📋 Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-15

周期:每日高频雷达 · 轻量版 · 本轮来源:HF Daily 富化 + Web 补充(arXiv 超时)


💡 本轮高价值条目(4 条)

1. Occamy-1.0 — 面向协同工作的 Pareto 前沿 35B Agent 模型

  • 来源: arXiv (2609.11977) · HF Daily
  • 摘要: 在 Qwen3.6-35B-A3B 基础上 post-training,构建执行锚定数据和环境,训练协同工作(co-work)场景下的成本-效率平衡模型。聚焦信息收集、工具调用、编码、文件操作等长链路 Agent 任务中的状态跟踪、恢复和后续跟进能力,而非单纯追求前沿推理峰值。HF votes: 23。
  • 标签: #Agent #Systems #Cost-Efficiency
  • 关联方向: Agent 评测 / 生产成本 / 多步工作流

2. RAG vs Long Context:2026 数据实证

  • 来源: usewire.io · 2026 生产对比数据
  • 核心数据: RAG 查询成本约 $0.00008/次,Long Context 约 $0.10/次(1250x 差距);延迟分别为 ~1s vs ~45s;长上下文在上下文中间位置准确率下降 30%+。
  • 结论: 两者并非替代关系,2026 主流架构为 Hybrid(检索收窄 + 长上下文推理),本质是 context engineering 而非工具选型。
  • 标签: #RAG #LongContext #Cost #Architecture

3. ReactHuman — 物理情境反应式决策 Benchmark

  • 来源: arXiv (2609.10895) · HF Daily
  • 摘要: 首个评测多模态 LLM 在突发物理危险(接住滑落餐盘、躲避下落刀具等)中进行即时安全反应能力的 Benchmark,现有评测均为主动问答或长程导航,不测实时反应。填补了具身 Agent 安全决策评测空白。
  • 标签: #Benchmark #EmbodiedAgent #Multimodal
  • 关联方向: Agent 安全 / 具身智能 / 反应式规划

4. RAG 仍在 2026 生态位:长上下文没有杀死它

  • 来源: EITT Academy 综述 · 2026
  • 核心论点: 三个原因支持 RAG 持续存在:① token 成本随上下文线性增长;② 检索可实现细粒度权限过滤;③ 动态新鲜度(可取到分钟级实时数据)。MCP(Model Context Protocol)成为连接 Agent 与工具/数据库的标准接口。
  • 标签: #RAG #AgentArchitecture #MCP

📦 其余候选(4 条)

# 标题 来源 摘要 标签
5 Ambient @ EgoProactive 2026(ECCV Wearable AI) arXiv (2609.07099) 可穿戴助手决定何时干预视频中的用户行为;单 token 分类替代生成式判断,macro-F1 +0.249 #Multimodal #Agent
6 EgoLongQA:长视频感知蒸馏进 Sub-2B arXiv (2609.07154) 将工具型 Agent 管道的长视频感知能力蒸馏入 2B 小模型,达到大管道 89% 精度,参数仅用 1.1% #LongContext #Distillation #Multimodal
7 Competence-Gated Pooling for Event Forecasting arXiv (2609.12101) LM 作为混合预测信号之一时,评估相对竞争力(相对于市场/统计预测的边际价值)而非绝对准确率 #Agent #Forecasting
8 Towards a Deterministic Math Solver for Clinical LMs arXiv (2609.10728) LM 不做计算,转而生成 case-specific Python 交给本地 executor 执行;Program-Solve 接口在 MedCalc-Bench Verified 验证 55 个临床计算器 #Benchmark #Reliability

📊 本轮元数据

字段
执行时间 2026-09-15 08:40 UTC
候选总数 8
高价值条目 4
arXiv 覆盖 部分超时(HFPaper 富化补偿)
Substack/Newsletter 2 条(EITT + Wire)
CSDN 未使用

⚠️ arXiv 多路查询本轮超时(429 + 3× TimeoutError),候选主体由 HF Daily 富化结果补足,质量仍在可接受范围。后续如持续超时建议检查 arXiv API 限速策略。