Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-09-05 14:40

概览

  • 候选总数:8 条
  • 高价值:4 条
  • 来源:arXiv + HuggingFace Daily(8 条)
  • Substack:使用(CSDN:未使用)

🔥 高价值条目

1. DRACO: 动态评分鲁棒分配用于长程 Agent 训练

  • 来源:HF Daily · 2026-09-02 · 23 票
  • 链接:https://arxiv.org/abs/2609.04094
  • 摘要:RLVR 在长程 Agent 任务中没有程序化 checker 时效果差。DRACO 动态生成评分 rubric,训练过程中跟踪策略能力演进,对完整轨迹评分后重新分配优势信号。
  • 标签agent
  • 意义:解决长程 Agent 信用分配难题,outcome-blind 场景下突破瓶颈。

2. RoboTok: 互联网规模机器人演示检索引擎

  • 来源:HF Daily · 2026-09-01 · 22 票
  • 链接:https://arxiv.org/abs/2609.03199
  • 摘要:给定人类操作视频,从网络视频中检索相关演示用于机器人灵巧操控策略训练,学习 3D 手部轨迹的潜在空间表示。
  • 标签rag benchmark multimodal
  • 意义:将 RAG 思想引入机器人学习,互联网规模数据 + 跨视角对齐是关键创新。

3. Select, Compress, Reinvest: 长视频 MLLM Token 分配控制研究

  • 来源:HF Daily · 2026-09-02 · 15 票
  • 链接:https://arxiv.org/abs/2609.03820
  • 摘要:1 小时视频每秒一帧 = 3600 张图,系统只保留固定 slice。研究解耦帧选择、空间压缩和"省下 token 重新投入"三个决策,在 6 种选择规则、3 个 benchmark、2 个模型上系统评测。
  • 标签benchmark multimodal systems
  • 意义:视频 Token 分配问题被长期忽视,本文提供了首个控制变量基准。

4. VeriPhy: Agentic 物理推理与世界模型评测

  • 来源:HF Daily · 2026-09-01 · 11 票
  • 链接:https://arxiv.org/abs/2609.03153
  • 摘要:视频生成光流 fluency ≠ 物理可靠性。VeriPhy 用纯文本 Planner 编译为类型化物理义务和静态验证执行计划,再由观察门控调用冻结专家(分割、跟踪、计数、11 种物理测量等)。
  • 标签agent benchmark multimodal systems
  • 意义:首个可审计物理验证框架,为世界模型提供可解释评测标准。

📌 一般条目

5. Last Translation Benchmark

  • 来源:HF Daily · 2026-09-02 · 22 票
  • 链接:https://arxiv.org/abs/2609.04173
  • 机器翻译标准 benchmark 趋于饱和,现有评估方法不可靠且无法追踪客观进展。引入新 benchmark。
  • 标签benchmark

6. QCell: 细胞查询重组用于重叠实例分割

  • 来源:HF Daily · 2026-08-28 · 13 票
  • 链接:https://arxiv.org/abs/2608.29253
  • 标签research

7. Locked at the Entrance: RLVR 缩小解空间的位置分析

  • 来源:HF Daily · 2026-08-28 · 8 票
  • 链接:https://arxiv.org/abs/2608.29188
  • 研究 RLVR 在推理轨迹何处丢失多样性——是访问层失败还是执行层失败。
  • 标签systems

8. A Common Measure of Communication for Speech BCIs

  • 来源:HF Daily · 2026-09-01 · 8 票
  • 链接:https://arxiv.org/abs/2609.02887
  • 语音脑机接口缺乏统一评测标准,讨论信息率与词汇分布问题。
  • 标签systems

💡 趋势洞察(来源:Substack)

RAG in 2026: RAG vs Long Context 争论趋于收敛,主流观点转向 混合架构——先用 RAG 召回宽泛相关段落,再注入大 context window 让模型全局推理。Graph RAG 在企业场景重要性上升,因果关系路径提供可解释性。Agentic RAG 正在从"retrieve-then-generate"演化为自修正、迭代、多 Agent 系统。


生成时间:2026-09-05 14:40 (Asia/Shanghai) · Tom 文献雷达