Tom 文献雷达 · Agent RAG LongContext · 2026-09-07
概览
- 采集时间:2026-09-07 08:40 (UTC+8)
- 数据源:HF Daily (arXiv 采样超时,HF 富化正常)
- 本轮候选:8 条 | 高价值:4 条
高价值候选
1. RoboTok — 互联网规模数据引擎:视频 RAG 驱动机器人灵巧操作学习
- 来源: HF Daily | votes: 115 | 2026-09-01
- 链接: https://arxiv.org/abs/2609.03199
- 标签:
ragbenchmarkmultimodal - 摘要: RoboTok 提出从互联网视频中检索人类操作演示,用于训练机器人策略。核心是学习 3D 手部轨迹的潜在运动空间,以 Actor 为中心的参考系表达,支持跨视角、跨场景的操控行为比较。这本质上是 RAG 范式在机器人学习领域的规模化复现。
- RAG 关联: ⭐⭐⭐ 高度相关 — 大规模演示检索、冷启动数据扩展
2. DRACO — 动态 Rubrics 的细粒度信用分配,用于长时程 Agent 训练
- 来源: HF Daily | votes: 24 | 2026-09-02
- 链接: https://arxiv.org/abs/2609.04094
- 标签:
agent - 摘要: RLVR 在有程序化检查器的任务上有效,但大多数 Agent 领域没有这类信号。DRACO 在 outcome-blind 设置下,通过动态生成评分规则(rubrics)来跟踪策略演化能力,解决了多步 Agent 轨迹中单一标量奖励信号不足的问题。
- Agent 关联: ⭐⭐⭐ 高度相关 — 多步 Agent 训练信用分配机制
3. VeriPhy — Agentic 物理推理:世界模型评测与改进
- 来源: HF Daily | votes: 12 | 2026-09-01
- 链接: https://arxiv.org/abs/2609.03153
- 标签:
agentbenchmarkmultimodalsystems - 摘要: 生成视频的视觉流畅性不等于物理可靠性。VeriPhy 通过纯文本规划器将提示编译为类型化物理约束,在观测任何帧之前先生成静态验证执行计划,然后由冻结的低层专家(分割、跟踪、深度、OCR 等)分步 gate 观测范围。
- Agent 关联: ⭐⭐ 相关 — Agentic 物理验证架构,多模态工具调用
4. Select, Compress, Reinvest — 长视频 MLLM 的视觉 Token 分配控制研究
- 来源: HF Daily | votes: 15 | 2026-09-02
- 链接: https://arxiv.org/abs/2609.03820
- 标签:
benchmarkmultimodalsystems - 摘要: 1 小时视频每秒一帧 = 3600 张图,系统只能保留固定slice。论文固定帧评分器、提示边界、分辨率策略和答题模型,逐步变化 selection、spatial compression、reinvestment 三个维度,系统性地研究长视频理解中 token 分配的权衡。
- 长上下文关联: ⭐⭐⭐ 高度相关 — 长视频 Token 预算控制
一般候选(4 条)
- Last Translation Benchmark (29 votes, 2026-09-02) — 机器翻译饱和评测新基准,评测方法论贡献,非本主题核心。
- Locked at the Entrance (10 votes, 2026-08-28) — RLVR 导致解空间收缩的机制分析,系统方向。
- QCell (14 votes, 2026-08-28) — 重叠细胞实例分割,微 microscopy 专用,非通用 RAG。
- A Common Measure of Speech BCIs (10 votes, 2026-09-01) — 语音脑机接口评测标准化,跨领域参考价值有限。
实践洞察(Substack)
5. Long Context vs RAG in 2026: Why "RAG Is Dead" Keeps Being Wrong
- 来源: Codefarm (codefarm.in) | 2026-08
- 链接: https://codefarm.in/blog/gen-ai/long-context-vs-rag-2026
- 摘要: 每当前沿模型上下文翻倍,"RAG 已死"的论调就会重现,但从 128K 到百万 token,每个严肃的生产 LLM 系统今年仍保留检索层。核心洞察:
- "宽检索 + 重排"范式在长上下文下变得更安全(检索更激进)
- 检索从管道阶段变成工具:Agent 在推理中途发起多轮定向搜索,配合 tool calling 和 MCP,这已是现代 Agent 架构标配
- RAG 的价值不在替代上下文,而是降低推理成本 + 提高特定知识调用精度
- 评价: ✅ 值得精读 — 对 RAG vs Long Context 的生产级澄清
去重备注
- 本轮 HF 候选与 2026-09-02~09-06 已有雷达无直接重复
- Substack 方向(Codefarm)近一个月无重复
Tom 文献雷达 · 每日 3 次轻量采集 · 高价值驱动