Tom 文献雷达 · Agent + RAG + Long Context · 2026-09-06 08:40

概览

  • 来源:HF Daily(arXiv 元数据富化;arXiv 查询本次全部超时)
  • 主题:AI Agent / RAG / 长上下文 / 评测 / 新论文线索
  • 候选总数:8 条

高价值候选(4 条)

1. DRACO: Long-Horizon Agent 信用分配新方法

  • 来源:HF Daily · arXiv 2609.04094
  • 链接:https://arxiv.org/abs/2609.04094
  • 摘要:RLVR 在有可编程 checker 的任务上有效,但大多数长线 agent 场景没有 checker——ground-truth 成功信号不可得。DRACO 在结果盲设置下,通过动态生成 rubric 跟踪策略演进能力,评分后跨步骤重新分配信用,解决了多步骤任务中单一标量奖励信号不足的问题。
  • 标签agent / credit assignment / RLVR / rubric
  • Votes:23
  • 点评:长线 agent 信用分配是当前 open-world agent 评测的核心痛点;动态 rubric 思路值得在知识库中标记为方法论参考。

2. RoboTok: 互联网规模的 RAG 数据引擎(机器人演示检索)

  • 来源:HF Daily · arXiv 2609.03199
  • 链接:https://arxiv.org/abs/2609.03199
  • 摘要:给定查询人类操作视频,从网络视频中检索相关演示,用于训练灵巧机器人策略。核心是学习 3D 手部轨迹的潜在空间,在估计的演员中心参考系中表达,支持跨视角、跨场景的行为比较。
  • 标签rag / benchmark / multimodal
  • Votes:77
  • 点评:Votes 最高;互联网规模检索 + robot learning 的组合展示了 RAG 在非文本模态的扩展路径;LongMemEval 等近期工作也指向同一方向。

3. Select, Compress, Reinvest: 长视频 MLLM 的视觉 Token 分配控制研究

  • 来源:HF Daily · arXiv 2609.03820
  • 链接:https://arxiv.org/abs/2609.03820
  • 摘要:长视频语言模型无法查看每一帧;哪个帧能进入固定 slice 通常被视为预处理细节,本文通过控制变量(选择策略 / 空间压缩 / 重新投资)逐一测试,在 6 种训练-free 选择规则、3 个长视频基准、2 个回答模型上评估。
  • 标签benchmark / multimodal / systems
  • Votes:15
  • 点评:核心问题(长上下文 token 有限→如何分配)与 RAG 压缩、多文档摘要直接相关;控制变量实验设计值得参考。

4. VeriPhy: Agentic 物理推理的世界模型评测

  • 来源:HF Daily · arXiv 2609.03153
  • 链接:https://arxiv.org/abs/2609.03153
  • 摘要:视频生成的视觉流畅性不等于物理可靠性;VeriPhy 用纯文本规划器将提示编译为类型化物理义务和静态验证执行计划,再由低层专家(分割、跟踪、计数、深度测量等)逐帧 gate 和 scope 观测。
  • 标签agent / benchmark / multimodal / systems
  • Votes:12
  • 点评:Agent 在物理世界的可靠性评测框架;评测思路对 open-world agent 基准设计有参考价值。

全部候选(8 条)

# 标题 标签 Votes
1 DRACO: Credit Assignment for Long-Horizon Agent agent 23
2 RoboTok: RAG for Robot Demonstration Retrieval rag benchmark multimodal 77
3 Select/Compress/Reinvest: Visual-Token Allocation in Long-Video MLLMs benchmark multimodal systems 15
4 VeriPhy: Agentic Physical Reasoning Benchmark agent benchmark multimodal systems 12
5 Last Translation Benchmark benchmark 26
6 Locked at the Entrance: Where RLVR Narrows Solution Space systems 9
7 QCell: Overlapping Cell Instance Segmentation research 13
8 A Common Measure of Communication for Speech BCIs systems 9

注:QCell 和 Speech BCI 两篇不在本次主题范围内,已标记为低优先级。


Substack 热点线索

The 2026 AI Agent Stack(Drawn from Scratch)— Coding with Roby

关键摘录: - 知识(knowledge)和记忆(memory)是不同层;2024 年 memory = "选个向量数据库做 RAG",2026 年 memory 是第一等架构原语,分三层。 - LongMemEval 基准表明:基础长上下文检索在大型上下文窗口下表现良好;瓶颈在检索质量而非向量数据库本身。检索是评测问题,次才是基础设施问题。 - 大多数团队过度复杂化 memory 架构;建议从 Postgres 对话历史 + 结构化 system prompt 开始,超出上下文再做向量搜索。

The AI Engineers · AI Agents Stack 2026 Edition

  • Gemini 上下文窗口 1M+ tokens,Claude 200K;更大窗口没有消灭 memory 需求,而是改变了取舍:什么塞进上下文 vs. 什么按需检索。

本次小结

  • arXiv 状态:全部查询超时,结果完全来自 HF Daily
  • Substack:使用了 1 条(The 2026 AI Agent Stack / Coding with Roby)
  • CSDN:未使用
  • 生成时间:2026-09-06 08:40 UTC

Tom 文献雷达 · 轻量模式 · agent-rag-longcontext