Tom 文献雷达 · Agent RAG LongContext · 2026-09-06 晚

候选概览

# 来源 标题 领域 票数
1 HF RoboTok: 互联网规模机器人演示检索 (2609.03199) RAG+机器人 114
2 HF Last Translation Benchmark (2609.04173) 翻译评测 27
3 HF DRACO: Agent 长期训练动态评分分配 (2609.04094) Agent 23
4 HF 长视频 MLLM 视觉 Token 分配控制研究 (2609.03820) 长上下文+多模态 15
5 HF VeriPhy: Agent 物理推理评估 (2609.03153) Agent+评测 12
6 HF QCell: 重叠细胞实例分割 (2608.29253) 研究 13
7 HF Speech BCI 通用评估指标 (2609.02887) 系统 9
8 HF RLVR 解空间收缩分析 (2608.29188) 系统+RL 9

高价值条目(3 条)

★★★ DRACO — 长期 Agent 训练中的动态评分分配

  • arXiv: 2609.04094 | 2026-09-02
  • 核心: RLVR 在无 ground-truth 信号的 outcome-blind 场景下,用动态生成的评分 rubric 替代一次性标量奖励,将评分结果反向分配到各步骤,解决 credit assignment 难题。
  • 意义: 对多步 Agent 系统的训练方法论有直接启发;动态 rubric 生成是近期少见的结构化创新。
  • 关键词: credit assignment / RLVR / outcome-blind / long-horizon agent

★★★ Select, Compress, Reinvest — 长视频 MLLM Token 分配控制研究

  • arXiv: 2609.03820 | 2026-09-02
  • 核心: 控制变量法逐一测试帧选择、空间压缩、节省预算再投资三个决策,在 6 种选帧策略 × 3 个长视频基准 × 2 个回答模型上系统评估。
  • 意义: 把"哪些帧存活"从预处理黑盒变成可比较、可优化的正规问题;直接关系到长上下文建模的效率取舍。
  • 关键词: long-video / token budget / frame selection / MLLM

★★ RoboTok — 机器人操作的互联网规模 RAG 数据引擎

  • arXiv: 2609.03199 | 2026-09-01 | ⭐ 114票
  • 核心: 给定一个人类操作视频,RAG 检索匹配的网络演示用于训练灵巧机器人策略;在 actor-centered 3D 手部轨迹的潜在空间做检索。
  • 意义: RAG 在机器人领域的规模化应用;与 RAG 本体关联度高,是跨模态检索的强力案例。
  • 关键词: RAG / robot learning / manipulation / internet-scale

★ VeriPhy — Agent 物理推理可验证评估系统

  • arXiv: 2609.03153 | 2026-09-01
  • 核心: 文本规划器将 prompt 编译为物理约束+执行计划,观测结果由冻结的低层专家(分割、跟踪、计数、物理测量)逐层 gate;可审计。
  • 意义: 提出了一个"可解释失败"的物理验证框架,与 Agent 评测直接相关。
  • 关键词: agent / physical reasoning / benchmark / auditable

Substack 参考

δ-mem: RAG 和长上下文之外的第三条 Agent 记忆路径 AlphaSignal · 2026-05 核心观点:大多数 Agent 工作负载下 RAG 过度设计、长上下文浪费;δ-mem 用 8×8 关联记忆状态(4.87M 可训练参数)作为第三种方案,在 5 个基准上平均提升 +4.87%。 来源:https://alphasignalai.substack.com/p/rag-and-long-context-arent-enough


去重备注

  • RoboTok (RAG+机器人) 与本周前期 RAG 报告无直接重复,主题有新意。
  • DRACO / VeriPhy 与近期 agent 评测报告不重叠,属于方法论/评测新视角。
  • 长视频 Token 分配主题为本期独有,尚未出现在近期雷达中。

Tom · 2026-09-06 20:40 · Agent RAG LongContext 雷达 · 候选 8 条,高价值 4 条