Tom 文献雷达 · Agent RAG 长上下文 · 2026-09-05 08:40 UTC

本期候选(8 条)

# 来源 标题 领域 热度
1 HF Daily DRACO: 动态评分表的细粒度信用分配,用于长时距 Agent 训练 Agent·RL ⬆⬆⬆
2 HF Daily 基于扎根理论的规模化 Agent 行为分析 Agent·评测 ⬆⬆
3 HF Daily Select, Compress, Reinvest: 长视频 MLLM 的视觉 Token 分配控制研究 Multimodal
4 HF Daily Last Translation Benchmark(机器翻译饱和评测新基准) Benchmark
5 HF Daily VeriPhy: Agentic 物理推理与世界模型评测 Agent·Benchmark
6 HF Daily Locked at the Entrance: RLVR 如何收窄解空间 Agent·RL
7 HF Daily QCell: 重组合细胞查询的重叠实例分割 Research
8 HF Daily Speech BCIs 通用通信评测指标 Systems

高价值条目解读

⬆⬆⬆ DRACO — 动态评分表 + 信用分配(arXiv 2609.04094)

核心问题:RLVR 在长时距 Agent 任务中效果显著,但大多数场景缺乏可编程检验器(programmatic checker),无法给出过程级 reward。

方法:DRACO 提出三步: 1. 训练期间动态生成评分表(rubrics) 来追踪策略能力演化; 2. 每个完整轨迹评分一次; 3. 将该判断 redistributed 回各 step 计算 advantage。

关键发现:传统多标准评分表是静态的,DRACO 的动态版本能自适应策略能力变化,对长 horizen 任务 credit assignment 问题有直接帮助。

追踪价值:DRACO 属于信用分配(credit assignment)领域的最新进展,与 2609.04094 同日另一篇 ReBel(Reward Belief)形成直接竞争,两篇都解决"部分可观测环境 + 延迟 reward"的 Agent 训练难题。值得优先关注。


⬆⬆ AutoTraceGT — 扎根理论做 Agent 轨迹分析(arXiv 2608.30391)

核心问题:Agent 行为分析缺乏可扩展的定性方法,现有分类器难以发现陌生任务中的新模式。

方法:将社会科学的扎根理论(grounded theory)引入 Agent 轨迹分析,提出 AutoTraceGT: - 六十年历史的定性方法,有原则性的饱和准则; - 迭代执行开放编码→轴心编码→理论编码,直至饱和; - 从数据到理论全程可审计。

意义:这是首个规模化多 Agent 轨迹定性分析 pipeline,适合用于理解复杂 Agent 系统的决策模式,而非仅靠量化的 benchmark 分数。


⬆ VeriPhy — Agentic 物理推理评测(arXiv 2609.03153)

核心问题:视频生成质量分数无法指示违反哪条物理定律或何时失效。

方法:VeriPhy 包含: - 纯文本 Planner 将 prompt 编译为类型化物理约束 + 静态验证执行计划; - 观测结果仅激活声称为真的低层专家(分割、跟踪、计数、11 类物理测量等); - 产生可审计的物理违规报告,而非单一质量分数。

关联:与 GAIA、WebArena 等构成 Agent 评测矩阵的物理/世界模型维度。


⬆ Locked at the Entrance — RLVR 收窄解空间问题(arXiv 2608.29188)

核心问题:RLVR 大幅提升 pass@1,但导致策略的解空间收缩,削弱了 test-time scaling 的收益。

方法:在 Countdown 任务上可穷举解空间,区分两类失败: - Access failure:无法触及有效解族; - Execution failure:能发起计算但无法完成。

发现:PPO(Qwen2.5-3B)和 GRPO 均存在解空间收窄,test-time compute 收益递减。


Substack 线索

Interconnects AIWhat comes next with reinforcement learning(substack/interconnects.ai)指出:

当前 RL 方法帮助模型在组成更长轨迹的单个任务上更 robust,而非在轨迹末端结果上做稀疏信用分配。Deep Research 等 Agent 的最终表现取决于 prompting + 让模型运行更久,而非稀疏信用分配。

这与 DRACO 的研究方向形成直接对话:DRACO 正是尝试在 trajectory 层面做 credit assignment,值得交叉关注。


去重备注

  • 2026-09-04T1440/1240/0840、2026-09-03T2040/1440/0840、2026-09-02T2040/1440/0840 均为同类 radar,本期 DRACO、AutoTraceGT、VeriPhy 为新条目,未见重复。
  • QCell 和 Speech BCI 与本 topic 相关性较低,不纳入高价值。

Generated by Tom Research Radar · 2026-09-05T08:40 UTC · candidates JSON: /shared/research-kb/inbox/tom/_candidates/2026-09-05-agent-rag-longcontext-candidates.json