📋 Tom 文献雷达 · Agent RAG LongContext · 2026-09-22 14:40
主题: AI Agent / RAG / 检索 / 长上下文 / 评测
数据源: HuggingFace Daily (+ Arxiv API 406,候选来自 HF 补漏)
Substack: 1 条(见末)
🔬 候选(8 条)
| # | 标题 | 来源 | votes | 标签 |
|---|---|---|---|---|
| 1 | Harness-Zero: Agent-as-Harness 蒸馏 | arxiv:2609.24974 | 9 | Agent, Systems |
| 2 | GameHorizon Suite: 多时间跨度游戏 AI 评测 | arxiv:2609.25001 | 22 | Agent, Benchmark |
| 3 | onPanda: Token 级修正的 Agent 轨迹标注 | arxiv:2609.24983 | 14 | Agent, Systems |
| 4 | CARE: VLA 策略的原子级纠错执行 | arxiv:2609.24118 | 1 | Agent, Multimodal |
| 5 | Grounded Action Model: 3D 接地的机器人基础模型 | arxiv:2609.23863 | 12 | Multimodal |
| 6 | 1% Tokens: On-Policy 蒸馏梯度估计 | arxiv:2609.24432 | 3 | Multimodal |
| 7 | GameHorizon Annotator: 可扩展游戏数据标注 | arxiv:2609.25001 | 22 | Benchmark |
| 8 | Measuring the Checker: GPU Kernel 突变分析 | arxiv:2609.22220 | 1 | Benchmark |
⭐ 高价值条目(3 条)
1. Harness-Zero: Agent-as-Harness 蒸馏 ⭐⭐⭐
- 链接: https://arxiv.org/abs/2609.24974
- 核心: Agent 在不同领域/实例/模型下需要不同 harness(外部系统),论文提出 harness 蒸馏:将优化 harness 的行为迁移到模型权重,使收益在单一固定 harness 下仍然有效。
- 意义: 解决 agent 泛化与专用 harness 耦合的问题,属于 agent 系统层面的新范式。
- 关键词: harness distillation, agent generalization, deployment gap
2. GameHorizon Suite: 多时间跨度游戏评测 ⭐⭐
- 链接: https://arxiv.org/abs/2609.25001
- 核心: 现有游戏 AI 数据集覆盖范围窄、缺语言指令、高方差。GameHorizon 提供统一评测套件,测量不同时间跨度(短期动作 / 长期目标)下的 agent 能力。
- 意义: 为 agent 长期规划能力提供可量化的评测基准,填补多时间跨度评测空白。
- 关键词: multi-horizon, agent benchmark, gameplay, temporal planning
3. onPanda: Token 级交互标注 ⭐⭐
- 链接: https://arxiv.org/abs/2609.24983
- 核心: 标注者在模型响应的第一个错误 token 处介入,替换或编辑后让模型继续生成,循环 locate-correct-continue 直到满意。低成本精确控制 agent 对齐数据质量。
- 意义: 对 agent 轨迹精修和人机协作标注有直接价值,尤其适合 RLHF / RLAIF 流程。
- 关键词: token-level correction, alignment data, agent trajectory annotation
📦 Substack 线索(1 条)
The 2026 AI Agent Stack, Drawn from Scratch — Brain Bytes / codingwithroby.substack.com
值得关注的行业观点: - 知识 vs 记忆已分离:知识是外部可检索的数据,记忆是 agent 自身状态,两者已拆成不同工程问题。 - RAG 瓶颈在检索质量而非向量库:选什么 chunk、如何排序、是否送达模型,比换底层引擎更关键。 - LongMemEval(长程交互记忆 benchmark)已出现,基础长上下文检索在大窗口下表现良好,但检索质量才是差异化所在。 - 建议:把 retrieval 当评测问题而非基础设施问题来处理。
📝 本轮小结
本批候选以 Agent 系统层面工作为主(Harness-Zero、onPanda),GameHorizon 提供新的评测视角。主流 RAG/长上下文方向仍依赖 HF Daily 补漏,Arxiv API 406 问题持续(今日已上报)。Substack 线索补充了"知识-记忆分离"和 LongMemEval 两个值得关注的行业判断。
Tom · 2026-09-22T14:40 · Light Mode · 10 min