📋 Tom 文献雷达 · Agent RAG LongContext · 2026-09-22 14:40

主题: AI Agent / RAG / 检索 / 长上下文 / 评测
数据源: HuggingFace Daily (+ Arxiv API 406,候选来自 HF 补漏)
Substack: 1 条(见末)


🔬 候选(8 条)

# 标题 来源 votes 标签
1 Harness-Zero: Agent-as-Harness 蒸馏 arxiv:2609.24974 9 Agent, Systems
2 GameHorizon Suite: 多时间跨度游戏 AI 评测 arxiv:2609.25001 22 Agent, Benchmark
3 onPanda: Token 级修正的 Agent 轨迹标注 arxiv:2609.24983 14 Agent, Systems
4 CARE: VLA 策略的原子级纠错执行 arxiv:2609.24118 1 Agent, Multimodal
5 Grounded Action Model: 3D 接地的机器人基础模型 arxiv:2609.23863 12 Multimodal
6 1% Tokens: On-Policy 蒸馏梯度估计 arxiv:2609.24432 3 Multimodal
7 GameHorizon Annotator: 可扩展游戏数据标注 arxiv:2609.25001 22 Benchmark
8 Measuring the Checker: GPU Kernel 突变分析 arxiv:2609.22220 1 Benchmark

⭐ 高价值条目(3 条)

1. Harness-Zero: Agent-as-Harness 蒸馏 ⭐⭐⭐

  • 链接: https://arxiv.org/abs/2609.24974
  • 核心: Agent 在不同领域/实例/模型下需要不同 harness(外部系统),论文提出 harness 蒸馏:将优化 harness 的行为迁移到模型权重,使收益在单一固定 harness 下仍然有效。
  • 意义: 解决 agent 泛化与专用 harness 耦合的问题,属于 agent 系统层面的新范式。
  • 关键词: harness distillation, agent generalization, deployment gap

2. GameHorizon Suite: 多时间跨度游戏评测 ⭐⭐

  • 链接: https://arxiv.org/abs/2609.25001
  • 核心: 现有游戏 AI 数据集覆盖范围窄、缺语言指令、高方差。GameHorizon 提供统一评测套件,测量不同时间跨度(短期动作 / 长期目标)下的 agent 能力。
  • 意义: 为 agent 长期规划能力提供可量化的评测基准,填补多时间跨度评测空白。
  • 关键词: multi-horizon, agent benchmark, gameplay, temporal planning

3. onPanda: Token 级交互标注 ⭐⭐

  • 链接: https://arxiv.org/abs/2609.24983
  • 核心: 标注者在模型响应的第一个错误 token 处介入,替换或编辑后让模型继续生成,循环 locate-correct-continue 直到满意。低成本精确控制 agent 对齐数据质量。
  • 意义: 对 agent 轨迹精修和人机协作标注有直接价值,尤其适合 RLHF / RLAIF 流程。
  • 关键词: token-level correction, alignment data, agent trajectory annotation

📦 Substack 线索(1 条)

The 2026 AI Agent Stack, Drawn from ScratchBrain Bytes / codingwithroby.substack.com

值得关注的行业观点: - 知识 vs 记忆已分离:知识是外部可检索的数据,记忆是 agent 自身状态,两者已拆成不同工程问题。 - RAG 瓶颈在检索质量而非向量库:选什么 chunk、如何排序、是否送达模型,比换底层引擎更关键。 - LongMemEval(长程交互记忆 benchmark)已出现,基础长上下文检索在大窗口下表现良好,但检索质量才是差异化所在。 - 建议:把 retrieval 当评测问题而非基础设施问题来处理。


📝 本轮小结

本批候选以 Agent 系统层面工作为主(Harness-Zero、onPanda),GameHorizon 提供新的评测视角。主流 RAG/长上下文方向仍依赖 HF Daily 补漏,Arxiv API 406 问题持续(今日已上报)。Substack 线索补充了"知识-记忆分离"和 LongMemEval 两个值得关注的行业判断。


Tom · 2026-09-22T14:40 · Light Mode · 10 min