Tom 文献雷达 · AI Agent × RAG × 长上下文 · 2026-07-25

概览

  • 采集来源:arXiv metadata + HuggingFace Daily(2026-07-22 ~ 2026-07-23)
  • 候选总数:8 条
  • 高价值条目:3 条(⭐)
  • Substack/CSDN:无(搜索未命中 Substack,CSDN 策略跳过)
  • 去重参考:最近 7 天同名 radar 文件 3 份(07-24T1440、07-24T2040、07-24T0841),本批无重复

⭐ 高价值条目

1. Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

  • 来源:arXiv(2026-07-23),Gaurav Dadhich
  • 链接http://arxiv.org/abs/2607.21503v1
  • 核心:生产 Agent 失败的主因不是推理能力不足,而是无法管理上下文:对话历史、提示膨胀、工具定义、工具输出堆积。作者认为这不仅是存储检索问题,更是生命周期管理问题,需要决定记忆什么、提取什么、遗忘什么,而非单纯压缩。
  • 标签:agent / rag / memory / benchmark
  • 点评:直接回应当前 Agent 在长对话场景下的 token 成本与召回两大痛点,框架视角值得关注。

2. OpenForgeRL: Train Harness-native Agents in Any Environment

  • 来源:arXiv(2026-07-23),Xiao Yu, Baolin Peng 等
  • 链接http://arxiv.org/abs/2607.21557v1
  • 核心:现有 Agent 推理 harness(Claude Code、OpenClaw 等)无法被开源 SFT/RL 栈原生表达,训练与推理解耦困难。OpenForgeRL 通过轻量代理(proxy)劫持 harness 模型调用,将其记录为标准 RL 训练数据,实现任意环境下端到端训练 harness-based Agent
  • 标签:agent / systems
  • 点评:Agent 训练基础设施方向,与 OpenClaw 直接相关(harness-native),工具链价值高。

3. Sample-Efficient Learning from Agent Experience

  • 来源:arXiv(2026-07-22)
  • 链接https://arxiv.org/abs/2607.21051
  • 核心:Agent 在真实环境中交互成本高(实验耗时、需人类反馈)。论文提出 Experience Distillation:将 Agent 交互历史通过上下文蒸馏内部化到模型权重,在不离线上下文的情况下保持样本效率。
  • 标签:agent
  • 点评:解决 Agent 在线学习的核心矛盾——上下文学习收益在上下文移除后消失,与 Agentic Context Management 形成互补。

其他候选

4. FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents

  • 来源:arXiv(2026-07-20)
  • 链接https://arxiv.org/abs/2607.19238
  • 核心:构建金融文档(LaTeX 复杂排版)Agentic Reasoning 评测基准,2000 份专业文档 + 6000 Q&A,覆盖 Agent 在真实金融场景下的能力差异。
  • 标签:agent / benchmark
  • 点评:垂直领域 Agent 评测数据集,对金融场景 RAG 评估有参考价值。

5. Multi-Turn On-Policy Distillation with Prefix Replay(ReOPD)

  • 来源:arXiv(2026-07-15)
  • 链接https://arxiv.org/abs/2607.04763
  • 核心:多轮 Agent 任务中在线蒸馏(OPD)成本高(每次更新需新鲜 rollout),ReOPD 通过预收集教师轨迹作为 replay prefix,学生在选定步骤行动,教师提供密度监督而无需新环境交互。
  • 标签:agent / multimodal

6. K12-KGraph:Curriculum-Aligned Knowledge Graph(EDU LLM Benchmark)

  • 来源:HF Daily(2026-07-22),票数 40
  • 链接https://arxiv.org/abs/2605.09635
  • 核心:K-12 教育 LLM 的课程认知评测基准,含课程先修链、概念分类、视觉落地等九类节点;与通用 RAG/Agent 关联弱,属教育 AI 垂直场景。

7. SANA-Video 2.0:Hybrid Linear Attention for Video Generation

  • 来源:HF Daily(2026-07-22),票数 15
  • 标签:multimodal / systems
  • 与本 topic 关联有限,但 5B/14B 规模下的线性注意力 O(N) 扩展性值得留意。

8. Self-Supervised Learning of Structured Dynamics from Videos

  • 来源:HF Daily(2026-07-22),票数 14
  • 标签:multimodal
  • 视频表征学习中运动分解,与 Agent/RAG 无直接关联。

趋势观察(3 条)

  1. Agent 上下文管理成独立研究方向:从存储检索视角转向生命周期与架构视角,记忆压缩、遗忘策略、token 成本控制是 2026 下半年热点。
  2. Agent 训练基础设施崛起:OpenForgeRL 类工作填补了"推理 harness 强、训练 harness 弱"的空白,预计会有更多开源复现。
  3. 评测基准从通用走向垂直:FinanceComplexQA 等金融、医疗、代码垂直评测与 K12 教育评测形成对照,垂直 Agent 评测数据集是当下建设热点。

Tom 文献雷达 · 每日 3 次 · 轻量模式 · 2026-07-25T08:40 UTC