Tom 文献雷达 · Agent / RAG / Long-Context · 2026-07-25 20:40
概况
本轮 8 条候选均已出现在今日 08:40 / 14:40 雷达中,无新增 arXiv/HF 条目。 补充 1 条 Substack 高价值线索。
🔴 高价值(3 条)
1. Agentic Context Management:Agent 的记忆与成本是生命周期问题
- 来源:arXiv 2607.21503,2026-07-23
- 核心:生产 Agent 失败往往不是推理差,而是上下文管理失控——历史膨胀、token 费用每轮递增、跨会话recall缺失。传统方案把它当存储-检索问题,过于狭隘。真正答案是生命周期管理:决定记什么、提取什么、压缩什么、遗忘什么。
- 关键观点:上下文管理是 lifecycle 而非 store;主动管理"记什么"比被动"存什么"更关键;现有 RAG 只解决信息获取,不解决信息过载。
- 标签:agent / rag / memory
2. δ-mem:RAG 和 Long Context 之外的第三种 Agent Memory 方案
- 来源:AlphaSignal AI Substack,2026
- 核心:扩展 context 成本高、long context 不等于模型真的用好历史。δ-mem 在 Transformer 选中层注入一个 8×8 矩阵,用矩阵 steering attention 来存储对话历史。Qwen3-4B-Instruct 上,4.87M 可训练参数(模型 0.12%),平均提升 5 benchmarks 准确率从 46.79% → 51.66%(+4.87pp)。
- 意义:轻量 adapter 方案,不扩展 context window,不依赖 RAG 检索,直接在内层干预 attention。Qwen3-4B adapter 已开源(CC-BY-4.0)。
- 标签:agent / memory / efficiency
3. OpenForgeRL:让 Agent 训练原生支持 Harness 推理
- 来源:arXiv 2607.21557,2026-07-23
- 核心:Claude Code、OpenClaw 等复杂推理 harness 难以用标准 SFT/RL 栈端到端训练(无法原生表达有状态、多进程的 harness 推理)。OpenForgeRL 用轻量 proxy 劫持 harness 的模型调用,记录为标准 RL 训练数据,从而实现端到端训练。
- 意义:第一个支持 harness-based agent 开源 RL 训练框架,打通"推理 harness"与"训练基础设施"的鸿沟。
- 标签:agent / systems / training
📦 候选列表(已去重,本轮无新增)
| # | 标题 | 来源 | 关键信号 |
|---|---|---|---|
| 1 | Agentic Context Management | arXiv | memory lifecycle 新框架 |
| 2 | OpenForgeRL | arXiv | Agent RL 训练开源框架 |
| 3 | δ-mem(Substack) | AlphaSignal | attention steering adapter |
| 4 | FinanceComplexQA | HF | 金融文档 Agentic Reasoning benchmark |
| 5 | ReOPD | HF | 多轮 Agent 离线蒸馏 |
| 6 | Sample-Efficient Learning from Agent Experience | HF | 经验蒸馏解决 context 丢失 |
| 7 | K12-KGraph | HF | 教育 KG benchmark(curriculum cognition) |
| 8 | SANA-Video 2.0 | HF | 视频生成(与本主题关联弱) |
注:其余 5 条(FinanceComplexQA、ReOPD、Sample-Efficient、Multi-Turn OPD、SANA-Video、K12-KGraph)均已在上轮覆盖,本轮仅保留摘要供去重参考。
📊 本轮统计
- 候选总数:8(arXiv 2 / HF 6)
- 高价值数:3 条
- Substack 来源:1 条(α-Signal δ-mem)
- CSDN:未使用
- 执行时间:~3 分钟
Tom 文献雷达 · 每日 3 次 · 轻量模式 Generated at 2026-07-25 20:40 CST