Tom 文献雷达 · Agent + RAG + LongContext · 2026-08-11 14:40
候选摘要(8条)
| # | 来源 | 标题 | 核心贡献 | 价值 |
|---|---|---|---|---|
| 1 | HF | Agent Memory Distillation (AMD) | 小模型(≤7B)从大模型教师轨迹蒸馏三级记忆(Workflow/Subtask/Function);无需训练即可迁移规划能力 | ⭐⭐⭐ |
| 2 | HF | Ouroboros | 自演进 coding agent,工具/提示/上下文组合通过 reviewed commits 迭代改进;Terminal-Bench 2.1 达 86.74%(Opus 5) | ⭐⭐⭐ |
| 3 | HF | OasisKV | 解耦 KV Cache 存储与 HBM,通过 lookahead sparse prefetching 在解码时突破 HBM 容量限制 | ⭐⭐⭐ |
| 4 | HF | Evo-Bench | 首个评测 LLM "harness 演进能力"的 benchmark,隔离 base model 影响;解决任务过拟合和长程迭代评估难题 | ⭐⭐ |
| 5 | HF | Scaling Inherently Interpretable LMs | 训练阶段内嵌可解释性约束而非事后解释;跨三个数量级算力,可解释性与能力同步提升 | ⭐⭐ |
| 6 | HF | Factorized Hypothesis Search | 解决"检索就绪差距":输入为间接证据时多维假设搜索提升 taxonomy 检索 | ⭐⭐ |
| 7 | HF | RynnValue | 用时序距离作为 reward signals 的开放权重机器人价值基础模型 | ⭐ |
| 8 | HF | Visually Aligned Edit Suggestions | 多轮图像生成对话中的 follow-up 建议框架(10万真实样本,Qwen App 数据) | ⭐ |
高价值条目简评
🔥 Agent Memory Distillation — 小模型记忆蒸馏(#1)
方法:AMD 从大模型成功轨迹中构建三级互补记忆:Workflow memory 编码任务级策略,Subtask memory 提供中间粒度行为示例,Function memory 捕获工具级细节。无须微调,直接迁移给小型学生模型。意义:为 memory-augmented agent 在边缘/端侧部署提供了训练-free 路径;与昨天雷达中 scaffold coupling 问题(DCAS)形成互补——一个是避免 scaffold 耦合,一个是直接蒸馏记忆。
🔥 Ouroboros — 自演进 coding agent(#2)
方法:Ouroboros 通过两种模式驱动 core 演进:recursive free evolution(改进本身作为任务,可自动调度下一轮)和 experience-driven evolution(日常工作暴露 bug、粗糙边缘和低效上下文构建→结构改进)。Terminal-Bench 2.1 最高分 86.74%。意义:标志着 coding agent 从"执行任务"进化到"改进自身工具链"的范式跃升;与 Evo-Bench 形成测试-改进闭环。
🔥 OasisKV — HBM 解耦 KV Cache(#3)
问题:长上下文生成时,decode 阶段 KV cache 显存压力限制了 batch size 和吞吐。方案:将完整 KV cache 存储从 HBM 解耦,通过 lookahead sparse prefetching 在解码时按需加载。意义:突破长上下文推理的显存瓶颈,对 LongContext RAG 系统的高吞吐部署有直接价值。
趋势观察
- Agent 自演进成规模:Ouroboros + Evo-Bench 标志着 coding agent 开始具备"改进自身 harness"的能力;2026 下半年可能出现 self-improving agent 的评测热潮
- 记忆蒸馏是端侧部署关键:AMD 证明无需微调即可给小模型注入复杂规划记忆;与 long-context window 压缩方案(昨天 Relevant but Incomplete)共同构成端侧高效推理的两条路线
- 可解释性不再是能力税:Interpretability-scaling 工作打破"可解释性 = 性能损耗"的预设;或影响未来 agent 系统的可审计性要求
数据来源
arXiv metadata + HF Daily;Substack/Newsletter 参考(EITT/Zylos/Wavect 等 2026 RAG vs LongContext 分析,无新特定论文线索)
Tom · 2026-08-11T14:40 · agent-rag-longcontext · 8候选 / 3高价值