Tom 文献雷达 · Agent + RAG + LongContext · 2026-08-11 14:40

候选摘要(8条)

# 来源 标题 核心贡献 价值
1 HF Agent Memory Distillation (AMD) 小模型(≤7B)从大模型教师轨迹蒸馏三级记忆(Workflow/Subtask/Function);无需训练即可迁移规划能力 ⭐⭐⭐
2 HF Ouroboros 自演进 coding agent,工具/提示/上下文组合通过 reviewed commits 迭代改进;Terminal-Bench 2.1 达 86.74%(Opus 5) ⭐⭐⭐
3 HF OasisKV 解耦 KV Cache 存储与 HBM,通过 lookahead sparse prefetching 在解码时突破 HBM 容量限制 ⭐⭐⭐
4 HF Evo-Bench 首个评测 LLM "harness 演进能力"的 benchmark,隔离 base model 影响;解决任务过拟合和长程迭代评估难题 ⭐⭐
5 HF Scaling Inherently Interpretable LMs 训练阶段内嵌可解释性约束而非事后解释;跨三个数量级算力,可解释性与能力同步提升 ⭐⭐
6 HF Factorized Hypothesis Search 解决"检索就绪差距":输入为间接证据时多维假设搜索提升 taxonomy 检索 ⭐⭐
7 HF RynnValue 用时序距离作为 reward signals 的开放权重机器人价值基础模型
8 HF Visually Aligned Edit Suggestions 多轮图像生成对话中的 follow-up 建议框架(10万真实样本,Qwen App 数据)

高价值条目简评

🔥 Agent Memory Distillation — 小模型记忆蒸馏(#1)

方法:AMD 从大模型成功轨迹中构建三级互补记忆:Workflow memory 编码任务级策略,Subtask memory 提供中间粒度行为示例,Function memory 捕获工具级细节。无须微调,直接迁移给小型学生模型。意义:为 memory-augmented agent 在边缘/端侧部署提供了训练-free 路径;与昨天雷达中 scaffold coupling 问题(DCAS)形成互补——一个是避免 scaffold 耦合,一个是直接蒸馏记忆。

🔥 Ouroboros — 自演进 coding agent(#2)

方法:Ouroboros 通过两种模式驱动 core 演进:recursive free evolution(改进本身作为任务,可自动调度下一轮)和 experience-driven evolution(日常工作暴露 bug、粗糙边缘和低效上下文构建→结构改进)。Terminal-Bench 2.1 最高分 86.74%。意义:标志着 coding agent 从"执行任务"进化到"改进自身工具链"的范式跃升;与 Evo-Bench 形成测试-改进闭环。

🔥 OasisKV — HBM 解耦 KV Cache(#3)

问题:长上下文生成时,decode 阶段 KV cache 显存压力限制了 batch size 和吞吐。方案:将完整 KV cache 存储从 HBM 解耦,通过 lookahead sparse prefetching 在解码时按需加载。意义:突破长上下文推理的显存瓶颈,对 LongContext RAG 系统的高吞吐部署有直接价值。


趋势观察

  • Agent 自演进成规模:Ouroboros + Evo-Bench 标志着 coding agent 开始具备"改进自身 harness"的能力;2026 下半年可能出现 self-improving agent 的评测热潮
  • 记忆蒸馏是端侧部署关键:AMD 证明无需微调即可给小模型注入复杂规划记忆;与 long-context window 压缩方案(昨天 Relevant but Incomplete)共同构成端侧高效推理的两条路线
  • 可解释性不再是能力税:Interpretability-scaling 工作打破"可解释性 = 性能损耗"的预设;或影响未来 agent 系统的可审计性要求

数据来源

arXiv metadata + HF Daily;Substack/Newsletter 参考(EITT/Zylos/Wavect 等 2026 RAG vs LongContext 分析,无新特定论文线索)


Tom · 2026-08-11T14:40 · agent-rag-longcontext · 8候选 / 3高价值