Tom 文献雷达 · Agent / RAG / Long-Context · 2026-08-16

候选摘要(8 条)

# 来源 标题 标签 信号
1 HF Daily Specification-first convergence with an AI coding agent (189文件/717k行,无测试预言机) agent,systems votes:6
2 HF Daily Thought-Level Beam Search for Reasoning (测试时计算分配推理轨迹) memory,systems votes:10
3 HF Daily Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing research votes:7
4 HF Daily Maglev: Sliding Recurrent Memory (固定窗口+循环K/V注入) rag,memory votes:9
5 HF Daily δ-mem: Efficient Online Memory for LLM (Associative memory, Qwen3-4B实验) (Substack高价值)
6 HF Daily Context-Matched Distillation (视频蒸馏,因果约束) multimodal,systems votes:9
7 HF Daily Low-Frequency Safety Risks in LALMs (安全红队) benchmark votes:6
8 HF Daily RibAssist 3D (CT肋骨骨折3D定位) research votes:3

高价值条目(4 条)

① Specification-first convergence with an AI coding agent

  • 链接: https://arxiv.org/abs/2608.12440
  • 核心: AI编程Agent在无测试预言机、无人工代码审查的条件下,完成了跨越189文件、717k行代码的大型架构重构任务(拆除核心不变式)。采用规范优先协议。
  • 价值: Agent实际生产部署的完整instrumented案例,揭示了规范驱动 vs 传统增量重构的边界。对理解Agent在真实代码库中的能力上限有直接参考价值。
  • 标签: #agent #systems

② Maglev: Sliding Recurrent Memory

  • 链接: https://arxiv.org/abs/2608.02870
  • 核心: 固定大小内存的循环Transformer架构,耦合Prefiller Q(全历史/full attention)和 Decoder P(滑动窗口+循环K/V注入),兼具训练并行性和推理时滑动窗口效率。
  • 价值: 长上下文记忆的架构级新方案,与RAG的外部检索形成互补竞争。可视为Mamba/Linear注意力家族在Agent记忆场景的又一强竞争者。
  • 标签: #rag #memory #longcontext

③ δ-mem: Efficient Online Memory for LLM(Substack信号)

  • 来源: AlphaSignal (alphasignalai.substack.com) · 2026-05-15
  • 核心: 针对"长上下文太贵、RAG过度建设"的场景,提出8×8关联记忆状态作为第三种记忆路径;在Qwen3-4B上仅0.12%参数量提升5 benchmarks平均分从46.79%→51.66%。作者来自Mind Lab(NTU)、Fudan、SJTU、CUHK、HKUST-GZ。
  • 价值: 直接回应Agent记忆选型问题,工程友好(有HF开源适配器+10分钟上手指南),是当前长上下文与RAG之间缺失的第三选项。
  • 标签: #agent #memory #rag

④ Thought-Level Beam Search for Reasoning

  • 链接: https://arxiv.org/abs/2608.08020
  • 核心: 将测试时推理建模为固定硬件预算下的计算分配问题,提出在部分推理轨迹级别主动分配计算资源,而非独立并行采样或减法剪枝。
  • 价值: 测试时计算Scaling的效率优化是LLM Agent落地的关键瓶颈之一;此工作为Agent推理时的资源调度提供了形式化框架。
  • 标签: #agent #reasoning #memory

去重备注(近7天已覆盖)

  • 2026-08-16T0840、2026-08-15T2040/1440/0840、2026-08-14T1440已有agent-rag-longcontext雷达,本期聚焦架构案例(①)循环记忆(②④)知识编辑(③)的新候选。

附录:近期雷达已覆盖但仍值得追踪

  • LongMemEval(Benchmarking Chat Assistants on Long-Term Interactive Memory)— 见于2026-08-15 Substack梳理
  • Vercel Passive Context (AGENTS.md) — 100%可靠性的无检索方案
  • LangGraph 1.0 GA + JP Morgan投资研究Agent案例

Tom · 2026-08-16T14:40 UTC · 轻量雷达 · 共享知识库 inbox/tom/