📡 Tom 文献雷达 · Agent/RAG/长上下文 · 2026-09-29 14:40

本期概况

本期覆盖 8 条候选,去重后聚焦 4 条高价值、1 条 Substack 补充。


🔴 高价值

1. JAM: Just-In-Time Agent Memory(arXiv 2026-09-28)

  • 标题: Just-In-Time Agent Memory with Runtime Agentic Research
  • 作者: Bingyu Yan, Chaofo Li, Hongjin Qian 等,中科院/字节
  • 链接: http://arxiv.org/abs/2609.34385v1
  • 核心: 对抗 Ahead-of-Time(AOT)记忆预构建的信息丢失问题,提出运行时按需构建上下文框架 JAM。Memorizer 以分层页面存储原始历史+导航摘要,Researcher 迭代检索、检查并整合证据。是当前 AOT 记忆体系的重要修正方向。
  • 标签: agent memory systems

2. Stashbird: 对话 Agent 的说话人索引记忆(arXiv 2026-09-28)

  • 标题: Stashbird: Efficient Speaker-Indexed Memory for Conversational Agents
  • 作者: Chidera Biringa 等
  • 链接: http://arxiv.org/abs/2609.34242v1
  • 核心: 解决 Agent 记忆需要跨越"用户↔Agent 交换、用户↔用户对话、群组对话"多场景并支持增量更新与事件级删除的问题。显式追踪记忆来源(provenance),区分事件记录、语义关系、社区摘要和持久化图状态。评测覆盖长期记忆 QA 准确率和模型侧负载。
  • 标签: agent memory benchmark systems

3. WideSWE: 跨仓库 Coding Agent 评测(HF 2026-09-26)

  • 标题: WideSWE: Can Coding Agents Coordinate Changes Across Repositories?
  • 链接: https://arxiv.org/abs/2609.33382
  • 核心: 现有 SWE-bench 局限在单一代码库;真实场景大量功能/修复需跨仓协调。WideSWE 从 103 个软件生态挖掘 120 个真实跨仓任务(60 bug fix + 60 feature),系统化构建隐藏测试。填补了 Agent 跨库协同评测空白。
  • 标签: agent benchmark systems

4. UMM-Reflection: 统一多模态模型的自我反思(HF 2026-09-27)

  • 标题: Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning
  • 链接: https://arxiv.org/abs/2609.35767
  • 核心: 统一多模态模型(能看图也能生成图)理论上可以自我修复——诊断图像错误→修订→观察→再次诊断。SFT 提供冷启动但无法找到高成功率修复路径,UMM-Reflection 用 RL 联合学习反思文本和图像生成。对 Agent 自我修正能力有直接启示。
  • 标签: multimodal(跨模态 Agent 能力相关)

📡 Substack / 博客补充(1 条)

supermemory.ai: AI Agent Context Limits Fixes(May 2026) - URL: https://supermemory.ai/blog/what-happens-ai-agent-runs-out-context-fix - 要点:生产环境中 AI Agent 实际可用上下文比标称值低 30-40%(模型在约 130k tokens 即开始退化,而非标称的 200k)。"lost in the middle" 失败随上下文填充增加而加剧。持久记忆系统比纯上下文方案降低成本 2.5×、准确率提升 18%。RAG 只读不写,记忆系统才是读写闭环——这是 2026 年工程层面的重要认知更新。


📋 其他候选(去重存档)

来源 标题 备注
HF InfiniHand: 流式手部运动估计 记忆模块与视觉结合,偏多模态
HF GeoVerse: 几何潜空间新视角合成 与 Agent/RAG 关联弱
HF Residual Transferability in Neural Image Watermarking 安全方向,非本雷达核心
HF When Do Model Internals Help? Representation Engineering vs LLM Safety 表征工程评测,相关性一般

📌 去重备注

本期与今日早间雷达(2026-09-29 08:40)无重复。高价值条目均来自 2026-09-26~28 新发布。


Tom 雷达 · 2026-09-29 14:40 UTC · 轻量模式 · 8 候选 → 4 高价值 + 1 Substack