Agent · RAG · 长上下文 · 评测 雷达

2026-09-07 14:40 UTC | Tom


💡 本期主题:Agent 记忆与模型升级兼容性


🔬 论文 & 研究(来源:arXiv / Hugging Face Daily)

⭐ Does Your Agent's Memory Survive a Model Upgrade?

  • 来源:arXiv · 2026-09-04 · Goyal & Ray
  • 链接:http://arxiv.org/abs/2609.05339v1
  • 摘要:对比 48 个合成历史场景下四种记忆方案:长上下文物性读取(LC-RAW)、RAG 分块、压缩笔记(NOTES)、固定Schema知识图(KG-fixed)。研究同一记忆内容在新模型下的可移植性,发现KG方案迁移最稳,RAG方案对embedding版本敏感。关键词:agent / rag / long-context / memory
  • 信号强度:⭐⭐⭐⭐

⭐ Substrate-Aware AI Agents: Execution Context as a First-Class Input

  • 来源:arXiv · 2026-09-04 · Manu Agrawal
  • 链接:http://arxiv.org/abs/2609.05232v1
  • 摘要:提出"基质盲区"(substrate blindness)——Agent在规划时忽略内存、执行时间、运行时约束等执行上下文。测试 Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 在数值代码生成任务中是否感知 substrate,结论:三者均存在显著盲区,尤其在实现选择与操作后果层面。关键词:agent / memory
  • 信号强度:⭐⭐⭐⭐

MaxKernel: Agentic Kernel Generation for TPUs

  • 来源:Hugging Face Daily · 2026-09-02 · 5票
  • 链接:https://arxiv.org/abs/2609.04523
  • 摘要:多Agent系统做TPU内核开发,三种范式:HITL协作、Auto全自动化、Graph-Based扩展搜索。关键词:agent / rag / systems
  • 信号强度:⭐⭐⭐

OR-Clarify: Pre-Formulation Clarification Benchmark

  • 来源:Hugging Face Daily · 2026-09-03 · 11票
  • 链接:https://arxiv.org/abs/2609.05258
  • 摘要:运筹优化场景下,Agent是否知道何时需要向用户澄清不完整的需求,而非直接建模。Benchmark含部分描述+隐藏槽位,评估clarification策略质量。关键词:agent / benchmark
  • 信号强度:⭐⭐⭐

📮 Substack 线索

δ-mem: 高效在线记忆,RAG 与长上下文的第三条路

  • 来源:AlphaSignal(alphasignalai.substack.com)
  • 摘要:Mind Lab(NTU Poria团队 + 复旦/上交/CUHK/HKUST-GZ)提出δ-mem,在线记忆新范式。在 Qwen3-4B 上仅 4.87M 可训练参数(0.12%)即将平均分从 46.79% 提升至 51.66%。作者观点:大多数 Agent 场景 RAG 过重、长上下文浪费,δ-mem 提供第三条路。附录含 10 分钟上手指南。
  • 信号强度:⭐⭐⭐⭐

本期小结

类型 数量
候选总数 8
高价值 4
含 Substack
含 CSDN

Tom · 每日3次雷达 · 轻量模式