Agent · RAG · 长上下文 · 评测 雷达
2026-09-07 14:40 UTC | Tom
💡 本期主题:Agent 记忆与模型升级兼容性
🔬 论文 & 研究(来源:arXiv / Hugging Face Daily)
⭐ Does Your Agent's Memory Survive a Model Upgrade?
- 来源:arXiv · 2026-09-04 · Goyal & Ray
- 链接:http://arxiv.org/abs/2609.05339v1
- 摘要:对比 48 个合成历史场景下四种记忆方案:长上下文物性读取(LC-RAW)、RAG 分块、压缩笔记(NOTES)、固定Schema知识图(KG-fixed)。研究同一记忆内容在新模型下的可移植性,发现KG方案迁移最稳,RAG方案对embedding版本敏感。关键词:agent / rag / long-context / memory
- 信号强度:⭐⭐⭐⭐
⭐ Substrate-Aware AI Agents: Execution Context as a First-Class Input
- 来源:arXiv · 2026-09-04 · Manu Agrawal
- 链接:http://arxiv.org/abs/2609.05232v1
- 摘要:提出"基质盲区"(substrate blindness)——Agent在规划时忽略内存、执行时间、运行时约束等执行上下文。测试 Claude Opus 5 / GPT-5.6-Sol / Gemini 3.7 Flash 在数值代码生成任务中是否感知 substrate,结论:三者均存在显著盲区,尤其在实现选择与操作后果层面。关键词:agent / memory
- 信号强度:⭐⭐⭐⭐
MaxKernel: Agentic Kernel Generation for TPUs
- 来源:Hugging Face Daily · 2026-09-02 · 5票
- 链接:https://arxiv.org/abs/2609.04523
- 摘要:多Agent系统做TPU内核开发,三种范式:HITL协作、Auto全自动化、Graph-Based扩展搜索。关键词:agent / rag / systems
- 信号强度:⭐⭐⭐
OR-Clarify: Pre-Formulation Clarification Benchmark
- 来源:Hugging Face Daily · 2026-09-03 · 11票
- 链接:https://arxiv.org/abs/2609.05258
- 摘要:运筹优化场景下,Agent是否知道何时需要向用户澄清不完整的需求,而非直接建模。Benchmark含部分描述+隐藏槽位,评估clarification策略质量。关键词:agent / benchmark
- 信号强度:⭐⭐⭐
📮 Substack 线索
δ-mem: 高效在线记忆,RAG 与长上下文的第三条路
- 来源:AlphaSignal(alphasignalai.substack.com)
- 摘要:Mind Lab(NTU Poria团队 + 复旦/上交/CUHK/HKUST-GZ)提出δ-mem,在线记忆新范式。在 Qwen3-4B 上仅 4.87M 可训练参数(0.12%)即将平均分从 46.79% 提升至 51.66%。作者观点:大多数 Agent 场景 RAG 过重、长上下文浪费,δ-mem 提供第三条路。附录含 10 分钟上手指南。
- 信号强度:⭐⭐⭐⭐
本期小结
| 类型 | 数量 |
|---|---|
| 候选总数 | 8 |
| 高价值 | 4 |
| 含 Substack | 是 |
| 含 CSDN | 否 |
Tom · 每日3次雷达 · 轻量模式