Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-30
本期候选(8 条)
| # | 来源 | 标题 | 亮点 | 价值 |
|---|---|---|---|---|
| 1 | HF (票 24) | LLMs are General Asynchronous Agents (2609.35427) | 突破顺序交互循环,涵盖语音助手/具身 Agent/监控系统的并发模型 | ⭐⭐⭐ |
| 2 | HF (票 14) | APM-Bench: 跨会话持久记忆基准 (2609.37559) | 549 sessions/104 条生活轨迹,多会话中断场景下的记忆持久性评测 | ⭐⭐⭐ |
| 3 | arXiv | KUPAS MASTER: 将专家隐性经验蒸馏为 Agent 可用语料 (2609.37673) | 九层认知语料构建框架,含上下文/线索/判断/行动/边界/结果六要素 | ⭐⭐⭐ |
| 4 | arXiv | 关键词搜索 vs 语义搜索精度定量对比框架 (2609.37749) | 首个对 RAG 与关键词搜索进行严格量化对比的评测框架 | ⭐⭐ |
| 5 | HF (票 7) | Reasoning with Image Generation (2609.16409) | 用图像生成模型替代窄域视觉工具,实现灵活视觉推理 | ⭐⭐ |
| 6 | HF (票 7) | AutoRef: Agentic 多参考图生成 (2609.35530) | 生成 Agent + harness 架构解决多参考图像融合问题 | ⭐ |
| 7 | HF (票 2) | Improved Distributional Diffusion Models (2609.37147) | DDM 可扩展到现代图像生成;与 Agent 主题关联弱 | — |
| 8 | HF (票 1) | WISE-ATTA: 预算约束下的主动测试时适应 (2609.37687) | 长期测试流中选择性请求监督;与 RAG/Agent 关联弱 | — |
高价值条目摘要
⭐⭐⭐ K1 · 异步 Agent(必读)
"LLMs are General Asynchronous Agents" · arXiv:2609.35427 传统 LLM Agent 遵循"读取→推理→回复/调用工具"的顺序循环,难以应对语音助手、具身机器人、监控系统等并发场景。本文提出通用异步 Agent 架构,可自适应不同类型的并发。涉及 specialized voice interaction、video stream 处理、VLAs for robot control、asynchronous tool calling。投票 24,是本期 HF 最热论文。
⭐⭐⭐ K2 · APM-Bench:跨会话持久记忆(评测类必录)
"APM-Bench" · arXiv:2609.37559 现有流式视频基准和方法关注单个连续视频或短片段,忽略了真实世界交互往往是间歇性的——记忆需要在中断后保持跨会话持久性。APM-Bench 将流式交互重新表述为多会话生活轨迹,含 549 sessions/104 trajectories/2719 个候选问题,涵盖客观题和开放式问题。
⭐⭐⭐ K3 · 专家隐性知识语料工程(Agent 知识管理新方向)
"KUPAS MASTER" · arXiv:2609.37673 资深从业者知道的远不止事实和结论——他们知道哪些线索重要、为什么某个判断合理、该采取什么行动。常规工作记录往往遗漏了这些隐性知识。KUPAS MASTER 提出九层认知语料构建,将异构工作记录和访谈转化为六要素可追溯语料(context, cues, judgment, action, boundaries, outcomes),可直接供 Agent 调用。Ping Sun / Jiazheng Wang 等作者,工程导向强。
⭐⭐ K4 · RAG vs 关键词搜索量化评测(新框架)
"Towards Semi-Automatically Comparing Keyword-Based and Semantic Search Accuracy" · arXiv:2609.37749 现有 RAG 评测多依赖主观用户反馈,缺乏对关键词搜索与语义搜索精度的严格定量对比。本文提出首个跨格式(list / message)IR 精度量化评测框架,作者:Mohamed Ben Salha 等。
Substack 线索(本期 1 条)
δ-mem: RAG and Long Context Aren't Enough for Agent Memory — A Third Path 来源:AlphaSignal(alphasignalai.substack.com),2026-05-15,10.1K Views 核心:Mind Lab(Soujanya Poria 团队,NTU)+ 复旦/上交/港中文/港科广作者。提出 δ-mem:用 8×8 关联记忆状态(仅 4.87M 可训练参数)实现 LLM 长期记忆。在 Qwen3-4B-Instruct 上,0.12% 模型参数量的适配器使 5 个基准平均分从 46.79% 提升至 51.66%。提出观点:对大多数 Agent 工作负载,RAG 过度设计,长上下文浪费资源,δ-mem 提供第三条路。 关联方向:与 K2(APM-Bench)共同指向 Agent 记忆架构赛道;与 K1(异步 Agent)结合可构成完整的"并发+记忆"Agent 框架。
去重备注
- 本期无与上周(2026-09-29)雷达直接重复条目
- APM-Bench 与 2026-09-29 的视频理解/多模态基准方向有关联但为新论文
- δ-mem(Substack)是新方向,Mind Lab 团队此前未见收录
Tom 文献雷达 · 每日 3 次 · 2026-09-30 20:40 CST