Tom 文献雷达 · Agent · RAG · 长上下文 · 2026-09-30

本期候选(8 条)

# 来源 标题 亮点 价值
1 HF (票 24) LLMs are General Asynchronous Agents (2609.35427) 突破顺序交互循环,涵盖语音助手/具身 Agent/监控系统的并发模型 ⭐⭐⭐
2 HF (票 14) APM-Bench: 跨会话持久记忆基准 (2609.37559) 549 sessions/104 条生活轨迹,多会话中断场景下的记忆持久性评测 ⭐⭐⭐
3 arXiv KUPAS MASTER: 将专家隐性经验蒸馏为 Agent 可用语料 (2609.37673) 九层认知语料构建框架,含上下文/线索/判断/行动/边界/结果六要素 ⭐⭐⭐
4 arXiv 关键词搜索 vs 语义搜索精度定量对比框架 (2609.37749) 首个对 RAG 与关键词搜索进行严格量化对比的评测框架 ⭐⭐
5 HF (票 7) Reasoning with Image Generation (2609.16409) 用图像生成模型替代窄域视觉工具,实现灵活视觉推理 ⭐⭐
6 HF (票 7) AutoRef: Agentic 多参考图生成 (2609.35530) 生成 Agent + harness 架构解决多参考图像融合问题 ⭐
7 HF (票 2) Improved Distributional Diffusion Models (2609.37147) DDM 可扩展到现代图像生成;与 Agent 主题关联弱 —
8 HF (票 1) WISE-ATTA: 预算约束下的主动测试时适应 (2609.37687) 长期测试流中选择性请求监督;与 RAG/Agent 关联弱 —

高价值条目摘要

⭐⭐⭐ K1 · 异步 Agent(必读)

"LLMs are General Asynchronous Agents" · arXiv:2609.35427 传统 LLM Agent 遵循"读取→推理→回复/调用工具"的顺序循环,难以应对语音助手、具身机器人、监控系统等并发场景。本文提出通用异步 Agent 架构,可自适应不同类型的并发。涉及 specialized voice interaction、video stream 处理、VLAs for robot control、asynchronous tool calling。投票 24,是本期 HF 最热论文。

⭐⭐⭐ K2 · APM-Bench:跨会话持久记忆(评测类必录)

"APM-Bench" · arXiv:2609.37559 现有流式视频基准和方法关注单个连续视频或短片段,忽略了真实世界交互往往是间歇性的——记忆需要在中断后保持跨会话持久性。APM-Bench 将流式交互重新表述为多会话生活轨迹,含 549 sessions/104 trajectories/2719 个候选问题,涵盖客观题和开放式问题。

⭐⭐⭐ K3 · 专家隐性知识语料工程(Agent 知识管理新方向)

"KUPAS MASTER" · arXiv:2609.37673 资深从业者知道的远不止事实和结论——他们知道哪些线索重要、为什么某个判断合理、该采取什么行动。常规工作记录往往遗漏了这些隐性知识。KUPAS MASTER 提出九层认知语料构建,将异构工作记录和访谈转化为六要素可追溯语料(context, cues, judgment, action, boundaries, outcomes),可直接供 Agent 调用。Ping Sun / Jiazheng Wang 等作者,工程导向强。

⭐⭐ K4 · RAG vs 关键词搜索量化评测(新框架)

"Towards Semi-Automatically Comparing Keyword-Based and Semantic Search Accuracy" · arXiv:2609.37749 现有 RAG 评测多依赖主观用户反馈,缺乏对关键词搜索与语义搜索精度的严格定量对比。本文提出首个跨格式(list / message)IR 精度量化评测框架,作者:Mohamed Ben Salha 等。

Substack 线索(本期 1 条)

δ-mem: RAG and Long Context Aren't Enough for Agent Memory — A Third Path 来源:AlphaSignal(alphasignalai.substack.com),2026-05-15,10.1K Views 核心:Mind Lab(Soujanya Poria 团队,NTU)+ 复旦/上交/港中文/港科广作者。提出 δ-mem:用 8×8 关联记忆状态(仅 4.87M 可训练参数)实现 LLM 长期记忆。在 Qwen3-4B-Instruct 上,0.12% 模型参数量的适配器使 5 个基准平均分从 46.79% 提升至 51.66%。提出观点:对大多数 Agent 工作负载,RAG 过度设计,长上下文浪费资源,δ-mem 提供第三条路。 关联方向:与 K2(APM-Bench)共同指向 Agent 记忆架构赛道;与 K1(异步 Agent)结合可构成完整的"并发+记忆"Agent 框架。

去重备注

  • 本期无与上周(2026-09-29)雷达直接重复条目
  • APM-Bench 与 2026-09-29 的视频理解/多模态基准方向有关联但为新论文
  • δ-mem(Substack)是新方向,Mind Lab 团队此前未见收录

Tom 文献雷达 · 每日 3 次 · 2026-09-30 20:40 CST