Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-10-01 晚间

任务模式:轻量 cron,每日第三次 生成时间:2026-10-01 20:40 Asia/Shanghai 候选来源:arXiv metadata + HF Daily(providers: arxiv, hf) 去重参考:今日已有 08:40、14:40 两期 radar


🔴 高价值条目(3 条)

1. RAGScope:RAG 幻觉分级与证据门控协议

  • 来源:arXiv 2609.39075,2026-09-30
  • 作者:Zeming Liu et al.
  • 核心:RAGScope 提出一种低成本证据门控协议,对低风险输出直接放行、不确定项送审、仅对高开销长尾动用强验证器。协议含上下文分组切片、折折 bootstrap 置信区间、部署操作点及源移 stress test。在 RAGTruth 三个任务上,RAGScope-E 达到 0.798 AUROC / 0.660 AP。
  • 关键词:rag benchmark systems
  • 价值判断:RAG 幻觉检测从规则,迈向可量化部署协议;是 RAG 系统落地的直接工程参考。

2. RoPE at the End of Its Rope?长上下文失效的理论、诊断与缓解

  • 来源:arXiv 2609.39929,2026-09-30
  • 作者:Yuyang Wu, Yufeng Du, Hao Peng
  • 核心:RoPE 内在在「维持稳定 token 偏好」与「区分相近位置」之间存在 trade-off;论文放款了 prior theory 中 query-key scale 相等的假设,使其与实际观察更吻合,并可在单 head 和单输入层面量化该弱点。高频分量支持位置敏感性,低频分量支持远程依赖——二者难以兼得是 RoPE 失效根因。
  • 关键词:long-context
  • 价值判断:长上下文模型评测与选型的理论依据;关于 RoPE 位置编码的诊断工具值得标注。

3. CUA-SWE:计算机使用智能体遇上视觉软件工程

  • 来源:HF Daily 2609.32600,2026-09-25
  • 核心:现有 coding agent 与 computer-use agent 独立研究,缺乏端到端集成开发流程benchmark。CUA-SWE 提出 benchmark + 环境 + 评测 pipeline,涵盖:反复运行软件、交互界面、视觉检查行为、将视觉观察连接至负责代码、用应用验证修复——完整还原真实开发循环。
  • 关键词:agent benchmark
  • 价值判断:software engineering agent 评测从单步走向全流程;多模态观测→代码定位→验证的闭环是明显的研究缺口。

🟡 中等价值条目(3 条)

4. Safety of Latent Communication in Multi-Agent Systems

  • 来源:HF Daily 2609.39788,2026-09-29
  • 核心:即便底层安全对齐的 agent,训练 latent link(表示空间映射)也可能增加有害合规性;攻击者可进一步在 harmful query-response 对上优化 link,或投毒训练数据。这是多 agent 表示空间通信的隐蔽安全风险。
  • 关键词:agent systems

5. ATLAS:Latent Structure 对齐传输用于世界模型规划

  • 来源:HF Daily 2609.36333,2026-09-29
  • 核心:regularizing latent marginal 不能保证 planning 用的 state-to-state 关系;ATLAS 将 encoder 表示的成对结构迁移到 planning latent,并使用 Wasserstein 分布对齐。解决了世界模型规划中「表示变换破坏规划相关新颖结构」的问题。
  • 关键词:agent

6. MIST:误导图像压力测试——VLM 评判的不稳定来源

  • 来源:HF Daily 2609.37863,2026-09-28,13 票
  • 核心:200 句英文,语义可字面/隐喻两读,附对齐图、误导图或无图;要求仅从句子判断标签。预期每张图都会将评判者标签拉向该图所描绘的意义——揭示 VLM 评判的脆弱性来源是图像而非模型本身。
  • 关键词:benchmark multimodal

🟢 低相关条目(2 条)

7. DyRAD:动态驾驶场景雷达新视角合成

  • 来源:HF Daily 2609.39841,2026-09-29,8 票
  • 超出本 radar 核心范围(自动驾驶雷达 NVS + Doppler),不深入。

8. The Endless Exam:数学构造基准集

  • 来源:HF Daily 2609.24555,2026-09-27
  • 数学基准,与 agent/RAG/长上下文主题偏离,仅保留备查。

📦 Substack 线索(1 条)

  • Cobus Greyling 写过 RAGTruth(RAG 幻觉语料库)的解读:span 级幻觉检测仍是未解难题,当前方法在词级 F1 上仍未达标。该文与 RAGScope 形成互补——RAGScope 给出工程解法,RAGTruth 提供评测基础。
  • 链接:https://cobusgreyling.substack.com/p/ragtruth

附:候选 JSON 存档

  • 路径:/shared/research-kb/inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json
  • 共 8 条,来源:arXiv × 2,HF Daily × 6