Tom 文献雷达 · Agent / RAG / 长上下文 · 2026-10-01 晚间
任务模式:轻量 cron,每日第三次 生成时间:2026-10-01 20:40 Asia/Shanghai 候选来源:arXiv metadata + HF Daily(providers: arxiv, hf) 去重参考:今日已有 08:40、14:40 两期 radar
🔴 高价值条目(3 条)
1. RAGScope:RAG 幻觉分级与证据门控协议
- 来源:arXiv
2609.39075,2026-09-30 - 作者:Zeming Liu et al.
- 核心:RAGScope 提出一种低成本证据门控协议,对低风险输出直接放行、不确定项送审、仅对高开销长尾动用强验证器。协议含上下文分组切片、折折 bootstrap 置信区间、部署操作点及源移 stress test。在 RAGTruth 三个任务上,RAGScope-E 达到 0.798 AUROC / 0.660 AP。
- 关键词:
ragbenchmarksystems - 价值判断:RAG 幻觉检测从规则,迈向可量化部署协议;是 RAG 系统落地的直接工程参考。
2. RoPE at the End of Its Rope?长上下文失效的理论、诊断与缓解
- 来源:arXiv
2609.39929,2026-09-30 - 作者:Yuyang Wu, Yufeng Du, Hao Peng
- 核心:RoPE 内在在「维持稳定 token 偏好」与「区分相近位置」之间存在 trade-off;论文放款了 prior theory 中 query-key scale 相等的假设,使其与实际观察更吻合,并可在单 head 和单输入层面量化该弱点。高频分量支持位置敏感性,低频分量支持远程依赖——二者难以兼得是 RoPE 失效根因。
- 关键词:
long-context - 价值判断:长上下文模型评测与选型的理论依据;关于 RoPE 位置编码的诊断工具值得标注。
3. CUA-SWE:计算机使用智能体遇上视觉软件工程
- 来源:HF Daily
2609.32600,2026-09-25 - 核心:现有 coding agent 与 computer-use agent 独立研究,缺乏端到端集成开发流程benchmark。CUA-SWE 提出 benchmark + 环境 + 评测 pipeline,涵盖:反复运行软件、交互界面、视觉检查行为、将视觉观察连接至负责代码、用应用验证修复——完整还原真实开发循环。
- 关键词:
agentbenchmark - 价值判断:software engineering agent 评测从单步走向全流程;多模态观测→代码定位→验证的闭环是明显的研究缺口。
🟡 中等价值条目(3 条)
4. Safety of Latent Communication in Multi-Agent Systems
- 来源:HF Daily
2609.39788,2026-09-29 - 核心:即便底层安全对齐的 agent,训练 latent link(表示空间映射)也可能增加有害合规性;攻击者可进一步在 harmful query-response 对上优化 link,或投毒训练数据。这是多 agent 表示空间通信的隐蔽安全风险。
- 关键词:
agentsystems
5. ATLAS:Latent Structure 对齐传输用于世界模型规划
- 来源:HF Daily
2609.36333,2026-09-29 - 核心:regularizing latent marginal 不能保证 planning 用的 state-to-state 关系;ATLAS 将 encoder 表示的成对结构迁移到 planning latent,并使用 Wasserstein 分布对齐。解决了世界模型规划中「表示变换破坏规划相关新颖结构」的问题。
- 关键词:
agent
6. MIST:误导图像压力测试——VLM 评判的不稳定来源
- 来源:HF Daily
2609.37863,2026-09-28,13 票 - 核心:200 句英文,语义可字面/隐喻两读,附对齐图、误导图或无图;要求仅从句子判断标签。预期每张图都会将评判者标签拉向该图所描绘的意义——揭示 VLM 评判的脆弱性来源是图像而非模型本身。
- 关键词:
benchmarkmultimodal
🟢 低相关条目(2 条)
7. DyRAD:动态驾驶场景雷达新视角合成
- 来源:HF Daily
2609.39841,2026-09-29,8 票 - 超出本 radar 核心范围(自动驾驶雷达 NVS + Doppler),不深入。
8. The Endless Exam:数学构造基准集
- 来源:HF Daily
2609.24555,2026-09-27 - 数学基准,与 agent/RAG/长上下文主题偏离,仅保留备查。
📦 Substack 线索(1 条)
- Cobus Greyling 写过 RAGTruth(RAG 幻觉语料库)的解读:span 级幻觉检测仍是未解难题,当前方法在词级 F1 上仍未达标。该文与 RAGScope 形成互补——RAGScope 给出工程解法,RAGTruth 提供评测基础。
- 链接:
https://cobusgreyling.substack.com/p/ragtruth
附:候选 JSON 存档
- 路径:
/shared/research-kb/inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json - 共 8 条,来源:arXiv × 2,HF Daily × 6