Tom 文献雷达 · AI Agent / RAG / 长上下文 · 2026-08-25 第三期

本期候选(8条)

# 来源 标题 标签
1 HF Daily Better Retrieval, Worse Robustness: Multi-hop RAG 放大上游 ASR 错误 rag, benchmark
2 HF Daily MobilePA-Bench: 移动端 Planner Agent 评测基准 agent, benchmark
3 HF Daily ARC: 开放域 Agent 交互中的公平相对优势比较 agent
4 HF Daily GameXpert-Bench: 编码 Agent 距游戏专家开发还有多远? agent, benchmark
5 HF Daily Task-CoEvolve: 自适应验证任务选择的高效 LLM Harness 优化 benchmark
6 HF Daily One Polluted Page: LLM 推荐系统中的 Web 内容污染评估 benchmark
7 HF Daily Block3D: 块级扩散文生 3D 框架 systems
8 HF Daily Unlocking Image Editing via Concept Scaling multimodal

⭐ 高价值条目(4条)

1. Better Retrieval, Worse Robustness: How Multi-hop RAG Amplifies Upstream ASR Errors

来源: arXiv · 2026-08-23 | 标签: rag, benchmark | votes: 2

语音应用先过 ASR 再进 RAG,ASR 错误是上游固定约束。论文测试了 entity-graph linking 和 iterative reformulation 两种 RAG 扩展,在四种英语口音(神经 TTS 合成)× 三多跳 QA 基准上评估——结论反直觉:结构更丰富的 RAG 配置在 ASR 噪声下绝对 F1 更高,但在干净文本上的优势反而缩小,说明这些扩展在吸收 ASR 错误上更鲁棒,却让系统在干净场景下产生不同类型的幻觉。

要点: 首个系统研究 RAG×ASR 噪声级联的工作;对语音+RAG 产品有直接警示意义;多跳 QA + ASR 的组合Benchmark值得关注。


2. MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

来源: arXiv · 2026-08-23 | 标签: agent, benchmark | votes: 24

填补 GUI 中心评测(只测屏幕操作)和静态 function-calling 评测(离线 API 匹配)之间的空白,提出交互式、状态化、以工具为核心的移动端 Planner 评测基准。评测移动 Agent 需要同时追踪后台工具调用和长时序规划能力。

要点: 24 票是本期最高;移动 OS 是 Agent paradigm 的下一个主战场;评测移动端 Agent 的系统性方案。


3. ARC: Fair Relative Advantage Comparison in Open-Ended Real-World Interaction

来源: arXiv · 2026-08-12 | 标签: agent | votes: 11

开放域 Agent 交互允许多种合理行为(直接回答、请求澄清、进度更新、先确认再行动),这打破了基于 rollouts 组内比较的 RL 假设——reward-model 对交互风格的偏好会扭曲相对优势。论文形式化此问题为 reward fairness problem,提出 ARC(Advantage Regularization via Conditioning)训练配方。

要点: 对 Agent 群体评测方法论有修正意义;reward fairness 是长上下文多轮交互里被低估的问题;是 2026 年 Agent 对齐的新方向。


4. GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

来源: arXiv · 2026-08-21 | 标签: agent, benchmark | votes: 5

游戏开发要求程序逻辑、视听内容、界面、交互和可玩性同时正确,是检验 Agent 端到端能力的极佳场景。论文分析了完整的人-Agent 开发轨迹,识别出三个关键阶段,并据此构建评测基准,填补了现有基准只评测最终产物或单个阶段的空白。

要点: 游戏开发是 Agent 能力的天然综合压测;三个阶段(构思→原型→迭代)的分解方法可迁移到其他复杂软件任务。


补充:Agent 评测生态动态

基于 Web 调研,当前评测格局快速演化: - 长上下文 Agent: AgentLongBench(支持 10⁴–4×10⁶ token)、LoCoBench-Agent、LifelongAgentBench 等覆盖 10K–4M token 范围 - RAG 安全: Hidden-in-Plain-Text 基准专门评估 Web-facing RAG 的 indirect prompt injection 和 retrieval poisoning 攻击 - 多模态检索: ViDoRe V3 推出 26K 页面 + 3,099 查询的六语言多模态 RAG 评测 - Agent 社会行为: M3-BENCH 在混合动机游戏中评测 Agent 推理+通讯的过程感知指标


生成时间: 2026-08-25 14:40 UTC
数据来源: HF Daily(arXiv metadata + 富化)
Substack: 未使用
CSDN: 未使用