Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-08-28 08:40
本次覆盖:HF Daily(8月23-25日)+ arXiv(8月26日);共8条,高价值4条,Substack 1条
高价值条目
1. SWE Refactor Bench · Agent · ⭐ 必读
Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
arxiv.org/abs/2608.23564 · 2026-08-23 · HF votes: 13
核心发现: 8个前沿模型、520次运行,三阶段审计(迁移真实性 + 行为保留 + 对抗验证),仅28次(5.4%)通过全部阶段,13/20任务零接受解。揭示当前前沿模型在长周期、仓库级重构上仍然极弱——"Blindness"问题( agents 复制原实现让测试通过而非真实迁移)。
工程意义: 堆栈迁移被业界视为高价值自动化场景,但 benchmark 结果表明现有 agents 仍无法自主完成;Harness 设计(持久化 agent 状态)是关键开放变量,同期有开源工具 Headlong(<10K Bash)尝试解决冻结问题。
📝 Substack: Samir Sengupta 撰写深度分析(5 min),补充了 leaderboard 上下文和实际失败模式描述。 参考:
samcodeman.com/writing/only-28-of-520-agent-runs-completed-a-migration
2. RetrievalRouter · RAG + 系统 · ⭐ 关注
RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval
arxiv.org/abs/2608.25625 · 2026-08-25 · HF votes: 3
核心贡献: 文档检索在模态(文本/多模态)和架构(dense / late-interaction)之间的权衡导致延迟与精度不可兼得;RetrievalRouter 证明可在 query 层面自适应选择 pipeline,无需在全局精度和延迟间做硬妥协。
工程意义: 金融/医疗/法律检索场景的实用价值高;late-interaction(如 ColBERT)精度高但延迟大,dense 快但复杂文档召回差——按查询动态路由是合理的工程折中方向。
3. GUI-Primitives · Agent · ⭐ 关注
Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding
arxiv.org/abs/2608.21832 · 2026-08-21 · HF votes: 4
核心贡献: 994项对比评测集,聚焦7种空间关系(左右、上下、 containment、对齐、邻近、列表序、遮挡),严格控制截图和锚点不变、仅改变关系表达,隔离模型对空间语言的理解能力。5名标注员验证子集(κ=0.94)。
工程意义: GUI agents 的空间推理是 computer-use 能力的核心短板;该 benchmark 设计严谨,可直接用于 VLM 评测和改进追踪。
4. Prefix Sliding · 长上下文 · ⭐ 关注
Prefix Sliding for Efficient Test-time Scaling
arxiv.org/abs/2608.26070 · 2026-08-25 · HF votes: 3
核心发现: 长思考任务保留完整推理 token 成本极高,但实验发现大多数中间推理 token 在后续推理中重要性骤降;Prefix Sliding 在推理过程中丢弃非 prefix 及最近几千 token 窗口以外的 token。
工程意义: Test-time scaling 是 2026 年热门方向,该方法以极简设计(无需新架构)实现 memory 效率提升,与当前主流的 full attention 方案形成直接竞争。
候选摘要(其余4条)
| 条目 | 来源 | 要点 |
|---|---|---|
| PlanSightRAG | arXiv 2608.26091 · 2026-08-26 | 视觉优先多模态 RAG,索引工程图纸而非 OCR;4,056对 benchmark,准确率91%;Planner-Retriever-Auditor-Synthesizer agent 架构 |
| Skill Issue | arXiv 2608.25832 · 2026-08-25 | 跨语言技能不一致性量化;多语言 self-play 游戏设置隔离语言对模型行为的影响 |
| Modular Agent CT | arXiv 2608.21140 · 2026-08-20 | CT 扫描空间关系验证的模块化 agent,VLM 空间推理弱点在医疗场景的具象化 |
| LibriBrain100 | arXiv 2608.25204 · 2026-08-24 | 100小时MEG数据集用于语音神经解码(神经科学方向,与本 radar 主题关联较弱) |
信号来源: arXiv metadata + HF Daily 富化;CSDN 未使用 本轮耗时: ~8 min