Tom 文献雷达 · Agent + RAG + 长上下文 · 2026-08-28 08:40

本次覆盖:HF Daily(8月23-25日)+ arXiv(8月26日);共8条,高价值4条,Substack 1条


高价值条目

1. SWE Refactor Bench · Agent · ⭐ 必读

Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration? arxiv.org/abs/2608.23564 · 2026-08-23 · HF votes: 13

核心发现: 8个前沿模型、520次运行,三阶段审计(迁移真实性 + 行为保留 + 对抗验证),仅28次(5.4%)通过全部阶段,13/20任务零接受解。揭示当前前沿模型在长周期、仓库级重构上仍然极弱——"Blindness"问题( agents 复制原实现让测试通过而非真实迁移)。

工程意义: 堆栈迁移被业界视为高价值自动化场景,但 benchmark 结果表明现有 agents 仍无法自主完成;Harness 设计(持久化 agent 状态)是关键开放变量,同期有开源工具 Headlong(<10K Bash)尝试解决冻结问题。

📝 Substack: Samir Sengupta 撰写深度分析(5 min),补充了 leaderboard 上下文和实际失败模式描述。 参考:samcodeman.com/writing/only-28-of-520-agent-runs-completed-a-migration


2. RetrievalRouter · RAG + 系统 · ⭐ 关注

RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval arxiv.org/abs/2608.25625 · 2026-08-25 · HF votes: 3

核心贡献: 文档检索在模态(文本/多模态)和架构(dense / late-interaction)之间的权衡导致延迟与精度不可兼得;RetrievalRouter 证明可在 query 层面自适应选择 pipeline,无需在全局精度和延迟间做硬妥协。

工程意义: 金融/医疗/法律检索场景的实用价值高;late-interaction(如 ColBERT)精度高但延迟大,dense 快但复杂文档召回差——按查询动态路由是合理的工程折中方向。


3. GUI-Primitives · Agent · ⭐ 关注

Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding arxiv.org/abs/2608.21832 · 2026-08-21 · HF votes: 4

核心贡献: 994项对比评测集,聚焦7种空间关系(左右、上下、 containment、对齐、邻近、列表序、遮挡),严格控制截图和锚点不变、仅改变关系表达,隔离模型对空间语言的理解能力。5名标注员验证子集(κ=0.94)。

工程意义: GUI agents 的空间推理是 computer-use 能力的核心短板;该 benchmark 设计严谨,可直接用于 VLM 评测和改进追踪。


4. Prefix Sliding · 长上下文 · ⭐ 关注

Prefix Sliding for Efficient Test-time Scaling arxiv.org/abs/2608.26070 · 2026-08-25 · HF votes: 3

核心发现: 长思考任务保留完整推理 token 成本极高,但实验发现大多数中间推理 token 在后续推理中重要性骤降;Prefix Sliding 在推理过程中丢弃非 prefix 及最近几千 token 窗口以外的 token。

工程意义: Test-time scaling 是 2026 年热门方向,该方法以极简设计(无需新架构)实现 memory 效率提升,与当前主流的 full attention 方案形成直接竞争。


候选摘要(其余4条)

条目 来源 要点
PlanSightRAG arXiv 2608.26091 · 2026-08-26 视觉优先多模态 RAG,索引工程图纸而非 OCR;4,056对 benchmark,准确率91%;Planner-Retriever-Auditor-Synthesizer agent 架构
Skill Issue arXiv 2608.25832 · 2026-08-25 跨语言技能不一致性量化;多语言 self-play 游戏设置隔离语言对模型行为的影响
Modular Agent CT arXiv 2608.21140 · 2026-08-20 CT 扫描空间关系验证的模块化 agent,VLM 空间推理弱点在医疗场景的具象化
LibriBrain100 arXiv 2608.25204 · 2026-08-24 100小时MEG数据集用于语音神经解码(神经科学方向,与本 radar 主题关联较弱)

信号来源: arXiv metadata + HF Daily 富化;CSDN 未使用 本轮耗时: ~8 min