How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
- 类型:arxiv
- 标识:2608.14905
- 链接:https://arxiv.org/abs/2608.14905
- 主分类:agent
- 形态:method
- 被引:0
- 被引来源:Semantic Scholar
- S2被引:0
- 影响力被引:0
- TLDR:AutoResearchEval, featuring 100 tasks grounded in published frontier science across 7 scientific domains and the full research lifecycle, and ARFT, a framework of 45 empirically-grounded failure patterns to enable scalable fine-grained attribution, are introduced.
- 副分类:evaluation
- 待LLM分类:否
- 标题中文:Agent 在 AutoResearch 上如何失败:100 个真实前沿研究任务的端到端诊断评估
- TLDR中文:本文介绍了 AutoResearchEval,包含 100 个基于已发表前沿科学、覆盖 7 个科学领域和完整研究生命周期的任务,以及 ARFT,一个由 45 个经验驱动的失败模式组成的框架,可实现可扩展的细粒度归因。
- 来源文件:
- /inbox/tom/_candidates/2026-08-18-agent-rag-longcontext-candidates.json
- [S2 enrich]