How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks

  • 类型:arxiv
  • 标识:2608.14905
  • 链接:https://arxiv.org/abs/2608.14905
  • 主分类:agent
  • 形态:method
  • 被引:0
  • 被引来源:Semantic Scholar
  • S2被引:0
  • 影响力被引:0
  • TLDR:AutoResearchEval, featuring 100 tasks grounded in published frontier science across 7 scientific domains and the full research lifecycle, and ARFT, a framework of 45 empirically-grounded failure patterns to enable scalable fine-grained attribution, are introduced.
  • 副分类:evaluation
  • 待LLM分类:否
  • 标题中文:Agent 在 AutoResearch 上如何失败:100 个真实前沿研究任务的端到端诊断评估
  • TLDR中文:本文介绍了 AutoResearchEval,包含 100 个基于已发表前沿科学、覆盖 7 个科学领域和完整研究生命周期的任务,以及 ARFT,一个由 45 个经验驱动的失败模式组成的框架,可实现可扩展的细粒度归因。
  • 来源文件
  • /inbox/tom/_candidates/2026-08-18-agent-rag-longcontext-candidates.json
  • [S2 enrich]