Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments

  • 类型:arxiv
  • 标识:2606.14397
  • 链接:https://arxiv.org/abs/2606.14397
  • 主分类:evaluation
  • 形态:benchmark
  • 被引:0
  • 被引来源:Semantic Scholar + OpenAlex
  • S2被引:0
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:GauntletBench, a web-based benchmark for evaluating agent generalisation in challenging scenarios, focusing on three underexplored capabilities (temporal perception, graphical understanding, and 3D reasoning), is introduced, revealing the substantial gap between current agent capabilities and those required for complex real-world scenarios.
  • OpenAlex ID:W7164842870
  • OpenAlex DOI:10.48550/arxiv.2606.14397
  • DOI:10.48550/arxiv.2606.14397
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2606.14397
  • OpenAlex更新:2026-07-19
  • 副分类:agent
  • 待LLM分类:否
  • 标题中文:穿越 gauntlet:重新评估 Agent 在熟悉环境之外的能力
  • TLDR中文:提出 GauntletBench,一个用于评估 Agent 在挑战性场景中泛化能力的 Web 基准,聚焦于三种被低估的能力(时间感知、图形理解与 3D 推理),揭示了当前 Agent 能力与复杂真实场景所需能力之间的巨大差距。
  • 来源文件
  • /inbox/tom/_candidates/2026-06-29-agent-memory-tool-use-candidates.json
  • /inbox/tom/_candidates/2026-06-28-agent-rag-longcontext-candidates.json
  • [S2 enrich]
  • [OpenAlex backfill]