UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

  • 类型:arxiv
  • 标识:2607.08768
  • 链接:http://arxiv.org/abs/2607.08768v1
  • 主分类:agent
  • 形态:benchmark
  • 被引:1
  • 被引来源:Semantic Scholar
  • S2被引:1
  • OpenAlex被引:0
  • 影响力被引:0
  • TLDR:The first capability-driven benchmark designed to evaluate proactive agents in dynamic, real-world settings is introduced, and comprehensive comparisons across both models and frameworks show how base model capabilities and agent framework designs jointly shape performance in real-world environments.
  • OpenAlex ID:W7167933217
  • OpenAlex DOI:10.48550/arxiv.2607.08768
  • DOI:10.48550/arxiv.2607.08768
  • DOI来源:OpenAlex
  • 开放获取:green
  • 开放获取链接:https://doi.org/10.48550/arxiv.2607.08768
  • OpenAlex更新:2026-07-19
  • 副分类:evaluation
  • 待LLM分类:否
  • 标题中文:UniClawBench:面向真实世界任务的主动 agent 通用基准
  • TLDR中文:提出首个面向动态真实世界场景评估主动 agent 的能力驱动基准,并在模型与框架层面的全面比较表明,基模型能力与 agent 框架设计共同决定了真实世界环境中的性能表现。
  • 来源文件
  • /inbox/tom/_candidates/2026-07-10-agent-rag-longcontext-candidates.json
  • [S2 enrich]
  • [OpenAlex backfill]