UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- 类型:arxiv
- 标识:2607.08768
- 链接:http://arxiv.org/abs/2607.08768v1
- 主分类:agent
- 形态:benchmark
- 被引:1
- 被引来源:Semantic Scholar
- S2被引:1
- OpenAlex被引:0
- 影响力被引:0
- TLDR:The first capability-driven benchmark designed to evaluate proactive agents in dynamic, real-world settings is introduced, and comprehensive comparisons across both models and frameworks show how base model capabilities and agent framework designs jointly shape performance in real-world environments.
- OpenAlex ID:W7167933217
- OpenAlex DOI:10.48550/arxiv.2607.08768
- DOI:10.48550/arxiv.2607.08768
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.08768
- OpenAlex更新:2026-07-19
- 副分类:evaluation
- 待LLM分类:否
- 标题中文:UniClawBench:面向真实世界任务的主动 agent 通用基准
- TLDR中文:提出首个面向动态真实世界场景评估主动 agent 的能力驱动基准,并在模型与框架层面的全面比较表明,基模型能力与 agent 框架设计共同决定了真实世界环境中的性能表现。
- 来源文件:
- /inbox/tom/_candidates/2026-07-10-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]