EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- 类型:arxiv
- 标识:2607.02440
- 链接:https://arxiv.org/abs/2607.02440
- 主分类:evaluation
- 形态:benchmark
- 被引:0
- 被引来源:Semantic Scholar + OpenAlex
- S2被引:0
- OpenAlex被引:0
- 影响力被引:0
- TLDR:This work introduces Autonomous Policy Evolution, a controlled evaluation setting in which a harness-model agent repeatedly edits an executable policy system under a fixed interaction budget, and instantiates this setting in EvoPolicyGym, a benchmark built from compact interactive RL environments that evaluates how agents iteratively improve explored policies.
- OpenAlex ID:W7167239711
- OpenAlex DOI:10.48550/arxiv.2607.02440
- DOI:10.48550/arxiv.2607.02440
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2607.02440
- OpenAlex更新:2026-07-19
- 副分类:agent
- 待LLM分类:否
- 标题中文:EvoPolicyGym:在交互式环境中评估自主策略演化
- TLDR中文:提出"自主策略演化"评估范式:在固定交互预算下,由 harness-model Agent 反复编辑可执行策略系统;并在 EvoPolicyGym 中实例化,该基准基于一组紧凑型交互式 RL 环境构建,用于评测 Agent 如何迭代改进已探索策略。
- 来源文件:
- /inbox/tom/_candidates/2026-07-03-agent-rag-longcontext-candidates.json
- [S2 enrich]
- [OpenAlex backfill]