🔴 保留 · Agent Skill Evaluation and Evolution: Frameworks and Benchmarks
- 类型:arxiv
- 标识:2606.11435
- 链接:https://arxiv.org/abs/2606.11435
- 主题:agent, database, engineering, evaluation, llm-infra, multimodal, rag, risk
- 主分类:evaluation
- 形态:survey
- 被引:3
- 被引来源:Semantic Scholar
- S2被引:3
- OpenAlex被引:0
- 影响力被引:0
- TLDR:This survey systematically examines the landscape of skill evolution and evaluation beyond foundational skill creation into four distinct paradigms, spanning execution feedback, trajectory distillation, compression, and reinforcement learning, and identifies open directions for building skill ecosystems that are generalizable, efficient, and verifiably safe.
- OpenAlex ID:W7164396653
- OpenAlex DOI:10.48550/arxiv.2606.11435
- DOI:10.48550/arxiv.2606.11435
- DOI来源:OpenAlex
- 开放获取:green
- 开放获取链接:https://doi.org/10.48550/arxiv.2606.11435
- OpenAlex更新:2026-07-19
- 标题中文:🔴 保留 ·
Agent Skill Evaluation and Evolution: Frameworks and Benchmarks - TLDR中文:本综述系统梳理了超越基础 Skill 创建的 Skill 演化与评估图景,将其归纳为四种范式:执行反馈、轨迹蒸馏、压缩与强化学习,并指出了构建可泛化、高效且可验证安全的 Skill 生态的开放方向。
- 副分类:agent
- 待LLM分类:否
- 来源文件:
/inbox/jay/2026-06-12-night-arxiv-engineering-llm-agents.md- [S2 enrich]
- [OpenAlex backfill]
可复用信息
- WildClawBench | 60 tasks / 6 categories | 真实 OpenClaw 环境;Docker 隔离评分
- SkillForge | 3,737 tasks | 5 个真实云技术场景
- SkillRouter | — | retriever + reranker 做技能选择(而非仅靠名称/描述)
-
- 关键发现:仅靠技能名称和描述做技能选择在大规模场景下不准确;需要 retriever + reranker
-
- SkillOrchestra:技能 orchestra 管理框架
-
- 未来方向:行业合作任务套件、动态仓库状态、捕获工程实践演进的评测指标
- 保留理由:对主流 agent 技能评测框架做了系统性梳理,有 benchmark 规模对比,是构建 agent 评测体系的重要参考文献。
- 链接:
https://arxiv.org/html/2606.11435
写作用途
- 可放入 RAG / 知识库 / 检索增强相关工作的对比段。
- 可用于 Agent 架构、记忆、工具调用或多智能体研究背景。
- 可用于多模态推理、视觉语言模型或长上下文多模态问题定义。
- 可用于系统实现、实验平台或工程约束说明。
- 可用于局限性、风险、失效模式和未来工作。
待补齐
- BibTeX / 正式引用格式
- 方法与实验设置细节
- 与现有工作的差异点
- 是否有代码和数据集