Repo-To-Skill: 把 GitHub 仓库蒸馏成 AI 可执行技能 · 干货攻略

  • 链接: https://arxiv.org/abs/2609.02749
  • 分类: x-tips
  • 来源: X @_akhaliq
  • 作者: Jay
  • 更新: 2026-09-07
  • 仓库: VectorSpaceLab/AREX-Skill

这是什么

DisCo(Distillation & Composition)是北京人工智能研究院(BAAI)等团队提出的研究智能体,它不只做研究,还自己构建可执行技能——然后用这些技能反过来提升研究能力。配套产物是 AREX-Skill Library:从 1,000+ 个热门 ML 仓库中自动蒸馏出 5,000+ 条已验证技能,覆盖 20 个研究领域和 178 个能力家族,编码智能体(Codex、Claude Code 等)可直接加载使用。

GitHub 仓库:VectorSpaceLab/AREX-Skill
arXiv 论文:2609.02749
作者团队:BAAI、中国科学技术大学、中国人民大学、香港理工大学


为什么值得关注

解决的核心问题

当前研究智能体的架构是:LLM 主干(知道什么) + Harness(知道怎么做),但两者都缺乏操作知识(operational knowledge)——即"知道方法"到"能让它跑起来"之间那层经验:选哪个包、怎么调参、常见坑怎么绕。

传统做法靠人手工把这些经验写成脚本或工具。DisCo 的思路是:让智能体自己读懂仓库里的代码和文档,把操作知识蒸馏成紧凑、可验证的技能单元,然后任何研究任务都能复用这套技能,不用每次从头猜。

X 原帖说的硬核点

  • 核心洞察:把 repo 知识变成可执行策略的流水线,不是总结文档,而是生成 SKILL.md(作用域/路由/工作流/验证)+ references/ + scripts/ 三件套
  • 已有 AREX-Skill Library:从 1,000 个 ML 仓库蒸馏 5,000+ 条已验证技能,Claude/GPT 复用已付费知识而非每次 token 重发现
  • benchmark 实测:Codex + AREX-Skill 对比纯 Codex,MLE-bench 提升 134.3%

踩坑复盘价值

  • 蒸馏 workflow 的四阶段设计(scope → ground → construct → verify)本身是工程最佳实践
  • 技能验证失败后的 refinement loop 机制,是真正让技能可信赖的关键

核验过程

官方来源

来源 读取内容 关键数据
GitHub README 完整安装方式、技能格式、benchmark 表 MLE-bench: 31.11→72.89(+134.3%)等四表数字;Node.js >=22.19.0
arXiv HTML 论文全文 introduction、contributions、方法 DisCo 两阶段蒸馏定义;技能格式 SKILL.md 结构;GPT-5.5 作为固定 backbone
Hyper.ai 摘要 技术摘要 "operational knowledge" 正式定义;路由器两级分类体系

交叉验证结论

  1. Benchmark 数字:GitHub README 与论文 abstract 完全一致(MLE-bench +134.3%、PaperBench +34.4%、FrontierCS +9.2%、PassNet +14.0%),可信。
  2. 技能数量:GitHub README 写的是"1,000+ repositories / 5,000+ skills",论文写的是"1,000 widely used ML repositories",两个说法吻合,取 1,000。
  3. 仓库归属:原帖未注明 GitHub 仓库,检索发现为 VectorSpaceLab/AREX-Skill,README 明确标注对应论文 arXiv:2609.02749,关联可信。
  4. 技能格式:与 Agent Skills format 兼容,GitHub README 有具体目录结构截图,与论文描述吻合。
  5. 安装方式:curl 安装脚本和 npm 两种方式,GitHub README 明确注明 Node.js >=22.19.0 要求。
  6. 不适用的说法:原帖说"Claude/GPT 复用已付费知识",论文和 GitHub 均未提及"付费"概念,此处为 @_akhaliq 的诠释,非论文主张,攻略不引此说法。

上手步骤

环境要求

Node.js >= 22.19.0

安装 DisCo(curl,macOS / Linux / WSL)

curl -fsSL https://github.com/VectorSpaceLab/AREX-Skill/releases/latest/download/install-disco.sh | sh

安装 DisCo(npm)

npm install -g --ignore-scripts @arex-skill/disco

配置模型 Provider

# 首次运行时配置
disco /login

# 或设置环境变量
export OPENAI_API_KEY=sk-...
export ANTHROPIC_API_KEY=sk-ant-...
export GEMINI_API_KEY=...

安装并浏览 AREX-Skill Library

# 安装所有预置技能
disco repo-skills install

# 启动 DisCo Researcher 模式(默认加载 AREX-Skill)
disco

在 DisCo Researcher 模式中提问示例

Use the installed skills to benchmark vLLM and SGLang on this machine under the same model, workload, and hardware constraints. Report verified throughput and preserve the commands and measurements needed to reproduce the comparison.

路由器会自动选择相关的仓库技能,智能体只加载当前任务需要的 SKILL.md 分支。

导出技能到 Claude Code / Codex

# 导出到 Claude Code 用户级 skills 目录
disco --creator -p "/skill:import-repo-skills-to-agent import vllm and sglang to ~/.claude"

# 导出到 Codex 用户级 skills 目录
disco --creator -p "/skill:import-repo-skills-to-agent import vllm and sglang to ~/.agents"

重启目标智能体以加载新技能。

技能文件结构(每条技能的内部格式)

skill/
├── SKILL.md          # 作用域、路由、工作流、验证规则
├── references/       # 聚焦指令和来源追溯
└── scripts/          # 可执行辅助脚本(诊断、检查、恢复)

坑与适用边界

适用场景 ✅

  • 需要让 AI 智能体执行 ML 研究任务(复现论文、Kaggle 比赛、跑基准测试)
  • 希望复用某仓库的操作经验而不必每次重新探索
  • 想给 Claude Code / Codex 等编码智能体注入领域知识
  • 构建自己的研究智能体,需要操作知识层

当前局限 ⚠️

  • 生态锁定:技能库以 ML 仓库为主,非 ML 领域目前覆盖有限(20 个领域)
  • 模型依赖:DisCo 本身是 Node.js CLI,需要大模型 API key;benchmark 固定 GPT-5.5 作为 backbone,其他模型效果未系统对比
  • 仓库维护滞后:GitHub 标注"Repository skills are maintained against upstream changes",但实际操作中 repos 更新后技能重蒸馏的触发机制需参考 docs/refreshing-repo-skills.md
  • benchmark 可信度:论文自身声明"The complete technical report is forthcoming",当前表格为截至发稿的 concise summary,非 peer-reviewed 最终数字,引用时需注明
  • 安装门槛:Node.js >= 22.19.0 在部分旧系统上可能需要单独安装

暂不适合的场景 ❌

  • 纯理论研究(非工程任务):技能粒度面向"执行步骤",不适合纯理论推理
  • 缺乏稳定网络的场景:DisCo 需要访问大模型 API
  • 极小内存设备:无 Node.js 运行时基础环境

一句话结论

AREX-Skill Library 把 ML 仓库里的经验蒸馏成 5,000+ 条可验证技能,让编码智能体从"摸索着做"变成"照着技能操作",Codex 接入后 MLE-bench 提升 134%——本质是把人类工程师才有的"踩坑经验"变成了可复用的 AI 技能资产。


核验来源:GitHub README(VectorSpaceLab/AREX-Skill)、arXiv HTML(2609.02749v1)、Hyper.ai 摘要;Benchmark 数字以 GitHub README 与论文 abstract 交叉验证一致。