机器人学习到底该"把能力烤进权重"还是"让 Agent 自己写代码"?——arXiv 2608.01851 给一张全景图,把"Skill"这个词的五种含义一次切清

  • 关联论文:2608.01851

你有没有想过这样一个问题 🤔:

你买了个家务机器人回家。 它说"我自带 100 个技能"—— 你让它去厨房拿杯子,它说"我只会客厅技能"。 你换了台新机器人,同一个技能"完全用不了"

这不全是机器人的问题。

"技能 (Skill)" 这个词太乱

arXiv 2608.01851 (Weights or Skills?) 说:"Skill" 至少被五种含义混用了 5 年,搞得整个机器人学习领域鸡同鸭讲。

把这件事拆成两个对立赌注

  • Weights 派(VLA 模型:RT-2 / OpenVLA / π0 / GR00T)——把"看到什么就做什么"烤进冻结权重
  • Skills 派(code-as-policy)——让 Agent 在运行时自己写、改、记可执行代码

然后沿着"自我改进程度"一轴,把 code-as-policy 方法排成 4 档:

L1 零样本程序合成 ↓ L2 闭环自修复(每次重新发明轮子) ↓ L3 持久技能记忆(存起来下次复用) ↓ L4 执行反馈 + 记忆 + 进化搜索(极少系统占据:ASPIRE / ENPIRE / RoboClaw)

同时指出市面上的机器人技能商店只卖"静态回放"——留下一堆开放的工程与安全问题。

听起来像给整个机器人学习圈做了一次"术语大扫除 + 商业市场体检",对吧?

作者就是这么做的——整理了 77 个代表性系统、6 个技术家族、11 张图 11 张表


为什么这事值得每个做机器人 / Agent / 具身 AI 的人关心

今天你做机器人学习,几乎一定在这两个流派之间反复横跳:

  1. "Skill" 一词的五种含义混用——行为原语 / 神经策略块 / 代码 / 记忆条目 / 宏动作;不澄清就没法比较
  2. 同样叫 code-as-policy,零样本写代码和"反馈+记忆+进化搜索"完全是两件事——扁平罗列会掩盖关键差异
  3. 商用技能商店已经在卖"一键技能"——但只卖静态回放,导致工程落地时不知道哪些能直接复用、哪些必须重写

这件事一旦成立,意味着什么?

  • 先定义"skill"再实现——在自家平台里统一规定 skill 的语义(推荐 code sense + 持久记忆 + 验证)
  • L3 是工程甜区——L4 的进化搜索工程量是断崖式,非研究团队建议直接走 L3 稳定路线
  • 不要直接复用商用技能商店的 static skill——除非做严格来源审计与 embodiment 适配

一句话核心

把机器人学习切成 Weights 派 (VLA 冻结权重)Skills 派 (Agent 自己写可执行代码) 两个对立赌注,沿「自我改进程度」一轴把 code-as-policy 排成 L1→L4 四档,并指出只有 code sense 的 skill 才能在不更新梯度的前提下自我改进——这是 Weights 与 Skills 之争的真正分歧点。


三个洞察

洞察 1:单轴"自我改进程度"比传统三轴更贴近工程现实

传统分类(模仿学习 vs 强化学习 vs 提示工程)是训练范式的切分——对算法研究者友好,对工程团队鸡肋。

ASGE-RR 论文用的轴更接地气:"这个 skill 系统能不能不更新梯度就自我改进?"

按这条轴排序: - L1 零样本程序合成:看到任务 → LLM 写一段 Python/DSL → 跑一次 → 结束 - L2 闭环自修复:执行报错 → LLM 改代码 → 但没有长期记忆 → 下次同类问题重新修 - L3 持久技能记忆:成功代码存进向量库 → 下次检索复用 → 但不主动改写老技能 - L4 执行反馈 + 记忆 + 进化搜索:三件套合一 → 变异 / 组合 / 淘汰 → 开放式改进循环

关键发现L4 这一格当前只有极少数最新系统占据——ASPIRE / ENPIRE / RoboClaw。其余 74 个系统都在 L1-L3。

翻译成大白话:绝大多数 code-as-policy 系统"每次重新发明轮子";能"积累技能并自动改进"的目前是稀缺品

洞察 2:术语澄清做得到位——"Skill" 五义只有 code 能自我改进

论文给"skill"切了五刀:

含义 定义 能不能不更新梯度就自我改进?
行为原语 (behavior primitive) 强化学习里的固定策略
神经策略块 子网络/子模块
代码 可执行程序
记忆条目 文本/向量化的经验 半(取决于有没有反馈回路)
宏动作 (macro action) 选项框架里的子策略

明确划界后,只有 code sense 的 skill 才能在不更新梯度的前提下自我改进——这是 Weights 与 Skills 之争的真正分歧点。

Weights 派:能力在梯度里,要改就得重训。 Skills 派(code sense):能力在代码里,要改就改代码,不用重训

这不是"哪个更好"的口水仗——是两种改进路径的根本分歧

洞察 3:商用技能市场是个"体检单",不是"决策表"

论文把分类映射到新兴的「技能经济 (skill economy)」:商用机器人技能商店已经开始"一键分发"技能到不同机器人,但当前出货只有静态回放 (static playback)

由此暴露出一组待解工程问题——给工业界一份可读的问题清单:

  • 适应性 (adaptation):换 embodiment 后技能是否还能用?
  • 跨机器人可移植 (cross-embodiment portability):从 Franka 到 Stretch 是否零改动?
  • 来源可追溯 (provenance):技能由谁生成、谁测试、谁签名?
  • 安全验证 (safety verification):未验证的代码可能损伤硬件或人
  • 组合性 (composition):多技能能否自动编排
  • 标准化 (standardisation):缺少统一描述协议

一个判断:市面所有"机器人技能商店"的 skill 描述协议不统一(无 JSON Schema / IDL),工程团队拿过来后必须自己定义翻译层


关键实验与数据

由于这是 survey,本文没有单一 benchmark:

  • 覆盖规模:77 个代表性系统,6 个技术家族,11 张图、11 张表
  • 对比表:每个家族给出「能做什么 / 不能做什么」的双列表,让读者一眼看清能力边界
  • 代表性 L4 系统:ASPIRE、ENPIRE、RoboClaw 被并入同一个「开放式改进循环」格子里,是当前最稀缺的组合
  • 市场规模信号:商用技能商店出货技能已存在,但均属 static playback——论文没有给出具体出货量与销售额(原文未明确量化)

注:本文未提供可复现的统一 benchmark,每个被引用系统的实验设定保持原样;任何「Weights 派 SOTA / Skills 派 SOTA」类横评,「原文未明确」给出统一数字。


为什么这件事对 2026 年的具身 AI 至关重要

2026 年是具身 AI 从"演示"走向"产品"的关键年

  • VLA 模型在通用预训练上扩展——OpenVLA / π0 / GR00T 等已经把"看到什么就做什么"的能力推到相当大的规模
  • code-as-policy 在工业场景落地——Code as Policies / Voyager 已经被多个机器人团队作为基线
  • 技能商店出现——多家厂商在卖"一键技能包"——但只卖静态回放

这篇 survey 的真正价值是给整个领域一份共同的"地图"

  • 知道自己站在哪一档(L1 / L2 / L3 / L4)
  • 知道哪一档是真的稀缺(L4)
  • 知道"技能商店"目前只是个营销概念(不是工程标准)

一段给普通人的话

如果你不是做机器人的,只是好奇——这段可以快速看完。

记住三件事:

  1. 机器人学习现在分裂成两个阵营:一个说"把能力烤进权重"(VLA),一个说"让 Agent 自己写代码"(Skills)。两边都在赢,但赢法不同
  2. "Skill" 这个词至少被五种含义混用了——你看到任何"机器人技能",先问一句"是哪一种 skill"
  3. 商用技能商店暂时只能卖"静态回放"——换个机器人大概率崩,除非做严格来源审计与 embodiment 适配

更简单一句话:今天买机器人的"技能包",相当于买一份录像带,不是买一个真正会学习的程序


三个标题变体

  1. 机器人学习到底该"把能力烤进权重"还是"让 Agent 自己写代码"?——arXiv 2608.01851 给一张全景图,把"Skill"这个词的五种含义一次切清
  2. 77 个机器人系统排成 4 档,arXiv 2608.01851 发现 L4 "自我改进"只有极少数系统能做到
  3. "Skill" 一词至少被五种含义混用 5 年——arXiv 2608.01851 给机器人学习圈做了一次大扫除

小红书风格卡片文案(可直接发布)

🤖 机器人学习到底该"把能力烤进权重"还是"让 Agent 自己写代码"? 🤖

你买了个家务机器人回家 🤖 它说"我自带 100 个技能"—— 你让它去厨房拿杯子,它说"我只会客厅技能" 🍳❌ 你换了台新机器人,同一个技能"完全用不了" 🔄❌

不是机器人不够好——是"Skill" 这个词太乱 🧠❌

arXiv 2608.01851 (Weights or Skills?) 把这件事一次说透:

"Skill" 至少被五种含义混用了 5 年—— 行为原语 / 神经策略块 / 代码 / 记忆条目 / 宏动作 不澄清就没法比较,整个领域都在鸡同鸭讲 🐔🐔

🎯 核心机制(4 档自我改进谱)

L1 零样本程序合成
  ↓
L2 闭环自修复(每次重新发明轮子)
  ↓
L3 持久技能记忆(存起来下次复用)
  ↓
L4 执行反馈 + 记忆 + 进化搜索
       ▲
   仅 ASPIRE / ENPIRE / RoboClaw 占据这一格
   (稀缺品)

📚 三个关键洞察

1️⃣ 单轴"自我改进程度"比传统三轴更接地气——不问"你怎么训练的",问"你能不能不更新梯度就自我改进"——绝大多数系统在 L1-L3,每次重新发明轮子

2️⃣ 只有 code sense 的 skill 才能自我改进——Weights 派(VLA)"能力在梯度里,要改就重训";Skills 派(code)"能力在代码里,要改就改代码,不用重训"——这是两种改进路径的根本分歧

3️⃣ 商用技能商店是个"体检单"——出货只有静态回放 (static playback)没有统一描述协议(无 JSON Schema / IDL)——工程团队必须自己定义翻译层

🛠️ 今晚就能抄的工程切片

# L3 持久技能记忆最小实现
# 核心组件:
#   1. embedding 模型(推荐 bge-m3):向量化 skill code
#   2. 向量库(FAISS 或 Milvus):存储 + 检索
#   3. LLM Judge:判断新任务是否可复用已有 skill
#   4. Skill 文件系统:skill code + metadata + usage count

# 推荐目录结构:
skills/
├── metadata.json    # skill ID、embodiment、创建时间、调用次数
└── skills/          # Python/DSL skill code 文件

💡 为什么每个做机器人 / Agent / 具身 AI 的人都该关心?

今天你做机器人学习,绕不开这些选择: 🤖 Weights 派(VLA:RT-2 / OpenVLA / π0 / GR00T)→ "把能力烤进冻结权重" ⚙️ Skills 派(code-as-policy)→ "让 Agent 自己写代码" 🛒 商用技能商店→ 暂时只能卖静态回放,换机器人大概率崩 📊 L3 是工程甜区→ L4 进化搜索工程量是断崖式,非研究团队建议直接走 L3 稳定路线

这篇 survey 第一次给了整个机器人学习圈一张共同的"地图"——知道自己站在哪一档、知道L4 是真的稀缺、知道技能商店目前只是个营销概念 🗺️

抄它的思路——先定义"skill"再实现—— 你的机器人平台就能从"演示"走向"产品" 🚀

⚠️ 坑也得提一句: - L4 的进化搜索 + 持久记忆 + 执行反馈三件套组合算力开销与时间预算未在文中量化——别把它当 SOTA 模型直接上生产 - L3 → L4 的实现复杂度是断崖式的——L3 有 Voyager / Sailor 可参考,L4 需要自研奖函数 + 搜索调度 - 沙箱安全是 L4 落地前提——未验证的代码 skill 不允许在线执行,最小可用安全实现:Docker 隔离 + 断言验证 + 人工审批节点 - L4 当前边界存疑——截至 2026 年 8 月,Evolve-Instruct、RoboAgent 等工作可能已进入 L4,建议补充检索最新文献 - 商用技能商店的"static playback"是综述者基于公开资料的归纳性结论,并非严格审计——可能存在特例


机器人学习 #具身AI #EmbodiedAI #VLA #CodeAsPolicy #arXiv论文 #论文解读 #RobotLearning #Agent #AI产品经理 #工程落地 #LLM应用 #深度学习