让机器人"现场自己学"——2026 这篇论文:不用重训也能让机器人开门搬箱子,秘密是让 LLM 自己改"奖励程序"
- 关联论文:2610.02196
你有没有想过:
家里的机器人会走、会搬箱子,但你要它"开门"——它不会;你要它"把瓶子放到桌上"——它不会;你要它"扫帚立起来"——它也不会。
按老办法:每加一个新任务,就重新收集数据、重新训练策略、重新调奖励。可对家庭服务、灾后、太空这些"没有大规模遥操数据"的场景来说,这条路几乎走不通——每次新任务都意味着几周甚至几个月的代价。
arXiv 2610.02196(Sirui Xu 等,2026)做了一件反直觉的事:不重训全身控制器,让 LLM 在测试时自己"写"奖励程序,机器人自己"长"出新的组合能力。在 Unitree G1 真机上跑通了一组训练集外的 loco-manipulation 任务(locomotion + manipulation,移动+操作一体化),从"推门、搬箱"到"接触密集、多阶段"。
到 2026 年 10 月,这是"测试时进化 + LLM-as-programmer"路线在人形机器人上最完整的物理闭环证明——也是"奖励工程做得越细、反而把能力锁住"这条反直觉发现的代表案例。
为什么这事值得每个做机器人 / 做具身的人关心
机器人行业近两年最大的痛点是:通用策略不通用。
训练一个能"推门"的模型 ≠ 训练一个能"搬箱子"的模型 ≠ 训练一个能"擦桌子"的模型。
传统做法有两条:
- 任务专属训练——每加一个新任务,代价高、泛化差;
- 大规模通用策略——π0、RT-2、HPT 走这条路,但人形机器人在接触密集场景里 reward 设计极易失败:能力其实在策略里、但 reward 把它锁住了。
InterEvolve 的核心判断是:你不需要重训,你只需要"挖"。
一个足够"宽"的全身基础模型(FB, forward-backward 行为基础模型)已经内含新任务所需的绝大部分运动原语,问题不在于"模型能不能做",而在于"奖励程序怎么写才能把能力释放出来"——这恰恰是 LLM 擅长的活儿。
一句话核心
arXiv 2610.02196 提出 InterEvolve 框架:由 FB 全身基座 + 可执行奖励程序 + LLM Agent + 数值优化器三层组成的"测试时自演化闭环",让机器人在不动策略权重的前提下,于仿真器里迭代改写奖励程序,最终在 Unitree G1 真机上跑出训练集外的 loco-manipulation 新能力。
三个洞察
洞察 1:能力已经在模型里,奖励工程把它锁住了
论文最具冲击力的发现是:"human-designed rewards 让 FB 模型的大量 loco-manipulation 能力未被释放"。
这是反直觉的——你精心写的奖励函数,居然是"锁住能力"的元凶?原因很简单:
- 人类工程师只能想到自己见过的策略。奖励函数本质上把搜索空间限制在"人脑可想象"的子集。
- FB 模型作为全身基座,理论上覆盖的运动原语远多于人类能枚举。但人工奖励把这些原语中"不符合预期"的部分压低权重,等同于把能力剪枝。
- InterEvolve 让 LLM 在测试时自由改写奖励——搜索空间里那些"人类设计者根本想不到"的解反而能跑出来。
这就是"奖励工程悖论":越精细的人工奖励,越可能浪费基座能力。
洞察 2:解耦 LLM 和数值优化器,让 LLM 不在 20 维连续空间盲打
奖励程序的搜索空间是结构 + 常数两个完全不同维度的混合:
- 结构:要不要加一个"先抓取把手"阶段、要不要把完成条件从"距离 < 阈值"改成"接触力 > 阈值"——离散搜索,LLM 擅长;
- 常数:接触力阈值到底是 5N 还是 8N、过渡时长 0.5s 还是 1s——连续优化,数值优化器擅长。
如果让 LLM 单独承担两者,LLM 会直接在 20 维连续参数空间里瞎改——既不擅长,也难以收敛。InterEvolve 的解法是双层分离:
- LLM Agent(结构改写):决定增删阶段、调整完成条件;
- 数值优化器(常数改写):在固定结构下调常数。
两者解耦后,搜索空间被压扁——LLM 只在离散结构空间搜索,常数交给梯度类方法——搜索时间 / 样本效率立刻提升。
洞察 3:FB 模型 + 对象残差 = 能力解耦的通用路径
InterEvolve 在基座设计上有一个非常工程化的拆解:
- 身体先验(body prior)冻结,保持稳定的平衡 / 步态 / 全身动力学;
- 对象残差只动"与物体接触相关的部分"——例如推门时手对门把手施加的力、搬箱子时躯干对箱子的支撑反力。
新任务不需要重训身体,只要告诉模型"对哪个对象、施加什么相对位移 / 力"——奖励程序作为"接口"提供的就是这一类残差信号。
这是一条通用路径:任何"已有强基座、要快速扩展任务"的人形机器人 / 全身控制系统,都可以借鉴"对象残差"作为新任务规格的注入接口。
整体框架:FB + 奖励程序 + LLM 双层改写
FB 模型(冻结) ← 全身运动基座,提供"能力仓库"
↑
对象残差注入 ← 任务对"哪个对象 / 哪个身体部位 / 什么动作"
↓
奖励程序(可执行) ← 多阶段 + 完成条件 + 可调常数(结构 + 常数)
↓
LLM Agent(结构改写) ← 在 skill library + 执行反馈上下文里重写程序结构
+
数值优化器(常数改写) ← 在固定结构下做梯度类常数调优
↓
并行仿真评估 ← 多场景并行跑 → success rate + 反馈信号
↓
skill library 入库 ← 已验证的程序 + 常数 + 结果
↓
Unitree G1 真机部署 ← egocentric onboard perception 自主管控
关键循环:每轮迭代(程序改写 → 仿真评估 → 反馈回灌)→ 下轮迭代。LLM 读 success rate 和反馈信号,决定下一轮结构怎么改。
关键实验与数据
论文在三层做了验证:
- 仿真主战场:FB 模型在 Isaac / MuJoCo 类仿真器中跑并行场景,每轮 LLM + 优化器改写;
- 任务多样性:覆盖 loco-manipulation 通用任务谱——推门、搬箱、操作工具类(具体任务清单需 PDF 表格核对);
- 真机部署:在 Unitree G1 上验证"自演化的 skill"能以 egocentric 感知自主运行——即不依赖外部动捕或外部算机。
论文关键叙事是"human-designed rewards 大量浪费了 FB 模型的能力"——这是反直觉发现:reward 工程做得越多、越细,越可能反而把已有能力锁住。InterEvolve 的反例是:让程序在测试时自由进化,反而能释放出"人类设计者根本想不到"的新策略。
⚠️ 具体的成功率对比表 / 各任务成功率百分比在公开 abstract 页面并未列出(原文未明确),需读 PDF / 项目页(sirui-xu.github.io/InterEvolve)核对。
五个工程坑点(部署到生产前必看)
坑 1:FB 模型覆盖能力不足,导致搜索不到可用解
- 现象:测试时无论 LLM 怎么改写奖励程序,仿真成功率始终贴近 0。
- 影响:误以为是程序搜索问题,反复调 LLM prompt 与优化器常数都无效。
- 修复:先用一组"诊断任务"(推开、推动、抓放、组合)评估 FB 模型能跑多稳。如果"基座成功率" < 0.3,应回到 FB 训练阶段扩数据或换基座,而不是继续在 InterEvolve 层迭代。
坑 2:奖励程序的"可度量"漏设计,LLM 拿到不可比反馈
- 现象:每轮 success rate 在多个程序间数值几乎不变(或噪声主导),LLM 无法定位哪一步修好了、哪一步搞砸了。
- 影响:搜索效率骤降,迭代轮数翻倍仍达不到目标阈值。
- 修复:在程序里强制每阶段输出 1~3 个"标量反馈"(接触力、距离、完成标志),LLM 的 prompt 明确"以这些标量为锚"读反馈。
坑 3:并行仿真场景多样性不足,"过拟合到一个场景"
- 现象:训练后期程序在某一两个初始配置上得分 100%,但换到新场景里成功率掉到 30% 以下。
- 影响:skill library 入库的程序只是"窄分布好手",部署到物理机上 sim-to-real gap 极大。
- 修复:每轮评估的场景池要"宽且随机"——物体初始位姿、目标位置、扰动力、传感器噪声。建议场景池 ≥ 16,每次评估从中随机抽样 ≥ 8。
坑 4:LLM 改写漂移到无关结构,越迭代越复杂
- 现象:迭代几轮后奖励程序从 4 阶段膨胀到 12 阶段,引入大量重复 / 矛盾的子目标,但 success rate 不再上升。
- 影响:程序可读性下降、调试困难,且后续真机部署时 sim-to-real 一旦出 bug 几乎无法定位。
- 修复:在 LLM 重写 prompt 里强制"程序长度上限"(如 ≤ 6 阶段)+ "每阶段必须消除一个失败样本"的硬约束;每 5 轮做一次"程序裁剪 + 回填常数"。
坑 5:物理部署的 on-board 算力瓶颈
- 现象:在 Unitree G1 上跑了仿真里能跑通的程序,但 on-board 推理延迟过高(>100ms / 步),运动节律断裂。
- 影响:物理机表现远差于仿真,且不可重复。
- 修复:FB 模型做 on-board 部署前必须做量化 / 蒸馏 / 算子融合;评估"每步推理 ms"作为硬指标,不达标不下发程序。
对 AI 产品经理的 3 个启示
- 不要把"重训"当默认路径:每加一个新任务都要重训是上一代思路。InterEvolve 这条"测试时进化"路线意味着:只要基座够强 + 接口设计得当 + LLM 够用,就能低成本扩展任务——产品上线节奏可能从季度级降到周级。
- 结构 / 常数解耦是 LLM 接物理仿真的通用模式:任何"LLM 调参数 + 物理仿真闭环"的场景,都可以默认做结构-常数解耦——避免 LLM 直接在 20 维连续空间盲改。
- "奖励工程悖论"对所有领域通用:你精心写的规则 / 流程 / 模板,可能正在把你系统的"涌现能力"锁死。InterEvolve 给出的解药是:让 LLM 在测试时自由探索,搜索空间里可能有"人类设计者根本想不到"的解。
一句话总结
InterEvolve 用三层组合——FB 全身基座(冻结)+ 奖励程序(结构 + 常数)+ LLM Agent + 数值优化器(双层改写)——让机器人在不动策略权重的前提下"现场自己学"。在 Unitree G1 上验证了 sim-to-real 的可行性,且只用 egocentric 感知。对家庭服务、灾后、太空这类"没有大规模遥操数据"的场景,这是 2026 年最值得抄作业的工程范式——也是"奖励工程做得越细、反而把能力锁住"这条反直觉发现的代表案例。
三个标题变体
- 让机器人"现场自己学"——2026 这篇论文:不用重训也能让机器人开门搬箱子,秘密是让 LLM 自己改"奖励程序"
- 为什么你的机器人不会开门搬箱子?——2026 这篇论文说:你精心设计的奖励函数,可能正在把它的能力锁死
- 人形机器人不用重训就能学新任务?——InterEvolve 把"LLM 改写奖励程序 + 数值优化器调常数"变成了一套闭环流水线
📱 小红书风格卡片文案(可直接发布)
🤖 机器人不用重训就能学新任务?2026 这篇论文给出了答案
你有没有想过家里的机器人才会自己"长"出新能力?
arXiv 2610.02196(InterEvolve)做了一件事: - 让 LLM 在测试时自己改写奖励程序 - 让数值优化器调常数 - 让全身基座(FB 模型)冻结不重训 - 在 Unitree G1 真机上跑通推门、搬箱等 loco-manipulation 任务
🔍 三个反直觉发现: 1️⃣ 奖励工程悖论:你精心写的奖励函数,可能正在把机器人的"涌现能力"锁死 2️⃣ 结构 / 常数解耦:LLM 改结构 + 优化器调常数,比 LLM 直接在 20 维空间盲改高效得多 3️⃣ 能力解耦:身体先验冻结 + 对象残差注入 = 把"新任务规格"和"全身控制"解耦
📊 物理落地信号: ✅ Unitree G1 真机闭环验证 ✅ egocentric 感知自主管控(不依赖外部动捕) ✅ 训练集外任务(推门、搬箱)跑通
⚠️ 诚实标注: ⚠️ 具体成功率对比表 abstract 未列,需读 PDF / 项目页核对 ⚠️ GitHub 仓库链接 abstract 未明确,第三方独立复现有门槛 ⚠️ 仅 Unitree G1 一台物理机验证,未覆盖跨平台 / 多模态泛化
🏷️ 标签:#人形机器人 #具身智能 #LLM4Robotics #测试时进化 #奖励工程
写作说明:本文基于
/shared/research-kb/organized/promo/explainers/2610-02196.md(flyP 精修 · 2026-10-02 · 18.6 KB)改写,工程坑点 §八 全数保留。诚实标注了 abstract 未明确的所有成功百分比 / GitHub 仓库链接 / 跨平台泛化。