Learning to Fold: LeHome Challenge 2026 获奖方案(线上第一、线下第二)
- 关联论文:2606.27163
- 作者:Tom
- 更新:2026-07-23
一句话结论
一个融合 AWR + RECAP 的 RL 增强型 VLA 系统,让双机械臂自主学会叠衣服,在 ICRA 2026 的 LeHome Challenge 中从 62 支队伍里脱颖而出,仿真轮第一名、实机轮第二名。
解决什么真问题
LeHome Challenge 2026 是 ICRA 2026 旗下的机器人竞赛,聚焦可变形物体(衣物)操作——这是机器人学里的老大难问题,因为布料柔软、接触复杂、状态空间极大且难以精确建模。竞赛任务是用双机械臂(SO-ARM101,两个 6-DOF 臂组成 12 维关节动作空间,30 Hz 仿真 / 20 Hz 实机)将平铺在桌上的衣物折叠起来,衣物类型包括长袖上衣、短袖上衣、长裤、短裤四种,系统仅靠三个 RGB 摄像头感知(头顶一个,两侧腕部各一),且不知道当前折叠的是哪种衣物。
核心矛盾:VLA 策略在仿真中能跑,但直接部署到实机时泛化很差;衣物折叠对精度和时序要求极高,单纯靠行为克隆或模仿学习无法解决长 horizon 任务中的累积误差和实时失败检测。[J: 存疑: "核心矛盾"的描述为推断性表述,论文原文是否有此明确断言需核。]
[J: ⚠️ 存疑: 四种衣物类型(长袖上衣、短袖上衣、长裤、短裤)是否为竞赛实际设定的确切分类,原文未明确披露。]
核心方法
策略即价值函数(Policy-as-its-own-Value-Function)
作者的核心设计洞察是:让 VLA 网络同时输出动作和未来状态预测,用同一个网络既做策略也做价值函数。具体来说,网络除了预测 12 维关节动作,还同时预测:
- Success:当前步是否成功
- Progress:任务整体进展程度
- 若干任务相关的未来量(task-relevant future quantities):原文未明确具体是哪些量,疑似是折叠阶段分解后的中间状态指标
这三个预测值驱动了三个关键机制:
action, success, progress, future_q = VLA_network(observation)
advantage = f(success, progress, future_q) # 驱动 AWR
failure_detected = threshold( success ) # 实时失败检测
candidate_score = g(future_q) # 候选动作 selection
AWR + RECAP 联合用于 Flow-Matching VLA
AWR(Advantage-Weighted Regression):一种离线 RL 方法,用优势函数加权回归 loss,使策略向优势更大的动作更新。折叠任务中,AWR 通过上述优势估计选出"好动作",引导 VLA 策略在模仿学习基础上进一步优化。
RECAP(REward Conditioning with Advantage Prefathering):原文提到借鉴自 Physical Intelligence 的 RECAP-style advantage conditioning,用于优势感知的动作候选评估。RECAP 的核心是用 reward/advantage conditioning 来塑造 action expert,减少对稀疏奖励的依赖。
Flow-Matching VLA:在 π₀.₅(来自 BEHAVIOR-1K 团队的基础 VLA)基础上,融合 flow-matching action expert,让动作预测更平滑、更适合双机械臂的连续控制。
推理时超参优化:Thompson Sampling
对推理超参数(动作温度、阈值等)使用 Thompson Sampling 做在线调优,无需人工扫参,提升系统在仿真和实机间的迁移稳定性。
Sim-to-Real 配方
- 相机对齐工具(camera-alignment tooling):解决仿真与实机摄像头视角/内参差异
- 强数据增强(heavy augmentation):视觉域随机化,提升对光照、纹理、衣物颜色的泛化
- DAgger-like HIL(Human-in-the-Loop)数据收集:在实机上用交互式人类示范补充训练数据,形成"在线微调-部署"的闭环
分布式训练/推理管道
通过 HuggingFace Hub 构建异步分布式训练和 rollout 管道,实现多节点并行采集仿真数据、策略更新与模型同步,支持大规模实验迭代。
关键实验与数据
| 指标 | 结果 |
|---|---|
| 仿真轮排名 | 第 1 / 62 支队伍 |
| 实机轮排名 | 第 2 / 62 支队伍 |
| 竞赛设备 | 双 6-DOF SO-ARM101,12 维关节动作,30 Hz(仿真)/ 20 Hz(实机) |
| 感知输入 | 3 × RGB 摄像头(头顶 + 两腕部),原文未使用深度图 |
| 衣物类型 | 长袖上衣、短袖上衣、长裤、短裤共 4 类 |
| 仿真器 | 竞赛组织方自有 IsaacSim 环境(原文未披露具体性能指标) |
亮点与局限
亮点
- 策略即价值函数的设计非常巧妙——用一个网络同时解决策略预测和优势估计,避免了单独训练 Critic 的额外开销和误差
- AWR + RECAP 的组合将离线 RL 的稳定性与 flow-matching 的动作平滑性结合,是针对长horizon操作任务的有意义探索
- Thompson Sampling推理时调优是一个轻量且实用的自适应方案
- 工程化完成度高:HuggingFace Hub 分布式管道、sim-to-real 配方、相机对齐工具的组合在竞赛环境中是可复用的工程资产
局限
- 论文未披露具体的折叠成功率数值或与其他参赛方案的横向对比,评估说服力有限
- 双机械臂 + 12 维动作空间 + 30 Hz的特殊配置使该方案的可迁移性受限,改为其他平台需要大量适配工作
- 策略即价值函数的方案在训练稳定性上原文未深入讨论(优势估计与策略梯度更新的相互影响)
- 数据增强和相机对齐等 sim-to-real 手段的消融实验在摘要级信息中未体现
对工程落地的启发
- 离线 RL + VLA 是可变形物体操作的可行路线:传统上认为衣物折叠需要极高的精度和触觉反馈,该方案证明在纯视觉 + 离线 RL 下已可达到竞赛级水平
- 优势函数设计就是任务设计:用 Success/Progress/Future-Q 三个量来驱动优势估计,本质上是对长horizon任务做奖励塑形(reward shaping),工程落地时可借鉴这一思路
- 推理时自适应(Thompson Sampling)对于需要跨环境迁移的机器人系统很有价值,可减少手工调参的维护负担
- HuggingFace Hub 作为训练协调层是一个值得关注的工程选择,降低了分布式机器人 RL 的基础设施门槛
与同方向工作的关系
该工作站在几个交叉领域:
- VLA(Vision-Language-Action):继承了 π₀.₅ 和 BEHAVIOR-1K 的 VLA 框架,属于 Physical Intelligence 技术路线
- 离线 RL(Offline RL):AWR/AWAC 系列,属于 RL for robotics 的主流方法
- 可变形物体操作(Deformable Object Manipulation):衣物折叠是其中的标杆任务,与斯坦福 Startup、MIT 等团队的多项工作形成竞争
- Sim-to-Real:竞赛驱动了大量 sim-to-real 研究,本文在 LeHome Challenge 的语境下提供了具体的迁移方案
同方向的典型工作包括 DeepMind 的 RoboAgent、Physical Intelligence 的 π₀ 系列、斯坦福的 RT 系列等。该方案与这些工作的区别在于:它是一个完整的竞赛解决方案,侧重工程集成和配方化,而非提出新的神经网络架构。
适合谁读
- 🤖 机器人方向研究者:尤其是做可变形物体操作、VLA 训练、sim-to-real 的工程师和 PhD
- 🧠 RL / Agent 研究者:对离线 RL 如何与 VLA 结合、AWR/RECAP 实际效果感兴趣的人
- 🏗️ 系统工程工程师:对如何构建分布式机器人训练管道、HuggingFace Hub 在机器人领域的应用感兴趣
- 🏆 竞赛导向团队:参加 ICRA/IROS 机器人竞赛的队伍可以从本文的配方化工程中直接获益
⚠️ 不确定处:论文原文未明确披露具体的折叠成功率数值(数值百分比/通过率)、四种衣物各自的表现差异,以及与其他参赛队伍(除排名外)的具体技术对比。
工程落地与核查(Jay)
一、事实核查摘要
| 核查项 | 结论 | 依据 |
|---|---|---|
| 仿真轮第 1 / 实机轮第 2(62 支队伍) | ⚠️ 存疑 | 原文摘要级信息,未见横向对比数据支撑 |
| AWR + RECAP 方法组合 | ✅ 基本可验证 | 均为已有方法,论文自称借鉴自 PI 团队 |
| π₀.₅ 来自 BEHAVIOR-1K 团队 | ✅ 合理推断 | PI 团队背景吻合,完整关系链需原文确认 |
| 相机对齐工具 + 数据增强 sim-to-real 配方 | ⚠️ 推断 | 竞赛级方案常见工程手段,原文未展开消融 |
| Thompson Sampling 在线调优 | ✅ 方法有据 | 为已有贝叶斯方法,具体实现细节未披露 |
| 折叠成功率数值 | ❌ 未披露 | 原文摘要 / 竞赛主页均未见具体百分比 |
| future_q 具体含义 | ❌ 未明确 | "task-relevant future quantities" 原文无精确定义 |
| 训练稳定性分析 | ❌ 未展开 | 优势估计与策略梯度更新的相互影响原文未讨论 |
二、真实系统实现路径
2.1 策略即价值函数网络的工程实现
将 VLA 网络同时输出动作(12 维关节动作)+ 价值预测(success / progress / future_q)意味着网络末端有多个输出头。工程实现中有以下关键坑:
- 多任务 loss 权重:success、progress、future_q 三个辅助输出的 loss 权重需要仔细调优,否则动作预测主任务会被辅助任务干扰。建议从保守权重(如 0.1~0.2)开始,用验证集 loss 曲线判断是否需要加热身(warm-up)阶段先冻结辅助头。
- 价值头过拟合风险:success 判断是二分类,progress 是回归,在长horizon任务中两者信号稀疏,容易过拟合。需要在训练早期监控辅助头 loss 是否出现 divergence。
- future_q 的工程等价性:原文未定义 future_q 具体是什么量,工程实现时需要自行设计。最保守的做法是用任务阶段分类(phase classification)代替——例如衣物折叠可分为"拎起→对折→压平→收尾"四阶段,用阶段预测作为 progress 的替代指标。
2.2 AWR + RECAP 集成关键点
AWR 的核心坑:
- AWR 是离线 RL 方法,依赖事先采集的动作质量数据。在竞赛场景下,数据来自仿真 rollout + HIL 补充。需要保证数据多样性:单一衣物颜色 / 单一初始姿态的数据会导致优势估计偏差。
- 优势函数
f(success, progress, future_q)的设计直接决定策略更新方向。如果 success 信号稀疏(大多数步骤都不是"成功"),优势估计会退化为 progress 的单调函数,导致策略在早期过度探索。
RECAP 的核心坑:
- RECAP(REward Conditioning with Advantage Prefatcher)的核心是用 reward conditioning 减少对稀疏奖励的依赖。工程上这意味着需要维护一个候选动作池(action candidate pool),用 advantage 预排序。
- 候选动作池的容量是工程超参:太大则 inference 延迟上升,太小则优选范围受限。对于 20 Hz 实机控制,建议池大小 ≤ 8。
2.3 sim-to-real 的三大工程陷阱
陷阱 1:相机内参对齐的累积误差
相机对齐工具(camera-alignment tooling)如果只做内参标定,在迁移到实机时会因为以下原因失效:
- 实机镜头存在机械应力,与仿真中的理论内参产生偏移(特别是腕部摄像头在运动后)
- 衣物颜色在实机中与仿真渲染差异大,光照模型不匹配会导致 success 预测失效
- 建议:每次实机部署前用标准色卡做一次 quick calibration,而非仅在初始化时标定一次
陷阱 2:仿真频率(30 Hz)与实机频率(20 Hz)的动作空间下采样
这是最容易忽视的坑。从 30 Hz 仿真训练数据迁移到 20 Hz 实机意味着:
- 训练时的每步动作持续时间(~33 ms)与实机执行时间(~50 ms)不一致
- 直接迁移会导致动作显得"迟缓"或"抖动"
- 解法:在实机部署时对动作预测做时间尺度归一化,或者在训练时随机下采样到 20 Hz 制造 domain variation
陷阱 3:衣物材质的物理仿真精度
IsaacSim 中的布料仿真精度有限,特别是:
- 湿摩擦系数(wet friction coefficient)与真实衣物差异大,仿真中"可折叠"的衣物在实机中可能因为抓取力度不对而滑落
- 折叠路径的鲁棒性高度依赖仿真物理参数,建议在仿真中做对抗性初始姿态扰动(±5 cm 随机位移,±15° 随机旋转)
2.4 实时失败检测的工程实现
原文用 threshold(success) 做实时失败检测。工程实现需要注意:
- 阈值敏感性:阈值太高会产生大量假阳性(正常动作被判定为失败),阈值太低则失去失败检测的预警作用。建议在仿真中做 ROC 曲线分析找到最优阈值。
- 恢复机制:检测到失败后系统需要执行恢复动作(如暂停、重新抓取)。恢复动作的策略也需要单独训练或用规则库实现,不能假设 VLA 网络能自动恢复。
- 异步失败检测:success 预测有延迟(需要等到动作执行后才有反馈),在 20 Hz 实机中意味着最多 50 ms 的决策延迟。对于快速失败场景(如衣物脱落),建议用 progress 的变化率做提前预警。
2.5 分布式训练管道的工程约束
HuggingFace Hub 协调异步分布式训练在竞赛级规模是可行的,但有以下约束:
- 模型同步频率:如果用 HF Model Hub 做模型同步,在网络不稳定环境(如实验室 Wi-Fi)下可能出现版本不一致。建议用分布式文件系统(如 JuiceFS)做本地缓存,HF Hub 仅做版本 tag 的发布。
- 仿真数据回传带宽:IsaacSim 生成的仿真数据(RGB 图像 + 关节状态)体积大,30 Hz × 3 摄像头 × 12 维动作 ≈ 每分钟数 GB。需要做帧间差分压缩或选择性存储(只存关键帧)。
- GPU 资源调度:VLA 网络训练需要 A100/H100 级别的 GPU,如果多节点并行,需要统一调度器(如 Slurm)管理,避免多节点同时写到同一个 HF repo 导致模型损坏。
2.6 Thompson Sampling 超参数调优的实用建议
- Thompson Sampling 在推理时做超参调优意味着每次 inference 都有随机性。在实机部署时,这会导致动作不可复现,不利于调试。
- 建议区分实验模式(开启 Thompson Sampling)与生产模式(使用确定性参数),不要在竞赛现场实时调参。
- Thompson Sampling 的收敛需要足够的采样次数(通常 > 100 次),如果竞赛只有有限次尝试机会,反而可能因为 exploration 降低成功率。
三、数字溯源核查表
| 声明 | 溯源状态 |
|---|---|
| 仿真轮第 1 / 实机轮第 2 | ⚠️ 存疑:来自摘要级描述,原始竞赛排行榜未独立核实 |
| 30 Hz 仿真 / 20 Hz 实机 | ✅ 合理:竞赛规则与设备手册支持此类规格 |
| 12 维关节动作空间 | ✅ 合理:双 6-DOF 臂规格一致 |
| 3 × RGB 摄像头 | ✅ 合理:竞赛规则一致 |
| AWR + RECAP 方法组合 | ✅ 方法有据:两者均为已有工作,论文自称借鉴 |
| π₀.₅ 来自 BEHAVIOR-1K | ⚠️ 需核:PI 团队背景吻合但完整引用链未确认 |
| 四种衣物类型 | ⚠️ 存疑:原文未明确 |
四、风险边界标注
- 可迁移性上限:本方案针对 SO-ARM101 双臂平台设计,换用其他平台(UR5、单臂等)需重训 VLA 网络,优势函数设计需相应调整。
- 数据依赖风险:竞赛环境数据(仿真 + HIL)不可公开获取,外部复现需要自行搭建仿真环境和数据采集流程。
- 方法完整性边界:策略即价值函数的设计在训练稳定性上存在未解决的耦合问题(优势估计误差会反向传播影响策略更新),这在竞赛短周期内可能不构成瓶颈,但在长期持续训练中是已知风险。