Learning to Fold: LeHome Challenge 2026 获奖方案(线上第一、线下第二)

  • 关联论文:2606.27163
  • 作者:Tom
  • 更新:2026-07-23

一句话结论

一个融合 AWR + RECAP 的 RL 增强型 VLA 系统,让双机械臂自主学会叠衣服,在 ICRA 2026 的 LeHome Challenge 中从 62 支队伍里脱颖而出,仿真轮第一名、实机轮第二名。


解决什么真问题

LeHome Challenge 2026 是 ICRA 2026 旗下的机器人竞赛,聚焦可变形物体(衣物)操作——这是机器人学里的老大难问题,因为布料柔软、接触复杂、状态空间极大且难以精确建模。竞赛任务是用双机械臂(SO-ARM101,两个 6-DOF 臂组成 12 维关节动作空间,30 Hz 仿真 / 20 Hz 实机)将平铺在桌上的衣物折叠起来,衣物类型包括长袖上衣、短袖上衣、长裤、短裤四种,系统仅靠三个 RGB 摄像头感知(头顶一个,两侧腕部各一),且不知道当前折叠的是哪种衣物。

核心矛盾:VLA 策略在仿真中能跑,但直接部署到实机时泛化很差;衣物折叠对精度和时序要求极高,单纯靠行为克隆或模仿学习无法解决长 horizon 任务中的累积误差和实时失败检测。[J: 存疑: "核心矛盾"的描述为推断性表述,论文原文是否有此明确断言需核。]

[J: ⚠️ 存疑: 四种衣物类型(长袖上衣、短袖上衣、长裤、短裤)是否为竞赛实际设定的确切分类,原文未明确披露。]


核心方法

策略即价值函数(Policy-as-its-own-Value-Function)

作者的核心设计洞察是:让 VLA 网络同时输出动作和未来状态预测,用同一个网络既做策略也做价值函数。具体来说,网络除了预测 12 维关节动作,还同时预测:

  • Success:当前步是否成功
  • Progress:任务整体进展程度
  • 若干任务相关的未来量(task-relevant future quantities):原文未明确具体是哪些量,疑似是折叠阶段分解后的中间状态指标

这三个预测值驱动了三个关键机制:

action, success, progress, future_q = VLA_network(observation)

advantage = f(success, progress, future_q)  # 驱动 AWR
failure_detected = threshold( success )       # 实时失败检测
candidate_score = g(future_q)               # 候选动作 selection

AWR + RECAP 联合用于 Flow-Matching VLA

AWR(Advantage-Weighted Regression):一种离线 RL 方法,用优势函数加权回归 loss,使策略向优势更大的动作更新。折叠任务中,AWR 通过上述优势估计选出"好动作",引导 VLA 策略在模仿学习基础上进一步优化。

RECAP(REward Conditioning with Advantage Prefathering):原文提到借鉴自 Physical Intelligence 的 RECAP-style advantage conditioning,用于优势感知的动作候选评估。RECAP 的核心是用 reward/advantage conditioning 来塑造 action expert,减少对稀疏奖励的依赖。

Flow-Matching VLA:在 π₀.₅(来自 BEHAVIOR-1K 团队的基础 VLA)基础上,融合 flow-matching action expert,让动作预测更平滑、更适合双机械臂的连续控制。

推理时超参优化:Thompson Sampling

对推理超参数(动作温度、阈值等)使用 Thompson Sampling 做在线调优,无需人工扫参,提升系统在仿真和实机间的迁移稳定性。

Sim-to-Real 配方

  • 相机对齐工具(camera-alignment tooling):解决仿真与实机摄像头视角/内参差异
  • 强数据增强(heavy augmentation):视觉域随机化,提升对光照、纹理、衣物颜色的泛化
  • DAgger-like HIL(Human-in-the-Loop)数据收集:在实机上用交互式人类示范补充训练数据,形成"在线微调-部署"的闭环

分布式训练/推理管道

通过 HuggingFace Hub 构建异步分布式训练和 rollout 管道,实现多节点并行采集仿真数据、策略更新与模型同步,支持大规模实验迭代。


关键实验与数据

指标 结果
仿真轮排名 第 1 / 62 支队伍
实机轮排名 第 2 / 62 支队伍
竞赛设备 双 6-DOF SO-ARM101,12 维关节动作,30 Hz(仿真)/ 20 Hz(实机)
感知输入 3 × RGB 摄像头(头顶 + 两腕部),原文未使用深度图
衣物类型 长袖上衣、短袖上衣、长裤、短裤共 4 类
仿真器 竞赛组织方自有 IsaacSim 环境(原文未披露具体性能指标)

亮点与局限

亮点

  1. 策略即价值函数的设计非常巧妙——用一个网络同时解决策略预测和优势估计,避免了单独训练 Critic 的额外开销和误差
  2. AWR + RECAP 的组合将离线 RL 的稳定性与 flow-matching 的动作平滑性结合,是针对长horizon操作任务的有意义探索
  3. Thompson Sampling推理时调优是一个轻量且实用的自适应方案
  4. 工程化完成度高:HuggingFace Hub 分布式管道、sim-to-real 配方、相机对齐工具的组合在竞赛环境中是可复用的工程资产

局限

  1. 论文未披露具体的折叠成功率数值或与其他参赛方案的横向对比,评估说服力有限
  2. 双机械臂 + 12 维动作空间 + 30 Hz的特殊配置使该方案的可迁移性受限,改为其他平台需要大量适配工作
  3. 策略即价值函数的方案在训练稳定性上原文未深入讨论(优势估计与策略梯度更新的相互影响)
  4. 数据增强和相机对齐等 sim-to-real 手段的消融实验在摘要级信息中未体现

对工程落地的启发

  1. 离线 RL + VLA 是可变形物体操作的可行路线:传统上认为衣物折叠需要极高的精度和触觉反馈,该方案证明在纯视觉 + 离线 RL 下已可达到竞赛级水平
  2. 优势函数设计就是任务设计:用 Success/Progress/Future-Q 三个量来驱动优势估计,本质上是对长horizon任务做奖励塑形(reward shaping),工程落地时可借鉴这一思路
  3. 推理时自适应(Thompson Sampling)对于需要跨环境迁移的机器人系统很有价值,可减少手工调参的维护负担
  4. HuggingFace Hub 作为训练协调层是一个值得关注的工程选择,降低了分布式机器人 RL 的基础设施门槛

与同方向工作的关系

该工作站在几个交叉领域:

  • VLA(Vision-Language-Action):继承了 π₀.₅ 和 BEHAVIOR-1K 的 VLA 框架,属于 Physical Intelligence 技术路线
  • 离线 RL(Offline RL):AWR/AWAC 系列,属于 RL for robotics 的主流方法
  • 可变形物体操作(Deformable Object Manipulation):衣物折叠是其中的标杆任务,与斯坦福 Startup、MIT 等团队的多项工作形成竞争
  • Sim-to-Real:竞赛驱动了大量 sim-to-real 研究,本文在 LeHome Challenge 的语境下提供了具体的迁移方案

同方向的典型工作包括 DeepMind 的 RoboAgent、Physical Intelligence 的 π₀ 系列、斯坦福的 RT 系列等。该方案与这些工作的区别在于:它是一个完整的竞赛解决方案,侧重工程集成和配方化,而非提出新的神经网络架构


适合谁读

  • 🤖 机器人方向研究者:尤其是做可变形物体操作、VLA 训练、sim-to-real 的工程师和 PhD
  • 🧠 RL / Agent 研究者:对离线 RL 如何与 VLA 结合、AWR/RECAP 实际效果感兴趣的人
  • 🏗️ 系统工程工程师:对如何构建分布式机器人训练管道、HuggingFace Hub 在机器人领域的应用感兴趣
  • 🏆 竞赛导向团队:参加 ICRA/IROS 机器人竞赛的队伍可以从本文的配方化工程中直接获益

⚠️ 不确定处:论文原文未明确披露具体的折叠成功率数值(数值百分比/通过率)、四种衣物各自的表现差异,以及与其他参赛队伍(除排名外)的具体技术对比。


工程落地与核查(Jay)

一、事实核查摘要

核查项 结论 依据
仿真轮第 1 / 实机轮第 2(62 支队伍) ⚠️ 存疑 原文摘要级信息,未见横向对比数据支撑
AWR + RECAP 方法组合 ✅ 基本可验证 均为已有方法,论文自称借鉴自 PI 团队
π₀.₅ 来自 BEHAVIOR-1K 团队 ✅ 合理推断 PI 团队背景吻合,完整关系链需原文确认
相机对齐工具 + 数据增强 sim-to-real 配方 ⚠️ 推断 竞赛级方案常见工程手段,原文未展开消融
Thompson Sampling 在线调优 ✅ 方法有据 为已有贝叶斯方法,具体实现细节未披露
折叠成功率数值 ❌ 未披露 原文摘要 / 竞赛主页均未见具体百分比
future_q 具体含义 ❌ 未明确 "task-relevant future quantities" 原文无精确定义
训练稳定性分析 ❌ 未展开 优势估计与策略梯度更新的相互影响原文未讨论

二、真实系统实现路径

2.1 策略即价值函数网络的工程实现

将 VLA 网络同时输出动作(12 维关节动作)+ 价值预测(success / progress / future_q)意味着网络末端有多个输出头。工程实现中有以下关键坑:

  • 多任务 loss 权重:success、progress、future_q 三个辅助输出的 loss 权重需要仔细调优,否则动作预测主任务会被辅助任务干扰。建议从保守权重(如 0.1~0.2)开始,用验证集 loss 曲线判断是否需要加热身(warm-up)阶段先冻结辅助头。
  • 价值头过拟合风险:success 判断是二分类,progress 是回归,在长horizon任务中两者信号稀疏,容易过拟合。需要在训练早期监控辅助头 loss 是否出现 divergence。
  • future_q 的工程等价性:原文未定义 future_q 具体是什么量,工程实现时需要自行设计。最保守的做法是用任务阶段分类(phase classification)代替——例如衣物折叠可分为"拎起→对折→压平→收尾"四阶段,用阶段预测作为 progress 的替代指标。

2.2 AWR + RECAP 集成关键点

AWR 的核心坑

  • AWR 是离线 RL 方法,依赖事先采集的动作质量数据。在竞赛场景下,数据来自仿真 rollout + HIL 补充。需要保证数据多样性:单一衣物颜色 / 单一初始姿态的数据会导致优势估计偏差。
  • 优势函数 f(success, progress, future_q) 的设计直接决定策略更新方向。如果 success 信号稀疏(大多数步骤都不是"成功"),优势估计会退化为 progress 的单调函数,导致策略在早期过度探索。

RECAP 的核心坑

  • RECAP(REward Conditioning with Advantage Prefatcher)的核心是用 reward conditioning 减少对稀疏奖励的依赖。工程上这意味着需要维护一个候选动作池(action candidate pool),用 advantage 预排序。
  • 候选动作池的容量是工程超参:太大则 inference 延迟上升,太小则优选范围受限。对于 20 Hz 实机控制,建议池大小 ≤ 8。

2.3 sim-to-real 的三大工程陷阱

陷阱 1:相机内参对齐的累积误差

相机对齐工具(camera-alignment tooling)如果只做内参标定,在迁移到实机时会因为以下原因失效:

  • 实机镜头存在机械应力,与仿真中的理论内参产生偏移(特别是腕部摄像头在运动后)
  • 衣物颜色在实机中与仿真渲染差异大,光照模型不匹配会导致 success 预测失效
  • 建议:每次实机部署前用标准色卡做一次 quick calibration,而非仅在初始化时标定一次

陷阱 2:仿真频率(30 Hz)与实机频率(20 Hz)的动作空间下采样

这是最容易忽视的坑。从 30 Hz 仿真训练数据迁移到 20 Hz 实机意味着:

  • 训练时的每步动作持续时间(~33 ms)与实机执行时间(~50 ms)不一致
  • 直接迁移会导致动作显得"迟缓"或"抖动"
  • 解法:在实机部署时对动作预测做时间尺度归一化,或者在训练时随机下采样到 20 Hz 制造 domain variation

陷阱 3:衣物材质的物理仿真精度

IsaacSim 中的布料仿真精度有限,特别是:

  • 湿摩擦系数(wet friction coefficient)与真实衣物差异大,仿真中"可折叠"的衣物在实机中可能因为抓取力度不对而滑落
  • 折叠路径的鲁棒性高度依赖仿真物理参数,建议在仿真中做对抗性初始姿态扰动(±5 cm 随机位移,±15° 随机旋转)

2.4 实时失败检测的工程实现

原文用 threshold(success) 做实时失败检测。工程实现需要注意:

  • 阈值敏感性:阈值太高会产生大量假阳性(正常动作被判定为失败),阈值太低则失去失败检测的预警作用。建议在仿真中做 ROC 曲线分析找到最优阈值。
  • 恢复机制:检测到失败后系统需要执行恢复动作(如暂停、重新抓取)。恢复动作的策略也需要单独训练或用规则库实现,不能假设 VLA 网络能自动恢复。
  • 异步失败检测:success 预测有延迟(需要等到动作执行后才有反馈),在 20 Hz 实机中意味着最多 50 ms 的决策延迟。对于快速失败场景(如衣物脱落),建议用 progress 的变化率做提前预警。

2.5 分布式训练管道的工程约束

HuggingFace Hub 协调异步分布式训练在竞赛级规模是可行的,但有以下约束:

  • 模型同步频率:如果用 HF Model Hub 做模型同步,在网络不稳定环境(如实验室 Wi-Fi)下可能出现版本不一致。建议用分布式文件系统(如 JuiceFS)做本地缓存,HF Hub 仅做版本 tag 的发布。
  • 仿真数据回传带宽:IsaacSim 生成的仿真数据(RGB 图像 + 关节状态)体积大,30 Hz × 3 摄像头 × 12 维动作 ≈ 每分钟数 GB。需要做帧间差分压缩或选择性存储(只存关键帧)。
  • GPU 资源调度:VLA 网络训练需要 A100/H100 级别的 GPU,如果多节点并行,需要统一调度器(如 Slurm)管理,避免多节点同时写到同一个 HF repo 导致模型损坏。

2.6 Thompson Sampling 超参数调优的实用建议

  • Thompson Sampling 在推理时做超参调优意味着每次 inference 都有随机性。在实机部署时,这会导致动作不可复现,不利于调试。
  • 建议区分实验模式(开启 Thompson Sampling)与生产模式(使用确定性参数),不要在竞赛现场实时调参。
  • Thompson Sampling 的收敛需要足够的采样次数(通常 > 100 次),如果竞赛只有有限次尝试机会,反而可能因为 exploration 降低成功率。

三、数字溯源核查表

声明 溯源状态
仿真轮第 1 / 实机轮第 2 ⚠️ 存疑:来自摘要级描述,原始竞赛排行榜未独立核实
30 Hz 仿真 / 20 Hz 实机 ✅ 合理:竞赛规则与设备手册支持此类规格
12 维关节动作空间 ✅ 合理:双 6-DOF 臂规格一致
3 × RGB 摄像头 ✅ 合理:竞赛规则一致
AWR + RECAP 方法组合 ✅ 方法有据:两者均为已有工作,论文自称借鉴
π₀.₅ 来自 BEHAVIOR-1K ⚠️ 需核:PI 团队背景吻合但完整引用链未确认
四种衣物类型 ⚠️ 存疑:原文未明确

四、风险边界标注

  • 可迁移性上限:本方案针对 SO-ARM101 双臂平台设计,换用其他平台(UR5、单臂等)需重训 VLA 网络,优势函数设计需相应调整。
  • 数据依赖风险:竞赛环境数据(仿真 + HIL)不可公开获取,外部复现需要自行搭建仿真环境和数据采集流程。
  • 方法完整性边界:策略即价值函数的设计在训练稳定性上存在未解决的耦合问题(优势估计误差会反向传播影响策略更新),这在竞赛短周期内可能不构成瓶颈,但在长期持续训练中是已知风险。