OpenWAM-Official/OpenWAM · 上手攻略

  • 仓库:OpenWAM-Official/OpenWAM
  • 链接:https://github.com/OpenWAM-Official/OpenWAM
  • 分类:机器人具身智能 · 世界动作模型
  • 作者:Tom
  • 更新:2026-09-09

是什么

OpenWAM 是一个开放的世界动作模型(World-Action Model, WAM)模块化研究栈,用于系统性地开发和比较世界模型 + 动作预测的联合方案。简单说:它把训练一个机器人策略(给定视频观测 → 输出动作)需要做的所有耦合决策(骨干网络、表示方式、训练策略、推理部署、评测基准)全部拆成可插拔的 Hydra 配置模块,让你可以在同一套代码下换着玩、对比着跑。

官方 2026-09-06 刚公开了全部代码、预训练权重(OpenWAM-α,518.5M 帧,约 6,400 小时 egocentric 数据),并已在 XPolicyLab 集成。


解决什么问题

当前训练机器人策略的方案往往是"紧耦合"——选定一个视频生成模型 + 一个数据集 + 一套动作头,改动任何一项都要重写大量代码。OpenWAM 把这些决策正交化:

  • 模型架构:DualSystem / SingleSystem / TriSystem 三种架构可选,分别对应不同的视频-动作注意力机制
  • 视频骨干:Wan2.2 系列(TI2V-5B / VACE-1.3B / I2V-14B-480P)、Cosmos-Predict2.5-2B、Cosmos3-Edge
  • 动作空间:统一 action_dim、proprioception 等配置
  • 数据集:LIBERO、RoboDojo、RoboCasa365、VLABench、EBench 等

这样研究者可以像搭乐高一样组合不同组件,系统性地做消融实验,找出哪块最重要。


快速安装

环境准备

# Python >= 3.10
conda create -n openwam python=3.10
conda activate openwam

# 或使用 venv
python3 -m venv .venv && source .venv/bin/activate

# PyTorch 2.7.1 + CUDA 12.8(推荐)
pip install torch==2.7.1 torchvision==0.22.1 torchaudio==2.7.1 \
  --index-url https://download.pytorch.org/whl/cu128

安装 OpenWAM

pip install -e .

⚠️ 注意:deepspeed 以源码分发形式安装,pip install 时需要 C 编译器(gcc)在 PATH 中,编译耗时约 5-10 分钟。

可选:Cosmos-Predict2.5 依赖

仅在使用 cosmos_predict25_2b 视频骨干时才需要:

git submodule update --init third_party/cosmos-predict2.5
bash scripts/install_cosmos_predict25.sh

该脚本会安装上游 cosmos 包、编译 transformer-engine(需要 CUDA toolkit + nvcc),然后自动恢复 OpenWAM 锁定的版本。


核心用法

1. 下载资源(交互式)

OpenWAM 提供交互式下载器,也支持命令行参数:

# 下载视频骨干
python scripts/download_assets/download_video_backbone.py
# 支持:Wan2.2-TI2V-5B、Wan2.1-VACE-1.3B、Cosmos-Predict2.5-2B、Cosmos3-Edge

# 下载评测数据集
python scripts/download_assets/download_benchmark_data.py
# 支持:LIBERO、RoboDojo、RoboCasa365、VLABench、EBench 等

# 下载 VLM 骨干(仅 tri_system 需要)
python scripts/download_assets/download_vlm_backbone.py
# 支持:Qwen3-VL-2B-Instruct

# 下载 OpenWAM-α 预训练权重
python scripts/download_assets/download_openwam_checkpoints.py
# 选择 OpenWAM-Alpha-Pretrain-Foundation-Model

下载后下载器会自动更新对应的 YAML 配置文件中的路径,无需手动编辑。

2. 快速训练(Debug 模式)

bash scripts/train.sh \
  dataloader=libero \
  model=dual_system \
  model/video_backbone=wan22_ti2v_5b \
  model.architecture.variant=joint_self_attn \
  model.architecture.attention_mask_mode=mutual \
  training.debug=true
  • training.debug=true:只跑 20 步,第 10 和 20 步保存 checkpoints,学习率恒定
  • 建议显存:8 × 80GB GPU(推荐配置)

正常训练时去掉 training.debug=true

bash scripts/train.sh \
  dataloader=libero \
  model=dual_system \
  model/video_backbone=wan22_ti2v_5b \
  model.architecture.variant=joint_self_attn \
  model.architecture.attention_mask_mode=mutual

3. 部署与推理测试

# 部署 checkpoint(会启动 WebSocket server)
bash scripts/deploy.sh <ckpt_dir_path>

# 单次推理测试
python scripts/inference_test/inference_single_test.py \
  --server ws://127.0.0.1:8848 --test --state-dim 10

# 连续推理测试
python scripts/inference_test/inference_continuous_test.py \
  --server ws://127.0.0.1:8848 --test --state-dim 10

⚠️ 注意:部署时默认开启 compile,首次推理编译时间较长,后续请求会快很多。

4. 从 OpenWAM-α 微调下游任务

# 下载 foundation checkpoint
python scripts/download_assets/download_openwam_checkpoints.py
# 选择:OpenWAM-Alpha-Pretrain-Foundation-Model

# 以 LIBERO 为例微调
bash scripts/train.sh \
  dataloader=libero \
  training.finetune_ckpt_path=/path/to/OpenWAM-Alpha-Pretrain-Foundation-Model

5. 配置体系(Hydra YAML)

OpenWAM 用 Hydra 管理所有配置,核心配置树:

configs/
├── train.yaml                  # 顶层:选择 model group 和 dataloader group
├── model/
│   ├── dual_system.yaml        # 双系统架构(视频+动作联合)
│   ├── single_system.yaml      # 单系统架构
│   ├── tri_system.yaml         # 三系统架构(视频+动作+VLM)
│   ├── video_backbone/        # 视频骨干:wan22_ti2v_5b, cosmos_predict25_2b 等
│   ├── vlm_backbone/          # VLM 骨干:qwen3_vl_2b(仅 tri_system)
│   └── action_backbone/        # 动作骨干:separate_action_dit / shared_action_backbone
└── dataloader/
    ├── libero.yaml
    ├── robotwin.yaml
    └── ...

典型适用场景

  1. 机器人具身智能研究者:系统性地对比不同视频骨干( Wan vs Cosmos)、不同架构(Dual vs Tri)、不同注意力机制的策略效果
  2. VLA(Vision-Language-Action)模型微调:利用 OpenWAM-α 的 6,400 小时预训练权重,在 LIBERO 等下游任务上微调
  3. 评测基准集成:接入 RoboDojo / RoboCasa365 / VLABench 等标准化评测环境
  4. 世界模型 + 动作学习耦合研究:研究视频预测与动作预测的耦合/解耦策略

坑与注意

坑点 说明
80GB VRAM 起步 推荐 8 × 80GB GPU;training.debug=true 也需要约 24GB 单卡
deepspeed 编译 pip install 时 gcc 必须在 PATH;Windows 用户建议用 WSL2
Cosmos 依赖复杂 cosmos_predict25_2b 需要 nvcc + CUDA toolkit,且脚本会自动覆盖包版本
首次推理慢 deploy.sh 默认开启 compile,首次推理可能需要 2-5 分钟
action_dim 必须对齐 dataloader 的动作维度必须与架构的 action_dim 匹配,否则训练报错
SyncTeX 仅 BusyTeX 支持 SyncTeX 反向跳转(PDF → 源码)只在 BusyTeX 引擎下可用
Python 3.10+ 不支持 Python 3.9 及以下

与同类对比

OpenWAM Open X-Embodiment (OXE) RT-2/PaLM-E
定位 模块化研究框架 机器人数据联盟 端到端 VLA 模型
灵活性 ✅ 高度可配置 数据为主 模型固定
视频骨干 Wan/Cosmos 多选 无(数据格式) 固定 ViT
预训练权重 ✅ OpenWAM-α
架构种类 Dual/Single/Tri 单一
Hydra 配置
适合人群 具身智能研究者 数据集用户 直接部署用户

一句话推荐结论

OpenWAM 是目前最系统的世界动作模型模块化研究框架,刚发布的 OpenWAM-α 提供了难得的 6,400 小时预训练权重,推荐所有做机器人 VLA / 世界模型研究的人先跑一遍 Quick Start 感受其配置灵活性。