机器人策略练到 99% 不算数,真机那一刻才会"原形毕露"——arXiv 2607.04434 把仿真和真机焊在了一起
- 关联论文:2607.04434
如果你做过机器人策略训练,2026 年你大概率被这件事折磨过——
你在 Isaac Sim 里把策略训到了 99% 成功率,搬上真机直接腰斩到 40%。不是你的代码有问题,是仿真和真机之间那道隐形的墙一直没被系统量化过。
更头疼的是:业内根本没有统一基准。有的用 RLBench、有的用 LIBERO、有的干脆自造场景——同一篇论文,N 个实验室跑出 N 种数字,根本没法横向比。
arXiv 2607.04434(RoboDojo) 这篇做的就是这件事:把"仿真一把尺、真机一把尺"焊成同一把。
一句话 TL;DR
- 问题:通用机器人操作策略缺乏仿真-真机统一的评测基准,sim-to-real gap 无法系统度量。
- 方案:RoboDojo = XPolicyLab(统一策略集成接口) + RoboDojo-Sim(42 任务仿真) + RoboDojo-RealEval(18 任务真机远程云访问),五维评估(泛化 / 记忆 / 精度 / 长 horizon / 开放词汇指令)。
- 规模:集成 30 种 通用机器人策略到统一排行榜,覆盖仿真与真机双环境。
- 意义:第一次让"仿真通过 ≠ 真机通过"这件事可度量、可复现、可横向比较。
为什么对机器人团队特别重要
过去三年,机器人基础模型(VLA、π 系列)的论文几乎都在卷"我能在 5 个任务上做到 90%+"——但工程痛点不在分数,在分布外:
- 没训过的物体/场景能泛化吗?(泛化性)
- 8 步任务做到第 5 步会飘吗?(长 horizon)
- "把蓝色杯子递给张三"它真的听得懂吗?(开放词汇指令)
更要命的是:仿真通过、真机失败这件事,每个实验室都自圆其说——你没法判定到底是策略不行、还是仿真器参数不准、还是评测脚本不对。
RoboDojo 的关键设计是:让 XPolicyLab 把策略统一集成一次,仿真真机同跑同一接口,出同一个排行榜。
这篇到底干了什么(用人话讲)
1. XPolicyLab:策略只写一份,仿真真机都能跑
传统流程:每个实验室为了适配不同 benchmark,要把同一份策略改 N 遍。XPolicyLab 提供统一注册接口——只要你的策略暴露 reset / evaluate / get_action 三个方法,适配一次,仿真能跑、真机也能跑。
现实价值:集成成本从 N 次压到 1 次,评测可比性指数级提升。
2. RoboDojo-Sim:42 任务、五维度评估
仿真层跑在 Isaac Sim 上,覆盖五个评估维度——它们对应真实部署里五种典型失败模式:
| 维度 | 测什么 |
|---|---|
| 泛化 | 没见过的物体/场景/指令 |
| 记忆 | 跨 episode 信息保持 |
| 精度 | 精细操作成功率 |
| 长 horizon | 多步骤全流程完成 |
| 开放词汇指令 | 自然语言泛化到开放集合 |
3. RoboDojo-RealEval:远程云真机评测
最大工程亮点:真机评测不再需要本地机器人。
云端统一规格真机平台(机械臂、末端、传感器全部标准化),远程提交评测、拿到 JSON 结果。这意味着——小团队也能做真机评测;结果完全可复现(同硬件、同场景、同 reset 协议)。
4. 30 种策略进榜
已集成 30 种 通用策略到公开 Leaderboard,所有人可以根据五个维度找自己模型的短板。
为什么这件事"现在"特别重要
2026 下半年机器人行业正在发生一件事:simulation-only 的论文越来越难发。
原因——投资人、同行、审稿人都被"仿真 99% / 真机 40%"骗过太多次。RoboDojo 把这个差距第一次放到统一基准下度量,等于让所有 VLA 论文必须"亮真机分"。
对正在选型 foundation model 的工程团队,RoboDojo 排行榜会成为新的"刷榜战场"。
工程落地的现实门槛
不是零成本落地。三个真门槛:
- Isaac Sim 许可:依赖 NVIDIA Isaac Sim,学术许可免费但功能受限;企业版按 GPU 节点收费。
- 真机接入:RoboDojo-RealEval 要求接入真机满足标准化硬件规格,不满足需适配。
- 资源排队:云端真机有限,高并发需预约。
最关键的判断:RoboDojo 不是"又一个刷榜 benchmark",它是让 sim-to-real gap 从"凭感觉"变成"打分"——这件事对整个机器人行业的基础设施价值远超 30 个任务本身。