无需微调:VLM 调度层填平"编排差距",真实机器人 16.7% → 97.3% · 干货攻略
- 链接: https://x.com/tri_dao/status/2082175796710658210
- 分类: x-tips
- 来源: X @tri_dao
- 作者: Jay
- 更新: 2026-08-19
- 仓库: lianegalanti/Pigey
这是什么
Pigey(Physical Agency orchestrator)是一个闭环 VLM 调度层,驱动已有的冻结机器人技能(frozen skills),无需任何新数据或微调,即可在仿真和真实机器人上大幅提升推理密集型任务的成功率。
核心论文:"Addressing the Orchestration Gap in Generalist Robots via Physical Agency",arXiv:2607.21725,作者:Liane Galanti(Princeton)、Dhruv Shah、T ri Dao(Together AI),2026 年 7 月提交。
一句话概括其核心主张:大多数"缺技能"本质上是缺调度——把模型权重冻住不动,只换推理时的编排流程,就能让同一套技能发挥出数倍实力。 这个差距,论文称之为"编排差距"(Orchestration Gap)。
为什么值得关注
谁分享的
@tri_dao(Flash Attention 作者、Together AI 首席科学家)在 X 上发帖,用两个具体数字引爆关注: - 真实机器人(Franka FR3):16.7% → 97.3% - 仿真(LIBERO-PRO):12.8% → 53.3%
原帖称"无需额外训练,4× SOTA",并表示效果让他自己都很惊讶。
解决什么问题
传统 VLA(Vision-Language-Action)路线试图把所有能力——感知、世界知识、规划、成功检测、恢复、低层控制——都压缩进一个大模型靠预训练解决。Pigey 的反直觉发现是:这些能力天然可以解耦,分别由不同模块负责更高效。
论文把机器人技能分为两类: - System 1(快、专用):TAMP(Task and Motion Planning)负责刚性物体抓取放置,π0.5 VLA 负责柔体操作和恢复动作 - System 2(慢、通才):VLM 负责任务级推理——规划、子目标分解、成功验证、失败恢复
冻结两类技能,VLM 当调度员跑闭环,即可在零新训练前提下实现 4 倍收益。
核验过程
官方来源(arXiv + GitHub + 项目主页)
| 来源 | URL | 核验结论 |
|---|---|---|
| arXiv 论文摘要 | https://arxiv.org/abs/2607.21725 | ✅ 确认:LIBERO-PRO 12.8%→53.3%,真实机器人 near-zero→90%+,核心方法与结论 |
| GitHub README | https://github.com/lianegalanti/Pigey | ✅ 确认:代码结构(real/ + sim/ 两套实现)、硬件配置、依赖项(openpi、TiPToP、DROID)、LLM 支持列表 |
| 项目主页 | https://lianegalanti.github.io/Pigey/ | ✅ 确认:完整分项数据表(按能力类别划分)、演示视频、完整结果表格 |
官方 GitHub README 中的关键信息摘录(已逐条核验):
- 真实机器人硬件:Franka Research 3 + Robotiq 2F-85 夹爪 + ZED 2i(第三人称)+ ZED-Mini(腕部)
- 两套实现:real/(TypeScript/Bun,Franka FR3)、sim/(Python,LIBERO 仿真)
- LLM 验证列表:Claude Opus 4.7、Sonnet 4.6、Haiku 4.5、Fable 5、Gemini 3.1 Pro、GPT-5-mini——均为 LiteLLM 兼容
- 上游依赖:openpi(π0.5 策略服务)、TiPToP(TAMP: 感知+cuRobo规划+抓取预测)、DROID(相机+Franka 封装)、LIBERO-PRO(仿真 benchmark)
官方论文/arXiv HTML 中的完整分项数据(已核验):
真实机器人 Franka FR3 能力拆解:
| 能力类别 | π0.5 直接 | TiPToP(开环) | Pigey(闭环) |
|---|---|---|---|
| 简单抓放 | 95% | 80% | 100% |
| 世界知识 | 0% | 90% | 100% |
| 条件逻辑 | 0% | 95% | 100% |
| 多步推理 | 0% | 25% | 100% |
| 空间推理 | 20% | 75% | 100% |
| 障碍/安全推理 | 0% | 0% | 90% |
| 错误恢复 | 10% | 0% | 90% |
| 长时记忆 | 0% | 0% | 100% |
| 总体 | 16.7% | 48.7% | 97.3% |
LIBERO-PRO 仿真 benchmark:
| 方法 | 平均成功率 |
|---|---|
| π0-LIBERO | 0% |
| π0.5-LIBERO(冻结) | 12.8% |
| CaP-Agent0 | 18.2% |
| Pigey(冻结,同权重) | 53.3% |
交叉验证
- arXiv HTML 全文(2607.21725v1)与项目主页数据完全一致
- GitHub README 声明"所有公开",代码链接了全部上游依赖
- Tri Dao X 帖中的数字(真实机器人 16.7%→97.3%、LIBERO-PRO 12.8%→53.3%)全部在论文 Table 2 和 Table 3 中有据可查,与 FAEA 攻略(2026-07-31)的"数字冲突"问题不同——此处数字完全匹配,无需降级处理
⚠️ 不确定处
- 代码完整度:GitHub README 说明"All public. Install each upstream first; this repo is the glue on top."——Pigey 本身是胶水代码,真正的 VLM 推理能力依赖 Claude Opus 4.7 等商业 API,读者需要自备 API key
- π0.5 权重获取:sim 使用 pi05_libero(可通过 openpi docs 获取),real 使用 pi05_droid(存放于 Google Cloud Storage,需科学访问),权重获取有一定门槛
上手步骤
仿真环境(推荐先跑这个)
前置依赖:
# 克隆 Pigey
git clone https://github.com/lianegalanti/Pigey
cd Pigey
# 安装上游(各自 README 有详细说明)
# openpi(π0.5 策略服务): https://github.com/Physical-Intelligence/openpi
# TiPToP(TAMP 仿真): https://github.com/tiptop-robot/tiptop
# LIBERO-PRO: https://github.com/Zxy-MLlab/LIBERO-PRO
启动 π0.5 策略服务器(Python,GPU 机器):
# 见 openpi 仓库的 launch.py
python openpi/projects/openpi/launch.py \
--policy pi05_libero \
--checkpoint <下载的权重路径> \
--port 8000
运行仿真评估:
# 需要同时启动 TAMP 服务器(见 TiPToP 文档)
export ANTHROPIC_API_KEY="your-key-here" # 或 GEMINI_API_KEY / OPENAI_API_KEY
export GEMINI_API_KEY="your-key-here" # Gemini Robotics ER 感知用
python agent_sim.py \
--mode harness \
--suite libero_goal_task \
--task 0 --episode 2 \
--policy-host localhost --policy-port 8000 \
--model gemini/gemini-3.5-flash \
--max-llm-steps 35 \
--max-steps-per-rollout 500 \
--out-dir results/
真实机器人环境(高门槛)
硬件要求: Franka Research 3 + Robotiq 2F-85 + ZED 2i + ZED-Mini + Blackwell/B300 GPU
启动流程:
# 1. 启动 π0.5 策略服务器(pi05_droid 权重)
python openpi/projects/openpi/launch.py \
--policy pi05_droid \
--checkpoint gs://openpi-assets/checkpoints/pi05_droid \
--port 8000
# 2. 启动 TAMP 服务器
# 见 TiPToP 文档,监听 :7777
# 3. 设置环境变量并运行
export ANTHROPIC_API_KEY="your-key-here"
export TAMP_URL=http://<workstation>:7777
export DROID_HOST=<workstation>
export PI0_URL=ws://<workstation>:8000
bun agent.ts "pick up the cup and put it in the basket"
可选环境变量(调整行为):
export AGENT_MAX_STEPS=50 # 最大步数上限
export AGENT_FAIL_LIMIT=3 # 允许失败重试次数
export AGENT_LLM_TIMEOUT_MS=30000 # LLM 单步超时(毫秒)
export AGENT_SKIP_WRIST_REC=1 # 跳过腕部摄像头(节省带宽)
核心架构一览
用户指令 ("pick up the cup...")
│
▼
┌─────────────────────────────┐
│ VLM Orchestrator (Pigey) │ ← TypeScript/Bun(real)或 Python(sim)
│ Claude Opus 4.7 / Gemini │ 闭环: 观察 → 推理 → 选工具 → 验证
└──────────┬──────────────────┘
│
┌──────┼──────┐
▼ ▼ ▼
TAMP DROID π0.5
Server Server Policy
(:7777) (:9876) (:8000/ws)
│ │ │
▼ ▼ ▼
感知+ 相机+ VLA 动作
cuRobo 状态 生成
规划
坑与适用边界
⚠️ 限制(论文原文明确说明)
- 硬件门槛极高:真实机器人需要 Franka Research 3、多相机 rig、Blackwell/B300 GPU,普通研究者几乎无法复现
- 依赖多个上游系统:需要正确配置 openpi + TiPToP + DROID 三个服务,外加商业 LLM API,任何一环出错都会导致系统不可用
- VLM 是瓶颈:所有步进推理都经过 LLM,延迟高(论文中 real-robot 任务有视频可见实时性有限),不适合需要毫秒级控制的精细操作
- API 成本:使用 Claude Opus 4.7 等大模型进行每步推理,在长时任务中可能产生大量 API 调用费用
- π0.5 权重需申请:real 模式使用的 pi05_droid 权重存于 GCS,非开源直接下载
适用场景
✅ 有 GPU 集群和机器人硬件的研究团队,验证"编排差距"假说
✅ 仿真环境中快速评测 VLM 的机器人任务规划能力
✅ 作为 VLA 微调的替代方案:用 Agentic Pipeline 挖掘现有冻结策略的潜力
不适用场景
❌ 个人开发者或小团队(无机器人硬件+无高配 GPU)
❌ 需要实时毫秒级控制的精细操作任务
❌ 期望开箱即用、零配置跑起来的场景
一句话结论
Pigey 用实验证明了一个反直觉命题:机器人缺的不是更好的策略,而是更好的调度——把 VLM 当调度员套在冻结的技能上,无需任何新训练就能把同一套权重从 12.8% 推到 53.3%(仿真)和 97.3%(真机),"编排差距"这个概念本身比具体数字更有长期价值。
论文引用:
bibtex @article{galanti2026addressing, title={Addressing the Orchestration Gap in Generalist Robots via Physical Agency}, author={Galanti, Liane and Shah, Dhruv and Dao, Tri}, journal={arXiv preprint arXiv:2607.21725}, year={2026} }核心链接: - 论文:https://arxiv.org/abs/2607.21725 - 项目主页:https://lianegalanti.github.io/Pigey/ - 代码:https://github.com/lianegalanti/Pigey - X 原帖(@tri_dao):https://x.com/tri_dao/status/2082175796710658210