无需微调:VLM 调度层填平"编排差距",真实机器人 16.7% → 97.3% · 干货攻略

  • 链接: https://x.com/tri_dao/status/2082175796710658210
  • 分类: x-tips
  • 来源: X @tri_dao
  • 作者: Jay
  • 更新: 2026-08-19
  • 仓库: lianegalanti/Pigey

这是什么

Pigey(Physical Agency orchestrator)是一个闭环 VLM 调度层,驱动已有的冻结机器人技能(frozen skills),无需任何新数据或微调,即可在仿真和真实机器人上大幅提升推理密集型任务的成功率。

核心论文:"Addressing the Orchestration Gap in Generalist Robots via Physical Agency",arXiv:2607.21725,作者:Liane Galanti(Princeton)、Dhruv Shah、T ri Dao(Together AI),2026 年 7 月提交。

一句话概括其核心主张:大多数"缺技能"本质上是缺调度——把模型权重冻住不动,只换推理时的编排流程,就能让同一套技能发挥出数倍实力。 这个差距,论文称之为"编排差距"(Orchestration Gap)。


为什么值得关注

谁分享的

@tri_dao(Flash Attention 作者、Together AI 首席科学家)在 X 上发帖,用两个具体数字引爆关注: - 真实机器人(Franka FR3):16.7% → 97.3% - 仿真(LIBERO-PRO):12.8% → 53.3%

原帖称"无需额外训练,4× SOTA",并表示效果让他自己都很惊讶。

解决什么问题

传统 VLA(Vision-Language-Action)路线试图把所有能力——感知、世界知识、规划、成功检测、恢复、低层控制——都压缩进一个大模型靠预训练解决。Pigey 的反直觉发现是:这些能力天然可以解耦,分别由不同模块负责更高效。

论文把机器人技能分为两类: - System 1(快、专用):TAMP(Task and Motion Planning)负责刚性物体抓取放置,π0.5 VLA 负责柔体操作和恢复动作 - System 2(慢、通才):VLM 负责任务级推理——规划、子目标分解、成功验证、失败恢复

冻结两类技能,VLM 当调度员跑闭环,即可在零新训练前提下实现 4 倍收益。


核验过程

官方来源(arXiv + GitHub + 项目主页)

来源 URL 核验结论
arXiv 论文摘要 https://arxiv.org/abs/2607.21725 ✅ 确认:LIBERO-PRO 12.8%→53.3%,真实机器人 near-zero→90%+,核心方法与结论
GitHub README https://github.com/lianegalanti/Pigey ✅ 确认:代码结构(real/ + sim/ 两套实现)、硬件配置、依赖项(openpi、TiPToP、DROID)、LLM 支持列表
项目主页 https://lianegalanti.github.io/Pigey/ ✅ 确认:完整分项数据表(按能力类别划分)、演示视频、完整结果表格

官方 GitHub README 中的关键信息摘录(已逐条核验):

  • 真实机器人硬件:Franka Research 3 + Robotiq 2F-85 夹爪 + ZED 2i(第三人称)+ ZED-Mini(腕部)
  • 两套实现:real/(TypeScript/Bun,Franka FR3)、sim/(Python,LIBERO 仿真)
  • LLM 验证列表:Claude Opus 4.7、Sonnet 4.6、Haiku 4.5、Fable 5、Gemini 3.1 Pro、GPT-5-mini——均为 LiteLLM 兼容
  • 上游依赖:openpi(π0.5 策略服务)、TiPToP(TAMP: 感知+cuRobo规划+抓取预测)、DROID(相机+Franka 封装)、LIBERO-PRO(仿真 benchmark)

官方论文/arXiv HTML 中的完整分项数据(已核验):

真实机器人 Franka FR3 能力拆解:

能力类别 π0.5 直接 TiPToP(开环) Pigey(闭环)
简单抓放 95% 80% 100%
世界知识 0% 90% 100%
条件逻辑 0% 95% 100%
多步推理 0% 25% 100%
空间推理 20% 75% 100%
障碍/安全推理 0% 0% 90%
错误恢复 10% 0% 90%
长时记忆 0% 0% 100%
总体 16.7% 48.7% 97.3%

LIBERO-PRO 仿真 benchmark:

方法 平均成功率
π0-LIBERO 0%
π0.5-LIBERO(冻结) 12.8%
CaP-Agent0 18.2%
Pigey(冻结,同权重) 53.3%

交叉验证

  • arXiv HTML 全文(2607.21725v1)与项目主页数据完全一致
  • GitHub README 声明"所有公开",代码链接了全部上游依赖
  • Tri Dao X 帖中的数字(真实机器人 16.7%→97.3%、LIBERO-PRO 12.8%→53.3%)全部在论文 Table 2 和 Table 3 中有据可查,与 FAEA 攻略(2026-07-31)的"数字冲突"问题不同——此处数字完全匹配,无需降级处理

⚠️ 不确定处

  1. 代码完整度:GitHub README 说明"All public. Install each upstream first; this repo is the glue on top."——Pigey 本身是胶水代码,真正的 VLM 推理能力依赖 Claude Opus 4.7 等商业 API,读者需要自备 API key
  2. π0.5 权重获取:sim 使用 pi05_libero(可通过 openpi docs 获取),real 使用 pi05_droid(存放于 Google Cloud Storage,需科学访问),权重获取有一定门槛

上手步骤

仿真环境(推荐先跑这个)

前置依赖:

# 克隆 Pigey
git clone https://github.com/lianegalanti/Pigey
cd Pigey

# 安装上游(各自 README 有详细说明)
# openpi(π0.5 策略服务): https://github.com/Physical-Intelligence/openpi
# TiPToP(TAMP 仿真): https://github.com/tiptop-robot/tiptop
# LIBERO-PRO: https://github.com/Zxy-MLlab/LIBERO-PRO

启动 π0.5 策略服务器(Python,GPU 机器):

# 见 openpi 仓库的 launch.py
python openpi/projects/openpi/launch.py \
  --policy pi05_libero \
  --checkpoint <下载的权重路径> \
  --port 8000

运行仿真评估:

# 需要同时启动 TAMP 服务器(见 TiPToP 文档)
export ANTHROPIC_API_KEY="your-key-here"      # 或 GEMINI_API_KEY / OPENAI_API_KEY
export GEMINI_API_KEY="your-key-here"          # Gemini Robotics ER 感知用

python agent_sim.py \
  --mode harness \
  --suite libero_goal_task \
  --task 0 --episode 2 \
  --policy-host localhost --policy-port 8000 \
  --model gemini/gemini-3.5-flash \
  --max-llm-steps 35 \
  --max-steps-per-rollout 500 \
  --out-dir results/

真实机器人环境(高门槛)

硬件要求: Franka Research 3 + Robotiq 2F-85 + ZED 2i + ZED-Mini + Blackwell/B300 GPU

启动流程:

# 1. 启动 π0.5 策略服务器(pi05_droid 权重)
python openpi/projects/openpi/launch.py \
  --policy pi05_droid \
  --checkpoint gs://openpi-assets/checkpoints/pi05_droid \
  --port 8000

# 2. 启动 TAMP 服务器
# 见 TiPToP 文档,监听 :7777

# 3. 设置环境变量并运行
export ANTHROPIC_API_KEY="your-key-here"
export TAMP_URL=http://<workstation>:7777
export DROID_HOST=<workstation>
export PI0_URL=ws://<workstation>:8000

bun agent.ts "pick up the cup and put it in the basket"

可选环境变量(调整行为):

export AGENT_MAX_STEPS=50          # 最大步数上限
export AGENT_FAIL_LIMIT=3          # 允许失败重试次数
export AGENT_LLM_TIMEOUT_MS=30000   # LLM 单步超时(毫秒)
export AGENT_SKIP_WRIST_REC=1      # 跳过腕部摄像头(节省带宽)

核心架构一览

用户指令 ("pick up the cup...")
       │
       ▼
┌─────────────────────────────┐
│   VLM Orchestrator (Pigey)   │  ← TypeScript/Bun(real)或 Python(sim)
│   Claude Opus 4.7 / Gemini   │     闭环: 观察 → 推理 → 选工具 → 验证
└──────────┬──────────────────┘
           │
    ┌──────┼──────┐
    ▼      ▼      ▼
 TAMP    DROID   π0.5
 Server  Server  Policy
(:7777) (:9876)  (:8000/ws)
    │      │      │
    ▼      ▼      ▼
 感知+   相机+   VLA 动作
 cuRobo  状态    生成
 规划

坑与适用边界

⚠️ 限制(论文原文明确说明)

  1. 硬件门槛极高:真实机器人需要 Franka Research 3、多相机 rig、Blackwell/B300 GPU,普通研究者几乎无法复现
  2. 依赖多个上游系统:需要正确配置 openpi + TiPToP + DROID 三个服务,外加商业 LLM API,任何一环出错都会导致系统不可用
  3. VLM 是瓶颈:所有步进推理都经过 LLM,延迟高(论文中 real-robot 任务有视频可见实时性有限),不适合需要毫秒级控制的精细操作
  4. API 成本:使用 Claude Opus 4.7 等大模型进行每步推理,在长时任务中可能产生大量 API 调用费用
  5. π0.5 权重需申请:real 模式使用的 pi05_droid 权重存于 GCS,非开源直接下载

适用场景

✅ 有 GPU 集群和机器人硬件的研究团队,验证"编排差距"假说
✅ 仿真环境中快速评测 VLM 的机器人任务规划能力
✅ 作为 VLA 微调的替代方案:用 Agentic Pipeline 挖掘现有冻结策略的潜力

不适用场景

❌ 个人开发者或小团队(无机器人硬件+无高配 GPU)
❌ 需要实时毫秒级控制的精细操作任务
❌ 期望开箱即用、零配置跑起来的场景


一句话结论

Pigey 用实验证明了一个反直觉命题:机器人缺的不是更好的策略,而是更好的调度——把 VLM 当调度员套在冻结的技能上,无需任何新训练就能把同一套权重从 12.8% 推到 53.3%(仿真)和 97.3%(真机),"编排差距"这个概念本身比具体数字更有长期价值。


论文引用: bibtex @article{galanti2026addressing, title={Addressing the Orchestration Gap in Generalist Robots via Physical Agency}, author={Galanti, Liane and Shah, Dhruv and Dao, Tri}, journal={arXiv preprint arXiv:2607.21725}, year={2026} }

核心链接: - 论文:https://arxiv.org/abs/2607.21725 - 项目主页:https://lianegalanti.github.io/Pigey/ - 代码:https://github.com/lianegalanti/Pigey - X 原帖(@tri_dao):https://x.com/tri_dao/status/2082175796710658210