Pigey:用 VLM 编排器弥合"编排差距",零训练 4 倍提升机器人推理任务 · 干货攻略
- 链接: https://x.com/tri_dao/status/2082175796710658210
- 分类: x-tips
- 来源: X @tri_dao
- 作者: Jay
- 更新: 2026-08-05
- 仓库: lianegalanti/Pigey
这是什么
Pigey(Physical Agency)是一个闭环 VLM 编排器(closed-loop VLM orchestrator),其核心思路是:不给机器人策略灌输推理能力,而是在推理时引入一个高-level agent 循环来规划、验证和恢复,让同一个冻结的技能策略在"循环内"比"单独使用"强数倍。
论文标题直接点出了核心概念:
Addressing the Orchestration Gap in Generalist Robots via Physical Agency (arXiv:2607.21725,2026-07-23 提交)
作者:Liane Galanti(普林斯顿)、Dhruv Shah、Tri Dao(Together AI)。
GitHub:lianegalanti/Pigey
项目页:lianegalanti.github.io/Pigey
为什么值得关注
谁分享的、解决什么问题
@tri_dao(Flash Attention 作者、Together AI 首席科学家)在 X 上转发了合作者 Liane Galanti 的工作,附言:
"Putting LLM brain on robots → 4× SOTA with no extra training. The time for agents running on robots is coming soon."
这背后的核心问题是:当前最强视觉-语言-动作模型(VLA)的问题不在于控制本身,而在于缺乏任务级推理、验证和恢复能力。 传统思路是靠大规模机器人数据让一个网络同时学会所有能力,结果是:
- 推理任务(世界知识、条件逻辑、错误恢复)几乎为零;
- 每个任务都需要专属演示数据,成本极高;
- 直接把高层指令发给 VLA,模型"prompt-invariant"——几乎输出相同动作,不管指令内容是什么。
核心贡献:编排差距(Orchestration Gap)
Pigey 提出了一个关键概念:编排差距——同一个冻结技能在"编排循环内"与"单独被 prompt"时的表现差距。
| 场景 | π₀.₅ 直接 prompt | Pigey(同样冻结权重) |
|---|---|---|
| 真实机器人(Franka FR3,30 项任务) | 16.7% | 97.3% |
| 仿真 LIBERO-PRO(平均成功率) | 12.8% | 53.3% |
以上数字均来自论文 Table 及项目页,为同一组冻结权重在不同推理时流程下的对比。
提升全部集中在推理受限任务(reasoning-limited tasks),而非简单拾放——论文原文:"already-easy pick-and-place stays at 100%"。
核验过程
本文所有关键数字均经过以下官方来源交叉验证:
-
arXiv 论文摘要(
arxiv.org/abs/2607.21725)
原文:"On LIBERO-PRO, Pigey advances the state-of-the-art by over 4× (12.8% → 53.3%) with no task-specific fine-tuning. On a real robot, Pigey lifts the frozen policy from near-zero to over 90% on reasoning-limited tasks." -
项目主页(
lianegalanti.github.io/Pigey)
提供了完整的真实机器人与仿真分任务 breakdown table,包含 30 项 Franka FR3 任务中各推理子类的具体数字(世界知识、条件逻辑、多步推理、空间推理、长程记忆、错误恢复、安全推理等),以及 LIBERO-PRO 六个扰动 suite 的分项数字。 -
GitHub README(
github.com/lianegalanti/Pigey)
提供了系统架构:两个agent实现文件(real/agent.ts+sim/agent_sim.py),调用三个上游依赖(TiPToP TAMP、DROID、π₀.₅ policy server),以及验证了感知层使用 Gemini Robotics ER。 -
X 原帖(
x.com/lianegalanti/status/2082146266461405552)
原始发布者确认数字:Real robot: 16.7% → 97.3%;Sim (LIBERO-PRO): 12.8% → 53.3%,并补充了 TiPToP 开放环路基线 48.7%、CaP-Agent0 仿真基线 18.2% 作为参照。
原帖主张与官方文档的关系:X 帖子中提到的真实机器人数字(97.3%)与 arXiv 摘要一致("over 90%"的精确值);LIBERO-PRO 仿真数字(53.3%)与摘要完全吻合。两者无冲突,均已核验。
上手步骤
系统架构一览
[Frontier VLM 编排器(Pigey)]
↓ 规划子目标、选择后端、验证结果
┌────────────┬────────────┐
│ TAMP │ π₀.₅ VLA │
│(TiPToP) │(Physical │
│ 刚体拾放 │ Intelligence)│
│ + 抓取 │ 变形体/恢复│
└────────────┴────────────┘
编排器永不发低层运动指令,每步观察 → 推理 → 行动 → 验证 → 恢复,循环直到任务谓词成立。
依赖安装(真实机器人)
# 1. 克隆主仓库
git clone https://github.com/lianegalanti/Pigey
cd Pigey
# 2. 安装上游依赖(各自独立安装)
# TiPToP(TAMP: 感知 + cuRobo 规划 + 抓取预测)
git clone https://github.com/tiptop-robot/tiptop
# DROID(相机 + Franka 包装器)
git clone https://github.com/droid-dataset/droid
# openpi(π₀.₅ policy server)
git clone https://github.com/Physical-Intelligence/openpi
# 下载检查点(pi05_droid): gs://openpi-assets/checkpoints/pi05_droid
# 3. 设置 API Key(VLM reasoner)
export ANTHROPIC_API_KEY=sk-... # Claude Opus 4.7 等
# 或
export GEMINI_API_KEY=... # Gemini Robotics ER 感知用
# 4. 启动各服务
# TAMP server (TiPToP)
export TAMP_URL=http://<workstation>:7777
# DROID server
export DROID_HOST=<workstation>
# π₀.₅ policy server
export PI0_URL=ws://<workstation>:8000
# 5. 运行编排器(使用 Bun)
bun agent.ts "pick up the cup and put it in the basket"
依赖安装(仿真,LIBERO-PRO)
export ANTHROPIC_API_KEY=...
export GEMINI_API_KEY=... # Gemini Robotics ER 感知必须
# 启动 π₀.₅ policy server(见 openpi 文档)
python agent_sim.py \
--mode harness \
--suite libero_goal_task \
--task 0 --episode 2 \
--policy-host localhost --policy-port 8000 \
--model gemini/gemini-3.5-flash \
--max-llm-steps 35 --max-steps-per-rollout 500 \
--out-dir results/
可替换模型:GitHub README 明确说明架构为模型无关(LiteLLM),已验证可用:Claude Sonnet 4.6 / Haiku 4.5 / Fable 5、Gemini 3.1 Pro、Gemini 3.5 Flash、GPT-5-mini。
坑与适用边界
⚠️ 硬件门槛极高
这是目前最大的限制:
- 真机:需要 Franka Research 3 + Robotiq 2F-85 gripper + ZED 2i(第三人称)+ ZED-Mini(腕部),三个独立服务(TAMP、DROID、π₀.₅ server)均需 GPU(README 特别提到 Blackwell/B300 GPU workaround)。普通研究者几乎无法复现。
- 仿真:LIBERO-PRO + π₀.₅ policy server 也需要相当的工程投入。
⚠️ VLM 扮演"裁判"而非"执行者"
编排器的核心假设是:VLM 能从实时相机图像判断"任务是否完成"。论文坦承"这能 work 本身不是显而易见的"(A general VLM, never trained for embodiment, must ground its reasoning in live camera observations tightly enough to tell a completed grasp from a failed one... from general pretraining alone. We find that it can.)。如果视觉条件不满足(例如遮挡严重、纹理缺失),VLM 验证可能失效。
⚠️ 简单任务收益有限
对于"本身就会的拾放动作",Pigey 的提升几乎为零(论文报告 100% → 100%)。这套框架的价值在于推理受限任务——世界知识、安全推理、长程记忆、空间推理、错误恢复。如果任务本身没有这些挑战,直接用 VLA 更简单。
⚠️ 名称拼写注意
系统名为 Pigey(来自 Physical Agency),不是 Pidgey( Pokémon),也不是 FAEA(那是另一个同生态系统的论文)。搜索时请注意关键词 Pigey robot orchestration gap。
一句话结论
Pigey 证明了"编排差距"是机器人泛化的盲点——不是缺数据,而是缺推理时循环;只需在冻结 VLA 外层加一层 VLM 编排(observe→reason→act→verify→recover),无需任何新训练,推理任务从 16.7% 飙升至 97.3%,仿真从 12.8% 到 53.3%——但其工程门槛(多 GPU 服务器 + 专业机器人硬件)限制了适用范围,更接近"证明概念可行"而非"开箱即用"。