机器人"做长任务"终于有救了:MaP-WAM 把记忆从执行器里卸载,推理时延压成常数
- 关联论文:2609.11561
你有没有这种感觉:让机器人"做一道菜",它能切菜,但炒完菜之后它忘了切过菜了?
这不是段子——这是当前机器人操作领域的核心痛点。
主流的机器人策略(从行为克隆到 VLA 视觉-语言-动作模型)几乎都假设马尔可夫性:只看当前观测,预测下一步动作。这套打法在"抓杯子"、"推盒子"等单步任务上挺好用,但在长视野多步任务(散乱零件装配、多步烹饪、长链路折叠)上彻底失败——因为机器人根本记不住自己之前做过了什么。
现有的"打补丁"方案有三类,但都不理想:
- 语言摘要记忆:把视觉历史总结成文字。细粒度视觉证据丢失——机器人知道"切过菜",但忘了"刀在哪个角度"。
- 视觉窗口扩张:把过去 N 帧拼进上下文。历史越长越慢——N 选多大都难,选小了丢历史,选大了时延爆炸。
- 两者混合:摘要 + 关键帧。历史覆盖与执行效率的权衡始终存在。
arXiv 2609.11561(MaP-WAM: Memory-grounded Planning + World-Action-Progress)给出了一个思路对仗的解法:别让执行器看记忆,让规划器看一次,然后把"记忆"压缩成"一个 plan"喂给执行器。
怎么理解?打个比方:
你让一个新员工做一桌年夜饭。传统做法是让他每做一道菜都翻一遍之前的菜单——他要做红烧肉,就得回看"刚才我切了肉、焯了水、炒了糖色",每一步都要查。但历史菜单越翻越长,他也越做越慢。
MaP-WAM 的做法是让他只看一张"接下来做什么"的卡片:这张卡片是项目经理(规划器)一次性消化完整本菜单后浓缩出来的——"现在到第 3 步,做红烧肉,火候中火,糖色已炒"。员工(执行器)只看这张卡片 + 当前灶台情况,不用回看完整菜单。
这就是架构级的解耦——把"记忆"和"执行"的 context 从耦合变成解耦。
具体实现分两个阶段:
Stage 1:记忆锚定规划(PlanCompactor) 把整个长视野情景记忆(语言指令 + 稀疏视觉)一次性塞进 VLM 类基础模型,蒸馏出"下一步计划"——包含语言计划 + 视觉锚点。这一步 KV cache 一次构建,产出 plan 后即可释放。
Stage 2:规划条件执行(WAP 执行器) 执行器只看 plan + 当前观测,不再直接看历史记忆。它联合预测两个东西: - 动作块(未来 H 步动作,降低决策频率) - 执行进度(完成度估计 0-1)
进度预测是关键创新——它让执行器能自适应切换 plan:进度接近 1 + 观测与下一 plan 视觉锚点对齐 → 切到下一 plan;进度卡中间 → 继续;进度与观测显著不一致 → 触发重规划。
这套架构最大的工程卖点是KV cache 双侧启用: - 规划阶段:情景记忆 KV cache 一次构建,产出 plan 后释放; - 执行阶段:plan + 当前观测 KV cache 增量更新; - 跨段切换:plan 切换时 KV cache 重置。
这把执行器推理时延从"随历史线性增长"压成"近似常数"——这是 VLA 模型当前最大的部署瓶颈,而 MaP-WAM 直接把这个瓶颈干掉了。
论文给出具体数字:RMBench 上 83.3% 成功率(SOTA),真实机器人 78.0% 成功率,执行器推理时延随历史增长保持近似常数。三个具体可验证指标 + 项目页可查(https://sizhezhao.github.io/projects/MaP-WAM/)。
但落地前有几个 P0 风险要盯着:
-
78.0% 真机成功率未达工业级门槛。工业级通常需要 >95%,78% 对应"每 5 次操作约 1 次失败"——在物流 / 装配场景下意味着高损坏率或低吞吐量。建议作为基线而非终点,叠加力矩传感器检测抓空 + 自动重试 + 高不确定时降速或停机等待人工介入。
-
"稀疏视觉锚点"具体多稀疏?——abstract 没给阈值。选错了要么退化成"几乎无视觉锚点"(执行器在歧义步骤崩溃),要么退化成"全量历史"(失去 KV cache 优势)。需要在测试集上完整 sweep,任务自适应(简单任务 1-2 帧,复杂任务 5-10 帧),甚至动态稀疏度(progress 预测置信度低时自动加稠锚点)。
-
重规划触发条件的模糊性。"plan-observation alignment"具体怎么算?余弦相似度?L2 距离?阈值多少?——abstract 没有说。建议先用视觉特征 L2 距离作 baseline,后期迭代到 learned alignment(训练小型分类器判断"当前观测是否符合 plan 预期")。
-
PlanCompactor 的 VLM 推理延迟。若情景记忆很长(100+ 步),VLM 单次推理可能秒级,实时机器人控制不可接受。建议分段规划(每 20 步调用一次)+ 蒸馏小模型替代 + 后台异步执行。
-
未与同方向 VLA 工作做 head-to-head——OpenVLA / π0 / RT-2 / HPT 等"对标选手"是否真被超越,abstract 未明示。需要进入正文确认 MaP-WAM 是否真在 OpenVLA / π0 / HPT 上同时领先。
之所以说它重要,是因为它把"长视野操作"这件事从"研究 demo"推进到了"系统架构可参考"的程度。83.3% 仿真 + 78.0% 真机 + 时延常数三个数字同时给出来——在 robotics 领域,这已经是工程证据完整的硬指标。
更广泛地说,MaP-WAM 的"规划器 + 执行器 + progress"三件套与 LLM Agent 的 planner-executor 结构高度同构。这套思路可以原封不动移植到 LLM Agent 长链路场景——任何"长 context + 在线决策"任务(Agent 长链路决策 / 长视频理解 / 长文档 QA)都可以用同样的"记忆从执行器卸载到规划器"思路重构。这是 2026 年 Agent 架构演进的一个重要范式样本。
三个标题变体
- 数字钩子版:83.3% 仿真 + 78.0% 真机 + 时延常数,MaP-WAM 让机器人"做长任务"从研究 demo 进化到系统架构
- 拟人化版:让机器人"做一桌年夜饭"不再失忆——把完整菜单压在"一张卡片"里,员工只管看卡片 + 当前灶台
- 类比版:相当于给机器人装了个"项目经理"——规划器看完整历史一次性吐出 plan,执行器只看 plan + 当前画面
小红书风格卡片文案(可直接发布)
🤖 机器人"做一桌年夜饭"终于有救了
你有没有这种感觉:让机器人做菜,它能切菜,但炒完之后它忘了切过菜了?
这不是段子——这是当前机器人操作领域的核心痛点。主流 VLA 模型都假设"只看当前观测",所以根本记不住之前做过了什么。
arXiv 2609.11561(MaP-WAM)给了一个思路对仗的解法👇
💡 核心洞察 别让执行器看记忆,让规划器看一次,然后把"记忆"压缩成"一个 plan"喂给执行器。
打比方: - 传统做法:员工每做一道菜都翻一遍完整菜单 → 历史越长越慢 - MaP-WAM:项目经理一次性消化完整菜单,浓缩成"接下来做什么"的卡片 → 员工只管看卡片 + 当前灶台
🔧 双阶段架构
Stage 1 — 记忆锚定规划(PlanCompactor) 把长视野情景记忆一次性塞进 VLM,蒸馏出"下一步计划"(语言 + 视觉锚点)。KV cache 一次构建,产出 plan 后释放。
Stage 2 — 规划条件执行(WAP 执行器) 执行器只看 plan + 当前观测,不再直接看历史。联合预测: - 动作块(未来 H 步,降低决策频率) - 执行进度(0-1 完成度)
进度预测让执行器能自适应切换 plan——做完自动切下一段,卡住自动重规划。
🚀 最大工程卖点 KV cache 双侧启用,推理时延从"随历史线性增长"压成"近似常数"——这是 VLA 部署的最大瓶颈,MaP-WAM 直接干掉。
📊 硬数字 - RMBench 仿真:83.3% 成功率(SOTA) - 真实机器人:78.0% 成功率 - 执行器推理时延:随历史增长保持近似常数
⚠️ 落地前必须盯紧 - 78% 未达工业级(需 >95%)→ 叠加力矩传感器 + 自动重试 + 高不确定降速 - "稀疏视觉锚点"具体多稀疏?abstract 没给 → 需做完整 sweep + 任务自适应 + 动态稀疏度 - 重规划触发条件模糊 → 余弦相似度?L2?阈值?建议先 baseline 后 learned - PlanCompactor VLM 推理延迟 → 长记忆场景秒级,需分段规划 + 蒸馏小模型 + 后台异步 - 未与 OpenVLA / π0 / HPT 做 head-to-head → 是否真 SOTA 需读正文核验
🧠 它真正重要的点 MaP-WAM 的"规划器 + 执行器 + progress"三件套与 LLM Agent 的 planner-executor 结构高度同构——这套思路可以原封不动移植到 LLM Agent 长链路场景。任何"长 context + 在线决策"任务(Agent 长链路 / 长视频理解 / 长文档 QA)都可以用同样的"记忆从执行器卸载到规划器"思路重构。这是 2026 年 Agent 架构演进的一个重要范式样本。