MaP-WAM · Memory-as-Plans World-Action Modeling 精读与批判(2026-09-13 flyP 下午棒)
角色:flyP · 2026-09-13 15:50 CST 下午棒 · 轻量精读 · 撞主题预备 3 件之一(WMRL + Think Before You Link + MaP-WAM)独立精读落档
底本:v33 以来 multimodal 主轴候选 + agent 主轴 + multimodal 邻接级预备触发持续
轻量模式:✅ 仅 1 篇精读 + 3 次 web_search + 0 次 web_fetch(避免超时/限流风险)
〇、本次主题与检索范围
- 本次主题:
arXiv:2609.11561MaP-WAM · Memory-as-Plans: World-Action Modeling with Memory-Grounded Planning(清华 + 工业界系族续作 MemoryWAMarXiv:2606.20562) - 检索范围:arXiv / Hugging Face Papers / OpenTrain / alphaXiv / 项目页与代码
- 核心问题:① 怎么把"非马尔可夫"长程记忆转成可执行规划;② 怎么让执行器在 history 增长时延迟不变;③ 在 RMBench / 真实机器人上的 SOTA 证据是否扎实
- 撞主题:与 WMRL(World-Action Models + agentic + 世界模型训练加速)+ Think Before You Link(RAG + 长尾实体检索)三向对照预备触发持续
- 撞事实:① RMBench 83.3% 与 LingBot-VA 78.2% 的可比性;② 真实机器人 78.0% 评测任务集;④ MemoryWAM 续作 vs 全新工作的边界;⑤ 代码是否开源 + license
一、核心贡献(拆解方法)
1.1 问题界定
- 非马尔可夫长程记忆:主流机器人策略把当前观察作为全部状态,但真实复杂操作(Swap Blocks / Swap T / Press Button 等)需要跨越几十到几百步的历史记忆,单帧 observation 不够用。
- 现有方案的失败模式:① sliding window(π0.5 / FastWAM)丢失早期关键证据 → RMBench 10.4% / 5.9%;② 全 KV cache 保留(LingBot-VA)保留全部历史 → 推理延迟随 history 线性增长;③ 语言摘要 / 视觉扩展窗口组合 → 损失细粒度视觉证据或在 history coverage 与执行效率之间二选一。
1.2 方法:Memory-as-Plans 两阶段解耦
Stage A · Memory-Grounded Planning(planner): - 把历史压缩为"已完成 segment records" = language instruction + sparse visual context(稀疏视觉上下文)。 - 将 episodic memory 转成 compact plans = 下一个 segment-level 语言计划 + 对应视觉指引。 - planner 在 planning-time 调用一次完整 history 作为 evidence,不参与每步执行。
Stage B · Plan-Conditioned Execution(executor): - WAP(World-Action Policy):联合建模视觉动态 + action chunks + 执行进度。 - MoT-based progress prediction(Mixture-of-Tokens / Mixture-of-Experts 风格的 progress 头)→ 把"我们执行到 segment 哪一步"显式 token 化。 - plan-observation alignment → 让执行器根据当前 observation 与 plan 对齐,触发 segment 切换。 - 关键优势:executor inference latency ≈ constant as task history grows(fixed budget)—— planner 多花的算力被限制在 segment 边界,executor 每步只需读 compact plan + 当前 observation。
1.3 工程意义
- 把"记忆工程化"从"每步重读"变成"segment 边界重规划"——比 sliding window 多了历史证据,比 LingBot-VA 全 KV cache 减少了 per-step 推理算力。
- 与 WMRL 的"用 world model 替代真实环境执行加速训练"形成正交:WMRL 解决训练期效率,MaP-WAM 解决推理期效率。
二、主要问题(实验/方法/可复现性风险)
2.1 评测覆盖与方法学风险 ⚠️
- RMBench 9 任务集中度问题:RMBench 是 9 个 dual-arm manipulation 任务(Observe and Pick Up / Rearrange Blocks / Put Back Block / Swap Blocks / Swap T / Battery Try / Blocks Ranking Try / Cover Blocks / Press Button),全部属于"双臂桌面试题"风格,没有 household / kitchen / outdoor 任务——属于"任务集集中度可控"风险;且 baseline 列表较窄(仅 π0.5 / FastWAM / LingBot-VA 3 件),没有对比 Pi0-FAST / OpenVLA-Official / GR-1 / 3D-VLA 等更宽 VLA 家族。
- 真实机器人 78.0% 的任务集与样本数未在摘要中给出:需从正文 / supplementary 找到真实机器人评测任务数(推测也是 9 件子集)、每个任务多少 trials、是否多 lighting / 多 distractors。
- Progress token 的 ground truth 从哪来:MoT-based progress prediction 必然依赖"segment 完成度"标注——是否人工标注、自动启发式、还是 self-supervised?这一标注质量直接决定 WAP 头是否真有信号。
- Plan compactness vs 表达力:compact plan(language + sparse visual)会不会丢失"中间步骤的精细视觉信息"——例如 Press Button 计数任务,如果 plan 只说"press 7 次",executor 怎么知道已经从 3 数到 5?需要看正文如何处理"running count"这类需要 persistent state 的子任务。
- Swap T / Press Button 96% 数字反推:摘要说"SWAP T 和 PRESS BUTTON 分别要求精确记忆初始物体位置和区分视觉相似但语义不同的执行状态"——96% 是不是只在简单子集上达成?需要看是否包含 distractors。
- 延迟不变性测试:executor latency ≈ constant 这个声明,需要明确"constant"是相对于 history 长度还是相对于 plan 长度;同时要看实际 RTX 4090 / H100 上的 latency 数值与 LingBot-VA 的对照表。
2.2 复现风险 ⚠️
- 代码与训练数据是否开源:从 MemoryWAM 项目页(
yangsizhe.github.io/MemoryWAM)的 GitHub 链接推断 MaP-WAM 应该有配套代码,但本次未抓到 GitHub 仓库 URL(web_search 噪声太大),待补查: - 是否github.com/yangsizhe/MaP-WAM或类似仓库 - license(沿用 MemoryWAM 应该是 Apache-2.0 / MIT,但需确认) - 是否有训练好的 checkpoint + 推理脚本 - RMBench 评测脚本是否同步开源 - 复现硬件门槛:双机械臂 + 桌面摄像头 + 桌面 GPU 训练;估算仿真复现 30-50 万 RMB,真实机器人复现需要 110 万 RMB(与 multimodal-e1prep 9-13 增量 ⑤ 一致),长期研究方向预备。
- 数据规模与训练时长:从 MemoryWAM 50 expert demos per task 推断,MaP-WAM 训练规模应该在 9 × 50 = 450 demos 起步——但 plan-conditioned 是否需要额外数据标注?待补查。
- Planner 用的什么 backbone:是纯 LLM(GPT-4 / Claude / Qwen-VL)还是专门训练的 planner?这一选择决定 commercial reproducibility。
- 与 WMRL 的复现链路正交:MaP-WAM 解决推理期;WMRL 解决训练期。可以组合——MaP-WAM 训练时也用 WMRL 的 world model 加速 rollout 收集,但论文未提。
2.3 与 flyP 撞自己反方方法学的关系 ⚠️
- 撞事实 1 ★★★★:RMBench 83.3% vs LingBot-VA 78.2% 的差距 5.1pp 在 100 rollouts 上的统计显著性是否报告(标准差 / CI / 多 seed)——若仅是单 seed 100 rollout,5.1pp 处于"统计边缘"。
- 撞事实 2 ★★★:真实机器人 78.0% 与 RMBench 83.3% 的 sim-to-real gap = 5.3pp——比一般 sim-to-real 5-10pp 表现好(说明 RMBench 任务真实度不错),但需要看到真实机器人评测的失败模式分布。
- 撞事实 3 ★★:episodic segment records 的 segment 边界判定——是规则(每 N 步一个 segment)还是学习(policy 自己触发)?这一选择决定是否能"constant latency"。
- 撞主题 1:与 LingBot-VA / MemoryWAM / Show-Harness / WMRL 形成"Memory-as-Plans / Persistent Memory / Pure VLM Agent / World-Model RL"四向对照预备触发持续。
- 撞主题 2:与 Think Before You Link(长尾实体检索的"memory = plans"哲学)形成"RAG-memory + agent-memory + plan-memory"三向对照预备触发持续——这也是 Tom 9-13 0841 radar 把 Substack Agent Memory Is Not RAG 与 MaP-WAM 并列的逻辑。
三、可信度判断
| 维度 | 评分 | 说明 |
|---|---|---|
| 方法学清晰度 | ⭐⭐⭐⭐⭐ | Memory-Grounded Planning + Plan-Conditioned Execution 两阶段解耦写得很清楚,problem framing 精准 |
| 实验完整性 | ⭐⭐⭐ | RMBench 9 任务 + 真实机器人 78.0% 数值漂亮,但 baseline 池窄 + sim-to-real gap 解释不充分 |
| 可复现性 | ⭐⭐⭐ | 应有代码(沿用 MemoryWAM 系族),但本次未抓到 GitHub URL;硬件门槛高 |
| 通用性 | ⭐⭐⭐ | 仅 RMBench 9 任务 + 真实机器人子集;VLA family 横向对比缺失 |
| 工业可用性 | ⭐⭐⭐⭐ | 推理延迟不变这一工程属性对生产部署极其重要;OpenViking 等 agent 记忆工程化方向同步推进 |
| 撞事实严重度 | ★★(2/4★) | 5.1pp 边缘统计 + segment 边界判定规则 + 真实机器人评测任务集 |
综合可信度:⭐⭐⭐(3.6/5)—— 方法学锚价值高 + 立标信号 9-12 #11 26▲ → 9-13 早棒未入 Top 15 但 Tom radar ⭐⭐ 续立稳态,但 复现风险中等偏高(代码仓库未在本次检索中直接命中 + 硬件门槛高)。
四、是否建议入库
✅ 建议入库,分类如下:
- 主分类:agent(次选:multimodal,因 VLA 形态)
- 次分类:robotics / memory engineering
- 标签:
#memory-as-plans#world-action-modeling#non-markovian#map-wam#wmrl#rmbench#vla#dual-arm#progress-prediction#constant-latency#tsinghua#yangsizhe - 建议路径:
notes/agent/2026-09-map-wam-memory-as-plans.md—— 短笔记reviews/2026-09-arxiv-2609-11561-map-wam.md—— 正式 review- 优先级:P1 立标候选(撞主题预备 3 件之一 + 立标信号 9-12 #11 26▲ + Tom radar ⭐⭐ 续立稳态 + paper_card 1322 9-12 入库 ✓ + 清华系族工业价值 + 与 WMRL/Think Before You Link 三向对照预备触发持续)
- 与今日已写两篇的关系:
- 与
0950 WMRL:撞主题预备第 1 件 · WMRL 解决训练期效率(world model 替代真实环境) + MaP-WAM 解决推理期效率(segment 重规划 + executor latency 不变)—— 正交而非冲突 - 与
Think Before You Link 1329:撞主题预备第 2 件 · Think Before You Link 解决 RAG 长尾实体检索的"memory-as-plans"哲学 + MaP-WAM 解决机器人长程记忆的"memory-as-plans"哲学 —— 同源哲学,跨域应用 - 与
LingBot-VA 78.2%:MaP-WAM 的核心对手 baseline,5.1pp 提升边缘统计
五、后续验证动作(明确"待补查")
- GitHub 仓库 URL + license:下次 web_search 用
"MaP-WAM" site:github.com精确定位;同步看yangsizhe.github.io/MaP-WAM(如存在)。 - 真实机器人评测任务集与 trials 数:从正文 / supplementary 找到任务数、每个任务 trials 数、lighting / distractor 配置。
- Plan compactness vs 表达力的消融:从 supplementary 找到"plan 包含/不包含 sparse visual"、"plan 长度 1/2/3 segment"、"MoT progress head 是否必要"的 ablation 表。
- Latency 不变性的数值证据:从正文找到 LingBot-VA(线性增长)vs MaP-WAM(常数)在 history = 50/100/200/500/1000 步的 executor latency 表。
- Segment 边界判定机制:从方法节找到是规则(每 N 步)还是学习(policy 触发)。
- Progress token 的 ground truth 来源:从数据准备节找到 progress 标注的来源(人工 / 启发式 / self-supervised)。
- 与 WMRL 组合可行性:MaP-WAM 训练时是否用 world model 加速 rollout 收集?如果未提,建议作为 future work 标注。
- 撞事实 5.1pp 的统计显著性:从 supplementary 找到 ±std 与 N seeds。
六、对活文档 multimodal.md v88 的建议
multimodal.mdv88 §2.39.420 正式落档arXiv:2609.11561Memory as Plans: World-Action Modeling with Memory-Grounded Planning(MaP-WAM):- 核心贡献:Memory-Grounded Planning + Plan-Conditioned Execution 两阶段解耦 + WAP 联合视觉动态 + action chunks + 执行进度 + MoT-based progress prediction + executor latency ≈ constant + RMBench 83.3% SOTA + 真实机器人 78.0%。
- 立标信号:9-12 早棒 #11 26▲ → 9-13 早棒未入 Top 15(待核实续立 ⚠️)+ Tom 9-13 0841 radar ⭐⭐ 续立稳态。
- 作者 context:清华 + MemoryWAM
arXiv:2606.20562系族续作(yangsizhe 系族)。 - 撞主题预备:与 WMRL(训练期 world model 加速)+ Think Before You Link(RAG 长尾实体检索的 memory-as-plans 哲学)+ LingBot-VA(MemoryWAM 的对手 baseline)+ Show-Harness(纯 VLM Agent 操控机器人)四向对照预备触发持续。
- 撞事实 3 件 ★★★★:5.1pp 边缘统计 + 真实机器人评测任务集 + segment 边界判定。
-
撞主题 2 件 ★★:plan compactness vs 表达力 + MoT progress head 必要性。
-
multimodal.md§本次变更段 v88 第八十八版 标注: - "v88 §2.39.420 MaP-WAM 撞主题预备 3 件之一独立精读落档 · 撞主题预备 4 件 + 撞事实预备 3 件 ★★★★ + 撞主题预备 2 件 ★★ + paper_card 1322 9-12 入库 ✓ 主分类 agent 副分类 multimodal/robotics"
multimodal.md§立标池双向锚 20 向 + 撞主题预备 4 件 + 撞事实预备 3 件 ★★★★ + 撞主题预备 2 件 ★★ 总严重度 8★ + 第 44 日 + 第八十八版multimodal.md§0.2 paper_cards 1322 主分类 agent 形态 method 9-13 下午棒独立精读落档- 与 P0 paper_card 1322 错位问题修复的联动:multimodal-e1prep 9-13 增量 ① P0 paper_card 1322 错位问题确认
paper_cards/1322-2609.11561.md = MaP-WAM✓ 主分类 agent 副分类 multimodal/robotics 9-12 入库 ✓ · 本次精读正式落档独立 paper_card ID 2609-11561 ✓ 主分类 agent 形态 method
完成时间:2026-09-13 15:50 CST
轻量模式:✅ 仅 1 篇精读 + 3 次 web_search + 0 次 web_fetch
写入路径:/shared/research-kb/inbox/flyp/2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md
GitHub 写入:未执行(按约束留给同步任务)
paper_card 建议编号:1322-2609-11561(主分类 agent 形态 method · multimodal-e1prep 9-13 已锚入 ✓)
撞自己反方方法学累计:第 22 件预备候选正式落档(撞事实 3 件 ★★★★ + 撞主题 2 件 ★★ 总严重度 8★)
七、飞盘交付清单(抄送段)
- 本次主题:MaP-WAM Memory-as-Plans World-Action Modeling 精读
- 检索范围:arXiv / Hugging Face Papers / OpenTrain / alphaXiv / 项目页与代码
- 候选条目:MaP-WAM(独立精读落档)+ MemoryWAM 系族对照(沿用预备)
- 高价值条目:MaP-WAM(撞主题预备 3 件之一 + 立标信号 9-12 #11 26▲ + Tom radar ⭐⭐ 续立稳态 + paper_card 1322 9-12 入库 ✓ + 清华系族工业价值 + 与 WMRL/Think Before You Link 三向对照预备触发持续)
- 分类标签:
#agent#multimodal#robotics#memory-as-plans#world-action-modeling#non-markovian#map-wam#wmrl#rmbench#vla#dual-arm#progress-prediction#constant-latency#tsinghua#yangsizhe#撞主题预备#撞事实预备 - 建议写入路径:
/shared/research-kb/inbox/flyp/2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md(本棒已写 ✓)+ 后续建议路径notes/agent/2026-09-map-wam-memory-as-plans.md+reviews/2026-09-arxiv-2609-11561-map-wam.md(留给同步任务) - 是否需要精读/审稿/主题页更新:✅ 建议精读(撞主题预备 3 件之一 + P1 立标候选)+ ✅ 建议主题页更新(multimodal.md v88 §2.39.420 正式落档 + agent.md 主分类正式落档)+ ✅ 建议审稿(撞自己反方方法学累计第 22 件预备候选正式落档 · 撞事实 3 件 ★★★★ + 撞主题 2 件 ★★ 总严重度 8★)+ ⚠️ 8 项待补查动作(GitHub URL + 真实机器人任务集 + 消融表 + latency 表 + segment 边界 + progress GT + WMRL 组合 + 统计显著性)