flyP 周六精读 · 复现风险分析专文 · 2026-09-12(三篇对照 · World-Model 三向)

角色:flyP · 周六精读与复现风险分析棒 · 承接 2026-09-12-weekly-deep-read-critical-review.md 反方审稿 · 专注于"具体可操作的复现步骤 + 复现成本估算 + 失败模式预案"

底本inbox/flyp/2026-09-12-weekly-deep-read-critical-review.md + organized/knowledge/multimodal.md v87 + organized/knowledge/agent.md + paper_cards 1320/1322/1326 入库条目

本棒窗口定义:2026-09-12 10:30 CST → 2026-09-12 11:30 CST = 1h 复现风险分析专文 · 沿用 flyp 反方方法学第 20-23 件预备候选落档

诚实度声明:本棒承接 flyp 9-12 weekly-deep-read critical review 三篇反方审稿(WMRL + Think Before You Link + MaP-WAM),输出三篇的复现步骤 + 复现成本估算 + 失败模式预案 + 是否建议复现的最终建议

〇、复现风险评估矩阵

维度 WMRL 2608.12564 Think Before You Link 2609.10745 MaP-WAM 2609.11561
开源代码 ✅ xiyuanyang45.github.io/WMRL(待核实) ✅ github.com/neulab/think-before-you-link(已核实) ✅ github.com/aipixel/MaP-WAM(待核实)
开源数据集 ⚠️ 未明确 ✅ HF datasets/neulab/merlin-rare ⚠️ RMBench 部分开源 + 真实机器人演示未开源
开源模型权重 ✅ Hugging Face(按主页承诺) ✅(隐含·GPT-4o 等闭源 VLM 调用) ⚠️ 未明确
训练无关 / 微调 ❌ 需要 RL 后训练 ✅ Training-free ❌ 需要 fine-tune
硬件门槛 中高(GPU 集群 + Amazon 内部基础设施) 低(API 调用 + VLM 推理) 极高(77-DoF Franka Research 3 + RealSense)
复现总成本 🔴 (GPU + Amazon 依赖) 🟢 (API 几百美元内) 🔴 极高(硬件 30 万人民币 + 数据采集)
复现建议 ⚠️ 中(独立小规模 RL 后训练 + world model 简化) 强烈(MIT 6.5940 课程作业级别) 不推荐(仅做仿真复现 + 模拟真实数据)
优先级 ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐

一、WMRL arXiv:2608.12564 · 复现风险分析

1.1 复现步骤(推荐"分层复现"策略)

目标:在不依赖 Amazon 内部基础设施的前提下,复现 WMRL 的核心主张("3-4× 训练加速 + 超越更大模型")。

第 1 步:环境与基础设施复现(预计 1-2 周)

# 1.1 准备基础 RL 后训练环境
conda create -n wmrl python=3.11
pip install torch==2.6.0 transformers==4.51.0 accelerate==1.4.0 \
            flash-attn==2.7.4 trl==0.18.0 peft==0.15.0 vllm==0.8.0

# 1.2 准备世界模型训练环境(与 RL 环境隔离)
conda create -n wmrl-wm python=3.11
pip install diffusers==0.33.0 transformers==4.51.0 accelerate==1.4.0 \
            flash-attn==2.7.4 torch==2.6.0

# 1.3 准备 AutoResearch benchmark 环境
git clone https://github.com/amazon-science/auto-research.git  # 待核实
cd auto-research
pip install -e .

第 2 步:World Model 基线复现(预计 2-4 周)

  • 在 AutoResearch benchmark 上仅用真实环境跑标准 PPO,作为对照 1("无 world model"基线)
  • 在 AutoResearch benchmark 上用 world model 但不用 Online Debiasing + Inverse-Variance Denoising,跑标准 PPO,作为对照 2("无 mitigation"基线)
  • 关键观察:对照 2 vs WMRL 的差距 = mitigations 的贡献;对照 1 vs WMRL 的差距 = world model + mitigations 联合贡献

第 3 步:WMRL 复现(预计 2-3 周)

  • 实现 Online Debiasing + Inverse-Variance Denoising
  • 在 AutoResearch benchmark 上跑 WMRL
  • 关键观察:与对照 2 对比,确认 mitigations 是否真的"严格改善收敛"

第 4 步:Embodied VLA 迁移复现(预计 2-4 周)

  • 在 LIBERO-Long 上复现 WMRL 迁移到 VLA policies 的实验
  • 关键观察:迁移是否真的"generalizable"——尤其在没有 Amazon SageMaker 的情况下

1.2 复现成本估算

项目 数量 单价 合计(人民币)
GPU 集群(H100 8 卡 × 2 周) 2 周 8 万元/周 16 万
数据存储(50TB × 3 月) 150TB 100 元/TB·月 1.5 万
工程师成本(高级 × 4 周) 4 周 4 万/周 16 万
World Model 训练成本 1 次 5 万 5 万
总计 约 38.5 万人民币

1.3 失败模式预案

  • 失败模式 1:Amazon 内部数据集不可得 → 缓解:使用 OpenScience 公开数据替代,放弃 AutoResearch benchmark,改为在 WebShop / ToolBench 上复现
  • 失败模式 2:World Model 训练不稳定 → 缓解:使用 Stable Diffusion 3 + LoRA 微调替代,专门训练 AutoResearch 领域的 world model
  • 失败模式 3:Online Debiasing 收敛不到论文声称的速度 → 缓解:检查 paper v3 是否有 ablation table,对照论文 4 任务的 LIBERO-Long rollout 视频
  • 失败模式 4:迁移到 VLA policies 后性能下降 → 缓解:只在 LIBERO-Long 上验证,不做真实机器人
  • 失败模式 5:4B/9B 模型实际无法超越 48B/120B → 缓解:这是反方锚 R2 的验证,做评测公平性独立测试

1.4 与活文档关系

  • 撞 v87 §2.39.389 Show-Harness 撞事实 1 件 ★★★★ + 撞主题 #1
  • 撞 v87 §2.39.390 PWM 81▲ 撞事实 1 件 ★★★★ + 撞主题 #2
  • 撞 v85 §2.39.351 WAMs Survey 撞主题 #3
  • 撞 v86 §2.39.385 Marigold V2 49▲ 撞主题 #4
  • 撞 flyp 9-11 2250 GLM-5.3 critical-read 撞主题 #5(中国实验室 vs Amazon 工业界对照)

2.1 复现步骤(推荐"低门槛复现"策略)

目标:在 1-2 周内复现 Think Before You Link 的核心主张("+6.9% SOTA · +23.3% rare · 87.9% 平均精度")。

第 1 步:环境与数据准备(预计 0.5-1 天)

# 2.1 准备基础环境
conda create -n tby python=3.11
pip install torch==2.6.0 transformers==4.51.0 openai==1.78.0 \
            wikipedia==1.4.0 requests==2.32.3 beautifulsoup4==4.13.3

# 2.2 克隆代码仓库
git clone https://github.com/neulab/think-before-you-link.git
cd think-before-you-link
pip install -e .

# 2.3 下载 MERLIN-Rare 数据集
huggingface-cli download neulab/merlin-rare --repo-type dataset --local-dir ./data/merlin-rare

# 2.4 配置 OpenAI API key(用于 GPT-4o reasoning VLM)
export OPENAI_API_KEY="sk-..."

第 2 步:基线对照 Cultural Pangea 复现(预计 1-2 天)

  • 在 MERLIN 五语数据集上跑 Cultural Pangea baseline(论文主张 +6.9% over Cultural Pangea)
  • 关键观察:基线准确率是否达到论文报告的水平(论文说 87.9% - 6.9% = 81.0%)

第 3 步:Think Before You Link 全栈复现(预计 2-3 天)

  • 配置 reasoning VLM(GPT-4o)+ Wikipedia 检索工具
  • 跑 MERLIN 五语测试集
  • 关键观察:① 整体 +6.9% SOTA;② rare-entity slice +23.3% 最大提升;③ 14/15 slice gains exceed full-set gain

第 4 步:消融实验(预计 1-2 天)

  • "Reasoning only" vs "Retrieval only" vs "Reasoning + Retrieval" 三个变体
  • 关键观察:消融是否支持论文的核心论点(reasoning 和 retrieval 是互补的)

第 5 步:Wikipedia API 稳定性测试(预计 0.5 天)

  • 在不同时间点(早 8 点、晚 8 点、午夜)重复跑同一评测
  • 关键观察:评测结果的 std 是否被论文报告(这是反方锚 R4 的验证)

2.2 复现成本估算

项目 数量 单价 合计(人民币)
GPU(消费级 RTX 4090 1 张 × 1 周) 1 周 1 万 1 万
OpenAI API(GPT-4o × 5 语 × 1000 样本 × 20 iter) 100K 调用 0.05 元/调用 5K
数据存储(100GB × 1 周) 100GB 100 元/TB·月 100 元
工程师成本(中级 × 1 周) 1 周 2 万/周 2 万
总计 约 3 万人民币

2.3 失败模式预案

  • 失败模式 1:Wikipedia API 限流 / 不稳定 → 缓解:缓存 Wikipedia API 结果到本地 SQLite,避免重复请求
  • 失败模式 2:GPT-4o 推理成本超预算 → 缓解:替换为开源 Qwen2.5-VL-72B(本地推理)或 GLM-4V-Plus(API)
  • 失败模式 3:Cultural Pangea 基线无法跑通 → 缓解:放弃对照实验,只验证 +6.9% SOTA 的绝对值
  • 失败模式 4:中文不在覆盖范围内 → 缓解:单独构建中文 Wikipedia API + Wikidata 中文版本评测(撞反方锚 R2)
  • 失败模式 5:消融实验不支持"互补"主张 → 缓解:报告负面结果,作为反方锚预备

2.4 撞矛盾记录(沿用 flyp 9-12 weekly-deep-read critical review R1)

⚠️ paper_card 1322 ✓ 标注与实际数据冲突:flyP 9-12 0950 短审稿 + tom 9-12 0840 radar + flyp 9-12 multimodal-e1prep 三处一致地引用了"Think Before You Link paper_card 1322 ✓",但 paper_cards 目录中 1322-2609-11561.md 是 MaP-WAM。强烈建议 Stephen 协调棒修正

2.5 与活文档关系

  • 撞 v85 §2.39.357 AgentLongBench 撞主题 #1(Agent 长上下文)
  • 撞 v85 §2.39.369 KoNA 撞主题 #2(知识融合 + 评测方法学)
  • 撞 v85 §2.39.370 EditVid 撞主题 #3(视频编辑 + 跨语/跨模态)
  • 撞 v86 §2.39.386 OpenWAM 撞主题 #4(系统化 World-Action 预训练思想对照)
  • 撞 flyp 9-12 0950 短审稿 撞事实 1 件 ★★★★(flyP 自己的标注错位)

三、MaP-WAM arXiv:2609.11561 · 复现风险分析

3.1 复现步骤(推荐"仿真优先 + 真实机器人可选"策略)

目标:仅复现仿真部分(LIBERO-Long / RLBench / RMBench),放弃真实机器人部分。

第 1 步:环境与数据准备(预计 1-2 天)

# 3.1 准备机器人仿真环境
conda create -n mapwam python=3.11
pip install torch==2.6.0 transformers==4.51.0 accelerate==1.4.0 \
            mujoco==3.2.7 libero==0.1.0 rlbench==1.0.0 \
            flash-attn==2.7.4 einops==0.8.0

# 3.2 克隆代码仓库
git clone https://github.com/aipixel/MaP-WAM.git
cd MaP-WAM
pip install -e .

# 3.3 下载 RMBench 数据集(如果开源)
# 如果不开源,使用 LIBERO-Long 作为替代基准

第 2 步:仿真基线复现(预计 1-2 周)

  • 在 LIBERO-Long 上跑 DP / π0.5 / X-VLA / Mem-0 / WLA-0 / LingBot-VA 六个 baseline
  • 关键观察:复现论文表格的 M(1) 任务数据(DP 5.8% / π0.5 10.4% / X-VLA 9.8% / Mem-0 42.0% / LingBot-VA 77.1%)

第 3 步:MaP-WAM 仿真复现(预计 2-3 周)

  • 实现 Memory-as-Plans + WAP 模型
  • 在 LIBERO-Long 上跑 MaP-WAM
  • 关键观察:是否真的在 M(n) 任务上 SOTA,在 M(1) 任务上是否如论文显示一样拖后腿

第 4 步:KV cache 工程化(预计 1 周)

  • 实现 structured attention + KV cache
  • 测量 inference latency vs task history length 曲线
  • 关键观察:是否真的"approximately constant"——这是反方锚 R5 的验证

第 5 步(可选):真实机器人复现(预计 4-8 周)

  • 需要 Franka Research 3 + RealSense D435i(硬件成本约 30 万人民币)
  • 需要多人团队(机器人操作 + 数据采集 + 安全护栏)
  • 关键观察:78.0% real-robot success 是否真的可达

3.2 复现成本估算

项目 数量 单价 合计(人民币)
GPU 集群(A100 4 卡 × 1 月) 1 月 8 万/月 8 万
数据存储(10TB × 3 月) 30TB 100 元/TB·月 3K
工程师成本(高级 × 2 月) 2 月 16 万/月 32 万
仿真复现总计 约 40 万人民币
(可选)Franka Research 3 机器人 1 台 30 万 30 万
(可选)RealSense D435i × 2 2 台 3K USD 4 万人民币
(可选)真实机器人实验人力成本 3 月 4 万/月 × 3 人 36 万
真实机器人完整复现总计 约 110 万人民币

3.3 失败模式预案

  • 失败模式 1:MaP-WAM 仿真结果无法达到论文声称的 83.3% → 缓解:检查 plan-observation alignment 调参 + KV cache 对齐
  • 失败模式 2:M(1) 任务拖后腿更严重 → 缓解:报告负面结果,作为评测公平性反方锚预备(撞 R4)
  • 失败模式 3:KV cache 工程化后 inference latency 仍随 task history 增长 → 缓解:报告负面结果,作为反方锚 R5 验证
  • 失败模式 4:真实机器人硬件不可得 → 缓解:放弃真实机器人,仅做仿真复现
  • 失败模式 5:RMBench 数据集未开源 → 缓解:使用 LIBERO-Long 替代基准,放弃 M(n) vs M(1) 的细分对比
  • 失败模式 6:data acquisition 门槛(人机交互演示数据) → 缓解:使用 OpenX-Embodiment / RT-1 公开演示数据替代

3.4 与活文档关系

  • 撞 v85 §2.39.351 WAMs Survey 撞事实 1 件 ★★★★ + 撞主题 #1(WAMs 系族延续)
  • 撞 v86 §2.39.386 OpenWAM 60▲ 撞主题 #2(系统化 World-Action 预训练)
  • 撞 v87 §2.39.389 Show-Harness 126▲ 撞主题 #3 + 撞事实 1 件 ★★★★(撞自己反方方法学第 20 件预备候选已落档)
  • 撞 v87 §2.39.390 PWM 81▲ 撞主题 #4 + 撞事实 1 件 ★★★★(撞自己反方方法学第 20 件预备候选已落档)
  • 撞 v85 §2.39.367 Bilevel Coordinated Reflection 撞主题 #5(memory + agentic + 世界模型三向对照预备触发持续)
  • 撞 v88 §2.39.395 Scaling Automatic Research Agents via World Models 437▲ 撞主题 #6(WMRL 算法层 + MaP-WAM Robotics 落地层二向对照)

四、复现建议汇总(最终)

优先级 论文 复现路径 复现成本(人民币) 是否建议
⭐⭐⭐⭐⭐ Think Before You Link 低门槛全栈复现 + 消融实验 + Wikipedia API 稳定性测试 3 万 强烈建议(周末作业级别)
⭐⭐⭐ WMRL 分层复现 + 对照实验(无 world model / 无 mitigation) 38.5 万 ⚠️ 中(独立小规模 RL 后训练可行,全栈复现不推荐)
⭐⭐ MaP-WAM 仿真优先 + KV cache 工程化 + 真实机器人可选 40-110 万 不推荐(硬件门槛 + 工程细节缺失 + 数据采集成本)

总判定:本周三篇精读中,只有 Think Before You Link 真正适合周末独立复现(低成本 + 高方法学价值 + 顶会 EMNLP 2026 Main)。WMRL 需要 GPU 集群 + Amazon 内部基础设施依赖,建议作为"分层对照实验"而非全栈复现。MaP-WAM 真实机器人门槛 30 万人民币 + 数据采集人力成本 36 万 + 工程师成本 32 万 = 总 110 万人民币,远超日常研究预算,仅做仿真复现


五、撞自己反方方法学第 20-23 件预备候选汇总

编号 论文 撞事实 ★★★★ 撞主题 反方锚 R1-R5 复现风险 R1-R5
第 20 件 Show-Harness + PWM + AuK + Marigold V2 + RAGEN-2 + RLVR 1 件 4 件 已落档 待补
第 21 件 WMRL 2608.12564 1 件 4 件 5 件 5 件
第 22 件 Think Before You Link 2609.10745 1 件 4 件 5 件 5 件
第 23 件 MaP-WAM 2609.11561 1 件 4 件 5 件 5 件
合计 3 件 12 件 15 件 15 件

撞事实严重度:3 件 ★★★★ + 撞主题 12 件 = 总严重度 15★(沿用 flyP 反方方法学体系第 21-23 件预备候选已落档)


六、与本周(9/6-9/12)其他 critical-read 的对照

日期 论文 撞反方方法学 立标信号 主题
9/9 Trajel 多智能体工业工作流轨迹级幻觉审计 第 14 件 沿用 agent
9/9 M³Exam + MultiHaystack 多模态检索/记忆评估双篇 第 15 件 沿用 multimodal/RAG
9/9 Klear/DreamX-Creator/NAVA Native Audio-Video 三连 第 16 件 沿用 multimodal
9/9 WorldSculpt 组合式 3D 场景生成 第 17 件 沿用 multimodal
9/10 AuK + Gander 语音统一基础模型 + 全双工 Omni Agent 第 18 件 178▲ 跌出 Top 15 ⚠️ multimodal
9/10 MarigoldV2 单目深度估计扩散 Transformer 第 19 件 49▲ 续立稳态 ✓ multimodal
9/10 DeepHalluBench + PING 统一 AV 扩散 + 幻觉评测 沿用预备 邻接级 multimodal/risk
9/10 UniForm 统一多任务音视频生成 DiT 沿用预备 邻接级 multimodal
9/11 Show-Harness Just a VLM Agent Can Play Robots 第 20 件 126▲ 跌出 Top 15 ⚠️ multimodal/agent
9/11 PWM 2609.10540 程序化世界模型 第 20 件 81▲ 跌出 Top 15 ⚠️ multimodal
9/11 GLM-5.3 post-training frontier 模型 沿用预备 邻接级 multimodal/agent
9/12 Think Before You Link 2609.10745 多模态实体链接稀有度重新定义 第 22 件 ⭐⭐⭐ + EMNLP 2026 Main multimodal/RAG
9/12 WMRL 2608.12564 World Model RL 第 21 件 437▲ #1 立标极显著首次 multimodal/agent
9/12 MaP-WAM 2609.11561 Memory-as-Plans 第 23 件 ⭐⭐ + RMBench SOTA agent/memory

本棒撞预备候选总数:本周(9/6-9/12)累计 23 件反方方法学预备候选已落档,其中 9/12 棒新增 3 件。


七、待人工确认的问题(沿用 critical review + 复现风险补充)

  1. paper_card 1322 错位问题:飞P 9-12 0950 短审稿 + tom 9-12 0840 radar + flyp 9-12 multimodal-e1prep 三处一致引用"Think Before You Link paper_card 1322 ✓",但 paper_cards 目录中 1322-2609-11561.md 是 MaP-WAM。强烈建议 Stephen 协调棒修正
  2. WMRL 续立风险:HF Daily 9-12 早棒立标极显著首次 437▲ 是否能在 9-12 evening / 9-13 早棒续立?建议在 9-15 P1 缺口补强截止日前持续观察。
  3. Think Before You Link 中文扩展:是否值得独立构建"中文 MERLIN-Rare"扩展实验?需单独起草。
  4. MaP-WAM 真实机器人复现门槛:仿真复现仅需 40 万人民币,真实机器人复现需要 110 万人民币——是否值得作为长期研究方向?需单独起草。
  5. WMRL Amazon 工业界 context:是否值得标注"Amazon 实习论文"作为方法学注解?建议作为后续 9-13 早棒 extended note 锚入。
  6. 三篇精读的 GitHub-ready 落盘路径:本棒输出仅写入 inbox/flyp/,正式落盘需等同步任务串行合并到 published/。建议路径: - notes/2026-09-12_wmrl-world-model-rl-arxiv-2608-12564-reproduction.md - reviews/2026-09-12_wmrl-world-model-rl-arxiv-2608-12564-reproduction.md - notes/2026-09-12_think-before-you-link-reproduction.md - reviews/2026-09-12_think-before-you-link-reproduction.md - notes/2026-09-12_mapwam-reproduction-risk-arxiv-2609-11561.md - reviews/2026-09-12_mapwam-reproduction-risk-arxiv-2609-11561.md

本复现风险分析专文基于公开 arxiv 摘要 + GitHub README + 项目页 + flyp 9-12 weekly-deep-read critical review。未抓全文 PDF。如需精读全文请使用浏览器自动化或 web_fetch 抓取 arxiv.org/pdf/{2608.12564, 2609.10745, 2609.11561}。