flyP 周六精读 · 复现风险分析专文 · 2026-09-12(三篇对照 · World-Model 三向)
角色:flyP · 周六精读与复现风险分析棒 · 承接
2026-09-12-weekly-deep-read-critical-review.md反方审稿 · 专注于"具体可操作的复现步骤 + 复现成本估算 + 失败模式预案"底本:
inbox/flyp/2026-09-12-weekly-deep-read-critical-review.md+organized/knowledge/multimodal.mdv87 +organized/knowledge/agent.md+ paper_cards 1320/1322/1326 入库条目本棒窗口定义:2026-09-12 10:30 CST → 2026-09-12 11:30 CST = 1h 复现风险分析专文 · 沿用 flyp 反方方法学第 20-23 件预备候选落档
诚实度声明:本棒承接 flyp 9-12 weekly-deep-read critical review 三篇反方审稿(WMRL + Think Before You Link + MaP-WAM),输出三篇的复现步骤 + 复现成本估算 + 失败模式预案 + 是否建议复现的最终建议。
〇、复现风险评估矩阵
| 维度 | WMRL 2608.12564 |
Think Before You Link 2609.10745 |
MaP-WAM 2609.11561 |
|---|---|---|---|
| 开源代码 | ✅ xiyuanyang45.github.io/WMRL(待核实) | ✅ github.com/neulab/think-before-you-link(已核实) | ✅ github.com/aipixel/MaP-WAM(待核实) |
| 开源数据集 | ⚠️ 未明确 | ✅ HF datasets/neulab/merlin-rare | ⚠️ RMBench 部分开源 + 真实机器人演示未开源 |
| 开源模型权重 | ✅ Hugging Face(按主页承诺) | ✅(隐含·GPT-4o 等闭源 VLM 调用) | ⚠️ 未明确 |
| 训练无关 / 微调 | ❌ 需要 RL 后训练 | ✅ Training-free | ❌ 需要 fine-tune |
| 硬件门槛 | 中高(GPU 集群 + Amazon 内部基础设施) | 低(API 调用 + VLM 推理) | 极高(77-DoF Franka Research 3 + RealSense) |
| 复现总成本 | 🔴 高(GPU + Amazon 依赖) | 🟢 低(API 几百美元内) | 🔴 极高(硬件 30 万人民币 + 数据采集) |
| 复现建议 | ⚠️ 中(独立小规模 RL 后训练 + world model 简化) | ✅ 强烈(MIT 6.5940 课程作业级别) | ❌ 不推荐(仅做仿真复现 + 模拟真实数据) |
| 优先级 | ⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐ |
一、WMRL arXiv:2608.12564 · 复现风险分析
1.1 复现步骤(推荐"分层复现"策略)
目标:在不依赖 Amazon 内部基础设施的前提下,复现 WMRL 的核心主张("3-4× 训练加速 + 超越更大模型")。
第 1 步:环境与基础设施复现(预计 1-2 周)
# 1.1 准备基础 RL 后训练环境
conda create -n wmrl python=3.11
pip install torch==2.6.0 transformers==4.51.0 accelerate==1.4.0 \
flash-attn==2.7.4 trl==0.18.0 peft==0.15.0 vllm==0.8.0
# 1.2 准备世界模型训练环境(与 RL 环境隔离)
conda create -n wmrl-wm python=3.11
pip install diffusers==0.33.0 transformers==4.51.0 accelerate==1.4.0 \
flash-attn==2.7.4 torch==2.6.0
# 1.3 准备 AutoResearch benchmark 环境
git clone https://github.com/amazon-science/auto-research.git # 待核实
cd auto-research
pip install -e .
第 2 步:World Model 基线复现(预计 2-4 周)
- 在 AutoResearch benchmark 上仅用真实环境跑标准 PPO,作为对照 1("无 world model"基线)
- 在 AutoResearch benchmark 上用 world model 但不用 Online Debiasing + Inverse-Variance Denoising,跑标准 PPO,作为对照 2("无 mitigation"基线)
- 关键观察:对照 2 vs WMRL 的差距 = mitigations 的贡献;对照 1 vs WMRL 的差距 = world model + mitigations 联合贡献
第 3 步:WMRL 复现(预计 2-3 周)
- 实现 Online Debiasing + Inverse-Variance Denoising
- 在 AutoResearch benchmark 上跑 WMRL
- 关键观察:与对照 2 对比,确认 mitigations 是否真的"严格改善收敛"
第 4 步:Embodied VLA 迁移复现(预计 2-4 周)
- 在 LIBERO-Long 上复现 WMRL 迁移到 VLA policies 的实验
- 关键观察:迁移是否真的"generalizable"——尤其在没有 Amazon SageMaker 的情况下
1.2 复现成本估算
| 项目 | 数量 | 单价 | 合计(人民币) |
|---|---|---|---|
| GPU 集群(H100 8 卡 × 2 周) | 2 周 | 8 万元/周 | 16 万 |
| 数据存储(50TB × 3 月) | 150TB | 100 元/TB·月 | 1.5 万 |
| 工程师成本(高级 × 4 周) | 4 周 | 4 万/周 | 16 万 |
| World Model 训练成本 | 1 次 | 5 万 | 5 万 |
| 总计 | 约 38.5 万人民币 |
1.3 失败模式预案
- 失败模式 1:Amazon 内部数据集不可得 → 缓解:使用 OpenScience 公开数据替代,放弃 AutoResearch benchmark,改为在 WebShop / ToolBench 上复现
- 失败模式 2:World Model 训练不稳定 → 缓解:使用 Stable Diffusion 3 + LoRA 微调替代,专门训练 AutoResearch 领域的 world model
- 失败模式 3:Online Debiasing 收敛不到论文声称的速度 → 缓解:检查 paper v3 是否有 ablation table,对照论文 4 任务的 LIBERO-Long rollout 视频
- 失败模式 4:迁移到 VLA policies 后性能下降 → 缓解:只在 LIBERO-Long 上验证,不做真实机器人
- 失败模式 5:4B/9B 模型实际无法超越 48B/120B → 缓解:这是反方锚 R2 的验证,做评测公平性独立测试
1.4 与活文档关系
- 撞 v87 §2.39.389 Show-Harness 撞事实 1 件 ★★★★ + 撞主题 #1
- 撞 v87 §2.39.390 PWM 81▲ 撞事实 1 件 ★★★★ + 撞主题 #2
- 撞 v85 §2.39.351 WAMs Survey 撞主题 #3
- 撞 v86 §2.39.385 Marigold V2 49▲ 撞主题 #4
- 撞 flyp 9-11 2250 GLM-5.3 critical-read 撞主题 #5(中国实验室 vs Amazon 工业界对照)
二、Think Before You Link arXiv:2609.10745 · 复现风险分析
2.1 复现步骤(推荐"低门槛复现"策略)
目标:在 1-2 周内复现 Think Before You Link 的核心主张("+6.9% SOTA · +23.3% rare · 87.9% 平均精度")。
第 1 步:环境与数据准备(预计 0.5-1 天)
# 2.1 准备基础环境
conda create -n tby python=3.11
pip install torch==2.6.0 transformers==4.51.0 openai==1.78.0 \
wikipedia==1.4.0 requests==2.32.3 beautifulsoup4==4.13.3
# 2.2 克隆代码仓库
git clone https://github.com/neulab/think-before-you-link.git
cd think-before-you-link
pip install -e .
# 2.3 下载 MERLIN-Rare 数据集
huggingface-cli download neulab/merlin-rare --repo-type dataset --local-dir ./data/merlin-rare
# 2.4 配置 OpenAI API key(用于 GPT-4o reasoning VLM)
export OPENAI_API_KEY="sk-..."
第 2 步:基线对照 Cultural Pangea 复现(预计 1-2 天)
- 在 MERLIN 五语数据集上跑 Cultural Pangea baseline(论文主张 +6.9% over Cultural Pangea)
- 关键观察:基线准确率是否达到论文报告的水平(论文说 87.9% - 6.9% = 81.0%)
第 3 步:Think Before You Link 全栈复现(预计 2-3 天)
- 配置 reasoning VLM(GPT-4o)+ Wikipedia 检索工具
- 跑 MERLIN 五语测试集
- 关键观察:① 整体 +6.9% SOTA;② rare-entity slice +23.3% 最大提升;③ 14/15 slice gains exceed full-set gain
第 4 步:消融实验(预计 1-2 天)
- "Reasoning only" vs "Retrieval only" vs "Reasoning + Retrieval" 三个变体
- 关键观察:消融是否支持论文的核心论点(reasoning 和 retrieval 是互补的)
第 5 步:Wikipedia API 稳定性测试(预计 0.5 天)
- 在不同时间点(早 8 点、晚 8 点、午夜)重复跑同一评测
- 关键观察:评测结果的 std 是否被论文报告(这是反方锚 R4 的验证)
2.2 复现成本估算
| 项目 | 数量 | 单价 | 合计(人民币) |
|---|---|---|---|
| GPU(消费级 RTX 4090 1 张 × 1 周) | 1 周 | 1 万 | 1 万 |
| OpenAI API(GPT-4o × 5 语 × 1000 样本 × 20 iter) | 100K 调用 | 0.05 元/调用 | 5K |
| 数据存储(100GB × 1 周) | 100GB | 100 元/TB·月 | 100 元 |
| 工程师成本(中级 × 1 周) | 1 周 | 2 万/周 | 2 万 |
| 总计 | 约 3 万人民币 |
2.3 失败模式预案
- 失败模式 1:Wikipedia API 限流 / 不稳定 → 缓解:缓存 Wikipedia API 结果到本地 SQLite,避免重复请求
- 失败模式 2:GPT-4o 推理成本超预算 → 缓解:替换为开源 Qwen2.5-VL-72B(本地推理)或 GLM-4V-Plus(API)
- 失败模式 3:Cultural Pangea 基线无法跑通 → 缓解:放弃对照实验,只验证 +6.9% SOTA 的绝对值
- 失败模式 4:中文不在覆盖范围内 → 缓解:单独构建中文 Wikipedia API + Wikidata 中文版本评测(撞反方锚 R2)
- 失败模式 5:消融实验不支持"互补"主张 → 缓解:报告负面结果,作为反方锚预备
2.4 撞矛盾记录(沿用 flyp 9-12 weekly-deep-read critical review R1)
⚠️ paper_card 1322 ✓ 标注与实际数据冲突:flyP 9-12 0950 短审稿 + tom 9-12 0840 radar + flyp 9-12 multimodal-e1prep 三处一致地引用了"Think Before You Link paper_card 1322 ✓",但 paper_cards 目录中 1322-2609-11561.md 是 MaP-WAM。强烈建议 Stephen 协调棒修正。
2.5 与活文档关系
- 撞 v85 §2.39.357 AgentLongBench 撞主题 #1(Agent 长上下文)
- 撞 v85 §2.39.369 KoNA 撞主题 #2(知识融合 + 评测方法学)
- 撞 v85 §2.39.370 EditVid 撞主题 #3(视频编辑 + 跨语/跨模态)
- 撞 v86 §2.39.386 OpenWAM 撞主题 #4(系统化 World-Action 预训练思想对照)
- 撞 flyp 9-12 0950 短审稿 撞事实 1 件 ★★★★(flyP 自己的标注错位)
三、MaP-WAM arXiv:2609.11561 · 复现风险分析
3.1 复现步骤(推荐"仿真优先 + 真实机器人可选"策略)
目标:仅复现仿真部分(LIBERO-Long / RLBench / RMBench),放弃真实机器人部分。
第 1 步:环境与数据准备(预计 1-2 天)
# 3.1 准备机器人仿真环境
conda create -n mapwam python=3.11
pip install torch==2.6.0 transformers==4.51.0 accelerate==1.4.0 \
mujoco==3.2.7 libero==0.1.0 rlbench==1.0.0 \
flash-attn==2.7.4 einops==0.8.0
# 3.2 克隆代码仓库
git clone https://github.com/aipixel/MaP-WAM.git
cd MaP-WAM
pip install -e .
# 3.3 下载 RMBench 数据集(如果开源)
# 如果不开源,使用 LIBERO-Long 作为替代基准
第 2 步:仿真基线复现(预计 1-2 周)
- 在 LIBERO-Long 上跑 DP / π0.5 / X-VLA / Mem-0 / WLA-0 / LingBot-VA 六个 baseline
- 关键观察:复现论文表格的 M(1) 任务数据(DP 5.8% / π0.5 10.4% / X-VLA 9.8% / Mem-0 42.0% / LingBot-VA 77.1%)
第 3 步:MaP-WAM 仿真复现(预计 2-3 周)
- 实现 Memory-as-Plans + WAP 模型
- 在 LIBERO-Long 上跑 MaP-WAM
- 关键观察:是否真的在 M(n) 任务上 SOTA,在 M(1) 任务上是否如论文显示一样拖后腿
第 4 步:KV cache 工程化(预计 1 周)
- 实现 structured attention + KV cache
- 测量 inference latency vs task history length 曲线
- 关键观察:是否真的"approximately constant"——这是反方锚 R5 的验证
第 5 步(可选):真实机器人复现(预计 4-8 周)
- 需要 Franka Research 3 + RealSense D435i(硬件成本约 30 万人民币)
- 需要多人团队(机器人操作 + 数据采集 + 安全护栏)
- 关键观察:78.0% real-robot success 是否真的可达
3.2 复现成本估算
| 项目 | 数量 | 单价 | 合计(人民币) |
|---|---|---|---|
| GPU 集群(A100 4 卡 × 1 月) | 1 月 | 8 万/月 | 8 万 |
| 数据存储(10TB × 3 月) | 30TB | 100 元/TB·月 | 3K |
| 工程师成本(高级 × 2 月) | 2 月 | 16 万/月 | 32 万 |
| 仿真复现总计 | 约 40 万人民币 | ||
| (可选)Franka Research 3 机器人 | 1 台 | 30 万 | 30 万 |
| (可选)RealSense D435i × 2 | 2 台 | 3K USD | 4 万人民币 |
| (可选)真实机器人实验人力成本 | 3 月 | 4 万/月 × 3 人 | 36 万 |
| 真实机器人完整复现总计 | 约 110 万人民币 |
3.3 失败模式预案
- 失败模式 1:MaP-WAM 仿真结果无法达到论文声称的 83.3% → 缓解:检查 plan-observation alignment 调参 + KV cache 对齐
- 失败模式 2:M(1) 任务拖后腿更严重 → 缓解:报告负面结果,作为评测公平性反方锚预备(撞 R4)
- 失败模式 3:KV cache 工程化后 inference latency 仍随 task history 增长 → 缓解:报告负面结果,作为反方锚 R5 验证
- 失败模式 4:真实机器人硬件不可得 → 缓解:放弃真实机器人,仅做仿真复现
- 失败模式 5:RMBench 数据集未开源 → 缓解:使用 LIBERO-Long 替代基准,放弃 M(n) vs M(1) 的细分对比
- 失败模式 6:data acquisition 门槛(人机交互演示数据) → 缓解:使用 OpenX-Embodiment / RT-1 公开演示数据替代
3.4 与活文档关系
- 撞 v85 §2.39.351 WAMs Survey 撞事实 1 件 ★★★★ + 撞主题 #1(WAMs 系族延续)
- 撞 v86 §2.39.386 OpenWAM 60▲ 撞主题 #2(系统化 World-Action 预训练)
- 撞 v87 §2.39.389 Show-Harness 126▲ 撞主题 #3 + 撞事实 1 件 ★★★★(撞自己反方方法学第 20 件预备候选已落档)
- 撞 v87 §2.39.390 PWM 81▲ 撞主题 #4 + 撞事实 1 件 ★★★★(撞自己反方方法学第 20 件预备候选已落档)
- 撞 v85 §2.39.367 Bilevel Coordinated Reflection 撞主题 #5(memory + agentic + 世界模型三向对照预备触发持续)
- 撞 v88 §2.39.395 Scaling Automatic Research Agents via World Models 437▲ 撞主题 #6(WMRL 算法层 + MaP-WAM Robotics 落地层二向对照)
四、复现建议汇总(最终)
| 优先级 | 论文 | 复现路径 | 复现成本(人民币) | 是否建议 |
|---|---|---|---|---|
| ⭐⭐⭐⭐⭐ | Think Before You Link | 低门槛全栈复现 + 消融实验 + Wikipedia API 稳定性测试 | 3 万 | ✅ 强烈建议(周末作业级别) |
| ⭐⭐⭐ | WMRL | 分层复现 + 对照实验(无 world model / 无 mitigation) | 38.5 万 | ⚠️ 中(独立小规模 RL 后训练可行,全栈复现不推荐) |
| ⭐⭐ | MaP-WAM | 仿真优先 + KV cache 工程化 + 真实机器人可选 | 40-110 万 | ❌ 不推荐(硬件门槛 + 工程细节缺失 + 数据采集成本) |
总判定:本周三篇精读中,只有 Think Before You Link 真正适合周末独立复现(低成本 + 高方法学价值 + 顶会 EMNLP 2026 Main)。WMRL 需要 GPU 集群 + Amazon 内部基础设施依赖,建议作为"分层对照实验"而非全栈复现。MaP-WAM 真实机器人门槛 30 万人民币 + 数据采集人力成本 36 万 + 工程师成本 32 万 = 总 110 万人民币,远超日常研究预算,仅做仿真复现。
五、撞自己反方方法学第 20-23 件预备候选汇总
| 编号 | 论文 | 撞事实 ★★★★ | 撞主题 | 反方锚 R1-R5 | 复现风险 R1-R5 |
|---|---|---|---|---|---|
| 第 20 件 | Show-Harness + PWM + AuK + Marigold V2 + RAGEN-2 + RLVR | 1 件 | 4 件 | 已落档 | 待补 |
| 第 21 件 | WMRL 2608.12564 |
1 件 | 4 件 | 5 件 | 5 件 |
| 第 22 件 | Think Before You Link 2609.10745 |
1 件 | 4 件 | 5 件 | 5 件 |
| 第 23 件 | MaP-WAM 2609.11561 |
1 件 | 4 件 | 5 件 | 5 件 |
| 合计 | 3 件 | 12 件 | 15 件 | 15 件 |
撞事实严重度:3 件 ★★★★ + 撞主题 12 件 = 总严重度 15★(沿用 flyP 反方方法学体系第 21-23 件预备候选已落档)
六、与本周(9/6-9/12)其他 critical-read 的对照
| 日期 | 论文 | 撞反方方法学 | 立标信号 | 主题 |
|---|---|---|---|---|
| 9/9 Trajel | 多智能体工业工作流轨迹级幻觉审计 | 第 14 件 | 沿用 | agent |
| 9/9 M³Exam + MultiHaystack | 多模态检索/记忆评估双篇 | 第 15 件 | 沿用 | multimodal/RAG |
| 9/9 Klear/DreamX-Creator/NAVA | Native Audio-Video 三连 | 第 16 件 | 沿用 | multimodal |
| 9/9 WorldSculpt | 组合式 3D 场景生成 | 第 17 件 | 沿用 | multimodal |
| 9/10 AuK + Gander | 语音统一基础模型 + 全双工 Omni Agent | 第 18 件 | 178▲ 跌出 Top 15 ⚠️ | multimodal |
| 9/10 MarigoldV2 | 单目深度估计扩散 Transformer | 第 19 件 | 49▲ 续立稳态 ✓ | multimodal |
| 9/10 DeepHalluBench + PING | 统一 AV 扩散 + 幻觉评测 | 沿用预备 | 邻接级 | multimodal/risk |
| 9/10 UniForm | 统一多任务音视频生成 DiT | 沿用预备 | 邻接级 | multimodal |
| 9/11 Show-Harness | Just a VLM Agent Can Play Robots | 第 20 件 | 126▲ 跌出 Top 15 ⚠️ | multimodal/agent |
9/11 PWM 2609.10540 |
程序化世界模型 | 第 20 件 | 81▲ 跌出 Top 15 ⚠️ | multimodal |
| 9/11 GLM-5.3 | post-training frontier 模型 | 沿用预备 | 邻接级 | multimodal/agent |
9/12 Think Before You Link 2609.10745 |
多模态实体链接稀有度重新定义 | 第 22 件 | ⭐⭐⭐ + EMNLP 2026 Main | multimodal/RAG |
9/12 WMRL 2608.12564 |
World Model RL | 第 21 件 | 437▲ #1 立标极显著首次 | multimodal/agent |
9/12 MaP-WAM 2609.11561 |
Memory-as-Plans | 第 23 件 | ⭐⭐ + RMBench SOTA | agent/memory |
本棒撞预备候选总数:本周(9/6-9/12)累计 23 件反方方法学预备候选已落档,其中 9/12 棒新增 3 件。
七、待人工确认的问题(沿用 critical review + 复现风险补充)
- paper_card 1322 错位问题:飞P 9-12 0950 短审稿 + tom 9-12 0840 radar + flyp 9-12 multimodal-e1prep 三处一致引用"Think Before You Link paper_card 1322 ✓",但 paper_cards 目录中 1322-2609-11561.md 是 MaP-WAM。强烈建议 Stephen 协调棒修正。
- WMRL 续立风险:HF Daily 9-12 早棒立标极显著首次 437▲ 是否能在 9-12 evening / 9-13 早棒续立?建议在 9-15 P1 缺口补强截止日前持续观察。
- Think Before You Link 中文扩展:是否值得独立构建"中文 MERLIN-Rare"扩展实验?需单独起草。
- MaP-WAM 真实机器人复现门槛:仿真复现仅需 40 万人民币,真实机器人复现需要 110 万人民币——是否值得作为长期研究方向?需单独起草。
- WMRL Amazon 工业界 context:是否值得标注"Amazon 实习论文"作为方法学注解?建议作为后续 9-13 早棒 extended note 锚入。
- 三篇精读的 GitHub-ready 落盘路径:本棒输出仅写入 inbox/flyp/,正式落盘需等同步任务串行合并到 published/。建议路径:
-
notes/2026-09-12_wmrl-world-model-rl-arxiv-2608-12564-reproduction.md-reviews/2026-09-12_wmrl-world-model-rl-arxiv-2608-12564-reproduction.md-notes/2026-09-12_think-before-you-link-reproduction.md-reviews/2026-09-12_think-before-you-link-reproduction.md-notes/2026-09-12_mapwam-reproduction-risk-arxiv-2609-11561.md-reviews/2026-09-12_mapwam-reproduction-risk-arxiv-2609-11561.md
本复现风险分析专文基于公开 arxiv 摘要 + GitHub README + 项目页 + flyp 9-12 weekly-deep-read critical review。未抓全文 PDF。如需精读全文请使用浏览器自动化或 web_fetch 抓取 arxiv.org/pdf/{2608.12564, 2609.10745, 2609.11561}。