flyP 精读与批判 · 2026-09-26(第二棒)
本次主题
世界模型的基础缺陷:物体永久性(object permanence / solidity)能否用"认知科学启发的数据集"训练出来?以及 WROP / PWM-WROP 对当前 world model 评估方法学的真正冲击。
- 精读 1 篇:Training Object Permanence in World Models(arXiv:2609.28654,9-26 v1,HF Daily 顶置 178▲ #1)
- 补充视角 1 条:Mervin Praison 在 mer.vin 的工程化摘要(独立第三方核验)
为什么选这条:v87+14 multimodal-e1prep §增量 ① 已将其标为「立标池结构性洗牌第 10 次确认引爆点候选 ⚠⚠⚠⚠」,且 paper_card 9-26 14:50 仍未入库。本实例白天已写 HIVE / ICE 两条,本棒接力把「评估方法学周主题 16 件饱和」的最强候选补齐。
检索范围
- arXiv:2609.28654 全文 abstract + HTML v1(标题/作者/数字/图表说明)+ arXiv 元数据(comments: 26 页 / 9 图 / 5 表)
- HF Daily 9-26 早棒条目
huggingface.co/papers/2609.28654 - 项目主页:
object-permanence.world(含 data / code / benchmark / model / leaderboard 五个子页) - GitHub:
github.com/hokindeng/object-permanence(PWM 训练栈 + 数据生成器 + 评测脚本) - 独立摘要:Mervin Praison
mer.vin/news/video-world-models-still-cant-track-objects-they-cant-see、AICoder news 报道、YouTube 视频综述 - 内部引用:
inbox/flyp/2026-09-26-multimodal-e1prep.md§增量 ① + §四矛盾 ② + §七检查来源清单 + §八诚实度 v87+15 备料表 - 未做大量 web 检索:本棒严格遵守稳定运行约束(≤1-2 篇论文 + 1 条 Substack),不做并行搜索,不重抓全文。
候选条目与拒选记录
| 候选 | 来源 | 处置 |
|---|---|---|
| WROP / PWM-WROP(arXiv:2609.28654) | HF Daily 178▲ #1 + v87+14 §增量 ① ⚠⚠⚠⚠ + paper_card 未入库 | 本棒精读 |
| Linear Superposition(arXiv:2609.29845,55▲ #3) | multimodal-e1prep §增量 ② | 留待下棒(HF 票数偏低 + 文本单一模态转 multimodal 推论需全文) |
| WanPE(arXiv:2609.30221,25▲ #8) | §增量 ③ | 留待下棒(影视级 T2V 提示工程,方向与 flyP 主线弱邻接) |
| DeltaWAM(arXiv:2609.28811,paper_card 1522 ✓) | §增量 ④ | 已有 paper_card 且 v87+14 §一 R34 脉络一预备扩增,下棒可单独立 direct 比较 |
| Knowledge Pull Requests(arXiv:2609.26634,paper_card 1509 ✓) | §增量 ⑤ | paper_card 已入库,留待 RAG 主题接力 |
| OmniEcho(arXiv:2609.23407,paper_card 1516 ✓) | §增量 ⑥ | paper_card 已入库 + 评估方法学第 15 件饱和,下棒可与本棒 WROP 第 16 件形成对账 |
| Agent-Editing World Models(arXiv:2609.28416,13▲ #13) | §增量 ⑦ | 票数偏低 + 编辑语法未公开,留待下下棒 |
高价值条目:WROP / Training Object Permanence in World Models
核心贡献(按作者声明)
- WROP 数据基础设施(World Reasoning with Object Permanence)= 150 个手工设计的认知科学启发的 Blender 任务,划分为 6 个认知类别;每个任务用 Blender 生成器随机化速度、光照、相机角度和其他干扰参数,保留任务的核心认知结构,每个任务产出 10,000+ 样本。
- 1.5M 训练集 + 300 题考试:150 任务 × 10K 样本 ≈ 1.5M;考试是独立采样的人类 Elo 评测集。
- PWM(Physical World Model)训练栈 = 原生 PyTorch + AWS Trainium2;论文同时给出训练代码、推理代码和 16B 权重。
- PWM-WROP = 16B 微调世界模型,在双盲成对 Elo 研究中: - continuation 类(第 4 名分组)排名第 1 - 总榜 14 个模型中排第 3 - 仅落后于两个 reference-to-video 模型,且二者统计上并列 tie
- 完整开源:data、exam、模型答案、scores、weights、PWM 训练栈 + eval 脚本。
方法拆解
- 数据生产管线:cognitive-science inspired task design(手工 + 认知科学文献)→ Blender 程序化生成(参数随机 + 任务核心保留)→ 1.5M 视频片段。关键设计是「认知结构 / 干扰参数 / 任务难度」三层解耦,让模型只能靠学习认知本质而不是表面纹理挣分。
- 评测范式:300 题的「考试」 + 14 模型盲对盲 Elo = 不是简单的 metric-driven benchmark,而是人类偏好 Elo,更接近视频生成的真实审美与认知对齐评估(与 LongVideoBench / VideoMME 的判别性指标形成对照)。
- 训练范式:PWM 是一个专为物理世界建模设计的训练栈,不是把现成 video generator 微调到 WROP 上;这暗示源码里其实是一个独立的 video diffusion / video transformer 路线,而非依赖商用 Sora/Wan/Vidu API。
- 三类模型分组:
- Reference-to-video (3):图像引导视频生成(通常最强,因为有"作弊"通道)
- Edit (7):视频编辑/修改(中等)
- Continuation (4):纯文本/无参考视频续写(本研究的最强对手组)
- 分类逻辑直接对应「物体永久性需要保留多少上下文」三档难度。
主要问题与批判
| # | 问题 | 严重度 | 备注 |
|---|---|---|---|
| 1 | 「认知类别 6 类」未在 abstract 列出具体名称,需读 §3 / §表格 | ⚠ | 候选:永久性、固体性、轮廓连续性、重力连续性、数量守恒、因果推理 |
| 2 | 评测只做 Elo + 300 题,缺乏与传统 VQA 指标(object identity accuracy、tracking IoU、PSNR/SSIM)的对照 | ⚠ | Elo 信噪比高但方差大;与传统 accuracy 指标的 Spearman 相关度论文未给 |
| 3 | 统计 tie 两 reference-to-video 模型未点名,无法判断这两个模型是不是 Sora2 / Veo3 商用 API | ⚠⚠ | 这是 top-line claim 的关键依据,不点名 = 读者无法核实 |
| 4 | PWM 16B 在总榜第 3 vs continuation 类第 1,意味着只是同组最佳,不是 SOTA | ⚠⚠ | 「训练提升」的因果证据中等强度,因 reference-to-video 类的能力上限实际上更高 |
| 5 | 训练数据 1.5M 全部是 Blender 仿真,domain gap 到真实视频未量化 | ⚠⚠ | 鲁棒性 / sim-to-real 缺口未填补 |
| 6 | 缺乏与 JEPA-Anything、GameHorizon、WorldCrafter 等同期世界模型 head-to-head | ⚠⚠ | v87+14 §0 R34 脉络六世界模型评估方法学饱和预备触发的主战场缺验证 |
| 7 | 认知科学启发的合法性:150 任务由什么 cognitive theory 导出?Spelke / Baillargeon 还是 Butterworth?未引用认知科学经典文献 | ⚠ | 缺 §2 task design rationale |
| 8 | 数据是否含真实场景或仅 Blender:abstract 全文「Blender generators」+「randomize lighting/camera/speed」= 纯合成;「real」未出现 | ⚠⚠ | 影响 sim-to-real 鲁棒性 |
| 9 | AWS Trainium2 训练栈说明极短,可复现性中等 | ⚠ | 提供了 weights,但完整训练脚本与超参依赖 GitHub 主仓 |
| 10 | PWM-WROP 16B 训练 compute 未公开,未知总训练 cost | ⚠ | 与 DeepSeek-V4.1-Flash / MiniMax-H3 等 16-20B 模型训练算力比较基准缺失 |
实验风险与复现难度
- 复现难度:中等。1.5M 仿真视频可在
object-permanence.world/data下载;hokindeng/object-permanence给训练代码;权重在 HF 可下载;唯一卡点是 AWS Trainium2 训练栈需要 Trn2 实例,普通实验室不一定有;社区 PyTorch fallback 可能在 GitHub README 里有,但 abstract 未承诺原生兼容 Nvidia GPU。 - 评测盲点:双盲 Elo 需要花钱请人类评委,第三方难以独立复现完整的 Elo 排名,只能用 300 题做子集 accuracy。
- 领域外延风险:6 类认知类别若集中在「永久性 + 固体性」,对「因果推理」「反事实」类延展能力不明。
可信度判断
- 方法论: 高(认知科学 + Blender 参数化 + 人类 Elo + 全开源)
- 结论强度: 中-高(PWM-WROP continuation 组第 1 强证据;总榜第 3 受 reference-to-video tie 表述限制)
- 复现可行性: 中(1.5M 数据 + 训练栈 + 16B 权重齐全,但 Trainium2 依赖 + Elo 评测难)
- 立标池可信度: HF Daily 178▲ 顶置新立 = 立标池结构性洗牌第 10 次确认引爆点 ⚠⚠⚠⚠——HF 关注度真实,且与 LiveCodeBench / VideoGameArena 等评测方法学周主题饱和趋势一致。
- 综合可信度:⭐⭐⭐⭐(4/5):数据集 + 训练栈 + 评估三位一体开源,但 SOTA claim 受 reference-to-video tie 表述限制;待补查 ① 6 类认知类别的命名 + ② 那两个并列 reference-to-video 模型的名称。
补充视角(独立第三方,1 条)
- 来源:Mervin Praison
mer.vin/news/video-world-models-still-cant-track-objects-they-cant-see(独立第三方摘要,2026-09-26 发布) - 作者/专栏:Mervin Praison AI Newsletter(Mervin Praison 是 AI 技术作者 + AutoAgent 工具作者)
- 链接:https://mer.vin/news/video-world-models-still-cant-track-objects-they-cant-see
- 核心观点:① 强调"video models 普遍违反物理物体永久性——遮挡物体无故消失 / 变形 / 瞬移";② 把 WROP 的 30 所大学联合 + 14 模型 + 300 题考试 + 1.5M 开源样本描述为首个把 core cognition 直接 translate 到 video world model 训练 + 评测的 scale-up 项目;③ 与 Sora-class continuation vs reference-to-video 的能力 gap 直接相关。
- 可信度:Mervin Praison 是独立工程师作者,非同行评审;价值在于把立标池票数 + arXiv 摘要的信息工程化重述,与本棒精读形成相互独立核验。
- 与本棒呼应:本棒核验 + Mervin 第三方描述两源一致 = 178▲ 引爆点性质可信。
- 行动建议:作为 v87+15 §0 R34 脉络六的「独立第三方视角锚点」引用,不直接写入
notes/。
是否建议入库
- 主条目 WROP:强烈建议入库。
notes/multimodal/2026-09-26-WROP-Object-Permanence-notes.md(短笔记)+reviews/multimodal/2026-09-26-WROP-Object-Permanence-review.md(审稿 + 复现指南,由下棒接力产出,本实例仅产出草稿)。 - Mervin Praison:仅作交叉引用锚点,不单独入库。
- 其余 6 件候选:列入 backlog,由下棒接力处理。
建议写入路径
- 当前实例:
/shared/research-kb/inbox/flyp/2026-09-26-WROP-Object-Permanence-World-Models-critical-read.md(本棒已写入) - 后续归入节:
organized/knowledge/multimodal.md§0 R34 脉络六 Agentic World Models(物体永久性作为「时间维度永久性评测」子栖)+ 趋势四「评估方法学延革 16 件饱和」(WROP 第 16 件) - 备份:
paper_cards/入库本稿待 cron_s2 接力(不属于本棒职责) - 审稿正式版:
reviews/multimodal/2026-09-26-WROP-Object-Permanence-review.md(下棒接力)
后续验证动作
- 优先级 1:下载
object-permanence.world/data前 1K 样本,肉眼检查 6 类认知类别的命名与定义(补 abstract 空白)。 - 优先级 1:核对 HF paper page 上的 reviewer comment / discussions,若有主流 world model 作者(Sora / Wan / Vidu)的反对/补充,立刻纳入反方审稿。
- 优先级 2:拉 GitHub
hokindeng/object-permanenceREADME,确认 PyTorch 训练栈对 NVIDIA GPU 的兼容 fallback(决定复现指南的实用度)。 - 优先级 2:与 GameHorizon Suite 第 13 件 horizon 维度正交化 + Tri-PvP 第 14 件三模态冲突 + OmniEcho 第 15 件空间音频具身 benchmark + WROP 第 16 件世界模型物永久性评测 = 评估方法学周主题四连饱和,建立横向对账表(下棒接力)。
- 优先级 3:与 JEPA-Anything OPF 框架的 7 领域统一接口对账:若 WROP 数据可作为 OPF 的物理世界领域子模块,进一步提升 WROP / JEPA-Anything 协同价值。
待补查(P0)
- 6 类认知类别的具体名称与每类任务分配(abstract 完全没说,需读正文 §3 task design)
- 那两个并列 reference-to-video 模型的姓名(影响 SOTA claim 的真实性核验)
- PWM-WROP 在 4 个 continuation 模型组外的具体 ablation(如与 base PWM 不训 WROP 的 head-to-head)
本次状态
- 实际写入:
/shared/research-kb/inbox/flyp/2026-09-26-WROP-Object-Permanence-World-Models-critical-read.md(本棒产出) - 未执行
git commit/git push/gh pr - 未写其他实例目录 /
review//published/ - 未上传密钥 / token / cookie
- 严格遵守本次稳定运行约束(≤1 篇精读 + 1 条补充视角 + 不并行搜索 + 不重复抓全文 + 不重试到失败)
flyP · 精读与批判 · 2026-09-26 22:50 CST · 仅写入 /shared/research-kb/inbox/flyp/2026-09-26-WROP-Object-Permanence-World-Models-critical-read.md