World Embedding Benchmark:视频表征的物理信息编码评测

  • 关联论文:2610.03632
  • 作者:Tom
  • 更新:2026-10-05

一句话结论

World Embedding Benchmark 构建了 8,000 个跨流体力学/固体力学/动力学/光电物理的仿真案例,首次系统揭示预训练视频表征在「跨模态物理对齐」与「定量物理信息可恢复性」之间存在 trade-off:强化 alignment 会损害 property regression,反之亦然。

解决什么真问题

World Model 和视频生成领域近年对「物理保真度(Physical Fidelity)」的关注急剧上升——一个能作为世界模型的视频生成系统,必须能生成物理上合理的结果,而不只是视觉上逼真。

但一个关键问题长期缺乏系统研究:视频表征(video embeddings)到底编码了多少物理世界的信息?这些信息有多容易被提取出来?

举例来说:一个 embedding 可以识别「这是流体」,但能否区分「高粘度流体 vs 低粘度流体」?能否区分「弹性体 vs 塑性体」?这种区分能力对 RAG 场景(用视频检索辅助生成)、物理估计、物理仿真验证都很关键。

World Embedding Benchmark 正是为回答这个问题而生。

核心方法

数据集构建

  • 8,000 个仿真案例,来自 80 个物理场景家族(physics families)
  • 四大物理领域:流体力学、固体力学、动力学、光电与电磁学
  • 每个案例:渲染视频(rendered video)+ 仿真导出的物理标注(physical annotations)

三项互补评测任务

论文设计了三类任务来区分两种能力:

任务 1:Text-Video Retrieval(文本-视频检索) 给定物理描述文本,检索相关视频。衡量 cross-modal physical alignment。

任务 2:Physical-Property Regression(物理属性回归) 给定视频,预测定量物理参数(如粘度、刚度、摩擦系数等)。衡量 quantitative physical information recoverability。

任务 3:Multiple-Choice Video-Description Pair Classification(视频描述对分类) 给定视频和多个描述(其中一个正确),判断哪个描述匹配该视频。同样是 alignment 指标,但比任务 1 更细粒度。

关键实验发现

发现 1:预训练 Omni-Modal Embedding 模型表现弱

评测了多个预训练的 omni-modal embedding 模型,结果: - 检索(任务 1/3):弱(weak retrieval) - 家族内描述对分类(任务 3):near-chance(接近随机)

说明当前视频表征的物理对齐能力严重不足。

发现 2:轻量级 Probe 能从冻结 Embedding 中恢复有用物理信息

尽管 embedding 的 zero-shot 物理能力弱,但用轻量级 probes(线性探测或小 MLP)从冻结的 video embedding 中可以恢复出有意义的物理属性——说明物理信息是被编码的,只是没有通过 similarity-based metrics 体现出来。

发现 3:Align 与 Property Regression 存在 Trade-off

用 physics-specific video-text pairs 做持续对比学习微调(continual contrastive training): - 检索和家族内分类 ↑(alignment 改善) - Physical-property regression ↓(定量信息恢复能力下降)

这是一个重要的发现:对齐物理语言描述与优化定量物理参数是相互制约的两种目标。

发现 4:视频 RAG 能提升视频生成物理保真度

用 embedding 检索参考视频给 MiniMax-H3 的 RAG 生成提供物理证据。检索模型越强(RAG retrieval score 越高),生成视频的物理保真度提升越大。

亮点与局限

亮点: - 首个系统区分「跨模态对齐」和「定量信息可恢复性」两大维度的 benchmark - 80 个物理家族 × 8,000 案例,数据规模和覆盖面前所未有 - 揭示了 alignment vs property regression 的核心 trade-off,这是重要理论贡献

局限: - benchmark 基于仿真环境,与真实世界视频存在 domain gap;论文未讨论仿真与实拍视频之间的泛化问题 - 持续对比学习的方法描述较简略,具体训练策略原文未详细展开 - 论文聚焦于表征评测,对改进表征本身的方法论贡献有限

对工程落地的启发

  1. 视频 RAG 的 retrieval 质量直接影响生成物理保真度:如果目标是物理相关的视频生成/检索,检索模型 strength 是关键瓶颈
  2. 用轻量 probes 提取物理属性是一个低成本方案——不需要重训 embedding,用 linear probe 就能挖掘现成表征的物理知识
  3. alignment 和 property regression 不可兼得:如果你的系统同时需要文本-视频对齐和精确物理估计,需要引入多任务学习或分离这两个目标,而不是用单一 embedding
  4. 视频生成团队在做 RAG 增强时,应显式评估 retrieval 是否真的在提供物理相关证据,而非只评估视觉相似度

与同方向工作的关系

工作 方法 与 WEB 的关系
VBench / VBench++ 视觉质量多维评分 WEB 专注物理维度,不同于整体视觉美学
PhysGaussian / PhysDreamer 物理仿真+生成 WEB 评估表征层,不直接做生成
MVBench / MLLM Bench 多模态任务评测 WEB 聚焦物理表征这一细粒度维度

适合谁读

  • 视频生成 / World Model 研究者
  • 视频 RAG 系统工程师
  • 多模态 embedding 评测设计者
  • cs.CV 方向关注视频表征学习的研究者

来源:arXiv abstract (https://arxiv.org/abs/2610.03632) + HTML version (https://arxiv.org/html/2610.03632v1) · 精确实验数值原文摘要页未给出,详见论文 Table · 作者:Chenghao Xiao 等(上海财经大学)