ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs

  • 关联论文:2609.10895
  • 作者:Tom
  • 更新:2026-09-15

一句话结论

现有 MLLM 在突发物理危险面前几乎无法可靠反应:约 1/3 的危险场景处理错误、不随模型规模增长而改善——ReactHuman 首次用 240Hz 刚体仿真提供了可复现的诊断基准与训练信号。

解决什么真问题

将 MLLM 部署为家庭机器人决策核心的硬性前提,是其能对突发物理危险做出即时、安全关键的动作反应(接住滑落的盘子、躲避坠落刀具等)。然而现有评测均无法衡量这一能力:要么通过视频问答被动探测直觉物理,要么考察导航、重排等长程任务。没有任何基准测试模型是否能把物理理解转化为即时、安全关键的动作。ReactHuman 填补了这一空白。

核心方法

基准构建

  • 场景来源:17 个事件家族、1,000+ 逐比特可复现场景;场景由 240Hz 刚体仿真自动生成,无需人工标注 ground truth。
  • 对抗性物体设计:引入了外观与物理特性相矛盾的物体(如泡沫大锤、钢制苹果),测试模型是否能超越外观做出物理判断。
  • 物理仿真验证:每项承诺的动作计划均通过物理引擎实际执行,使决策具有可观测的后果。

评估指标体系

五维指标覆盖三个轴: - Reasonable(合理性) - Safe(安全性) - Physically Grounded(物理可解释性)

被测模型

7 个代表性 MLLM,覆盖不同规模与架构。

关键实验与数据

  • 安全失败率:模型约对 1/3 的危险处理失误。
  • 固定 disposition 行为:模型从固定 disposition 而非观察到的场景出发做出反应。
  • 外观 > 运动:模型倾向于信任外观而非运动信息。
  • 米级截击点漏判:即便所选动作正确,模型也常错过截击时机。
  • 尺度不收敛:上述失败模式均不随模型规模增长而缩小(原文未明确具体数字)。

亮点与局限

亮点

  • 首个物理可执行的 reactive decision-making 基准,物理 ground truth 来源于仿真而非人工标注,消除标注噪声。
  • 对抗性物体设计精巧,能暴露"以貌取物"的浅层理解问题。
  • 五维三轴指标比单一准确率更有诊断价值,可指引训练方向。

局限

  • 基准依赖仿真环境,与真实家庭场景的物理复杂度可能仍有差距(原文未明确 sim-to-real gap)。
  • 仅覆盖 household hazards,泛化到其他场景待测。
  • 模型规模实验的结论("不随规模改善")需更多模型覆盖才能确证。

对工程落地的启发

  1. 安全关键场景的 MLLM 部署前必须用 reactive benchmark 做红线验证,而非仅靠 QA 指标乐观外推。
  2. 外观-物理解耦是关键训练目标:当前模型容易被外观欺骗,工程上需要专门设计对抗性外观的训练数据。
  3. 固定 disposition 行为说明 MLLM 倾向于记忆而非实时推理,具身推理需要在回路中引入更强的场景感知信号。
  4. 尺度定律在此问题上的失效表明,单纯增大模型不是解法,数据与评测设计比 scale 更重要。

与同方向工作的关系

  • 现有具身评测(如 ALFRED、MetaWorld)聚焦长程任务规划,ReactHuman 补全了毫秒级 reactive decision-making这一维度。
  • 与 PHYRE 等物理推理基准不同,ReactHuman 要求动作执行而非仅问答。
  • 与 RT 系列等端到端具身策略不同,ReactHuman 以 MLLM 为决策核心,测试语言-动作转换的可靠性。
  • 泡沫大锤等对抗性物体的思路,与 CV 领域 adversarial robustness 密切相关,但扩展到了物理交互层面。

适合谁读

  • 具身智能研究者:构建以 MLLM 为核心的家庭机器人,需了解当前 reactive safety 的严重缺陷。
  • 多模态模型评测研究者:寻找比 QA 更有诊断力的 benchmark 设计范本。
  • 安全关键 AI 工程师:理解为什么现有 SOTA MLLM 在实时安全决策上不可靠,以及需要在哪些方向改进。
  • 游戏/仿真环境开发者:利用其 240Hz 仿真 ground truth 生成管线构建自己的物理评测场景。

⚠️ 本文部分实验数字(各模型具体安全失败率)原文未给出精确数值,基于"roughly one hazard in three"等描述标注;对抗性物体具体列表、模型名称与规模对应关系建议参考原文 Table 1。