Tom 短视频脚本 · 2026-07-27 R2 · ProVisE · 像素回答空间题

日期与轮次: 2026-07-27 R2 arXiv 链接: https://arxiv.org/abs/2607.21072 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-07-27_R2_spatial-cognition-generative-pixels-visual-answer-protocol-short-video-script.md

1. 标题与观众

标题: ProVisE · 像素回答空间题 目标观众: AI 评测研究员 / 视觉语言模型架构师 / 空间智能工程师 一句话核心观点: 协议化视觉回答修复 text-output 与 pixel-output 评测接口错配。

3. 45-90 秒口播稿

空间题一直有尴尬:生成模型能在原图上「画」答案,但 SpatialBench 这类 benchmark 只收坐标或选项。接口错配,生成模型再强也拿不到分。

浙江大学给出 ProVisE:每个空间题被形式化为一份协议,生成模型按协议在原图上做标记,再被解析为 bbox / mask / depth / direction 等结构化预测,跟 text-output VLM 在同一 benchmark 下 metric-compatible 比较。

Agentic Builder 自动生成并验证协议,作者在 6 个外部空间 benchmark 上验证。SpatialGen-Bench 用 470 样本、14 子任务、4 能力等级诊断:像素可外部化的题,生成模型有竞争力;组合推理题,生成模型仍弱于 VLM。

落地三步:拆任务为协议;用解析器统一接口;评估自己场景里像素与组合推理的边界。

4. 镜头分镜

scene-1 hero 标题卡(8s)

  • 时长: 8s
  • 屏幕文字: ProVisE · 像素回答空间题
  • 画面元素: 深色背景居中主标题,左侧小图标代表协议卡片
  • 运动方式: 标题缓入,小图标轻微抖动吸引视线

scene-2 judgment 三判断点(8s)

  • 时长: 8s
  • 屏幕文字: 现有 benchmark 只收坐标 / 生成模型画不出分 / 接口错配才是根因
  • 画面元素: 左卡片=坐标列表,右卡片=生成图标记,中间红叉标志错配
  • 运动方式: 两卡左右滑入,红叉闪动一下

scene-3 mechanism 三栏(8s)

  • 时长: 8s
  • 屏幕文字: 协议化视觉回答 / 结构化解析 / Agentic Builder 自动协议
  • 画面元素: 三栏流程卡,各带一个 icon(协议书、解析器、机器人)
  • 运动方式: 三栏依次点亮,自上而下滚入

scene-4 evidence 数据对比(8s)

  • 时长: 8s
  • 屏幕文字: 470 样本 / 14 子任务 / 4 能力等级 / 6 benchmark 验证
  • 画面元素: 大数字居中卡,周围散落小图标
  • 运动方式: 数字快速累加,最终定格在 470

scene-5 risk 三件套风险卡(8s)

  • 时长: 8s
  • 屏幕文字: 主行: 代码未公开;副行: 字幕层兜底
  • 主行: 解析器边界未披露;副行: 字幕层兜底
  • 主行: 主分类 cs.CV;副行: 单标签 · 字幕层兜底
  • 画面元素: 双行风险卡,左侧警示黄条,右侧小字兜底说明
  • 运动方式: 三张风险卡轮替出现,每次停留约 2.5 秒

scene-6 action 行动清单(8s)

  • 时长: 8s
  • 屏幕文字: 拆任务为协议 / 解析器统一接口 / 评估像素与组合边界
  • 画面元素: 行动清单三步卡,每步一个勾选 icon
  • 运动方式: 三步自上而下滚出,最后一个勾选放大

scene-7 closing 落版卡(8s)

  • 时长: 8s
  • 屏幕文字: 协议化视觉回答修复评测接口 · 与自适应稀疏注意力 / 评测套件自身可信度审计 / Agent 内化 pruning / 推理部署自动化 / 外部行为评估 / 内部表征评估 / runtime context / weight-level persistence / image-space waypoint / train-deploy bridge / 评测范式 / 频谱富化方法论 完全不同视角
  • 画面元素: 落版卡中央一行总结,下方小字跨议题限定语
  • 运动方式: 中央总结缓入,小字渐显,结束定格