date: 2026-08-14 round: R2 arxiv_id: 2608.08814 source_script: /shared/video-kb/scripts/tom/2026-08-14_R2_360cityarena-360-embodied-urban-nav-short-video-script.md


1. 标题与观众

  • 标题:360CityArena · 60pp 警钟
  • 目标观众:具身 Agent / VLM 导航研究员 · 评测方法学 / benchmark 设计者 · 3D 重建 / 360° 视觉感知工程师
  • 一句话核心观点:60pp 反差不是 SOTA 数字博弈,而是评测方法学给城市具身响起的警钟

3. 45-90 秒口播稿

城市具身 Agent 的 benchmark,要么缺真实感,要么缺复杂度,60pp 差距就是这种结构性缺陷的总账。

360CityArena 用 602 段 360° 视频,重建日本东京秋叶原 85 条街道,做成 photorealistic 虚拟城市。

再配 175 道人工任务,覆盖环境理解、路径推理、空间推理三类,让最强 VLM 来跑。

结果:最强 Gemini 2.5 Flash 准确率 17.1%,人类基线 77.3%,差了 60 个百分点。

但这不是 SOTA 数字博弈,而是评测方法学的警钟,真实城市具身 = 真实工程问题。

60pp 反差让模型有明确改进空间,反而证明这套基准是有效的,不是失效的。

不过单城市覆盖是评测方法学已知硬约束,秋叶原不能回答欧洲老城、美国郊区、南美贫民窟上的表现。

把 60pp 从悲观转成「问题被显式化」的工程信号,跨城市场景谱才是下一道题。

4. 镜头分镜

scene-1 · Hero(0-8s)

  • 时长:8s
  • 屏幕文字:360CityArena · 60pp 警钟
  • 画面元素:深色背景 + 中央大字标题 + 副标「城市具身基准」
  • 运动方式:标题中心放大入场,副标下方淡入,60pp 数字高亮红色脉冲

scene-2 · 数据层(8-16s)

  • 时长:8s
  • 屏幕文字:602 段 / 85 街 / 175 题
  • 画面元素:左中右三组数据卡(视频数 / 街道数 / 任务数)+ 顶部「秋叶原」标签
  • 运动方式:三组数据卡从左右两侧飞入,数字逐个打字机出现

scene-3 · 任务三类(16-24s)

  • 时长:8s
  • 屏幕文字:理解 / 路径 / 空间
  • 画面元素:三层认知金字塔(Environment Understanding / Path Reasoning / Spatial Reasoning)+ 右上「cs.CV 主分类」修正标签
  • 运动方式:金字塔自下而上点亮,主分类修正标签淡入

scene-4 · 反差卡(24-32s)

  • 时长:8s
  • 屏幕文字:17.1% vs 77.3%
  • 画面元素:左右双柱状图(Gemini 2.5 Flash vs 人类)+ 中央 60pp 红色大字 + 副标「不是数字博弈」
  • 运动方式:左柱从底部升起 17.1%,右柱升起 77.3%,60pp 红色数字闪烁入场

scene-5 · 评测缺口(32-40s)

  • 时长:8s
  • 屏幕文字:评测缺口 ≠ 模型差距
  • 画面元素:左右对比卡(「更大算力」× / 「重做评测方法学」✓)+ 底部「60pp = 问题被显式化」脚注
  • 运动方式:左侧打叉红章,右侧打勾绿章,脚注淡入

scene-6 · 边界卡(40-48s)

  • 时长:8s
  • 屏幕文字:单城市 ≠ 跨城市
  • 画面元素:三栏风险卡(单城市覆盖 / 175 任务规模 / 360° 视觉输入公平性)+ 底部「评测方法学硬约束」警示条
  • 运动方式:三栏从左至右滑入,警示条黄色脉冲

scene-7 · 行动清单(48-56s)

  • 时长:8s
  • 屏幕文字:把警钟变行动
  • 画面元素:行动清单 3 行(跨城市场景谱 / 任务规模扩展 / 输入模态公平性)+ 底部「ECCV 2026 同行评议」脚注
  • 运动方式:清单逐行打字机出现,行动编号亮起,脚注淡入