日期与轮次:2026-07-25 R2 arxiv 链接:https://arxiv.org/abs/2607.20785 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-25_R2_robostral-navigate-image-space-waypoint-vl-n-sota-short-video-script.md
1. 标题与观众
标题:RN · 用单目 RGB 把导航推到 SOTA 目标观众:机器人导航 / VLN 研究与工程团队 / 多模态大模型训练团队 / 具身智能平台架构师 一句话核心观点:8B VLM 仅用单目 RGB,在画面上指出 (u,v) 像素航点,R2R-CE 77.4%、RxR-CE 75.1% 同时刷新 SOTA,且跨 wheeled / legged / aerial 三类机器人无需重训。
3. 45-90 秒口播稿
视觉语言导航长期依赖 RGB-D、多相机、预建地图。Robostral Navigate 提出 image-space waypoint —— 模型不输出机器人坐标里的目标点,而是直接在当前画面上指出一个 (u,v) 像素航点。
整条链路只用一个 8B 视觉-语言模型,加单目 RGB 视频流。三个训练 trick 让这件事可负担:第一,2.4M 条仿真轨迹覆盖 35 万场景,把数据规模拉到工业级;第二,prefix-caching 让相邻 step 复用前缀 KV cache,整条 episode 训练 token 压到 1/22,训练时间从几个月降到几天;第三,tree-based attention mask 阻断模型偷看未来 ground-truth 偏置,真正让它「看着画面」预测动作。
效果上,R2R-CE 达到 77.4% 成功率,比最佳单目方法高 10.5 个百分点,比最强 depth 或多相机系统还高 5.3 个百分点;RxR-CE 达到 75.1%。更关键的是,策略输出和底盘几何解耦,同一份模型装到轮式、四足、人形、飞行机器人上,无需重训或重标定。
今天能带走的:如果你做 VLN / 具身导航,先把高层策略输出空间从机器人坐标系切到图像坐标系,跨本体迁移成本可降到几乎为零。落地链路就三步 —— 像素 (u,v) 反投影到射线,射线乘深度或单目深度估计得 3D 点,视觉伺服(IBVS / PBVS)下发底盘速度。提醒一句:image-space waypoint 仅 R2R-CE + RxR-CE 两个 VLN 公开基准验证,不可外推为所有视觉导航场景,真实部署请在小规模真实室内场景做 sim-to-real gap 评估。
4. 镜头分镜
scene-1 hero · 标题卡(8s)
- 时长:8s
- 屏幕文字:
RN · 用单目 RGB 把导航推到 SOTA(主标题 13 字) - 画面元素:深色背景 + 主标题大字居中 + 副标题小字 "arXiv 2607.20785 v1 · Robostral Navigate"
- 运动方式:主标题从下往上滑入,副标题淡入
scene-2 judgment · 三个判断点(8s)
- 时长:8s
- 屏幕文字:卡片一「输出从机器人坐标切到像素」/ 卡片二「22× token 训练压到几天」/ 卡片三「跨 wheeled / legged / aerial 零重训」
- 画面元素:三张判断卡横向排列,卡片边框亮起依次高亮
- 运动方式:三卡淡入 + 当前卡边框脉冲放大
scene-3 evidence · 数字证据卡(8s)
- 时长:8s
- 屏幕文字:
77.4%+10.5pp+5.3pp75.1%22× - 画面元素:5 个数字圆环并排,圆环底色 = 主分类 cs.RO + cs.AI 配色(深橙 + 紫)
- 运动方式:数字从中心放大弹出,后四个依次延时 0.4s 出现
scene-4 architecture · Pipeline 流程图(8s)
- 时长:8s
- 屏幕文字:
单目 RGB → 8B VLM → (u,v) 像素 → 视觉伺服 → 底盘速度 - 画面元素:五节点横向流程图,箭头连接,每个节点配图标(相机 / 模型 / 像素坐标 / 控制器 / 机器人)
- 运动方式:流程图从左向右绘制,箭头依次点亮
scene-5 risk · 风险卡三件套(8s)
- 时长:8s
- 屏幕文字:
- 主行
GitHub 实测+ 副行W7 0 命中(W7) - 主行
主分类 cs.X+ 副行cs.RO+AI(W11) - 主行
数字 4+5 件 verbatim+ 副行实验论文路径(W4) - 画面元素:三张风险卡竖排,每卡主行大字 + 副行小字双行排版,边框警示色
- 运动方式:三卡依次滑入,每张停顿 2.5s
scene-6 comparison · 输出空间对比表(8s)
- 时长:8s
- 屏幕文字:表头
传感器假设 / 跨本体迁移 / 训练效率,行机器人坐标输出 高 ✗ ✗/世界坐标输出 高 ✗ ✗/图像坐标输出(RN)低 ✓ ✓ - 画面元素:2×4 网格表,RN 行用主色高亮
- 运动方式:表格行依次出现,RN 行最后高亮 + 边框脉冲
scene-7 closing · 落版卡(8s)
- 时长:8s
- 屏幕文字:
RN = sensor-to-action 输出空间切换·与 weight-level persistence / runtime context 完全不同视角·8B VLM backbone 选型原文未明确 · prefix-caching 复现细节待社区验证 · 仅 R2R-CE / RxR-CE 验证 · 不可外推为所有视觉导航场景 - 画面元素:落版卡 + 行动清单点(把策略输出切到 image-space)
- 运动方式:行动点逐条打勾,字幕层最后一行小字 disclaimer 淡入