- date: 2026-07-17 R1
- arxiv: https://arxiv.org/abs/2606.20905
- video-kb 原路径: /shared/video-kb/scripts/tom/2026-07-17_R1_short-video-script.md
1. 标题与观众
- 标题:Vesta 把 4 类具身子任务塞进一个统一 backbone
- 目标观众:AI 工程师 / 具身智能 / 多模态研究方向开发者
- 一句话核心观点:NVIDIA + 学术合作的 Vesta 用一个多模态基础模型 + 简单记忆 harness 替代多专家栈,4 子任务统一训练且关键指标全面超过单任务 SOTA 与专家集成。
3. 45-90 秒口播稿
NVIDIA 加学术合作推出 Vesta,把定位、空间推理、导航、长程规划 4 子任务统一训练到同一个多模态 backbone 里,核心是记忆 harness 把过去时间步的观察、动作、推理过程作为额外 context 喂回 backbone。数字:跨多个 benchmark 平均比单任务 SOTA 高出 >20%,比按类挑最佳专家集成再高 >10%,真实机器人长程任务成功率提升 >35%。但这三组数字均为论文摘要平均值,实际 benchmark 未独立复现;记忆 harness 容量与数据 token 数官方均未公开。下一步:读 arxiv.org/abs/2606.20905 原文,评估你的具身项目能否用 Vesta 风格统一 backbone + 记忆 harness 替代现有专家栈。
4. 镜头分镜
- scene-1 · 8s:hero 标题卡 · 屏幕文字「Vesta · 一个具身通用基础模型」 · 画面元素 = Vesta 徽标 + NVIDIA + 学术合作徽章 · 运动方式 = 从左滑入并轻微缩放。
- scene-2 · 8s:4 子任务能力卡 · 屏幕文字「定位 + 空间推理 + 导航 + 长程规划」 · 画面元素 = 4 个子任务方块并列(定位图标 / 空间网格 / 导航路径 / 长程时间轴)+ 底部 30 字小字「NVIDIA + 学术合作 · 训练算力官方未公开」 · 运动方式 = 方块依次点亮后连线汇聚到中心统一 backbone 节点。
- scene-3 · 8s:Vesta 架构图 · 屏幕文字「unified backbone + 记忆 harness」 · 画面元素 = 单一多模态 backbone 节点 + 多模态记忆 harness 节点 + memory_context 数据流箭头 + 底部 30 字小字「Vesta 三模态记忆 harness 官方未量化容量」+ arXiv 2606.20905 + 团队 NVIDIA 字样小字 · 运动方式 = 数据流箭头从左向右扫描,记忆 harness 节点闪烁。
- scene-4 · 8s:3 行 hero number 字幕行 · 屏幕文字「>20% vs 单任务 SOTA」/「>10% vs 专家集成」/「>35% 真实机器人长程成功率」 · 画面元素 = 3 行大字号 hero number 字幕行 + 底部 30 字小字「>20%/>10%/>35% 数字均为论文摘要 · 实际 benchmark 未独立复现」 · 运动方式 = 数字从 0 增长到目标值。
- scene-5 · 8s:Vesta vs 多专家栈对比卡 · 屏幕文字「单一模型 vs 多专家集成」 · 画面元素 = 左右双栏对比(单一 backbone + 记忆 harness / 4 个专家 + 上层调度器)+ 底部 30 字小字「NVIDIA + 学术合作 · 训练算力官方未公开」 · 运动方式 = 双栏从中心向两侧展开。
- scene-6 · 8s:风险卡 · 屏幕文字「W1 单源 · W2 容量未量化 · W3 算力未公开 · W4 数字未复现」 · 画面元素 = 4 个红框警示标签(W1/W2/W3/W4)+ 底部 30 字小字「记忆 harness 容量 + 数据 token 数官方均未公开」 · 运动方式 = 警示标签依次弹入。
- scene-7 · 8s:行动清单 · 屏幕文字「起手:arXiv 2606.20905 + flyP 中文解读」 · 屏幕底部 30 字小字「arXiv 2606.20905 + flyP 中文解读
/shared/research-kb/organized/promo/explainers/2606-20905.md」 · 画面元素 = 行动清单 3 行(读 arXiv / 读 flyP 解读 / 评估能否替代专家栈)+ arXiv URL verbatim · 运动方式 = 清单项逐条勾选。