• 日期:2026-07-20 R1
  • arxiv 链接:https://arxiv.org/abs/2607.14187
  • video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-20_R1_rxbrain-embodied-joint-planning-mot-short-video-script.md

1. 标题与观众

  • 标题:RxBrain同段序列
  • 目标观众:具身智能 / 多模态大模型开发者
  • 一句话核心观点:用一段联合规划序列把语言骨架、视觉想象和连续动作三件套压在一起。

3. 45-90 秒口播稿

具身智能两半割裂:VLM 擅决策动作落不到物理状态,世界模型擅预测缺任务分解。论文 arXiv 2607.14187 v1 的 Hy-Embodied-RxBrain 用 unified multimodal Mixture-of-Transformers 单模型,把语言与想象塞进同一段 joint planning sequence,文本视觉互为上下文;视频流水线造 text planning + visual state alignment 监督,做到 continuous robot action generation 且 without large-scale action-data pretraining,展现 promising real-robot performance。两段拼接压成一段规划序列

4. 镜头分镜

  • 场景 1(0-7s · hero title):时长 7 秒,屏幕文字「RxBrain同段序列」,画面元素:深色背景加橙色 hero 标题卡加副标题「arXiv 2607.14187 v1」,运动方式:hero 标题从下方淡入,字幕固定不动。
  • 场景 2(7-15s · 真问题卡片):时长 8 秒,屏幕文字「VLM 派擅决策但动作落不到物理状态 · 世界模型派擅预测却缺任务分解与时序」,画面元素:左右两栏对照卡,VLM 派打红叉,世界模型派打红叉,中间一个橙色 plus 号,运动方式:两栏从两侧滑入,plus 号弹跳放大。
  • 场景 3(15-28s · joint planning sequence 三件套):时长 13 秒,屏幕文字「text + visual_imagination + sub_goal · step_1/step_2/step_3」,画面元素:三列堆叠卡(text 蓝、visual_imagination 橙、sub_goal 灰),每列三步箭头串联,中心标注「joint planning sequence」,运动方式:三列依次下落,箭头沿顺时针逐段点亮。
  • 场景 4(28-42s · Mixture-of-Transformers 架构):时长 14 秒,屏幕文字「unified multimodal Mixture-of-Transformers · 单模型理解 + 生成」,画面元素:左侧单一大方框内嵌三个专家分支(语言/图像/视频),右侧输出三类模态,运动方式:三个分支依次从中心放射,共享表征空间高亮。
  • 场景 5(42-56s · 关键 trick + 公开状态限定语):时长 14 秒,屏幕文字「without large-scale action-data pretraining」(大字)+「论文 verbatim · 解释稿二次解读 · 非真机效果承诺」小字+「v1 PDF 已发 · 未见 v2 · 未进同行评议」,画面元素:橙色关键 trick 框居中,下方双行小字卡片,运动方式:关键 trick 框缓慢呼吸,小字行同步淡入。
  • 场景 6(56-68s · 风险卡三件套):时长 12 秒,屏幕文字「W11 公开状态:v1 PDF 已发 · 未见 v2 · 未进同行评议」、「W12 反方审稿:0 第三方复现 · 0 反方审稿」、「W4 数字外推:abstract 未给具体成功率」,画面元素:三张风险卡竖排,每张左侧警示图标,右侧文字,运动方式:三张卡依次下落,警示图标闪两次。
  • 场景 7(68-80s · 三问行动清单):时长 12 秒,屏幕文字「看 abstract 第二段就懂统一 MoT」、「看 abstract 第三段就懂自动视频流水线」、「看 abstract 最后一段就懂真机落地限定语」,画面元素:三个 checkbox 列表,每个问题配一个对勾动画,运动方式:checkbox 依次勾选,行动清单整体上升淡出。