TurboVLA 跑上 RTX 4090(视频脚本镜像)

日期:2026-08-01 · 轮次:R1 arXiv 链接:https://arxiv.org/abs/2607.27205 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-08-01_R1_turbovla-vla-v+l-a-direct-fusion-rtx4090-32hz-short-video-script.md

1. 标题与观众

  • 标题:TurboVLA 跑上 RTX 4090
  • 目标观众:AI 工程师
  • 一句话核心观点:抛弃大语言模型中转,VLA 也能 32 Hz 实时。

3. 45-90 秒口播稿

VLA 让机器人看图理解指令再动起来。 主流路径是 V→L→A,中间架一颗大语言模型。 这条路算力重,部署门槛高。 TurboVLA 改写为 V+L→A。 视觉用 DINOv3 单独编码,语言用 BERT 单独编码。 两者做轻量双向交互,直连紧凑解码器。 解码器一次输出连续动作块。 0.2B 参数,31.2 毫秒推理,0.9 GB 显存。 在消费级 RTX 4090 跑到 32 赫兹。 仿真 LIBERO 拿到 97.7% 平均成功率。 缺主流当代 VLA 同台对比,缺真实机器人表。 V+L→A 可能只是把语言模型体积藏进编码器。 部署前请先求真实机器人成功率与同台对比数据。

4. 镜头分镜

  • 镜头 1 · 0-6 秒 · 标题卡
  • 屏幕文字:TurboVLA 跑上 RTX 4090
  • 画面元素:中央大字标题,右下 arXiv 编号小字
  • 运动方式:轻微推近,标题淡入
  • 镜头 2 · 6-16 秒 · 流程图
  • 屏幕文字:V→L→A 旧路径 算力重
  • 画面元素:三段横排方块,中间块高亮加重
  • 运动方式:从左到右逐段点亮
  • 镜头 3 · 16-30 秒 · 流程图
  • 屏幕文字:V+L→A 直融合 DINOv3
  • 画面元素:视觉与语言并排,各自连线进解码器
  • 运动方式:并排模块同步点亮,然后汇入解码器
  • 镜头 4 · 30-46 秒 · 证据卡
  • 屏幕文字:0.2B/31ms/0.9GB
  • 画面元素:五枚数字徽章一排摆开
  • 运动方式:数字逐个弹入并定住
  • 镜头 5 · 46-60 秒 · 风险卡
  • 屏幕文字:缺同台对比 缺真实机器人表
  • 画面元素:双行警示条,黄色描边
  • 运动方式:警示条由浅入深推进
  • 镜头 6 · 60-76 秒 · 行动清单
  • 屏幕文字:求真机率 求同台 求长尾
  • 画面元素:三步清单竖排,序号加粗
  • 运动方式:逐条向上展开
  • 镜头 7 · 76-90 秒 · 落版卡
  • 屏幕文字:arXiv 2607.27205
  • 画面元素:底部条幅,左侧关键数字,右侧论文编号
  • 运动方式:整体轻微上推并定版