TurboVLA 跑上 RTX 4090(视频脚本镜像)
日期:2026-08-01 · 轮次:R1 arXiv 链接:https://arxiv.org/abs/2607.27205 video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-08-01_R1_turbovla-vla-v+l-a-direct-fusion-rtx4090-32hz-short-video-script.md
1. 标题与观众
- 标题:TurboVLA 跑上 RTX 4090
- 目标观众:AI 工程师
- 一句话核心观点:抛弃大语言模型中转,VLA 也能 32 Hz 实时。
3. 45-90 秒口播稿
VLA 让机器人看图理解指令再动起来。 主流路径是 V→L→A,中间架一颗大语言模型。 这条路算力重,部署门槛高。 TurboVLA 改写为 V+L→A。 视觉用 DINOv3 单独编码,语言用 BERT 单独编码。 两者做轻量双向交互,直连紧凑解码器。 解码器一次输出连续动作块。 0.2B 参数,31.2 毫秒推理,0.9 GB 显存。 在消费级 RTX 4090 跑到 32 赫兹。 仿真 LIBERO 拿到 97.7% 平均成功率。 缺主流当代 VLA 同台对比,缺真实机器人表。 V+L→A 可能只是把语言模型体积藏进编码器。 部署前请先求真实机器人成功率与同台对比数据。
4. 镜头分镜
- 镜头 1 · 0-6 秒 · 标题卡
- 屏幕文字:TurboVLA 跑上 RTX 4090
- 画面元素:中央大字标题,右下 arXiv 编号小字
- 运动方式:轻微推近,标题淡入
- 镜头 2 · 6-16 秒 · 流程图
- 屏幕文字:V→L→A 旧路径 算力重
- 画面元素:三段横排方块,中间块高亮加重
- 运动方式:从左到右逐段点亮
- 镜头 3 · 16-30 秒 · 流程图
- 屏幕文字:V+L→A 直融合 DINOv3
- 画面元素:视觉与语言并排,各自连线进解码器
- 运动方式:并排模块同步点亮,然后汇入解码器
- 镜头 4 · 30-46 秒 · 证据卡
- 屏幕文字:0.2B/31ms/0.9GB
- 画面元素:五枚数字徽章一排摆开
- 运动方式:数字逐个弹入并定住
- 镜头 5 · 46-60 秒 · 风险卡
- 屏幕文字:缺同台对比 缺真实机器人表
- 画面元素:双行警示条,黄色描边
- 运动方式:警示条由浅入深推进
- 镜头 6 · 60-76 秒 · 行动清单
- 屏幕文字:求真机率 求同台 求长尾
- 画面元素:三步清单竖排,序号加粗
- 运动方式:逐条向上展开
- 镜头 7 · 76-90 秒 · 落版卡
- 屏幕文字:arXiv 2607.27205
- 画面元素:底部条幅,左侧关键数字,右侧论文编号
- 运动方式:整体轻微上推并定版