MOSS-VL 技术报告 · 11.3B 开源实时多模态双优 · 视频脚本镜像
日期与轮次:2026-08-19 R2
arXiv 链接:https://arxiv.org/abs/2608.15045
video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-08-19_R2_moss-vl-realtime-streaming-mllm-short-video-script.md
1. 标题与观众
- 标题:MOSS-VL 实时多模态开源双优(11 字 · 5/5 关键词命中 MOSS-VL + 实时 + 多模态 + 开源 + 双优 · ≤ 22 字 PR hard_gate PASS)
- 目标观众:多模态 LLM 应用开发者 · 实时多模态 / 流式 VLM 产品工程师 · 推理服务部署工程师 · AI 工程产品经理
- 一句话核心观点:开源 11.3B 首次同时吃下流式 Proactive + 离线 Instruct · 三件协同设计开源落地
3. 45-90 秒口播稿
传统 VLM 把视觉 token 拼进解码序列。 模型说话时,新帧插不进来,只能重跑。 TTFT 首字延迟随视觉增长而爆炸。 MOSS-VL 来自 OpenMOSS,11.3B 参数。 解码器只看语言 token,视觉走门控交叉注意力。 边说边看,首字延迟不随视觉上下文涨。 合成交互语料教模型三种状态: 该说就说,该沉默就沉默,该修正就修正。 不是 prompt 技巧,而是训练目标。 OmniMMI 66.0 对开源 37.5。 开源最强基线,几乎翻倍。 TTFT 优势 2.8 倍拉到 5.1 倍。 四项流式基准拿下三个第一。 五件套全开源,加 LlamaFactory 集成。 复现友好度五颗星,值得立马上手。
4. 镜头分镜
- scene-1 · 8s · 标题卡 · 屏幕文字:MOSS-VL 11.3B 边说边看 · 画面:OpenMOSS 团队 logo + 解码器 KV cache 概念图 · 运动:慢推近 + 概念图旋转淡入
- scene-2 · 8s · 流程图 · 屏幕文字:门控交叉注意力 解耦视觉 token · 画面:解码器 → 门控 → 视觉编码器三段流水线 · 运动:左→右流动 + 视觉 token 在门外独立 step
- scene-3 · 8s · 证据卡 · 屏幕文字:说 沉默 修正 三态监督 · 画面:三态切换图(三个对话框气泡切换)· 运动:三态循环淡入
- scene-4 · 8s · 证据卡 · 屏幕文字:OmniMMI 66 vs 37.5 · 画面:折线对比图 + 红色箭头标 · 运动:基线 37.5 → MOSS-VL 66.0 拉出
- scene-5 · 8s · 流程图 · 屏幕文字:TTFT 2.8× → 5.1× · 画面:视觉上下文长度 vs TTFT 加速比曲线 · 运动:曲线延伸 + 端点数字标注
- scene-6 · 8s · 证据卡 · 屏幕文字:四流式基准 三项第一 · 画面:4 benchmark 雷达图 + 三格打勾 · 运动:雷达扫过 + 逐格打勾
- scene-7 · 8s · 行动清单 · 屏幕文字:五件套全开源 立马上手 · 画面:5 checkpoint 矩阵 + LlamaFactory logo · 运动:矩阵拉出 + logo 浮现