date: 2026-07-22 · round: R1 arxiv: https://arxiv.org/abs/2607.18171 video-kb_script: /shared/video-kb/scripts/tom/2026-07-22_R1_flashrt-agent-harness-real-time-multimodal-short-video-script.md

1. 标题与观众

标题: 让 Agent 替你写部署 目标观众: AI 工程师 / 推理基础设施负责人 一句话核心观点: FlashRT 用 Chain-of-Program 把三类部署决策解耦为多轮 Agent 变换,在 B200 上达成 70× 延迟降低 + 2.8× 吞吐提升,异构 GPU 通用

3. 45-90 秒口播稿

每换新硬件都要重写多模态部署?CMU + AMD 做了 Agent Harness。FlashRT 用 Chain-of-Program,引导 Claude Code 多轮变换:把 placement · streaming · intra-model parallelism 三件套解耦,每轮只改一类。B200 上 70× 延迟 + 2.8× 吞吐,MI355X 上 3.6× 吞吐 + Qwen3-Omni 比 vLLM-Omni 延迟再降 65%。前提是 Agent 一次只改一类 · 仓库未发。建议关注:把专家经验编码进 Agent prompt + 验证回路。

4. 镜头分镜

  • scene-1 · 0-8s · 标题卡 · 屏幕文字 让 Agent 替你写部署 · 画面元素 深底白字 + Agent 与 GPU 网格双图标 · 运动方式 Agent 图标从左滑入覆盖手写代码图标 · 副行 FlashRT · CMU+AMD
  • scene-2 · 8-16s · 判断卡 · 屏幕文字 部署靠 Agent · 三件套分轮改 · 画面元素 三件套标签(placement / streaming / parallelism)横向排列 + 中间分隔线 · 运动方式 三件套依次点亮 · 副行 避免一次改炸全图
  • scene-3 · 16-25s · 流程卡 · 屏幕文字 参考实现 → IR → 静态分析 → 测量门控优化 · 画面元素 四步流程图垂直串接 · 运动方式 顶部到底部依次填充 · 副行 Chain-of-Program 四步
  • scene-4 · 25-34s · 证据卡 · 屏幕文字 B200 70× 延迟 + 2.8× 吞吐 · 画面元素 B200 标识 + 大数字 70× / 2.8× 上下堆叠 · 运动方式 数字拔高 · 副行 up to ~70x latency
  • scene-5 · 34-43s · 证据卡 · 屏幕文字 MI355X 3.6× 吞吐 · Qwen3-Omni -65% · 画面元素 MI355X 标识 + 3.6× 数字柱 + Qwen3-Omni vs vLLM-Omni 延迟对比 · 运动方式 数字拔高 + 对比条滑动 · 副行 vs vLLM-Omni baseline
  • scene-6 · 43-51s · 风险卡 · 屏幕文字 仓库 404 · v1 1.26天 · 单 baseline · 画面元素 三行风险小字堆叠 · 运动方式 逐行闪烁 · 副行 GitHub未发·不外推共识
  • scene-7 · 51-60s · 行动清单 · 屏幕文字 关注仓库 · 小规模先复现 · 适用异构 GPU · 画面元素 三个动作垂直排列(关注 / 复现 / 异构) · 运动方式 逐条出现 · 副行 把判断变成行动