date: 2026-08-11 round: R2 arxiv: 2608.07009 arxiv_url: https://arxiv.org/abs/2608.07009 video_kb_script: /shared/video-kb/scripts/tom/2026-08-11_R2_hisparse-tiered-kv-sparse-attn-short-video-script.md
1. 标题与观众
标题: HiSparse · 把 KV 从 GPU 全量搬到 host 内存 目标观众: 推理系统工程师 / LLM serving 平台工程师 一句话核心观点: HiSparse 把稀疏注意力的 KV 缓存搬到 host 内存,GPU 端只留固定工作集。
3. 45-90 秒口播稿
稀疏注意力把算力省下来了,可 KV 还是要全量堆在 GPU。 请求的内存随完整上下文线性增长,容量墙先撞上,算力还没用满。 HiSparse 把 KV 全量搬到 host 内存,GPU 端只留一个固定大小的工作集。 模型输出不变,top-k 选择器看到的就是完整候选,只是把 KV 的住址换了。 机制靠一个融合 CUDA 内核,在 decode graph 内做 hit 检测、LRU、host-to-device 抓取。 换句话说,机制本身不加每 token 计算,剩下的代价只有 host-device IO。 abstract 报峰值吞吐最高 4.7×,是 up to 上限,延迟仍是 comparable/reduced 定性表述。 跨层预取在 indexer 暴露层间共享时启用,能藏住约一半 miss 开销,但只对暴露的 indexer 成立。 HiSparse 已经在上游 SGLang 落地,DSA/NSA/Quest 三家族都适用。 host 内存是新的容量上限,单节点 host DRAM 仍是瓶颈,长上下文加并发仍撞墙。 部署长上下文 serving,把 KV 放 host + GPU 小 cache,已经是通用范式。
4. 镜头分镜
镜头 1 · 标题卡
- 时长: 7s
- 屏幕文字: HiSparse · 把 KV 从 GPU 全量搬到 host 内存
- 画面元素: 论文标题卡 + arXiv ID 2608.07009
- 运动方式: 标题从中央放大,arXiv ID 副标淡入
镜头 2 · 问题流程卡
- 时长: 10s
- 屏幕文字: 算力省下了,KV 还在堆 GPU
- 画面元素: 左 GPU HBM 红色堆栈、右 host memory 蓝色堆栈
- 运动方式: HBM 堆栈溢出红框,容量墙标线从顶部压下
镜头 3 · 架构对照卡
- 时长: 10s
- 屏幕文字: host 全量 + GPU 端固定 cache
- 画面元素: 双层架构图,host 蓝、GPU 工作集橙
- 运动方式: 中间一条 PCIe/NVLink 数据线动画连接
镜头 4 · 机制流程卡
- 时长: 10s
- 屏幕文字: hit / LRU / prefetch · 融合 CUDA 内核
- 画面元素: decode graph 框 + 三步小流程图
- 运动方式: 三个操作在 graph 内顺次亮起
镜头 5 · 数字矩阵卡
- 时长: 10s
- 屏幕文字: 4.7× up to · comparable latency · reduced TTFT
- 画面元素: 三栏数字卡,4.7× 高亮为 up to 上限
- 运动方式: 数字依次跳入,up to 标签在 4.7× 下方淡入
镜头 6 · 落地证据卡
- 时长: 10s
- 屏幕文字: 已合入上游 SGLang
- 画面元素: SGLang logo + GitHub PR 列表行
- 运动方式: logo 淡入,3 条 PR 行从下方滑入
镜头 7 · 风险限定卡
- 时长: 10s
- 屏幕文字: host 内存是新上限 · 长尾未披露
- 画面元素: 三层警示卡,host 墙、P99 问号、indexer 限制
- 运动方式: 警示标线从右向左扫过