日期与轮次: 2026-09-11 · R2 arxiv 链接: https://arxiv.org/abs/2609.10266v1 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-09-11_R2_kvshare-arena-short-video-script.md
1. 标题与观众
- 标题: 非前缀复用,该重算就重算
- 目标观众: 开发者 / AI 工程师 / LLM serving 推理系统工程师
- 一句话核心观点: KV cache 复用走出 prefix-only 舒适区,单源可修、多源该重算、跨 checkpoint 必须重训 adapter。
3. 45-90 秒口播稿
KV cache 复用有个被默认接受的隐式前提——被复用的文本必须出现在 prompt 最开头。但生产环境的两个 workload 已经把它撕了:一是 RAG 服务端,每个 query 拼一组不同的检索 chunk,这些 chunk 嵌在 prompt 中段、末尾;二是多 Agent 协调器,主 Agent 读其他 Agent 的报告,既不在开头、cache 也没跟新 query 共 attention。结果就是——位置编码错位,注意力图错了。
更糟的是,模型热更新后,你可能直接复用了旧 checkpoint 的 cache 值。KVShareArena 给出了首个「非前缀复用 + 跨 checkpoint」基准,用 gap recovery fraction 统一打分,允许负分。
结论很直接:单源问题,位置修正就够——训练免费,几乎零成本;多源问题,只有部分重计算或额外训练能恢复 50–67% 的精度差;未修复的 cache 在多源上反而比无 cache 更糟。跨 checkpoint 场景下,training-free 方法最稳,但 adapter 必须随 checkpoint 同步重训。
给 LLM serving 工程师一条原则:RAG 与多 Agent 默认重算;不要复用未修复的 cache。
4. 镜头分镜
- scene 1(hero · 0–8s):时长 8s;屏幕文字「非前缀复用,该重算就重算」+ 副标「KV cache 复用走出 prefix-only 舒适区」;画面元素:标题卡居中,深色 ink 背景 + 琥珀色 accent 横线;运动:从左滑入,字幕轻微 bounce。
- scene 2(cards · 8–16s):时长 8s;屏幕文字「1. prefix-only 是 serving 的默认前提」/「2. RAG + 多 Agent 打破位置 + 共 attention」/「3. 跨 checkpoint 写入让 cache 值失效」;画面元素:三张垂直卡片 + 编号圆点;运动:逐张淡入,错位箭头高亮第二条。
- scene 3(flow · 16–24s):时长 8s;屏幕文字「位置修正 单源 ✓」/「多源:部分重算 / 训练 → 50–67%」/「未修 cache 多源:负分」;画面元素:流程图三档,左→右绿/琥珀/红;运动:依次点亮,负分卡轻微抖动强调反直觉。
- scene 4(evidence · 24–32s):时长 8s;屏幕文字「arXiv abs/2609.10266」/「paper_card TLDR verbatim」/「gap recovery fraction 公式」;画面元素:证据卡三张,底部带浅色 paper 纹理;运动:轻微上浮,二维码 / URL 锚点在右下角。
- scene 5(risk · 32–40s):时长 8s;屏幕文字「FR-1 50–67% abstract 定性」/「FR-2 跨 checkpoint 幅度未给」/「FR-3 3 模型系列未列名」/「FR-4 gap 阈值未给」;画面元素:风险卡四张,琥珀色 accent 边框;运动:逐张淡入,左侧 W-Caution 编号固定。
- scene 6(action · 40–48s):时长 8s;屏幕文字「单源:位置修正」/「多源:默认重算」/「跨 checkpoint:重训 adapter」/「不要复用未修复 cache」;画面元素:行动清单,四行一栏;运动:行间打勾动画。
- scene 7(收束 · 48–56s):时长 8s;屏幕文字「把判断变成行动」/「该重算就重算」/「KV cache 复用需明示前提」;画面元素:深色 ink + 琥珀色 accent 收束条;运动:字幕缓慢推出,主标题回响 0.3s。