date: 2026-08-13 · round: R2 arxiv: https://arxiv.org/abs/2608.07458 video-kb 脚本原路径: /shared/video-kb/scripts/tom/2026-08-13_R2_coinrag-nugget-kv-cache-reuse-short-video-script.md
1. 标题与观众
- 标题:CoinRAG · KV 下推 nugget
- 目标观众:RAG 系统工程负责人 / 推理基础设施团队 / 检索 pipeline 工程师
- 一句话核心观点:把 KV 缓存复用粒度从 chunk 再下推到 nugget,两阶段检索拿新 Pareto 前沿
3. 45-90 秒口播稿
长上下文 RAG 越拼越长,首 token 越慢。砍掉低分 chunk 又怕漏掉高价值片段,这是工程上的两难取舍。
CoinRAG 把 KV 缓存复用的粒度,从 chunk 再下推一档到 nugget,也就是比句子更细的语义要点。
离线把每个 chunk 按更细粒度切成 nugget,各自预算 KV 缓存,在线只拼不重算,延迟走切片复用。
在线先做 chunk 级粗筛保留上下文连贯,再对命中的 chunk 内的 nugget 做细筛取 top-k 信息要点。
最后把命中的 nugget 加上 chunk 开头和结尾的上下文信号,拼成 prompt。
LongBench 多跳 QA 上,平均 F1 相对提升 5.3%,在标准 fast prefill 预算下,拿到新的 Pareto 前沿。
粒度是隐变量,太粗退化成 chunk,太细拼接成本爆炸,跟着语料任务模型调。
先在已有 chunk 级 KV 系统里加一层 nugget 级索引,粗排用 bge-m3,精排用 cross-encoder,跑 LongBench 画自己的 Pareto 曲线。
4. 镜头分镜
scene-1 · Hero(0-8s)
- 时长:8s
- 屏幕文字:CoinRAG 下推 nugget
- 画面元素:深色背景 + 中央大字标题 + 副标「长上下文 RAG」
- 运动方式:标题中心放大入场,副标下方淡入
scene-2 · 现有打法的缺陷(8-16s)
- 时长:8s
- 屏幕文字:chunk 越长 · 越慢
- 画面元素:左侧 chunk 堆叠 + 右侧灰色冗余区
- 运动方式:左侧 chunk 滑动,右侧冗余区脉冲
scene-3 · 卡片清单(16-24s)
- 时长:8s
- 屏幕文字:nugget = 语义要点
- 画面元素:三层卡片(chunks / sub / nuggets)
- 运动方式:三层从上至下飞入,解释块淡入
scene-4 · 两阶段检索(24-32s)
- 时长:8s
- 屏幕文字:粗筛 chunk → 细筛
- 画面元素:query 节点 + 两级漏斗 + prompt 区
- 运动方式:query 连线穿漏斗,prompt 逐段亮
scene-5 · 数字层证据卡(32-40s)
- 时长:8s
- 屏幕文字:F1 +5.3% · Pareto
- 画面元素:坐标图(prefill x / F1 y)+ 红色曲线
- 运动方式:基线点逐个绘制,红色曲线高亮
scene-6 · 反方风险卡(40-48s)
- 时长:8s
- 屏幕文字:粒度是隐变量 · 离线 ≠ 免费
- 画面元素:三栏风险卡(粒度 / Pareto / 存储)
- 运动方式:三栏从左至右滑入,警示图标弹跳
scene-7 · 行动清单(48-56s)
- 时长:8s
- 屏幕文字:加索引 · 画自己 Pareto
- 画面元素:行动清单 4 行(索引 / bge-m3 / CE / LongBench)
- 运动方式:清单逐行打字机出现,副标淡入