数据库内核 & KV Cache 工程 · 2026-06-28
Jay · 研究知识库
🔬 检索范围
- tavily: arXiv KV cache 压缩 / MLA / MQA / GQA / 低秩注意力 / 多层存储管理
- 目标:工程可复现的 KV cache 优化论文 + 数据库查询优化新动态
📐 database · 数据库内核动态
ICDE 2026 接收论文(部分)
来源: https://icde2026.github.io/accepted-papers.html 可信度: ★★★★☆ 发布时间: 2026年
值得关注(标题摘要): - FaScalSQL: GPU-Accelerated SQL Query Engine for Out-of-Memory Tables(NUDT) → GPU 加速 OOM 表的 SQL 查询引擎,国防科技大学团队 - LITHE: Query Rewrite Advisor using LLMs(IISc Bangalore) → LLM 做查询重写建议,印第安理工学院数据库实验室
Learned Query Optimizer 综述(ACM 2026)
来源: https://dl.acm.org/doi/10.1145/3626246.3654692 可信度: ★★★★☆ 类型: Tutorial paper,理论与实践并重
覆盖范围: Learned Cardinality Estimation / Learned Join Ordering / E2E Query Optimizer
🧠 kv-cache · KV Cache 优化:工程复现笔记
本章节聚焦生产可复现的 KV cache 压缩与内存管理研究。核心问题:LLM 推理中 KV cache 是主要显存瓶颈,如何在精度可接受范围内压缩?
📍 基线:MHA / MQA / GQA / MLA 四代压缩范式
| 范式 | 代表 | KV Cache 量级 | Compute 变化 | 主要缺点 |
|---|---|---|---|---|
| MHA(标准多头注意力) | - | O(n·h·dh) | 无 | 显存杀手 |
| MQA(多查询注意力) | Shazeer 2019 | 共享单一 K/V | 减少 | 解码快但质量损失 |
| GQA(分组查询注意力) | Ainslie 2023 | 每组共享 K/V | 减少 | 精度 vs 压缩 trade-off |
| MLA(多头潜在注意力) | DeepSeek 2024 | 低秩联合压缩 ~4.5×dh | 减少 decode | RoPE 冲突;锁死 MQA-absorb 路径 |
| LRKV(低秩 KV) | 2601.11471 | MHA 的 45-53% | 基本不变 | 最新研究,精度超 MLA |
| MLRA(多头低秩注意力) | 2603.02188 | 可分区块 | 4-way TP | MLA 升级版,支持张量并行 |
| GQLA(分组查询潜在注意力) | 2605.15250 | MLA 级 | MLA 级 | 解决 MLA 架构锁定,硬件自适应 |
| CCGQA | 2510.04476 | 8x 压缩无性能下降 | 联合压缩 | MoE 模型效果最佳 |
✅ LRKV: Low-Rank Key Value Attention
论文: arXiv:2601.11471v3 机构: 未确认(arXiv 匿名提交格式) 可信度: ★★★★☆ 工程价值: ★★★★★
核心方法: 每层使用一个全秩共享 KV projection + 低秩 head-specific residual: - 共享部分 → 跨 head 利用冗余,压缩 cache - residual 部分 → 保留每个 head 的独立信息,弥补 MQA/GQA 的精度损失
实验结果(在 128M~6.3B 模型上): - test loss 一致性低于标准 MHA、MQA/GQA、MLA - KV cache 大小:MHA 的 45-53% - 适用:Dense 和 MoE 模型
工程提示: 低秩 residual 的秩(rank)是一个可调超参,压缩率与精度的 trade-off 可通过调整 rank 控制。这是目前第一篇在压缩率下精度超越 MLA 的工作。
✅ Predictive Multi-Tier Memory Management for KV Cache
论文: arXiv:2604.26968v1 可信度: ★★★★★ 工程价值: ★★★★★(对大规模推理服务架构影响直接)
三个 compound 失效问题:
问题1:MLA 架构的内存过度配置 - 通用框架不感知 MLA 架构,导致 57x 内存过度配置 - 例如:DeepSeek-V2 对 KV cache 的估算如果套用 MHA 框架,会浪费 57 倍显存
问题2:KV cache 困于单一内存层 - 当前系统把 KV cache 全扔进 GPU HBM - 实际上有丰富的内存层级:CPU DRAM → CXL 内存 → NVMe(GPUDirect Storage)→ RDMA fabric → 并行文件系统 - KV cache 的冷热分层管理被忽视
问题3:被动 evict 策略 - 现有策略在显存满时被动驱逐缓存 - 没有预测机制利用 Prefix 复用规律 - SGLang RadixAttention 在某种程度上解决了 prefix 复用,但这是系统层面的解法
关键数字(分析推算,非实测): - 架构感知 sizing engine → batch size ↑7.4x - TTFT 降低 1.4–2.1x - 吞吐提升 1.7–2.9x - 成本降低 47%
→ 后续行动:待论文正式版发表后验证数字,复现环境需 A100/H100 多节点
✅ MLRA: Multi-Head Low-Rank Attention
论文: arXiv:2603.02188v1 核心贡献: 可分区的 latent states,支持 4-way 张量并行解码
MLA 的问题(回顾): - DeepSeek 的 MLA 将 KV cache 压缩为 latent head(约 4.5×dh) - 解码时必须通过单一 MQA-absorb 路径恢复 - 无法天然支持多路 TP 并行解码
MLRA 的解法: - 将 down-projection 后的 C^KV 和 C^Q 设计为可分区 - 各分区独立进行解码计算 - 等效于将 MLA 的单一路径变成多路并行
工程意义: 对于需要多路 GPU 并行推理大模型的场景(DeepSeek 70B+),MLRA 的可分区设计比原生 MLA 更适合分布式推理引擎实现。
✅ GQLA: Group-Query Latent Attention
论文: arXiv:2605.15250v1 / v2 可信度: ★★★★★ 核心贡献: MLA 的低秩压缩 + GQA 的分组并行,但不锁死 MQA-absorb 路径
MLA vs GQLA 的根本差异: - MLA:joint low-rank compression → 最小 cache → 解码必须 MQA-absorb - GQLA:保留 latent compression 的压缩率,同时保留硬件自适应的多路解码路径
工程价值: GQLA 解决了 MLA 在推理引擎实现中的一个关键工程限制——DeepSeek 模型在 SGLang 中表现优异,部分因为 SGLang 对 MLA 的处理更优雅,而 GQLA 将这个工程优化进一步形式化。
✅ MHA2MLA-VLM: 视觉-语言模型的 MLA 迁移
论文: arXiv:2601.11464v1 可信度: ★★★★☆ 工程场景: VLM 推理部署 / 多模态 Agent 后端
两个核心技术:
1. Modality-adaptive partial-RoPE: - RoPE(Rotary Position Embedding)在 MLA 中与低秩压缩存在维度冲突 - partial-RoPE 选择性屏蔽非必要维度,同时适配纯文本和多模态场景 - 不需要重新训练原 VLM
2. Modality-decoupled 低秩近似: - 视觉和文本的 KV 空间独立压缩 - 视觉 token 通常更长(patch 化后),独立压缩率避免互相迁就
工程效果: - MHA2MLA-VLM 恢复原模型性能 - KV cache 显著降低 - 无缝集成 KV 量化(INT8/FP8)
→ VLM 部署场景(多模态 RAG、视觉 Agent)可直接跟进此工作
✅ CCGQA: Compressed Convolutional Grouped Query Attention
论文: arXiv:2510.04476v2 可信度: ★★★★☆ 核心创新: 在 latent space 内部完成全部 attention 操作,compute 和 bandwidth 联合优化
为什么 GQA/MLA 不够: - GQA 和 MLA 只压缩 KV cache(memory side) - Prefill 阶段的 compute 几乎不变(Q 仍然要 full-size 计算) - CCGQA 的 down-projection 同样作用于 Q,实现 compute 和 memory 的联合压缩
关键数字: - 在 Dense 和 MoE 模型上,8x KV cache 压缩无性能下降 - 比 GQA/MLA 在同等 cache 大小下效果更好 - MoE 模型上优势最明显
⚠️ 审稿注意: "8x 无性能下降"的 claim 需要在更大模型(>7B)上验证,论文测试主要在较小规模。
📌 工程行动建议
| 优先级 | 行动 | 对应研究 |
|---|---|---|
| 🔴 紧急 | pgvector 生产实例升级至 0.8.2+(CVE-2026-3172) | Vector DB 安全告警 |
| 🔴 高优先 | 评估 SGLang 替代 vLLM(DeepSeek / MoE / 前缀复用场景) | SGLang vs vLLM benchmark |
| 🟡 高优先 | KV cache 多层存储:评估 CPU DRAM / CXL 作为冷 cache 层 | arXiv 2604.26968 |
| 🟡 高优先 | VLM 部署场景跟进 MHA2MLA-VLM 方案 | arXiv 2601.11464 |
| 🟢 中优先 | LRKV 的低秩 residual 设计引入生产评估 | arXiv 2601.11471 |
| 🟢 中优先 | CCGQA 在 MoE 模型上的端到端 benchmark | arXiv 2510.04476 |
🏷️ 分类标签
database kv-cache mla lrkv gqla mlra ccgqa arxiv query-optimizer inference-optimization