数据库内核 & KV Cache 工程 · 2026-06-28

Jay · 研究知识库


🔬 检索范围

  • tavily: arXiv KV cache 压缩 / MLA / MQA / GQA / 低秩注意力 / 多层存储管理
  • 目标:工程可复现的 KV cache 优化论文 + 数据库查询优化新动态

📐 database · 数据库内核动态

ICDE 2026 接收论文(部分)

来源: https://icde2026.github.io/accepted-papers.html 可信度: ★★★★☆ 发布时间: 2026年

值得关注(标题摘要): - FaScalSQL: GPU-Accelerated SQL Query Engine for Out-of-Memory Tables(NUDT) → GPU 加速 OOM 表的 SQL 查询引擎,国防科技大学团队 - LITHE: Query Rewrite Advisor using LLMs(IISc Bangalore) → LLM 做查询重写建议,印第安理工学院数据库实验室

Learned Query Optimizer 综述(ACM 2026)

来源: https://dl.acm.org/doi/10.1145/3626246.3654692 可信度: ★★★★☆ 类型: Tutorial paper,理论与实践并重

覆盖范围: Learned Cardinality Estimation / Learned Join Ordering / E2E Query Optimizer


🧠 kv-cache · KV Cache 优化:工程复现笔记

本章节聚焦生产可复现的 KV cache 压缩与内存管理研究。核心问题:LLM 推理中 KV cache 是主要显存瓶颈,如何在精度可接受范围内压缩?

📍 基线:MHA / MQA / GQA / MLA 四代压缩范式

范式 代表 KV Cache 量级 Compute 变化 主要缺点
MHA(标准多头注意力) - O(n·h·dh) 显存杀手
MQA(多查询注意力) Shazeer 2019 共享单一 K/V 减少 解码快但质量损失
GQA(分组查询注意力) Ainslie 2023 每组共享 K/V 减少 精度 vs 压缩 trade-off
MLA(多头潜在注意力) DeepSeek 2024 低秩联合压缩 ~4.5×dh 减少 decode RoPE 冲突;锁死 MQA-absorb 路径
LRKV(低秩 KV) 2601.11471 MHA 的 45-53% 基本不变 最新研究,精度超 MLA
MLRA(多头低秩注意力) 2603.02188 可分区块 4-way TP MLA 升级版,支持张量并行
GQLA(分组查询潜在注意力) 2605.15250 MLA 级 MLA 级 解决 MLA 架构锁定,硬件自适应
CCGQA 2510.04476 8x 压缩无性能下降 联合压缩 MoE 模型效果最佳

✅ LRKV: Low-Rank Key Value Attention

论文: arXiv:2601.11471v3 机构: 未确认(arXiv 匿名提交格式) 可信度: ★★★★☆ 工程价值: ★★★★★

核心方法: 每层使用一个全秩共享 KV projection + 低秩 head-specific residual: - 共享部分 → 跨 head 利用冗余,压缩 cache - residual 部分 → 保留每个 head 的独立信息,弥补 MQA/GQA 的精度损失

实验结果(在 128M~6.3B 模型上): - test loss 一致性低于标准 MHA、MQA/GQA、MLA - KV cache 大小:MHA 的 45-53% - 适用:Dense 和 MoE 模型

工程提示: 低秩 residual 的秩(rank)是一个可调超参,压缩率与精度的 trade-off 可通过调整 rank 控制。这是目前第一篇在压缩率下精度超越 MLA 的工作。


✅ Predictive Multi-Tier Memory Management for KV Cache

论文: arXiv:2604.26968v1 可信度: ★★★★★ 工程价值: ★★★★★(对大规模推理服务架构影响直接)

三个 compound 失效问题:

问题1:MLA 架构的内存过度配置 - 通用框架不感知 MLA 架构,导致 57x 内存过度配置 - 例如:DeepSeek-V2 对 KV cache 的估算如果套用 MHA 框架,会浪费 57 倍显存

问题2:KV cache 困于单一内存层 - 当前系统把 KV cache 全扔进 GPU HBM - 实际上有丰富的内存层级:CPU DRAM → CXL 内存 → NVMe(GPUDirect Storage)→ RDMA fabric → 并行文件系统 - KV cache 的冷热分层管理被忽视

问题3:被动 evict 策略 - 现有策略在显存满时被动驱逐缓存 - 没有预测机制利用 Prefix 复用规律 - SGLang RadixAttention 在某种程度上解决了 prefix 复用,但这是系统层面的解法

关键数字(分析推算,非实测): - 架构感知 sizing engine → batch size ↑7.4x - TTFT 降低 1.4–2.1x - 吞吐提升 1.7–2.9x - 成本降低 47%

→ 后续行动:待论文正式版发表后验证数字,复现环境需 A100/H100 多节点


✅ MLRA: Multi-Head Low-Rank Attention

论文: arXiv:2603.02188v1 核心贡献: 可分区的 latent states,支持 4-way 张量并行解码

MLA 的问题(回顾): - DeepSeek 的 MLA 将 KV cache 压缩为 latent head(约 4.5×dh) - 解码时必须通过单一 MQA-absorb 路径恢复 - 无法天然支持多路 TP 并行解码

MLRA 的解法: - 将 down-projection 后的 C^KV 和 C^Q 设计为可分区 - 各分区独立进行解码计算 - 等效于将 MLA 的单一路径变成多路并行

工程意义: 对于需要多路 GPU 并行推理大模型的场景(DeepSeek 70B+),MLRA 的可分区设计比原生 MLA 更适合分布式推理引擎实现。


✅ GQLA: Group-Query Latent Attention

论文: arXiv:2605.15250v1 / v2 可信度: ★★★★★ 核心贡献: MLA 的低秩压缩 + GQA 的分组并行,但不锁死 MQA-absorb 路径

MLA vs GQLA 的根本差异: - MLA:joint low-rank compression → 最小 cache → 解码必须 MQA-absorb - GQLA:保留 latent compression 的压缩率,同时保留硬件自适应的多路解码路径

工程价值: GQLA 解决了 MLA 在推理引擎实现中的一个关键工程限制——DeepSeek 模型在 SGLang 中表现优异,部分因为 SGLang 对 MLA 的处理更优雅,而 GQLA 将这个工程优化进一步形式化。


✅ MHA2MLA-VLM: 视觉-语言模型的 MLA 迁移

论文: arXiv:2601.11464v1 可信度: ★★★★☆ 工程场景: VLM 推理部署 / 多模态 Agent 后端

两个核心技术:

1. Modality-adaptive partial-RoPE: - RoPE(Rotary Position Embedding)在 MLA 中与低秩压缩存在维度冲突 - partial-RoPE 选择性屏蔽非必要维度,同时适配纯文本和多模态场景 - 不需要重新训练原 VLM

2. Modality-decoupled 低秩近似: - 视觉和文本的 KV 空间独立压缩 - 视觉 token 通常更长(patch 化后),独立压缩率避免互相迁就

工程效果: - MHA2MLA-VLM 恢复原模型性能 - KV cache 显著降低 - 无缝集成 KV 量化(INT8/FP8)

→ VLM 部署场景(多模态 RAG、视觉 Agent)可直接跟进此工作


✅ CCGQA: Compressed Convolutional Grouped Query Attention

论文: arXiv:2510.04476v2 可信度: ★★★★☆ 核心创新: 在 latent space 内部完成全部 attention 操作,compute 和 bandwidth 联合优化

为什么 GQA/MLA 不够: - GQA 和 MLA 只压缩 KV cache(memory side) - Prefill 阶段的 compute 几乎不变(Q 仍然要 full-size 计算) - CCGQA 的 down-projection 同样作用于 Q,实现 compute 和 memory 的联合压缩

关键数字: - 在 Dense 和 MoE 模型上,8x KV cache 压缩无性能下降 - 比 GQA/MLA 在同等 cache 大小下效果更好 - MoE 模型上优势最明显

⚠️ 审稿注意: "8x 无性能下降"的 claim 需要在更大模型(>7B)上验证,论文测试主要在较小规模。


📌 工程行动建议

优先级 行动 对应研究
🔴 紧急 pgvector 生产实例升级至 0.8.2+(CVE-2026-3172) Vector DB 安全告警
🔴 高优先 评估 SGLang 替代 vLLM(DeepSeek / MoE / 前缀复用场景) SGLang vs vLLM benchmark
🟡 高优先 KV cache 多层存储:评估 CPU DRAM / CXL 作为冷 cache 层 arXiv 2604.26968
🟡 高优先 VLM 部署场景跟进 MHA2MLA-VLM 方案 arXiv 2601.11464
🟢 中优先 LRKV 的低秩 residual 设计引入生产评估 arXiv 2601.11471
🟢 中优先 CCGQA 在 MoE 模型上的端到端 benchmark arXiv 2510.04476

🏷️ 分类标签

database kv-cache mla lrkv gqla mlra ccgqa arxiv query-optimizer inference-optimization