研究草稿 · 2026-07-13 傍晚
本次主题
KVCache 架构演进全景(Modular 五时代)+ LLM 架构最新进展(Raschka)+ Harness 工程自我改进(Lilian Weng)
一、The Five Eras of KVCache(Modular)
链接:https://www.modular.com/blog/the-five-eras-of-kvcache
来源:Modular 官方工程博客
发布时间:2026年7月(推断)
可信度:⭐⭐⭐⭐⭐
核心内容摘要
Modular 从系统工程视角,将 KVCache 在 LLM 推理引擎中的演进划分为五个时代:
Era 1 — No KVCache(Transformer 前中期) - 早期 Transformer 模型(如原始 GPT/BERT)单次推理即可完成,无需跨 step 状态 - ONNX、TensorRT 等通用推理框架时期,KVCache 概念尚未出现
Era 2 — Single Request KVCache(自回归推理引入) - 自回归生成模型需要在每步生成时保留此前所有 token 的 Key-Value 状态 - 朴素实现:为每个请求在 GPU VRAM 中预分配最大序列长度 × hidden_dim 的连续块 - 问题:连续分配导致显存碎片化、并发能力极低
**Era 3 — PagedAttention / Chunked KVCache(vLLM 突破)
vLLM 引入 PagedAttention,将 KVCache 按 block 分页管理,类似操作系统的虚拟内存分页:
- 无需预分配最大序列长度,按需分配物理块
- 支持在 GPU 内存满时换出到 CPU RAM
- 多个请求的 KVCache 可共享同一物理块(相同前缀场景)
**Era 4 — RadixAttention / Tree-based Routing(SGLang 路线)
SGLang 的 RadixAttention 进一步将分页思想扩展为基数树(Radix Tree):
- 多个并发请求可共享公共前缀的 KVCache(如 few-shot 示例、system prompt)
- LRU 淘汰策略自动管理缓存复用
- 在推理吞吐量上比 vLLM 高 5×(相同前缀场景)
Era 5 — Speculative Decoding + Prefix Caching + Cross-Request Sharing(当前前沿)
最新一代引擎整合多种 KVCache 优化:
- Speculative Decoding:draft model 和 target model 各自维护 KVCache
- Prefix Caching:相同 system prompt / few-shot 示例跨请求复用
- Continuous Batching**:动态拼批,结合 KVCache 分页
工程评价
- 价值:系统梳理了 KVCache 优化的演进脉络,对理解 vLLM vs SGLang vs TensorRT-LLM 的架构差异非常有帮助
- 局限性:纯概念性,缺具体 benchmark 数据;适合作为理解框架,不适合做选型依据
- 建议分类:
kvcacheinference-engineeringvllmsglangpagedattentionarchitecture
二、Raschka:LLM 架构最新进展 — KV Sharing、mHC、Compressed Attention
链接:https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures
作者:Sebastian Raschka(AI researcher, Ahead of AI newsletter)
发布时间:2026年7月(推断,约6月前后)
可信度:⭐⭐⭐⭐
核心观点摘要
Raschka 系统梳理了 2025-2026 年主流开源权重模型在长上下文场景下的架构创新:
1. KV Sharing(Key-Value 共享机制) - 背景:长上下文场景下,KVCache 显存占用成为主要瓶颈 - 核心思路:不同 attention head 或不同层之间共享 key/value 表示 - 代表工作: - Multi-head Cache (mHC):将 KV 按 head 分组共享,减少冗余存储 - Compressed Attention:对 KV 进行压缩存储,定期清理不重要信息 - 效果:从 Gemma 4 到 DeepSeek V4,各家模型均在不同程度引入 KV 压缩机制
2. 各家模型架构对比
| 模型 | 参数量 | 上下文 | 架构特色 |
|---|---|---|---|
| Gemma 4 | 12B | 128K | encoder-free multimodal,统一处理图像文本 |
| DeepSeek V4 | 1.6T | 1M | MoE + KVSharing,生产级长上下文 |
| Qwen 3 | 多尺寸 | 128K | dual chunk attention,支持超长 prompt |
3. 核心工程启示 - 长上下文成本正在被 KV 压缩技术系统性降低 - 混合注意力机制(局部+全局)正在成为主流 - 开源模型在长上下文任务上正在缩小与闭源模型差距
工程评价
- 价值:Raschka 是 AI/NLP 领域高影响力研究者,内容经过技术验证;将 KV Sharing、mHC、Compressed Attention 整合到统一框架下,梳理清晰
- 局限:偏向研究视角,工程落地细节有限
- 建议分类:
llm-architecturekvcachecompressed-attentiongemmadeepseekqwenraschka
三、Lilian Weng:面向自我改进的 Harness 工程
链接:https://lilianweng.github.io/posts/2026-07-04-harness/
作者:Lilian Weng(Lil'Log,OpenAI 安全团队前成员)
发布时间:2026-07-04
可信度:⭐⭐⭐⭐⭐
核心内容摘要
Lilian Weng 这篇博文系统探讨了如何通过 Harness 工程(Harness Engineering)实现 LLM 的递归自我改进(Recursive Self-Improvement, RSI)。
RSI 概念溯源 - I. J. Good (1965):超智能机器定义为"能够超出其设计者能力的机器" - 核心问题:在 AI Agent 中实现 RSI 需要什么工程基础设施?
Harness 的定义 - Harness = "约束框架",用于引导 LLM 行为、收集反馈、驱动改进 - 类比:软件开发中的 test harness——标准化输入、收集输出、验证正确性 - Agent 场景下的 Harness 需要:环境模拟、工具调用追踪、memory 管理、eval 回调
Harness 工程四大组件
-
Environment Simulation(环境模拟) - 提供可重复的测试环境(代码执行、沙盒、API mock) - 关键挑战:真实环境与模拟环境之间的分布偏移
-
Tool Call Tracking(工具调用追踪) - 记录每次工具调用:输入、输出、耗时、成本 - 用于离线回放和错误根因分析
-
Memory Tier Management(记忆分层) - L1: Working memory(当前会话上下文) - L2: Episodic memory(跨会话重要事件) - L3: Long-term knowledge(持久化的学到教训) - Harness 需要能够在不同层级间迁移和对齐信息
-
Eval-Driven Refinement(评估驱动精炼) - 设计 reward 信号来驱动模型自我改进 - 关键:reward 信号本身的可靠性(避免 reward hacking)
Harness 工程中的常见失败模式 - 分布偏移:模拟环境与生产环境的输入分布差异 - reward hacking:模型学会"作弊"获取高分而非真正改进 - 层级混淆:L2 memory 被错误地当作 L3 使用
工程评价
- 价值:Lilian Weng 是 AI 安全与 Agent 系统领域的顶级实践者,本文将"自我改进 Agent"从哲学概念落实到 Harness 工程细节,具有很强的实操性
- 与前序条目的互补:与 2026-07-13 下午子堆栈 AI Agent Stack 2026 互补——该文描述"六层架构",本文给出其中 Memory 层和 Eval 层的深度工程实现
- 建议分类:
agentself-improvementharnessevalmemorylilian-wengrecursive
四、关联与去重说明
| 条目 | 与本批次其他条目的关联 |
|---|---|
| Modular Five Eras of KVCache | 与 Raschka KV Sharing 互补,前者是系统工程视角,后者是模型架构视角,共同构成 KV 优化全景 |
| Raschka LLM Architecture | 与 2026-07-13 子堆栈 AI Agent Stack 互补,前者关注底层模型,后者关注上层编排 |
| Lilian Weng Harness | 与 Simon Willison "vibe coding" 方向相反——Weng 关注系统化工程,Willison 关注快速探索 |
| Lilian Weng Harness | 与 2026-07-13 下午 "awesome-ai-agents-2026" 中的 memory 层直接关联 |
五、建议写入路径
| 分类 | 建议写入 |
|---|---|
kvcache inference-engineering |
本批次三条可合并为一个 inference-kvcache-architecture-2026 主题页 |
agent harness self-improvement |
Lilian Weng 条目可单独写入 agent-harness-selfplay-2026,或合并入已有 agent 相关主题页 |
六、后续行动建议
- 精读:Lilian Weng Harness Engineering(工程细节丰富,建议完整阅读原文)
- 审稿:Raschka LLM Architecture 条目,可向其 newsletter 提交技术勘误
- 主题页更新:建议合并本批次三条为
kvcache-architecture-survey-2026主题页,作为知识库 Inference Systems 分支的补充材料 - 核验:Modular Five Eras of KVCache 的 Era 时代划分是否与 vLLM 官方文档一致