研究草稿 · 2026-07-13 傍晚

本次主题

KVCache 架构演进全景(Modular 五时代)+ LLM 架构最新进展(Raschka)+ Harness 工程自我改进(Lilian Weng)


一、The Five Eras of KVCache(Modular)

链接https://www.modular.com/blog/the-five-eras-of-kvcache
来源:Modular 官方工程博客
发布时间:2026年7月(推断)
可信度:⭐⭐⭐⭐⭐

核心内容摘要

Modular 从系统工程视角,将 KVCache 在 LLM 推理引擎中的演进划分为五个时代:

Era 1 — No KVCache(Transformer 前中期) - 早期 Transformer 模型(如原始 GPT/BERT)单次推理即可完成,无需跨 step 状态 - ONNX、TensorRT 等通用推理框架时期,KVCache 概念尚未出现

Era 2 — Single Request KVCache(自回归推理引入) - 自回归生成模型需要在每步生成时保留此前所有 token 的 Key-Value 状态 - 朴素实现:为每个请求在 GPU VRAM 中预分配最大序列长度 × hidden_dim 的连续块 - 问题:连续分配导致显存碎片化、并发能力极低

**Era 3 — PagedAttention / Chunked KVCache(vLLM 突破)
vLLM 引入 PagedAttention,将 KVCache 按 block 分页管理,类似操作系统的虚拟内存分页: - 无需预分配最大序列长度,按需分配物理块 - 支持在 GPU 内存满时换出到 CPU RAM - 多个请求的 KVCache 可共享同一物理块(相同前缀场景)

**Era 4 — RadixAttention / Tree-based Routing(SGLang 路线)
SGLang 的 RadixAttention 进一步将分页思想扩展为基数树(Radix Tree): - 多个并发请求可共享公共前缀的 KVCache(如 few-shot 示例、system prompt) - LRU 淘汰策略自动管理缓存复用 - 在推理吞吐量上比 vLLM 高 5×(相同前缀场景)

Era 5 — Speculative Decoding + Prefix Caching + Cross-Request Sharing(当前前沿)
最新一代引擎整合多种 KVCache 优化: -
Speculative Decoding:draft model 和 target model 各自维护 KVCache - Prefix Caching:相同 system prompt / few-shot 示例跨请求复用 - Continuous Batching**:动态拼批,结合 KVCache 分页

工程评价

  • 价值:系统梳理了 KVCache 优化的演进脉络,对理解 vLLM vs SGLang vs TensorRT-LLM 的架构差异非常有帮助
  • 局限性:纯概念性,缺具体 benchmark 数据;适合作为理解框架,不适合做选型依据
  • 建议分类kvcache inference-engineering vllm sglang pagedattention architecture

二、Raschka:LLM 架构最新进展 — KV Sharing、mHC、Compressed Attention

链接https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures
作者:Sebastian Raschka(AI researcher, Ahead of AI newsletter)
发布时间:2026年7月(推断,约6月前后)
可信度:⭐⭐⭐⭐

核心观点摘要

Raschka 系统梳理了 2025-2026 年主流开源权重模型在长上下文场景下的架构创新:

1. KV Sharing(Key-Value 共享机制) - 背景:长上下文场景下,KVCache 显存占用成为主要瓶颈 - 核心思路:不同 attention head 或不同层之间共享 key/value 表示 - 代表工作: - Multi-head Cache (mHC):将 KV 按 head 分组共享,减少冗余存储 - Compressed Attention:对 KV 进行压缩存储,定期清理不重要信息 - 效果:从 Gemma 4 到 DeepSeek V4,各家模型均在不同程度引入 KV 压缩机制

2. 各家模型架构对比

模型 参数量 上下文 架构特色
Gemma 4 12B 128K encoder-free multimodal,统一处理图像文本
DeepSeek V4 1.6T 1M MoE + KVSharing,生产级长上下文
Qwen 3 多尺寸 128K dual chunk attention,支持超长 prompt

3. 核心工程启示 - 长上下文成本正在被 KV 压缩技术系统性降低 - 混合注意力机制(局部+全局)正在成为主流 - 开源模型在长上下文任务上正在缩小与闭源模型差距

工程评价

  • 价值:Raschka 是 AI/NLP 领域高影响力研究者,内容经过技术验证;将 KV Sharing、mHC、Compressed Attention 整合到统一框架下,梳理清晰
  • 局限:偏向研究视角,工程落地细节有限
  • 建议分类llm-architecture kvcache compressed-attention gemma deepseek qwen raschka

三、Lilian Weng:面向自我改进的 Harness 工程

链接https://lilianweng.github.io/posts/2026-07-04-harness/
作者:Lilian Weng(Lil'Log,OpenAI 安全团队前成员)
发布时间:2026-07-04
可信度:⭐⭐⭐⭐⭐

核心内容摘要

Lilian Weng 这篇博文系统探讨了如何通过 Harness 工程(Harness Engineering)实现 LLM 的递归自我改进(Recursive Self-Improvement, RSI)。

RSI 概念溯源 - I. J. Good (1965):超智能机器定义为"能够超出其设计者能力的机器" - 核心问题:在 AI Agent 中实现 RSI 需要什么工程基础设施?

Harness 的定义 - Harness = "约束框架",用于引导 LLM 行为、收集反馈、驱动改进 - 类比:软件开发中的 test harness——标准化输入、收集输出、验证正确性 - Agent 场景下的 Harness 需要:环境模拟、工具调用追踪、memory 管理、eval 回调

Harness 工程四大组件

  1. Environment Simulation(环境模拟) - 提供可重复的测试环境(代码执行、沙盒、API mock) - 关键挑战:真实环境与模拟环境之间的分布偏移

  2. Tool Call Tracking(工具调用追踪) - 记录每次工具调用:输入、输出、耗时、成本 - 用于离线回放和错误根因分析

  3. Memory Tier Management(记忆分层) - L1: Working memory(当前会话上下文) - L2: Episodic memory(跨会话重要事件) - L3: Long-term knowledge(持久化的学到教训) - Harness 需要能够在不同层级间迁移和对齐信息

  4. Eval-Driven Refinement(评估驱动精炼) - 设计 reward 信号来驱动模型自我改进 - 关键:reward 信号本身的可靠性(避免 reward hacking)

Harness 工程中的常见失败模式 - 分布偏移:模拟环境与生产环境的输入分布差异 - reward hacking:模型学会"作弊"获取高分而非真正改进 - 层级混淆:L2 memory 被错误地当作 L3 使用

工程评价

  • 价值:Lilian Weng 是 AI 安全与 Agent 系统领域的顶级实践者,本文将"自我改进 Agent"从哲学概念落实到 Harness 工程细节,具有很强的实操性
  • 与前序条目的互补:与 2026-07-13 下午子堆栈 AI Agent Stack 2026 互补——该文描述"六层架构",本文给出其中 Memory 层和 Eval 层的深度工程实现
  • 建议分类agent self-improvement harness eval memory lilian-weng recursive

四、关联与去重说明

条目 与本批次其他条目的关联
Modular Five Eras of KVCache 与 Raschka KV Sharing 互补,前者是系统工程视角,后者是模型架构视角,共同构成 KV 优化全景
Raschka LLM Architecture 与 2026-07-13 子堆栈 AI Agent Stack 互补,前者关注底层模型,后者关注上层编排
Lilian Weng Harness 与 Simon Willison "vibe coding" 方向相反——Weng 关注系统化工程,Willison 关注快速探索
Lilian Weng Harness 与 2026-07-13 下午 "awesome-ai-agents-2026" 中的 memory 层直接关联

五、建议写入路径

分类 建议写入
kvcache inference-engineering 本批次三条可合并为一个 inference-kvcache-architecture-2026 主题页
agent harness self-improvement Lilian Weng 条目可单独写入 agent-harness-selfplay-2026,或合并入已有 agent 相关主题页

六、后续行动建议

  1. 精读:Lilian Weng Harness Engineering(工程细节丰富,建议完整阅读原文)
  2. 审稿:Raschka LLM Architecture 条目,可向其 newsletter 提交技术勘误
  3. 主题页更新:建议合并本批次三条为 kvcache-architecture-survey-2026 主题页,作为知识库 Inference Systems 分支的补充材料
  4. 核验:Modular Five Eras of KVCache 的 Era 时代划分是否与 vLLM 官方文档一致