知识库草稿 · Jay · 2026-08-14
主题
CSDN 高价值推理引擎 + RAG 工程文章 · Substack KV Cache / Inference Engineering 精选
检索范围
- CSDN:vLLM / SGLang / TensorRT-LLM / 推理引擎 / KV Cache / RAG / Agent
- Substack:LLM Inference Systems / KV Cache Engineering / Speculative Decoding / Disaggregation
- 时效:2026-07-01 之后,重点关注 2026-08 月新增内容
一、CSDN 高价值条目(工程价值 / 复现价值 / 版本+命令)
条目 1|大模型推理引擎架构深度解析:vLLM、SGLang 与 TensorRT-LLM
- 链接:
https://blog.csdn.net/DK_Allen/article/details/163443903 - 发布时间:2026-08-03
- 作者:DK_Allen
- 可信度:高 — 2026-08-03 刚发布,聚焦三引擎架构对比
- 核心内容摘要:
- vLLM:通用性+易用性成为生产部署标准,PagedAttention + Continuous Batching
- SGLang:RadixAttention,多轮对话场景吞吐量比 vLLM 提升 3-5 倍
- TensorRT-LLM:编译融合优化,NVIDIA 硬件极限性能,牺牲灵活性换吞吐
- 三者架构哲学差异:vLLM 专注调度优化,SGLang 集成语言前端与调度,TensorRT-LLM 底层编译
- 工程价值:⭐⭐⭐⭐⭐ — 三足鼎立格局分析,2026年推理引擎选型参考
- 建议分类:
inference-engine/vllm/sglang/tensorrt-llm/选型 - 建议行动:精读,作为推理引擎选型 Wiki 条目补充
条目 2|2026 分布式高并发 AI 推理系统架构设计
- 链接:
https://blog.csdn.net/yanxilou/article/details/162914326 - 发布时间:2026-07-15
- 作者:yanxilou
- 可信度:高 — 架构设计向,引用 vLLM 2026年演进方向
- 核心内容摘要:
- vLLM 是 2026 年最安全的默认选择
- 架构价值在于根据业务负载特征(前缀复用率、结构化输出比例、模型变更频率)做精确匹配
- 盲目追求最高吞吐不如根据业务 shape 选型
- 涉及分布式 / 高并发场景
- 工程价值:⭐⭐⭐⭐ — 架构决策框架,不是泛泛而谈,有选型逻辑
- 建议分类:
inference-engine/architecture/distributed/vllm - 建议行动:精读,补充分布式推理架构 Wiki 条目
条目 3|Efficient LLM Inference 与 Serving:KV Cache、Speculative Decoding
- 链接:
https://blog.csdn.net/weixin_44369324/article/details/162635526 - 发布时间:2026-07-06
- 作者:weixin_44369324
- 可信度:高 — 系统梳理 2025-2026 年 LLM 推理优化核心战场
- 核心内容摘要:
- 2025-2026 年 LLM 系统主战场从"训练更大模型"转向"又快又便宜地服务真实用户"
- 推理是持续性成本,非一次性成本
- KV Cache 管理策略:PagedAttention / FlashDecoding / Chunked Prefill
- Speculative Decoding 变体:Dynamic Speculative Decoding(系统负载低时减少延迟,负载高时不启用)
- 工程价值:⭐⭐⭐⭐ — KV Cache 和 Speculative Decoding 核心原理+工程取舍
- 建议分类:
kv-cache/speculative-decoding/inference-optimization/llm-systems - 建议行动:审稿,作为 KV Cache 机制 Wiki 条目的更新参考
二、Substack 高价值条目
条目 4|Batching, Caching, Routing, and Cost Control(Designgurus / Arslan Ahmad)
- 链接:
https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching - 作者:Arslan Ahmad(Designgurus)
- 可信度:高 — 工程向付费专栏,2026 年更新的 LLM Inference 系统设计深度文章
- 核心洞察:
- Continuous Batching(Iteration-level Scheduling):请求级批处理替代固定组,GPU 满载率大幅提升
- KV Cache 跨请求复用:prefix caching 对于有固定系统提示词的场景特别有效
- 请求路由:根据负载动态分配到不同推理实例
- 成本控制:TTFT(Time to First Token)和 TPOT(Time Per Output Token)的 SLO 分离优化
- 建议分类:
inference-engineering/batching/kv-cache/routing/cost-optimization - 建议行动:归档,值得深入研读后补充到 inference-engineering 条目
条目 5|KV Caching and Speculative Decoding(Boringbot / Hamza Farooq)
- 链接:
https://boringbot.substack.com/p/kv-caching-and-speculative-decoding - 作者:Hamza Farooq(Boringbot)+ 特邀作者 Ali Shafique(LLM post-training / inference optimization)
- 可信度:高 — 特邀专家署名,含 KV Cache 原理和 Speculative Decoding 详解
- 核心洞察:
- Autoregressive Decoding 每步都重新处理增长中的前缀,导致解码减速
- KV Cache 本质:将已经计算过的 Key-Value 保存下来,避免重复计算
- Speculative Decoding:用小模型预测多个 token,大模型验证,加速生成
- 硬件趋势:专用 AI 芯片为 KV Cache 操作设计,可提供比通用 GPU 高 10-100 倍的改进
- 新内存系统专为 AI 工作负载设计,高带宽内存针对 KV Cache 存储优化
- 建议分类:
kv-cache/speculative-decoding/hardware/llm-inference - 建议行动:精读,补充硬件趋势到 inference-systems 条目
条目 6|What is inference engineering? Deepdive(Gergely Orosz / Pragmatic Engineer)
- 链接:
https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering - 作者:Gergely Orosz(Pragmatic Engineer,知名软件工程 newsletter)
- 可信度:高 — 2026 年更新的 inference engineering 定义性文章
- 核心洞察:
- Inference Engineering 作为独立工种已成型:不是 ML 工程师,也不是传统 SRE
- Prefill/Decode Disaggregation:将 LLM 推理拆分为三步:prefill 生成 KV cache 并计算第一个 token → 通过硬件互联传输 KV cache → decode engine 计算后续 token
- KV Cache 跨请求复用:相同固定前缀的请求(如相同的 system prompt)可以复用 KV Cache
- 业界对 inference engineering 的需求随 AI 爆发而急剧增长
- 建议分类:
inference-engineering/disaggregation/kv-cache/role-definition - 建议行动:归档,作为 inference engineering 职业定义 Wiki 条目
条目 7|Architecting LLM Inference: Part 6 - Parallelism for Large-Scale Inference(Pawan K Jha)
- 链接:
https://pawankjha.substack.com/p/architecting-llm-inference-part-6 - 作者:Pawan K Jha
- 发布时间:2026-06-15
- 可信度:高 — "Architecting LLM Inference" 系列第 6 篇,系列系统性深度
- 核心洞察:
- 并行策略:Tensor Parallelism / Pipeline Parallelism / Data Parallelism / Sequence Parallelism
- Prefill/Decode Disaggregation 优势:TTFT 和 TPOT 分别优化、减少 prefill/decode 干扰、不同硬件处理不同阶段
- KV-Cache-Centric Serving:将 KV state 作为基础设施而非临时运行时状态
- 关键机制:paged KV allocation / prefix caching / KV reuse / KV eviction / KV offload / KV transfer / KV-aware routing
- 主要成本:KV 传输延迟、网络带宽压力、缓存放置复杂性、跨阶段故障处理
- 建议分类:
llm-systems/parallelism/disaggregation/kv-cache/distributed-inference - 建议行动:精读,作为大规模 LLM 推理架构 Wiki 的并行策略补充
条目 8|My NeurIPS Week in KV Caches, Spec Decoding, and FP4(Kaitchup)
- 链接:
https://kaitchup.substack.com/p/efficient-llms-at-scale-my-neurips - 作者:Kaitchup(高效 LLM 微调/推理 newsletter)
- 可信度:高 — NeurIPS 2026 一手观察,学术+工程交汇
- 核心洞察:
- ChunkKV:语义保留的 KV Cache 压缩方法,区别于独立 token 剪枝(会破坏局部语义)
- RL for LLMs 趋势:到 2026 年底,RL 在 LLM 中的应用方式预计会有显著变化
- GRPO 等增量修复可能将被更整合的方法取代
- FP4 量化(4-bit 浮点)在推理中的应用
- 建议分类:
kv-cache/quantization/rlhf/neurips2026/research-trend - 建议行动:归档,ChunkKV 方法值得关注
三、综合评估
| 条目 | 来源 | 类型 | 工程价值 | 新鲜度 | 建议动作 |
|---|---|---|---|---|---|
| 推理引擎架构深度解析 vLLM/SGLang/TensorRT | CSDN | 工程选型 | ⭐⭐⭐⭐⭐ | 2026-08-03 | 精读 |
| 2026分布式高并发AI推理架构 | CSDN | 架构设计 | ⭐⭐⭐⭐ | 2026-07-15 | 精读 |
| KV Cache + Speculative Decoding 原理工程 | CSDN | 技术深度 | ⭐⭐⭐⭐ | 2026-07-06 | 审稿 |
| Designgurus: Batching/Caching/Routing/Cost | Substack | 工程系统 | ⭐⭐⭐⭐⭐ | 2026 | 精读 |
| Boringbot: KV + Spec Decoding 硬件趋势 | Substack | 技术深度 | ⭐⭐⭐⭐ | 2026 | 精读 |
| Gergely Orosz: What is Inference Engineering | Substack | 职业定义 | ⭐⭐⭐⭐⭐ | 2026 | 精读 |
| Pawan K Jha: LLM Inference Part 6 Parallelism | Substack | 系统架构 | ⭐⭐⭐⭐⭐ | 2026-06 | 精读 |
| Kaitchup: NeurIPS KV Cache / RL / FP4 | Substack | 学术前沿 | ⭐⭐⭐ | 2026 | 归档 |
四、建议写入路径
- 主草稿:
/shared/research-kb/inbox/jay/2026-08-14-csdn-inference-rag-substack-highvalue.md(本文件)
五、待办 / 后续行动
- Wiki 条目更新:基于条目 1、2、7,更新知识库「推理引擎选型」和「大规模 LLM 推理架构」页面
- 精读任务:Designgurus 和 Gergely Orosz 的文章适合作为 inference engineering 主题页核心引用
- ChunkKV 跟进:条目 8 提到的 ChunkKV 语义保留压缩值得关注,检索是否有对应 arXiv 论文
- CSDN 原文访问:CSDN 页面多次超时,建议通过 CSDN AI 阅读助手或镜像获取全文内容