知识库草稿 · Jay · 2026-08-14

主题

CSDN 高价值推理引擎 + RAG 工程文章 · Substack KV Cache / Inference Engineering 精选

检索范围

  • CSDN:vLLM / SGLang / TensorRT-LLM / 推理引擎 / KV Cache / RAG / Agent
  • Substack:LLM Inference Systems / KV Cache Engineering / Speculative Decoding / Disaggregation
  • 时效:2026-07-01 之后,重点关注 2026-08 月新增内容

一、CSDN 高价值条目(工程价值 / 复现价值 / 版本+命令)

条目 1|大模型推理引擎架构深度解析:vLLM、SGLang 与 TensorRT-LLM

  • 链接https://blog.csdn.net/DK_Allen/article/details/163443903
  • 发布时间:2026-08-03
  • 作者:DK_Allen
  • 可信度:高 — 2026-08-03 刚发布,聚焦三引擎架构对比
  • 核心内容摘要
  • vLLM:通用性+易用性成为生产部署标准,PagedAttention + Continuous Batching
  • SGLang:RadixAttention,多轮对话场景吞吐量比 vLLM 提升 3-5 倍
  • TensorRT-LLM:编译融合优化,NVIDIA 硬件极限性能,牺牲灵活性换吞吐
  • 三者架构哲学差异:vLLM 专注调度优化,SGLang 集成语言前端与调度,TensorRT-LLM 底层编译
  • 工程价值:⭐⭐⭐⭐⭐ — 三足鼎立格局分析,2026年推理引擎选型参考
  • 建议分类inference-engine / vllm / sglang / tensorrt-llm / 选型
  • 建议行动:精读,作为推理引擎选型 Wiki 条目补充

条目 2|2026 分布式高并发 AI 推理系统架构设计

  • 链接https://blog.csdn.net/yanxilou/article/details/162914326
  • 发布时间:2026-07-15
  • 作者:yanxilou
  • 可信度:高 — 架构设计向,引用 vLLM 2026年演进方向
  • 核心内容摘要
  • vLLM 是 2026 年最安全的默认选择
  • 架构价值在于根据业务负载特征(前缀复用率、结构化输出比例、模型变更频率)做精确匹配
  • 盲目追求最高吞吐不如根据业务 shape 选型
  • 涉及分布式 / 高并发场景
  • 工程价值:⭐⭐⭐⭐ — 架构决策框架,不是泛泛而谈,有选型逻辑
  • 建议分类inference-engine / architecture / distributed / vllm
  • 建议行动:精读,补充分布式推理架构 Wiki 条目

条目 3|Efficient LLM Inference 与 Serving:KV Cache、Speculative Decoding

  • 链接https://blog.csdn.net/weixin_44369324/article/details/162635526
  • 发布时间:2026-07-06
  • 作者:weixin_44369324
  • 可信度:高 — 系统梳理 2025-2026 年 LLM 推理优化核心战场
  • 核心内容摘要
  • 2025-2026 年 LLM 系统主战场从"训练更大模型"转向"又快又便宜地服务真实用户"
  • 推理是持续性成本,非一次性成本
  • KV Cache 管理策略:PagedAttention / FlashDecoding / Chunked Prefill
  • Speculative Decoding 变体:Dynamic Speculative Decoding(系统负载低时减少延迟,负载高时不启用)
  • 工程价值:⭐⭐⭐⭐ — KV Cache 和 Speculative Decoding 核心原理+工程取舍
  • 建议分类kv-cache / speculative-decoding / inference-optimization / llm-systems
  • 建议行动:审稿,作为 KV Cache 机制 Wiki 条目的更新参考

二、Substack 高价值条目

条目 4|Batching, Caching, Routing, and Cost Control(Designgurus / Arslan Ahmad)

  • 链接https://designgurus.substack.com/p/llm-inference-at-scale-batching-caching
  • 作者:Arslan Ahmad(Designgurus)
  • 可信度:高 — 工程向付费专栏,2026 年更新的 LLM Inference 系统设计深度文章
  • 核心洞察
  • Continuous Batching(Iteration-level Scheduling):请求级批处理替代固定组,GPU 满载率大幅提升
  • KV Cache 跨请求复用:prefix caching 对于有固定系统提示词的场景特别有效
  • 请求路由:根据负载动态分配到不同推理实例
  • 成本控制:TTFT(Time to First Token)和 TPOT(Time Per Output Token)的 SLO 分离优化
  • 建议分类inference-engineering / batching / kv-cache / routing / cost-optimization
  • 建议行动:归档,值得深入研读后补充到 inference-engineering 条目

条目 5|KV Caching and Speculative Decoding(Boringbot / Hamza Farooq)

  • 链接https://boringbot.substack.com/p/kv-caching-and-speculative-decoding
  • 作者:Hamza Farooq(Boringbot)+ 特邀作者 Ali Shafique(LLM post-training / inference optimization)
  • 可信度:高 — 特邀专家署名,含 KV Cache 原理和 Speculative Decoding 详解
  • 核心洞察
  • Autoregressive Decoding 每步都重新处理增长中的前缀,导致解码减速
  • KV Cache 本质:将已经计算过的 Key-Value 保存下来,避免重复计算
  • Speculative Decoding:用小模型预测多个 token,大模型验证,加速生成
  • 硬件趋势:专用 AI 芯片为 KV Cache 操作设计,可提供比通用 GPU 高 10-100 倍的改进
  • 新内存系统专为 AI 工作负载设计,高带宽内存针对 KV Cache 存储优化
  • 建议分类kv-cache / speculative-decoding / hardware / llm-inference
  • 建议行动:精读,补充硬件趋势到 inference-systems 条目

条目 6|What is inference engineering? Deepdive(Gergely Orosz / Pragmatic Engineer)

  • 链接https://open.substack.com/pub/pragmaticengineer/p/what-is-inference-engineering
  • 作者:Gergely Orosz(Pragmatic Engineer,知名软件工程 newsletter)
  • 可信度:高 — 2026 年更新的 inference engineering 定义性文章
  • 核心洞察
  • Inference Engineering 作为独立工种已成型:不是 ML 工程师,也不是传统 SRE
  • Prefill/Decode Disaggregation:将 LLM 推理拆分为三步:prefill 生成 KV cache 并计算第一个 token → 通过硬件互联传输 KV cache → decode engine 计算后续 token
  • KV Cache 跨请求复用:相同固定前缀的请求(如相同的 system prompt)可以复用 KV Cache
  • 业界对 inference engineering 的需求随 AI 爆发而急剧增长
  • 建议分类inference-engineering / disaggregation / kv-cache / role-definition
  • 建议行动:归档,作为 inference engineering 职业定义 Wiki 条目

条目 7|Architecting LLM Inference: Part 6 - Parallelism for Large-Scale Inference(Pawan K Jha)

  • 链接https://pawankjha.substack.com/p/architecting-llm-inference-part-6
  • 作者:Pawan K Jha
  • 发布时间:2026-06-15
  • 可信度:高 — "Architecting LLM Inference" 系列第 6 篇,系列系统性深度
  • 核心洞察
  • 并行策略:Tensor Parallelism / Pipeline Parallelism / Data Parallelism / Sequence Parallelism
  • Prefill/Decode Disaggregation 优势:TTFT 和 TPOT 分别优化、减少 prefill/decode 干扰、不同硬件处理不同阶段
  • KV-Cache-Centric Serving:将 KV state 作为基础设施而非临时运行时状态
  • 关键机制:paged KV allocation / prefix caching / KV reuse / KV eviction / KV offload / KV transfer / KV-aware routing
  • 主要成本:KV 传输延迟、网络带宽压力、缓存放置复杂性、跨阶段故障处理
  • 建议分类llm-systems / parallelism / disaggregation / kv-cache / distributed-inference
  • 建议行动:精读,作为大规模 LLM 推理架构 Wiki 的并行策略补充

条目 8|My NeurIPS Week in KV Caches, Spec Decoding, and FP4(Kaitchup)

  • 链接https://kaitchup.substack.com/p/efficient-llms-at-scale-my-neurips
  • 作者:Kaitchup(高效 LLM 微调/推理 newsletter)
  • 可信度:高 — NeurIPS 2026 一手观察,学术+工程交汇
  • 核心洞察
  • ChunkKV:语义保留的 KV Cache 压缩方法,区别于独立 token 剪枝(会破坏局部语义)
  • RL for LLMs 趋势:到 2026 年底,RL 在 LLM 中的应用方式预计会有显著变化
  • GRPO 等增量修复可能将被更整合的方法取代
  • FP4 量化(4-bit 浮点)在推理中的应用
  • 建议分类kv-cache / quantization / rlhf / neurips2026 / research-trend
  • 建议行动:归档,ChunkKV 方法值得关注

三、综合评估

条目 来源 类型 工程价值 新鲜度 建议动作
推理引擎架构深度解析 vLLM/SGLang/TensorRT CSDN 工程选型 ⭐⭐⭐⭐⭐ 2026-08-03 精读
2026分布式高并发AI推理架构 CSDN 架构设计 ⭐⭐⭐⭐ 2026-07-15 精读
KV Cache + Speculative Decoding 原理工程 CSDN 技术深度 ⭐⭐⭐⭐ 2026-07-06 审稿
Designgurus: Batching/Caching/Routing/Cost Substack 工程系统 ⭐⭐⭐⭐⭐ 2026 精读
Boringbot: KV + Spec Decoding 硬件趋势 Substack 技术深度 ⭐⭐⭐⭐ 2026 精读
Gergely Orosz: What is Inference Engineering Substack 职业定义 ⭐⭐⭐⭐⭐ 2026 精读
Pawan K Jha: LLM Inference Part 6 Parallelism Substack 系统架构 ⭐⭐⭐⭐⭐ 2026-06 精读
Kaitchup: NeurIPS KV Cache / RL / FP4 Substack 学术前沿 ⭐⭐⭐ 2026 归档

四、建议写入路径

  • 主草稿/shared/research-kb/inbox/jay/2026-08-14-csdn-inference-rag-substack-highvalue.md(本文件)

五、待办 / 后续行动

  1. Wiki 条目更新:基于条目 1、2、7,更新知识库「推理引擎选型」和「大规模 LLM 推理架构」页面
  2. 精读任务:Designgurus 和 Gergely Orosz 的文章适合作为 inference engineering 主题页核心引用
  3. ChunkKV 跟进:条目 8 提到的 ChunkKV 语义保留压缩值得关注,检索是否有对应 arXiv 论文
  4. CSDN 原文访问:CSDN 页面多次超时,建议通过 CSDN AI 阅读助手或镜像获取全文内容