CSDN 高价值 + Substack 前沿研究 · 2026-08-31 早场(8:20AM)

实例: Jay
时间: 2026-08-31 08:20 (Asia/Shanghai)
检索范围: CSDN 推理内核 / MoE 部署 / SGLang 源码树 / Substack 前沿推理工程
去重参考: 08-30 早场(v0.20 五层架构、SGLang 社区贡献指南、LLaMA-Factory→Ollama);08-29 下午(DeepSeek-V4 SGLang/vLLM 选型);08-26(vLLM 0.20 架构);08-20(LangGraph/vLLM/Ollama)
本次新发现: PagedAttention CUDA Kernel 底层实现、MoE 全栈部署实战、RadixAttention 基数树数据结构、Substack 前沿推理工程系列(Physics & Engineering of Frontier LLM Inference 2026)、State of Model Serving Communities Apr 2026


一、CSDN 高价值条目

① 把操作系统搬进 GPU:vLLM PagedAttention C++/CUDA 底层实现详解 ⭐⭐⭐ 极高

  • 链接: https://blog.csdn.net/m0_69378371/article/details/158455491
  • 来源: CSDN 博客(m0_69378371)
  • 发布时间: 2026-02-27(最新推荐 2026-03-14)
  • 工程价值: 今日检索最高质量 CSDN 文章,含完整 CUDA Kernel 伪代码、Block Table 映射逻辑、Copy-on-Write 机制 Python 模拟;非泛泛架构描述,直接展示 attention_kernels.cu 底层实现
  • 核心内容:
  • KV Cache 显存浪费根因: 传统预分配导致内部碎片(Hi 占用 5 token,浪费 2043);外部碎片(长序列占住整块无法释放);前缀重复复制
  • Block Table 映射: 逻辑块(B0~B31)通过页表映射到物理离散块;va_to_pa(virtual_token_idx) 函数级实现
  • CUDA Kernel 计算流程: compute_qk_scorescompute_attn_scorescompute_output 三步;线程块通过 Block Table 查找物理块指针,逐块计算局部注意力分数,再全局归约
  • Copy-on-Write(写时复制): beam search 多分支共享同一物理块,只在写入时触发 CoW,显存降低 55%
  • KV 缓存内存布局: csrc/attention/attention_kernels.cuKVCacheLayout 结构:K: [num_blocks, num_kv_heads, head_size/x, block_size, x]V: [num_blocks, num_kv_heads, head_size, block_size]
  • 性能数据: 显存利用率 ~92%(传统 ~25%);吞吐量 198.3 tokens/s(传统 TGI 38.5 tokens/s);PagedAttention 吞吐量是 TGI 的 5.15 倍
  • 复现可行性: 高(含完整 CUDA Kernel 伪代码和 Python BlockTable 模拟,可直接复现理解)
  • 版本信息: vLLM 源码(对应 ~v0.11-v0.12 时期,含 BlockSpaceManagerV1/V2 说明)
  • 分类标签: 推理部署 vLLM PagedAttention CUDA-Kernel KV-Cache Copy-on-Write 源码
  • 建议: 精读;可作为 PagedAttention 底层原理专项存档,与 08-30 v0.20 五层架构文互补(架构文侧重调度层,本文侧重 CUDA 执行层)
  • 可信度判断: 高;源码引用具体路径 csrc/attention/attention_kernels.cu,数学公式与实现代码对照;建议交叉核验 vLLM 官方 GitHub 最新版本

② MoE 推理加速全栈优化:从模型切分到 KV Cache 共享 ⭐⭐ 高

  • 链接: https://blog.csdn.net/BytePulse/article/details/161257042
  • 来源: CSDN 博客(BytePulse)
  • 发布时间: 2026-05-20
  • 工程价值: 面向生产级 MoE 部署的全链路优化,含模型切分策略、通信优化、负载均衡、KV Cache 共享四维度
  • 核心内容:
  • MoE 稀疏激活特性:动态路由仅激活部分专家,显存瓶颈而非算力
  • 模型切分: Expert Parallelism(EP)vs Tensor Parallelism(TP);DeepSeek-V3 中 EP + TP 混合策略
  • 通信优化: DeepEP(MoE 专用通信库);all-to-all 集合通信瓶颈分析
  • KV Cache 共享: 跨请求前缀共享(同系统提示词);MoE 中 KV Cache 占比较Dense模型更低,但总量仍大
  • 负载均衡: group-limited expert routing(DeepSeek-V3);TopK + 辅助损失函数
  • 复现可行性: 中(理论框架清晰,含 DeepSeek-V3 技术报告引用,需结合 vLLM/SGLang 官方文档核验)
  • 版本信息: DeepSeek-V3(2024-12 发布);vLLM MoE 支持需核实 2026 年最新状态
  • 分类标签: 推理部署 MoE DeepSeek 模型切分 通信优化 KV-Cache 负载均衡
  • 建议: 精读;MoE 部署必读,与 08-29 DeepSeek-V4 选型稿合并建立 MoE 专辑;建议核验 vLLM 官方 MoE EP 文档

③ SGLang 源码讲解:RadixAttention 基数树 KV 缓存管理 ⭐⭐ 高

  • 链接: https://blog.csdn.net/u011091936/article/details/150429518
  • 来源: CSDN 博客(u011091936)
  • 发布时间: 2025(推断,SGLang-v0.4 时期;持续推荐)
  • 工程价值: SGLang 与 vLLM 的核心差异在于 RadixAttention 对 KV Cache 的树状管理;本文详解 RadixTree 数据结构在前缀共享中的原理
  • 核心内容:
  • SGLang 将多轮对话历史构建为 RadixTree(前缀树变体),相同前缀的请求共享同一子树
  • 插入(Insert): 新请求的前缀命中 RadixTree 时直接复用子树;未命中时创建新叶节点
  • 驱逐(Eviction): LRU 策略驱逐最少使用节点;CoW 机制避免写入冲突
  • 查询(Lookup): O(1) 前缀匹配,支持 prompt 缓存命中判断
  • 与 vLLM Block Manager 区别: vLLM 按 block 粒度管理(block_size=16 tokens);SGLang 按 token 前缀树管理(逻辑语义层);SGLang 在多轮对话场景优势显著
  • 生产配置建议: enable_prefix_caching=True(SGLang 默认开启)
  • 复现可行性: 高(含源码路径 sglang/python/sglang/srt/managers/schedule_policy.py
  • 版本信息: SGLang v0.4.3(2025 年中期);v0.5+ 版本 API 有变化,建议核验
  • 分类标签: 推理部署 SGLang RadixAttention KV-Cache 前缀缓存 源码
  • 建议: 精读;与 08-30 SGLang 社区贡献指南(侧重前端 DSL)形成互补——本文聚焦后端 RadixTree 数据结构

④ SGLang 代码梳理:KVCache 篇 ⭐⭐ 中高

  • 链接: https://blog.csdn.net/u011576070/article/details/146889758
  • 来源: CSDN 博客(u011576070)
  • 发布时间: 2025(推断)
  • 工程价值: 前后端分离架构设计解析;SGLang 如何将复杂 LLM 控制逻辑与高性能推理执行解耦
  • 核心内容:
  • 前端(Frontend): 接收用户请求,构建 RadixTree,更新树结构
  • 后端(SRT): 调用 vLLM 执行推理,管理物理 KV 块
  • 状态机调度: schedule_policy.py 中 FCFS + 优先级调度逻辑
  • 与 vLLM 的关系: SGLang 后端复用 vLLM 的 PagedAttention 和 Worker 池;差异在于 RadixTree 前缀共享层
  • 复现可行性: 中(含源码路径,适合作为架构学习材料)
  • 版本信息: SGLang 早期版本(v0.3.x 时期)
  • 分类标签: 推理部署 SGLang 架构设计 KV-Cache 前后端分离
  • 建议: 快速浏览;与 ③ 合并,核实版本差异

⑤ DeepSeek MoE 同步税:MoE 推理延迟的根源与优化实战 ⭐⭐ 中高

  • 链接: https://blog.csdn.net/weixin_30467861/article/details/162184820
  • 来源: CSDN 博客(weixin_30467861)
  • 发布时间: 2026-06-21
  • 工程价值: 指出 MoE 推理中常被忽视的"同步税"(All-to-All 通信等待)问题,给出实测数据
  • 核心内容:
  • 同步税定义: Expert 并行中 token 分发和结果汇聚的集合通信开销,与计算时间重叠率低
  • 实测数据: DeepSeek-V3 在 8-GPU 场景下,同步税占总延迟 ~30%;单 GPU 场景下 ~15%
  • 优化方向: 通信与计算重叠(overlap)、流水线并行掩盖延迟、Expert 分组策略
  • 与 vLLM 集成注意事项: EP 模式下 All-to-All 通信是瓶颈,需配合 NVLink 或 NCCL 优化
  • 复现可行性: 中(含实测数据,需结合 DeepSeek 官方技术报告核验)
  • 版本信息: DeepSeek-V3(2024-12)
  • 分类标签: 推理部署 MoE DeepSeek 通信优化 延迟优化 并行策略
  • 建议: 审稿;与 ② 互补(②侧重全栈框架,⑤侧重延迟根因)

⑥ 2026 年大模型推理引擎怎么选(vLLM vs SGLang vs TensorRT-LLM)⭐⭐ 中高

  • 链接: https://blog.csdn.net/smallym1/article/details/163407419
  • 来源: CSDN 博客(smallym1)
  • 发布时间: 2026(推断,较新)
  • 工程价值: 2026 年最新选型决策框架,覆盖 9 个维度,含生产运维考量
  • 核心内容:
  • 9维度评分:模型支持、硬件适配、部署难度、吞吐量、延迟、结构化输出、缓存、分布式扩展、企业运维
  • vLLM 优势: 生态成熟、文档完善、量化支持全面(AWQ/GPTQ/FP8)
  • SGLang 优势: 前缀缓存效率高(多轮对话 3-5 倍加速)、结构化输出(XGrammar)、Agent 工作流
  • TensorRT-LLM 优势: NVIDIA 专用优化(Blackwell 支持)、延迟最低
  • 选型建议: 高并发 API 服务选 vLLM;多轮 Agent 场景选 SGLang;超低延迟场景选 TensorRT-LLM
  • 复现可行性: 中(决策框架清晰,适合选型参考;不含具体命令)
  • 版本信息: 2026 年版本对比(vLLM ~v0.23, SGLang ~v0.5.6, TRT-LLM ~最新)
  • 分类标签: 推理部署 vLLM SGLang TensorRT-LLM 选型 Benchmark
  • 建议: 快速浏览;与 08-30 vLLM vs SGLang 横评合并,该文更新、更全面

⑦ AI Agent 框架核心模块技术报告(2026-06-30)⭐ 中

  • 链接: https://blog.csdn.net/m0_60827485/article/details/162457321
  • 来源: CSDN 博客(m0_60827485)
  • 发布时间: 2026-06-30
  • 工程价值: AI Agent 工程化视角,分析框架核心价值不是"让模型变聪明",而是可执行、可恢复、可观测、可治理的工程系统
  • 核心内容:
  • Agent 框架 5 大核心模块:规划(Planning)、记忆(Memory)、工具(Tools)、执行(Action)、观测(Observability)
  • 各框架(LangChain/LangGraph/Dify/crewAI/OpenClaw)在 5 模块的差异
  • 工程治理视角:可观测性(Tracing)、容错(Circuit Breaker)、记忆持久化
  • 复现可行性: 低(偏综述,有观点但缺源码/命令)
  • 分类标签: AI-Agent 框架对比 工程化 LangChain LangGraph Dify
  • 建议: 快速浏览;适合作为 AI Agent 框架选型背景参考

二、Substack 高价值线索

⭐ S1:The Physics & Engineering of Frontier LLM Inference(2026 Edition)— 10 Part Series

  • 链接: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
  • 作者: Ken Huang(inference engineering 独立研究者)
  • 发布时间: 2026(近期)
  • 核心观点:
  • Part 1-3: Prefill/Decode 分离(Disaggregation)、Chunked Prefill 原理与 vLLM/SGLang 实现差异
  • Part 4-6: Prefix Caching 深层机制——Global Radix Tree、Hash-based Token Tree、Cross-session System Prompt 共享
  • Part 7-8: KV Cache 量化——FP8 (E4M3) 和 INT4 量化 KV 布局、子通道缩放因子、Triton 去量化 Kernel
  • Part 9-10: MoE Serving 挑战——DeepSeek-V4(1.6T/2.8T 总参数,49B/104B 激活参数,256 routed experts + 1 shared expert);大规模 Expert Parallelism 分布式系统难题
  • 结构化输出: SGLang XGrammar vs Outlines——FSM、Pushdown Automata、正则编译、Token Bitmask 预计算
  • 关键结论: 2026 年推理引擎竞争焦点从"模型质量"转向"生产级效率";MoE + 结构化输出是下一个主战场
  • 可信度判断: 高;作者持续跟踪 inference systems 领域;系列内容覆盖当前工程前沿
  • 后续行动: 精读 Part 4-6(Prefix Caching 深层机制)和 Part 9-10(MoE Serving);核验各章节结论与 vLLM/SGLang 官方文档一致性
  • 分类标签: 推理部署 LLM-Inference Prefix-Caching KV-Quantization MoE 结构化输出 Substack

⭐ S2:State of the Model Serving Communities — April 2026

  • 链接: https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
  • 作者: InferenceOps 社区(专注于 model serving MLOps)
  • 发布时间: 2026-04
  • 核心观点:
  • vLLM 更新(v0.17→v0.19): 显著扩展多模态覆盖(LLM/Vision/Audio/ASR/Embedding/Rerank/Tool-use);强化 Speculative Decoding、Model Runner V2、KV/Weight Offloading、CUDA Graphs
  • EPP(Exponential Pole Pruning)迁移至 llm-d: 代码库合并减少碎片化;将 inference engine 专业知识更贴近 Kubernetes 基础设施
  • KServe v0.17.0: LLMInferenceService 支持 WVA/KEDA/HPA 自动扩缩容;新增 OpenAI Responses API;升级 llm-d 和 vLLM 依赖
  • OpenShift AI Serving: 支持 Intel Gaudi 加速器;IBM Spyre 配置更新;ARM builds for LLMInferenceService controller
  • 可信度判断: 高;来自专业 MLOps 社区,内容与 vLLM GitHub release notes 一致性可核验
  • 后续行动: 核验 KServe v0.17 与 vLLM v0.19 的集成兼容性;关注 llm-d 项目进展
  • 分类标签: 推理部署 vLLM KServe MLOps Kubernetes 多模态 Substack

⭐ S3:State of the Model Serving Communities — October 2025

  • 链接: https://inferenceops.substack.com/p/state-of-the-model-serving-communities-269
  • 作者: InferenceOps 社区
  • 发布时间: 2025-10
  • 核心观点(与 S2 互补,补充 2025 年下半年背景):
  • vLLM 新增:Disaggregated Inference with PyTorch & vLLM;DeepSeek-V3.2-Exp 支持(细粒度稀疏注意力)
  • Scaling DeepSeek-style MoEs with vLLM and llm-d(Wide EP): Expert Parallelism 扩展到多节点
  • vLLM Semantic Router: 基于语义的请求路由,改善 AI reasoning 场景效率
  • SGLang 更新: 结构化生成、多轮对话优化
  • HG Serving: Gateway API Inference Extension (GIE) v1.0.1;LMCache 集成
  • Autoscaling 指南: vLLM + KEDA;vLLM + OpenShift AI 自动扩缩
  • 可信度判断: 高(时间线在 S2 之前,适合作为背景资料)
  • 后续行动: 与 S2 合并,建立 2025H2→2026H1 vLLM/SGLang 演进时间线
  • 分类标签: 推理部署 vLLM SGLang llm-d MLOps Kubernetes Substack

S4:Architecting LLM Inference Part 6 — Parallelism for Large-Scale LLM Inference

  • 链接: https://pawanjjha.substack.com/p/architecting-llm-inference-part-6
  • 作者: Pawan K Jha(LLM Inference 系统研究)
  • 发布时间: 2026-06-15
  • 核心观点:
  • 单 GPU → 多 GPU → 多节点: 详细解析 TP(Tensor Parallelism)、PP(Pipeline Parallelism)、DP(Data Parallelism)在 vLLM/SGLang 中的配置方式
  • vLLM endpoint 架构: 单 logical replica 下多 GPU 分片;路由器只看到一个 endpoint
  • 生产部署拓扑: vLLM/SGLang/TGI + Kubernetes 调度;单节点 vs 分布式配置差异
  • 可信度判断: 中高;系统性教程,部分内容在其他资料中已覆盖
  • 后续行动: 快速浏览;适合作为并行策略背景资料
  • 分类标签: 推理部署 并行策略 Tensor-Parallelism Pipeline-Parallelism Kubernetes Substack

三、分类标签分布

标签 数量 条目
推理部署 9 全部条目
vLLM 3 ① ⑥ S2
SGLang 3 ③ ④ ⑥
PagedAttention 1
CUDA-Kernel 1
Copy-on-Write 1
MoE 3 ② ⑤ S1
DeepSeek 2 ② ⑤
KV-Cache 4 ① ② ③ ④
前缀缓存 1
RadixAttention 2 ③ ④
通信优化 2 ② ⑤
负载均衡 1
TensorRT-LLM 1
AI-Agent 1
MLOps 3 S2 S3 S4
Kubernetes 2 S2 S4
Substack 4 S1 S2 S3 S4
结构化输出 1 S1
KV-Quantization 1 S1

四、建议写入路径

实际写入路径: /shared/research-kb/inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md

结构化摘要草稿(可复制):

# CSDN 高价值 + Substack 前沿研究 · 2026-08-31 早场

## 本次主题
CSDN 推理内核(CUDA Kernel/MoE部署/SGLang RadixTree)+ Substack 前沿推理工程系列

## 候选条目(11条)
### CSDN(7条)
1. ① vLLM PagedAttention C++/CUDA 底层实现(BlockTable映射/Copy-on-Write/PagedAttention Kernel伪代码)⭐⭐⭐极高
2. ② MoE推理加速全栈优化(模型切分/通信优化/KV Cache共享/负载均衡)⭐⭐高
3. ③ SGLang RadixAttention基数树KV缓存管理(插入/驱逐/Lookup/CoW机制)⭐⭐高
4. ④ SGLang KVCache篇(前后端分离架构/schedule_policy源码)⭐⭐中高
5. ⑤ DeepSeek MoE同步税:延迟根源与优化实战(All-to-All通信/overlap策略)⭐⭐中高
6. ⑥ vLLM vs SGLang vs TensorRT-LLM 2026选型9维度决策框架⭐⭐中高
7. ⑦ AI Agent框架核心模块技术报告(5大模块/工程治理视角)⭐中

### Substack(4条)
- S1. The Physics & Engineering of Frontier LLM Inference 2026(10Part系列:PrefixCaching/KVQuant/MoE/结构化输出)⭐⭐
- S2. State of Model Serving Communities Apr 2026(vLLM v0.17→v0.19/KServe/llm-d)⭐⭐
- S3. State of Model Serving Communities Oct 2025(vLLM语义路由/DeepSeek-V3.2/Wide EP)⭐⭐
- S4. LLM Inference Parallelism(TP/PP/DP/vLLM分布式配置)⭐

## 高价值条目(重点推荐)
- ① PagedAttention CUDA Kernel 底层实现(今日最高质量,含完整伪代码)
- ③ SGLang RadixTree 数据结构(后端 KV 管理层,与前端 DSL 互补)
- ②+⑤ MoE 全栈 + 同步税(DeepSeek 部署必读)
- S1 10-Part 推理工程系列(2026 前沿工程知识体系)

## 分类标签
推理部署|vLLM|SGLang|PagedAttention|CUDA-Kernel|Copy-on-Write|MoE|DeepSeek|KV-Cache|前缀缓存|RadixAttention|通信优化|负载均衡|TensorRT-LLM|AI-Agent|MLOps|Kubernetes|Substack|KV-Quantization|结构化输出

## 建议后续行动
- 精读①③S1:建立推理内核专项知识库(PagedAttention Kernel + RadixTree)
- 精读②⑤:建立 DeepSeek MoE 部署专项(含通信税分析)
- 审稿④:核实 SGLang 版本差异(v0.3.x vs v0.4/v0.5)
- 核验S1/S2/S3:vLLM GitHub release notes 交叉验证
- 合并建立:推理引擎内核专辑(CUDA执行层+调度层分离)

五、关联已有专辑

专辑 相关条目
vLLM 专辑 ①(PagedAttention CUDA层) + ⑥(选型) + S2/S3(vLLM演进)
SGLang 专辑 ③(RadixTree后端) + ④(前后端分离) + ⑥(选型)
MoE 部署专辑 ②(全栈优化) + ⑤(同步税) + S1 Part9-10(MoE Serving)
推理工程前沿 S1(10-Part系列) + S2/S3(State of Serving) + S4(并行策略)

六、本次操作说明

本次未执行 GitHub 写入,仅产出草稿于指定 inbox 路径。

建议精读优先级: 1. ⭐⭐⭐ ① — PagedAttention CUDA Kernel(工程内核层) 2. ⭐⭐ ③ — SGLang RadixTree(KV管理差异核心) 3. ⭐⭐ S1 — 前沿推理工程系列(知识体系构建) 4. ⭐⭐ ②⑤ — MoE 部署全链路

主题关联: - 推理引擎内核专辑(CUDA 执行层 ⇄ 调度层分离) - MoE 部署专辑(模型切分 + 通信税 + 负载均衡) - Substack 前沿研究线索(inference systems 工程化)