CSDN 高价值 + Substack 前沿研究 · 2026-08-31 早场(8:20AM)
实例: Jay
时间: 2026-08-31 08:20 (Asia/Shanghai)
检索范围: CSDN 推理内核 / MoE 部署 / SGLang 源码树 / Substack 前沿推理工程
去重参考: 08-30 早场(v0.20 五层架构、SGLang 社区贡献指南、LLaMA-Factory→Ollama);08-29 下午(DeepSeek-V4 SGLang/vLLM 选型);08-26(vLLM 0.20 架构);08-20(LangGraph/vLLM/Ollama)
本次新发现: PagedAttention CUDA Kernel 底层实现、MoE 全栈部署实战、RadixAttention 基数树数据结构、Substack 前沿推理工程系列(Physics & Engineering of Frontier LLM Inference 2026)、State of Model Serving Communities Apr 2026
一、CSDN 高价值条目
① 把操作系统搬进 GPU:vLLM PagedAttention C++/CUDA 底层实现详解 ⭐⭐⭐ 极高
- 链接: https://blog.csdn.net/m0_69378371/article/details/158455491
- 来源: CSDN 博客(m0_69378371)
- 发布时间: 2026-02-27(最新推荐 2026-03-14)
- 工程价值: 今日检索最高质量 CSDN 文章,含完整 CUDA Kernel 伪代码、Block Table 映射逻辑、Copy-on-Write 机制 Python 模拟;非泛泛架构描述,直接展示
attention_kernels.cu底层实现 - 核心内容:
- KV Cache 显存浪费根因: 传统预分配导致内部碎片(Hi 占用 5 token,浪费 2043);外部碎片(长序列占住整块无法释放);前缀重复复制
- Block Table 映射: 逻辑块(B0~B31)通过页表映射到物理离散块;
va_to_pa(virtual_token_idx)函数级实现 - CUDA Kernel 计算流程:
compute_qk_scores→compute_attn_scores→compute_output三步;线程块通过 Block Table 查找物理块指针,逐块计算局部注意力分数,再全局归约 - Copy-on-Write(写时复制): beam search 多分支共享同一物理块,只在写入时触发 CoW,显存降低 55%
- KV 缓存内存布局:
csrc/attention/attention_kernels.cu中KVCacheLayout结构:K: [num_blocks, num_kv_heads, head_size/x, block_size, x];V: [num_blocks, num_kv_heads, head_size, block_size] - 性能数据: 显存利用率 ~92%(传统 ~25%);吞吐量 198.3 tokens/s(传统 TGI 38.5 tokens/s);PagedAttention 吞吐量是 TGI 的 5.15 倍
- 复现可行性: 高(含完整 CUDA Kernel 伪代码和 Python BlockTable 模拟,可直接复现理解)
- 版本信息: vLLM 源码(对应 ~v0.11-v0.12 时期,含 BlockSpaceManagerV1/V2 说明)
- 分类标签:
推理部署vLLMPagedAttentionCUDA-KernelKV-CacheCopy-on-Write源码 - 建议: 精读;可作为 PagedAttention 底层原理专项存档,与 08-30 v0.20 五层架构文互补(架构文侧重调度层,本文侧重 CUDA 执行层)
- 可信度判断: 高;源码引用具体路径
csrc/attention/attention_kernels.cu,数学公式与实现代码对照;建议交叉核验 vLLM 官方 GitHub 最新版本
② MoE 推理加速全栈优化:从模型切分到 KV Cache 共享 ⭐⭐ 高
- 链接: https://blog.csdn.net/BytePulse/article/details/161257042
- 来源: CSDN 博客(BytePulse)
- 发布时间: 2026-05-20
- 工程价值: 面向生产级 MoE 部署的全链路优化,含模型切分策略、通信优化、负载均衡、KV Cache 共享四维度
- 核心内容:
- MoE 稀疏激活特性:动态路由仅激活部分专家,显存瓶颈而非算力
- 模型切分: Expert Parallelism(EP)vs Tensor Parallelism(TP);DeepSeek-V3 中 EP + TP 混合策略
- 通信优化: DeepEP(MoE 专用通信库);all-to-all 集合通信瓶颈分析
- KV Cache 共享: 跨请求前缀共享(同系统提示词);MoE 中 KV Cache 占比较Dense模型更低,但总量仍大
- 负载均衡: group-limited expert routing(DeepSeek-V3);TopK + 辅助损失函数
- 复现可行性: 中(理论框架清晰,含 DeepSeek-V3 技术报告引用,需结合 vLLM/SGLang 官方文档核验)
- 版本信息: DeepSeek-V3(2024-12 发布);vLLM MoE 支持需核实 2026 年最新状态
- 分类标签:
推理部署MoEDeepSeek模型切分通信优化KV-Cache负载均衡 - 建议: 精读;MoE 部署必读,与 08-29 DeepSeek-V4 选型稿合并建立 MoE 专辑;建议核验 vLLM 官方 MoE EP 文档
③ SGLang 源码讲解:RadixAttention 基数树 KV 缓存管理 ⭐⭐ 高
- 链接: https://blog.csdn.net/u011091936/article/details/150429518
- 来源: CSDN 博客(u011091936)
- 发布时间: 2025(推断,SGLang-v0.4 时期;持续推荐)
- 工程价值: SGLang 与 vLLM 的核心差异在于 RadixAttention 对 KV Cache 的树状管理;本文详解 RadixTree 数据结构在前缀共享中的原理
- 核心内容:
- SGLang 将多轮对话历史构建为 RadixTree(前缀树变体),相同前缀的请求共享同一子树
- 插入(Insert): 新请求的前缀命中 RadixTree 时直接复用子树;未命中时创建新叶节点
- 驱逐(Eviction): LRU 策略驱逐最少使用节点;CoW 机制避免写入冲突
- 查询(Lookup): O(1) 前缀匹配,支持 prompt 缓存命中判断
- 与 vLLM Block Manager 区别: vLLM 按 block 粒度管理(block_size=16 tokens);SGLang 按 token 前缀树管理(逻辑语义层);SGLang 在多轮对话场景优势显著
- 生产配置建议:
enable_prefix_caching=True(SGLang 默认开启) - 复现可行性: 高(含源码路径
sglang/python/sglang/srt/managers/schedule_policy.py) - 版本信息: SGLang v0.4.3(2025 年中期);v0.5+ 版本 API 有变化,建议核验
- 分类标签:
推理部署SGLangRadixAttentionKV-Cache前缀缓存源码 - 建议: 精读;与 08-30 SGLang 社区贡献指南(侧重前端 DSL)形成互补——本文聚焦后端 RadixTree 数据结构
④ SGLang 代码梳理:KVCache 篇 ⭐⭐ 中高
- 链接: https://blog.csdn.net/u011576070/article/details/146889758
- 来源: CSDN 博客(u011576070)
- 发布时间: 2025(推断)
- 工程价值: 前后端分离架构设计解析;SGLang 如何将复杂 LLM 控制逻辑与高性能推理执行解耦
- 核心内容:
- 前端(Frontend): 接收用户请求,构建 RadixTree,更新树结构
- 后端(SRT): 调用 vLLM 执行推理,管理物理 KV 块
- 状态机调度:
schedule_policy.py中 FCFS + 优先级调度逻辑 - 与 vLLM 的关系: SGLang 后端复用 vLLM 的 PagedAttention 和 Worker 池;差异在于 RadixTree 前缀共享层
- 复现可行性: 中(含源码路径,适合作为架构学习材料)
- 版本信息: SGLang 早期版本(v0.3.x 时期)
- 分类标签:
推理部署SGLang架构设计KV-Cache前后端分离 - 建议: 快速浏览;与 ③ 合并,核实版本差异
⑤ DeepSeek MoE 同步税:MoE 推理延迟的根源与优化实战 ⭐⭐ 中高
- 链接: https://blog.csdn.net/weixin_30467861/article/details/162184820
- 来源: CSDN 博客(weixin_30467861)
- 发布时间: 2026-06-21
- 工程价值: 指出 MoE 推理中常被忽视的"同步税"(All-to-All 通信等待)问题,给出实测数据
- 核心内容:
- 同步税定义: Expert 并行中 token 分发和结果汇聚的集合通信开销,与计算时间重叠率低
- 实测数据: DeepSeek-V3 在 8-GPU 场景下,同步税占总延迟 ~30%;单 GPU 场景下 ~15%
- 优化方向: 通信与计算重叠(overlap)、流水线并行掩盖延迟、Expert 分组策略
- 与 vLLM 集成注意事项: EP 模式下 All-to-All 通信是瓶颈,需配合 NVLink 或 NCCL 优化
- 复现可行性: 中(含实测数据,需结合 DeepSeek 官方技术报告核验)
- 版本信息: DeepSeek-V3(2024-12)
- 分类标签:
推理部署MoEDeepSeek通信优化延迟优化并行策略 - 建议: 审稿;与 ② 互补(②侧重全栈框架,⑤侧重延迟根因)
⑥ 2026 年大模型推理引擎怎么选(vLLM vs SGLang vs TensorRT-LLM)⭐⭐ 中高
- 链接: https://blog.csdn.net/smallym1/article/details/163407419
- 来源: CSDN 博客(smallym1)
- 发布时间: 2026(推断,较新)
- 工程价值: 2026 年最新选型决策框架,覆盖 9 个维度,含生产运维考量
- 核心内容:
- 9维度评分:模型支持、硬件适配、部署难度、吞吐量、延迟、结构化输出、缓存、分布式扩展、企业运维
- vLLM 优势: 生态成熟、文档完善、量化支持全面(AWQ/GPTQ/FP8)
- SGLang 优势: 前缀缓存效率高(多轮对话 3-5 倍加速)、结构化输出(XGrammar)、Agent 工作流
- TensorRT-LLM 优势: NVIDIA 专用优化(Blackwell 支持)、延迟最低
- 选型建议: 高并发 API 服务选 vLLM;多轮 Agent 场景选 SGLang;超低延迟场景选 TensorRT-LLM
- 复现可行性: 中(决策框架清晰,适合选型参考;不含具体命令)
- 版本信息: 2026 年版本对比(vLLM ~v0.23, SGLang ~v0.5.6, TRT-LLM ~最新)
- 分类标签:
推理部署vLLMSGLangTensorRT-LLM选型Benchmark - 建议: 快速浏览;与 08-30 vLLM vs SGLang 横评合并,该文更新、更全面
⑦ AI Agent 框架核心模块技术报告(2026-06-30)⭐ 中
- 链接: https://blog.csdn.net/m0_60827485/article/details/162457321
- 来源: CSDN 博客(m0_60827485)
- 发布时间: 2026-06-30
- 工程价值: AI Agent 工程化视角,分析框架核心价值不是"让模型变聪明",而是可执行、可恢复、可观测、可治理的工程系统
- 核心内容:
- Agent 框架 5 大核心模块:规划(Planning)、记忆(Memory)、工具(Tools)、执行(Action)、观测(Observability)
- 各框架(LangChain/LangGraph/Dify/crewAI/OpenClaw)在 5 模块的差异
- 工程治理视角:可观测性(Tracing)、容错(Circuit Breaker)、记忆持久化
- 复现可行性: 低(偏综述,有观点但缺源码/命令)
- 分类标签:
AI-Agent框架对比工程化LangChainLangGraphDify - 建议: 快速浏览;适合作为 AI Agent 框架选型背景参考
二、Substack 高价值线索
⭐ S1:The Physics & Engineering of Frontier LLM Inference(2026 Edition)— 10 Part Series
- 链接: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
- 作者: Ken Huang(inference engineering 独立研究者)
- 发布时间: 2026(近期)
- 核心观点:
- Part 1-3: Prefill/Decode 分离(Disaggregation)、Chunked Prefill 原理与 vLLM/SGLang 实现差异
- Part 4-6: Prefix Caching 深层机制——Global Radix Tree、Hash-based Token Tree、Cross-session System Prompt 共享
- Part 7-8: KV Cache 量化——FP8 (E4M3) 和 INT4 量化 KV 布局、子通道缩放因子、Triton 去量化 Kernel
- Part 9-10: MoE Serving 挑战——DeepSeek-V4(1.6T/2.8T 总参数,49B/104B 激活参数,256 routed experts + 1 shared expert);大规模 Expert Parallelism 分布式系统难题
- 结构化输出: SGLang XGrammar vs Outlines——FSM、Pushdown Automata、正则编译、Token Bitmask 预计算
- 关键结论: 2026 年推理引擎竞争焦点从"模型质量"转向"生产级效率";MoE + 结构化输出是下一个主战场
- 可信度判断: 高;作者持续跟踪 inference systems 领域;系列内容覆盖当前工程前沿
- 后续行动: 精读 Part 4-6(Prefix Caching 深层机制)和 Part 9-10(MoE Serving);核验各章节结论与 vLLM/SGLang 官方文档一致性
- 分类标签:
推理部署LLM-InferencePrefix-CachingKV-QuantizationMoE结构化输出Substack
⭐ S2:State of the Model Serving Communities — April 2026
- 链接: https://inferenceops.substack.com/p/state-of-the-model-serving-communities-b93
- 作者: InferenceOps 社区(专注于 model serving MLOps)
- 发布时间: 2026-04
- 核心观点:
- vLLM 更新(v0.17→v0.19): 显著扩展多模态覆盖(LLM/Vision/Audio/ASR/Embedding/Rerank/Tool-use);强化 Speculative Decoding、Model Runner V2、KV/Weight Offloading、CUDA Graphs
- EPP(Exponential Pole Pruning)迁移至 llm-d: 代码库合并减少碎片化;将 inference engine 专业知识更贴近 Kubernetes 基础设施
- KServe v0.17.0: LLMInferenceService 支持 WVA/KEDA/HPA 自动扩缩容;新增 OpenAI Responses API;升级 llm-d 和 vLLM 依赖
- OpenShift AI Serving: 支持 Intel Gaudi 加速器;IBM Spyre 配置更新;ARM builds for LLMInferenceService controller
- 可信度判断: 高;来自专业 MLOps 社区,内容与 vLLM GitHub release notes 一致性可核验
- 后续行动: 核验 KServe v0.17 与 vLLM v0.19 的集成兼容性;关注 llm-d 项目进展
- 分类标签:
推理部署vLLMKServeMLOpsKubernetes多模态Substack
⭐ S3:State of the Model Serving Communities — October 2025
- 链接: https://inferenceops.substack.com/p/state-of-the-model-serving-communities-269
- 作者: InferenceOps 社区
- 发布时间: 2025-10
- 核心观点(与 S2 互补,补充 2025 年下半年背景):
- vLLM 新增:Disaggregated Inference with PyTorch & vLLM;DeepSeek-V3.2-Exp 支持(细粒度稀疏注意力)
- Scaling DeepSeek-style MoEs with vLLM and llm-d(Wide EP): Expert Parallelism 扩展到多节点
- vLLM Semantic Router: 基于语义的请求路由,改善 AI reasoning 场景效率
- SGLang 更新: 结构化生成、多轮对话优化
- HG Serving: Gateway API Inference Extension (GIE) v1.0.1;LMCache 集成
- Autoscaling 指南: vLLM + KEDA;vLLM + OpenShift AI 自动扩缩
- 可信度判断: 高(时间线在 S2 之前,适合作为背景资料)
- 后续行动: 与 S2 合并,建立 2025H2→2026H1 vLLM/SGLang 演进时间线
- 分类标签:
推理部署vLLMSGLangllm-dMLOpsKubernetesSubstack
S4:Architecting LLM Inference Part 6 — Parallelism for Large-Scale LLM Inference
- 链接: https://pawanjjha.substack.com/p/architecting-llm-inference-part-6
- 作者: Pawan K Jha(LLM Inference 系统研究)
- 发布时间: 2026-06-15
- 核心观点:
- 单 GPU → 多 GPU → 多节点: 详细解析 TP(Tensor Parallelism)、PP(Pipeline Parallelism)、DP(Data Parallelism)在 vLLM/SGLang 中的配置方式
- vLLM endpoint 架构: 单 logical replica 下多 GPU 分片;路由器只看到一个 endpoint
- 生产部署拓扑: vLLM/SGLang/TGI + Kubernetes 调度;单节点 vs 分布式配置差异
- 可信度判断: 中高;系统性教程,部分内容在其他资料中已覆盖
- 后续行动: 快速浏览;适合作为并行策略背景资料
- 分类标签:
推理部署并行策略Tensor-ParallelismPipeline-ParallelismKubernetesSubstack
三、分类标签分布
| 标签 | 数量 | 条目 |
|---|---|---|
推理部署 |
9 | 全部条目 |
vLLM |
3 | ① ⑥ S2 |
SGLang |
3 | ③ ④ ⑥ |
PagedAttention |
1 | ① |
CUDA-Kernel |
1 | ① |
Copy-on-Write |
1 | ① |
MoE |
3 | ② ⑤ S1 |
DeepSeek |
2 | ② ⑤ |
KV-Cache |
4 | ① ② ③ ④ |
前缀缓存 |
1 | ③ |
RadixAttention |
2 | ③ ④ |
通信优化 |
2 | ② ⑤ |
负载均衡 |
1 | ② |
TensorRT-LLM |
1 | ⑥ |
AI-Agent |
1 | ⑦ |
MLOps |
3 | S2 S3 S4 |
Kubernetes |
2 | S2 S4 |
Substack |
4 | S1 S2 S3 S4 |
结构化输出 |
1 | S1 |
KV-Quantization |
1 | S1 |
四、建议写入路径
实际写入路径:
/shared/research-kb/inbox/jay/2026-08-31T0820-jay-csdn-substack-inference-engineering-kernel-moe.md
结构化摘要草稿(可复制):
# CSDN 高价值 + Substack 前沿研究 · 2026-08-31 早场
## 本次主题
CSDN 推理内核(CUDA Kernel/MoE部署/SGLang RadixTree)+ Substack 前沿推理工程系列
## 候选条目(11条)
### CSDN(7条)
1. ① vLLM PagedAttention C++/CUDA 底层实现(BlockTable映射/Copy-on-Write/PagedAttention Kernel伪代码)⭐⭐⭐极高
2. ② MoE推理加速全栈优化(模型切分/通信优化/KV Cache共享/负载均衡)⭐⭐高
3. ③ SGLang RadixAttention基数树KV缓存管理(插入/驱逐/Lookup/CoW机制)⭐⭐高
4. ④ SGLang KVCache篇(前后端分离架构/schedule_policy源码)⭐⭐中高
5. ⑤ DeepSeek MoE同步税:延迟根源与优化实战(All-to-All通信/overlap策略)⭐⭐中高
6. ⑥ vLLM vs SGLang vs TensorRT-LLM 2026选型9维度决策框架⭐⭐中高
7. ⑦ AI Agent框架核心模块技术报告(5大模块/工程治理视角)⭐中
### Substack(4条)
- S1. The Physics & Engineering of Frontier LLM Inference 2026(10Part系列:PrefixCaching/KVQuant/MoE/结构化输出)⭐⭐
- S2. State of Model Serving Communities Apr 2026(vLLM v0.17→v0.19/KServe/llm-d)⭐⭐
- S3. State of Model Serving Communities Oct 2025(vLLM语义路由/DeepSeek-V3.2/Wide EP)⭐⭐
- S4. LLM Inference Parallelism(TP/PP/DP/vLLM分布式配置)⭐
## 高价值条目(重点推荐)
- ① PagedAttention CUDA Kernel 底层实现(今日最高质量,含完整伪代码)
- ③ SGLang RadixTree 数据结构(后端 KV 管理层,与前端 DSL 互补)
- ②+⑤ MoE 全栈 + 同步税(DeepSeek 部署必读)
- S1 10-Part 推理工程系列(2026 前沿工程知识体系)
## 分类标签
推理部署|vLLM|SGLang|PagedAttention|CUDA-Kernel|Copy-on-Write|MoE|DeepSeek|KV-Cache|前缀缓存|RadixAttention|通信优化|负载均衡|TensorRT-LLM|AI-Agent|MLOps|Kubernetes|Substack|KV-Quantization|结构化输出
## 建议后续行动
- 精读①③S1:建立推理内核专项知识库(PagedAttention Kernel + RadixTree)
- 精读②⑤:建立 DeepSeek MoE 部署专项(含通信税分析)
- 审稿④:核实 SGLang 版本差异(v0.3.x vs v0.4/v0.5)
- 核验S1/S2/S3:vLLM GitHub release notes 交叉验证
- 合并建立:推理引擎内核专辑(CUDA执行层+调度层分离)
五、关联已有专辑
| 专辑 | 相关条目 |
|---|---|
| vLLM 专辑 | ①(PagedAttention CUDA层) + ⑥(选型) + S2/S3(vLLM演进) |
| SGLang 专辑 | ③(RadixTree后端) + ④(前后端分离) + ⑥(选型) |
| MoE 部署专辑 | ②(全栈优化) + ⑤(同步税) + S1 Part9-10(MoE Serving) |
| 推理工程前沿 | S1(10-Part系列) + S2/S3(State of Serving) + S4(并行策略) |
六、本次操作说明
本次未执行 GitHub 写入,仅产出草稿于指定 inbox 路径。
建议精读优先级: 1. ⭐⭐⭐ ① — PagedAttention CUDA Kernel(工程内核层) 2. ⭐⭐ ③ — SGLang RadixTree(KV管理差异核心) 3. ⭐⭐ S1 — 前沿推理工程系列(知识体系构建) 4. ⭐⭐ ②⑤ — MoE 部署全链路
主题关联: - 推理引擎内核专辑(CUDA 执行层 ⇄ 调度层分离) - MoE 部署专辑(模型切分 + 通信税 + 负载均衡) - Substack 前沿研究线索(inference systems 工程化)