CSDN 高价值技术分享检索报告 · Jay · 2026-09-18 上午

检索时间:2026-09-18 08:20 (UTC+8) 检索主题:CSDN 高价值技术分享 · LLM推理引擎调度/RAG范式迁移/Substack前沿研究 检索范围:site:csdn.net · Substack · Tavily 搜索


一、LLM 推理引擎调度类(高价值)

条目 1:推理引擎到底在调度什么:从 vLLM 到 SGLang 看服务端黑箱 ⭐⭐⭐⭐⭐

字段 内容
标题 大模型推理引擎到底在调度什么?从vLLM 到SGLang 看服务端黑箱
链接 https://blog.csdn.net/xx_nm98/article/details/163313516
来源 CSDN博客(原创)
发布时间 2026年
作者 xx_nm98
浏览量 未标注

核心观点摘要: - 推理引擎本质是一个"小型操作系统":调度请求、抢显存、拆批次、复用缓存、分配GPU、平衡TTFT和TPOT - vLLM 调度哲学:PagedAttention 将 KV Cache 按固定大小"页"管理,类似 OS 虚拟内存;连续批处理(Continuous Batching)动态组合不同长度序列;ZMQ 进程间通信分离 tokenizer 和 GPU 调度 - SGLang 调度哲学:RadixAttention 前缀共享 + 重叠调度器(Overlap Scheduler);CPU scheduler 提前为下一 batch 准备元数据,用 overlap 填满 GPU 空闲;cache-aware 调度优先将新请求分配到已有缓存前缀的序列旁 - vLLM 可观察性指标:盯两个进程的 ZMQ 延迟和 API server 并发;PagedAttention 命中率 - SGLang 可观察性指标:Overlap Scheduler 是否真正运行;RadixAttention 命中率是否正常 - SGLang 在高并发下表现更可预测:30-31 tok/s 恒定输出;vLLM 从 22 tok/s 降至 16 tok/s - 2026年新动态:vLLM 0.8.x 发布;SGLang 0.4.6.post2;SGLang 开始复用 vLLM 部分组件(两框架走向融合)

工程价值:⭐⭐⭐⭐⭐ - 源码级别分析,非表面对比 - 有具体可观测性指标,可直接用于生产监控 - 解释了两框架的核心调度差异

可信度评估:高 - 架构分析逻辑清晰,有具体机制描述 - 建议核验:ZMQ 进程分离的具体实现版本

复现可行性:高 - 生产监控建议可直接落地 - 可配合 nvidia-smi + vllm serve 日志验证

分类标签vLLM SGLang PagedAttention RadixAttention Continuous Batching 推理调度 可观测性

建议写入路径/shared/research-kb/inbox/jay/2026-09-18-csdn-inference-scheduling-deep-dive.md


条目 2:LLM推理引擎深度对比 SGLang vs vLLM(版本+并发+实测数据)

字段 内容
标题 LLM推理引擎深度对比:SGLang vs vLLM,吞吐量、延迟、内存全面测评与生产选型
链接 https://blog.csdn.net/cmzznet/article/details/161558882
来源 CSDN博客
发布时间 2026-05-31
作者 cmzznet
分类 vLLM / SGLang / 性能横评

核心观点摘要: - 版本现状(截至2026年5月):SGLang 最新 0.4.6.post2;vLLM 已迭代至 0.8.x 系列 - 高并发下衰减行为差异:SGLang 保持 30-31 tok/s 恒定输出;vLLM 从 22 tok/s 降至 16 tok/s(流量尖峰下 SGLang 更可预测) - 根本原因:SGLang cache-aware 调度器优先将新请求分配到已有缓存前缀的序列旁;vLLM 偏向公平分配,高负载下各序列竞争显存导致频繁换页 - 显存管理:vLLM PagedAttention 动态批处理 + 抢占式执行;SGLang RadixAttention 前缀共享 - 订阅 Release Notes 的重要性:两项目每月都有重要更新,新版本可能改变选型结论 - 异构硬件关注点:AMD ROCm 和 Intel Gaudi 支持进展直接影响选型范围

工程价值:⭐⭐⭐⭐⭐ - 有具体版本号(可直接对照升级) - 有实测并发性能数据(可直接用于容量规划) - 包含选型建议

可信度评估:中高 - 数据具体,有机制解释 - 建议核验:版本号(2026-05-31 截止,需更新至当前最新)

复现可行性:高 - 可用 sglang --helpvllm --help 验证配置参数 - 建议实际压测验证

代码片段

# vLLM 关键配置
--max_num_seqs 128   # 最大并发序列数
--block_size 16       # 内存块大小(token数)
--gpu_memory_utilization 0.9

# SGLang RadixAttention 前缀共享(自动启用)
# 关注指标:radix_cache_ratio

分类标签vLLM SGLang 版本跟踪 并发性能 PagedAttention RadixAttention 容量规划

建议写入路径/shared/research-kb/inbox/jay/2026-09-18-csdn-vllm-sglang-versioned-comparison.md


条目 3:推理加速完整优化路径(500ms → 80ms)

字段 内容
标题 大模型推理加速2026:从500ms到80ms的完整优化路径
链接 https://ascendai.csdn.net/69c5d22154b52172bc64d7e2.html
来源 昇腾开源生态专区(CSDN系)
发布时间 2026-03-27
作者 xyghehehehe(昇腾AI专区)

核心观点摘要: - 五阶段优化方案:模型量化(INT8/INT4) → KV Cache 分层优化 → 连续批处理 → 内核加速 → 推测解码 - 量化工具:vLLM 原生支持 AWQ/GPTQ;TensorRT-LLM 支持 FP8 - KV Cache 分层:GPU HBM + 主机端 DRAM + SSD 分级卸载(PagedAttention 扩展) - 连续批处理(Continuous Batching):动态组合不同长度序列,减少 GPU 空闲 - 推测解码(Speculative Decoding):小模型草稿 + 大模型验证,加速生成 - 目标指标:500ms → 80ms(6倍加速) - 实战配置:vLLM + TensorRT-LLM 均可落地

工程价值:⭐⭐⭐⭐ - 优化路径完整,有量化工具和配置建议 - 涉及昇腾/华为生态,适合国产化场景

可信度评估:中 - 有量化工具链说明,但具体加速倍数需实测验证 - 部分内容可能与昇腾硬件绑定

分类标签推理优化 量化 INT8 INT4 KV Cache分层 连续批处理 推测解码 vLLM TensorRT-LLM

建议写入路径/shared/research-kb/inbox/jay/2026-09-18-csdn-inference-optimization-500ms-to-80ms.md


二、RAG 范式迁移类(高价值)

条目 4:RAG 正在被重写(2026年范式迁移分析)

字段 内容
标题 2026,RAG 正在被重写:从向量检索到Agent认知架构的范式迁移
链接 https://blog.csdn.net/qcx23/article/details/160820786
来源 CSDN博客(qcx23)
发布时间 2026年9月
作者 qcx23

核心观点摘要: - 传统 RAG 根本缺陷:相似度检索无法解决语义鸿沟;分块策略决定上限;多跳推理能力弱 - 2026年范式迁移:从"向量检索+生成"单链路 → "Agent认知架构"动态决策循环 - Agentic RAG 核心特征:LLM 自主决定何时检索、检索什么、是否迭代;ReAct 框架驱动;多跳问答能力 - CRAG(Corrective RAG):检索质量评估 + 失败时 Web 搜索兜底 - Self-RAG:自反思 Token 评估检索与生成质量 - Adaptive RAG:按问题复杂度动态路由到不同检索策略 - HyDE(假设文档增强):先生成假设答案再检索,提升检索相关性 - 准确率现状:朴素 RAG 不到45%;Agentic RAG + 正确架构可达更高水平

工程价值:⭐⭐⭐⭐⭐ - 2026年9月最新分析,时效性强 - 覆盖多条技术路线对比(CRAG/Self-RAG/Adaptive RAG/HyDE) - 结合顶会论文洞察

可信度评估:中高 - 有顶会论文引用框架 - 准确率"不到45%"数据需核验来源

分类标签RAG Agentic RAG CRAG Self-RAG Adaptive RAG HyDE 范式迁移 2026趋势

建议写入路径/shared/research-kb/inbox/jay/2026-09-18-csdn-rag-paradigm-shift-2026.md


三、Substack 前沿研究线索

条目 5:The Physics & Engineering of Frontier LLM Inference(10章系列)

字段 内容
标题 Announcing the 10-Part Series: The Physics & Engineering of Frontier LLM Inference (2026 Edition)
链接 https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
来源 Substack · Ken Huang(DistributedApps.ai)
发布时间 2026年9月(预告,9月4日起发布)
作者机构 DistributedApps.ai 研究团队

核心观点摘要: - 系列定位:2026版前沿 LLM 推理系统工程分解,融合 DeepSeek/Moonshot/Zhipu/Alibaba/NVIDIA/Google DeepMind 研究 - 第1章重点:Memory Wall 摧毁硬件利用率——MFU(Model FLOPs Utilization)仅3%-8%;95% Decode 阶段转移(推理模型思考时大量单Token生成步骤) - KV Cache 前沿技术: - MLA(Multi-head Latent Attention,DeepSeek 创新):低秩联合压缩 Key/Value 至单一潜向量(dc=512),per-token KV cache 从 128+ bytes 降至 576 bytes/layer(93.3%内存降低) - Global Radix Tree & Prefix Caching:vLLM/SGLang 动态共享前缀检测,跨会话系统提示词共享 - 第2章重点:KV Cache Frontier — MLA、Global Prefix Caching、KVShare - 约束解码:SGLang XGrammar 和 Outlines:将正则表达式编译为有限状态机,预计算 Token 位掩码,消除词汇表索引开销 - 边缘 SLM 部署:DeepSeek-V4-Pro-Distill-Qwen 1.5B/7B/14B、Llama-3.2、SmolLM2、Phi-4 量化部署于 Apple Silicon MLX/Metal、骁龙 X Elite NPU、WebGPU/ONNX Runtime

工程价值:⭐⭐⭐⭐⭐ - 系统工程级别分析,非综述性质 - 覆盖 MLA 深层原理(93.3% 内存降低的具体数学推导) - 有边缘部署具体路径

可信度评估:高 - 出自 DistributedApps.ai 研究团队 - 引用具体研究(DeepSeek MLA、vLLM/SGLang 源码)

后续行动: - 跟踪系列文章发布(每月更新) - 核验 MLA 数学推导细节

分类标签Substack LLM推理 Memory Wall MLA DeepSeek KV Cache Prefix Caching XGrammar 边缘部署

建议写入路径/shared/research-kb/inbox/jay/2026-09-18-substack-llm-inference-physics-series.md


条目 6:Piers Stobbs September 2026 Newsletter(AI投资视角)

字段 内容
标题 September 2026 Newsletter
链接 https://rssdsaisection.substack.com/p/september-2026-newsletter
来源 Substack · Piers Stobbs
发布时间 2026年9月

核心观点摘要: - GLM-5.2 成为新晋最佳开源模型:IndexShare 架构保证可靠性,100万token上下文窗口,能力逼近前沿闭源模型 - AI Agent 记忆关键洞察:人类分析师与 AI Agent 对同一仓库的理解差异——Agent 只能知道上下文明确表达的内容,建模 Agent 需要"把隐式写出来" - ARC-AGI-3 Benchmark 新发现:开启"retained reasoning"和"compaction"两个 API 设置,分数提升3倍,输出 token 减少6倍 - PagedAttention 本质:OS 虚拟内存思想移植到 KV cache——这是推理引擎吞吐提升2-4倍的本质原因 - DSpark 推测解码:semi-autoregressive drafting + confidence-scheduled verification,LLM 服务提速85% - 本地LLM成熟度:消费级硬件本地LLM已达到实际可用门槛,成为开发者隐私工具

工程价值:⭐⭐⭐⭐ - 投资视角但含具体技术洞察 - ARC-AGI-3 API 设置发现对评估方法有直接价值 - GLM-5.2 新模型动态值得关注

可信度评估:中高 - 投资背景,内容偏行业观察 - 具体技术数据(ARC-AGI-3 分数提升3倍)需核验

分类标签Substack GLM-5.2 Benchmark PagedAttention 推测解码 本地LLM Agent评估

建议写入路径/shared/research-kb/inbox/jay/2026-09-18-substack-piers-stobbs-sep2026.md


四、综合评估与后续行动

本次检索统计

维度 数据
检索次数 4次(Tavily)
候选条目 ~25条
高价值条目 6条
最高价值 推理引擎调度黑箱分析 + RAG范式迁移 + LLM推理物理系列

高价值条目汇总

排名 条目 价值 复现性 时效
1 推理引擎到底在调度什么(vLLM vs SGLang黑箱) ⭐⭐⭐⭐⭐ 2026
2 RAG正在被重写:范式迁移分析 ⭐⭐⭐⭐⭐ Sep 2026
3 LLM推理物理与工程系列(Substack) ⭐⭐⭐⭐⭐ Sep 2026
4 SGLang vs vLLM 版本对比(并发实测) ⭐⭐⭐⭐⭐ May 2026
5 推理加速500ms→80ms优化路径 ⭐⭐⭐⭐ Mar 2026
6 Piers Stobbs Sep 2026 Newsletter ⭐⭐⭐⭐ Sep 2026

建议后续行动

  1. 精读: - 推理引擎调度黑箱文章(源码级别,有具体监控指标) - RAG范式迁移(2026年9月最新分析)

  2. 跟踪订阅: - Ken Huang 的 LLM 推理物理系列(10章,2026年持续更新) - Substack · Piers Stobbs(每月更新)

  3. 核验论文/代码: - DeepSeek MLA 原论文(93.3% KV cache 内存降低的具体数学推导) - ARC-AGI-3 benchmark API 设置发现

  4. 知识库更新: - 建议增加 LLM推理调度 专题(vLLM/SGLang对比) - 建议增加 Agentic RAG 专题(2026范式)

写入文件清单

序号 建议写入路径 类型
1 /shared/research-kb/inbox/jay/2026-09-18-csdn-inference-scheduling-deep-dive.md 本次写入
2 /shared/research-kb/inbox/jay/2026-09-18-csdn-rag-paradigm-shift-2026.md 本次写入
3 /shared/research-kb/inbox/jay/2026-09-18-substack-llm-inference-physics-series.md 本次写入
4 /shared/research-kb/inbox/jay/2026-09-18-csdn-vllm-sglang-versioned-comparison.md 本次写入
5 /shared/research-kb/inbox/jay/2026-09-18-csdn-inference-optimization-500ms-to-80ms.md 本次写入
6 /shared/research-kb/inbox/jay/2026-09-18-substack-piers-stobbs-sep2026.md 本次写入

报告生成:Jay · 知识库检索任务 · 2026-09-18 08:20 规则遵循:CSDN筛选标准 · Substack研究线索规范 · 不执行GitHub写入 · 仅产出自草稿 后续处理:GitHub合并由同步任务串行处理