CSDN 高价值技术分享检索报告 · Jay · 2026-09-18 上午
检索时间:2026-09-18 08:20 (UTC+8) 检索主题:CSDN 高价值技术分享 · LLM推理引擎调度/RAG范式迁移/Substack前沿研究 检索范围:site:csdn.net · Substack · Tavily 搜索
一、LLM 推理引擎调度类(高价值)
条目 1:推理引擎到底在调度什么:从 vLLM 到 SGLang 看服务端黑箱 ⭐⭐⭐⭐⭐
| 字段 | 内容 |
|---|---|
| 标题 | 大模型推理引擎到底在调度什么?从vLLM 到SGLang 看服务端黑箱 |
| 链接 | https://blog.csdn.net/xx_nm98/article/details/163313516 |
| 来源 | CSDN博客(原创) |
| 发布时间 | 2026年 |
| 作者 | xx_nm98 |
| 浏览量 | 未标注 |
核心观点摘要: - 推理引擎本质是一个"小型操作系统":调度请求、抢显存、拆批次、复用缓存、分配GPU、平衡TTFT和TPOT - vLLM 调度哲学:PagedAttention 将 KV Cache 按固定大小"页"管理,类似 OS 虚拟内存;连续批处理(Continuous Batching)动态组合不同长度序列;ZMQ 进程间通信分离 tokenizer 和 GPU 调度 - SGLang 调度哲学:RadixAttention 前缀共享 + 重叠调度器(Overlap Scheduler);CPU scheduler 提前为下一 batch 准备元数据,用 overlap 填满 GPU 空闲;cache-aware 调度优先将新请求分配到已有缓存前缀的序列旁 - vLLM 可观察性指标:盯两个进程的 ZMQ 延迟和 API server 并发;PagedAttention 命中率 - SGLang 可观察性指标:Overlap Scheduler 是否真正运行;RadixAttention 命中率是否正常 - SGLang 在高并发下表现更可预测:30-31 tok/s 恒定输出;vLLM 从 22 tok/s 降至 16 tok/s - 2026年新动态:vLLM 0.8.x 发布;SGLang 0.4.6.post2;SGLang 开始复用 vLLM 部分组件(两框架走向融合)
工程价值:⭐⭐⭐⭐⭐ - 源码级别分析,非表面对比 - 有具体可观测性指标,可直接用于生产监控 - 解释了两框架的核心调度差异
可信度评估:高 - 架构分析逻辑清晰,有具体机制描述 - 建议核验:ZMQ 进程分离的具体实现版本
复现可行性:高
- 生产监控建议可直接落地
- 可配合 nvidia-smi + vllm serve 日志验证
分类标签:vLLM SGLang PagedAttention RadixAttention Continuous Batching 推理调度 可观测性
建议写入路径:/shared/research-kb/inbox/jay/2026-09-18-csdn-inference-scheduling-deep-dive.md
条目 2:LLM推理引擎深度对比 SGLang vs vLLM(版本+并发+实测数据)
| 字段 | 内容 |
|---|---|
| 标题 | LLM推理引擎深度对比:SGLang vs vLLM,吞吐量、延迟、内存全面测评与生产选型 |
| 链接 | https://blog.csdn.net/cmzznet/article/details/161558882 |
| 来源 | CSDN博客 |
| 发布时间 | 2026-05-31 |
| 作者 | cmzznet |
| 分类 | vLLM / SGLang / 性能横评 |
核心观点摘要:
- 版本现状(截至2026年5月):SGLang 最新 0.4.6.post2;vLLM 已迭代至 0.8.x 系列
- 高并发下衰减行为差异:SGLang 保持 30-31 tok/s 恒定输出;vLLM 从 22 tok/s 降至 16 tok/s(流量尖峰下 SGLang 更可预测)
- 根本原因:SGLang cache-aware 调度器优先将新请求分配到已有缓存前缀的序列旁;vLLM 偏向公平分配,高负载下各序列竞争显存导致频繁换页
- 显存管理:vLLM PagedAttention 动态批处理 + 抢占式执行;SGLang RadixAttention 前缀共享
- 订阅 Release Notes 的重要性:两项目每月都有重要更新,新版本可能改变选型结论
- 异构硬件关注点:AMD ROCm 和 Intel Gaudi 支持进展直接影响选型范围
工程价值:⭐⭐⭐⭐⭐ - 有具体版本号(可直接对照升级) - 有实测并发性能数据(可直接用于容量规划) - 包含选型建议
可信度评估:中高 - 数据具体,有机制解释 - 建议核验:版本号(2026-05-31 截止,需更新至当前最新)
复现可行性:高
- 可用 sglang --help 和 vllm --help 验证配置参数
- 建议实际压测验证
代码片段:
# vLLM 关键配置
--max_num_seqs 128 # 最大并发序列数
--block_size 16 # 内存块大小(token数)
--gpu_memory_utilization 0.9
# SGLang RadixAttention 前缀共享(自动启用)
# 关注指标:radix_cache_ratio
分类标签:vLLM SGLang 版本跟踪 并发性能 PagedAttention RadixAttention 容量规划
建议写入路径:/shared/research-kb/inbox/jay/2026-09-18-csdn-vllm-sglang-versioned-comparison.md
条目 3:推理加速完整优化路径(500ms → 80ms)
| 字段 | 内容 |
|---|---|
| 标题 | 大模型推理加速2026:从500ms到80ms的完整优化路径 |
| 链接 | https://ascendai.csdn.net/69c5d22154b52172bc64d7e2.html |
| 来源 | 昇腾开源生态专区(CSDN系) |
| 发布时间 | 2026-03-27 |
| 作者 | xyghehehehe(昇腾AI专区) |
核心观点摘要: - 五阶段优化方案:模型量化(INT8/INT4) → KV Cache 分层优化 → 连续批处理 → 内核加速 → 推测解码 - 量化工具:vLLM 原生支持 AWQ/GPTQ;TensorRT-LLM 支持 FP8 - KV Cache 分层:GPU HBM + 主机端 DRAM + SSD 分级卸载(PagedAttention 扩展) - 连续批处理(Continuous Batching):动态组合不同长度序列,减少 GPU 空闲 - 推测解码(Speculative Decoding):小模型草稿 + 大模型验证,加速生成 - 目标指标:500ms → 80ms(6倍加速) - 实战配置:vLLM + TensorRT-LLM 均可落地
工程价值:⭐⭐⭐⭐ - 优化路径完整,有量化工具和配置建议 - 涉及昇腾/华为生态,适合国产化场景
可信度评估:中 - 有量化工具链说明,但具体加速倍数需实测验证 - 部分内容可能与昇腾硬件绑定
分类标签:推理优化 量化 INT8 INT4 KV Cache分层 连续批处理 推测解码 vLLM TensorRT-LLM
建议写入路径:/shared/research-kb/inbox/jay/2026-09-18-csdn-inference-optimization-500ms-to-80ms.md
二、RAG 范式迁移类(高价值)
条目 4:RAG 正在被重写(2026年范式迁移分析)
| 字段 | 内容 |
|---|---|
| 标题 | 2026,RAG 正在被重写:从向量检索到Agent认知架构的范式迁移 |
| 链接 | https://blog.csdn.net/qcx23/article/details/160820786 |
| 来源 | CSDN博客(qcx23) |
| 发布时间 | 2026年9月 |
| 作者 | qcx23 |
核心观点摘要: - 传统 RAG 根本缺陷:相似度检索无法解决语义鸿沟;分块策略决定上限;多跳推理能力弱 - 2026年范式迁移:从"向量检索+生成"单链路 → "Agent认知架构"动态决策循环 - Agentic RAG 核心特征:LLM 自主决定何时检索、检索什么、是否迭代;ReAct 框架驱动;多跳问答能力 - CRAG(Corrective RAG):检索质量评估 + 失败时 Web 搜索兜底 - Self-RAG:自反思 Token 评估检索与生成质量 - Adaptive RAG:按问题复杂度动态路由到不同检索策略 - HyDE(假设文档增强):先生成假设答案再检索,提升检索相关性 - 准确率现状:朴素 RAG 不到45%;Agentic RAG + 正确架构可达更高水平
工程价值:⭐⭐⭐⭐⭐ - 2026年9月最新分析,时效性强 - 覆盖多条技术路线对比(CRAG/Self-RAG/Adaptive RAG/HyDE) - 结合顶会论文洞察
可信度评估:中高 - 有顶会论文引用框架 - 准确率"不到45%"数据需核验来源
分类标签:RAG Agentic RAG CRAG Self-RAG Adaptive RAG HyDE 范式迁移 2026趋势
建议写入路径:/shared/research-kb/inbox/jay/2026-09-18-csdn-rag-paradigm-shift-2026.md
三、Substack 前沿研究线索
条目 5:The Physics & Engineering of Frontier LLM Inference(10章系列)
| 字段 | 内容 |
|---|---|
| 标题 | Announcing the 10-Part Series: The Physics & Engineering of Frontier LLM Inference (2026 Edition) |
| 链接 | https://kenhuangus.substack.com/p/announcing-the-10-part-series-the |
| 来源 | Substack · Ken Huang(DistributedApps.ai) |
| 发布时间 | 2026年9月(预告,9月4日起发布) |
| 作者机构 | DistributedApps.ai 研究团队 |
核心观点摘要: - 系列定位:2026版前沿 LLM 推理系统工程分解,融合 DeepSeek/Moonshot/Zhipu/Alibaba/NVIDIA/Google DeepMind 研究 - 第1章重点:Memory Wall 摧毁硬件利用率——MFU(Model FLOPs Utilization)仅3%-8%;95% Decode 阶段转移(推理模型思考时大量单Token生成步骤) - KV Cache 前沿技术: - MLA(Multi-head Latent Attention,DeepSeek 创新):低秩联合压缩 Key/Value 至单一潜向量(dc=512),per-token KV cache 从 128+ bytes 降至 576 bytes/layer(93.3%内存降低) - Global Radix Tree & Prefix Caching:vLLM/SGLang 动态共享前缀检测,跨会话系统提示词共享 - 第2章重点:KV Cache Frontier — MLA、Global Prefix Caching、KVShare - 约束解码:SGLang XGrammar 和 Outlines:将正则表达式编译为有限状态机,预计算 Token 位掩码,消除词汇表索引开销 - 边缘 SLM 部署:DeepSeek-V4-Pro-Distill-Qwen 1.5B/7B/14B、Llama-3.2、SmolLM2、Phi-4 量化部署于 Apple Silicon MLX/Metal、骁龙 X Elite NPU、WebGPU/ONNX Runtime
工程价值:⭐⭐⭐⭐⭐ - 系统工程级别分析,非综述性质 - 覆盖 MLA 深层原理(93.3% 内存降低的具体数学推导) - 有边缘部署具体路径
可信度评估:高 - 出自 DistributedApps.ai 研究团队 - 引用具体研究(DeepSeek MLA、vLLM/SGLang 源码)
后续行动: - 跟踪系列文章发布(每月更新) - 核验 MLA 数学推导细节
分类标签:Substack LLM推理 Memory Wall MLA DeepSeek KV Cache Prefix Caching XGrammar 边缘部署
建议写入路径:/shared/research-kb/inbox/jay/2026-09-18-substack-llm-inference-physics-series.md
条目 6:Piers Stobbs September 2026 Newsletter(AI投资视角)
| 字段 | 内容 |
|---|---|
| 标题 | September 2026 Newsletter |
| 链接 | https://rssdsaisection.substack.com/p/september-2026-newsletter |
| 来源 | Substack · Piers Stobbs |
| 发布时间 | 2026年9月 |
核心观点摘要: - GLM-5.2 成为新晋最佳开源模型:IndexShare 架构保证可靠性,100万token上下文窗口,能力逼近前沿闭源模型 - AI Agent 记忆关键洞察:人类分析师与 AI Agent 对同一仓库的理解差异——Agent 只能知道上下文明确表达的内容,建模 Agent 需要"把隐式写出来" - ARC-AGI-3 Benchmark 新发现:开启"retained reasoning"和"compaction"两个 API 设置,分数提升3倍,输出 token 减少6倍 - PagedAttention 本质:OS 虚拟内存思想移植到 KV cache——这是推理引擎吞吐提升2-4倍的本质原因 - DSpark 推测解码:semi-autoregressive drafting + confidence-scheduled verification,LLM 服务提速85% - 本地LLM成熟度:消费级硬件本地LLM已达到实际可用门槛,成为开发者隐私工具
工程价值:⭐⭐⭐⭐ - 投资视角但含具体技术洞察 - ARC-AGI-3 API 设置发现对评估方法有直接价值 - GLM-5.2 新模型动态值得关注
可信度评估:中高 - 投资背景,内容偏行业观察 - 具体技术数据(ARC-AGI-3 分数提升3倍)需核验
分类标签:Substack GLM-5.2 Benchmark PagedAttention 推测解码 本地LLM Agent评估
建议写入路径:/shared/research-kb/inbox/jay/2026-09-18-substack-piers-stobbs-sep2026.md
四、综合评估与后续行动
本次检索统计
| 维度 | 数据 |
|---|---|
| 检索次数 | 4次(Tavily) |
| 候选条目 | ~25条 |
| 高价值条目 | 6条 |
| 最高价值 | 推理引擎调度黑箱分析 + RAG范式迁移 + LLM推理物理系列 |
高价值条目汇总
| 排名 | 条目 | 价值 | 复现性 | 时效 |
|---|---|---|---|---|
| 1 | 推理引擎到底在调度什么(vLLM vs SGLang黑箱) | ⭐⭐⭐⭐⭐ | 高 | 2026 |
| 2 | RAG正在被重写:范式迁移分析 | ⭐⭐⭐⭐⭐ | 高 | Sep 2026 |
| 3 | LLM推理物理与工程系列(Substack) | ⭐⭐⭐⭐⭐ | 中 | Sep 2026 |
| 4 | SGLang vs vLLM 版本对比(并发实测) | ⭐⭐⭐⭐⭐ | 高 | May 2026 |
| 5 | 推理加速500ms→80ms优化路径 | ⭐⭐⭐⭐ | 高 | Mar 2026 |
| 6 | Piers Stobbs Sep 2026 Newsletter | ⭐⭐⭐⭐ | 中 | Sep 2026 |
建议后续行动
-
精读: - 推理引擎调度黑箱文章(源码级别,有具体监控指标) - RAG范式迁移(2026年9月最新分析)
-
跟踪订阅: - Ken Huang 的 LLM 推理物理系列(10章,2026年持续更新) - Substack · Piers Stobbs(每月更新)
-
核验论文/代码: - DeepSeek MLA 原论文(93.3% KV cache 内存降低的具体数学推导) - ARC-AGI-3 benchmark API 设置发现
-
知识库更新: - 建议增加
LLM推理调度专题(vLLM/SGLang对比) - 建议增加Agentic RAG专题(2026范式)
写入文件清单
| 序号 | 建议写入路径 | 类型 |
|---|---|---|
| 1 | /shared/research-kb/inbox/jay/2026-09-18-csdn-inference-scheduling-deep-dive.md |
本次写入 |
| 2 | /shared/research-kb/inbox/jay/2026-09-18-csdn-rag-paradigm-shift-2026.md |
本次写入 |
| 3 | /shared/research-kb/inbox/jay/2026-09-18-substack-llm-inference-physics-series.md |
本次写入 |
| 4 | /shared/research-kb/inbox/jay/2026-09-18-csdn-vllm-sglang-versioned-comparison.md |
本次写入 |
| 5 | /shared/research-kb/inbox/jay/2026-09-18-csdn-inference-optimization-500ms-to-80ms.md |
本次写入 |
| 6 | /shared/research-kb/inbox/jay/2026-09-18-substack-piers-stobbs-sep2026.md |
本次写入 |
报告生成:Jay · 知识库检索任务 · 2026-09-18 08:20 规则遵循:CSDN筛选标准 · Substack研究线索规范 · 不执行GitHub写入 · 仅产出自草稿 后续处理:GitHub合并由同步任务串行处理