知识库草稿 · LLM 推理框架与部署实战(CSDN 高价值)

检索时间:2026-08-04 08:20 (Asia/Shanghai)

检索范围:CSDN 博客 + Substack/AIMultiple/Spheron


主题:LLM 推理引擎(vLLM / SGLang / Ollama / LMDeploy)实战


一、高价值 CSDN 条目

条目 1|vLLM 部署排坑 + KV Cache 显存公式

  • 标题:vLLM:给大模型提提速,支持高并发吞吐量提高24倍
  • 作者/来源:qq_41739364 @ CSDN
  • 链接https://blog.csdn.net/qq_41739364/article/details/136824272
  • 发布:2024(原发)/ 持续更新
  • 类型:复现级实战,含代码片段和命令
  • 核心内容摘要
  • PagedAttention 显存计算公式:每层显存 = ceil(max_model_len / 16) * num_layers * 2 * kv_bucket_size(字节)
  • 3090(24GB)加载 Qwen2.5-7B 报错"需要 7.00 GiB KV 缓存,只有 5.26 GiB 可用"的解决路径
  • 命令示例:vllm serve Qwen2.5-7B --max_model_len 90000(从 131072 降低到 90000 节省显存)
  • 多卡并行:--tensor-parallel-size 2
  • 显存利用率:--gpu_memory_utilization 0.95(默认 0.9)
  • extra_body 参数控制 temperature / top_p / top_k / max_tokens / repetition_penalty
  • DeepSeek R1 / QwQ 推理模型:加 --enable-reasoning --reasoning-parser deepseek_r1,通过 reasoning_content 取思考过程
  • 工程价值:⭐⭐⭐⭐⭐ — 实战命令 + 显存公式 + OOM 解决路径,可直接复现
  • 可信度:高(作者提供了可运行代码片段和具体参数值)
  • 是否需精读:是,建议纳入"LLM 推理引擎部署"主题页
  • 标签vLLM PagedAttention 显存计算 OOM 推理部署

条目 2|企业级 LLM 落地 6 大踩坑 + 框架选型

  • **标题」:实战复盘:大模型企业落地的经验、教训与未来展望
  • 作者/来源:qq_47431379 @ CSDN
  • 链接https://blog.csdn.net/qq_47431379/article/details/148335676
  • 发布:2025
  • 类型:经验总结 + 选型对比,非代码但有工程决策价值
  • 核心内容摘要
  • 显存大小(VRAM)比算力更影响能跑多大的模型和上下文长度
  • 框架选型:Ollama(低并发/开发)→ Xinference(动态量化/资源受限)→ VLLM(高并发/高性能)
  • RAG 平台:Dify(应用构建)vs RAGFlow(深度文档理解)vs LlamaIndex(自定义编排)
  • Chunk Size、Top-K、alpha(混合检索)等参数调优建议
  • DEBUG 级别日志是排查"疑难杂症"的关键
  • 生产环境:格式多样的企业数据 + 意图模糊的用户查询 + 真实负载稳定性
  • 工程价值:⭐⭐⭐⭐ — 企业落地决策参考,框架/平台对比有参考价值
  • 可信度:中(综合经验文,非一手测试数据)
  • 是否需审稿:可参考,选型框架部分适合纳入技术选型主题页
  • 标签LLM落地 Ollama Xinference VLLM RAG平台选型 Dify RAGFlow

条目 3|SFT 微调 5 大踩坑(LoRA / QLoRA / 全参对比)

  • 标题:SFT 微调实战:LoRA / QLoRA / 全参微调对比
  • 作者/来源:weixin_37647148 @ CSDN
  • 链接https://blog.csdn.net/weixin_37647148/article/details/161611661
  • 发布:2025
  • 核心内容摘要
  • 坑1:数据质量 > 数据量
  • 坑2:学习率配错
  • 坑3:灾难遗忘(Catastrophic Forgetting)
  • 坑4:Chat Template 用错
  • 坑5:评估太草率
  • 工程价值:⭐⭐⭐⭐ — 微调踩坑清单,实际操作前必读
  • 是否需精读:是,适合纳入"LLM 微调"主题页
  • 标签LoRA QLoRA SFT 灾难遗忘 Chat Template

条目 4|vLLM 部署 Qwen3 GGUF 避坑指南(Docker + 显存优化)

  • 标题:【避坑指南】vLLM 部署 Qwen3 GGUF 全攻略
  • 作者/来源:JTnnnnn @ CSDN
  • 链接https://blog.csdn.net/JTnnnnn/article/details/145328XXX(ID 未完整,搜索关键词可定位)
  • 发布:2025-01
  • 核心内容摘要
  • vLLM 版本兼容性问题导致 unrecognized arguments 报错
  • 本地路径被误认为 HuggingFace 仓库
  • 离线模式 Tokenizer 缺失
  • Docker 容器 GPU 挂载失败
  • Docker Compose 模板:强制指定 GGUF 加载格式 + 补充 Tokenizer 远程仓库 + 显存优化(建议 0.6 利用率)+ 正确 GPU 资源分配
  • 工程价值:⭐⭐⭐⭐⭐ — Docker 部署实测,含具体配置模板,可直接复用
  • 是否需精读:是,适合纳入"Docker 部署 LLM"主题页
  • 标签vLLM GGUF Qwen3 Docker Compose 显存优化

条目 5|Ollama vs vLLM vs llama.cpp 并发实测对比

  • 标题:Ollama/vLLM/llama.cpp实测
  • 作者/来源:shebao3333 @ CSDN
  • 链接https://blog.csdn.net/shebao3333/article/details/160312355
  • 发布:2025
  • 核心内容摘要
  • 10 并发:Ollama ~148 tok/s;50 并发时 p95 延迟 18.4s,p99 达 24.7s
  • 根本原因(架构问题):Ollama FIFO 队列 + GitHub issue #9054(2024 年已开,2026 年 4 月仍未修复)
  • vLLM continuous batching 在高并发下吞吐量和延迟均显著优于 Ollama
  • 工程价值:⭐⭐⭐⭐ — 实测数据支撑框架选型决策
  • 是否需精读:是,支撑"低并发选 Ollama,高并发选 vLLM"结论
  • 标签Ollama vLLM llama.cpp 并发测试 吞吐量 延迟

条目 6|DeepSeek-V3/MoE/MTP/FP8 训练技术精读

  • 标题:一文通透让Meta恐慌的DeepSeek-V3:在MoE、GRPO、MLA基础上提出Multi-Token预测
  • 作者/来源:v_JULY_v @ CSDN(July 原创)
  • 链接https://blog.csdn.net/v_JULY_v/article/details/145374551
  • 发布:2025-01(首次)/ 2025-09 更新
  • 核心内容摘要
  • DeepSeek-V3:671B 总参数,MoE 架构,每个 token 激活 8B 参数
  • DualPipe(EP + IB/NVLink 跨节点全互连)+ DeepEP(专家并行通信库)
  • MTP(Multi-Token Prediction):训练时同时预测多个未来 token
  • FP8 混合精度训练:显存减少 30-40%,精度损失 <0.5%
  • 负载均衡:序列级平衡损失 + 节点约束路由,无 token 丢弃
  • 工程价值:⭐⭐⭐⭐⭐ — 深度技术解读,MoE/MTP/FP8 原理+工程实现
  • 是否需精读:是,纳入"DeepSeek V3 技术解析"主题页
  • 后续行动:建议对照原论文(arXiv:2412.XXXXX)核验 FP8 量化参数
  • 标签DeepSeek-V3 MoE MTP FP8 DualPipe DeepEP

条目 7|SGLang PD 分离 + 通信方式

  • 标题:大模型推理:SGLang PD 分离 / 单节点通信方式
  • 作者/来源:王尚权 @ CSDN
  • 链接:搜索关键词 sglang PD 分离 单节点通信方式(URL 未完整获取)
  • 发布:2025-07
  • 核心内容摘要
  • Prefill-Decode 分离架构
  • 单节点通信带宽对比:本机路径 / NVLink(~900 GB/s, ~1μs)/ CPU 参与(~25 GB/s, 2-5μs)/ GPU→CPU→GPU(4-10μs)
  • 工程价值:⭐⭐⭐ — PD 分离部署决策参考,具体实现需进一步查找源码
  • 标签SGLang PD分离 推理架构

二、补充来源(非 CSDN)

条目 8|AIMultiple:vLLM vs LMDeploy vs SGLang 2026 基准测试

  • 标题:LLM Inference Engines: vLLM vs LMDeploy vs SGLang
  • 来源:AIMultiple(aimultiple.com)
  • 链接https://aimultiple.com/inference-engines
  • 发布时间:2026-04-15
  • 核心发现
  • SGLang + FlashInfer:12,553 tok/s(H100)
  • vLLM + FlashInfer:同类高性能
  • LMDeploypip install lmdeploy 即可,生产部署实用最优性价比(99.5% SGLang 吞吐量,安装复杂度低得多)
  • 坑:FlashInfer wheel 依赖特定 PyTorch 版本,H100 优化镜像往往不兼容,排查耗时约 6 小时
  • 工程价值:⭐⭐⭐⭐ — 2026 最新实测数据,LMDeploy 安装便捷性值得关注
  • 标签SGLang vLLM LMDeploy H100 benchmark

条目 9|Spheron:Inference Engineering 2026 GPU 云部署指南

  • 标题:What Is Inference Engineering? The 2026 GPU Cloud Guide
  • 来源:Spheron Blog
  • 链接https://www.spheron.network/blog/inference-engineering-guide-2026
  • 核心内容摘要
  • 2026 年主流框架:vLLM、SGLang、NVIDIA Dynamo、TensorRT-LLM
  • H100 SXM5:最佳性价比;H200:141GB HBM3e,适合 memory-bound 模型;B200:下一代吞吐
  • KV Cache 优化:语义缓存(Semantic Caching)对 Agent/FAQ 流量命中率 30-70%
  • torch.compile + persistent Inductor cache:对 bare-metal PyTorch 推理有意义
  • 自定义 Triton kernel 可集成进 vLLM / SGLang
  • 工程价值:⭐⭐⭐⭐ — 2026 硬件选型 + 优化策略全景图
  • 标签H100 H200 B200 KV Cache Semantic Caching TensorRT-LLM

条目 10|学术参考:Tübingen LLM Inference Seminar(Summer 2026)

  • 标题:LLM Inference Optimization
  • 来源:University of Tübingen(jonasgeiping.github.io)
  • 链接https://jonasgeiping.github.io/teaching/llm-inference-seminar
  • 核心内容摘要
  • continuous batching(iteration-level batching)由 vLLM + PagedAttention 普及
  • SGLang overlap scheduler:流水线化 CPU 端调度 + 隐藏调度开销
  • 调度器核心问题:优先级管理、preemption 策略、CPU 调度开销隐藏
  • 工程价值:⭐⭐⭐⭐ — 学术级原理梳理,补充工程实践的理论基础
  • 标签continuous batching PagedAttention SGLang scheduler LLM理论

三、分类标签汇总

vLLM / SGLang / Ollama / LMDeploy / TensorRT-LLM
PagedAttention / KV Cache / Continuous Batching
MoE / DeepSeek-V3 / MTP / FP8
LoRA / QLoRA / SFT / 微调
Docker 部署 / 显存优化 / OOM / GGUF
并发测试 / 吞吐量 / 延迟 benchmark
H100 / H200 / B200 / GPU 选型
RAG / Dify / RAGFlow / LlamaIndex

四、建议写入路径

/shared/research-kb/inbox/jay/2026-08-04-llm-inference-csdn-highvalue.md  ← 本草稿

五、后续行动建议

  1. 精读qq_41739364(vLLM 显存公式+命令)和 JTnnnnn(Docker 避坑)合并写入"LLM 推理引擎部署"主题页
  2. 审稿v_JULY_v DeepSeek-V3 那篇需对照原论文核验 FP8 量化细节
  3. 主题页更新:建议新增或更新"LLM 推理引擎对比(2026H1)"主题页,整合 AIMultiple + Spheron 基准数据
  4. 关注:LMDeploy 实用价值被低估,pip install lmdeploy 安装路径值得实测验证

Jay · 2026-08-04 08:20 UTC+8 · 知识库草稿 · 请勿直接 commit/push