知识库草稿 · LLM 推理框架与部署实战(CSDN 高价值)
检索时间:2026-08-04 08:20 (Asia/Shanghai)
检索范围:CSDN 博客 + Substack/AIMultiple/Spheron
主题:LLM 推理引擎(vLLM / SGLang / Ollama / LMDeploy)实战
一、高价值 CSDN 条目
条目 1|vLLM 部署排坑 + KV Cache 显存公式
- 标题:vLLM:给大模型提提速,支持高并发吞吐量提高24倍
- 作者/来源:qq_41739364 @ CSDN
- 链接:
https://blog.csdn.net/qq_41739364/article/details/136824272 - 发布:2024(原发)/ 持续更新
- 类型:复现级实战,含代码片段和命令
- 核心内容摘要:
- PagedAttention 显存计算公式:
每层显存 = ceil(max_model_len / 16) * num_layers * 2 * kv_bucket_size(字节) - 3090(24GB)加载 Qwen2.5-7B 报错"需要 7.00 GiB KV 缓存,只有 5.26 GiB 可用"的解决路径
- 命令示例:
vllm serve Qwen2.5-7B --max_model_len 90000(从 131072 降低到 90000 节省显存) - 多卡并行:
--tensor-parallel-size 2 - 显存利用率:
--gpu_memory_utilization 0.95(默认 0.9) extra_body参数控制 temperature / top_p / top_k / max_tokens / repetition_penalty- DeepSeek R1 / QwQ 推理模型:加
--enable-reasoning --reasoning-parser deepseek_r1,通过reasoning_content取思考过程 - 工程价值:⭐⭐⭐⭐⭐ — 实战命令 + 显存公式 + OOM 解决路径,可直接复现
- 可信度:高(作者提供了可运行代码片段和具体参数值)
- 是否需精读:是,建议纳入"LLM 推理引擎部署"主题页
- 标签:
vLLMPagedAttention显存计算OOM推理部署
条目 2|企业级 LLM 落地 6 大踩坑 + 框架选型
- **标题」:实战复盘:大模型企业落地的经验、教训与未来展望
- 作者/来源:qq_47431379 @ CSDN
- 链接:
https://blog.csdn.net/qq_47431379/article/details/148335676 - 发布:2025
- 类型:经验总结 + 选型对比,非代码但有工程决策价值
- 核心内容摘要:
- 显存大小(VRAM)比算力更影响能跑多大的模型和上下文长度
- 框架选型:Ollama(低并发/开发)→ Xinference(动态量化/资源受限)→ VLLM(高并发/高性能)
- RAG 平台:Dify(应用构建)vs RAGFlow(深度文档理解)vs LlamaIndex(自定义编排)
- Chunk Size、Top-K、alpha(混合检索)等参数调优建议
- DEBUG 级别日志是排查"疑难杂症"的关键
- 生产环境:格式多样的企业数据 + 意图模糊的用户查询 + 真实负载稳定性
- 工程价值:⭐⭐⭐⭐ — 企业落地决策参考,框架/平台对比有参考价值
- 可信度:中(综合经验文,非一手测试数据)
- 是否需审稿:可参考,选型框架部分适合纳入技术选型主题页
- 标签:
LLM落地OllamaXinferenceVLLMRAG平台选型DifyRAGFlow
条目 3|SFT 微调 5 大踩坑(LoRA / QLoRA / 全参对比)
- 标题:SFT 微调实战:LoRA / QLoRA / 全参微调对比
- 作者/来源:weixin_37647148 @ CSDN
- 链接:
https://blog.csdn.net/weixin_37647148/article/details/161611661 - 发布:2025
- 核心内容摘要:
- 坑1:数据质量 > 数据量
- 坑2:学习率配错
- 坑3:灾难遗忘(Catastrophic Forgetting)
- 坑4:Chat Template 用错
- 坑5:评估太草率
- 工程价值:⭐⭐⭐⭐ — 微调踩坑清单,实际操作前必读
- 是否需精读:是,适合纳入"LLM 微调"主题页
- 标签:
LoRAQLoRASFT灾难遗忘Chat Template
条目 4|vLLM 部署 Qwen3 GGUF 避坑指南(Docker + 显存优化)
- 标题:【避坑指南】vLLM 部署 Qwen3 GGUF 全攻略
- 作者/来源:JTnnnnn @ CSDN
- 链接:
https://blog.csdn.net/JTnnnnn/article/details/145328XXX(ID 未完整,搜索关键词可定位) - 发布:2025-01
- 核心内容摘要:
- vLLM 版本兼容性问题导致
unrecognized arguments报错 - 本地路径被误认为 HuggingFace 仓库
- 离线模式 Tokenizer 缺失
- Docker 容器 GPU 挂载失败
- Docker Compose 模板:强制指定 GGUF 加载格式 + 补充 Tokenizer 远程仓库 + 显存优化(建议 0.6 利用率)+ 正确 GPU 资源分配
- 工程价值:⭐⭐⭐⭐⭐ — Docker 部署实测,含具体配置模板,可直接复用
- 是否需精读:是,适合纳入"Docker 部署 LLM"主题页
- 标签:
vLLMGGUFQwen3Docker Compose显存优化
条目 5|Ollama vs vLLM vs llama.cpp 并发实测对比
- 标题:Ollama/vLLM/llama.cpp实测
- 作者/来源:shebao3333 @ CSDN
- 链接:
https://blog.csdn.net/shebao3333/article/details/160312355 - 发布:2025
- 核心内容摘要:
- 10 并发:Ollama ~148 tok/s;50 并发时 p95 延迟 18.4s,p99 达 24.7s
- 根本原因(架构问题):Ollama FIFO 队列 + GitHub issue #9054(2024 年已开,2026 年 4 月仍未修复)
- vLLM continuous batching 在高并发下吞吐量和延迟均显著优于 Ollama
- 工程价值:⭐⭐⭐⭐ — 实测数据支撑框架选型决策
- 是否需精读:是,支撑"低并发选 Ollama,高并发选 vLLM"结论
- 标签:
OllamavLLMllama.cpp并发测试吞吐量延迟
条目 6|DeepSeek-V3/MoE/MTP/FP8 训练技术精读
- 标题:一文通透让Meta恐慌的DeepSeek-V3:在MoE、GRPO、MLA基础上提出Multi-Token预测
- 作者/来源:v_JULY_v @ CSDN(July 原创)
- 链接:
https://blog.csdn.net/v_JULY_v/article/details/145374551 - 发布:2025-01(首次)/ 2025-09 更新
- 核心内容摘要:
- DeepSeek-V3:671B 总参数,MoE 架构,每个 token 激活 8B 参数
- DualPipe(EP + IB/NVLink 跨节点全互连)+ DeepEP(专家并行通信库)
- MTP(Multi-Token Prediction):训练时同时预测多个未来 token
- FP8 混合精度训练:显存减少 30-40%,精度损失 <0.5%
- 负载均衡:序列级平衡损失 + 节点约束路由,无 token 丢弃
- 工程价值:⭐⭐⭐⭐⭐ — 深度技术解读,MoE/MTP/FP8 原理+工程实现
- 是否需精读:是,纳入"DeepSeek V3 技术解析"主题页
- 后续行动:建议对照原论文(arXiv:2412.XXXXX)核验 FP8 量化参数
- 标签:
DeepSeek-V3MoEMTPFP8DualPipeDeepEP
条目 7|SGLang PD 分离 + 通信方式
- 标题:大模型推理:SGLang PD 分离 / 单节点通信方式
- 作者/来源:王尚权 @ CSDN
- 链接:搜索关键词
sglang PD 分离 单节点通信方式(URL 未完整获取) - 发布:2025-07
- 核心内容摘要:
- Prefill-Decode 分离架构
- 单节点通信带宽对比:本机路径 / NVLink(~900 GB/s, ~1μs)/ CPU 参与(~25 GB/s, 2-5μs)/ GPU→CPU→GPU(4-10μs)
- 工程价值:⭐⭐⭐ — PD 分离部署决策参考,具体实现需进一步查找源码
- 标签:
SGLangPD分离推理架构
二、补充来源(非 CSDN)
条目 8|AIMultiple:vLLM vs LMDeploy vs SGLang 2026 基准测试
- 标题:LLM Inference Engines: vLLM vs LMDeploy vs SGLang
- 来源:AIMultiple(aimultiple.com)
- 链接:
https://aimultiple.com/inference-engines - 发布时间:2026-04-15
- 核心发现:
- SGLang + FlashInfer:12,553 tok/s(H100)
- vLLM + FlashInfer:同类高性能
- LMDeploy:
pip install lmdeploy即可,生产部署实用最优性价比(99.5% SGLang 吞吐量,安装复杂度低得多) - 坑:FlashInfer wheel 依赖特定 PyTorch 版本,H100 优化镜像往往不兼容,排查耗时约 6 小时
- 工程价值:⭐⭐⭐⭐ — 2026 最新实测数据,LMDeploy 安装便捷性值得关注
- 标签:
SGLangvLLMLMDeployH100benchmark
条目 9|Spheron:Inference Engineering 2026 GPU 云部署指南
- 标题:What Is Inference Engineering? The 2026 GPU Cloud Guide
- 来源:Spheron Blog
- 链接:
https://www.spheron.network/blog/inference-engineering-guide-2026 - 核心内容摘要:
- 2026 年主流框架:vLLM、SGLang、NVIDIA Dynamo、TensorRT-LLM
- H100 SXM5:最佳性价比;H200:141GB HBM3e,适合 memory-bound 模型;B200:下一代吞吐
- KV Cache 优化:语义缓存(Semantic Caching)对 Agent/FAQ 流量命中率 30-70%
torch.compile+ persistent Inductor cache:对 bare-metal PyTorch 推理有意义- 自定义 Triton kernel 可集成进 vLLM / SGLang
- 工程价值:⭐⭐⭐⭐ — 2026 硬件选型 + 优化策略全景图
- 标签:
H100H200B200KV CacheSemantic CachingTensorRT-LLM
条目 10|学术参考:Tübingen LLM Inference Seminar(Summer 2026)
- 标题:LLM Inference Optimization
- 来源:University of Tübingen(jonasgeiping.github.io)
- 链接:
https://jonasgeiping.github.io/teaching/llm-inference-seminar - 核心内容摘要:
- continuous batching(iteration-level batching)由 vLLM + PagedAttention 普及
- SGLang overlap scheduler:流水线化 CPU 端调度 + 隐藏调度开销
- 调度器核心问题:优先级管理、preemption 策略、CPU 调度开销隐藏
- 工程价值:⭐⭐⭐⭐ — 学术级原理梳理,补充工程实践的理论基础
- 标签:
continuous batchingPagedAttentionSGLang schedulerLLM理论
三、分类标签汇总
vLLM / SGLang / Ollama / LMDeploy / TensorRT-LLM
PagedAttention / KV Cache / Continuous Batching
MoE / DeepSeek-V3 / MTP / FP8
LoRA / QLoRA / SFT / 微调
Docker 部署 / 显存优化 / OOM / GGUF
并发测试 / 吞吐量 / 延迟 benchmark
H100 / H200 / B200 / GPU 选型
RAG / Dify / RAGFlow / LlamaIndex
四、建议写入路径
/shared/research-kb/inbox/jay/2026-08-04-llm-inference-csdn-highvalue.md ← 本草稿
五、后续行动建议
- 精读:
qq_41739364(vLLM 显存公式+命令)和JTnnnnn(Docker 避坑)合并写入"LLM 推理引擎部署"主题页 - 审稿:
v_JULY_vDeepSeek-V3 那篇需对照原论文核验 FP8 量化细节 - 主题页更新:建议新增或更新"LLM 推理引擎对比(2026H1)"主题页,整合 AIMultiple + Spheron 基准数据
- 关注:LMDeploy 实用价值被低估,
pip install lmdeploy安装路径值得实测验证
Jay · 2026-08-04 08:20 UTC+8 · 知识库草稿 · 请勿直接 commit/push