Jay · 知识库草稿 · 2026-10-08

主题:LLM 推理框架选型 & RAG 系统工程实践


一、CSDN 高价值条目

条目 A:vLLM vs SGLang · 2026 年四大主流推理框架横评

  • 来源: https://blog.csdn.net/yu808454/article/details/163394780
  • 作者: yu808454(亚马逊云科技技术品牌专区),2026-06-23
  • 平台收录: 亚马逊云科技技术品牌专区、AtomGit 开源社区
  • 工程价值: ⭐⭐⭐⭐⭐
  • 实测数据丰富:5 大框架(vLLM / SGLang / TensorRT-LLM / TGI / lmdeploy)在 H100 8×80GB 上的量化横评
  • 吞吐量对比表:SGLang 6200 tokens/s 高并发最优;TensorRT-LLM 78 tokens/s 单序列最强
  • 混合长度负载(短长比 7:3)场景下 SGLang 5400 vs vLLM 4900,RadixAttention 优势显著
  • 提供了明确的选型决策树:vLLM 通用起点 → 按瓶颈切换专项框架
  • TTFT 首字延迟对比、国产 GPU 适配说明
  • 涉及版本: vLLM 0.29.0(2026-09 snapshot),SGLang 最新稳定版
  • 可信度: 高(多图实测、有平台编辑审核)
  • 复现价值: 高(硬件配置、命令参数、benchmark 方法完整)
  • 分类标签: LLM推理 vLLM SGLang TensorRT-LLM 性能基准 工程选型

条目 B:SGLang + vLLM-Ascend 昇腾调优 · 5 年运维血泪踩坑

  • 来源: https://ascendai.csdn.net/69d4c85172111d255bf7caad.html
  • 作者: 青云交(昇腾开源生态专区)
  • 工程价值: ⭐⭐⭐⭐⭐
  • 全网稀缺:昇腾 NPU + vLLM-ascend 0.11.0 实际生产配置
  • 真实客户反馈数据:batch=64 Mistral-7B 吞吐量 2150 tokens/s,NPU 利用率 90%
  • 关键参数:gpu_memory_utilization=0.85(O 规避峰值 OOM 的最优值);bf16(fp16) 精度选择;LoRA 关闭理由
  • 引擎初始化耗时 120-180s 正常范围、异步输出提升 15% 吞吐
  • 有客户技术选型报告背景和追加订单佐证
  • 可信度: 高(真实生产数据,有运维细节)
  • 复现价值: 极高(完整配置参数块,含避坑说明)
  • 分类标签: LLM推理 昇腾NPU vLLM-ascend 生产优化 运维 国产GPU

条目 C:vLLM 框架解析 · 突破大模型推理显存瓶颈

  • 来源: https://bbs.csdn.net/weixin_29913663/article/details/100238433
  • 作者: weixin_29913663,2026-07-29,CC 4.0 BY-SA
  • 工程价值: ⭐⭐⭐⭐
  • PagedAttention 原理深度拆解(非表面概述)
  • AsyncLangChain 集成说明:asyncio、AsyncBatchChain、Prometheus+Grafana 监控
  • HuggingFace 格式兼容列表(Llama-2/3、Qwen、ChatGLM、Phi-3 等)
  • vLLM V1 vs V0:吞吐量提升 1.7×、CPU 调度开销降低
  • 可信度: 中高(技术原理性内容,框架核心作者参考)
  • 复现价值: 高(原理清晰,有代码级说明)
  • 分类标签: LLM推理 vLLM PagedAttention 显存优化 AsyncLangChain

条目 D:五大推理框架横评(GitCode 完整版)

  • 来源: https://gitcode.csdn.net/6a2c308d10ee7a33f27bec68.html
  • 作者: 像风一样自由2020,AtomGit 开源社区
  • 工程价值: ⭐⭐⭐⭐
  • 8×H100 / Llama-3-70B-Instruct / FP8 / TP=4 实测
  • 四类测试场景:单序列、高并发(batch=128)、混合长度、TTFT 长尾(32K prompt)
  • 架构哲学总结:vLLM 专注调度优化;SGLang 集成语言前端+调度;TensorRT-LLM 编译融合
  • LLM Gateway 混合部署架构图:vLLM (通用) → SGLang (Agent) → TensorRT-LLM (高流量) → Ollama (内部测试)
  • vLLM 0.29 新特性:disaggregated prefill/decode/encode、context parallelism
  • 可信度: 高
  • 复现价值: 高(benchmark 工具说明、负载注入方法)
  • 分类标签: LLM推理 性能基准 分布式 LLM-Gateway 多框架选型

条目 E:RAG 知识库构建 · 向量化、分块与语义检索避坑

  • 来源: https://bbs.csdn.net/weixin_29061531/article/details/100164755
  • 作者: weixin_29061531,2026-06-27,CC 4.0 BY-SA
  • 工程价值: ⭐⭐⭐⭐⭐
  • 实测数据:HNSW ef_construction=200 vs 默认 128,金融文本精度提升明显,内存 +35%
  • 中文 Embedding 模型对比:ada-002 MRR=0.62(长尾词表征差) vs bge-large-zh-v1.5 MRR=0.79
  • Qdrant HNSW 参数调优实战经验
  • 维度选择:768 维 vs 1536 维,领域微调后小模型反而更精准
  • 可信度: 高(实测数据,有对比图表)
  • 复现价值: 高(具体参数、评估指标 MRR/F1)
  • 分类标签: RAG Embedding 向量数据库 Qdrant 中文NLP 分块策略

条目 F:企业级 RAG 实战指南 · 2026 生产部署全解析

  • 来源: https://gitcode.csdn.net/6a0f097810ee7a33f2743363.html
  • 作者: Python怎么学啊,AtomGit 开源社区
  • 工程价值: ⭐⭐⭐⭐
  • 企业知识库权限控制方案:Metadata 标记 + 检索时角色过滤
  • 监控指标体系:Recall@K / Precision@K / 忠实性 / 幻觉率 / 延迟 / QPS / 错误率 / 用户满意度
  • RAG 维护任务清单:增量 Embedding、定期评估、Prompt 优化
  • HuggingFace Reranker 模型使用代码:HuggingFaceCrossEncoder(bge-reranker-v2-m3)
  • 混合检索实战(BM25 + 向量检索 + Reranker)
  • 可信度: 高(工程实践导向,结构完整)
  • 复现价值: 高(完整代码片段、评估体系)
  • 分类标签: RAG 生产部署 权限控制 监控系统 混合检索 企业级

条目 G:Ollama 本地部署 + 微调 2026 实战

  • 来源: https://bbs.csdn.net/weixin_29056701/article/details/100180855
  • 作者: weixin_29056701,2026-09
  • 工程价值: ⭐⭐⭐
  • systemctl 自启服务配置(Ollama Service)
  • ollama pull qwen3.5:0.8b 实测命令
  • 适用边界说明(Ollama vs vLLM:低并发/轻量场景 vs 高并发企业服务)
  • vLLM 在 batch=50 时推理速度是 Ollama 的 6-7 倍
  • 环境要求:CPU i5+ / 16GB RAM / NVIDIA 可选
  • 可信度: 中高(步骤详细,有 systemd 配置)
  • 复现价值: 中(适合入门,但进阶内容少)
  • 分类标签: Ollama 本地部署 模型管理 系统服务 国产开源模型

二、Substack 高价值条目

条目 H:The Physics & Engineering of Frontier LLM Inference(10 篇系列,2026)

  • 来源: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
  • 作者: Ken Huang(AI 基础设施研究者)
  • 核心洞察:
  • 推理模型 decode 阶段 95% 时间运行单 token 生成,compute-to-memory ratio 接近理论最低
  • 端侧 SLM 部署:DeepSeek-V4-Pro-Distill-Qwen / Llama-3.2 / SmolLM2 / Phi-4 量化部署方案
  • 2026 生产架构栈:API Gateway → Semantic Router → Global Prefix Caching → Disaggregated P/D Nodes → 监控
  • 关注:Edge NPU 部署(Apple Silicon MLX/Metal、Qualcomm Snapdragon X Elite NPU、WebGPU/ONNX Runtime)
  • 可信度判断: 高(系统工程视角,有代码和硬件分析)
  • 是否需要核验: 建议对照 vLLM 0.29.0 官方文档和对应论文,验证 disaggregated prefill/decode 细节
  • 分类标签: LLM推理 系统工程 Edge-AI SLM 2026架构

条目 I:The 2026 AI Agent Stack, Drawn from Scratch

  • 来源: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
  • 作者: Eric Roby
  • 核心洞察:
  • Agent 栈与 LLM 栈明确区分:LLM 栈处理 GPU/批处理/量化;Agent 栈处理工具/记忆/编排/评估
  • 前沿模型层(2026):GPT-5.5 / Claude 4.x / Gemini 3.x / Llama / Mistral / DeepSeek(自托管)
  • 自托管工具链:Ollama / vLLM / 云推理提供商
  • 硬问题:共享状态、错误恢复、流式部分结果
  • 可信度判断: 中高(实战工程经验,图文并茂)
  • 后续行动: 建议与条目 D 的 Gateway 架构图对照
  • 分类标签: Agent LLM架构 Ollama vLLM 生产系统

条目 J:State of LLM Routers in 2026

  • 来源: https://pakodas.substack.com/p/llm-routers
  • 作者: Pratik Bhavsar
  • 核心洞察:
  • vLLM Semantic Router:下一代路由方向,Mixture of Models 架构
  • 推理努力(reasoning effort)作为路由维度:OpenAI / Anthropic / Gemini 均已暴露思考预算参数
  • 架构意义:推理不再是单一智力选择,而是可组合的"智能预算"系统
  • 可信度判断: 中(行业观察文章,快速概览价值)
  • 后续行动: 关注 vLLM 官方 semantic router 插件进展
  • 分类标签: LLM路由 SemanticRouter 成本优化 推理预算

三、综合分析

1. vLLM vs SGLang 选型决策树(2026-10 更新版)

业务瓶颈分析
├── 延迟敏感 + 高并发 + 结构化输出(Agent/RAG)
│   └── SGLang(RadixAttention,共享 KV Cache,结构化成功率 99.8%)
├── 极致单序列吞吐量 + NVIDIA 硬件
│   └── TensorRT-LLM(CUDA 融合编译,78 tokens/s)
├── 通用部署 + 生态成熟 + 国产 GPU
│   └── vLLM(0.29.0 最新,disaggregated P/D/E,支持昇腾/壁仞)
├── 轻量 / 内部测试 / 快速迭代
│   └── Ollama
└── 多框架协同(Gateway 路由)
    └── vLLM + SGLang + TensorRT-LLM 按业务分层

2. RAG 工程关键结论

  • 中文 Embedding:bge-large-zh-v1.5(MRR=0.79)全面优于 ada-002(MRR=0.62),长尾词差距显著
  • 向量库:HNSW ef_construction=200(金融文本精度更优,但内存 +35%)
  • 混合检索 + Reranker 已是生产 RAG 标准配置
  • 企业级三维度:权限控制(Metadata) + 监控体系(Recall/Precision/幻觉率)+ 增量更新机制

3. 国产化趋势

  • 昇腾 NPU + vLLM-ascend 0.11.0 已进入生产选型(batch=64 / Mistral-7B / 2150 tokens/s / NPU 90%)
  • LMDeploy(国产生态)2026 年已跻身五大框架之一
  • 国产 GPU 适配需注意:bf16 兼容性差,建议 fp16,实测 gpu_memory_utilization=0.85 最优

四、建议写入路径

路径: /shared/research-kb/inbox/jay/2026-10-08-llm-inference-rag-framework.md

草稿结构: - 第一部分:CSDN 高价值条目索引(含工程价值评分、复现优先级) - 第二部分:Substack 条目索引(含核验建议) - 第三部分:选型决策树 + RAG 工程关键结论 - 第四部分:后续精读建议(按优先级排序)


五、后续行动建议

优先级 行动 关联条目
🔴 高 对照 vLLM 0.29.0 官方 Changelog 核验 disaggregated P/D/E 支持范围 条目 A/D/H
🔴 高 验证 SGLang bge-reranker-v2-m3 集成代码可运行性 条目 F
🟡 中 Substack Ken Huang 系列第 3-5 篇深度内容提取 条目 H
🟡 中 更新 2026-10 月版 LLM 推理框架选型 Cheatsheet 条目 A/B/C/D
🟢 低 AtomGit 仓库 PR 触发同步(由同步任务统一处理) 本草稿

Jay · 2026-10-08 12:25 · CSDN 高频检索任务 · 草稿版本