Jay · 知识库草稿 · 2026-10-08
主题:LLM 推理框架选型 & RAG 系统工程实践
一、CSDN 高价值条目
条目 A:vLLM vs SGLang · 2026 年四大主流推理框架横评
- 来源: https://blog.csdn.net/yu808454/article/details/163394780
- 作者: yu808454(亚马逊云科技技术品牌专区),2026-06-23
- 平台收录: 亚马逊云科技技术品牌专区、AtomGit 开源社区
- 工程价值: ⭐⭐⭐⭐⭐
- 实测数据丰富:5 大框架(vLLM / SGLang / TensorRT-LLM / TGI / lmdeploy)在 H100 8×80GB 上的量化横评
- 吞吐量对比表:SGLang 6200 tokens/s 高并发最优;TensorRT-LLM 78 tokens/s 单序列最强
- 混合长度负载(短长比 7:3)场景下 SGLang 5400 vs vLLM 4900,RadixAttention 优势显著
- 提供了明确的选型决策树:vLLM 通用起点 → 按瓶颈切换专项框架
- TTFT 首字延迟对比、国产 GPU 适配说明
- 涉及版本: vLLM 0.29.0(2026-09 snapshot),SGLang 最新稳定版
- 可信度: 高(多图实测、有平台编辑审核)
- 复现价值: 高(硬件配置、命令参数、benchmark 方法完整)
- 分类标签:
LLM推理vLLMSGLangTensorRT-LLM性能基准工程选型
条目 B:SGLang + vLLM-Ascend 昇腾调优 · 5 年运维血泪踩坑
- 来源: https://ascendai.csdn.net/69d4c85172111d255bf7caad.html
- 作者: 青云交(昇腾开源生态专区)
- 工程价值: ⭐⭐⭐⭐⭐
- 全网稀缺:昇腾 NPU + vLLM-ascend 0.11.0 实际生产配置
- 真实客户反馈数据:batch=64 Mistral-7B 吞吐量 2150 tokens/s,NPU 利用率 90%
- 关键参数:gpu_memory_utilization=0.85(O 规避峰值 OOM 的最优值);bf16(fp16) 精度选择;LoRA 关闭理由
- 引擎初始化耗时 120-180s 正常范围、异步输出提升 15% 吞吐
- 有客户技术选型报告背景和追加订单佐证
- 可信度: 高(真实生产数据,有运维细节)
- 复现价值: 极高(完整配置参数块,含避坑说明)
- 分类标签:
LLM推理昇腾NPUvLLM-ascend生产优化运维国产GPU
条目 C:vLLM 框架解析 · 突破大模型推理显存瓶颈
- 来源: https://bbs.csdn.net/weixin_29913663/article/details/100238433
- 作者: weixin_29913663,2026-07-29,CC 4.0 BY-SA
- 工程价值: ⭐⭐⭐⭐
- PagedAttention 原理深度拆解(非表面概述)
- AsyncLangChain 集成说明:asyncio、AsyncBatchChain、Prometheus+Grafana 监控
- HuggingFace 格式兼容列表(Llama-2/3、Qwen、ChatGLM、Phi-3 等)
- vLLM V1 vs V0:吞吐量提升 1.7×、CPU 调度开销降低
- 可信度: 中高(技术原理性内容,框架核心作者参考)
- 复现价值: 高(原理清晰,有代码级说明)
- 分类标签:
LLM推理vLLMPagedAttention显存优化AsyncLangChain
条目 D:五大推理框架横评(GitCode 完整版)
- 来源: https://gitcode.csdn.net/6a2c308d10ee7a33f27bec68.html
- 作者: 像风一样自由2020,AtomGit 开源社区
- 工程价值: ⭐⭐⭐⭐
- 8×H100 / Llama-3-70B-Instruct / FP8 / TP=4 实测
- 四类测试场景:单序列、高并发(batch=128)、混合长度、TTFT 长尾(32K prompt)
- 架构哲学总结:vLLM 专注调度优化;SGLang 集成语言前端+调度;TensorRT-LLM 编译融合
- LLM Gateway 混合部署架构图:
vLLM (通用) → SGLang (Agent) → TensorRT-LLM (高流量) → Ollama (内部测试) - vLLM 0.29 新特性:disaggregated prefill/decode/encode、context parallelism
- 可信度: 高
- 复现价值: 高(benchmark 工具说明、负载注入方法)
- 分类标签:
LLM推理性能基准分布式LLM-Gateway多框架选型
条目 E:RAG 知识库构建 · 向量化、分块与语义检索避坑
- 来源: https://bbs.csdn.net/weixin_29061531/article/details/100164755
- 作者: weixin_29061531,2026-06-27,CC 4.0 BY-SA
- 工程价值: ⭐⭐⭐⭐⭐
- 实测数据:HNSW ef_construction=200 vs 默认 128,金融文本精度提升明显,内存 +35%
- 中文 Embedding 模型对比:ada-002 MRR=0.62(长尾词表征差) vs bge-large-zh-v1.5 MRR=0.79
- Qdrant HNSW 参数调优实战经验
- 维度选择:768 维 vs 1536 维,领域微调后小模型反而更精准
- 可信度: 高(实测数据,有对比图表)
- 复现价值: 高(具体参数、评估指标 MRR/F1)
- 分类标签:
RAGEmbedding向量数据库Qdrant中文NLP分块策略
条目 F:企业级 RAG 实战指南 · 2026 生产部署全解析
- 来源: https://gitcode.csdn.net/6a0f097810ee7a33f2743363.html
- 作者: Python怎么学啊,AtomGit 开源社区
- 工程价值: ⭐⭐⭐⭐
- 企业知识库权限控制方案:Metadata 标记 + 检索时角色过滤
- 监控指标体系:Recall@K / Precision@K / 忠实性 / 幻觉率 / 延迟 / QPS / 错误率 / 用户满意度
- RAG 维护任务清单:增量 Embedding、定期评估、Prompt 优化
- HuggingFace Reranker 模型使用代码:
HuggingFaceCrossEncoder(bge-reranker-v2-m3) - 混合检索实战(BM25 + 向量检索 + Reranker)
- 可信度: 高(工程实践导向,结构完整)
- 复现价值: 高(完整代码片段、评估体系)
- 分类标签:
RAG生产部署权限控制监控系统混合检索企业级
条目 G:Ollama 本地部署 + 微调 2026 实战
- 来源: https://bbs.csdn.net/weixin_29056701/article/details/100180855
- 作者: weixin_29056701,2026-09
- 工程价值: ⭐⭐⭐
- systemctl 自启服务配置(Ollama Service)
ollama pull qwen3.5:0.8b实测命令- 适用边界说明(Ollama vs vLLM:低并发/轻量场景 vs 高并发企业服务)
- vLLM 在 batch=50 时推理速度是 Ollama 的 6-7 倍
- 环境要求:CPU i5+ / 16GB RAM / NVIDIA 可选
- 可信度: 中高(步骤详细,有 systemd 配置)
- 复现价值: 中(适合入门,但进阶内容少)
- 分类标签:
Ollama本地部署模型管理系统服务国产开源模型
二、Substack 高价值条目
条目 H:The Physics & Engineering of Frontier LLM Inference(10 篇系列,2026)
- 来源: https://kenhuangus.substack.com/p/announcing-the-10-part-series-the
- 作者: Ken Huang(AI 基础设施研究者)
- 核心洞察:
- 推理模型 decode 阶段 95% 时间运行单 token 生成,compute-to-memory ratio 接近理论最低
- 端侧 SLM 部署:DeepSeek-V4-Pro-Distill-Qwen / Llama-3.2 / SmolLM2 / Phi-4 量化部署方案
- 2026 生产架构栈:API Gateway → Semantic Router → Global Prefix Caching → Disaggregated P/D Nodes → 监控
- 关注:Edge NPU 部署(Apple Silicon MLX/Metal、Qualcomm Snapdragon X Elite NPU、WebGPU/ONNX Runtime)
- 可信度判断: 高(系统工程视角,有代码和硬件分析)
- 是否需要核验: 建议对照 vLLM 0.29.0 官方文档和对应论文,验证 disaggregated prefill/decode 细节
- 分类标签:
LLM推理系统工程Edge-AISLM2026架构
条目 I:The 2026 AI Agent Stack, Drawn from Scratch
- 来源: https://codingwithroby.substack.com/p/the-2026-ai-agent-stack-drawn-from
- 作者: Eric Roby
- 核心洞察:
- Agent 栈与 LLM 栈明确区分:LLM 栈处理 GPU/批处理/量化;Agent 栈处理工具/记忆/编排/评估
- 前沿模型层(2026):GPT-5.5 / Claude 4.x / Gemini 3.x / Llama / Mistral / DeepSeek(自托管)
- 自托管工具链:Ollama / vLLM / 云推理提供商
- 硬问题:共享状态、错误恢复、流式部分结果
- 可信度判断: 中高(实战工程经验,图文并茂)
- 后续行动: 建议与条目 D 的 Gateway 架构图对照
- 分类标签:
AgentLLM架构OllamavLLM生产系统
条目 J:State of LLM Routers in 2026
- 来源: https://pakodas.substack.com/p/llm-routers
- 作者: Pratik Bhavsar
- 核心洞察:
- vLLM Semantic Router:下一代路由方向,Mixture of Models 架构
- 推理努力(reasoning effort)作为路由维度:OpenAI / Anthropic / Gemini 均已暴露思考预算参数
- 架构意义:推理不再是单一智力选择,而是可组合的"智能预算"系统
- 可信度判断: 中(行业观察文章,快速概览价值)
- 后续行动: 关注 vLLM 官方 semantic router 插件进展
- 分类标签:
LLM路由SemanticRouter成本优化推理预算
三、综合分析
1. vLLM vs SGLang 选型决策树(2026-10 更新版)
业务瓶颈分析
├── 延迟敏感 + 高并发 + 结构化输出(Agent/RAG)
│ └── SGLang(RadixAttention,共享 KV Cache,结构化成功率 99.8%)
├── 极致单序列吞吐量 + NVIDIA 硬件
│ └── TensorRT-LLM(CUDA 融合编译,78 tokens/s)
├── 通用部署 + 生态成熟 + 国产 GPU
│ └── vLLM(0.29.0 最新,disaggregated P/D/E,支持昇腾/壁仞)
├── 轻量 / 内部测试 / 快速迭代
│ └── Ollama
└── 多框架协同(Gateway 路由)
└── vLLM + SGLang + TensorRT-LLM 按业务分层
2. RAG 工程关键结论
- 中文 Embedding:bge-large-zh-v1.5(MRR=0.79)全面优于 ada-002(MRR=0.62),长尾词差距显著
- 向量库:HNSW ef_construction=200(金融文本精度更优,但内存 +35%)
- 混合检索 + Reranker 已是生产 RAG 标准配置
- 企业级三维度:权限控制(Metadata) + 监控体系(Recall/Precision/幻觉率)+ 增量更新机制
3. 国产化趋势
- 昇腾 NPU + vLLM-ascend 0.11.0 已进入生产选型(batch=64 / Mistral-7B / 2150 tokens/s / NPU 90%)
- LMDeploy(国产生态)2026 年已跻身五大框架之一
- 国产 GPU 适配需注意:bf16 兼容性差,建议 fp16,实测 gpu_memory_utilization=0.85 最优
四、建议写入路径
路径: /shared/research-kb/inbox/jay/2026-10-08-llm-inference-rag-framework.md
草稿结构: - 第一部分:CSDN 高价值条目索引(含工程价值评分、复现优先级) - 第二部分:Substack 条目索引(含核验建议) - 第三部分:选型决策树 + RAG 工程关键结论 - 第四部分:后续精读建议(按优先级排序)
五、后续行动建议
| 优先级 | 行动 | 关联条目 |
|---|---|---|
| 🔴 高 | 对照 vLLM 0.29.0 官方 Changelog 核验 disaggregated P/D/E 支持范围 | 条目 A/D/H |
| 🔴 高 | 验证 SGLang bge-reranker-v2-m3 集成代码可运行性 | 条目 F |
| 🟡 中 | Substack Ken Huang 系列第 3-5 篇深度内容提取 | 条目 H |
| 🟡 中 | 更新 2026-10 月版 LLM 推理框架选型 Cheatsheet | 条目 A/B/C/D |
| 🟢 低 | AtomGit 仓库 PR 触发同步(由同步任务统一处理) | 本草稿 |
Jay · 2026-10-08 12:25 · CSDN 高频检索任务 · 草稿版本