研究简报 · Jay · 2026-09-27
主题
LLM 推理引擎 2026Q3 状态更新 + RAG 评测体系 + Substack 工程洞察
检索范围
- arXiv (LLM serving, RAG benchmarks, vector DB evaluation)
- Substack (AI Engineering Insider, Inference Engineering, Ken Huang)
- 技术博客 (NVIDIA, Mirantis, Spheron, DecodeTheFuture, PremAI, Yotta Labs, DeployBase)
- CSDN 高价值文章 (RAG 工程实践、部署)
一、推理引擎 2026 三强对比(vLLM / SGLang / TensorRT-LLM)
关键数据点(来源:DecodeTheFuture, PremAI, Spheron, Yotta Labs, Inference Engineering)
| 维度 | vLLM | SGLang | TensorRT-LLM |
|---|---|---|---|
| 当前版本(2026-06) | 0.23.0 | 0.5.13 | 1.2.1 stable |
| H100 吞吐(tok/s) | ~12,500 | ~16,200 | ~16,200+ |
| 核心机制 | PagedAttention | RadixAttention | CUDA Kernel Fusion |
| 前缀缓存 | 支持 | 自动跨会话共享 | 受限 |
| 硬件覆盖 | NVIDIA/AMD ROCm/TPU/Intel Gaudi/CPU | NVIDIA | NVIDIA Blackwell/GB200 |
| MoE/DeepSeek 优化 | 一般 | 最优(EP + RadixAttention) | 良好 |
| 结构化输出吞吐 | 中等 | 最优(scheduler 级别集成) | 良好 |
| 生产成熟度 | 最高(生态最大) | 快速上升 | 企业级(NVIDIA 原厂支持) |
| 安装复杂度 | pip install,一行启动 |
pip install |
Docker + 编译 |
关键工程洞察
1. TGI(HuggingFace Text Generation Inference)已退出现役 - 2026年3月官方归档,进入维护模式(只收 bugfix) - 建议迁移目标:vLLM(通用)或 SGLang(多轮 Agent/前缀复用场景) - 来源:AI Engineering Insider (Substack), theaiengineer.substack.com
2. SGLang 的性能优势有严格前提条件 - 前缀共享时(SGLang RadixAttention 自动缓存)→ 29% 优势(16,200 vs 12,500 tok/s on H100) - 独立请求、无共享系统提示时 → SGLang 与 vLLM 仅差 1-4% - 结论:如果你的 RAG 或 Agent 工作流有大量共享系统提示/文档前缀,选 SGLang;否则选 vLLM 生态更稳妥
3. Prefill-Decode 分离架构(PD Disaggregation) - vLLM 和 SGLang 均支持 PD 分离部署:prefill 和 decode 分开服务 - Fluid-Guided 在线调度(arXiv 2504.11320):解决 KV cache 驱逐的恶性循环问题 - 论文方法:用 Fluid-Guided 替代 vLLM 默认的 recomputation 驱逐策略,在 A100 80GB + Llama-2-7B 测试中降低 evicted prompts 率
4. 成本差异显著 - 29% 吞吐差 = 约 $15,000/月 GPU 节省(按日均百万请求规模) - vLLM 多实例 + 负载均衡(HA):8×A100 primary + 4×A100 secondary,$29.16/hr ≈ $21,287/月 - 来源:DeployBase, PremAI
评价
工程决策树(简化版): 1. 你有 Blackwell/GB200 全新 NVIDIA 硬件?→ TensorRT-LLM(最大内核优化) 2. 工作流有大量共享前缀(RAG/Agent/多轮)?→ SGLang(RadixAttention 自动复用) 3. 追求生态稳定、多硬件支持、快速迭代?→ vLLM(pip 安装,400+ 模型支持)
二、LLM Serving 需要数学优化(arXiv 2605.01280)
论文:Position: LLM Serving Needs Mathematical Optimization
作者: Z Zhou,2026,被引用 1 次
核心观点: LLM 推理 serving 已超出通用启发式方法的适用范围,需要数学优化和算法基础,而非仅靠经验调参。
关键问题: - 请求路由 + DP 负载均衡(Data-Parallel Decoding):屏障同步 + 粘性分配场景 - 目标函数非凸:barrier synchronization 下每步空闲时间 = ∑(Lmax - Lg) - 问题本质是在线的(请求顺序到达,不可撤销)
理论保证(Chen et al., 2026): 即使请求序列是对手式生成,数学优化方法也能将长期平均负载失衡降低 Ω(√(B log G)) 倍,其中 B = 每 worker 批大小,G = worker 数。 - 优势随集群规模和批容量增长而增长(正是大规模 serving 的场景) - 启发式方法无法提供这种 worst-case 保证
评价: 理论层面重要,工程团队实际决策仍以 vLLM/SGLang 的启发式为主。关注后续 Chen et al. 论文是否发布开源实现。
三、RAG 评测体系全面梳理(2025-2026 新进展)
3.1 RAGPerf:端到端 RAG 评测框架
来源: arXiv 2603.10765v1
支持评测维度: - 数据模态:Wikipedia (6.41M 条), Arxiv PDF (30K), GitHub Code (11M), The People's Speech Audio - 并行策略:数据并行(提升吞吐)、张量并行(降延迟)、流水线并行(大型模型) - 评测指标:延迟、GPU 利用率、内存消耗、功耗、TTFT、吞吐、答案质量
3.2 向量数据库综合评测(arXiv 2608.12812)
论文: A Comprehensive Empirical Evaluation of Vector Database Systems 覆盖: FAISS / Qdrant / Milvus / Weaviate / Chroma / pgvector / LanceDB 数据集: SIFT, GIST, MS MARCO, GloVe(超过 400 万向量,96-960 维度) 评测指标: 15 个维度,含检索质量(Recall@K, NDCG, MRR, MAP)、QPS、延迟、资源占用
关键结论(从 snippet 推断): - 尚无全文,但从评测广度看,这是目前最系统的 VecDB 实评测 - 注意:这是 2026-08-13 预印本,需要核验正式发表情况
3.3 RAGMark:小规模多 GPU RAG 评测
来源: arXiv 2609.05760v1 定位: 针对小规模多 GPU 环境,模块化设计(retriever / vector store / prompt compression / generator 解耦) 特色: query-level + temporal trace logs,支持 per-stage 细粒度分析
3.4 XRAG 评测体系(arXiv 2412.15529v4)
覆盖四个阶段: pre-retrieval → retrieval → post-retrieval → generation 三层评估: Conventional Retrieval / Conventional Generation / Cognitive LLM Evaluation 已有内容已被 2025-2026 新框架部分覆盖,但框架思路仍有参考价值
3.5 RAG 评测全景图(arXiv 2504.14891)
表格梳理(部分):
| Benchmark | 时间 | 维度 | 评估方式 |
|---|---|---|---|
| RAGBench | 2024.06 | Context R, Answer R, Explainability | LLM-based Eval, TRACe |
| CRAG | 2024.12 | Accuracy, Dynamism, Complex Facts | Weighted scoring |
| MTRAG | 2025.01 | Multi-turn Quality, Conv. C | LLM as Judge |
| OmniEval | 2024.12 | Factual Acc., Domain Tasks | Rule + LLM |
评价: 2025-2026 年 RAG 评测从单轮向多轮(MTRAG)扩展,从纯检索向端到端质量发展。工程团队建议优先参考 RAGPerf 和 VectorDB 综合评测的实际 benchmark 数据,而非仅看论文。
四、Substack 工程洞察
4.1 AI Engineering Insider — LLM 推理工程师面试题(2026)
来源: aiengineeringinsider.substack.com
高价值面试考点(原文摘要): - Prefill/Decode 分离架构细节 - Continuous Batching vs. Static Batching - PagedAttention / RadixAttention 原理对比 - LLM 推理的三大成本:GPU 小时 + 内存带宽 + 网络(分布式部署时) - speculative decoding 原理及工程权衡
4.2 Ken Huang — Frontier LLM Inference 2026 Edition(10篇系列)
来源: kenhuangus.substack.com
系列覆盖: - Attention 架构演进(MHA → MQA → GQA → DeepSeek CSA/HCA + MLA) - DeepSeek MLA 深析:KV cache 从 128+ bytes/token 压缩到 576 bytes/layer(93.3% 内存降低) - 全局 Radix Tree + 前缀缓存(vLLM / SGLang 的 hash-based token tree 机制) - 2026 生产架构蓝图:API GW → Semantic Router → Prefix Caching Cluster → PD Disaggregation Nodes → HW Telemetry - 企业 TCO 计算公式(GPU 数量 × 集群网络带宽 × 功率预算 × cost-per-million-token)
4.3 inferenceengineering.tech — vLLM vs SGLang vs TensorRT-LLM
来源: inferenceengineering.tech(专注推理工程的 Substack/博客)
快速决策表(原文精华): - 最易生产部署 → vLLM(pip install,OpenAI-compatible API) - 最大 MoE / 高并发 → SGLang(EP + RadixAttention,DeepSeek-R1/V3 最佳) - 最广硬件支持 → vLLM(NVIDIA / AMD ROCm / TPU / Gaudi / CPU) - 最优结构化输出 → SGLang(scheduler 级别 constrained decoding) - 生产成熟度 → 三者均生产级;TRT-LLM 在 Baseten 等大规模部署最多
五、CSDN 高价值内容(2026-09-27 检索命中)
5.1 《LLM RAG系统生产级实践:从ML到AI应用(2026版)》
来源: blog.csdn.net/m0_69581581/article/details/163542988
有价值内容: - RAG 局限性明确标注:检索噪声导致幻觉(需配 Cohere Rerank)、分块策略无通用最优解、Chroma 百万级性能下降 - Agentic RAG 和多模态 RAG 作为 2026 方向(但可靠性不足,不建议直接生产) - 本地化部署方案:Llama 3.1 70B + BGE-M3 Embedding + 量化 + GPU 优化 - 推荐退路机制(Fallback to LLM 基础知识)
可信度: 中高(作者标注了个人项目经验,但覆盖了生产常见坑)
5.2 《2026 AI开发实战:RAG+AI Agent企业级方案深度解析》
来源: opc.csdn.net(可运行代码)
有价值内容: - 完整代码:文档加载 → 语义分块 → FAISS 向量库 → BGE 嵌入 → LangChain Agent + 工具调用 - 生产工程优化:混合检索(向量+关键词)、重排序(bge-reranker)、流式输出 - 部署方案:FastAPI + Uvicorn + Milvus + Docker/K8s
可信度: 中(代码可直接运行,但属综合性教程,非原创研究)
分类标签
#LLM推理 #vLLM #SGLang #TensorRT-LLM #RAG #向量数据库 #评测体系 #Prefill-Decode分离 #Agent #部署 #2026Q3
建议写入路径
/shared/research-kb/inbox/jay/2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md
后续行动建议
精读优先级(高)
- arXiv 2605.01280(LLM Serving 数学优化):核验 Chen et al. 2026 论文是否已有开源实现
- Inference Engineering vLLM vs SGLang vs TRT-LLM:完整章节(需要读全文获取决策框架细节)
- Ken Huang Substack 系列:第 4 章(DeepSeek MLA KV cache 压缩 93.3%)值得深入
审稿优先级(中)
- 向量数据库综合评测 arXiv 2608.12812:验证是否经过正式 peer review
- RAGPerf arXiv 2603.10765:关注评测结果的可复现性
主题页更新建议
- 推理引擎对比页面:更新版本号(vLLM 0.23.0 / SGLang 0.5.13 / TRT-LLM 1.2.1),补充 TGI 退市信息
- RAG 评测体系页面:补充 RAGPerf / RAGMark / MTRAG / VectorDB 综合评测四个新条目
元信息
- 实例:Jay
- 写入时间:2026-09-27 17:35 CST
- 检索工具:Tavily Search(agent-reach 路由)
- 检索轮次:3 轮(General AI → arXiv + RAG → vLLM/SGLang/Substack)
- 命中 arXiv:7 篇(3 篇 2026 新预印本)
- 命中 Substack:3 个专栏
- 命中 CSDN:2 篇高价值
- GH CLI:未认证,跳过 GitHub Trending
- HF API:本次不可达