研究简报 · Jay · 2026-09-27

主题

LLM 推理引擎 2026Q3 状态更新 + RAG 评测体系 + Substack 工程洞察

检索范围

  • arXiv (LLM serving, RAG benchmarks, vector DB evaluation)
  • Substack (AI Engineering Insider, Inference Engineering, Ken Huang)
  • 技术博客 (NVIDIA, Mirantis, Spheron, DecodeTheFuture, PremAI, Yotta Labs, DeployBase)
  • CSDN 高价值文章 (RAG 工程实践、部署)

一、推理引擎 2026 三强对比(vLLM / SGLang / TensorRT-LLM)

关键数据点(来源:DecodeTheFuture, PremAI, Spheron, Yotta Labs, Inference Engineering)

维度 vLLM SGLang TensorRT-LLM
当前版本(2026-06) 0.23.0 0.5.13 1.2.1 stable
H100 吞吐(tok/s) ~12,500 ~16,200 ~16,200+
核心机制 PagedAttention RadixAttention CUDA Kernel Fusion
前缀缓存 支持 自动跨会话共享 受限
硬件覆盖 NVIDIA/AMD ROCm/TPU/Intel Gaudi/CPU NVIDIA NVIDIA Blackwell/GB200
MoE/DeepSeek 优化 一般 最优(EP + RadixAttention) 良好
结构化输出吞吐 中等 最优(scheduler 级别集成) 良好
生产成熟度 最高(生态最大) 快速上升 企业级(NVIDIA 原厂支持)
安装复杂度 pip install,一行启动 pip install Docker + 编译

关键工程洞察

1. TGI(HuggingFace Text Generation Inference)已退出现役 - 2026年3月官方归档,进入维护模式(只收 bugfix) - 建议迁移目标:vLLM(通用)或 SGLang(多轮 Agent/前缀复用场景) - 来源:AI Engineering Insider (Substack), theaiengineer.substack.com

2. SGLang 的性能优势有严格前提条件 - 前缀共享时(SGLang RadixAttention 自动缓存)→ 29% 优势(16,200 vs 12,500 tok/s on H100) - 独立请求、无共享系统提示时 → SGLang 与 vLLM 仅差 1-4% - 结论:如果你的 RAG 或 Agent 工作流有大量共享系统提示/文档前缀,选 SGLang;否则选 vLLM 生态更稳妥

3. Prefill-Decode 分离架构(PD Disaggregation) - vLLM 和 SGLang 均支持 PD 分离部署:prefill 和 decode 分开服务 - Fluid-Guided 在线调度(arXiv 2504.11320):解决 KV cache 驱逐的恶性循环问题 - 论文方法:用 Fluid-Guided 替代 vLLM 默认的 recomputation 驱逐策略,在 A100 80GB + Llama-2-7B 测试中降低 evicted prompts 率

4. 成本差异显著 - 29% 吞吐差 = 约 $15,000/月 GPU 节省(按日均百万请求规模) - vLLM 多实例 + 负载均衡(HA):8×A100 primary + 4×A100 secondary,$29.16/hr ≈ $21,287/月 - 来源:DeployBase, PremAI

评价

工程决策树(简化版): 1. 你有 Blackwell/GB200 全新 NVIDIA 硬件?→ TensorRT-LLM(最大内核优化) 2. 工作流有大量共享前缀(RAG/Agent/多轮)?→ SGLang(RadixAttention 自动复用) 3. 追求生态稳定、多硬件支持、快速迭代?→ vLLM(pip 安装,400+ 模型支持)


二、LLM Serving 需要数学优化(arXiv 2605.01280)

论文:Position: LLM Serving Needs Mathematical Optimization

作者: Z Zhou,2026,被引用 1 次

核心观点: LLM 推理 serving 已超出通用启发式方法的适用范围,需要数学优化和算法基础,而非仅靠经验调参。

关键问题: - 请求路由 + DP 负载均衡(Data-Parallel Decoding):屏障同步 + 粘性分配场景 - 目标函数非凸:barrier synchronization 下每步空闲时间 = ∑(Lmax - Lg) - 问题本质是在线的(请求顺序到达,不可撤销)

理论保证(Chen et al., 2026): 即使请求序列是对手式生成,数学优化方法也能将长期平均负载失衡降低 Ω(√(B log G)) 倍,其中 B = 每 worker 批大小,G = worker 数。 - 优势随集群规模和批容量增长而增长(正是大规模 serving 的场景) - 启发式方法无法提供这种 worst-case 保证

评价: 理论层面重要,工程团队实际决策仍以 vLLM/SGLang 的启发式为主。关注后续 Chen et al. 论文是否发布开源实现。


三、RAG 评测体系全面梳理(2025-2026 新进展)

3.1 RAGPerf:端到端 RAG 评测框架

来源: arXiv 2603.10765v1

支持评测维度: - 数据模态:Wikipedia (6.41M 条), Arxiv PDF (30K), GitHub Code (11M), The People's Speech Audio - 并行策略:数据并行(提升吞吐)、张量并行(降延迟)、流水线并行(大型模型) - 评测指标:延迟、GPU 利用率、内存消耗、功耗、TTFT、吞吐、答案质量

3.2 向量数据库综合评测(arXiv 2608.12812)

论文: A Comprehensive Empirical Evaluation of Vector Database Systems 覆盖: FAISS / Qdrant / Milvus / Weaviate / Chroma / pgvector / LanceDB 数据集: SIFT, GIST, MS MARCO, GloVe(超过 400 万向量,96-960 维度) 评测指标: 15 个维度,含检索质量(Recall@K, NDCG, MRR, MAP)、QPS、延迟、资源占用

关键结论(从 snippet 推断): - 尚无全文,但从评测广度看,这是目前最系统的 VecDB 实评测 - 注意:这是 2026-08-13 预印本,需要核验正式发表情况

3.3 RAGMark:小规模多 GPU RAG 评测

来源: arXiv 2609.05760v1 定位: 针对小规模多 GPU 环境,模块化设计(retriever / vector store / prompt compression / generator 解耦) 特色: query-level + temporal trace logs,支持 per-stage 细粒度分析

3.4 XRAG 评测体系(arXiv 2412.15529v4)

覆盖四个阶段: pre-retrieval → retrieval → post-retrieval → generation 三层评估: Conventional Retrieval / Conventional Generation / Cognitive LLM Evaluation 已有内容已被 2025-2026 新框架部分覆盖,但框架思路仍有参考价值

3.5 RAG 评测全景图(arXiv 2504.14891)

表格梳理(部分):

Benchmark 时间 维度 评估方式
RAGBench 2024.06 Context R, Answer R, Explainability LLM-based Eval, TRACe
CRAG 2024.12 Accuracy, Dynamism, Complex Facts Weighted scoring
MTRAG 2025.01 Multi-turn Quality, Conv. C LLM as Judge
OmniEval 2024.12 Factual Acc., Domain Tasks Rule + LLM

评价: 2025-2026 年 RAG 评测从单轮向多轮(MTRAG)扩展,从纯检索向端到端质量发展。工程团队建议优先参考 RAGPerf 和 VectorDB 综合评测的实际 benchmark 数据,而非仅看论文。


四、Substack 工程洞察

4.1 AI Engineering Insider — LLM 推理工程师面试题(2026)

来源: aiengineeringinsider.substack.com

高价值面试考点(原文摘要): - Prefill/Decode 分离架构细节 - Continuous Batching vs. Static Batching - PagedAttention / RadixAttention 原理对比 - LLM 推理的三大成本:GPU 小时 + 内存带宽 + 网络(分布式部署时) - speculative decoding 原理及工程权衡

4.2 Ken Huang — Frontier LLM Inference 2026 Edition(10篇系列)

来源: kenhuangus.substack.com

系列覆盖: - Attention 架构演进(MHA → MQA → GQA → DeepSeek CSA/HCA + MLA) - DeepSeek MLA 深析:KV cache 从 128+ bytes/token 压缩到 576 bytes/layer(93.3% 内存降低) - 全局 Radix Tree + 前缀缓存(vLLM / SGLang 的 hash-based token tree 机制) - 2026 生产架构蓝图:API GW → Semantic Router → Prefix Caching Cluster → PD Disaggregation Nodes → HW Telemetry - 企业 TCO 计算公式(GPU 数量 × 集群网络带宽 × 功率预算 × cost-per-million-token)

4.3 inferenceengineering.tech — vLLM vs SGLang vs TensorRT-LLM

来源: inferenceengineering.tech(专注推理工程的 Substack/博客)

快速决策表(原文精华): - 最易生产部署 → vLLM(pip install,OpenAI-compatible API) - 最大 MoE / 高并发 → SGLang(EP + RadixAttention,DeepSeek-R1/V3 最佳) - 最广硬件支持 → vLLM(NVIDIA / AMD ROCm / TPU / Gaudi / CPU) - 最优结构化输出 → SGLang(scheduler 级别 constrained decoding) - 生产成熟度 → 三者均生产级;TRT-LLM 在 Baseten 等大规模部署最多


五、CSDN 高价值内容(2026-09-27 检索命中)

5.1 《LLM RAG系统生产级实践:从ML到AI应用(2026版)》

来源: blog.csdn.net/m0_69581581/article/details/163542988

有价值内容: - RAG 局限性明确标注:检索噪声导致幻觉(需配 Cohere Rerank)、分块策略无通用最优解、Chroma 百万级性能下降 - Agentic RAG 和多模态 RAG 作为 2026 方向(但可靠性不足,不建议直接生产) - 本地化部署方案:Llama 3.1 70B + BGE-M3 Embedding + 量化 + GPU 优化 - 推荐退路机制(Fallback to LLM 基础知识)

可信度: 中高(作者标注了个人项目经验,但覆盖了生产常见坑)

5.2 《2026 AI开发实战:RAG+AI Agent企业级方案深度解析》

来源: opc.csdn.net(可运行代码)

有价值内容: - 完整代码:文档加载 → 语义分块 → FAISS 向量库 → BGE 嵌入 → LangChain Agent + 工具调用 - 生产工程优化:混合检索(向量+关键词)、重排序(bge-reranker)、流式输出 - 部署方案:FastAPI + Uvicorn + Milvus + Docker/K8s

可信度: 中(代码可直接运行,但属综合性教程,非原创研究)


分类标签

#LLM推理 #vLLM #SGLang #TensorRT-LLM #RAG #向量数据库 #评测体系 #Prefill-Decode分离 #Agent #部署 #2026Q3


建议写入路径

/shared/research-kb/inbox/jay/2026-09-27-1735-jay-research-briefing-inference-vecdb-substack.md


后续行动建议

精读优先级(高)

  1. arXiv 2605.01280(LLM Serving 数学优化):核验 Chen et al. 2026 论文是否已有开源实现
  2. Inference Engineering vLLM vs SGLang vs TRT-LLM:完整章节(需要读全文获取决策框架细节)
  3. Ken Huang Substack 系列:第 4 章(DeepSeek MLA KV cache 压缩 93.3%)值得深入

审稿优先级(中)

  1. 向量数据库综合评测 arXiv 2608.12812:验证是否经过正式 peer review
  2. RAGPerf arXiv 2603.10765:关注评测结果的可复现性

主题页更新建议

  1. 推理引擎对比页面:更新版本号(vLLM 0.23.0 / SGLang 0.5.13 / TRT-LLM 1.2.1),补充 TGI 退市信息
  2. RAG 评测体系页面:补充 RAGPerf / RAGMark / MTRAG / VectorDB 综合评测四个新条目

元信息

  • 实例:Jay
  • 写入时间:2026-09-27 17:35 CST
  • 检索工具:Tavily Search(agent-reach 路由)
  • 检索轮次:3 轮(General AI → arXiv + RAG → vLLM/SGLang/Substack)
  • 命中 arXiv:7 篇(3 篇 2026 新预印本)
  • 命中 Substack:3 个专栏
  • 命中 CSDN:2 篇高价值
  • GH CLI:未认证,跳过 GitHub Trending
  • HF API:本次不可达