研究知识库草稿 · 2026-09-01 10:50 · Jay

本次主题

推理引擎实测基准(2026)、MoE 推理优化工程、Agentic RAG Benchmark 纵览


检索范围

  • Web:vLLM vs SGLang 2026 benchmark(SandBase/YottaLabs/Spheron/TECHSY/Particula/AIMultiple)
  • arXiv:MoE inference optimization、Agentic RAG evaluation(2025-2026)
  • MLSys 2026:LLM Serving 系统论文
  • Substack:The AI Engineer、LLM Engineering Roadmap

1. 推理引擎 2026 横向实测基准(多源比对)

📊 综合结论(跨 6 个独立基准来源)

指标 vLLM SGLang TGI TensorRT-LLM llama.cpp
H100 吞吐量 12,500 tok/s 16,200 tok/s ~10,000
TTFT p50(H100/Llama3-70B) ~210ms ~190ms ~260ms ~210ms
TPOT p50 ~20ms ~19ms ~24ms
TPOT p99 ~55ms ~50ms ~80ms
冷启动时间(H100) ~62s ~62s 需编译
前缀复用优势 29%↑(共享系统提示/对话历史)
DeepSeek V3 专用加速 3.1× vs vLLM(MLA 优化)
多模态 VLM 支持 支持 支持 有限 CPU only
多硬件支持 最广(NVIDIA/AMD/TPU/Trainium) NVIDIA/部分 AMD NVIDIA NVIDIA 所有
生产部署复杂度

核心差异本质: - vLLM PagedAttention:OS 页表式 KV cache 管理,最大化 GPU 利用率和批量吞吐 - SGLang RadixAttention:基数树式前缀缓存,最大化共享上下文场景下的重复计算复用

适用场景决策

IF 流量特征 == 共享系统提示 OR 多轮对话 OR 相同文档 RAG 查询:
    → SGLang(TTFT 降低 29%+,输出 token 生成速度 2×+)
IF 批量作业(embedding/摘要/独立请求)OR 多硬件需求:
    → vLLM(吞吐量优势 + 生态最广)
IF 极致单次推理延迟 AND 固定模型 AND 编译成本可接受:
    → TensorRT-LLM
IF 非 NVIDIA 硬件 OR CPU 推理:
    → vLLM(Trainium)或 llama.cpp

来源:SandBase(2026)、YottaLabs(2026)、Spheron(2026-03)、TECHSY(2026)、Particula(2026)、AIMultiple(2026-04)


⚠️ 关键警告:后端诱导数值分歧

论文arXiv 2605.19537 "The Silent Hyperparameter" - 不同推理后端对相同模型产生数值分歧,非数值等价 - Prefix Caching:分块处理改变归约树;禁用后 vLLM Llama 3.1 精度 +0.46%,Ollama DeepSeek -0.47% - CUDA Graphs:禁用后性能偏移 up to +0.15% - 在 NVIDIA L40 GPU 上,后端诱导方差 up to 17.2% Max-Min 差 - 工程影响:生产评估需锁定推理引擎版本,不同后端不能混用做 A/B 测试


2. MoE 推理优化工程(arXiv 2025-2026)

🔬 2.1 MoE 推理优化全景(ACM CSUR 2026)

  • arXiv2412.14219(已接受 ACM CSUR 2026)
  • 标签:MoE / 推理优化 / 综述 / 并行策略 / 负载均衡
  • 工程价值:⭐⭐⭐⭐⭐
  • 覆盖维度: 1. 并行策略:TP(张量并行)、EP(专家并行)、PP(流水线并行)、DP(数据并行)组合 2. 负载均衡:辅助损失、专家容量、动态门控 3. All-to-All 通信:MoE 层核心瓶颈,通信与计算重叠策略 4. 任务调度:Token 路由、专家选择、优先级队列 5. 量化:MoEQuant、EAQuant、DynaExq、MiLo 等专家级量化方案 6. 知识蒸馏:从大 MoE 到小 MoE 的迁移
  • 关键工程数字
  • SiDA (MLSys'24):稀疏感知服务,E2E 效率显著提升
  • ExpertFlow (ArXiv'24.10):专家激活和 Token 分配联合优化
  • DeepSeek-V2:236B 总参数,21B 活跃参数,训练和推理效率均优秀
  • 建议分类MoE / 推理优化 / 并行策略 / 2026
  • 可信度:高——ACM CSUR 2026 同行评审综述
  • 后续行动:工程落地优先关注:动态门控 + 专家缓存 + 负载均衡组合方案

🔬 2.2 MoE 推理通信调度联合优化(Aurora)

  • arXiv2410.17043
  • 标签:MoE / 推理调度 / 通信优化 / 3D 匹配
  • 工程价值:⭐⭐⭐⭐
  • 核心机制
  • 将专家放置(Expert colocation)+ GPU 分配联合优化建模为3维匹配问题(相比二分图匹配的扩展)
  • 基于历史统计数据的优化(token 分布、Gate/FFN/Aggregation 时耗)
  • Aurora 系统使用运行时收集的性能监控数据指导优化
  • 建议分类MoE / 通信优化 / 调度 / 2025
  • 可信度:高——有具体系统和算法设计

🔬 2.3 X-MoE:非 NVIDIA 平台 MoE 训练优化

  • arXiv2508.13337
  • 标签:MoE / HPC / 跨平台 / 稀疏计算 / 2025
  • 工程价值:⭐⭐⭐⭐
  • 核心优化
  • Padding-Free Sparse MoE Training:消除不同 MoE 阶段间的零填充
  • Sparse PFT Layout:token-dropping 策略中,将 cumsum 从内维移到外维,手工 one_hot_enc tensor 重排,10× 加速
  • 支持非 NVIDIA HPC 平台(AMD ROCm 等)
  • 关键数字:在 64 GPU(8节点×8GPU)场景验证,模型含 8 个专家,EP=8
  • 建议分类MoE / HPC / 跨平台 / 稀疏计算 / 2025

3. Agentic RAG Benchmark 纵览

📊 核心 Benchmark 对比

Benchmark 任务类型 核心指标 最优系统成绩 瓶颈
BRIGHT 长上下文多跳检索(8领域) Recall@1 49.6%(+21.8pp vs embedding 基线) 迭代式子查询
FinanceBench 金融文档问答(84份长PDF,均值116K token) Answer Correctness 92.00%(GPT-5-mini,3.8× vs 传统 RAG) 复杂情境查询
RAGCap-Bench Agentic RAG 过程评估(细粒度) 组件级能力 "slow-thinking"模型得分更高 中间过程错误定位
HERB 企业真实场景(Slack/GitHub/会议记录/内部文档) 综合得分 32.96(即使是最佳 Agentic RAG) 检索是主要瓶颈
InfoDeepSeek 动态 Web 环境信息获取 多维指标 挑战性查询构造方法论 动态环境适应
Is Agentic RAG Worth It? Enhanced vs Agentic RAG 对比(FIQA/FEVER/CQA) F1/Recall Enhanced: F1=95.7;Agentic: F1=98.8 Agentic 在 FEVER 上反而下降(49.3% recall)

关键工程洞察: - Agentic RAG 并不总是优于 Enhanced RAG:在 FEVER 任务上,naïve RAG recall=100 但 F1=66.7;enhanced RAG F1=87.9;agentic RAG F1=64.6(recall 仅 49.3%)——说明 agentic 方案在某些场景会过度检索或检索偏移 - 检索是 Agentic RAG 的主瓶颈:HERB benchmark 上即使是最佳系统也只有 32.96 分,深层搜索能力不足 - Benchmark 趋势:从端到端评估(答案质量)→ 过程感知评估(RAGCap-Bench 方向)→ 真实企业场景(HERB)

建议分类RAG / Agentic / Benchmark / Evaluation / 2025-2026


4. MLSys 2026 LLM Serving 系统论文

来源:mlsys.org/virtual/2026/papers.html

论文 标签 摘要
Optimizing Deployment Configurations for LLM Inference LLM Serving / 部署配置 推断部署配置优化
PROMPTS: PeRformance Optimization via Multi-Agent Planning for LLM Training and Serving LLM Serving / 多Agent 多Agent规划优化训练和推理
Scaling Up LLM Serving Systems for Semantic Job Search LLM Serving / 垂直搜索 语义招聘搜索场景扩展
Attribution-based Sparse Activation in LLMs LLM / 稀疏激活 基于归因的稀疏激活

建议分类LLM Serving / MLSys 2026 / 系统


5. Substack 工程洞察精选

📝 "vLLM vs Ollama vs SGLang vs TensorRT-LLM 2026" — The AI Engineer

  • 作者:Paolo Perrone(The AI Engineer,21K+ 订阅者)
  • URLhttps://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt
  • 标签:LLM Serving / 推理引擎 / 选型 / 2026
  • 工程价值:⭐⭐⭐⭐
  • 核心观点
  • Ollama 适合本地单用户原型,不适合生产
  • 生产推理引擎分为 4 类:本地运行时(Ollama/llama.cpp)→ 生产框架(vLLM/SGLang/TGI/LMDeploy)→ 硬件优化(TensorRT-LLM/llama.cpp CUDA)→ 编排层(Ray Serve/Triton/NVIDIA Dynamo)
  • TGI 已落后:新功能、性能改进优先给 vLLM 和 SGLang;2026 应规划从 TGI 迁移
  • 建议分类LLM Serving / 推理引擎 / 选型 / 2026

分类标签

LLM Serving Inference Engine vLLM SGLang MoE Agentic RAG Benchmark MLSys 2026 Quantization Production 2026


本次新增关键发现

  1. 推理引擎实测 6 来源综合:SGLang 在共享上下文场景 29% 吞吐优势 + 3.1× DeepSeek V3 专用加速;vLLM 多硬件支持最广
  2. The Silent Hyperparameter 警告:不同推理后端数值分歧,生产锁定版本
  3. MoE 综述(ACM CSUR 2026):并行/负载均衡/通信/量化/调度全覆盖,X-MoE 非 NVIDIA 平台优化有工程参考价值
  4. Agentic RAG Benchmark:HERB(32.96 分)揭示检索是主瓶颈;Agentic 并不总优于 Enhanced RAG(FEVER 反例)
  5. MLSys 2026:PROMPTS 多Agent推理优化、Attribution-based Sparse Activation
  6. TGI 迁移警告:The AI Engineer 建议 2026 规划从 TGI 迁移到 vLLM/SGLang

建议写入路径

/shared/research-kb/inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md


与 09:35 草稿的关系

  • 本轮新增:MoE 推理优化(3篇 arXiv)、Agentic RAG Benchmark 纵览(HERB/RAGCap-Bench/InfoDeepSeek)、MLSys 2026 Serving 论文、推理引擎多源实测基准表(6来源)、TGI 迁移建议
  • 本轮未重复:Oneiros/Albireo/Silent Hyperparameter(09:35 已覆盖)、Substack 4篇(09:35 已覆盖)、HF State of Open Source(09:35 已覆盖)

本草案由 Jay(2026-09-01T10:50)产出,未经 Git 提交,仅供草稿区暂存。