研究知识库草稿 · 2026-09-01 10:50 · Jay
本次主题
推理引擎实测基准(2026)、MoE 推理优化工程、Agentic RAG Benchmark 纵览
检索范围
- Web:vLLM vs SGLang 2026 benchmark(SandBase/YottaLabs/Spheron/TECHSY/Particula/AIMultiple)
- arXiv:MoE inference optimization、Agentic RAG evaluation(2025-2026)
- MLSys 2026:LLM Serving 系统论文
- Substack:The AI Engineer、LLM Engineering Roadmap
1. 推理引擎 2026 横向实测基准(多源比对)
📊 综合结论(跨 6 个独立基准来源)
| 指标 | vLLM | SGLang | TGI | TensorRT-LLM | llama.cpp |
|---|---|---|---|---|---|
| H100 吞吐量 | 12,500 tok/s | 16,200 tok/s | ~10,000 | 高 | — |
| TTFT p50(H100/Llama3-70B) | ~210ms | ~190ms | ~260ms | ~210ms | — |
| TPOT p50 | ~20ms | ~19ms | ~24ms | — | — |
| TPOT p99 | ~55ms | ~50ms | ~80ms | — | — |
| 冷启动时间(H100) | ~62s | ~62s | — | 需编译 | — |
| 前缀复用优势 | 无 | 29%↑(共享系统提示/对话历史) | 无 | 无 | 无 |
| DeepSeek V3 专用加速 | — | 3.1× vs vLLM(MLA 优化) | — | — | — |
| 多模态 VLM | 支持 | 支持 | 支持 | 有限 | CPU only |
| 多硬件支持 | 最广(NVIDIA/AMD/TPU/Trainium) | NVIDIA/部分 AMD | NVIDIA | NVIDIA | 所有 |
| 生产部署复杂度 | 低 | 中 | 低 | 高 | 低 |
核心差异本质: - vLLM PagedAttention:OS 页表式 KV cache 管理,最大化 GPU 利用率和批量吞吐 - SGLang RadixAttention:基数树式前缀缓存,最大化共享上下文场景下的重复计算复用
适用场景决策:
IF 流量特征 == 共享系统提示 OR 多轮对话 OR 相同文档 RAG 查询:
→ SGLang(TTFT 降低 29%+,输出 token 生成速度 2×+)
IF 批量作业(embedding/摘要/独立请求)OR 多硬件需求:
→ vLLM(吞吐量优势 + 生态最广)
IF 极致单次推理延迟 AND 固定模型 AND 编译成本可接受:
→ TensorRT-LLM
IF 非 NVIDIA 硬件 OR CPU 推理:
→ vLLM(Trainium)或 llama.cpp
来源:SandBase(2026)、YottaLabs(2026)、Spheron(2026-03)、TECHSY(2026)、Particula(2026)、AIMultiple(2026-04)
⚠️ 关键警告:后端诱导数值分歧
论文:arXiv 2605.19537 "The Silent Hyperparameter"
- 不同推理后端对相同模型产生数值分歧,非数值等价
- Prefix Caching:分块处理改变归约树;禁用后 vLLM Llama 3.1 精度 +0.46%,Ollama DeepSeek -0.47%
- CUDA Graphs:禁用后性能偏移 up to +0.15%
- 在 NVIDIA L40 GPU 上,后端诱导方差 up to 17.2% Max-Min 差
- 工程影响:生产评估需锁定推理引擎版本,不同后端不能混用做 A/B 测试
2. MoE 推理优化工程(arXiv 2025-2026)
🔬 2.1 MoE 推理优化全景(ACM CSUR 2026)
- arXiv:
2412.14219(已接受 ACM CSUR 2026) - 标签:MoE / 推理优化 / 综述 / 并行策略 / 负载均衡
- 工程价值:⭐⭐⭐⭐⭐
- 覆盖维度: 1. 并行策略:TP(张量并行)、EP(专家并行)、PP(流水线并行)、DP(数据并行)组合 2. 负载均衡:辅助损失、专家容量、动态门控 3. All-to-All 通信:MoE 层核心瓶颈,通信与计算重叠策略 4. 任务调度:Token 路由、专家选择、优先级队列 5. 量化:MoEQuant、EAQuant、DynaExq、MiLo 等专家级量化方案 6. 知识蒸馏:从大 MoE 到小 MoE 的迁移
- 关键工程数字:
- SiDA (MLSys'24):稀疏感知服务,E2E 效率显著提升
- ExpertFlow (ArXiv'24.10):专家激活和 Token 分配联合优化
- DeepSeek-V2:236B 总参数,21B 活跃参数,训练和推理效率均优秀
- 建议分类:
MoE / 推理优化 / 并行策略 / 2026 - 可信度:高——ACM CSUR 2026 同行评审综述
- 后续行动:工程落地优先关注:动态门控 + 专家缓存 + 负载均衡组合方案
🔬 2.2 MoE 推理通信调度联合优化(Aurora)
- arXiv:
2410.17043 - 标签:MoE / 推理调度 / 通信优化 / 3D 匹配
- 工程价值:⭐⭐⭐⭐
- 核心机制:
- 将专家放置(Expert colocation)+ GPU 分配联合优化建模为3维匹配问题(相比二分图匹配的扩展)
- 基于历史统计数据的优化(token 分布、Gate/FFN/Aggregation 时耗)
- Aurora 系统使用运行时收集的性能监控数据指导优化
- 建议分类:
MoE / 通信优化 / 调度 / 2025 - 可信度:高——有具体系统和算法设计
🔬 2.3 X-MoE:非 NVIDIA 平台 MoE 训练优化
- arXiv:
2508.13337 - 标签:MoE / HPC / 跨平台 / 稀疏计算 / 2025
- 工程价值:⭐⭐⭐⭐
- 核心优化:
- Padding-Free Sparse MoE Training:消除不同 MoE 阶段间的零填充
- Sparse PFT Layout:token-dropping 策略中,将 cumsum 从内维移到外维,手工 one_hot_enc tensor 重排,10× 加速
- 支持非 NVIDIA HPC 平台(AMD ROCm 等)
- 关键数字:在 64 GPU(8节点×8GPU)场景验证,模型含 8 个专家,EP=8
- 建议分类:
MoE / HPC / 跨平台 / 稀疏计算 / 2025
3. Agentic RAG Benchmark 纵览
📊 核心 Benchmark 对比
| Benchmark | 任务类型 | 核心指标 | 最优系统成绩 | 瓶颈 |
|---|---|---|---|---|
| BRIGHT | 长上下文多跳检索(8领域) | Recall@1 | 49.6%(+21.8pp vs embedding 基线) | 迭代式子查询 |
| FinanceBench | 金融文档问答(84份长PDF,均值116K token) | Answer Correctness | 92.00%(GPT-5-mini,3.8× vs 传统 RAG) | 复杂情境查询 |
| RAGCap-Bench | Agentic RAG 过程评估(细粒度) | 组件级能力 | "slow-thinking"模型得分更高 | 中间过程错误定位 |
| HERB | 企业真实场景(Slack/GitHub/会议记录/内部文档) | 综合得分 | 32.96(即使是最佳 Agentic RAG) | 检索是主要瓶颈 |
| InfoDeepSeek | 动态 Web 环境信息获取 | 多维指标 | 挑战性查询构造方法论 | 动态环境适应 |
| Is Agentic RAG Worth It? | Enhanced vs Agentic RAG 对比(FIQA/FEVER/CQA) | F1/Recall | Enhanced: F1=95.7;Agentic: F1=98.8 | Agentic 在 FEVER 上反而下降(49.3% recall) |
关键工程洞察: - Agentic RAG 并不总是优于 Enhanced RAG:在 FEVER 任务上,naïve RAG recall=100 但 F1=66.7;enhanced RAG F1=87.9;agentic RAG F1=64.6(recall 仅 49.3%)——说明 agentic 方案在某些场景会过度检索或检索偏移 - 检索是 Agentic RAG 的主瓶颈:HERB benchmark 上即使是最佳系统也只有 32.96 分,深层搜索能力不足 - Benchmark 趋势:从端到端评估(答案质量)→ 过程感知评估(RAGCap-Bench 方向)→ 真实企业场景(HERB)
建议分类:RAG / Agentic / Benchmark / Evaluation / 2025-2026
4. MLSys 2026 LLM Serving 系统论文
来源:mlsys.org/virtual/2026/papers.html
| 论文 | 标签 | 摘要 |
|---|---|---|
| Optimizing Deployment Configurations for LLM Inference | LLM Serving / 部署配置 | 推断部署配置优化 |
| PROMPTS: PeRformance Optimization via Multi-Agent Planning for LLM Training and Serving | LLM Serving / 多Agent | 多Agent规划优化训练和推理 |
| Scaling Up LLM Serving Systems for Semantic Job Search | LLM Serving / 垂直搜索 | 语义招聘搜索场景扩展 |
| Attribution-based Sparse Activation in LLMs | LLM / 稀疏激活 | 基于归因的稀疏激活 |
建议分类:LLM Serving / MLSys 2026 / 系统
5. Substack 工程洞察精选
📝 "vLLM vs Ollama vs SGLang vs TensorRT-LLM 2026" — The AI Engineer
- 作者:Paolo Perrone(The AI Engineer,21K+ 订阅者)
- URL:
https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt - 标签:LLM Serving / 推理引擎 / 选型 / 2026
- 工程价值:⭐⭐⭐⭐
- 核心观点:
- Ollama 适合本地单用户原型,不适合生产
- 生产推理引擎分为 4 类:本地运行时(Ollama/llama.cpp)→ 生产框架(vLLM/SGLang/TGI/LMDeploy)→ 硬件优化(TensorRT-LLM/llama.cpp CUDA)→ 编排层(Ray Serve/Triton/NVIDIA Dynamo)
- TGI 已落后:新功能、性能改进优先给 vLLM 和 SGLang;2026 应规划从 TGI 迁移
- 建议分类:
LLM Serving / 推理引擎 / 选型 / 2026
分类标签
LLM Serving Inference Engine vLLM SGLang MoE Agentic RAG Benchmark MLSys 2026 Quantization Production 2026
本次新增关键发现
- 推理引擎实测 6 来源综合:SGLang 在共享上下文场景 29% 吞吐优势 + 3.1× DeepSeek V3 专用加速;vLLM 多硬件支持最广
- The Silent Hyperparameter 警告:不同推理后端数值分歧,生产锁定版本
- MoE 综述(ACM CSUR 2026):并行/负载均衡/通信/量化/调度全覆盖,X-MoE 非 NVIDIA 平台优化有工程参考价值
- Agentic RAG Benchmark:HERB(32.96 分)揭示检索是主瓶颈;Agentic 并不总优于 Enhanced RAG(FEVER 反例)
- MLSys 2026:PROMPTS 多Agent推理优化、Attribution-based Sparse Activation
- TGI 迁移警告:The AI Engineer 建议 2026 规划从 TGI 迁移到 vLLM/SGLang
建议写入路径
/shared/research-kb/inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md
与 09:35 草稿的关系
- 本轮新增:MoE 推理优化(3篇 arXiv)、Agentic RAG Benchmark 纵览(HERB/RAGCap-Bench/InfoDeepSeek)、MLSys 2026 Serving 论文、推理引擎多源实测基准表(6来源)、TGI 迁移建议
- 本轮未重复:Oneiros/Albireo/Silent Hyperparameter(09:35 已覆盖)、Substack 4篇(09:35 已覆盖)、HF State of Open Source(09:35 已覆盖)
本草案由 Jay(2026-09-01T10:50)产出,未经 Git 提交,仅供草稿区暂存。