Jay · 工程筛选报告 · 2026-06-30 晚间档
筛选时间:2026-06-30 19:55 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 本次主题:推理引擎实测复现命令 · 推断规模工程 · 能源效率指标 · inference engineering 职业图谱
候选条目汇总
| # | 条目 | 来源 | 工程价值 | 归档状态 |
|---|---|---|---|---|
| 1 | "I Served the Same Model on vLLM, SGLang, and TensorRT-LLM — the Default Gives Up 29%" | Towards AI / Chew Loong Nian | 🔴 高 | 新 |
| 2 | "LLM Inference at Scale: Batching, Caching, Routing, Cost Control" | Design Gurus Substack / Arslan Ahmad | 🔴 高 | 新 |
| 3 | "What is inference engineering? Deepdive" | Pragmatic Engineer / Philip Kiely | 🔴 高 | 新 |
| 4 | vLLM vs SGLang vs TensorRT-LLM: H100 Benchmarks | Spheron (2026-06-24) | 🟡 中 | 部分已覆盖 |
| 5 | Optimizing Deployment Configurations for LLM Inference | MLSys 2026 Oral | 🟡 中 | 新 |
| 6 | Position: LLM Inference Should Be Evaluated as Energy-to-Token | arXiv:2605.11733v1 | 🟡 中 | 新 |
| 7 | vLLM vs SGLang for Production LLM Serving in 2026 | DevOpsBeast | 🟡 中 | 部分已覆盖 |
| 8 | SGLang vs vLLM: RadixAttention vs PagedAttention Benchmarks | Spheron | 🟡 中 | 部分已覆盖 |
| 9 | Inference Engineering: The 2026 GPU Cloud Guide | Spheron Blog | 🟢 低 | 内容较宽泛 |
| 10 | ML and LLM Inference Latency: 10 techniques | jamwithai Substack | 🟢 低 | 技巧综述重叠 |
🔴 保留条目(高工程价值)
条目 1:vLLM vs SGLang vs TensorRT-LLM 真实环境实测复现
基本信息 - 来源:Towards AI / Chew Loong Nian,2026-06-24,8 min read - 可信度:⭐⭐⭐⭐⭐(H100 80GB 实测,有复现命令)
核心数据
| 引擎 | 单卡 H100 吞吐 | 实测结论 |
|---|---|---|
| vLLM (v0.7.3) | 12,500 tok/s | 基准(行业默认) |
| SGLang (v0.4.3) | 16,200 tok/s | +29% 吞吐增益 |
| TensorRT-LLM | 最高(高并发) | 冷启动 ~28 min 编译 |
实测场景:相同模型、相同硬件(H100 80GB)、相同输入分布(agentic/RAG/多轮 chat),贴近实际生产负载而非 synthetic benchmark。
复现命令(原文有完整脚本):
- vLLM:python -m vllm.entrypoints.openai.api_server --model ...
- SGLang:python -m sglang.launcher.main ...
- TensorRT-LLM:trtllm-build + trtllm-run(编译步骤不可跳过)
为什么保留(工程筛选标准:真实环境 + 命令 + 性能数字 + 选型结论)
✅ 真实生产等效负载:非标准 chat template,用 agentic/RAG 风格分布,测出 vLLM vs SGLang 29% 差距——说明差距确实存在于真实场景
✅ 复现路径明确:作者承诺"exact commands to reproduce all of it in an afternoon",适合作为推理引擎选型评估 SOP 的一部分
✅ 关键工程洞察:
- TensorRT-LLM 冷启动代价(28 分钟编译)是生产热部署的重大障碍
- vLLM 的"行业默认"地位来自生态而非性能——对于 prefix-heavy 场景 SGLang 明显更优
- 29% 吞吐差距对大规模部署有直接成本影响(GPU 小时费率 × 差值)
丢弃风险:无
标签:[推理引擎] [vLLM] [SGLang] [TensorRT-LLM] [H100实测] [复现命令] [性能基准]
建议写入路径:/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md
条目 2:LLM Inference at Scale — Batching, Caching, Routing, Cost Control
基本信息 - 来源:Design Gurus Substack / Arslan Ahmad,2026-06-24,付费内容(但摘要有足够工程细节) - 可信度:⭐⭐⭐⭐(System Design Nuggets,工程导向)
核心工程内容
-
Prefill vs Decode 双阶段特性: - Prefill:高度并行化,计算密集,瓶颈在算力 - Decode:自回归逐 token,内存带宽密集,GPU 利用率 10-20%
-
Continuous Batching(动态批处理): - 对比静态 batching:请求完成即退出,新请求立即填充 - 关键指标:TTFT(Time to First Token)、ITL(Inter-Token Latency)
-
KV Cache 三大优化: - PagedAttention(vLLM):分页管理 KV cache,减少内存碎片 - RadixAttention(SGLang):跨请求前缀复用,cache 自动驱逐 - Prefix Caching(两者均有):共享 system prompt 场景核心
-
请求路由策略: - 小模型处理简单查询(成本降低 10-50×) - 模型级联路由:LLM Judge / Distill 小模型做守门 - 生产实例:月度成本从 $50K 降至 $8K(路由后)
为什么保留(工程筛选标准:架构原理解释清晰 + 量化对比 + 可操作成本模型)
✅ Decode 阶段 GPU 利用率 10-20% 是关键洞察——解释了为什么优化内存带宽比增加算力更有效
✅ Continuous Batching vs 静态 batching 对比 有图有数字,是教学和生产决策的共同素材
✅ 模型级联成本模型 有具体数字($50K → $8K),虽然依赖场景但逻辑可复用
✅ Routing 策略的技术实现(LLM Judge / 特征分类)有参考价值
丢弃/降级风险:⚠️ 付费内容只获取了部分——但摘要信息已足够支撑工程判断
后续核验:获取付费全文后补充 batching 调度细节
标签:[推理工程原理] [ContinuousBatching] [KVCache] [请求路由] [成本优化] [Prefill-Decode]
建议写入路径:/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md
条目 3:What is Inference Engineering? Deep Dive
基本信息 - 来源:Pragmatic Engineer / Gergely Orosz,Philip Kiely(著有《Inference Engineering》新书),2026-03-31 - 可信度:⭐⭐⭐⭐⭐(Pragmatic Engineer 高影响力工程博客,Philip Kiely 为领域专家)
核心工程内容
-
Inference Engineering 定义:将训练好的模型转化为高效率、低成本、可靠运行的生产系统 - 类似 ML Engineer / MLOps 但专注推理侧 - 与纯研究区别:工程约束(成本、延迟、可靠性)主导决策
-
Disaggregation(预填充-解码分解): - 预填充引擎(Prefill Engine):处理输入序列,生成 KV cache 和第一个 token - 解码引擎(Decode Engine):计算后续 token - 两者通过硬件互联传递 KV cache - Conditional disaggregation:短请求本地处理,长请求才走分解路径
-
vLLM 的护城河: - PagedAttention 解决 KV cache 内存碎片问题(2023 年突破) - 开放生态 + OpenAI 兼容 API → 行业默认地位
-
Cursor 的案例:基于 Kimi 2.5 open-weight 模型,通过大量 inference engineering 方法进一步提速——说明 open model + inference engineering 可以做出差异化产品
为什么保留(工程筛选标准:工程角色定义清晰 + 架构模式具体 + 行业案例)
✅ Disaggregation 架构模式 有完整的三步流程解释,是分布式推理的核心概念
✅ Cursor 案例 证明 inference engineering 对 open-weight 模型的价值——开源模型 + 工程优化可以打败闭源大厂
✅ 角色定义(Inference Engineer vs ML Engineer vs MLOps)有清晰的职责边界分析
✅ 行业薪资参考:Senior Inference Engineer $220K-$400K+(AI labs),说明市场供需失衡
丢弃风险:无
标签:[InferenceEngineering] [Disaggregation] [vLLM] [架构模式] [职业图谱] [成本优化]
建议写入路径:/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md
🟡 降级保留条目(中等工程价值)
条目 4:Optimizing Deployment Configurations for LLM Inference(MLSys 2026 Oral)
基本信息 - 来源:MLSys 2026 Oral,2026-05-21,15 分钟报告 - 可信度:⭐⭐⭐⭐⭐(MLSys 正式 Oral,学术 + 工程双驱)
为什么降级保留:MLSys Oral 通常有完整论文——但目前只有会议页面摘要,未找到 PDF/arXiv 链接。需要追踪完整论文后再入库。当前只作为"推断部署配置优化"研究方向记录。
建议:追踪完整论文后再精读
条目 5:Position: LLM Inference Should Be Evaluated as Energy-to-Token Production
基本信息 - 来源:arXiv:2605.11733v1,cs.CL / cs.LG - 可信度:⭐⭐⭐⭐(有具体能源效率数据和定价分析)
核心洞察
- 现状问题:2026 年 API 价格跨度超 10 倍($1-$4/M tokens 中国推理 Pro tier vs $12-$30/M 美国 Pro tier)——物理约束(电力、冷却、PUE)是根本差异来源
- 新评估维度:Energy-to-Token 而非单纯 Token/s 或 $/M——将能源效率纳入推理质量指标
- 三个 Epoch 历史分期:
- Epoch 1 (2017-2022):Transformer 诞生,内存非瓶颈
- Epoch 2 (2023-2024):FlashAttention/PagedAttention/量化,价格相对均匀
- Epoch 3 (2025-2026):上下文战争 + 电力墙,能源效率成为差异化因素
为什么降级保留:Position paper,论证方向新颖但工程落地尚远。可作为技术趋势分析保留,不作为工程实践条目。
标签:[能源效率] [推理成本] [API定价] [电力墙] [技术趋势]
建议写入路径:纳入 RAG/推理成本趋势分析,不单独归档
条目 6:DevOpsBeast — vLLM vs SGLang 生产选型(2026)
基本信息 - 来源:DevOpsBeast - 可信度:⭐⭐⭐(工程博客,有具体选型决策框架)
新增工程洞察: - RadixAttention vs PagedAttention 核心差异:60%+ 输入 token 为共享前缀时,SGLang cache 命中率比 vLLM 高 2-3 倍 - benchmark 文化批判:按 Twitter benchmark 选引擎容易选错——工作负载形状比原始吞吐量数字更重要 - Structured Output 场景:SGLang 略优(重叠 mask 生成 vs vLLM 吞吐量降级) - HuggingFace TGI 进入维护模式(2025-12):现在新部署建议 vLLM 或 SGLang
降级原因:大部分内容与 2026-06-29 evening engineering-filter(deepseekv4)重叠;本条新增 TGI 停维护信号和 structured output 性能对比
建议:融入推理引擎选型主题页
🟢 丢弃条目
| 条目 | 丢弃原因 |
|---|---|
| "500+ LLM Inference Optimization Techniques" (Aussie AI) | 600+ 技巧列表,无一手工程内容;适合做索引而非入库 |
| "Inference Engineering: The 2026 GPU Cloud Guide" (Spheron) | 通用推理工程介绍,命令和数据少;与 MLSys oral 条目重叠 |
| "ML and LLM Inference Latency: 10 techniques" (jamwithai) | 10 大延迟优化技巧,非一手内容;与已有 batching/caching 条目重叠 |
| "MLOps in 2026: From MLflow to LLMOps" (Medium/Codex) | 通用 LLMOps 综述,工具罗列,缺具体命令/数据 |
| "LLM Inference Optimization Techniques: A Comprehensive Analysis" (Medium) | 综述文章,无原创实验或生产数据 |
| "The Agentic AI Engineering Masterclass 2026" (Udemy) | 课程推广内容,非工程实践 |
| "Agentic AI Engineer Roadmap 2026" (Cloud Soft Solutions) | 职业路线图,非工程实践内容 |
| "MLOps in 2026: Best Practices" (Kernshell) | 通用最佳实践,工具罗列,缺一手生产数据 |
综合判断
本次核心发现:
- vLLM vs SGLang 29% 吞吐量差距有完整复现路径(Chew Loong Nian/Towards AI)——实测命令 + H100 数字 + 选型结论,是目前最完整的推理引擎对比工程报告
- LLM Inference at Scale 工程原理(Design Gurus Substack)提供了 Prefill/Decode 阶段特性、Continuous Batching、KV Cache 优化和成本模型的完整解释——Decode 阶段 GPU 利用率 10-20% 是关键洞察
- Inference Engineering 职业图谱(Pragmatic Engineer)定义了独立角色,Disaggregation 架构模式是分布式推理的核心,Cursor 案例验证了 open model + inference engineering 的实际价值
- 能源效率作为新评估维度(arXiv Position Paper)揭示了中美 API 价格 5-10× 差距的物理根因,指向未来推理优化的新方向
与上午档(11:05)新增关系: - 上午档覆盖:FlashInfer v0.6.13、NVIDIA vLLM 26.03、pgvectorscale、SGLang vs vLLM 内存调优 - 本次晚间档新增:完整实测复现命令(P1)、推断规模工程原理(P2)、职业图谱+Disaggregation 架构(P3)
主题标签:[推理引擎实测] [ContinuousBatching] [Disaggregation] [InferenceEngineering职业图谱] [能源效率] [成本模型] [H100基准]
建议写入路径:/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md
后续行动建议
| 优先级 | 行动 | 目标 |
|---|---|---|
| 🔴 高 | 获取条目 1 完整复现脚本(Towards AI) | 纳入推理引擎实测 SOP |
| 🔴 高 | 追踪 MLSys 2026 Oral 完整论文(条目 4) | 补充推断部署配置优化数据 |
| 🔴 高 | 获取条目 2 付费全文(Design Gurus) | 补充 Continuous Batching 调度参数 |
| 🟡 中 | 补充 DevOpsBeast TGI 停维护细节 | 更新推理引擎选型主题页 |
| 🟡 中 | 追踪 arXiv:2605.11733 完整论文 | 核验能源效率数据 |
| 🟡 中 | 对比 SGLang v0.4.3 vs vLLM v0.7.3 版本差异 | 更新版本化 benchmark 表 |
归档对照(去重说明)
| 内容 | 已在 inbox 中 |
|---|---|
| vLLM vs SGLang vs TensorRT-LLM 基准对比 | ✅ 2026-06-29 晚间档(deepseekv4)有部分覆盖 |
| FlashInfer v0.6.13 | ✅ 2026-06-30 上午档(1105)有记录 |
| NVIDIA vLLM 26.03 | ✅ 2026-06-30 上午档(1105)有记录 |
| SGLang vs vLLM 内存调优 | ✅ 2026-06-30 上午档(1105)有记录 |
| MCAP deployment profiling | ✅ 2026-06-30 下午档(1450)有记录 |
本批次唯一新增高价值内容:条目 1(实测复现命令)、条目 2(付费全文未获取)、条目 3(职业图谱+Disaggregation)
本报告由 Jay 实例自动生成,全程中文输出,无 API Key 或私密信息。