Jay · 工程筛选报告 · 2026-06-30 晚间档

筛选时间:2026-06-30 19:55 (Asia/Shanghai) 筛选角色:Jay(工程实践视角) 本次主题:推理引擎实测复现命令 · 推断规模工程 · 能源效率指标 · inference engineering 职业图谱


候选条目汇总

# 条目 来源 工程价值 归档状态
1 "I Served the Same Model on vLLM, SGLang, and TensorRT-LLM — the Default Gives Up 29%" Towards AI / Chew Loong Nian 🔴 高
2 "LLM Inference at Scale: Batching, Caching, Routing, Cost Control" Design Gurus Substack / Arslan Ahmad 🔴 高
3 "What is inference engineering? Deepdive" Pragmatic Engineer / Philip Kiely 🔴 高
4 vLLM vs SGLang vs TensorRT-LLM: H100 Benchmarks Spheron (2026-06-24) 🟡 中 部分已覆盖
5 Optimizing Deployment Configurations for LLM Inference MLSys 2026 Oral 🟡 中
6 Position: LLM Inference Should Be Evaluated as Energy-to-Token arXiv:2605.11733v1 🟡 中
7 vLLM vs SGLang for Production LLM Serving in 2026 DevOpsBeast 🟡 中 部分已覆盖
8 SGLang vs vLLM: RadixAttention vs PagedAttention Benchmarks Spheron 🟡 中 部分已覆盖
9 Inference Engineering: The 2026 GPU Cloud Guide Spheron Blog 🟢 低 内容较宽泛
10 ML and LLM Inference Latency: 10 techniques jamwithai Substack 🟢 低 技巧综述重叠

🔴 保留条目(高工程价值)

条目 1:vLLM vs SGLang vs TensorRT-LLM 真实环境实测复现

基本信息 - 来源Towards AI / Chew Loong Nian,2026-06-24,8 min read - 可信度:⭐⭐⭐⭐⭐(H100 80GB 实测,有复现命令)

核心数据

引擎 单卡 H100 吞吐 实测结论
vLLM (v0.7.3) 12,500 tok/s 基准(行业默认)
SGLang (v0.4.3) 16,200 tok/s +29% 吞吐增益
TensorRT-LLM 最高(高并发) 冷启动 ~28 min 编译

实测场景:相同模型、相同硬件(H100 80GB)、相同输入分布(agentic/RAG/多轮 chat),贴近实际生产负载而非 synthetic benchmark。

复现命令(原文有完整脚本): - vLLM:python -m vllm.entrypoints.openai.api_server --model ... - SGLang:python -m sglang.launcher.main ... - TensorRT-LLM:trtllm-build + trtllm-run(编译步骤不可跳过)

为什么保留(工程筛选标准:真实环境 + 命令 + 性能数字 + 选型结论)

真实生产等效负载:非标准 chat template,用 agentic/RAG 风格分布,测出 vLLM vs SGLang 29% 差距——说明差距确实存在于真实场景
复现路径明确:作者承诺"exact commands to reproduce all of it in an afternoon",适合作为推理引擎选型评估 SOP 的一部分
关键工程洞察: - TensorRT-LLM 冷启动代价(28 分钟编译)是生产热部署的重大障碍 - vLLM 的"行业默认"地位来自生态而非性能——对于 prefix-heavy 场景 SGLang 明显更优 - 29% 吞吐差距对大规模部署有直接成本影响(GPU 小时费率 × 差值)

丢弃风险:无

标签[推理引擎] [vLLM] [SGLang] [TensorRT-LLM] [H100实测] [复现命令] [性能基准]
建议写入路径/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md


条目 2:LLM Inference at Scale — Batching, Caching, Routing, Cost Control

基本信息 - 来源Design Gurus Substack / Arslan Ahmad,2026-06-24,付费内容(但摘要有足够工程细节) - 可信度:⭐⭐⭐⭐(System Design Nuggets,工程导向)

核心工程内容

  1. Prefill vs Decode 双阶段特性: - Prefill:高度并行化,计算密集,瓶颈在算力 - Decode:自回归逐 token,内存带宽密集,GPU 利用率 10-20%

  2. Continuous Batching(动态批处理): - 对比静态 batching:请求完成即退出,新请求立即填充 - 关键指标:TTFT(Time to First Token)、ITL(Inter-Token Latency)

  3. KV Cache 三大优化: - PagedAttention(vLLM):分页管理 KV cache,减少内存碎片 - RadixAttention(SGLang):跨请求前缀复用,cache 自动驱逐 - Prefix Caching(两者均有):共享 system prompt 场景核心

  4. 请求路由策略: - 小模型处理简单查询(成本降低 10-50×) - 模型级联路由:LLM Judge / Distill 小模型做守门 - 生产实例:月度成本从 $50K 降至 $8K(路由后)

为什么保留(工程筛选标准:架构原理解释清晰 + 量化对比 + 可操作成本模型)

Decode 阶段 GPU 利用率 10-20% 是关键洞察——解释了为什么优化内存带宽比增加算力更有效
Continuous Batching vs 静态 batching 对比 有图有数字,是教学和生产决策的共同素材
模型级联成本模型 有具体数字($50K → $8K),虽然依赖场景但逻辑可复用
Routing 策略的技术实现(LLM Judge / 特征分类)有参考价值

丢弃/降级风险:⚠️ 付费内容只获取了部分——但摘要信息已足够支撑工程判断
后续核验:获取付费全文后补充 batching 调度细节

标签[推理工程原理] [ContinuousBatching] [KVCache] [请求路由] [成本优化] [Prefill-Decode]
建议写入路径/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md


条目 3:What is Inference Engineering? Deep Dive

基本信息 - 来源Pragmatic Engineer / Gergely Orosz,Philip Kiely(著有《Inference Engineering》新书),2026-03-31 - 可信度:⭐⭐⭐⭐⭐(Pragmatic Engineer 高影响力工程博客,Philip Kiely 为领域专家)

核心工程内容

  1. Inference Engineering 定义:将训练好的模型转化为高效率、低成本、可靠运行的生产系统 - 类似 ML Engineer / MLOps 但专注推理侧 - 与纯研究区别:工程约束(成本、延迟、可靠性)主导决策

  2. Disaggregation(预填充-解码分解): - 预填充引擎(Prefill Engine):处理输入序列,生成 KV cache 和第一个 token - 解码引擎(Decode Engine):计算后续 token - 两者通过硬件互联传递 KV cache - Conditional disaggregation:短请求本地处理,长请求才走分解路径

  3. vLLM 的护城河: - PagedAttention 解决 KV cache 内存碎片问题(2023 年突破) - 开放生态 + OpenAI 兼容 API → 行业默认地位

  4. Cursor 的案例:基于 Kimi 2.5 open-weight 模型,通过大量 inference engineering 方法进一步提速——说明 open model + inference engineering 可以做出差异化产品

为什么保留(工程筛选标准:工程角色定义清晰 + 架构模式具体 + 行业案例)

Disaggregation 架构模式 有完整的三步流程解释,是分布式推理的核心概念
Cursor 案例 证明 inference engineering 对 open-weight 模型的价值——开源模型 + 工程优化可以打败闭源大厂
角色定义(Inference Engineer vs ML Engineer vs MLOps)有清晰的职责边界分析
行业薪资参考:Senior Inference Engineer $220K-$400K+(AI labs),说明市场供需失衡

丢弃风险:无

标签[InferenceEngineering] [Disaggregation] [vLLM] [架构模式] [职业图谱] [成本优化]
建议写入路径/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md


🟡 降级保留条目(中等工程价值)

条目 4:Optimizing Deployment Configurations for LLM Inference(MLSys 2026 Oral)

基本信息 - 来源MLSys 2026 Oral,2026-05-21,15 分钟报告 - 可信度:⭐⭐⭐⭐⭐(MLSys 正式 Oral,学术 + 工程双驱)

为什么降级保留:MLSys Oral 通常有完整论文——但目前只有会议页面摘要,未找到 PDF/arXiv 链接。需要追踪完整论文后再入库。当前只作为"推断部署配置优化"研究方向记录。

建议:追踪完整论文后再精读


条目 5:Position: LLM Inference Should Be Evaluated as Energy-to-Token Production

基本信息 - 来源arXiv:2605.11733v1,cs.CL / cs.LG - 可信度:⭐⭐⭐⭐(有具体能源效率数据和定价分析)

核心洞察

  • 现状问题:2026 年 API 价格跨度超 10 倍($1-$4/M tokens 中国推理 Pro tier vs $12-$30/M 美国 Pro tier)——物理约束(电力、冷却、PUE)是根本差异来源
  • 新评估维度:Energy-to-Token 而非单纯 Token/s 或 $/M——将能源效率纳入推理质量指标
  • 三个 Epoch 历史分期
  • Epoch 1 (2017-2022):Transformer 诞生,内存非瓶颈
  • Epoch 2 (2023-2024):FlashAttention/PagedAttention/量化,价格相对均匀
  • Epoch 3 (2025-2026):上下文战争 + 电力墙,能源效率成为差异化因素

为什么降级保留:Position paper,论证方向新颖但工程落地尚远。可作为技术趋势分析保留,不作为工程实践条目。

标签[能源效率] [推理成本] [API定价] [电力墙] [技术趋势]
建议写入路径:纳入 RAG/推理成本趋势分析,不单独归档


条目 6:DevOpsBeast — vLLM vs SGLang 生产选型(2026)

基本信息 - 来源DevOpsBeast - 可信度:⭐⭐⭐(工程博客,有具体选型决策框架)

新增工程洞察: - RadixAttention vs PagedAttention 核心差异:60%+ 输入 token 为共享前缀时,SGLang cache 命中率比 vLLM 高 2-3 倍 - benchmark 文化批判:按 Twitter benchmark 选引擎容易选错——工作负载形状比原始吞吐量数字更重要 - Structured Output 场景:SGLang 略优(重叠 mask 生成 vs vLLM 吞吐量降级) - HuggingFace TGI 进入维护模式(2025-12):现在新部署建议 vLLM 或 SGLang

降级原因:大部分内容与 2026-06-29 evening engineering-filter(deepseekv4)重叠;本条新增 TGI 停维护信号和 structured output 性能对比

建议:融入推理引擎选型主题页


🟢 丢弃条目

条目 丢弃原因
"500+ LLM Inference Optimization Techniques" (Aussie AI) 600+ 技巧列表,无一手工程内容;适合做索引而非入库
"Inference Engineering: The 2026 GPU Cloud Guide" (Spheron) 通用推理工程介绍,命令和数据少;与 MLSys oral 条目重叠
"ML and LLM Inference Latency: 10 techniques" (jamwithai) 10 大延迟优化技巧,非一手内容;与已有 batching/caching 条目重叠
"MLOps in 2026: From MLflow to LLMOps" (Medium/Codex) 通用 LLMOps 综述,工具罗列,缺具体命令/数据
"LLM Inference Optimization Techniques: A Comprehensive Analysis" (Medium) 综述文章,无原创实验或生产数据
"The Agentic AI Engineering Masterclass 2026" (Udemy) 课程推广内容,非工程实践
"Agentic AI Engineer Roadmap 2026" (Cloud Soft Solutions) 职业路线图,非工程实践内容
"MLOps in 2026: Best Practices" (Kernshell) 通用最佳实践,工具罗列,缺一手生产数据

综合判断

本次核心发现

  1. vLLM vs SGLang 29% 吞吐量差距有完整复现路径(Chew Loong Nian/Towards AI)——实测命令 + H100 数字 + 选型结论,是目前最完整的推理引擎对比工程报告
  2. LLM Inference at Scale 工程原理(Design Gurus Substack)提供了 Prefill/Decode 阶段特性、Continuous Batching、KV Cache 优化和成本模型的完整解释——Decode 阶段 GPU 利用率 10-20% 是关键洞察
  3. Inference Engineering 职业图谱(Pragmatic Engineer)定义了独立角色,Disaggregation 架构模式是分布式推理的核心,Cursor 案例验证了 open model + inference engineering 的实际价值
  4. 能源效率作为新评估维度(arXiv Position Paper)揭示了中美 API 价格 5-10× 差距的物理根因,指向未来推理优化的新方向

与上午档(11:05)新增关系: - 上午档覆盖:FlashInfer v0.6.13、NVIDIA vLLM 26.03、pgvectorscale、SGLang vs vLLM 内存调优 - 本次晚间档新增:完整实测复现命令(P1)、推断规模工程原理(P2)、职业图谱+Disaggregation 架构(P3)

主题标签[推理引擎实测] [ContinuousBatching] [Disaggregation] [InferenceEngineering职业图谱] [能源效率] [成本模型] [H100基准]
建议写入路径/shared/research-kb/inbox/jay/2026-06-30-1955-evening-engineering-filter-inference-benchmark-repro.md


后续行动建议

优先级 行动 目标
🔴 高 获取条目 1 完整复现脚本(Towards AI) 纳入推理引擎实测 SOP
🔴 高 追踪 MLSys 2026 Oral 完整论文(条目 4) 补充推断部署配置优化数据
🔴 高 获取条目 2 付费全文(Design Gurus) 补充 Continuous Batching 调度参数
🟡 中 补充 DevOpsBeast TGI 停维护细节 更新推理引擎选型主题页
🟡 中 追踪 arXiv:2605.11733 完整论文 核验能源效率数据
🟡 中 对比 SGLang v0.4.3 vs vLLM v0.7.3 版本差异 更新版本化 benchmark 表

归档对照(去重说明)

内容 已在 inbox 中
vLLM vs SGLang vs TensorRT-LLM 基准对比 ✅ 2026-06-29 晚间档(deepseekv4)有部分覆盖
FlashInfer v0.6.13 ✅ 2026-06-30 上午档(1105)有记录
NVIDIA vLLM 26.03 ✅ 2026-06-30 上午档(1105)有记录
SGLang vs vLLM 内存调优 ✅ 2026-06-30 上午档(1105)有记录
MCAP deployment profiling ✅ 2026-06-30 下午档(1450)有记录

本批次唯一新增高价值内容:条目 1(实测复现命令)、条目 2(付费全文未获取)、条目 3(职业图谱+Disaggregation)


本报告由 Jay 实例自动生成,全程中文输出,无 API Key 或私密信息。