工程实践筛选报告 · 2026-06-29 · Jay
主题
LLM 推理工程实践:CUDA Profiling / 命令行 Benchmark / 生产部署实测
检索范围
- arXiv cs.CL / cs.LG / cs.SE(2026-06 新文)
- Substack:ByteByteGo · Dennis Kennetz · Pragmatic Engineer · BoringBot
- 官方工程文档:NVIDIA trtllm-bench · vLLM docs · inferenceengineering.tech
- 工程博客:Spheron · SitePoint · DeployBase · MorphLLM
保留条目(✅ 含真实环境/命令/源码/性能数据)
🔴 高工程价值
| 属性 |
内容 |
| arXiv ID |
2606.26453v1 |
| 方向 |
CUDA Profiling + LLM Kernel 优化工程 |
| 核心观点 |
LLM Agent 可使用 NVIDIA Nsight Compute (ncu) 微分级 profiling 数据辅助 CUDA kernel 优化,而非仅靠端到端 timing。提出了 KernelPro 系统,使用 roofline 分析 + 结构化瓶颈输出。 |
| 工程价值亮点 |
⭐⭐⭐⭐⭐ |
| - |
比纯端到端 timing 的 LLM kernel 优化方案更进一步 |
| - |
实测包含 ncu metrics(memory-bound vs compute-bound 分类) |
| - |
与 GrepSeek (Salemi et al., 2026) 独立得出相同结论:可执行搜索 > 索引检索 |
| - |
MCTS UCT 树搜索用于 CUDA kernel 优化,与 OptiML (Bhattacharjee et al., 2026) 收敛 |
| 可信度 |
⭐⭐⭐⭐(arXiv 预印本,有真实 benchmark) |
| 保留理由 |
有完整 profiling → 分析 → 优化闭环,含实测工具链(ncu/KernelPro),可直接用于 CUDA kernel 工程研究 |
| 后续行动 |
✅ 精读 → 对照 NVIDIA ncu 官方文档交叉核验;纳入"推理系统工程"主题页 |
2. arXiv:2606.26105 — "Context Recycling for Long-Horizon LLM Inference"
| 属性 |
内容 |
| arXiv ID |
2606.26105 |
| 方向 |
KV Cache 压缩 · Context 管理 · 长上下文推理 |
| 作者 |
Derek Thomas |
| 核心观点 |
研究长程 LLM 推理中的 context 回收与复用问题,目标是降低长序列下的显存和计算开销 |
| 工程价值亮点 |
⭐⭐⭐⭐ |
| - |
针对 KV Cache 长期痛点,有直接工程意义 |
| - |
与 vLLM PagedAttention / SGLang RadixAttention 直接相关 |
| 可信度 |
⭐⭐⭐⭐(cs.CL 顶会投稿水平) |
| 保留理由 |
与同日趋热的 Context Caching / Prefix Caching 话题高度相关,是 PagedAttention 的上游研究 |
| 后续行动 |
✅ 精读 → 对比 vLLM 0.7.x 的 prefix caching 实现源码 |
| 属性 |
内容 |
| arXiv ID |
2606.26875 |
| 方向 |
KV Cache 压缩 · 长推理优化 |
| 核心观点 |
对 KV Cache 做信息感知压缩,在长推理场景下降低显存占用同时保持质量 |
| 工程价值亮点 |
⭐⭐⭐⭐ |
| - |
与当前 vLLM/SGLang 的 KV Cache 管理策略直接竞争 |
| - |
工业界实用价值高(长 context = 高显存占用) |
| 可信度 |
⭐⭐⭐⭐(cs.CL 近期投稿) |
| 保留理由 |
精读可了解最新 KV Cache 压缩算法,与生产环境内存调优直接挂钩 |
| 后续行动 |
✅ 精读 → 对比 MorphLLM 2026 报告中 KV Cache 量化数据 |
4. ISO-Bench (arXiv:2602.19594) — "Can Coding Agents Optimize Real-World Inference Workloads?"
| 属性 |
内容 |
| arXiv ID |
2602.19594v1 |
| 方向 |
AI Coding Agent × Inference Engine 优化 |
| 核心观点 |
从 vLLM 和 SGLang 真实合并 PR 中提取 54 个优化任务,构建 ISO-Bench 评测基准。包含真实吞吐量/延迟 benchmark + 正确性测试。 |
| 工程价值亮点 |
⭐⭐⭐⭐⭐ |
| - |
54 个真实 vLLM/SGLang commit 优化任务,非合成数据 |
| - |
Dual evaluation framework(hard + soft metrics)区分真正成功和偶然胜出 |
| - |
数据集开源(Apache 2.0 / CC BY 4.0) |
| - |
每个任务含 repository snapshot + throughput/latency benchmark + correctness tests |
| 可信度 |
⭐⭐⭐⭐⭐(真实 commit 提取,可复现) |
| 保留理由 |
本次筛选最高价值工程数据集;是研究 vLLM/SGLang 内部优化机制的直接素材 |
| 后续行动 |
✅ 精读 + 下载数据集 → 纳入"AI 工程实践"主题页参考 |
5. inferenceengineering.tech — "Chapter 4: Software" — CUDA 体系结构工程入门
| 属性 |
内容 |
| URL |
https://inferenceengineering.tech/chapters/software |
| 方向 |
CUDA 基础 · 推理系统工程教育 |
| 核心观点 |
CUDA 四大组件(kernel / graph / driver / runtime)的工程级解释,非科普性质 |
| 工程价值亮点 |
⭐⭐⭐⭐ |
| - |
CUDA 不是编程语言,是 C++ → nvcc 编译为 CPU+GPU 分离代码 |
| - |
CUDA Graph:以 DAG 形式捕获多个 kernel 和 GPU 操作,减少 launch overhead |
| - |
推理工程师视角:CUDA 是生成式 AI 在 NVIDIA 硬件上的根基 |
| 可信度 |
⭐⭐⭐⭐(工程教科书体系,由 Philip Kiely 等作者维护) |
| 保留理由 |
推理工程基础扫盲必备,避免混淆 CUDA 编程模型和 PyTorch 抽象层 |
| 后续行动 |
✅ 纳入"推理工程基础"推荐阅读清单 |
6. NVIDIA trtllm-bench — 官方 Benchmark 命令行工程手册
| 属性 |
内容 |
| URL |
https://developer.nvidia.com/blog/llm-inference-benchmarking-performance-tuning-with-tensorrt-llm |
| 方向 |
TensorRT-LLM 生产级 Benchmark |
| 核心观点 |
trtllm-bench 是 TensorRT-LLM 内置 Python benchmark 工具,可直接测 model throughput/latency 而无需完整推理部署 |
| 工程价值亮点 |
⭐⭐⭐⭐⭐ |
| 真实命令示例(GPU 恢复默认设置) |
sudo nvidia-smi -rgc; sudo nvidia-smi -rmc |
| 真实命令示例(查询最大功率) |
nvidia-smi -q -d POWER |
| 真实命令示例(设置功率上限) |
nvidia-smi -i <gpu_id> -pl <power_limit> |
| 真实配置示例(llm_api_options.yml) |
cuda_graph_config: max_batch_size: 3840; padding_enabled: true |
| 可信度 |
⭐⭐⭐⭐⭐(NVIDIA 官方,2026 年更新) |
| 保留理由 |
完整的 GPU benchmark 端到端流程,含环境准备 → 数据集准备 → 并发配置 → 性能指标解读 |
| 后续行动 |
✅ 纳入"推理引擎 Benchmark 工具"主题页 |
7. Spheron — vLLM vs TensorRT-LLM vs SGLang H100 Benchmark(2026-06 实测)
| 属性 |
内容 |
| URL |
https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks |
| 方向 |
推理引擎横向评测 |
| 实测硬件 |
H100 80GB · Llama 3.3 70B Instruct FP8 |
| 实测命令 |
完整 benchmark 脚本(SGLang + vLLM) |
| 工程数据 |
⭐⭐⭐⭐⭐ |
| 实测结果 |
|
|
Engine |
|
vLLM |
|
TensorRT-LLM |
|
SGLang |
| 选型建议 |
vLLM = 通用首选;TensorRT-LLM = 单模型长期生产;SGLang = 共享 prefix / RAG / 多轮对话 |
| 可信度 |
⭐⭐⭐⭐(Spheron 2026-06-24 更新,含 Blackwell B200 补充数据) |
| 保留理由 |
2026 年 6 月最新 H100 实测数据,生产选型直接参考;含完整 benchmark 命令和环境配置 |
| 后续行动 |
✅ 纳入"推理引擎选型"主题页;对比同日 DeployBase 的 A100 数据 |
8. ByteByteGo Substack — "A Guide to AI Inference Engineering"(2026-06-15)
| 属性 |
内容 |
| URL |
https://blog.bytebytego.com/p/a-guide-to-ai-inference-engineering |
| 作者 |
ByteByteGo(Alex Xu 等)· 发行量 ~1,000,000 |
| 方向 |
Batching 原理 · Continuous Batching · 生产成本权衡 |
| 核心工程观点 |
|
| - |
Batching 的本质权衡:吞吐量上升 vs 单用户延迟上升 |
| - |
Continuous Batching = 迭代级动态插入/移除,GPU 满载,throughput 3-5x 提升 |
| - |
Prefill + Decode Mixing 同批次混合是生产级框架通用做法 |
| - |
PagedAttention(vLLM 发明)= OS page table 思路管理 KV Cache,2-4x 显存利用率提升 |
| 可信度 |
⭐⭐⭐⭐⭐(ByteByteGo 百万级发行,工程圈权威) |
| Substack 信息 |
作者:ByteByteGo · 发布:2026-06-15 · 222 次分享 |
| 保留理由 |
原理清晰 + 图表辅助,Continuous Batching 和 PagedAttention 的最佳科普工程文章 |
| 后续行动 |
✅ 纳入"推理工程基础"推荐;与 inferenceengineering.tech 教材互补 |
9. Pragmatic Engineer Substack — "What is inference engineering? Deep Dive"(2026-03-31)
| 属性 |
内容 |
| URL |
https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering |
| 作者 |
Gergely Orosz(Pragmatic Engineer)· Philip Kiely(《Inference Engineering》作者) |
| 方向 |
推理工程职业定义 · 技能树 · 行业现状 |
| 核心工程观点 |
|
| - |
推理工程师(Inference Engineer)= 从 CUDA 到 Kubernetes 全栈优化 |
| - |
推理现在是 AI 行业最有价值的子领域,但工程人才极度短缺 |
| - |
运行自有推理栈 = 控制权 + 定价权(vs OpenAI API) |
| - |
Philip Kiely 新书《Inference Engineering》可免费电子版下载 |
| 可信度 |
⭐⭐⭐⭐⭐(行业权威 newsletter + 书作者背书) |
| Substack 信息 |
作者:Gergely Orosz · 发布:2026-03-31 |
| 保留理由 |
推理工程职业认知必读,技能树梳理系统,与 Dennis Kennetz 课程互补 |
| 后续行动 |
✅ 纳入"AI 工程职业/技能"主题页;附 Philip Kiely 电子书链接 |
10. Dennis Kennetz Substack — "LLM Inference Curriculum"(2026-02-14)
| 属性 |
内容 |
| URL |
https://dkennetz.substack.com/p/llm-inference-curriculum |
| 方向 |
推理工程学习路径(Build It / Use It) |
| 核心工程观点 |
|
| - |
学习路径:CPU serving → GPU serving → 分布式推理 → 推理瓶颈定位 |
| - |
CPU serving 起步:huggingface transformers pipeline,本地运行,理解 batching 的本质 |
| - |
GPU 核心问题:显存有限(vs CPU 内存),disk → CPU RAM → GPU VRAM 的数据搬运不是免费的 |
| - |
每一步都要 benchmark:测 tokens/sec、TTFT、ITL,工具 prometheus + grafana |
| - |
"Build small, throw it away, build the next thing" |
| 可信度 |
⭐⭐⭐⭐(Dennis Kennetz · 工程教育者,有完整课程体系) |
| Substack 信息 |
作者:Dennis Kennetz · 发布:2026-02-14 |
| 保留理由 |
工程学习路径最佳实践,强调 benchmark-first 思维,适合作为团队内训参考 |
| 后续行动 |
✅ 纳入"推理工程学习路径"推荐 |
11. Spheron — torch.compile + CUDA Graphs 生产部署指南(2026-04)
| 属性 |
内容 |
| URL |
https://www.spheron.network/blog/torch-compile-cuda-graphs-llm-inference-pytorch-2-6 |
| 方向 |
PyTorch 2.6 生产推理优化 |
| 核心工程内容 |
|
| - |
torch.compile persistent Inductor cache:编译产物持久化到 NVMe,重启复用 |
| - |
Warm-up 两次:prefill shape 一次 + decode shape 一次,避免冷启动影响 |
| - |
Qwen 2.5 自定义 GQA attention:Dynamo 无法 trace → 升级 PyTorch 2.6 或 fallback regional compilation |
| - |
Graph Break 排查:Dynamo 遇到无法 trace 的操作 → eager mode fallback → fusion 失效 |
| 真实输出 |
torch._inductor: Compiling kernel: mm_default_0 / Compilation complete (35.2s) |
| 可信度 |
⭐⭐⭐⭐⭐(PyTorch 2.6 官方生产指南,2026-04-25 日期) |
| 保留理由 |
torch.compile 生产级部署避坑指南,有真实编译日志输出和故障排查路径 |
| 后续行动 |
✅ 精读 → 纳入"PyTorch 生产推理"主题页 |
12. DeployBase — vLLM vs SGLang vs TGI vs llama.cpp 全框架横向评测(含实测命令)
| 属性 |
内容 |
| URL |
https://deploybase.ai/articles/best-llm-inference-engine |
| 方向 |
推理引擎选型横向评测 |
| 核心工程亮点 |
|
| - |
完整 GCP A100 部署命令:gcloud compute instances create vllm-server ... --accelerator=type=nvidia-tesla-a100 |
| - |
llama.cpp GPU offload 命令:-ngl 80(加载 80 层到 GPU) |
| - |
llama.cpp CPU 多线程:./main -m model.gguf -t 16 |
| - |
TGI bfloat16:docker run -e HF_MODEL_QUANTIZE=bfloat16 → A100/H100 10-15% 提升 |
| - |
高可用 vLLM 架构:多区域 + 负载均衡,$29.16/hr 成本估算 |
| 可信度 |
⭐⭐⭐⭐(含命令可复现,但 benchmark 数据需实测验证) |
| 保留理由 |
命令级实操参考,llama.cpp 资源受限场景命令实用 |
| 后续行动 |
✅ 纳入"推理引擎命令行参考"主题页 |
13. vLLM 官方 Blog — 2026 年 6 月更新摘要
| 属性 |
内容 |
| URL |
https://vllm.ai/blog |
| 方向 |
vLLM 最新功能跟踪 |
| 6 月新增 |
|
| - |
Session-Aware Agentic Routing(vLLM Semantic Router v0.2):长程 agent 上下文连续性路由 |
| - |
NVIDIA Nemotron 3 Ultra:BF16 + NVFP4 checkpoint,NeMo RL 集成,1M token context |
| - |
DeepSeek-V3.2 on GB300:NVFP4 量化,TP+EP 部署,GB300 实测 |
| - |
P-EAGLE:Parallel Speculative Decoding,单次 forward 多个 draft token,B200 提速 |
| - |
Multi-LoRA:fused MoE LoRA kernels,支持 SageMaker AI + Bedrock |
| 可信度 |
⭐⭐⭐⭐⭐(vLLM 官方) |
| 保留理由 |
vLLM 生产环境 2026-Q2 最新能力清单,直接影响选型决策 |
| 后续行动 |
✅ 纳入"vLLM 版本跟踪"主题页 |
丢弃条目(❌ 无工程细节/无可复现步骤)
| 条目 |
丢弃理由 |
| MorphLLM "LLM Inference Optimization: Cut Cost & Latency at Every Layer" |
引擎对比数据与 Spheron 报告重叠,无独立命令/源码 |
| Spheron "What Is Inference Engineering?" |
与 ByteByteGo / Pragmatic Engineer 内容高度重叠,无新工程细节 |
| LinkedIn "What Is an Inference Engineer" |
职业介绍性质,无技术深度 |
| Medium "LLM Inference Optimization in Production" |
框架概述,无实测 benchmark 命令 |
| YouTube "Maximize LLM Inference Performance" |
视频内容,无法提取工程命令 |
| DeepLearning.AI vLLM 课程(YouTube) |
课程推广,无独立工程内容,含链接需翻页访问 |
| Lyceum "vLLM Production Deployment" |
欧洲主权云营销文,无独立命令/benchmark 数据 |
与今日已有草稿去重说明
| 已有草稿 |
本次新增补充 |
去重结果 |
2026-06-29-ai-engineering-backend-db.md |
✅ 新增:ISO-Bench · arXiv CUDA profiling · trtllm-bench 命令 |
未重复 |
2026-06-29-csdn-rag-agent-mcp-inference-highvalue.md |
✅ 新增:vLLM/SGLang benchmark 对比(Spheron) |
未重复 |
2026-06-29-1000-rss-simon-willison.md |
✅ 新增:Substack 工程实践(ByteByteGo 等 3 个) |
未重复 |
分类标签
LLM推理工程 | CUDA Profiling | Nsight Compute | torch.compile | torch inductor | CUDA Graphs | vLLM | SGLang | TensorRT-LLM | llama.cpp | PagedAttention | RadixAttention | Continuous Batching | KV Cache | Speculative Decoding | ISO-Bench | arXiv工程 | 生产Benchmark | trtllm-bench | NVIDIA | Blackwell | H100 | 推理引擎选型 | 工程学习路径 | Substack工程实践
建议写入路径
- 草稿路径:
/shared/research-kb/inbox/jay/2026-06-29-engineering-filter-inference-profiling-commands.md
- 状态:✅ 已写入
后续行动建议
| 优先级 |
行动 |
说明 |
| 🔴 P1 |
精读 ISO-Bench(arXiv:2602.19594) |
54 个真实 vLLM/SGLang 优化任务,生产级参考 |
| 🔴 P1 |
精读 arXiv:2606.26453 |
CUDA ncu profiling 工程方法论 |
| 🟡 P2 |
精读 Spheron torch.compile + CUDA Graphs 指南 |
PyTorch 2.6 生产避坑 |
| 🟡 P2 |
精读 vLLM 官方 Blog 6 月更新 |
Session-Aware Routing / P-EAGLE / DeepSeek-V3.2 |
| 🟡 P2 |
精读 ByteByteGo + Pragmatic Engineer Substack |
工程科普 + 职业认知 |
| 🟢 P3 |
对比 Spheron H100 Benchmark vs DeployBase A100 数据 |
完善推理引擎选型矩阵 |
| 🟢 P3 |
下载 ISO-Bench 数据集 |
纳入"AI 工程实践"知识库 |
Jay · 2026-06-29 10:50 CST · 工程实践筛选 · 第3次高频运营