工程实践筛选报告 · 2026-06-29 · Jay

主题

LLM 推理工程实践:CUDA Profiling / 命令行 Benchmark / 生产部署实测

检索范围

  • arXiv cs.CL / cs.LG / cs.SE(2026-06 新文)
  • Substack:ByteByteGo · Dennis Kennetz · Pragmatic Engineer · BoringBot
  • 官方工程文档:NVIDIA trtllm-bench · vLLM docs · inferenceengineering.tech
  • 工程博客:Spheron · SitePoint · DeployBase · MorphLLM

保留条目(✅ 含真实环境/命令/源码/性能数据)

🔴 高工程价值


1. arXiv:2606.26453 — "Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization"

属性 内容
arXiv ID 2606.26453v1
方向 CUDA Profiling + LLM Kernel 优化工程
核心观点 LLM Agent 可使用 NVIDIA Nsight Compute (ncu) 微分级 profiling 数据辅助 CUDA kernel 优化,而非仅靠端到端 timing。提出了 KernelPro 系统,使用 roofline 分析 + 结构化瓶颈输出。
工程价值亮点 ⭐⭐⭐⭐⭐
- 比纯端到端 timing 的 LLM kernel 优化方案更进一步
- 实测包含 ncu metrics(memory-bound vs compute-bound 分类)
- 与 GrepSeek (Salemi et al., 2026) 独立得出相同结论:可执行搜索 > 索引检索
- MCTS UCT 树搜索用于 CUDA kernel 优化,与 OptiML (Bhattacharjee et al., 2026) 收敛
可信度 ⭐⭐⭐⭐(arXiv 预印本,有真实 benchmark)
保留理由 有完整 profiling → 分析 → 优化闭环,含实测工具链(ncu/KernelPro),可直接用于 CUDA kernel 工程研究
后续行动 ✅ 精读 → 对照 NVIDIA ncu 官方文档交叉核验;纳入"推理系统工程"主题页

2. arXiv:2606.26105 — "Context Recycling for Long-Horizon LLM Inference"

属性 内容
arXiv ID 2606.26105
方向 KV Cache 压缩 · Context 管理 · 长上下文推理
作者 Derek Thomas
核心观点 研究长程 LLM 推理中的 context 回收与复用问题,目标是降低长序列下的显存和计算开销
工程价值亮点 ⭐⭐⭐⭐
- 针对 KV Cache 长期痛点,有直接工程意义
- 与 vLLM PagedAttention / SGLang RadixAttention 直接相关
可信度 ⭐⭐⭐⭐(cs.CL 顶会投稿水平)
保留理由 与同日趋热的 Context Caching / Prefix Caching 话题高度相关,是 PagedAttention 的上游研究
后续行动 ✅ 精读 → 对比 vLLM 0.7.x 的 prefix caching 实现源码

3. arXiv:2606.26875 — "Information-Aware KV Cache Compression for Long Reasoning"

属性 内容
arXiv ID 2606.26875
方向 KV Cache 压缩 · 长推理优化
核心观点 对 KV Cache 做信息感知压缩,在长推理场景下降低显存占用同时保持质量
工程价值亮点 ⭐⭐⭐⭐
- 与当前 vLLM/SGLang 的 KV Cache 管理策略直接竞争
- 工业界实用价值高(长 context = 高显存占用)
可信度 ⭐⭐⭐⭐(cs.CL 近期投稿)
保留理由 精读可了解最新 KV Cache 压缩算法,与生产环境内存调优直接挂钩
后续行动 ✅ 精读 → 对比 MorphLLM 2026 报告中 KV Cache 量化数据

4. ISO-Bench (arXiv:2602.19594) — "Can Coding Agents Optimize Real-World Inference Workloads?"

属性 内容
arXiv ID 2602.19594v1
方向 AI Coding Agent × Inference Engine 优化
核心观点 从 vLLM 和 SGLang 真实合并 PR 中提取 54 个优化任务,构建 ISO-Bench 评测基准。包含真实吞吐量/延迟 benchmark + 正确性测试。
工程价值亮点 ⭐⭐⭐⭐⭐
- 54 个真实 vLLM/SGLang commit 优化任务,非合成数据
- Dual evaluation framework(hard + soft metrics)区分真正成功和偶然胜出
- 数据集开源(Apache 2.0 / CC BY 4.0)
- 每个任务含 repository snapshot + throughput/latency benchmark + correctness tests
可信度 ⭐⭐⭐⭐⭐(真实 commit 提取,可复现)
保留理由 本次筛选最高价值工程数据集;是研究 vLLM/SGLang 内部优化机制的直接素材
后续行动 ✅ 精读 + 下载数据集 → 纳入"AI 工程实践"主题页参考

5. inferenceengineering.tech — "Chapter 4: Software" — CUDA 体系结构工程入门

属性 内容
URL https://inferenceengineering.tech/chapters/software
方向 CUDA 基础 · 推理系统工程教育
核心观点 CUDA 四大组件(kernel / graph / driver / runtime)的工程级解释,非科普性质
工程价值亮点 ⭐⭐⭐⭐
- CUDA 不是编程语言,是 C++ → nvcc 编译为 CPU+GPU 分离代码
- CUDA Graph:以 DAG 形式捕获多个 kernel 和 GPU 操作,减少 launch overhead
- 推理工程师视角:CUDA 是生成式 AI 在 NVIDIA 硬件上的根基
可信度 ⭐⭐⭐⭐(工程教科书体系,由 Philip Kiely 等作者维护)
保留理由 推理工程基础扫盲必备,避免混淆 CUDA 编程模型和 PyTorch 抽象层
后续行动 ✅ 纳入"推理工程基础"推荐阅读清单

6. NVIDIA trtllm-bench — 官方 Benchmark 命令行工程手册

属性 内容
URL https://developer.nvidia.com/blog/llm-inference-benchmarking-performance-tuning-with-tensorrt-llm
方向 TensorRT-LLM 生产级 Benchmark
核心观点 trtllm-bench 是 TensorRT-LLM 内置 Python benchmark 工具,可直接测 model throughput/latency 而无需完整推理部署
工程价值亮点 ⭐⭐⭐⭐⭐
真实命令示例(GPU 恢复默认设置) sudo nvidia-smi -rgc; sudo nvidia-smi -rmc
真实命令示例(查询最大功率) nvidia-smi -q -d POWER
真实命令示例(设置功率上限) nvidia-smi -i <gpu_id> -pl <power_limit>
真实配置示例(llm_api_options.yml) cuda_graph_config: max_batch_size: 3840; padding_enabled: true
可信度 ⭐⭐⭐⭐⭐(NVIDIA 官方,2026 年更新)
保留理由 完整的 GPU benchmark 端到端流程,含环境准备 → 数据集准备 → 并发配置 → 性能指标解读
后续行动 ✅ 纳入"推理引擎 Benchmark 工具"主题页

7. Spheron — vLLM vs TensorRT-LLM vs SGLang H100 Benchmark(2026-06 实测)

属性 内容
URL https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks
方向 推理引擎横向评测
实测硬件 H100 80GB · Llama 3.3 70B Instruct FP8
实测命令 完整 benchmark 脚本(SGLang + vLLM)
工程数据 ⭐⭐⭐⭐⭐
实测结果
Engine
vLLM
TensorRT-LLM
SGLang
选型建议 vLLM = 通用首选;TensorRT-LLM = 单模型长期生产;SGLang = 共享 prefix / RAG / 多轮对话
可信度 ⭐⭐⭐⭐(Spheron 2026-06-24 更新,含 Blackwell B200 补充数据)
保留理由 2026 年 6 月最新 H100 实测数据,生产选型直接参考;含完整 benchmark 命令和环境配置
后续行动 ✅ 纳入"推理引擎选型"主题页;对比同日 DeployBase 的 A100 数据

8. ByteByteGo Substack — "A Guide to AI Inference Engineering"(2026-06-15)

属性 内容
URL https://blog.bytebytego.com/p/a-guide-to-ai-inference-engineering
作者 ByteByteGo(Alex Xu 等)· 发行量 ~1,000,000
方向 Batching 原理 · Continuous Batching · 生产成本权衡
核心工程观点
- Batching 的本质权衡:吞吐量上升 vs 单用户延迟上升
- Continuous Batching = 迭代级动态插入/移除,GPU 满载,throughput 3-5x 提升
- Prefill + Decode Mixing 同批次混合是生产级框架通用做法
- PagedAttention(vLLM 发明)= OS page table 思路管理 KV Cache,2-4x 显存利用率提升
可信度 ⭐⭐⭐⭐⭐(ByteByteGo 百万级发行,工程圈权威)
Substack 信息 作者:ByteByteGo · 发布:2026-06-15 · 222 次分享
保留理由 原理清晰 + 图表辅助,Continuous Batching 和 PagedAttention 的最佳科普工程文章
后续行动 ✅ 纳入"推理工程基础"推荐;与 inferenceengineering.tech 教材互补

9. Pragmatic Engineer Substack — "What is inference engineering? Deep Dive"(2026-03-31)

属性 内容
URL https://newsletter.pragmaticengineer.com/p/what-is-inference-engineering
作者 Gergely Orosz(Pragmatic Engineer)· Philip Kiely(《Inference Engineering》作者)
方向 推理工程职业定义 · 技能树 · 行业现状
核心工程观点
- 推理工程师(Inference Engineer)= 从 CUDA 到 Kubernetes 全栈优化
- 推理现在是 AI 行业最有价值的子领域,但工程人才极度短缺
- 运行自有推理栈 = 控制权 + 定价权(vs OpenAI API)
- Philip Kiely 新书《Inference Engineering》可免费电子版下载
可信度 ⭐⭐⭐⭐⭐(行业权威 newsletter + 书作者背书)
Substack 信息 作者:Gergely Orosz · 发布:2026-03-31
保留理由 推理工程职业认知必读,技能树梳理系统,与 Dennis Kennetz 课程互补
后续行动 ✅ 纳入"AI 工程职业/技能"主题页;附 Philip Kiely 电子书链接

10. Dennis Kennetz Substack — "LLM Inference Curriculum"(2026-02-14)

属性 内容
URL https://dkennetz.substack.com/p/llm-inference-curriculum
方向 推理工程学习路径(Build It / Use It)
核心工程观点
- 学习路径:CPU serving → GPU serving → 分布式推理 → 推理瓶颈定位
- CPU serving 起步:huggingface transformers pipeline,本地运行,理解 batching 的本质
- GPU 核心问题:显存有限(vs CPU 内存),disk → CPU RAM → GPU VRAM 的数据搬运不是免费的
- 每一步都要 benchmark:测 tokens/sec、TTFT、ITL,工具 prometheus + grafana
- "Build small, throw it away, build the next thing"
可信度 ⭐⭐⭐⭐(Dennis Kennetz · 工程教育者,有完整课程体系)
Substack 信息 作者:Dennis Kennetz · 发布:2026-02-14
保留理由 工程学习路径最佳实践,强调 benchmark-first 思维,适合作为团队内训参考
后续行动 ✅ 纳入"推理工程学习路径"推荐

11. Spheron — torch.compile + CUDA Graphs 生产部署指南(2026-04)

属性 内容
URL https://www.spheron.network/blog/torch-compile-cuda-graphs-llm-inference-pytorch-2-6
方向 PyTorch 2.6 生产推理优化
核心工程内容
- torch.compile persistent Inductor cache:编译产物持久化到 NVMe,重启复用
- Warm-up 两次:prefill shape 一次 + decode shape 一次,避免冷启动影响
- Qwen 2.5 自定义 GQA attention:Dynamo 无法 trace → 升级 PyTorch 2.6 或 fallback regional compilation
- Graph Break 排查:Dynamo 遇到无法 trace 的操作 → eager mode fallback → fusion 失效
真实输出 torch._inductor: Compiling kernel: mm_default_0 / Compilation complete (35.2s)
可信度 ⭐⭐⭐⭐⭐(PyTorch 2.6 官方生产指南,2026-04-25 日期)
保留理由 torch.compile 生产级部署避坑指南,有真实编译日志输出和故障排查路径
后续行动 ✅ 精读 → 纳入"PyTorch 生产推理"主题页

12. DeployBase — vLLM vs SGLang vs TGI vs llama.cpp 全框架横向评测(含实测命令)

属性 内容
URL https://deploybase.ai/articles/best-llm-inference-engine
方向 推理引擎选型横向评测
核心工程亮点
- 完整 GCP A100 部署命令:gcloud compute instances create vllm-server ... --accelerator=type=nvidia-tesla-a100
- llama.cpp GPU offload 命令:-ngl 80(加载 80 层到 GPU)
- llama.cpp CPU 多线程:./main -m model.gguf -t 16
- TGI bfloat16:docker run -e HF_MODEL_QUANTIZE=bfloat16 → A100/H100 10-15% 提升
- 高可用 vLLM 架构:多区域 + 负载均衡,$29.16/hr 成本估算
可信度 ⭐⭐⭐⭐(含命令可复现,但 benchmark 数据需实测验证)
保留理由 命令级实操参考,llama.cpp 资源受限场景命令实用
后续行动 ✅ 纳入"推理引擎命令行参考"主题页

13. vLLM 官方 Blog — 2026 年 6 月更新摘要

属性 内容
URL https://vllm.ai/blog
方向 vLLM 最新功能跟踪
6 月新增
- Session-Aware Agentic Routing(vLLM Semantic Router v0.2):长程 agent 上下文连续性路由
- NVIDIA Nemotron 3 Ultra:BF16 + NVFP4 checkpoint,NeMo RL 集成,1M token context
- DeepSeek-V3.2 on GB300:NVFP4 量化,TP+EP 部署,GB300 实测
- P-EAGLE:Parallel Speculative Decoding,单次 forward 多个 draft token,B200 提速
- Multi-LoRA:fused MoE LoRA kernels,支持 SageMaker AI + Bedrock
可信度 ⭐⭐⭐⭐⭐(vLLM 官方)
保留理由 vLLM 生产环境 2026-Q2 最新能力清单,直接影响选型决策
后续行动 ✅ 纳入"vLLM 版本跟踪"主题页

丢弃条目(❌ 无工程细节/无可复现步骤)

条目 丢弃理由
MorphLLM "LLM Inference Optimization: Cut Cost & Latency at Every Layer" 引擎对比数据与 Spheron 报告重叠,无独立命令/源码
Spheron "What Is Inference Engineering?" 与 ByteByteGo / Pragmatic Engineer 内容高度重叠,无新工程细节
LinkedIn "What Is an Inference Engineer" 职业介绍性质,无技术深度
Medium "LLM Inference Optimization in Production" 框架概述,无实测 benchmark 命令
YouTube "Maximize LLM Inference Performance" 视频内容,无法提取工程命令
DeepLearning.AI vLLM 课程(YouTube) 课程推广,无独立工程内容,含链接需翻页访问
Lyceum "vLLM Production Deployment" 欧洲主权云营销文,无独立命令/benchmark 数据

与今日已有草稿去重说明

已有草稿 本次新增补充 去重结果
2026-06-29-ai-engineering-backend-db.md ✅ 新增:ISO-Bench · arXiv CUDA profiling · trtllm-bench 命令 未重复
2026-06-29-csdn-rag-agent-mcp-inference-highvalue.md ✅ 新增:vLLM/SGLang benchmark 对比(Spheron) 未重复
2026-06-29-1000-rss-simon-willison.md ✅ 新增:Substack 工程实践(ByteByteGo 等 3 个) 未重复

分类标签

LLM推理工程 | CUDA Profiling | Nsight Compute | torch.compile | torch inductor | CUDA Graphs | vLLM | SGLang | TensorRT-LLM | llama.cpp | PagedAttention | RadixAttention | Continuous Batching | KV Cache | Speculative Decoding | ISO-Bench | arXiv工程 | 生产Benchmark | trtllm-bench | NVIDIA | Blackwell | H100 | 推理引擎选型 | 工程学习路径 | Substack工程实践

建议写入路径

  • 草稿路径/shared/research-kb/inbox/jay/2026-06-29-engineering-filter-inference-profiling-commands.md
  • 状态:✅ 已写入

后续行动建议

优先级 行动 说明
🔴 P1 精读 ISO-Bench(arXiv:2602.19594) 54 个真实 vLLM/SGLang 优化任务,生产级参考
🔴 P1 精读 arXiv:2606.26453 CUDA ncu profiling 工程方法论
🟡 P2 精读 Spheron torch.compile + CUDA Graphs 指南 PyTorch 2.6 生产避坑
🟡 P2 精读 vLLM 官方 Blog 6 月更新 Session-Aware Routing / P-EAGLE / DeepSeek-V3.2
🟡 P2 精读 ByteByteGo + Pragmatic Engineer Substack 工程科普 + 职业认知
🟢 P3 对比 Spheron H100 Benchmark vs DeployBase A100 数据 完善推理引擎选型矩阵
🟢 P3 下载 ISO-Bench 数据集 纳入"AI 工程实践"知识库

Jay · 2026-06-29 10:50 CST · 工程实践筛选 · 第3次高频运营