Jay 工程实践筛选 · 2026-06-29 第三次

筛选时间: 2026-06-29 18:50 (SGT) 检索范围: arXiv cs.AI/cs.LG、新增 Substack 文章、DevOpsBeast、vLLM/SGLang 官方文档、CSDN 工程实践


本次主题

inference 系统工程:AI 生成 Kernel / GPU 调度 / vLLM SGLang 生产排障


候选条目(8个)

1. FlashInfer-Bench(arXiv:2601.00227)- 保留 ✓

来源: arXiv cs.AI | GitHub: flashinfer-ai/flashinfer-bench-starter-kit | FlashInfer 官方博客 工程价值判断:

  • 真实环境: 基于真实 LLM 推理负载 trace,支持 SGLang / vLLM 集成
  • 源码: GitHub 有完整 starter kit,含 Triton kernel.py / CUDA kernel.cu 模板
  • 性能数据: 3-phase virtuous cycle: kernel 生成 → benchmark → 部署;支持 leaderboard 排名
  • 可复现步骤: config.toml 配置 track,python test.py 本地验证,submit 提交
  • MLSys 2026 Contest: NVIDIA Blackwell GPU,MoE / Sparse Attention / Gated Delta Net 三个赛道,AI agent 可参赛

保留理由: 首个将 AI kernel 生成 → 评测 → 生产部署形成闭环的标准化框架,有完整命令、schema、源码和 contest;工程价值极高,与 SGLang/vLLM 生产部署直接相关。

标签: GPU Kernel / AI Agent / SGLang / vLLM / MLSys2026 / Benchmarking 建议写入路径: inference-systems/flashinfer-bench-kernel-generation.md 需精读/审稿: 需 PDF 深度读 + GitHub 源码走读


2. APEX: Asynchronous Parallel CPU-GPU Execution(arXiv:2506.03296)- 保留 ✓

来源: arXiv cs.AI | Virginia Tech 工程价值判断:

  • 性能数据: T4 GPU 提升 49%、A10 提升 37%(长输出场景);vs GPU-only 调度器(vLLM)提升 84-96%(T4)和 11-89%(A10)
  • 真实环境: Llama-2-7B 和 Llama-3.1-8B 在 NVIDIA T4/A10 实测
  • 核心机制: profiling-informed scheduling + Asymmetric Pipelining,无 batch splitting;重叠系数公式:$T_{gpuonly} = T_{glinear} + T_{gatt}$
  • 源码: 预计有开源实现(待核验)

保留理由: 首个在 constrained GPU 场景实现细粒度 CPU offloading 且无需 batch splitting 的调度器;数字具体(49%、37%),有明确公式和测试环境;填补了 hybrid CPU-GPU 推理调度空白。

标签: CPU-GPU Hybrid / KV Cache Offloading / Scheduler / T4 / A10 / Profiling 建议写入路径: inference-systems/apex-cpu-gpu-scheduling.md 需精读/审稿: 需 PDF 核验源码和调度算法细节


3. CudaForge: Multi-Agent CUDA Kernel Optimization(OpenReview / arXiv:2511.01884)- 保留 ✓

来源: OpenReview ICLR-style | GitHub | arXiv:2511.01884 工程价值判断:

  • 源码: Coder Agent + Judge Agent 双循环,Coder 生成 CUDA/Triton kernel,Judge 分析 NCU 指标并给出优化指令
  • 工具: Nsight Compute (NCU) 性能分析反馈
  • 性能数据: 97.6% correctness,avg 1.68× speedup over PyTorch baselines;超越 OpenAI-o3 和 Kevin on KernelBench
  • 真实环境: 跨 GPU 型号和模型泛化性验证

保留理由: 多 agent 工作流在 CUDA kernel 优化领域的最佳工程实践之一;有明确工具链(NCU)、双 agent 角色分工、硬件反馈闭环;与 FlashInfer-Bench 形成"AI 写 kernel + AI 优化 kernel"的完整生态叙事。

标签: CUDA / Multi-Agent / Nsight Compute / Kernel Optimization / Code Generation 建议写入路径: gpu-engineering/cudaforge-multiagent-kernel-optimization.md 需精读/审稿: 需 PDF 读 Agent 提示词工程和 feedback loop 细节


4. DevOpsBeast: vLLM vs SGLang 生产对比 2026 - 保留 ✓

来源: https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 工程价值判断:

  • 生产决策框架: 4 问题 5 分钟决策(workload shape / structured output / hardware / team maturity)
  • Benchmark 误区: 强调 TTFT p50/p95/p99 真实并发,而非 max throughput;强调 prefix-cache hit rate 是关键轴
  • 真实案例: 某团队从 vLLM 迁移 agent pool 到 SGLang,prefix hit rate 18% → 71%,TTFT 1.4s → 380ms,GPU 数量 12 → 5,账单降 28%
  • 常见错误: 7 条,包含"用合成 prompt 跑 benchmark"、"优化 max throughput 而非 latency SLO"、"单一引擎偏执"
  • 具体命令/参数: gpu_memory_utilization、chunked-prefill-size、max_running_requests 等

保留理由: 2026 生产视角最完整的 vLLM vs SGLang 对比;有具体数字、真实 war story、决策框架工程价值极高;与今日 inference 工程筛选主题强相关。

标签: vLLM / SGLang / Production / Benchmark / Decision Framework / Prefix Cache 建议写入路径: inference-systems/vllm-vs-sglang-production-2026.md 需精读: 是(原文高质量,建议整读)


5. vLLM 官方 Troubleshooting 文档 - 保留 ✓

来源: https://docs.vllm.ai/en/latest/usage/troubleshooting/ 工程价值判断:

  • 真实错误模式: torch.compile Error / Model failed to inspect / NCCL error / CUDA PTX unsupported toolchain / ptxas fatal sm_110a / Python multiprocessing
  • Architecture docs: CUDA Graphs、CustomOp、Dual Batch Overlap、torch.compile integration、Paged Attention、Automatic Prefix Caching
  • Design docs: vLLM IR、Hybrid KV Cache Manager、Model Runner V2、NIXL KV transfer
  • 具体参数: --load-format dummy 排查模型加载;NCCL_DEBUG=INFO 排查 NCCL

保留理由: vLLM 官方排障文档,每次生产事故必查;Architecture/Design 文档是理解 vLLM 内部机制最权威来源;已覆盖 torch.compile error、OOM、NCCL、CUDA error 等主要错误类。

标签: vLLM / Troubleshooting / CUDA / NCCL / Production / Documentation 建议写入路径: inference-systems/vllm-troubleshooting-2026.md 需精读: Architecture docs(按需)


6. SGLang Troubleshooting(Mintlify)- 保留 ✓

来源: https://sgl-project-sglang-93.mintlify.app/resources/troubleshooting 工程价值判断:

  • CUDA OOM during prefill: 具体命令 python -m sglang.launch_server --model-path ... --chunked-prefill-size 4096 --max-running-requests 128
  • CUDA Error: Illegal Memory Access: 内核错误
  • Memory Pool Size / The Server Hangs: 初始化和运行中内存问题
  • Tensor Parallelism Errors / Quantization Issues / Multimodal Errors: 均有独立章节
  • FAQ: https://sgl-project.github.io/references/faq.html

保留理由: SGLang 官方排障文档,与 vLLM 排障文档互为镜像;prefill OOM 的 --chunked-prefill-size 参数是生产高频调优点;多 GPU 和量化问题有专门章节。

标签: SGLang / Troubleshooting / CUDA OOM / Prefill / Production 建议写入路径: inference-systems/sglang-troubleshooting-2026.md 需精读: FAQ 部分(按需)


7. Sector88: vLLM OOM 完整检查清单 2026 - 保留 ✓

来源: https://www.sector88.co/blog/how-to-fix-vllm-oom 工程价值判断:

  • 4 大 OOM 原因框架: ① 模型不适用当前精度 ② KV cache 爆炸(max_model_len 设置过高)③ gpu_memory_utilization 过高 ④ 突发并发
  • CPU OOM vs GPU OOM 区分: Exit Code 137(OOMKilled)vs torch.cuda.OutOfMemoryError
  • Kubernetes 资源配置公式: 8B → 16-24Gi;13B → 24-32Gi;70B → 48-64Gi(CPU memory);GPU memory 另算
  • KV cache 调优: max_model_len 设到实际峰值而非理论峰值

保留理由: 最系统的 vLLM OOM 排障指南;有具体内存数字、K8s resource 配置示例、4 原因框架;与 vLLM/SGLang 排障主题高度重叠但角度更教学化。

标签: vLLM / OOM / Kubernetes / Memory / KV Cache / Production 建议写入路径: inference-systems/vllm-oom-checklist-2026.md 需精读: 可选(工程师实操参考)


8. CSDN 高价值工程文章筛选 - 降级收录 ↓

判断: 本次 CSDN 未发现新增独立高价值文章(与前两轮重复)。相关工程内容已由 DevOpsBeast + 官方文档覆盖。

决策: 不单独成篇,相关引用合并到上方条目。


汇总

序号 条目 决策 理由摘要 标签
1 FlashInfer-Bench 保留 AI kernel 闭环,有源码/命令/MLSys2026 contest GPU Kernel / AI Agent / SGLang / vLLM
2 APEX 保留 CPU-GPU 混合调度,49%/37% 提升,公式具体 CPU-GPU Hybrid / Scheduler / T4 / A10
3 CudaForge 保留 多 agent CUDA 优化,NCU 反馈,97.6% correctness CUDA / Multi-Agent / Nsight Compute
4 DevOpsBeast vLLM vs SGLang 保留 2026 最完整生产对比,4 问决策框架,war story 有数字 vLLM / SGLang / Production / Benchmark
5 vLLM Troubleshooting 保留 官方排障文档,真实错误模式,Architecture docs vLLM / Troubleshooting / CUDA / NCCL
6 SGLang Troubleshooting 保留 官方排障文档,prefill OOM 具体命令 SGLang / Troubleshooting / CUDA OOM
7 Sector88 vLLM OOM 保留 4 原因框架,K8s 内存配置公式 vLLM / OOM / Kubernetes / Memory
8 CSDN 补充 降级 本轮无独立新增,并入上方条目

高优先级主题页更新建议

  • Inference Systems 主题页: 建议增加 FlashInfer-Bench + CudaForge 作为"AI 写 kernel + AI 优化 kernel"叙事单元;APEX 作为"constrained GPU 调度"最新代表
  • vLLM / SGLang 主题页: DevOpsBeast 的 4 问决策框架值得引用;vLLM/SGLang Troubleshooting 文档应作为固定参考资源

输出文件: /shared/research-kb/inbox/jay/2026-06-29-1850-engineering-filter-flashinfer-cudaforge-apex-vllm-sglang-production.md 本轮写入: ✅ 是(本文档) GitHub 写入: ❌ 未执行(遵守规则)