Jay 工程实践筛选 · 2026-06-29 第三次
筛选时间: 2026-06-29 18:50 (SGT) 检索范围: arXiv cs.AI/cs.LG、新增 Substack 文章、DevOpsBeast、vLLM/SGLang 官方文档、CSDN 工程实践
本次主题
inference 系统工程:AI 生成 Kernel / GPU 调度 / vLLM SGLang 生产排障
候选条目(8个)
1. FlashInfer-Bench(arXiv:2601.00227)- 保留 ✓
来源: arXiv cs.AI | GitHub: flashinfer-ai/flashinfer-bench-starter-kit | FlashInfer 官方博客 工程价值判断:
- 真实环境: 基于真实 LLM 推理负载 trace,支持 SGLang / vLLM 集成
- 源码: GitHub 有完整 starter kit,含 Triton kernel.py / CUDA kernel.cu 模板
- 性能数据: 3-phase virtuous cycle: kernel 生成 → benchmark → 部署;支持 leaderboard 排名
- 可复现步骤:
config.toml配置 track,python test.py本地验证,submit提交 - MLSys 2026 Contest: NVIDIA Blackwell GPU,MoE / Sparse Attention / Gated Delta Net 三个赛道,AI agent 可参赛
保留理由: 首个将 AI kernel 生成 → 评测 → 生产部署形成闭环的标准化框架,有完整命令、schema、源码和 contest;工程价值极高,与 SGLang/vLLM 生产部署直接相关。
标签: GPU Kernel / AI Agent / SGLang / vLLM / MLSys2026 / Benchmarking
建议写入路径: inference-systems/flashinfer-bench-kernel-generation.md
需精读/审稿: 需 PDF 深度读 + GitHub 源码走读
2. APEX: Asynchronous Parallel CPU-GPU Execution(arXiv:2506.03296)- 保留 ✓
来源: arXiv cs.AI | Virginia Tech 工程价值判断:
- 性能数据: T4 GPU 提升 49%、A10 提升 37%(长输出场景);vs GPU-only 调度器(vLLM)提升 84-96%(T4)和 11-89%(A10)
- 真实环境: Llama-2-7B 和 Llama-3.1-8B 在 NVIDIA T4/A10 实测
- 核心机制: profiling-informed scheduling + Asymmetric Pipelining,无 batch splitting;重叠系数公式:$T_{gpuonly} = T_{glinear} + T_{gatt}$
- 源码: 预计有开源实现(待核验)
保留理由: 首个在 constrained GPU 场景实现细粒度 CPU offloading 且无需 batch splitting 的调度器;数字具体(49%、37%),有明确公式和测试环境;填补了 hybrid CPU-GPU 推理调度空白。
标签: CPU-GPU Hybrid / KV Cache Offloading / Scheduler / T4 / A10 / Profiling
建议写入路径: inference-systems/apex-cpu-gpu-scheduling.md
需精读/审稿: 需 PDF 核验源码和调度算法细节
3. CudaForge: Multi-Agent CUDA Kernel Optimization(OpenReview / arXiv:2511.01884)- 保留 ✓
来源: OpenReview ICLR-style | GitHub | arXiv:2511.01884 工程价值判断:
- 源码: Coder Agent + Judge Agent 双循环,Coder 生成 CUDA/Triton kernel,Judge 分析 NCU 指标并给出优化指令
- 工具: Nsight Compute (NCU) 性能分析反馈
- 性能数据: 97.6% correctness,avg 1.68× speedup over PyTorch baselines;超越 OpenAI-o3 和 Kevin on KernelBench
- 真实环境: 跨 GPU 型号和模型泛化性验证
保留理由: 多 agent 工作流在 CUDA kernel 优化领域的最佳工程实践之一;有明确工具链(NCU)、双 agent 角色分工、硬件反馈闭环;与 FlashInfer-Bench 形成"AI 写 kernel + AI 优化 kernel"的完整生态叙事。
标签: CUDA / Multi-Agent / Nsight Compute / Kernel Optimization / Code Generation
建议写入路径: gpu-engineering/cudaforge-multiagent-kernel-optimization.md
需精读/审稿: 需 PDF 读 Agent 提示词工程和 feedback loop 细节
4. DevOpsBeast: vLLM vs SGLang 生产对比 2026 - 保留 ✓
来源: https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 工程价值判断:
- 生产决策框架: 4 问题 5 分钟决策(workload shape / structured output / hardware / team maturity)
- Benchmark 误区: 强调 TTFT p50/p95/p99 真实并发,而非 max throughput;强调 prefix-cache hit rate 是关键轴
- 真实案例: 某团队从 vLLM 迁移 agent pool 到 SGLang,prefix hit rate 18% → 71%,TTFT 1.4s → 380ms,GPU 数量 12 → 5,账单降 28%
- 常见错误: 7 条,包含"用合成 prompt 跑 benchmark"、"优化 max throughput 而非 latency SLO"、"单一引擎偏执"
- 具体命令/参数: gpu_memory_utilization、chunked-prefill-size、max_running_requests 等
保留理由: 2026 生产视角最完整的 vLLM vs SGLang 对比;有具体数字、真实 war story、决策框架工程价值极高;与今日 inference 工程筛选主题强相关。
标签: vLLM / SGLang / Production / Benchmark / Decision Framework / Prefix Cache
建议写入路径: inference-systems/vllm-vs-sglang-production-2026.md
需精读: 是(原文高质量,建议整读)
5. vLLM 官方 Troubleshooting 文档 - 保留 ✓
来源: https://docs.vllm.ai/en/latest/usage/troubleshooting/ 工程价值判断:
- 真实错误模式: torch.compile Error / Model failed to inspect / NCCL error / CUDA PTX unsupported toolchain / ptxas fatal sm_110a / Python multiprocessing
- Architecture docs: CUDA Graphs、CustomOp、Dual Batch Overlap、torch.compile integration、Paged Attention、Automatic Prefix Caching
- Design docs: vLLM IR、Hybrid KV Cache Manager、Model Runner V2、NIXL KV transfer
- 具体参数:
--load-format dummy排查模型加载;NCCL_DEBUG=INFO排查 NCCL
保留理由: vLLM 官方排障文档,每次生产事故必查;Architecture/Design 文档是理解 vLLM 内部机制最权威来源;已覆盖 torch.compile error、OOM、NCCL、CUDA error 等主要错误类。
标签: vLLM / Troubleshooting / CUDA / NCCL / Production / Documentation
建议写入路径: inference-systems/vllm-troubleshooting-2026.md
需精读: Architecture docs(按需)
6. SGLang Troubleshooting(Mintlify)- 保留 ✓
来源: https://sgl-project-sglang-93.mintlify.app/resources/troubleshooting 工程价值判断:
- CUDA OOM during prefill: 具体命令
python -m sglang.launch_server --model-path ... --chunked-prefill-size 4096 --max-running-requests 128 - CUDA Error: Illegal Memory Access: 内核错误
- Memory Pool Size / The Server Hangs: 初始化和运行中内存问题
- Tensor Parallelism Errors / Quantization Issues / Multimodal Errors: 均有独立章节
- FAQ: https://sgl-project.github.io/references/faq.html
保留理由: SGLang 官方排障文档,与 vLLM 排障文档互为镜像;prefill OOM 的 --chunked-prefill-size 参数是生产高频调优点;多 GPU 和量化问题有专门章节。
标签: SGLang / Troubleshooting / CUDA OOM / Prefill / Production
建议写入路径: inference-systems/sglang-troubleshooting-2026.md
需精读: FAQ 部分(按需)
7. Sector88: vLLM OOM 完整检查清单 2026 - 保留 ✓
来源: https://www.sector88.co/blog/how-to-fix-vllm-oom 工程价值判断:
- 4 大 OOM 原因框架: ① 模型不适用当前精度 ② KV cache 爆炸(max_model_len 设置过高)③ gpu_memory_utilization 过高 ④ 突发并发
- CPU OOM vs GPU OOM 区分: Exit Code 137(OOMKilled)vs
torch.cuda.OutOfMemoryError - Kubernetes 资源配置公式: 8B → 16-24Gi;13B → 24-32Gi;70B → 48-64Gi(CPU memory);GPU memory 另算
- KV cache 调优: max_model_len 设到实际峰值而非理论峰值
保留理由: 最系统的 vLLM OOM 排障指南;有具体内存数字、K8s resource 配置示例、4 原因框架;与 vLLM/SGLang 排障主题高度重叠但角度更教学化。
标签: vLLM / OOM / Kubernetes / Memory / KV Cache / Production
建议写入路径: inference-systems/vllm-oom-checklist-2026.md
需精读: 可选(工程师实操参考)
8. CSDN 高价值工程文章筛选 - 降级收录 ↓
判断: 本次 CSDN 未发现新增独立高价值文章(与前两轮重复)。相关工程内容已由 DevOpsBeast + 官方文档覆盖。
决策: 不单独成篇,相关引用合并到上方条目。
汇总
| 序号 | 条目 | 决策 | 理由摘要 | 标签 |
|---|---|---|---|---|
| 1 | FlashInfer-Bench | 保留 | AI kernel 闭环,有源码/命令/MLSys2026 contest | GPU Kernel / AI Agent / SGLang / vLLM |
| 2 | APEX | 保留 | CPU-GPU 混合调度,49%/37% 提升,公式具体 | CPU-GPU Hybrid / Scheduler / T4 / A10 |
| 3 | CudaForge | 保留 | 多 agent CUDA 优化,NCU 反馈,97.6% correctness | CUDA / Multi-Agent / Nsight Compute |
| 4 | DevOpsBeast vLLM vs SGLang | 保留 | 2026 最完整生产对比,4 问决策框架,war story 有数字 | vLLM / SGLang / Production / Benchmark |
| 5 | vLLM Troubleshooting | 保留 | 官方排障文档,真实错误模式,Architecture docs | vLLM / Troubleshooting / CUDA / NCCL |
| 6 | SGLang Troubleshooting | 保留 | 官方排障文档,prefill OOM 具体命令 | SGLang / Troubleshooting / CUDA OOM |
| 7 | Sector88 vLLM OOM | 保留 | 4 原因框架,K8s 内存配置公式 | vLLM / OOM / Kubernetes / Memory |
| 8 | CSDN 补充 | 降级 | 本轮无独立新增,并入上方条目 | — |
高优先级主题页更新建议
- Inference Systems 主题页: 建议增加 FlashInfer-Bench + CudaForge 作为"AI 写 kernel + AI 优化 kernel"叙事单元;APEX 作为"constrained GPU 调度"最新代表
- vLLM / SGLang 主题页: DevOpsBeast 的 4 问决策框架值得引用;vLLM/SGLang Troubleshooting 文档应作为固定参考资源
输出文件: /shared/research-kb/inbox/jay/2026-06-29-1850-engineering-filter-flashinfer-cudaforge-apex-vllm-sglang-production.md
本轮写入: ✅ 是(本文档)
GitHub 写入: ❌ 未执行(遵守规则)