Jay 工程实践筛选 · 2026-09-23 第1次(上午)

任务概述

  • 筛选周期:每天 3 次(08:00 / 14:00 / 20:00 SGT)
  • 本次执行:2026-09-23 10:50 SGT(上午场)
  • 检索范围:vLLM/SGLang 推理引擎 · KV Cache 量化 · MCP 安全 · NVIDIA/AMD 推理调优 · Substack 工程专栏
  • 筛选标准:真实环境、命令、错误日志、源码分析、性能数据、可复现步骤

✅ 高价值条目(保留)


1. vLLM vs TensorRT-LLM vs SGLang H100 基准测试命令详解

来源Spheron · vLLM vs TensorRT-LLM vs SGLang: Which Is Fastest? (H100 Benchmarks, 2026) 发布时间:2026年3月23日(Mar 23, 2026) 作者:Mitrasish, Co-founder & CTO, Spheron 可信度:高 — 工程团队博客,含完整命令和基准测试方法论

核心工程价值: - 框架版本明确:vLLM v0.18.0 / TensorRT-LLM v1.2.0 / SGLang v0.5.9 - 测试方法可复现: - async Python client + aiohttp 生成负载 - 200 条 prompt(平均 512 token 输入 / 256 token 输出,seed=42 固定) - 4 个并发级别:1 / 10 / 50 / 100 - 每级别运行 3 分钟,预热 60 秒 - VRAM 采样:nvidia-smi --query-gpu=memory.used 每秒一次 - SGLang 部署命令示例bash docker run --gpus all --ipc=host -p 8000:8000 \ -e HUGGING_FACE_HUB_TOKEN=your_token_here \ lmsysorg/sglang:v0.5.9-cu130-runtime \ python -m sglang.launch_server \ --model-path meta-llama/Llama-3.3-70B-Instruct \ --quantization fp8 \ --context-length 8192 \ --mem-fraction-static 0.92 \ --max-running-requests 128 \ --host 0.0.0.0 --port 8000 - TensorRT-LLM 引擎构建流程:先构建引擎(约 28 分钟),再启动服务 - 主要结论:SGLang 在前缀复用场景领先约 29%;vLLM 高并发连续批处理更强;TensorRT-LLM 吞吐量最高但需要一次编译

保留理由:完整的框架版本 + 可复现的测试命令 + 明确的 benchmark 配置,是推理引擎对比的工程级参考。

标签inference-systems benchmark vllm sglang tensorrt-llm h100 production

引用https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks


2. NVIDIA AIPerf 基准测试方法论:vLLM 生产基准实操命令

来源NVIDIA Developer · Benchmarking LLM Inference at Scale with AIPerf 发布时间:2026年9月18日(Sep 18, 2026) 作者:Francesco Di Natale 等,NVIDIA 高级性能工程师 可信度:高 — 官方 NVIDIA 技术博客,含具体 flag 含义和实测方法

核心工程价值: - vLLM 服务启动命令(含 reasoning parser): bash # 静态基准(固定 ISL/OSL) python -m aiperf \ --server-url http://localhost:8000/v1/chat/completions \ --model Qwen3-0.6B \ --num-requests 1000 \ --max-input-tokens 128 --max-output-tokens 128 \ --synthetic-input-tokens-stddev 0 \ --output-tokens-stddev 0 \ --extra-inputs min_tokens:128 \ --extra-inputs ignore_eos:true - Poisson 随机负载基准(真实生产场景模拟): bash python -m aiperf \ --server-url http://localhost:8000/v1/chat/completions \ --model Qwen3-0.6B \ --num-requests 1000 \ --synthetic-input-tokens-stddev 32 \ --output-tokens-stddev 32 \ --random-seed 42 \ --streaming - 关键 flag 含义(作者亲解): - --synthetic-input-tokens-stddev 0 + --output-tokens-stddev 0:固定 ISL=128/OSL=128,建立静态基准 - --extra-inputs min_tokens:128:强制模型输出 128 token 而非提前停止 - --random-seed 42:使 Poisson 时序和随机长度可复现 - --streaming必选,否则无法测量 TTFT 和 decode token 指标 - 负载整形能力:支持 constant/Poisson/gamma 到达模式,可调 burstiness,合成 vLLM/SGLang 分布 - 作者背景:NVIDIA 高级性能工程师,前 Lawrence Livermore 国家实验室 HPC 科学家

保留理由:NVIDIA 官方方法论文档,明确解释了各 flag 的实际作用,是推理基准测试工程化的重要参考,而非通用介绍文章。

标签inference-systems benchmark nvidia aiperf vllm methodology commands

引用https://developer.nvidia.com/blog/benchmarking-llm-inference-at-scale-with-aiperf


3. AMD ROCm TurboQuant 生产化:MI355X 上 KV Cache 量化 12.7× 加速

来源AMD ROCm Blog · Productionizing TurboQuant on AMD GPUs for KV-Cache-Bound LLM Inference 发布时间:2026年6月11日(Jun 11, 2026) 作者:AMD ROCm 团队(INES CHAKRABARTI, DAVID LIMPEUS 等) 可信度:高 — AMD 官方 ROCm 博客,ICLR 2026 TurboQuant 论文的 AMD GPU 生产实现

核心工程价值: - TurboQuant 背景:ICLR 2026 论文,在线向量量化方法,KV Cache 压缩至 3-3.5 bit,实现 6 倍以上 KV Cache 内存降低,H100 上 attention logit 计算 8 倍加速 - AMD GPU 生产实现: - 硬件:2× AMD MI355X,TP=2 - 量化格式:--kv-cache-dtype turboquant_4bit_nc - Block size:--block-size 32 - Attention backend:--attention-backend ROCM_AITER_UNIFIED_ATTN - 测试配置: - 32K/1K(ISL=32K, OSL=1K):长上下文 decode,C=64 固定 - 8K/1K sweep(ISL=8K, OSL=1K):并发 C=4 到 C=64 扫描 - 关键结论:decode kernel 综合优化(算法+硬件+代码生成)可达开源基线 12.7 倍加速 - 参考实现TheTom/TurboQuant+(llama.cpp 社区移植版本)

保留理由:AMD GPU 上 TurboQuant 生产化是 2026 年 MoE 推理工程的重要实践,含具体硬件配置、量化参数和 benchmark 配置,是有源码背景的工程量化文章。

标签inference-systems quantization kv-cache amd rocm turboquant mi355x production

引用https://rocm.blogs.amd.com/artificial-intelligence/turboquant-vllm-agentic/README.html


4. vLLM 博客:Qwen3.8-2.4T PD Serving(Prefill-Decode 分离)达成 5K throughput

来源vLLM.ai Blog · PD Serving of Qwen3.8-2.4T 发布时间:近期(2026年内) 可信度:高 — vLLM 官方博客,工程深度文章

核心工程价值: - GB300 NVL72 PD(预填充-解码分离) Serving: - Throughput:5K tokens/s - Interactivity(TTFT):180ms - 模型:Qwen3.8-2.4T(2.4T 参数,MoE,FP8/BF16 checkpoint,NVFP4/MXFP4 量化权重) - 支持 NVIDIA + AMD 硬件上的联合优化 kernel - Decode Context Parallelism(DCP):通过 sequence 维度分片 KV cache,在长上下文 agentic 工作负载上实现 3 倍吞吐量提升(对比标准 tensor parallelism) - Day-0 支持:vLLM 对 Qwen3.8-2.4T-A95B 实现 Day-0 支持,含混合 MoE 架构支持

保留理由:PD 分离是 2026 年大模型推理的关键架构演进,vLLM 官方博客含具体吞吐量和交互性数字,有工程参考价值。

标签inference-systems pd-disaggregation vllm qwen3.8 moe nvl72 dcp

引用https://vllm.ai/blog


5. KV Cache 优化工程指南:量化数据 + 成本计算

来源DigitalApplied · KV Cache Optimization for LLMs 2026: Engineering Guide 发布时间:2026年(近期) 可信度:中 — 工程博客,有量化数字但需核验

核心工程价值: - 5 类 KV 优化技术栈: 1. PagedAttention(vLLM 内存管理基础) 2. Prefix Caching(vLLM / SGLang RadixAttention) 3. Attention 层压缩(MQA → GQA → DeepSeek MLA) 4. KV Cache 量化(INT8 / FP8) 5. 架构压缩(MoE) - 关键数字(自 2026 年 9 月): - FP8 KV Cache 节省:50%(对比 FP16 基线) - Prefix Cache Hit 时节省:85-95%(对比未缓存) - MLA 架构:KV Cache 降低 90% 以上(DeepSeek V2 论文自报) - Long-context KV 内存数据(Llama 70B MHA FP16): - 8K context → 1.0 GB - 32K context → 4.3 GB - 128K context → 17.3 GB - 1M context → ~134 GB(超过单卡容量) - Block size 建议:16 或 32 tokens(大多数工作负载最优) - 生产原则:2026 年所有推理栈默认启用 PagedAttention;如有人建议禁用来刷基准分,忽略即可

保留理由:KV Cache 工程优化的量化数据整理,有数字有分层,但部分为厂商报告数据,需注意交叉核验。

标签inference-systems kv-cache quantization prefix-caching engineering cost-analysis

引用https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide


❌ 丢弃条目(低工程价值)


1. 「AI Agents Stack 2026」Substack 综合概览

来源The AI Engineer · The AI Agents Stack (2026 Edition) 丢弃理由: - MCP 安全数据(84.2% tool poisoning / 82% path traversal / 67% code injection)有来源(Invariant Labs MCPTox / Endor Labs),但原始论文/报告未经独立验证 - 整体是 2026 agent 生态全景图,非具体工程实现 - 部分内容与 2026-06/-07 的早期版本重复 - 降级为线索:可追踪 MCPTox 和 Endor Labs 原始报告


2. LMDeploy vs SGLang vs vLLM H100 吞吐量排名

来源aimultiple.com · LLM Inference Engines: vLLM vs LMDeploy vs SGLang 丢弃理由: - 排名数字(vLLM 12553 tok/s)来源模糊,无具体 benchmark 方法论 - 标题含「April 15, 2026」,但内容混合了厂商报告和自测数据 - 缺少命令、错误、环境配置等工程细节 - 保留线索价值:LMDeploy 一行安装 pip install lmdeploy 的易用性优势可参考


3. IntuitionLabs KV Cache 内存成本计算

来源IntuitionLabs · KV Cache Memory: The Real Cost of Long-Context Inference 丢弃理由: - 主要是成本计算框架和公式推导,缺少实际部署命令 - 2026 年 9 月 5 日发布,数字新鲜度尚可,但与 DigitalApplied 条目重叠 - GPU 价格数据($2.65/hr H100 / $1.48/hr A100 as of Sep 22 2026)有一定参考价值,但文档未注明来源 - 降级为线索:GPU 价格数据可辅助成本估算


4. KV Cache Fingerprinting arXiv 论文(arXiv:2605.29979)

来源arXiv · Fingerprinting Inference Systems of Large Language Models 丢弃理由: - 安全研究论文,主要价值在攻击面分析,非生产部署工程 - 提及 vLLM/SGLang 近期 CVE(Wu et al., 2025/2026),但需查 MITRE 原始漏洞库 - 论文方法论完整,但不适合作为工程实践筛选的主要来源 - 保留线索:与 2026-09-16 报告中 GPUStack 一起,构成推理引擎安全面的线索


📋 本次分类标签汇总

类别 条目数 关键标签
inference-systems 4 vllm sglang kv-cache benchmark pd-disaggregation quantization
gpu-hardware 1 amd rocm turboquant mi355x
security 0 降级为线索,未收录具体工程条目
agent-framework 0 降级为线索,无高价值生产工程条目

📁 建议写入路径

路径/shared/research-kb/inbox/jay/2026-09-23-1050-jay-engineering-filter.md

是否需要精读/审稿/主题页更新: - 精读:《vLLM vs TensorRT-LLM vs SGLang》命令级内容建议审稿人核验 benchmark 数字(Spheron 自测数据) - 审稿:《AMD TurboQuant》建议对照 ICLR 2026 原始论文核验 12.7× 数字 - 主题页更新:建议在 inference-systems 主题页新增「PD Disaggregation」条目(vLLM Qwen3.8-2.4T) - 不需要更新:Substack AI Agents Stack 2026 降级为线索,不入库


📝 草稿全文

本报告即为草稿,已按 /shared/research-kb/inbox/jay/YYYY-MM-DD-topic.md 格式写入 /shared/research-kb/inbox/jay/2026-09-23-1050-jay-engineering-filter.md