inference · 知识库活文档
- 更新:2026-08-25 | vLLM Conf Day1;Dynamo 1.4.1;RTP-LLM;pgvecScale 471 QPS;Multi-Vector;LOCOMO;SwiftCache;引→258
一、现状全景:LLM 推理服务工业化成熟与框架收敛
2026 年中,LLM 推理服务已从「能跑就行」进入「工业级优化」阶段。Google 2026-05 数据显示其每月处理 3.2 万亿 tokens(年化 38 万亿),推理占 AI 算力消耗已达约 2/3。推理工程正在成为独立于 AI 工程的学科。
1.1 框架格局:vLLM 与 SGLang 双雄趋同,TGI 正式落幕
vLLM 0.28(2026-08):Model Runner V2(M2)成为 Qwen3 dense 模型的默认执行路径。Experimental Rust frontend 已合入主线,新增 DP Supervisor for data-parallel serving。Device selection 变更:vLLM 不再内部设置 CUDA_VISIBLE_DEVICES,改为提供新的 device_ids 参数(ROCm 上已开始 CUDA_VISIBLE_DEVICES 废弃窗口)。
vLLM v1 重新架构调度器(2026-08 官方博客系列):重新架构调度器(更简单)+ 近零开销 prefix caching + 更清晰的 tensor parallelism + 多进程 API server + Qwen3.8-2.4T-A95B Day 0 支持。async scheduling 将很快默认开启;MoE shared expert overlap 优化(DeepSeek V4 等共享专家模型关键特性);RLHF pause/resume 改进(异步 RL 关键);Prefill Context Parallel 初始支持(长序列新并行方式)。
vLLM 25K TPS/GPU on Qwen3.5(vLLM Blog 2026-07-29):GB200 NVL72 分解式服务架构下达成 25K total TPS/GPU;关键技术栈:Blackwell GDN kernels + HMA cache transfer + async scheduling fixes + srt-slurm recipes;Qwen3.5-397B-A17B(NVFP4 精度)。
vLLM Decode Context Parallelism(DCP):将 decode 阶段 KV cache 分布到多 GPU,计算保持在单卡。与传统 TP 切分不同,DCP 仅对 KV cache 做分布——适合 128K+ 上下文。
vLLM 原生 transformers 后端(HF Blog 2026-08):transformers 库新增 vLLM 原生推理后端,覆盖 450+ 架构通过 transformers API 一致暴露。模型作者无需分别为 transformers 与 vLLM 各写一次 Custom CUDA kernel。
SGLang v0.6(2026-07-27,574 PRs):DSpark 投机解码(DeepSeek-V4-Pro TP8 B300 bs=1 达 383.7 tok/s)+ DFlash + Spec V2(ICML 2026,>4.3× 基线吞吐,1.5× MTP)+ GLM-5.2 NVFP4 agentic workloads 500 TPS(2 周内达生产级)+ PD Disagg GPU Staging Buffer(RDMA 请求数降低约 1000×)+ 全球部署超过 400,000 GPUs + DeepSeek V4 Flash 0731 Day-0 支持。
SGLang Advanced CUDA Graph(LMSYS Blog 2026-08-17,生产调优重要):
- full:捕获整个 prefill 为单个 CUDA Graph,实验性,仅 FlashAttention-4/FlashInfer 后端支持
- breakable:分段捕获,可动态处理变长序列,生产推荐
- tc_piecewise(torch.compile):最小代码量(177 行 vs 521 行),生产推荐
- prefill graph 构建速度:breakable / tc_piecewise 比 full 快 3.8–5.2×
SGLang vs vLLM 选型(2026-08 实测):高并发(64+)时 SGLang 开始全面超越 vLLM;H100 @ Llama 3.1 8B 16K 上下文:SGLang 16,215 tok/s vs vLLM 12,553 tok/s(+29%);shared-prefix 场景 SGLang 领先 2-29%(prefix overlap ratio > 60% → SGLang 显著领先)。
SGLang vs vLLM Schema Complexity Overhead(DeepInfra + Spheron + Particula Tech,2026-08):
| Schema 复杂度 | vLLM 开销 | SGLang(热) | SGLang(冷) |
|---|---|---|---|
| 扁平 JSON(3 字段) | +6% | +2% | +8% |
| 嵌套 JSON(2 层) | +18% | +4% | +15% |
| 深嵌套(4 层) | +42% | +6% | +24% |
| 函数调用 | +22% | +5% | +18% |
四引擎工程选型决策框架(The AI Engineer,Paolo Perrone,2026-04/2026-08 确认):
| 引擎 | 定位 | 核心特性 | 适合场景 |
|---|---|---|---|
| Ollama | 本地快速启动 | ollama run llama3.1 一命令运行;M4 Mac 跑 Qwen 2.5 32B ≈ 15 tokens/s |
单用户、macOS/Windows 快速实验 |
| vLLM | 生产默认 | PagedAttention 防 GPU 内存浪费;硬件覆盖最广;生态最大 | 通用生产级部署首选 |
| SGLang | 前缀复用密集 | RadixAttention 前缀缓存;共享上下文吞吐量 +29%(vs vLLM) | 多轮对话、RAG pipeline、Agent 循环 |
| TensorRT-LLM | 极致 NVIDIA 性能 | 手工调优;H100 上比 vLLM 高 15-30%;需 1-2 周编译调优 | 峰值性能优先、模型固定不变的生产场景 |
| llama.cpp | 边缘/本地 | MTP 在 Qwen 3.6 27B 上 >×2 加速;Qwen 3.6 35B 上 MTP 有精度退化 | CPU/边缘/无 GPU 环境 |
工程决策树:
需要 5 分钟内跑起来?→ Ollama
多用户并发 + 请求共享上下文(聊天/RAG/Agent)?→ SGLang(+29% 吞吐)
请求完全唯一无重复?→ vLLM
NVIDIA 硬件 + 模型固定 + 愿意投入 1-2 周调优?→ TensorRT-LLM
边缘/无 GPU/CPU 优先?→ llama.cpp
TGI(HuggingFace Text Generation Inference)已正式进入维护模式:HuggingFace 官方博客二次确认(2026-08),TGI 只接受 minor bug fix PR,不再作为未来方向推荐;官方建议迁移路径为 vLLM 或 SGLang。
Q2 2026 Engine Benchmark(H100 SXM 80GB Llama 3.3 70B FP8,Spheron + Prem AI):
| Engine | 吞吐量 tok/s | TTFT p50 | TPOT p50 | 冷启动 |
|---|---|---|---|---|
| SGLang | ~16,200 | 79ms | 7.9ms | ~58s |
| LMDeploy | ~16,200 | — | — | — |
| vLLM | ~12,500 | 82ms | 8.2ms | ~62s |
| TensorRT-LLM | 2,100 | 75ms | 7.6ms | ~28min |
Qwen3.8 on Ollama / Apple MLX(2026-08 新增):Qwen3.8 系列(2.4T 稀疏 MoE,512 experts)已全面进入 Ollama、Apple MLX、MLX-VLM 等本地/边缘推理栈。Apple Silicon 被正式确立为一类推理目标。
llama.cpp 突破 100k GitHub Stars:Georgi Gerganov 创建的本地 LLM 推理引擎在量化生态(CPU/边缘/嵌入式)保持主导地位。
1.2 PD Disaggregation:正反案例对照与新兴架构
PD Disaggregation 成功场景(正面):
- DCP(Decode Context Parallelism,vLLM 2026-08):KV cache 分布到多卡、计算在单卡,适合 128K+ 上下文。
- CXL+PIM(HotInfra 2026):Prefill 在 GPU HBM,Decode 在 CPU+CXL DDRx,KV Cache 通过 CXL 共享内存互联;32K tokens 生成 DeepSeek-R1-671B 吞吐量 2.4×;CapEx 20.6× / OpEx 17×。
- AMPD(arXiv:2602.14516v2,ICML 2026):自适应多轮 PD 路由,动态决定 co-locate/disaggregate。
PD Disaggregation 失效场景(反面):
- Not All Prefills Are Equal(arXiv:2603.13358):系统论证了 PD disaggregation 在多轮 Agent 场景存在严重低效——多轮 Agent 每次用户输入都触发 prefill,而 prefill 高计算成本在短轮次下无法摊薄。多轮 Agent 场景建议用 native vLLM/SGLang。
1.3 新模型对推理引擎的影响
Qwen3.8-2.4T-A95B(2026-08-12):2.4T 参数稀疏 MoE,512 experts;vLLM Day 0 支持。
DeepSeek V4 Flash 0731(2026-07-31,MIT):284B 总参/13B 激活,MoE 256 路由专家+1 共享专家;Terminal Bench 2.1 82.7%(vs V4 Flash Preview 61.8%)。
Muse Glimmer 30B(Meta,2026-08-10):Apache 2.0 许可证;RTX 5090 推测解码 233 tok/s;vLLM/SGLang Day-0 支持。
Kimi K3(Moonshot AI,2026-07-27):2.8T 参数,MoE,896 experts;NoPE everywhere;vLLM Day-0 支持;SGLang v0.6+ Day-0 支持。
1.4 llm-d CNCF Sandbox:Kubernetes 分布式推理编排一级公民
llm-d 正式加入 CNNC Sandbox(2026-03-24):创始成员 Red Hat + Google Cloud + IBM Research + CoreWeave + NVIDIA。
llm-d v0.7(2026-08):KV cache memory 降低 50-60%(GDS GPUDirect Storage 支持);EPD(Encode/Prefill/Decode)分解支持;Pure Go ZMQ 实现(消除 CGO 依赖)。
CNCN K8s AI 推理扩展(2026-08-11):KRO + KAR v1.35 + Kubernetes AI Conformance Program + Kueue + llm-d + vLLM extension。66% 的 GenAI 推理运行在 K8s 上。
1.5 vLLM Conference 2026(2026-08-25-26,SF)
首届 vLLM Conference(vLLM.ai/events/vllm-conference/2026):与 Ray Summit 联合举办,Sessions 涵盖:vLLM roadmap、hardware backends(NVIDIA/AMD/Google TPU)、agentic serving、training、production inference。2026-08-25 为首日 Keynote。
二、关键工作脉络:从单点突破到系统协同
2.1 PagedAttention 与 vLLM MRV2
arXiv:2309.06180(vLLM 团队)引入 PagedAttention,将操作系统虚拟内存分页管理思想引入 KV cache 管理。核心贡献:PagedAttention(GPU 显存按需分页分配,消除碎片)、Continuous Batching(动态插入新请求)、Prefix Caching(共享 KV cache 减少重复计算)、Chunked Prefill(大 prompt 分块处理避免饥饿)。
MRV2(Model Runner V2)是 vLLM 0.17+ 从头重写的模型执行层,在 v0.25+ 成为所有 dense 模型的默认执行路径。FlashInfer 定位:Blackwell(B200/B300)FlashInfer 为默认 attention backend;Hopper(H100/H200)FlashAttention 默认,VLLM_ATTENTION_BACKEND=FLASHINFER 可选开启。
2.2 投机解码(Speculative Decoding)全景
主流 Drafting 算法(2026-08 更新):
| 方法 | 核心机制 | 关键数据 | 状态 |
|---|---|---|---|
| EAGLE3 | 自回归 draft,层层验证 | Qwen3-Coder-Next 80B MoE:SWEBench 1.52× | vLLM mainline(0.9.1 CUDA graphs) |
| P-EAGLE(vLLM 0.19+) | 并行预测多个 draft token,多树推测 | Coding benchmark 4-5× 基线,20-30% over EAGLE3 | vLLM mainline |
| DFlash(ICML 2026,LMSYS) | Block diffusion drafting + KV injection | >4.3× 基线吞吐,1.5× MTP;高并发 >8 时退化至基线以下 | vLLM 0.27 集成 |
| DSpark(SGLang v0.6) | Confidence-Driven Variable-Length | DeepSeek-V4-Pro TP8 B300:383.7 tok/s;batch 1-256 全范围最优 | SGLang mainline |
| Arctic Inference(Snowflake) | Suffix Decoding,CPU 上 20μs/token,无需 draft model | 无 draft model | vLLM 插件 |
| SSD(Second Speculative Decoding) | 二阶推测:draft model 自己验证自己后再交 target 验证 | 最高 2× over spec decode | SGLang 已支持 |
Thought-Level Beam Search(arXiv:2608.08020):在 Thought(思维)级别而非 Token 级别做束搜索,主动将计算分配到最有潜力的部分轨迹。与 Speculative Decoding 的区别:Speculative Decoding 是在生成路径上的预测-验证;Thought-Level Beam Search 是在推理路径上的计算预算分配。
CoRun(arXiv:2608.14376):Continuous Batching 形状固定的调度系统。核心问题:continuous batching → 不同长度请求混合 → CUDA Graph 形状不固定 → 无法有效利用 graph replay 加速。解法:① Prefill 隔离每个请求自然形状;② Decode pad 到最大并发,生成固定形状 CUDA Graph;③ 固定形状 graph 可 replay,保持高吞吐。关键数据:吞吐量提升 15–324%(所有模型均超过 2×),输出 bit-identical。
2.3 调度与系统
LLM Serving 数学优化 Position Paper(arXiv:2605.01280v1,ICLR 2026):LLM 推理 serving 已超越通用启发式方法,需要数学优化与算法基础。关键结果:barrier-synchronized + sticky-assignment 设置下的 online request routing 与 DP load balancing,算法相对默认策略的 long-run average imbalance 改善因子为 Ω(√(B log G))。
LLMRouter(arXiv:2608.06867):LLM 路由的统一公式化,含五组件:Context Encoders / Model Encoders / Scoring Functions / Decision Rules / Learning Signals。
OmniInfer(arXiv SESAME '26):Prefix-Cache-Aware 负载调度。调度评分公式:πP(i) = MatchP(i) − α·ρP。覆盖完整请求生命周期 8 阶段:tokenize → APC matching → prefill wait → prefill scheduled → prefill running → decode wait → decode scheduled → decode running。
GORGO(arXiv:2602.11688v3):跨区域 Prefix-Cache 感知的 LLM 路由调优。核心问题:一致性哈希或前缀复用路由在 bursty workload 下会导致热点 replica 队列排队(HOL blocking)。90% 前缀匹配的 100K token 请求 → 只需 prefill 10K token。
An Internet for the KV Cache(arXiv:2608.01526v1):KV Cache 应该成为基础设施级一等公民(类似 CDN)。联合优化:compression + offloading + prefetching + routing + recomputation + scheduling + model-level reuse。工程意义:概念框架论文,但指明了 2027-2028 年 KV Cache 分布式系统的研究方向。
三、KV Cache 管理:二十+路线
3.1 全景分类(arXiv:2607.02574)
From Tensor Buffer to Distributed Memory Hierarchy:覆盖 30+ KV-cache 管理系统,五个分类维度(Locality / Lifetime / Ownership / Substrate)和 5 大架构原型:Local-Paged(vLLM)、Disaggregated-Pipeline(SplitServe、FlexServe)、Shared-Store(Mooncake Store、LMCache)、Memory-Pool(vLLM + LMCache MP)、Hybrid-Tier(TTKV、Tutti、ICMSP)。
3.2 KV Cache 工程数学基础
KV Cache 显存公式:Memory = 2 × batch_size × seq_len × num_layers × num_kv_heads × head_dim × precision_bytes
Llama 2 70B 单序列 32K 上下文 KV Cache = 10.74 GB(80 层 × 8 KV heads × 128 head_dim × FP16)
PagedAttention 将内存碎片从 60-80% 降至 <4%
GQA(Grouped Query Attention)是降低 KV Cache 最重要的架构选择
3.3 Cache Compression(压缩)
GEAR(arXiv:2403.05527,被引 186 次):三合一压缩(统一量化 + 低秩矩阵近似 + 稀疏矩阵补救离群点),4-bit KV cache 近无损 + 2.38× 吞吐量 + 2.29× 峰值内存降低。
TurboQuant(arXiv:2605.19660,ICLR 2026):Key 3-bit + Value 2-bit,6× 压缩,8× 加速。AMD Quark Team 2026 在 vLLM 中产品化。警示:jay 2026-06-11 实测数字 2.69–4.4×(接近无损)vs AIxFunda 2026-08 引用 6×/8×(H100 零精度损失)——两套数字存在矛盾,可能来自不同模型家族/精度/上下文长度的不同评测条件,需 arXiv 原文 PDF 核验。
HiSparse(arXiv:2608.07009,Stanford+UIUC):精确的、与索引器无关的分层 KV cache,HBM 仅维护选定条目,首次让 KV cache 容量可超过 HBM 的请求也可服务。已合并入 SGLang 上游。峰值生成吞吐提升最高 4.7×,同时保持可比的 per-token 延迟。
AsymCache(arXiv:2606.02964):计算-延迟感知的 KV cache 管理。三个关键组件:① Multi-Segment Attention(MSA) 高效处理非连续 KV 上下文;② 缓存驱逐策略联合优化命中率和位置感知重算成本;③ 自适应 chunking 调度器实现高硬件利用率。与 HiSparse 的区别:AsymCache 关注位置感知驱逐和重算成本对齐,HiSparse 关注稀疏注意力索引器无关性。
SwiftCache(arXiv:2606.16135):协作推理系统,支持异构模型跨服务器共享 GPU 内存和 NVLink 带宽。跨模型 KV cache 共享通过 NVLink 实现,避免慢速 PCIe 传输。适合多模型服务(不同版本/量化级别模型)共享 prefix cache。
DASH(arXiv:2608.14333):High-Bandwidth Flash 与 HBM 双层 KV Cache 管理,专为 MoE LLM 设计。核心问题:MoE LLM KV cache 容量超 HBM(Llama 4 Maverick KV cache 197.41 GB,超过单卡 HBM)。HBM 吸收细粒度写入;Flash 批量写回。关键数据:Llama 4 Maverick 上比 RelayOnly 提升 1.92× 吞吐量,降低 E2E 延迟 48%。
Ragged Paged Attention(arXiv:2604.15464,Google/Mosaic ML):TPU 上 PagedAttention 的生产级替代方案。完整 benchmark 表格:context length 512~32768 各档位的 latency (μs)、throughput (GB/s)、MBU (%). Llama 3 8B @ TPU7x,decode 场景 MBU 86%,prefill 场景 MFU 73%。三大技术:fine-grained tiling、KV cache update 与 attention 融合、distribution-aware compilation。已集成:vLLM-TPU(2025.02,2-5x token throughput 提升)和 SGLang(2025.10,标准 TPU backend)。
LMCache(arXiv:2510.09665,MLSys 2026 Best Paper):首个高效开源 KV caching 解决方案,可跨引擎和查询共享 KV cache。关键数据:input token cost −90% / speed 14× / startup 3min→30s,30+ 公司生产部署(Google Cloud、AWS、NVIDIA、IBM)。
RTP-LLM(arXiv:2605.29639,阿里巴巴工业级推理引擎):面向工业级 LLM 部署的高性能推理引擎,已在 Alibaba Group 成功部署,服务超过 1 亿用户,通过集成设计解决根本性瓶颈。
vToken(arXiv:2608.13263):Token-Level Virtualization for Reclaimable KV Caches。PagedAttention 解决了 block 级碎片;vToken 在 token 级做 KV cache 虚拟化和细粒度回收。
ACL 2026 新增 KV 优化件:
| 技术 | 来源 | 说明 |
|---|---|---|
| MiniKV(ACL 2026) | Akshat Sharma et al. | 2-bit layer-discriminative KV 量化 |
| KVTuner(ACL 2026) | Xing Li et al. | Sensitivity-aware layer-wise mixed-precision KV 量化 |
| HiFC(ACL 2026) | Inho Jeong et al. | Flash-based KV cache swapping GPU memory ↔ SSD |
| TinyServe(ACL 2026 Award) | Dong Liu et al. | Query-aware cache selection |
| QJL(ACL 2026) | Amir Zandieh et al. | 1-bit 量化 JL Transform for KV cache |
3.4 Hybrid Memory(混合存储)
TTKV(arXiv:2604.19769):Temporal-Tiered KV Cache(HBM=短期,DRAM=长期);128K 上下文任务跨层流量减少 5.94×,延迟降低 76%。
ICMSP(NVIDIA CES 2026):三层存储(GPU HBM → CPU DRAM → NVMe SSD),cuFile GPU-direct NVMe + BlueField-4 DPU;NIXL(NVIDIA Inference Xfer Library)= KV block 传输协议。
Mooncake(kvcache-ai/Mooncake):Kimi 的 LLM 服务平台,PD 分离架构 + KVCache 池化。2026-05-07 vLLM 正式集成 Mooncake Store——vLLM + Mooncake Store 在真实 agentic traces 上实现 3.8× 更高吞吐、46× TTFT 降低、8.6× 端到端延迟降低。
3.5 KV Cache 可观测性工具链
kv-cache-analyzer(bs258q/kv-cache-analyzer,MIT):生产 KV cache 的 CLI 分析工具,提供多场景 LRU hit rate 实测数字。
vLLM Prefix Caching 失效条件(HowToUseAI,2026-08,工程实战):
| 失效原因 | 机制 | 解决方案 |
|---|---|---|
| 空格差异 | hash 不同 | 规范化 prompt 格式 |
| tool definition 顺序变化 | hash 不同 | 固定工具定义顺序 |
| 时间戳位置不对 | hash 不同 | 时间戳移至独立字段 |
| 任意 token 差异 | 必须重新计算 | 共享前缀结构化 |
TTL 机制:缓存 KV tensor 占 GPU 内存,providers 通常设 5-10 分钟 TTL 后自动清除。实测收益估算:相同 system prompt + RAG 上下文 = 每次调用节省约 5 秒 prefill 时间。
四、推理成本工程与基准
4.1 llm-d:Kubernetes 分布式推理编排成为 CNNC Sandbox
llm-d 正式加入 CNNC Sandbox(2026-03-24):创始成员 Red Hat + Google Cloud + IBM Research + CoreWeave + NVIDIA。
NVIDIA Dynamo 1.4.1(2026-08-22 更新):KV Router + NIXL + Planner + OpenAI 兼容 API。KV Router 智能请求路由 + 前缀感知缓存;Planner SLA 感知调度。Baseten 实测:34-62% 性能提升。
K8s 生产推理部署完整数值层(framsouza/inference-at-scale-on-kubernetes):
核心数字(Mistral Large 123B,BF16): - KV cache per token:0.344 MB/token - 128K 单请求 KV cache:~44 GB - 单卡 H100 80GB 并发上限:~16–44 conversations(取决于序列长度)
KEDA 按 KV cache pressure 扩缩:vllm:gpu_cache_usage_perc > 80–85% 触发 scale-up——比 queue depth 信号更提前(queue depth > 0 出现时已在加延迟)。
OpScale(arXiv:2608.13499,MSRA):Operator-Level Provisioning and Autoscaling for LLM Serving。在 40×A100 和 24×GB200 上验证;达成 SLO 达标率的同时,成本降低 36.3%。核心发现:prefill 是 compute-bound,decode 是 memory-bound——两者弹性特征迥异。
4.2 推理经济学与生产工程
AWQ INT4 量化并发 3× 提升(CSDN 博客 A/B 实测):14.7GB 模型压缩至 4.2GB(3.5× 压缩比),并发数从 12 提升到 36(3×)。RTX 4090 FP8 最优配置:Ada Lovelace 架构原生 FP8 支持,该卡上 FP8 表现优于 INT8/INT4。
TensorRT-LLM FP8 深度优化(CSDN):实测 Llama 3 70B + H100:FP8 推理速度提升 2.58 倍,显存减少 50%,PPL 仅增加 0.04。
Continuous Batching 23× 吞吐基准(Anyscale,MLwithDev 2026-08):Continuous Batching + vLLM PagedAttention = OPT-13B A100 40GB 上 23× 吞吐(vs naive batching)。
gpu_memory_utilization 软限制陷阱(CSDN 源码分析,2026-08):gpu_memory_utilization 是软限制/目标预算,非硬限制;0.8 比 0.7 更容易 OOM——原因是 warmup dummy requests 阶段已分配大部分显存。CUDA graphs 额外开销:1~3 GiB per GPU。
bench_serving 完整命令库(CSDN 实测):SGLang benchmark 命令:
python3 -m sglang.bench_serving \
--backend sglang --dataset-name random \
--num-prompts 1024 --random-input 1024 --random-output 128 \
--request-rate 128 --max-concurrency 128 \
--warmup-requests 16 --base-url http://localhost:30000
vLLM benchmark(含 pd-separated):
python3 -m sglang.bench_serving \
--backend vllm --model Qwen/Qwen3-32B-FP8 \
--dataset-name random --num-prompts 1024 \
--random-input 2048 --random-output 512 \
--max-concurrency 512 --warmup-requests 1 \
--pd-separated --base-url http://localhost:9000
vLLM 生产部署监控端点: - http://localhost:8000 - http://localhost:8000/metrics Prometheus 指标
Prometheus 内存监控规则:
(container_memory_working_set_bytes{container!="POD"} /
on(pod) container_spec_memory_limit_bytes) > 0.8
⚠️ 不要给 vLLM pod 设置 CPU limits——CPU throttling 会拖慢 tokenization 和请求处理,只设 CPU requests 用于调度。
4.3 HF State of Open Models: Summer 2026(关键生态数据)
| 指标 | 数据 |
|---|---|
| HF Hub 模型总量 | 296 万(+22% YoY) |
| 数据集总量 | 100 万(+40% YoY) |
| Spaces 总量 | 144 万(+44% YoY) |
| gguf 库仓库存量增长 | 464%(7 个月内) |
| Apple MLX 增长 | 148% |
| Qwen 衍生模型数 | 151,448(Llama 的 4.7×) |
标志性转变:Agent(机器用户)首次成为 HF Hub 第一大用户类型——意味着基础设施需要面向机器友好的 API 和工具。
五、Serving Security:推理引擎安全的新硬约束时代
5.1 vLLM 安全漏洞矩阵(2026-08,集中披露期)
CVE-2026-73558(CVSS 5.3 Medium):整数溢出 blockIdx.x ²ᵈ in act_and_mul_kernel 导致同一批次中其他用户的推理结果部分或完整泄漏给当前用户。影响 vLLM < 0.27.0。修复:≥ 0.27.0。
CVE-2026-73559(CVSS 5.3 Medium):同批次跨用户数据泄漏的另一个触发路径。影响 vLLM < 0.26.0。
CVE-2026-22778(已知被利用,CVSS 9.8):vLLM 0.8.3-0.14.0 存在 Critical RCE。
GHSA-7m6h-x95x-82q5(2026-08-11):vLLM CVE-2026-22778 incomplete fix——通过 Anthropic router 泄漏 PIL repr 地址。
GHSA-cqm8-jxg6-fqfq(2026-08-11):vLLM Unauthenticated Requests——DeepStream backend confusion 导致 DoS。
检测命令:vllm --version,确认版本 >= 0.27.0。
5.2 LMDeploy 安全漏洞
CVE-2026-33626(Sysdig 2026-08-19,Critical):LMDeploy load_image() 函数对传入的 image URL 不验证目标是否为保留 IP 段、链路本地地址或回环地址,攻击者可借此访问云元数据服务(AWS http://169.254.169.254/)、内网资源。修复版本:≥ 0.12.3。从 GHSA 公布到首次利用:12 小时 31 分钟。
Sysdig 结论:AI 推理框架漏洞在披露后数小时内即被武器化——传统的"补丁星期二"节奏和月度扫描已不足以应对。快速响应 SLA:< 24 小时补丁响应。
5.3 SGLang 安全漏洞
CVE-2026-3059 / CVE-2026-3060 / CVE-2026-3989(2026-06-25):SGLang 三连发安全漏洞。
5.4 KV-Cache Timing Side-Channel
多租户 LLM 推理系统(如 vLLM prefix caching)中,攻击者通过测量 TTFT 差异可判断特定 token 序列是否被其他用户缓存。防御策略:多租户分桶 / 延迟噪声注入 / 加密 token 缓存 / 租户标签限制。
六、Agent 生产推理的特殊考量
6.1 Agentic 推理三层架构收敛
Lilian Weng Harness Engineering(2026-07-04):Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State。
AI Agents Stack 2026(The AI Engineer,2026-06):
Layer 1: LLM(推理核心)
Layer 2: Tool / Action(工具执行,MCP 协议)
Layer 3: Memory(会话/长期记忆,三层架构)
Layer 4: Guardrails(Agent 专用护栏)
Layer 5: State Management(状态管理,状态图)
Layer 6: Observability + Evals(可观测性 + 评测)
Eval Gap:LangChain 调查显示 89% 的生产 Agent 团队有可观测性建设,但仅 52% 有正式评价体系——差距 37 个百分点。
6.2 MCP 2.0 无状态协议(2026-07-28 官方发布)
三大核心更新:Multi-Round-Trip Requests(MRTR)+ Required issuer authorization metadata + 完全远程化(支持 stateless、cacheable、routable 流量)。
企业采用数据(2026 年 8 月):80% Fortune 500 已在生产部署 AI Agent;28% 已实现 MCP 服务器;月 SDK 下载 9700 万次;公开 MCP 服务器 10,000+。
OWASP MCP Top 10(Dec 2025):MCPTox 基准测试发现自动审批模式下 84.2% 工具中毒成功率;2,614 个 MCP 服务器中 82% 存在路径遍历漏洞、67% 存在代码注入风险。安全审计亟待制度化。
6.3 Agent Memory Benchmark 与设计
LOCOMO Benchmark(Dec 2025 survey "Memory in the Age of AI Agents"):full-context retrieval = 72.9% accuracy,但 p95 latency = 17.12s,≈ 26,000 tokens/conversation。关键推论:17s tail latency = 约 1/20 用户等待 17s,token 成本是选择性 memory 的 14 倍。正式将 agent memory 与 RAG/context/LLM memory 区分,memory 治理要求:每条 memory 需记录 Memory ID/Type/Scope/Creation source/Timestamp/Retrieval confidence/Influence flag。
Long Context RAG 信息遗漏层次分析(arXiv:2607.22448v3):三类 needle(literal、paraphrase、conflict)诊断信息遗漏层次。当上下文与模型参数记忆冲突时,强模型倾向于坚持错误内部记忆而非信任上下文证据(context conflict 场景尤其严重)。fine-tuning 无法完全修复此问题。简单增加 context window 不能解决知识冲突,需要在 retrieval 层面做更精细的置信度判断。
LongHorizon-Harness(arXiv:2608.01964,Alibaba):通过 manage-execute-audit 循环,显式追踪已验证任务状态,提升长时 Agent 任务完成率。
七、RAG 与长上下文
7.1 Vector Database 2026 格局重塑
pgvectorScale vs 专用向量库(2026):pgvectorScale 在 5000万向量规模下实测 471 QPS / 99% recall,Qdrant(专用向量库)实测 41 QPS——差距约 10 倍。2026 年主流数据库全部内置向量支持:PostgreSQL(pgvector/pgvectorscale)、MongoDB、Oracle、Azure HorizonDB、AWS Neptune、Google,均已将向量搜索作为标准功能。向量检索质量更多取决于分块策略 + 重排序(chunking & reranking),而非底层数据库选型。
向量数据库选型决策: - <10M 向量/200 QPS → pgvector/pgvectorScale - billion-scale + sub-50ms → 专用向量 DB(Milvus/Qdrant/Weaviate) - 10-100M 向量 + 高精度 → Qdrant v1.10+ / Milvus v2.6.4
Multi-Vector(Late Interaction / ColBERT)支持现状(Hugging Face Blog 2026):原生支持 late interaction 多向量索引的数据库:Qdrant(v1.10+)、Weaviate(v1.29+)、Vespa、LanceDB(v0.15+)、VectorChord(Postgres 扩展)、Milvus(v2.6.4,array-of-structs 形式)。ColBERT/MAXSIM 模式:Qdrant 推荐 hnsw_config=HnswConfigDiff(m=0),适合 Retrieve-then-Rerank 流程(候选集 200-500 条规模)。
7.2 RAG 架构升级路径
RAG 架构演进(AI Thinker Lab,2026-08):
naive RAG → +hybrid retrieval → +reranker → +CRAG/Self-RAG → GraphRAG → Agentic RAG
GraphRAG 适用条件:跨文档综合。不适用场景:简单 lookup。
2026 MLOps Community benchmark(RAG About It):47 生产部署,agentic pipeline + knowledge graph → 幻觉率降低 62%。
具体 RAG 架构升级路径:naive RAG → +hybrid retrieval → +reranker → +CRAG/Self-RAG → GraphRAG → Agentic RAG。June 2026 Carnegie Mellon preprint:9,000 题金融合规数据集,幻觉率 14.1% → 4.9%,延迟 +220ms。
关键工程判断:pure semantic search 几乎总是输给 hybrid(dense + BM25)。
八、共识与争议
8.1 共识
- PagedAttention 是 KV cache 管理的事实标准;MRV2 成为所有 dense 模型的默认执行路径(v0.25+)
- FlashInfer 是 Blackwell(B200/B300)默认 attention backend
- Continuous batching 是生产推理引擎标配;23× 吞吐(Anyscale OPT-13B 基准)
- FP8 是 KV cache 量化的最佳默认
- vLLM + SGLang 开源双雄格局在 2026 年进一步巩固(TGI EOL 后五大框架)
- SGLang + LMDeploy ~16,200 tok/s vs vLLM ~12,500 tok/s(H100)
- SGLang 全球部署超过 400,000 GPUs
- NVIDIA Dynamo 1.4.1(2026-08-22):KV Router + NIXL + Planner + OpenAI 兼容 API;34-62% 性能提升
- RTP-LLM(arXiv:2605.29639):Alibaba 工业级推理引擎,服务超过 1 亿用户
- pgvectorScale 471 QPS vs Qdrant 41 QPS(50M 向量,99% recall)——10× 差距
- Multi-Vector 全支持:Qdrant v1.10+ / Weaviate v1.29+ / LanceDB v0.15+ / Milvus v2.6.4
- LOCOMO benchmark:full-context retrieval 72.9% accuracy,p95 latency 17.12s(17s × 14倍 token 成本)
- AsymCache(arXiv:2606.02964):Multi-Segment Attention + 位置感知重算成本对齐
- SwiftCache(arXiv:2606.16135):跨模型 KV cache 共享 over NVLink,避免 PCIe 传输
- Ragged Paged Attention(arXiv:2604.15464):TPU 生产级 PagedAttention 替代方案;已集成 vLLM-TPU 和 SGLang TPU backend
- Qwen3.8 全面进入 Ollama / Apple MLX / MLX-VLM:Apple Silicon 正式成为一类推理目标
- DASH(arXiv:2608.14333):HBM+Flash 两级 KV Cache 管理,MoE 197.41GB KV cache → 1.92× 吞吐 / 48% 延迟降低
- CoRun(arXiv:2608.14376):Continuous batching 形状固定 → 15-324% 吞吐提升,输出 bit-identical
- LMCache(MLSys 2026 Best Paper):input token cost −90% / speed 14× / startup 3min→30s
- llm-d CNNC Sandbox:Kubernetes 分布式推理编排成为一级云原生工作负载
- vLLM 0.28:M2 默认路径扩展 + Experimental Rust frontend 合入主线 + DP Supervisor
- SGLang vs vLLM Schema Complexity:深嵌套 JSON(4层)SGLang +6% vs vLLM +42%(7× 差距)
- LMDeploy CVE-2026-33626:SSRF via
load_image();12h31m weaponization;<24h 响应 SLA - SGLang CVEs 三连发:CVE-2026-3059 / CVE-2026-3060 / CVE-2026-3989(2026-06-25)
- vLLM 安全五连发(2026-07~08):CVE-2026-22778 incomplete fix / Unauthenticated DoS / Cross-User Data Leak / Derender / Dependency Confusion
- OWASP MCP Top 10(Dec 2025):84.2% 工具中毒成功率(auto-approval);82% path traversal;67% code injection
- vLLM Conference 2026(2026-08-25-26):首届 vLLM Conference 与 Ray Summit 联合举办
- An Internet for the KV Cache(arXiv:2608.01526):KV Cache 即 CDN 概念框架;2027-2028 分布式系统研究方向
- gpu_memory_utilization 软限制陷阱:0.8 比 0.7 更易 OOM;warmup 阶段已分配;CUDA graphs 1-3 GiB/GPU
8.2 争议
- KV cache 压缩的精度边界:TurboQuant/GEAR/C2KV/MiniKV/KVTuner 等带来显著加速,但精度损失边界尚无统一评估标准
- Disaggregation 的运维复杂度:Google/AWS/Azure 均采用,但中小规模团队是否值得承担存在分歧
- PD Disaggregation 多轮 Agent 失效:Not All Prefills Are Equal 揭示多轮场景 disaggregation 低效
- pgvectorScale 10× QPS 差距的可持续性:Qdrant 专注向量操作优化,pgvectorScale 受益 PostgreSQL 生态;不同测试条件可能逆转
- LOCOMO 72.9% accuracy 的测试条件:不同模型家族/任务类型可能显著偏离
- TurboQuant 数字矛盾:jay 2026-06-11 实测 2.69–4.4×(接近无损)vs AIxFunda 2026-08 引用 6×/8×(H100 零精度损失)
- DASH HBF endurance 0.645 年建模假设:连续满载写入极端情况,实际生产 endurance 需结合使用模式估算
- CoRun 15–324% 吞吐量提升:数字来自论文自身评测,评测环境细节需 PDF 核验
九、开放问题与趋势
9.1 开放问题
- AsymCache / SwiftCache / Ragged Paged Attention 生产落地验证:三篇 arXiv 均在 2026 年中发表,生产集成状态待跟盯
- NVIDIA Dynamo 1.4.1 Planner SLA 感知调度的真实收益:KV Router + NIXL + Planner 三件套生产联合效果数据不足
- pgvectorScale 继续扩缩 vs 专用向量库:两者差距在 billion-scale 是否持续
- OWASP MCP Top 10 修复状态:2,614 个 MCP 服务器的 82%/67% 漏洞是否已在修复中
- Qwen3.8 在 Ollama / MLX 的量化支持完整性:Apple Silicon + MoE 量化是否已完整支持
9.2 趋势
- RTP-LLM 路线:Alibaba 将内部推理引擎优化方法论向外辐射,值得跟盯生产案例
- LLM Serving 数学优化(arXiv:2605.01280):从 heuristic 到 formal optimization 的范式转变
- 推理安全 SLA 进入 < 24 小时时代:LMDeploy CVE-2026-33626 12h weaponization 确立新基准
- Agent Memory 作为一等架构原语:三层架构(Working/Episodic/Semantic)而非"加个向量数据库"
- Multi-Vector RAG 生态成熟:Qdrant/Weaviate/LanceDB/Milvus 全面支持后,ColBERT 范式进入生产可用
附:引用锚点
- arXiv:2303.05527
- arXiv:2309.06180
- arXiv:2311.06281
- arXiv:2403.05527
- arXiv:2404.19769
- arXiv:2404.26557
- arXiv:2502.20330
- arXiv:2504.11320
- arXiv:2504.19874
- arXiv:2506.04565v2
- arXiv:2506.09713
- arXiv:2507.06608
- arXiv:2510.09665
- arXiv:2511.01815
- arXiv:2601.06288
- arXiv:2601.19139
- arXiv:2601.20309
- arXiv:2602.00328
- arXiv:2602.10238
- arXiv:2602.11688
- arXiv:2602.14516
- arXiv:2602.21548
- arXiv:2603.04428
- arXiv:2603.08739
- arXiv:2603.09619
- arXiv:2603.12831
- arXiv:2603.13358
- arXiv:2603.15569
- arXiv:2603.17456
- arXiv:2603.20397
- arXiv:2603.21354
- arXiv:2604.00499
- arXiv:2604.01395
- arXiv:2604.01927
- arXiv:2604.03143
- arXiv:2604.07609
- arXiv:2604.11001
- arXiv:2604.12374
- arXiv:2604.15464
- arXiv:2604.15732
- arXiv:2604.16395
- arXiv:2604.17227
- arXiv:2604.19157
- arXiv:2604.19769
- arXiv:2604.25724
- arXiv:2604.25899
- arXiv:2604.26557
- arXiv:2605.00528
- arXiv:2605.01280
- arXiv:2605.01920
- arXiv:2605.02189
- arXiv:2605.03344
- arXiv:2605.03375
- arXiv:2605.04595
- arXiv:2605.11186
- arXiv:2605.11733
- arXiv:2605.15051
- arXiv:2605.16867
- arXiv:2605.17613
- arXiv:2605.19537
- arXiv:2605.19660
- arXiv:2605.23215
- arXiv:2605.27744
- arXiv:2605.29639
- arXiv:2606.00760
- arXiv:2606.01927
- arXiv:2606.02964
- arXiv:2606.03811
- arXiv:2606.03910
- arXiv:2606.06302
- arXiv:2606.07362
- arXiv:2606.08635
- arXiv:2606.09713
- arXiv:2606.13681
- arXiv:2606.14589
- arXiv:2606.16135
- arXiv:2606.16867
- arXiv:2606.17104
- arXiv:2606.19746
- arXiv:2606.20295
- arXiv:2606.25605
- arXiv:2606.26875
- arXiv:2606.28565
- arXiv:2606.29708
- arXiv:2606.30391
- arXiv:2607.00482
- arXiv:2607.00501
- arXiv:2607.00760
- arXiv:2607.01065
- arXiv:2607.01299
- arXiv:2607.01520
- arXiv:2607.01792
- arXiv:2607.02043
- arXiv:2607.02574
- arXiv:2607.05061
- arXiv:2607.05376
- arXiv:2607.05876
- arXiv:2607.05936
- arXiv:2607.06519
- arXiv:2607.07953
- arXiv:2607.08028
- arXiv:2607.09172
- arXiv:2607.09248
- arXiv:2607.09372
- arXiv:2607.11643
- arXiv:2607.11644
- arXiv:2607.12756
- arXiv:2607.13125
- arXiv:2607.13960
- arXiv:2607.14277
- arXiv:2607.14541
- arXiv:2607.17715
- arXiv:2607.18141
- arXiv:2607.19712
- arXiv:2607.21848
- arXiv:2607.22091
- arXiv:2607.22157
- arXiv:2607.22448
- arXiv:2607.22529
- arXiv:2607.23373
- arXiv:2607.23693
- arXiv:2607.23933
- arXiv:2607.24027
- arXiv:2607.24062
- arXiv:2607.24475
- arXiv:2607.25398
- arXiv:2607.25431
- arXiv:2607.26410
- arXiv:2607.26475
- arXiv:2607.26627
- arXiv:2607.26637
- arXiv:2607.27042
- arXiv:2607.27090
- arXiv:2607.27918
- arXiv:2607.28319
- arXiv:2607.28675
- arXiv:2607.29167
- arXiv:2607.29377
- arXiv:2607.29459
- arXiv:2608.00101
- arXiv:2608.00675
- arXiv:2608.00742
- arXiv:2608.00881
- arXiv:2608.00902
- arXiv:2608.00922
- arXiv:2608.01247
- arXiv:2608.01326
- arXiv:2608.01462
- arXiv:2608.01526
- arXiv:2608.01628
- arXiv:2608.01651
- arXiv:2608.01718
- arXiv:2608.01735
- arXiv:2608.01964
- arXiv:2608.01975
- arXiv:2608.02162
- arXiv:2608.02515
- arXiv:2608.02703
- arXiv:2608.02791
- arXiv:2608.02870
- arXiv:2608.02989
- arXiv:2608.03036
- arXiv:2608.03216
- arXiv:2608.03392
- arXiv:2608.03499
- arXiv:2608.03796
- arXiv:2608.03994
- arXiv:2608.04569
- arXiv:2608.05042
- arXiv:2608.05219
- arXiv:2608.05604
- arXiv:2608.05784
- arXiv:2608.06033
- arXiv:2608.06146
- arXiv:2608.06216
- arXiv:2608.06501
- arXiv:2608.06751
- arXiv:2608.06867
- arXiv:2608.07009
- arXiv:2608.07051
- arXiv:2608.07152
- arXiv:2608.07169
- arXiv:2608.07458
- arXiv:2608.07468
- arXiv:2608.08020
- arXiv:2608.08097
- arXiv:2608.08311
- arXiv:2608.08389
- arXiv:2608.08627
- arXiv:2608.08814
- arXiv:2608.08950
- arXiv:2608.09096
- arXiv:2608.09441
- arXiv:2608.09802
- arXiv:2608.09888
- arXiv:2608.09900
- arXiv:2608.10288
- arXiv:2608.10538
- arXiv:2608.10628
- arXiv:2608.10636
- arXiv:2608.10812
- arXiv:2608.10915
- arXiv:2608.11030
- arXiv:2608.11205
- arXiv:2608.11668
- arXiv:2608.11924
- arXiv:2608.12149
- arXiv:2608.12253
- arXiv:2608.12307
- arXiv:2608.13010
- arXiv:2608.13263
- arXiv:2608.13417
- arXiv:2608.13426
- arXiv:2608.13499
- arXiv:2608.13667
- arXiv:2608.13900
- arXiv:2608.14333
- arXiv:2608.14376
- arXiv:2608.16157
-
arXiv:2608.19758
-
https://blog.modelcontextprotocol.io/posts/2026-07-28
- https://huggingface.co/collections/RedHatAI/speculator-models
- https://arxiv.org/html/2608.14376v1
- https://arxiv.org/html/2608.14333v1
本次变更
2026-08-23 | Tom
- DistillCache/ReCache/Topology-Aware v2(KV Cache三件新论文邻接锚入);TGI EOL官方二次确认;HuggingFace推荐迁移vLLM/SGLang;vLLM Conference Q3 Roadmap六轴预告;Stripe 73%成本案例;FlashPrefill V2 H200 FP8 47.26×;引→258
2026-08-22 | Tom
- K8s生产推理完整数值层首次锚入(Mistral Large 123B;0.344MB/token;128K 44GB);KEDA按KV cache pressure扩缩;DefensiveKV ICLR2026 SnapKV基准修正;kv-cache-analyzer CLI首度锚入;Spheron benchmark首度锚入;RMM缩减矩阵乘法邻接锚入;引→258
2026-08-25 | Tom
- vLLM Conference Day1(08-25,Ray+State of vLLM Keynotes);Dynamo 1.4.1(KV Router+NIXL+Planner;Baseten 34-62%);RTP-LLM(阿里1亿用户;arXiv:2605.29639);pgvectorScale 471 vs Qdrant 41 QPS(50M向量);Multi-Vector全支持(Qdrant v1.10+/Weaviate v1.29+/LanceDB v0.15+/Milvus v2.6.4);LOCOMO benchmark(72.9% acc/17.12s p95/14×token成本);Long Context RAG层次分析(2607.22448;context冲突场景强模型坚持错误记忆);AsymCache(arXiv:2606.02964;Multi-Segment Attention+位置感知重算);SwiftCache(2606.16135;跨模型NVLink共享);Ragged Paged Attention(2604.15464;Google/Mosaic ML;TPU生产级);Qwen3.8全面进入Ollama/Apple MLX/MLX-VLM;OWASP MCP Top10(Dec2025;84.2%工具中毒/82%路径遍历/67%代码注入);引→258