inference · 知识库活文档

  • 更新:2026-08-25 | vLLM Conf Day1;Dynamo 1.4.1;RTP-LLM;pgvecScale 471 QPS;Multi-Vector;LOCOMO;SwiftCache;引→258

一、现状全景:LLM 推理服务工业化成熟与框架收敛

2026 年中,LLM 推理服务已从「能跑就行」进入「工业级优化」阶段。Google 2026-05 数据显示其每月处理 3.2 万亿 tokens(年化 38 万亿),推理占 AI 算力消耗已达约 2/3。推理工程正在成为独立于 AI 工程的学科。

1.1 框架格局:vLLM 与 SGLang 双雄趋同,TGI 正式落幕

vLLM 0.28(2026-08):Model Runner V2(M2)成为 Qwen3 dense 模型的默认执行路径。Experimental Rust frontend 已合入主线,新增 DP Supervisor for data-parallel serving。Device selection 变更:vLLM 不再内部设置 CUDA_VISIBLE_DEVICES,改为提供新的 device_ids 参数(ROCm 上已开始 CUDA_VISIBLE_DEVICES 废弃窗口)。

vLLM v1 重新架构调度器(2026-08 官方博客系列):重新架构调度器(更简单)+ 近零开销 prefix caching + 更清晰的 tensor parallelism + 多进程 API server + Qwen3.8-2.4T-A95B Day 0 支持。async scheduling 将很快默认开启;MoE shared expert overlap 优化(DeepSeek V4 等共享专家模型关键特性);RLHF pause/resume 改进(异步 RL 关键);Prefill Context Parallel 初始支持(长序列新并行方式)。

vLLM 25K TPS/GPU on Qwen3.5(vLLM Blog 2026-07-29):GB200 NVL72 分解式服务架构下达成 25K total TPS/GPU;关键技术栈:Blackwell GDN kernels + HMA cache transfer + async scheduling fixes + srt-slurm recipes;Qwen3.5-397B-A17B(NVFP4 精度)。

vLLM Decode Context Parallelism(DCP):将 decode 阶段 KV cache 分布到多 GPU,计算保持在单卡。与传统 TP 切分不同,DCP 仅对 KV cache 做分布——适合 128K+ 上下文。

vLLM 原生 transformers 后端(HF Blog 2026-08):transformers 库新增 vLLM 原生推理后端,覆盖 450+ 架构通过 transformers API 一致暴露。模型作者无需分别为 transformers 与 vLLM 各写一次 Custom CUDA kernel。

SGLang v0.6(2026-07-27,574 PRs):DSpark 投机解码(DeepSeek-V4-Pro TP8 B300 bs=1 达 383.7 tok/s)+ DFlash + Spec V2(ICML 2026,>4.3× 基线吞吐,1.5× MTP)+ GLM-5.2 NVFP4 agentic workloads 500 TPS(2 周内达生产级)+ PD Disagg GPU Staging Buffer(RDMA 请求数降低约 1000×)+ 全球部署超过 400,000 GPUs + DeepSeek V4 Flash 0731 Day-0 支持。

SGLang Advanced CUDA Graph(LMSYS Blog 2026-08-17,生产调优重要): - full:捕获整个 prefill 为单个 CUDA Graph,实验性,仅 FlashAttention-4/FlashInfer 后端支持 - breakable:分段捕获,可动态处理变长序列,生产推荐 - tc_piecewisetorch.compile):最小代码量(177 行 vs 521 行),生产推荐 - prefill graph 构建速度:breakable / tc_piecewisefull3.8–5.2×

SGLang vs vLLM 选型(2026-08 实测):高并发(64+)时 SGLang 开始全面超越 vLLM;H100 @ Llama 3.1 8B 16K 上下文:SGLang 16,215 tok/s vs vLLM 12,553 tok/s(+29%);shared-prefix 场景 SGLang 领先 2-29%(prefix overlap ratio > 60% → SGLang 显著领先)。

SGLang vs vLLM Schema Complexity Overhead(DeepInfra + Spheron + Particula Tech,2026-08)

Schema 复杂度 vLLM 开销 SGLang(热) SGLang(冷)
扁平 JSON(3 字段) +6% +2% +8%
嵌套 JSON(2 层) +18% +4% +15%
深嵌套(4 层) +42% +6% +24%
函数调用 +22% +5% +18%

四引擎工程选型决策框架(The AI Engineer,Paolo Perrone,2026-04/2026-08 确认)

引擎 定位 核心特性 适合场景
Ollama 本地快速启动 ollama run llama3.1 一命令运行;M4 Mac 跑 Qwen 2.5 32B ≈ 15 tokens/s 单用户、macOS/Windows 快速实验
vLLM 生产默认 PagedAttention 防 GPU 内存浪费;硬件覆盖最广;生态最大 通用生产级部署首选
SGLang 前缀复用密集 RadixAttention 前缀缓存;共享上下文吞吐量 +29%(vs vLLM) 多轮对话、RAG pipeline、Agent 循环
TensorRT-LLM 极致 NVIDIA 性能 手工调优;H100 上比 vLLM 高 15-30%;需 1-2 周编译调优 峰值性能优先、模型固定不变的生产场景
llama.cpp 边缘/本地 MTP 在 Qwen 3.6 27B 上 >×2 加速;Qwen 3.6 35B 上 MTP 有精度退化 CPU/边缘/无 GPU 环境

工程决策树

需要 5 分钟内跑起来?→ Ollama
多用户并发 + 请求共享上下文(聊天/RAG/Agent)?→ SGLang(+29% 吞吐)
请求完全唯一无重复?→ vLLM
NVIDIA 硬件 + 模型固定 + 愿意投入 1-2 周调优?→ TensorRT-LLM
边缘/无 GPU/CPU 优先?→ llama.cpp

TGI(HuggingFace Text Generation Inference)已正式进入维护模式:HuggingFace 官方博客二次确认(2026-08),TGI 只接受 minor bug fix PR,不再作为未来方向推荐;官方建议迁移路径为 vLLMSGLang

Q2 2026 Engine Benchmark(H100 SXM 80GB Llama 3.3 70B FP8,Spheron + Prem AI)

Engine 吞吐量 tok/s TTFT p50 TPOT p50 冷启动
SGLang ~16,200 79ms 7.9ms ~58s
LMDeploy ~16,200
vLLM ~12,500 82ms 8.2ms ~62s
TensorRT-LLM 2,100 75ms 7.6ms ~28min

Qwen3.8 on Ollama / Apple MLX(2026-08 新增):Qwen3.8 系列(2.4T 稀疏 MoE,512 experts)已全面进入 Ollama、Apple MLX、MLX-VLM 等本地/边缘推理栈。Apple Silicon 被正式确立为一类推理目标

llama.cpp 突破 100k GitHub Stars:Georgi Gerganov 创建的本地 LLM 推理引擎在量化生态(CPU/边缘/嵌入式)保持主导地位。

1.2 PD Disaggregation:正反案例对照与新兴架构

PD Disaggregation 成功场景(正面)

  • DCP(Decode Context Parallelism,vLLM 2026-08):KV cache 分布到多卡、计算在单卡,适合 128K+ 上下文。
  • CXL+PIM(HotInfra 2026):Prefill 在 GPU HBM,Decode 在 CPU+CXL DDRx,KV Cache 通过 CXL 共享内存互联;32K tokens 生成 DeepSeek-R1-671B 吞吐量 2.4×;CapEx 20.6× / OpEx 17×。
  • AMPD(arXiv:2602.14516v2,ICML 2026):自适应多轮 PD 路由,动态决定 co-locate/disaggregate。

PD Disaggregation 失效场景(反面)

  • Not All Prefills Are Equal(arXiv:2603.13358):系统论证了 PD disaggregation 在多轮 Agent 场景存在严重低效——多轮 Agent 每次用户输入都触发 prefill,而 prefill 高计算成本在短轮次下无法摊薄。多轮 Agent 场景建议用 native vLLM/SGLang

1.3 新模型对推理引擎的影响

Qwen3.8-2.4T-A95B(2026-08-12):2.4T 参数稀疏 MoE,512 experts;vLLM Day 0 支持。

DeepSeek V4 Flash 0731(2026-07-31,MIT):284B 总参/13B 激活,MoE 256 路由专家+1 共享专家;Terminal Bench 2.1 82.7%(vs V4 Flash Preview 61.8%)。

Muse Glimmer 30B(Meta,2026-08-10):Apache 2.0 许可证;RTX 5090 推测解码 233 tok/s;vLLM/SGLang Day-0 支持。

Kimi K3(Moonshot AI,2026-07-27):2.8T 参数,MoE,896 experts;NoPE everywhere;vLLM Day-0 支持;SGLang v0.6+ Day-0 支持。

1.4 llm-d CNCF Sandbox:Kubernetes 分布式推理编排一级公民

llm-d 正式加入 CNNC Sandbox(2026-03-24):创始成员 Red Hat + Google Cloud + IBM Research + CoreWeave + NVIDIA。

llm-d v0.7(2026-08):KV cache memory 降低 50-60%(GDS GPUDirect Storage 支持);EPD(Encode/Prefill/Decode)分解支持;Pure Go ZMQ 实现(消除 CGO 依赖)。

CNCN K8s AI 推理扩展(2026-08-11):KRO + KAR v1.35 + Kubernetes AI Conformance Program + Kueue + llm-d + vLLM extension。66% 的 GenAI 推理运行在 K8s 上

1.5 vLLM Conference 2026(2026-08-25-26,SF)

首届 vLLM Conference(vLLM.ai/events/vllm-conference/2026):与 Ray Summit 联合举办,Sessions 涵盖:vLLM roadmap、hardware backends(NVIDIA/AMD/Google TPU)、agentic serving、training、production inference。2026-08-25 为首日 Keynote

二、关键工作脉络:从单点突破到系统协同

2.1 PagedAttention 与 vLLM MRV2

arXiv:2309.06180(vLLM 团队)引入 PagedAttention,将操作系统虚拟内存分页管理思想引入 KV cache 管理。核心贡献:PagedAttention(GPU 显存按需分页分配,消除碎片)、Continuous Batching(动态插入新请求)、Prefix Caching(共享 KV cache 减少重复计算)、Chunked Prefill(大 prompt 分块处理避免饥饿)。

MRV2(Model Runner V2)是 vLLM 0.17+ 从头重写的模型执行层,在 v0.25+ 成为所有 dense 模型的默认执行路径。FlashInfer 定位:Blackwell(B200/B300)FlashInfer 为默认 attention backend;Hopper(H100/H200)FlashAttention 默认,VLLM_ATTENTION_BACKEND=FLASHINFER 可选开启。

2.2 投机解码(Speculative Decoding)全景

主流 Drafting 算法(2026-08 更新)

方法 核心机制 关键数据 状态
EAGLE3 自回归 draft,层层验证 Qwen3-Coder-Next 80B MoE:SWEBench 1.52× vLLM mainline(0.9.1 CUDA graphs)
P-EAGLE(vLLM 0.19+) 并行预测多个 draft token,多树推测 Coding benchmark 4-5× 基线,20-30% over EAGLE3 vLLM mainline
DFlash(ICML 2026,LMSYS) Block diffusion drafting + KV injection >4.3× 基线吞吐,1.5× MTP;高并发 >8 时退化至基线以下 vLLM 0.27 集成
DSpark(SGLang v0.6) Confidence-Driven Variable-Length DeepSeek-V4-Pro TP8 B300:383.7 tok/s;batch 1-256 全范围最优 SGLang mainline
Arctic Inference(Snowflake) Suffix Decoding,CPU 上 20μs/token,无需 draft model 无 draft model vLLM 插件
SSD(Second Speculative Decoding) 二阶推测:draft model 自己验证自己后再交 target 验证 最高 2× over spec decode SGLang 已支持

Thought-Level Beam Search(arXiv:2608.08020):在 Thought(思维)级别而非 Token 级别做束搜索,主动将计算分配到最有潜力的部分轨迹。与 Speculative Decoding 的区别:Speculative Decoding 是在生成路径上的预测-验证;Thought-Level Beam Search 是在推理路径上的计算预算分配。

CoRun(arXiv:2608.14376):Continuous Batching 形状固定的调度系统。核心问题:continuous batching → 不同长度请求混合 → CUDA Graph 形状不固定 → 无法有效利用 graph replay 加速。解法:① Prefill 隔离每个请求自然形状;② Decode pad 到最大并发,生成固定形状 CUDA Graph;③ 固定形状 graph 可 replay,保持高吞吐。关键数据:吞吐量提升 15–324%(所有模型均超过 2×),输出 bit-identical

2.3 调度与系统

LLM Serving 数学优化 Position Paper(arXiv:2605.01280v1,ICLR 2026):LLM 推理 serving 已超越通用启发式方法,需要数学优化与算法基础。关键结果:barrier-synchronized + sticky-assignment 设置下的 online request routing 与 DP load balancing,算法相对默认策略的 long-run average imbalance 改善因子为 Ω(√(B log G))

LLMRouter(arXiv:2608.06867):LLM 路由的统一公式化,含五组件:Context Encoders / Model Encoders / Scoring Functions / Decision Rules / Learning Signals。

OmniInfer(arXiv SESAME '26):Prefix-Cache-Aware 负载调度。调度评分公式:πP(i) = MatchP(i) − α·ρP。覆盖完整请求生命周期 8 阶段:tokenize → APC matching → prefill wait → prefill scheduled → prefill running → decode wait → decode scheduled → decode running。

GORGO(arXiv:2602.11688v3):跨区域 Prefix-Cache 感知的 LLM 路由调优。核心问题:一致性哈希或前缀复用路由在 bursty workload 下会导致热点 replica 队列排队(HOL blocking)。90% 前缀匹配的 100K token 请求 → 只需 prefill 10K token。

An Internet for the KV Cache(arXiv:2608.01526v1):KV Cache 应该成为基础设施级一等公民(类似 CDN)。联合优化:compression + offloading + prefetching + routing + recomputation + scheduling + model-level reuse。工程意义:概念框架论文,但指明了 2027-2028 年 KV Cache 分布式系统的研究方向。

三、KV Cache 管理:二十+路线

3.1 全景分类(arXiv:2607.02574)

From Tensor Buffer to Distributed Memory Hierarchy:覆盖 30+ KV-cache 管理系统,五个分类维度(Locality / Lifetime / Ownership / Substrate)和 5 大架构原型:Local-Paged(vLLM)、Disaggregated-Pipeline(SplitServe、FlexServe)、Shared-Store(Mooncake Store、LMCache)、Memory-Pool(vLLM + LMCache MP)、Hybrid-Tier(TTKV、Tutti、ICMSP)。

3.2 KV Cache 工程数学基础

KV Cache 显存公式Memory = 2 × batch_size × seq_len × num_layers × num_kv_heads × head_dim × precision_bytes

Llama 2 70B 单序列 32K 上下文 KV Cache = 10.74 GB(80 层 × 8 KV heads × 128 head_dim × FP16)

PagedAttention 将内存碎片从 60-80% 降至 <4%

GQA(Grouped Query Attention)是降低 KV Cache 最重要的架构选择

3.3 Cache Compression(压缩)

GEAR(arXiv:2403.05527,被引 186 次):三合一压缩(统一量化 + 低秩矩阵近似 + 稀疏矩阵补救离群点),4-bit KV cache 近无损 + 2.38× 吞吐量 + 2.29× 峰值内存降低

TurboQuant(arXiv:2605.19660,ICLR 2026):Key 3-bit + Value 2-bit,6× 压缩,8× 加速。AMD Quark Team 2026 在 vLLM 中产品化。警示:jay 2026-06-11 实测数字 2.69–4.4×(接近无损)vs AIxFunda 2026-08 引用 6×/8×(H100 零精度损失)——两套数字存在矛盾,可能来自不同模型家族/精度/上下文长度的不同评测条件,需 arXiv 原文 PDF 核验。

HiSparse(arXiv:2608.07009,Stanford+UIUC):精确的、与索引器无关的分层 KV cache,HBM 仅维护选定条目,首次让 KV cache 容量可超过 HBM 的请求也可服务。已合并入 SGLang 上游。峰值生成吞吐提升最高 4.7×,同时保持可比的 per-token 延迟。

AsymCache(arXiv:2606.02964):计算-延迟感知的 KV cache 管理。三个关键组件:① Multi-Segment Attention(MSA) 高效处理非连续 KV 上下文;② 缓存驱逐策略联合优化命中率和位置感知重算成本;③ 自适应 chunking 调度器实现高硬件利用率。与 HiSparse 的区别:AsymCache 关注位置感知驱逐和重算成本对齐,HiSparse 关注稀疏注意力索引器无关性。

SwiftCache(arXiv:2606.16135):协作推理系统,支持异构模型跨服务器共享 GPU 内存和 NVLink 带宽。跨模型 KV cache 共享通过 NVLink 实现,避免慢速 PCIe 传输。适合多模型服务(不同版本/量化级别模型)共享 prefix cache。

DASH(arXiv:2608.14333):High-Bandwidth Flash 与 HBM 双层 KV Cache 管理,专为 MoE LLM 设计。核心问题:MoE LLM KV cache 容量超 HBM(Llama 4 Maverick KV cache 197.41 GB,超过单卡 HBM)。HBM 吸收细粒度写入;Flash 批量写回。关键数据:Llama 4 Maverick 上比 RelayOnly 提升 1.92× 吞吐量,降低 E2E 延迟 48%

Ragged Paged Attention(arXiv:2604.15464,Google/Mosaic ML):TPU 上 PagedAttention 的生产级替代方案。完整 benchmark 表格:context length 512~32768 各档位的 latency (μs)、throughput (GB/s)、MBU (%). Llama 3 8B @ TPU7x,decode 场景 MBU 86%,prefill 场景 MFU 73%。三大技术:fine-grained tiling、KV cache update 与 attention 融合、distribution-aware compilation。已集成:vLLM-TPU(2025.02,2-5x token throughput 提升)和 SGLang(2025.10,标准 TPU backend)。

LMCache(arXiv:2510.09665,MLSys 2026 Best Paper):首个高效开源 KV caching 解决方案,可跨引擎和查询共享 KV cache。关键数据:input token cost −90% / speed 14× / startup 3min→30s,30+ 公司生产部署(Google Cloud、AWS、NVIDIA、IBM)。

RTP-LLM(arXiv:2605.29639,阿里巴巴工业级推理引擎):面向工业级 LLM 部署的高性能推理引擎,已在 Alibaba Group 成功部署,服务超过 1 亿用户,通过集成设计解决根本性瓶颈。

vToken(arXiv:2608.13263):Token-Level Virtualization for Reclaimable KV Caches。PagedAttention 解决了 block 级碎片;vToken 在 token 级做 KV cache 虚拟化和细粒度回收。

ACL 2026 新增 KV 优化件

技术 来源 说明
MiniKV(ACL 2026) Akshat Sharma et al. 2-bit layer-discriminative KV 量化
KVTuner(ACL 2026) Xing Li et al. Sensitivity-aware layer-wise mixed-precision KV 量化
HiFC(ACL 2026) Inho Jeong et al. Flash-based KV cache swapping GPU memory ↔ SSD
TinyServe(ACL 2026 Award) Dong Liu et al. Query-aware cache selection
QJL(ACL 2026) Amir Zandieh et al. 1-bit 量化 JL Transform for KV cache

3.4 Hybrid Memory(混合存储)

TTKV(arXiv:2604.19769):Temporal-Tiered KV Cache(HBM=短期,DRAM=长期);128K 上下文任务跨层流量减少 5.94×,延迟降低 76%。

ICMSP(NVIDIA CES 2026):三层存储(GPU HBM → CPU DRAM → NVMe SSD),cuFile GPU-direct NVMe + BlueField-4 DPU;NIXL(NVIDIA Inference Xfer Library)= KV block 传输协议。

Mooncake(kvcache-ai/Mooncake):Kimi 的 LLM 服务平台,PD 分离架构 + KVCache 池化。2026-05-07 vLLM 正式集成 Mooncake Store——vLLM + Mooncake Store 在真实 agentic traces 上实现 3.8× 更高吞吐、46× TTFT 降低、8.6× 端到端延迟降低。

3.5 KV Cache 可观测性工具链

kv-cache-analyzer(bs258q/kv-cache-analyzer,MIT):生产 KV cache 的 CLI 分析工具,提供多场景 LRU hit rate 实测数字。

vLLM Prefix Caching 失效条件(HowToUseAI,2026-08,工程实战)

失效原因 机制 解决方案
空格差异 hash 不同 规范化 prompt 格式
tool definition 顺序变化 hash 不同 固定工具定义顺序
时间戳位置不对 hash 不同 时间戳移至独立字段
任意 token 差异 必须重新计算 共享前缀结构化

TTL 机制:缓存 KV tensor 占 GPU 内存,providers 通常设 5-10 分钟 TTL 后自动清除。实测收益估算:相同 system prompt + RAG 上下文 = 每次调用节省约 5 秒 prefill 时间

四、推理成本工程与基准

4.1 llm-d:Kubernetes 分布式推理编排成为 CNNC Sandbox

llm-d 正式加入 CNNC Sandbox(2026-03-24):创始成员 Red Hat + Google Cloud + IBM Research + CoreWeave + NVIDIA。

NVIDIA Dynamo 1.4.1(2026-08-22 更新):KV Router + NIXL + Planner + OpenAI 兼容 API。KV Router 智能请求路由 + 前缀感知缓存;Planner SLA 感知调度。Baseten 实测:34-62% 性能提升。

K8s 生产推理部署完整数值层(framsouza/inference-at-scale-on-kubernetes)

核心数字(Mistral Large 123B,BF16): - KV cache per token:0.344 MB/token - 128K 单请求 KV cache:~44 GB - 单卡 H100 80GB 并发上限:~16–44 conversations(取决于序列长度)

KEDA 按 KV cache pressure 扩缩vllm:gpu_cache_usage_perc > 80–85% 触发 scale-up——比 queue depth 信号更提前(queue depth > 0 出现时已在加延迟)。

OpScale(arXiv:2608.13499,MSRA):Operator-Level Provisioning and Autoscaling for LLM Serving。在 40×A100 和 24×GB200 上验证;达成 SLO 达标率的同时,成本降低 36.3%。核心发现:prefill 是 compute-bound,decode 是 memory-bound——两者弹性特征迥异。

4.2 推理经济学与生产工程

AWQ INT4 量化并发 3× 提升(CSDN 博客 A/B 实测):14.7GB 模型压缩至 4.2GB(3.5× 压缩比),并发数从 12 提升到 36(3×)。RTX 4090 FP8 最优配置:Ada Lovelace 架构原生 FP8 支持,该卡上 FP8 表现优于 INT8/INT4。

TensorRT-LLM FP8 深度优化(CSDN):实测 Llama 3 70B + H100:FP8 推理速度提升 2.58 倍,显存减少 50%,PPL 仅增加 0.04。

Continuous Batching 23× 吞吐基准(Anyscale,MLwithDev 2026-08):Continuous Batching + vLLM PagedAttention = OPT-13B A100 40GB 上 23× 吞吐(vs naive batching)。

gpu_memory_utilization 软限制陷阱(CSDN 源码分析,2026-08)gpu_memory_utilization软限制/目标预算,非硬限制;0.8 比 0.7 更容易 OOM——原因是 warmup dummy requests 阶段已分配大部分显存。CUDA graphs 额外开销:1~3 GiB per GPU

bench_serving 完整命令库(CSDN 实测):SGLang benchmark 命令:

python3 -m sglang.bench_serving \
  --backend sglang --dataset-name random \
  --num-prompts 1024 --random-input 1024 --random-output 128 \
  --request-rate 128 --max-concurrency 128 \
  --warmup-requests 16 --base-url http://localhost:30000

vLLM benchmark(含 pd-separated):

python3 -m sglang.bench_serving \
  --backend vllm --model Qwen/Qwen3-32B-FP8 \
  --dataset-name random --num-prompts 1024 \
  --random-input 2048 --random-output 512 \
  --max-concurrency 512 --warmup-requests 1 \
  --pd-separated --base-url http://localhost:9000

vLLM 生产部署监控端点: - http://localhost:8000 - http://localhost:8000/metrics Prometheus 指标

Prometheus 内存监控规则

(container_memory_working_set_bytes{container!="POD"} /
 on(pod) container_spec_memory_limit_bytes) > 0.8

⚠️ 不要给 vLLM pod 设置 CPU limits——CPU throttling 会拖慢 tokenization 和请求处理,只设 CPU requests 用于调度。

4.3 HF State of Open Models: Summer 2026(关键生态数据)

指标 数据
HF Hub 模型总量 296 万(+22% YoY)
数据集总量 100 万(+40% YoY)
Spaces 总量 144 万(+44% YoY)
gguf 库仓库存量增长 464%(7 个月内)
Apple MLX 增长 148%
Qwen 衍生模型数 151,448(Llama 的 4.7×)

标志性转变:Agent(机器用户)首次成为 HF Hub 第一大用户类型——意味着基础设施需要面向机器友好的 API 和工具。

五、Serving Security:推理引擎安全的新硬约束时代

5.1 vLLM 安全漏洞矩阵(2026-08,集中披露期)

CVE-2026-73558(CVSS 5.3 Medium):整数溢出 blockIdx.x ²ᵈ in act_and_mul_kernel 导致同一批次中其他用户的推理结果部分或完整泄漏给当前用户。影响 vLLM < 0.27.0。修复:≥ 0.27.0

CVE-2026-73559(CVSS 5.3 Medium):同批次跨用户数据泄漏的另一个触发路径。影响 vLLM < 0.26.0

CVE-2026-22778(已知被利用,CVSS 9.8):vLLM 0.8.3-0.14.0 存在 Critical RCE。

GHSA-7m6h-x95x-82q5(2026-08-11):vLLM CVE-2026-22778 incomplete fix——通过 Anthropic router 泄漏 PIL repr 地址。

GHSA-cqm8-jxg6-fqfq(2026-08-11):vLLM Unauthenticated Requests——DeepStream backend confusion 导致 DoS。

检测命令vllm --version,确认版本 >= 0.27.0。

5.2 LMDeploy 安全漏洞

CVE-2026-33626(Sysdig 2026-08-19,Critical):LMDeploy load_image() 函数对传入的 image URL 不验证目标是否为保留 IP 段、链路本地地址或回环地址,攻击者可借此访问云元数据服务(AWS http://169.254.169.254/)、内网资源。修复版本:≥ 0.12.3。从 GHSA 公布到首次利用:12 小时 31 分钟

Sysdig 结论:AI 推理框架漏洞在披露后数小时内即被武器化——传统的"补丁星期二"节奏和月度扫描已不足以应对。快速响应 SLA:< 24 小时补丁响应

5.3 SGLang 安全漏洞

CVE-2026-3059 / CVE-2026-3060 / CVE-2026-3989(2026-06-25):SGLang 三连发安全漏洞。

5.4 KV-Cache Timing Side-Channel

多租户 LLM 推理系统(如 vLLM prefix caching)中,攻击者通过测量 TTFT 差异可判断特定 token 序列是否被其他用户缓存。防御策略:多租户分桶 / 延迟噪声注入 / 加密 token 缓存 / 租户标签限制。

六、Agent 生产推理的特殊考量

6.1 Agentic 推理三层架构收敛

Lilian Weng Harness Engineering(2026-07-04):Harness = LLM + Memory + Tools + Planning + Action + Workflow Design + Eval + Permission Controls + Persistent State。

AI Agents Stack 2026(The AI Engineer,2026-06)

Layer 1: LLM(推理核心)
Layer 2: Tool / Action(工具执行,MCP 协议)
Layer 3: Memory(会话/长期记忆,三层架构)
Layer 4: Guardrails(Agent 专用护栏)
Layer 5: State Management(状态管理,状态图)
Layer 6: Observability + Evals(可观测性 + 评测)

Eval Gap:LangChain 调查显示 89% 的生产 Agent 团队有可观测性建设,但仅 52% 有正式评价体系——差距 37 个百分点

6.2 MCP 2.0 无状态协议(2026-07-28 官方发布)

三大核心更新:Multi-Round-Trip Requests(MRTR)+ Required issuer authorization metadata + 完全远程化(支持 stateless、cacheable、routable 流量)。

企业采用数据(2026 年 8 月):80% Fortune 500 已在生产部署 AI Agent;28% 已实现 MCP 服务器;月 SDK 下载 9700 万次;公开 MCP 服务器 10,000+。

OWASP MCP Top 10(Dec 2025):MCPTox 基准测试发现自动审批模式下 84.2% 工具中毒成功率;2,614 个 MCP 服务器中 82% 存在路径遍历漏洞67% 存在代码注入风险安全审计亟待制度化

6.3 Agent Memory Benchmark 与设计

LOCOMO Benchmark(Dec 2025 survey "Memory in the Age of AI Agents"):full-context retrieval = 72.9% accuracy,但 p95 latency = 17.12s,≈ 26,000 tokens/conversation。关键推论:17s tail latency = 约 1/20 用户等待 17s,token 成本是选择性 memory 的 14 倍。正式将 agent memory 与 RAG/context/LLM memory 区分,memory 治理要求:每条 memory 需记录 Memory ID/Type/Scope/Creation source/Timestamp/Retrieval confidence/Influence flag。

Long Context RAG 信息遗漏层次分析(arXiv:2607.22448v3):三类 needle(literal、paraphrase、conflict)诊断信息遗漏层次。当上下文与模型参数记忆冲突时,强模型倾向于坚持错误内部记忆而非信任上下文证据(context conflict 场景尤其严重)。fine-tuning 无法完全修复此问题。简单增加 context window 不能解决知识冲突,需要在 retrieval 层面做更精细的置信度判断。

LongHorizon-Harness(arXiv:2608.01964,Alibaba):通过 manage-execute-audit 循环,显式追踪已验证任务状态,提升长时 Agent 任务完成率。

七、RAG 与长上下文

7.1 Vector Database 2026 格局重塑

pgvectorScale vs 专用向量库(2026):pgvectorScale 在 5000万向量规模下实测 471 QPS / 99% recall,Qdrant(专用向量库)实测 41 QPS——差距约 10 倍。2026 年主流数据库全部内置向量支持:PostgreSQL(pgvector/pgvectorscale)、MongoDB、Oracle、Azure HorizonDB、AWS Neptune、Google,均已将向量搜索作为标准功能。向量检索质量更多取决于分块策略 + 重排序(chunking & reranking),而非底层数据库选型。

向量数据库选型决策: - <10M 向量/200 QPS → pgvector/pgvectorScale - billion-scale + sub-50ms → 专用向量 DB(Milvus/Qdrant/Weaviate) - 10-100M 向量 + 高精度 → Qdrant v1.10+ / Milvus v2.6.4

Multi-Vector(Late Interaction / ColBERT)支持现状(Hugging Face Blog 2026):原生支持 late interaction 多向量索引的数据库:Qdrant(v1.10+)、Weaviate(v1.29+)、Vespa、LanceDB(v0.15+)、VectorChord(Postgres 扩展)、Milvus(v2.6.4,array-of-structs 形式)。ColBERT/MAXSIM 模式:Qdrant 推荐 hnsw_config=HnswConfigDiff(m=0),适合 Retrieve-then-Rerank 流程(候选集 200-500 条规模)。

7.2 RAG 架构升级路径

RAG 架构演进(AI Thinker Lab,2026-08)

naive RAG → +hybrid retrieval → +reranker → +CRAG/Self-RAG → GraphRAG → Agentic RAG

GraphRAG 适用条件:跨文档综合。不适用场景:简单 lookup。

2026 MLOps Community benchmark(RAG About It):47 生产部署,agentic pipeline + knowledge graph → 幻觉率降低 62%

具体 RAG 架构升级路径:naive RAG → +hybrid retrieval → +reranker → +CRAG/Self-RAG → GraphRAG → Agentic RAG。June 2026 Carnegie Mellon preprint:9,000 题金融合规数据集,幻觉率 14.1% → 4.9%,延迟 +220ms。

关键工程判断:pure semantic search 几乎总是输给 hybrid(dense + BM25)

八、共识与争议

8.1 共识

  • PagedAttention 是 KV cache 管理的事实标准;MRV2 成为所有 dense 模型的默认执行路径(v0.25+)
  • FlashInfer 是 Blackwell(B200/B300)默认 attention backend
  • Continuous batching 是生产推理引擎标配;23× 吞吐(Anyscale OPT-13B 基准)
  • FP8 是 KV cache 量化的最佳默认
  • vLLM + SGLang 开源双雄格局在 2026 年进一步巩固(TGI EOL 后五大框架)
  • SGLang + LMDeploy ~16,200 tok/s vs vLLM ~12,500 tok/s(H100)
  • SGLang 全球部署超过 400,000 GPUs
  • NVIDIA Dynamo 1.4.1(2026-08-22):KV Router + NIXL + Planner + OpenAI 兼容 API;34-62% 性能提升
  • RTP-LLM(arXiv:2605.29639):Alibaba 工业级推理引擎,服务超过 1 亿用户
  • pgvectorScale 471 QPS vs Qdrant 41 QPS(50M 向量,99% recall)——10× 差距
  • Multi-Vector 全支持:Qdrant v1.10+ / Weaviate v1.29+ / LanceDB v0.15+ / Milvus v2.6.4
  • LOCOMO benchmark:full-context retrieval 72.9% accuracy,p95 latency 17.12s(17s × 14倍 token 成本)
  • AsymCache(arXiv:2606.02964):Multi-Segment Attention + 位置感知重算成本对齐
  • SwiftCache(arXiv:2606.16135):跨模型 KV cache 共享 over NVLink,避免 PCIe 传输
  • Ragged Paged Attention(arXiv:2604.15464):TPU 生产级 PagedAttention 替代方案;已集成 vLLM-TPU 和 SGLang TPU backend
  • Qwen3.8 全面进入 Ollama / Apple MLX / MLX-VLM:Apple Silicon 正式成为一类推理目标
  • DASH(arXiv:2608.14333):HBM+Flash 两级 KV Cache 管理,MoE 197.41GB KV cache → 1.92× 吞吐 / 48% 延迟降低
  • CoRun(arXiv:2608.14376):Continuous batching 形状固定 → 15-324% 吞吐提升,输出 bit-identical
  • LMCache(MLSys 2026 Best Paper):input token cost −90% / speed 14× / startup 3min→30s
  • llm-d CNNC Sandbox:Kubernetes 分布式推理编排成为一级云原生工作负载
  • vLLM 0.28:M2 默认路径扩展 + Experimental Rust frontend 合入主线 + DP Supervisor
  • SGLang vs vLLM Schema Complexity:深嵌套 JSON(4层)SGLang +6% vs vLLM +42%(7× 差距)
  • LMDeploy CVE-2026-33626:SSRF via load_image();12h31m weaponization;<24h 响应 SLA
  • SGLang CVEs 三连发:CVE-2026-3059 / CVE-2026-3060 / CVE-2026-3989(2026-06-25)
  • vLLM 安全五连发(2026-07~08):CVE-2026-22778 incomplete fix / Unauthenticated DoS / Cross-User Data Leak / Derender / Dependency Confusion
  • OWASP MCP Top 10(Dec 2025):84.2% 工具中毒成功率(auto-approval);82% path traversal;67% code injection
  • vLLM Conference 2026(2026-08-25-26):首届 vLLM Conference 与 Ray Summit 联合举办
  • An Internet for the KV Cache(arXiv:2608.01526):KV Cache 即 CDN 概念框架;2027-2028 分布式系统研究方向
  • gpu_memory_utilization 软限制陷阱:0.8 比 0.7 更易 OOM;warmup 阶段已分配;CUDA graphs 1-3 GiB/GPU

8.2 争议

  1. KV cache 压缩的精度边界:TurboQuant/GEAR/C2KV/MiniKV/KVTuner 等带来显著加速,但精度损失边界尚无统一评估标准
  2. Disaggregation 的运维复杂度:Google/AWS/Azure 均采用,但中小规模团队是否值得承担存在分歧
  3. PD Disaggregation 多轮 Agent 失效:Not All Prefills Are Equal 揭示多轮场景 disaggregation 低效
  4. pgvectorScale 10× QPS 差距的可持续性:Qdrant 专注向量操作优化,pgvectorScale 受益 PostgreSQL 生态;不同测试条件可能逆转
  5. LOCOMO 72.9% accuracy 的测试条件:不同模型家族/任务类型可能显著偏离
  6. TurboQuant 数字矛盾:jay 2026-06-11 实测 2.69–4.4×(接近无损)vs AIxFunda 2026-08 引用 6×/8×(H100 零精度损失)
  7. DASH HBF endurance 0.645 年建模假设:连续满载写入极端情况,实际生产 endurance 需结合使用模式估算
  8. CoRun 15–324% 吞吐量提升:数字来自论文自身评测,评测环境细节需 PDF 核验

九、开放问题与趋势

9.1 开放问题

  • AsymCache / SwiftCache / Ragged Paged Attention 生产落地验证:三篇 arXiv 均在 2026 年中发表,生产集成状态待跟盯
  • NVIDIA Dynamo 1.4.1 Planner SLA 感知调度的真实收益:KV Router + NIXL + Planner 三件套生产联合效果数据不足
  • pgvectorScale 继续扩缩 vs 专用向量库:两者差距在 billion-scale 是否持续
  • OWASP MCP Top 10 修复状态:2,614 个 MCP 服务器的 82%/67% 漏洞是否已在修复中
  • Qwen3.8 在 Ollama / MLX 的量化支持完整性:Apple Silicon + MoE 量化是否已完整支持

9.2 趋势

  • RTP-LLM 路线:Alibaba 将内部推理引擎优化方法论向外辐射,值得跟盯生产案例
  • LLM Serving 数学优化(arXiv:2605.01280):从 heuristic 到 formal optimization 的范式转变
  • 推理安全 SLA 进入 < 24 小时时代:LMDeploy CVE-2026-33626 12h weaponization 确立新基准
  • Agent Memory 作为一等架构原语:三层架构(Working/Episodic/Semantic)而非"加个向量数据库"
  • Multi-Vector RAG 生态成熟:Qdrant/Weaviate/LanceDB/Milvus 全面支持后,ColBERT 范式进入生产可用

附:引用锚点

  • arXiv:2303.05527
  • arXiv:2309.06180
  • arXiv:2311.06281
  • arXiv:2403.05527
  • arXiv:2404.19769
  • arXiv:2404.26557
  • arXiv:2502.20330
  • arXiv:2504.11320
  • arXiv:2504.19874
  • arXiv:2506.04565v2
  • arXiv:2506.09713
  • arXiv:2507.06608
  • arXiv:2510.09665
  • arXiv:2511.01815
  • arXiv:2601.06288
  • arXiv:2601.19139
  • arXiv:2601.20309
  • arXiv:2602.00328
  • arXiv:2602.10238
  • arXiv:2602.11688
  • arXiv:2602.14516
  • arXiv:2602.21548
  • arXiv:2603.04428
  • arXiv:2603.08739
  • arXiv:2603.09619
  • arXiv:2603.12831
  • arXiv:2603.13358
  • arXiv:2603.15569
  • arXiv:2603.17456
  • arXiv:2603.20397
  • arXiv:2603.21354
  • arXiv:2604.00499
  • arXiv:2604.01395
  • arXiv:2604.01927
  • arXiv:2604.03143
  • arXiv:2604.07609
  • arXiv:2604.11001
  • arXiv:2604.12374
  • arXiv:2604.15464
  • arXiv:2604.15732
  • arXiv:2604.16395
  • arXiv:2604.17227
  • arXiv:2604.19157
  • arXiv:2604.19769
  • arXiv:2604.25724
  • arXiv:2604.25899
  • arXiv:2604.26557
  • arXiv:2605.00528
  • arXiv:2605.01280
  • arXiv:2605.01920
  • arXiv:2605.02189
  • arXiv:2605.03344
  • arXiv:2605.03375
  • arXiv:2605.04595
  • arXiv:2605.11186
  • arXiv:2605.11733
  • arXiv:2605.15051
  • arXiv:2605.16867
  • arXiv:2605.17613
  • arXiv:2605.19537
  • arXiv:2605.19660
  • arXiv:2605.23215
  • arXiv:2605.27744
  • arXiv:2605.29639
  • arXiv:2606.00760
  • arXiv:2606.01927
  • arXiv:2606.02964
  • arXiv:2606.03811
  • arXiv:2606.03910
  • arXiv:2606.06302
  • arXiv:2606.07362
  • arXiv:2606.08635
  • arXiv:2606.09713
  • arXiv:2606.13681
  • arXiv:2606.14589
  • arXiv:2606.16135
  • arXiv:2606.16867
  • arXiv:2606.17104
  • arXiv:2606.19746
  • arXiv:2606.20295
  • arXiv:2606.25605
  • arXiv:2606.26875
  • arXiv:2606.28565
  • arXiv:2606.29708
  • arXiv:2606.30391
  • arXiv:2607.00482
  • arXiv:2607.00501
  • arXiv:2607.00760
  • arXiv:2607.01065
  • arXiv:2607.01299
  • arXiv:2607.01520
  • arXiv:2607.01792
  • arXiv:2607.02043
  • arXiv:2607.02574
  • arXiv:2607.05061
  • arXiv:2607.05376
  • arXiv:2607.05876
  • arXiv:2607.05936
  • arXiv:2607.06519
  • arXiv:2607.07953
  • arXiv:2607.08028
  • arXiv:2607.09172
  • arXiv:2607.09248
  • arXiv:2607.09372
  • arXiv:2607.11643
  • arXiv:2607.11644
  • arXiv:2607.12756
  • arXiv:2607.13125
  • arXiv:2607.13960
  • arXiv:2607.14277
  • arXiv:2607.14541
  • arXiv:2607.17715
  • arXiv:2607.18141
  • arXiv:2607.19712
  • arXiv:2607.21848
  • arXiv:2607.22091
  • arXiv:2607.22157
  • arXiv:2607.22448
  • arXiv:2607.22529
  • arXiv:2607.23373
  • arXiv:2607.23693
  • arXiv:2607.23933
  • arXiv:2607.24027
  • arXiv:2607.24062
  • arXiv:2607.24475
  • arXiv:2607.25398
  • arXiv:2607.25431
  • arXiv:2607.26410
  • arXiv:2607.26475
  • arXiv:2607.26627
  • arXiv:2607.26637
  • arXiv:2607.27042
  • arXiv:2607.27090
  • arXiv:2607.27918
  • arXiv:2607.28319
  • arXiv:2607.28675
  • arXiv:2607.29167
  • arXiv:2607.29377
  • arXiv:2607.29459
  • arXiv:2608.00101
  • arXiv:2608.00675
  • arXiv:2608.00742
  • arXiv:2608.00881
  • arXiv:2608.00902
  • arXiv:2608.00922
  • arXiv:2608.01247
  • arXiv:2608.01326
  • arXiv:2608.01462
  • arXiv:2608.01526
  • arXiv:2608.01628
  • arXiv:2608.01651
  • arXiv:2608.01718
  • arXiv:2608.01735
  • arXiv:2608.01964
  • arXiv:2608.01975
  • arXiv:2608.02162
  • arXiv:2608.02515
  • arXiv:2608.02703
  • arXiv:2608.02791
  • arXiv:2608.02870
  • arXiv:2608.02989
  • arXiv:2608.03036
  • arXiv:2608.03216
  • arXiv:2608.03392
  • arXiv:2608.03499
  • arXiv:2608.03796
  • arXiv:2608.03994
  • arXiv:2608.04569
  • arXiv:2608.05042
  • arXiv:2608.05219
  • arXiv:2608.05604
  • arXiv:2608.05784
  • arXiv:2608.06033
  • arXiv:2608.06146
  • arXiv:2608.06216
  • arXiv:2608.06501
  • arXiv:2608.06751
  • arXiv:2608.06867
  • arXiv:2608.07009
  • arXiv:2608.07051
  • arXiv:2608.07152
  • arXiv:2608.07169
  • arXiv:2608.07458
  • arXiv:2608.07468
  • arXiv:2608.08020
  • arXiv:2608.08097
  • arXiv:2608.08311
  • arXiv:2608.08389
  • arXiv:2608.08627
  • arXiv:2608.08814
  • arXiv:2608.08950
  • arXiv:2608.09096
  • arXiv:2608.09441
  • arXiv:2608.09802
  • arXiv:2608.09888
  • arXiv:2608.09900
  • arXiv:2608.10288
  • arXiv:2608.10538
  • arXiv:2608.10628
  • arXiv:2608.10636
  • arXiv:2608.10812
  • arXiv:2608.10915
  • arXiv:2608.11030
  • arXiv:2608.11205
  • arXiv:2608.11668
  • arXiv:2608.11924
  • arXiv:2608.12149
  • arXiv:2608.12253
  • arXiv:2608.12307
  • arXiv:2608.13010
  • arXiv:2608.13263
  • arXiv:2608.13417
  • arXiv:2608.13426
  • arXiv:2608.13499
  • arXiv:2608.13667
  • arXiv:2608.13900
  • arXiv:2608.14333
  • arXiv:2608.14376
  • arXiv:2608.16157
  • arXiv:2608.19758

  • https://blog.modelcontextprotocol.io/posts/2026-07-28

  • https://huggingface.co/collections/RedHatAI/speculator-models
  • https://arxiv.org/html/2608.14376v1
  • https://arxiv.org/html/2608.14333v1

本次变更

2026-08-23 | Tom

  • DistillCache/ReCache/Topology-Aware v2(KV Cache三件新论文邻接锚入);TGI EOL官方二次确认;HuggingFace推荐迁移vLLM/SGLang;vLLM Conference Q3 Roadmap六轴预告;Stripe 73%成本案例;FlashPrefill V2 H200 FP8 47.26×;引→258

2026-08-22 | Tom

  • K8s生产推理完整数值层首次锚入(Mistral Large 123B;0.344MB/token;128K 44GB);KEDA按KV cache pressure扩缩;DefensiveKV ICLR2026 SnapKV基准修正;kv-cache-analyzer CLI首度锚入;Spheron benchmark首度锚入;RMM缩减矩阵乘法邻接锚入;引→258

2026-08-25 | Tom

  • vLLM Conference Day1(08-25,Ray+State of vLLM Keynotes);Dynamo 1.4.1(KV Router+NIXL+Planner;Baseten 34-62%);RTP-LLM(阿里1亿用户;arXiv:2605.29639);pgvectorScale 471 vs Qdrant 41 QPS(50M向量);Multi-Vector全支持(Qdrant v1.10+/Weaviate v1.29+/LanceDB v0.15+/Milvus v2.6.4);LOCOMO benchmark(72.9% acc/17.12s p95/14×token成本);Long Context RAG层次分析(2607.22448;context冲突场景强模型坚持错误记忆);AsymCache(arXiv:2606.02964;Multi-Segment Attention+位置感知重算);SwiftCache(2606.16135;跨模型NVLink共享);Ragged Paged Attention(2604.15464;Google/Mosaic ML;TPU生产级);Qwen3.8全面进入Ollama/Apple MLX/MLX-VLM;OWASP MCP Top10(Dec2025;84.2%工具中毒/82%路径遍历/67%代码注入);引→258