inference · E1 预消化简报(2026-08-14)

执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-13 22:20 → 2026-08-14 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(2026-08-14 Bole/AcceptMoE/AOSpec投机解码+LMDeploy~16K+sglang 64+并发优势+vllm-mlx+Q2 benchmark+vLLM 0.9.1) 本棒性质: inference 主题 E1 日间预消化轮;不重写活文档,只列近 24h 新硬增量供今晚活文档接力决策参考


状态

  • 增量条数: 4 条主线(含 1 条首度锚入 inference 主题;邻接 5 条)
  • 显著新增: 有(阿里云精确版本号压测+vLLM GPU crash rate实锤安全区+C2KV KDD 2026跨请求复用+vLLM 0.19精确升级路径均属inference主题严格新量)
  • 本棒说明: Aug 13→14 窗口 inference 主题核心增量来自 jay 全天主力棒(inference-agent-rag-engineering/csdn-inference-rag-quantization-highvalue/inference-vector-rag-k8s/ai-agents-stack-2026-substack/five-category-evening-briefing)+spark llm-infra-e1prep(4件工程补丁+1件邻接);paper_cards 8-14净增68张中无inference主分类新卡;新增C2KV(2607.17715)为KV-Cache第13路线候选;本棒聚焦spark llm-infra-e1prep未完整覆盖的inference专属发现
  • 涉及 arXiv 号: 4 件净增(2件inference主题);1件邻接沿用

一、最重要的 4 条增量

增量 1【推理引擎 · §1.(1) + §1.(7)】vLLM 0.19 Model Runner V2 / P-EAGLE / FlexKV Offloading / gRPC Serving —— vLLM 0.17→0.19 精确升级路径 ★★★★

来源: inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md §二.2.1(InferenceOps Substack State of Model Serving Communities April 2026);inbox/spark/2026-08-14-llm-infra-e1prep.md 增量4 arXiv: 无(InferenceOps Substack + GitHub release notes)

要点: - vLLM v0.17→v0.19 关键进展: - Model Runner V2:模块化架构重构;CUDA graph dispatch 重写 - P-EAGLE(Parallel Speculative Decoding):Eagle3 支持的并行推测解码,进一步提升多核并行效率 - KV Cache Offloading:FlexKV offloading backend + reuse-frequency-gated CPU stores(基于访问频率的 CPU 缓存淘汰) - gRPC serving(--grpc flag):GPU-less rendering serving;多模态预处理与 GPU 推理分离 - NGram GPU Speculative Decoding:兼容 async scheduler - FlashAttention 4 集成 + FlashInfer 0.6.6 - DBO(Dual-Batch Overlap)泛化到所有模型:跨模型批量调度优化 - 周安装量 ~1M/周 → ~2M/周(2026-03,InferenceOps 数据) - 新架构支持:Gemma 4(MoE/多模态/推理/tool-use)+Sarvam MoE+OLMo Hybrid+ColPali - vLLM 推测解码实测(Llama-2-7B drafter → Llama-3.3-70B target): decode-heavy 15-25% speedup;balanced ~8% speedup(Aug 13基线已有,本棒补充P-EAGLE并行机制)

与活文档现有脉络的关系: - inference.md Aug 14版 §1.(1) 五大主流框架已立 vLLM/SGLang双栖;Aug 13版已立Q2 2026 benchmark体系化数据 - 本棒 = vLLM 0.17→0.19精确升级路径首度锚入(Aug 13基线有vLLM推测解码实测数据,无0.19精确版本升级路径);FlexKV offloading是vLLM KV-Cache offloading工程化首度具体化;P-EAGLE并行机制补充§2.3投机解码实现层

建议归入节: §1.(1) 推理引擎新增vLLM 0.19精确升级路径(P-EAGLE/FlexKV/gRPC/DBO泛化/FlashAttn4集成);§2.3 投机解码邻接(P-EAGLE并行机制);§3.3 KV-Cache邻接(FlexKV offloading CPU stores)


增量 2【推理引擎 · §1.(1) + §1.(7)】阿里云函数计算 SGLang v0.4.6.post2-cu124 vs vLLM v0.8.5 压测——精确版本号+并发建议+压测工具 ★★★★

来源: inbox/jay/2026-08-14T1620-jay-csdn-inference-rag-quantization-highvalue.md 条目2(阿里云官方);inbox/jay/2026-08-14-inference-agent-rag-engineering.md 条目3 arXiv: 无(阿里云官方文档)

要点: - 框架版本: SGLang v0.4.6.post2-cu124(内置镜像);vLLM v0.8.5(内置镜像);压测工具:evalscope(魔搭开源) - QWen-QWQ-32B-AWQ:单卡 ~35 tokens/s;双卡TP并行 ~50 tokens/s;建议最大并发 ≤5 - QWen-QWQ-32B:双卡 ~20 tokens/s(Ada单卡显存不足) - SGLang vs vLLM:SGLang在TTFT/TPOT/Throughput多数场景优于vLLM;SGLang启动速度比vLLM快约30%(但均为分钟级) - 显存利用率: 两者启动后均接近100%(模型参数+KV Cache);SM利用率100%(推理时)/0%(空闲) - 多卡收益: 模型越大,TP并行收益越明显(20%~50%) - 关键工程参数: Ada GPU/CUDA 12.4

与活文档现有脉络的关系: - inference.md Aug 13版 §1.(1) 已有SGLang vs vLLM并发数据(SGLang 1856 vs vLLM 1512);已有SGLang冷启动5×数据 - 本棒 = 精确版本号首度锚入(v0.4.6.post2-cu124 / v0.8.5 / CUDA 12.4 / evalscope压测工具);30%启动速度差补充Aug 13版5×数据(5×是绝对时间,30%是相对差);Ada并发建议(≤5)补充§1.(1)生产部署约束

建议归入节: §1.(1) 推理引擎新增精确版本号压测(SGLang v0.4.6.post2-cu124/vLLM v0.8.5/CUDA12.4/evalscope);§1.(4) 服务层并发安全新增Ada并发建议(≤5)


增量 3【推理引擎 · §1.(1) + §1.(7)】vLLM GPU crash rate三档实测——0.95→100% / 0.90→30% / 0.80→0% ★★★★

来源: inbox/jay/2026-08-14-inference-agent-rag-engineering.md 条目3(AIMultiple H100 80GB HBM3 / CUDA 12.8.1 / PyTorch 2.8.0 / vLLM 0.11.0);inbox/spark/2026-08-14-llm-infra-e1prep.md 增量5 arXiv: 无(AIMultiple benchmark + GitHub vllm-project/vllm/discussions#17221)

要点: - vLLM gpu_memory_utilization 与 Crash 率关系(AIMultiple H100 80GB HBM3): - 0.95100% crash rate - 0.9030% crash rate - 0.800% crash rate - vLLM 调优命令: vllm serve qwen2.5-7b --gpu-memory-utilization 0.3 --max-model-len 2048 --max-num-seqs 8 - A10 24GB Qwen2.5-7B实测(SGLang 惰性KV分配 vs vLLM 预分配): - SGLang 占用 7GB VRAM - vLLM 占用 21GB - 根因:SGLang惰性KV分配(lazy KV allocation) vs vLLM预分配(pre-allocation) - vLLM默认gpu_memory_utilization=0.9(即21GB/24GB=87.5%)

与活文档现有脉络的关系: - inference.md Aug 13版 §1.(1) 已有vLLM vs SGLang并发对比数据;Aug 12版有Host Overhead分析框架(SGLang延迟优势真正来源) - 本棒 = GPU crash rate三档首度锚入(v49无任何vLLM crash rate数据);A10 7GB vs 21GB根因(惰性KV vs 预分配)是Host Overhead分析框架的具体实现层补充;0.80为生产安全区边界提供量化依据

建议归入节: §1.(1) 推理引擎新增vLLM GPU crash rate三档(0.95=100%/0.90=30%/0.80=0%);§1.(4) 服务层并发安全新增gpu_memory_utilization配置建议(生产安全区0.80);§1.(1)邻接新增A10 7GB vs 21GB根因(惰性KV vs 预分配)


增量 4【KV-Cache · §3.3】C2KV KDD 2026 arXiv:2607.17715——跨请求KV-Cache压缩可组合复用 ★★★

来源: inbox/jay/2026-08-14T1130-jay-five-category-briefing.md §一.DATABASE 1.1;inbox/spark/2026-08-14-llm-infra-e1prep.md 增量3 arXiv: 2607.17715(C2KV:Compressed and Composable KV Cache;KDD 2026 Jeju Island)

要点: - 核心问题: vLLM PagedAttention解决单请求内KV-Cache分配;C2KV解决跨请求KV-Cache复用——两者互补,共同构成KV-Cache完整优化方案 - 验证数据集: Llama-3.1-8B / Qwen-2.5-7B;GovReport / HotpotQA / MultiNews等标准数据集 - 核心价值: 跨请求KV-Cache压缩可组合复用,减少重复计算 - 发表状态: KDD 2026(Jeju Island 2026-08-09~13)正式论文

与活文档现有脉络的关系: - inference.md Aug 13版 §3.3 KV-Cache压缩已立12条路线(HiSparse/OasisKV/PIM-DIMM/GEAR/TurboQuant/MosaicKV/SAW-INT4/QuantSpec/DeepSeek V4-Pro 9×/iFAN等) - 本棒 = KV-Cache第13路线候选首度锚入(跨请求复用方向,与PagedAttention单请求内分配互补);C2KV是inference主题KV-Cache路线中首条明确跨请求复用的设计

建议归入节: §3.3 KV-Cache压缩新增C2KV第13路线候选(跨请求KV-Cache复用;KDD 2026)


二、邻接增量(补充纳入,不单独列章)

邻接 A【推理引擎 · §1.(1)邻接】vLLM原生transformers后端(HF Blog 2026-08)——450+架构一致暴露 ★★★★

来源: inbox/jay/2026-08-14T1130-jay-five-category-briefing.md §二.BACKEND 2.1;HF Blog 2026-08 arXiv: 无(HF Blog官方发布)

要点: - 核心变化: transformers库新增vLLM原生推理后端;新模型一旦集成transformers,即可获得vLLM原生实现速度 - 过去: 模型作者需要分别为transformers与vLLM各写一次Custom CUDA kernel实现 - 现在: transformers动态应用inference-specific layer fusions,运行时匹配custom实现速度 - 覆盖范围: 450+架构通过transformers API一致暴露;vLLM共享这些实现;SGLang/TensorRT-LLM等也从vLLM实现中受益

建议归入节: §1.(1)推理引擎新增vLLM生态结构升级(450+架构via transformers);§1.(7)推理经济学邻接(适配成本降低)


邻接 B【推理引擎 · §1.(1)邻接】TGI维护模式8-14再次官方确认 ★★

来源: inbox/jay/2026-08-14-inference-vector-rag-k8s.md §1;inbox/jay/2026-08-14T1130-jay-five-category-briefing.md §二.BACKEND 2.2 arXiv: 无(HuggingFace官方文档)

要点: - TGI于2025年12月进入维护模式;HF官方推荐新部署使用vLLM或SGLang - 量化更新(新浪财经实测): vLLM吞吐量峰值1512 tok/s(并发128);SGLang 1856 tok/s(并发256);SGLang在并发64+开始全面超越vLLM(CSDN 2026-07-28,沿用Aug 13基线数据) - vLLM优势在新模型支持更快;SGLang优势在冷启动快5×

建议归入节: §1.(1)推理引擎框架格局(确认TGI维护模式);§1.(1)邻接并发对比数据


邻接 C【推测解码 · §2.3邻接】TIS 2.0消除RAG位置偏差+12.5%推测解码加速 ★★

来源: inbox/jay/2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md §三;inbox/spark/2026-08-14-llm-infra-e1prep.md 增量7 arXiv: 无(HF Forum 2026-08-13)

要点: - RAG位置偏差: 检索到的上下文片段在prompt中的位置(开头/中间/结尾)显著影响LLM输出质量,标准化排序后偏差仍存在 - TIS 2.0(Token Importance Scoring v2): 对检索到的上下文片段进行token级别重要性评分;per-passage relevance scoring+RMSNorm+InfoNCE对比训练 - 推测解码结合(LLaMA-3.1-8B target+LLaMA-3.2-1B drafter,n=30): - No TIS:Accept Length 5.80/8;Speedup 0.644 - TIS depth-scaled:Accept Length 6.57/8;Speedup 0.730 = +12.5%

建议归入节: §2.3 投机解码邻接(TIS 2.0 RAG×推测解码交叉);§1.(7)推理经济学邻接


邻接 D【推理经济学 · §1.(7)邻接】vLLM vs SGLang 2026选型决策树 ★★

来源: inbox/jay/2026-08-14-inference-db-backend-ai-eng.md §一(关键趋势);inbox/jay/2026-08-14T1620-jay-csdn-inference-rag-framework-quantization-highvalue.md §二 arXiv: 无(CSDN工程总结)

要点: - 高并发API服务: vLLM(PagedAttention对100+并发处理效率高) - 多轮对话/Agent工作流: SGLang(RadixAttention共享上下文缓存命中率85-95%) - 延迟SLA敏感: Triton-TRT(p99 TTFT最稳定,43ms variance) - 量化模型+受限GPU: LMDeploy - TGI现有部署: 保持稳定,新项目选vLLM/SGLang - SGLang原生结构化输出最优;vLLM Outlines损耗15-30%吞吐(atomic.chat 2026)

建议归入节: §1.(1)推理引擎新增选型决策树;§1.(4)服务层并发安全邻接(延迟SLA)


邻接 E【KV-Cache · §3.3邻接】Memory-Centric CXL+PIM HotInfra 2026详细数字 ★★★

来源: inbox/spark/2026-08-14-llm-infra-e1prep.md 增量3;inbox/jay/2026-08-14-engineering-e1prep.md arXiv: 无(HotInfra 2026 final59.pdf)

要点: - 32K tokens生成场景DeepSeek-R1-671B实测: - 吞吐量:CXL+PIM 1,607 tok/s vs GPU HBM 679 tok/s = 2.4× - CapEx:CXL+PIM $27,664 vs GPU $570,000 = 20.6× - OpEx:CXL+PIM $3.53/hr vs GPU $59.23/hr - 架构: Prefill在GPU HBM;Decode在CPU+CXL DDRx;KV-Cache通过CXL共享内存互联 - 理论依据: 引用Mooncake(USENIX FAST 2025)KVCache中心化解聚架构

建议归入节: §3.3 KV-Cache压缩邻接(PIM-DIMM第11路线精确数字补丁);§5.2推理成本工程邻接


三、值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险等级
1 vLLM周安装量1M→2M(2026-03) 数据来自InferenceOps Substack(Red Hat AI团队),厂商报告可能有选择性呈现 InferenceOps Substack 🟡 中
2 P-EAGLE并行推测解码具体算法细节 vLLM 0.19 release notes未披露与标准EAGLE3的差异 GitHub release notes 🟡 中
3 FlexKV offloading backend生产可用性 属于实验性功能,稳定性未验证 vLLM 0.19 release notes 🟡 中
4 C2KV vLLM/SGLang官方集成状态 KDD 2026论文已发表,但官方集成情况未披露 KDD 2026 🟡 中
5 TIS 2.0 +12.5% 仅在LLaMA-3.1-8B+LLaMA-3.2-1B/n=30条件下验证,不同drafter配对可能不同 HF Forum 🟡 中
6 Memory-Centric CXL+PIM CapEx $27,664 单一场景benchmark,不能跨场景泛化;PIM硬件生态(Samsung PIM-DIMM)尚未成熟 HotInfra 2026 🟡 中
7 阿里云压测并发建议≤5 针对QWen-QWQ-32B-AWQ的具体结论,其他模型/硬件可能不同 阿里云官方 🟡 中

四、可引用 arXiv 号列表

🆕 净增 2 件(inference主题):

arXiv 号 论文 主题 价值 归入活文档节
2607.17715 C2KV:Compressed and Composable KV Cache(KDD 2026 Jeju Island) 跨请求KV-Cache压缩复用 ★★★ §3.3 KV-Cache 第13路线候选
2608.06867 LLMRouter:Unified Infrastructure for LLM Routers(主分类evaluation) 路由五组件 formalism ★★ §2.4 调度系统邻接

🆕 净增 2 件(邻接inference主题):

arXiv 号 论文 主题 价值 归入活文档节
2607.17715 C2KV(KDD 2026) 跨请求KV-Cache复用 ★★★ §3.3 邻接
2608.06867 LLMRouter(主分类evaluation) 路由统一公式化 ★★ §2.4 邻接

🔄 沿用(Aug 13版基线已立,本棒邻接引用): - 2608.01651(Bole · Hybrid-attention树状推测解码 · §2.3) — 沿用 - 2608.02989(AcceptMoE · MoE自适应Expert验证 · §2.3) — 沿用 - 2608.00881(AOSpec · Action-Observation联合推测 · §2.3) — 沿用 - 2608.01526(An Internet for the KV Cache · DeepSeek 9×) — 沿用 - 2603.21354(WRP · Workload-Router-Pool) — 沿用 - 2601.19139(vllm-mlx · Apple Silicon原生推理) — 沿用


五、检查过的来源清单

  • inbox/jay/2026-08-14-inference-agent-rag-engineering.md → ⭐⭐⭐⭐⭐ A级4件:Sherlocks AI 73生产事故六层栈/vLLM GPU crash rate/A10 7GB vs 21GB根因/KV Cache BF16量化分级
  • inbox/jay/2026-08-14T1620-jay-csdn-inference-rag-quantization-highvalue.md → ⭐⭐⭐⭐⭐ 阿里云函数计算SGLang v0.4.6.post2-cu124 vs vLLM v0.8.5精确版本号压测/llama.cpp TurboQuant/Muse Glimmer本地部署
  • inbox/jay/2026-08-14-inference-vector-rag-k8s.md → ⭐⭐⭐⭐⭐ TGI维护模式确认/vLLM vs SGLang vs TGI vs TensorRT-LLM四框架格局/pgvector 2026性能突破/K8s v1.36 DRA
  • inbox/jay/2026-08-14T0820-jay-csdn-inference-stack-substack-research.md → ⭐⭐⭐⭐⭐ vLLM 0.19 Model Runner V2/P-EAGLE/FlexKV/llm-d CNCF v0.7 EPD分解/KServe v0.17.0/Llama Stack v0.7.1
  • inbox/jay/2026-08-14T1130-jay-five-category-briefing.md → ⭐⭐⭐⭐ C2KV KDD 2026/vLLM原生transformers后端/Alice Labs框架评分/vLLM DCP
  • inbox/jay/2026-08-14T1735-jay-ai-agents-stack-2026-substack-tis2-hf-trending.md → ⭐⭐⭐⭐⭐ AI Agents Stack 2026六层框架/TIS 2.0 RAG位置偏差/NVIDIA Nemotron 3 Embed/HF Trending精选
  • inbox/jay/2026-08-14T2105-jay-five-category-evening-briefing.md → Simulator Collapse(2608.12253)/Information Abundance Paradox(2608.12218)/LittleLearner(2608.13545)——均属llm-application主题,inference邻接
  • inbox/spark/2026-08-14-llm-infra-e1prep.md → 49KB;11条候选;vLLM 0.19精确补丁/阿里云压测版本号/vLLM GPU crash rate/C2KV/Memory-Centric/TIS 2.0/LLMRouter
  • inbox/tom/2026-08-14-rag-e1prep.md → RAG主题E1;无inference直接增量
  • inbox/tom/2026-08-14-evaluation-e1prep.md → Evaluation主题E1;无inference直接增量
  • inbox/tom/2026-08-14T1440-agent-rag-longcontext-radar.md → SKILLER/LLMRouter/ParliamentRAG;无inference主增量
  • organized/knowledge/inference.md Aug 14版 → 基线活文档
  • inbox/tom/2026-08-13-inference-e1prep.md → Aug 13版基线(5条主线+6邻接;含Bole/AcceptMoE/AOSpec三大推测解码方向首度锚入/vLLM-mlx首度锚入/Q2 2026 benchmark体系化锚入)
  • inbox/tom/2026-08-12-inference-e1prep.md → Aug 12版基线(5条主线+7邻接)
  • paper_cards/920-2608-10288.md → PLDR-LLM/PLGA;主分类llm-infra;沿用
  • paper_cards/934-2608-05604.md → SkillZip;主分类agent;沿用
  • paper_cards/946-2608-10538.md → SKILLER;主分类agent;沿用
  • paper_cards/947-2608-06867.md → LLMRouter;主分类evaluation;沿用
  • work-queue.md 2026-08-14 → 选题榜无inference直接增量

六、无显著新增量的领域(如实说明)

以下Aug 13版基线已立标方向,本棒检查后确认无新增量,不重复列出:

  • Bole arXiv:2608.01651 / AcceptMoE arXiv:2608.02989 / AOSpec arXiv:2608.00881 — Aug 13版已充分覆盖;本棒邻接C(TIS 2.0)补充推测解码×RAG交叉,但三件本身无新数据
  • Q2 2026 benchmark — Aug 13版已体系化锚入(SGLang ~16,200 tok/s / vLLM ~12,500 tok/s / Triton-TRT p99 118ms);本棒阿里云压测补充了另一测试环境数据,但非同件更新
  • vLLM-mlx Apple Silicon — Aug 13版已首度锚入(4.3× llama.cpp);本棒无新数据
  • PLDR-LLM/PLGA arXiv:2608.10288 — Aug 13版邻接A已锚入;本棒无新数据
  • HiSparse / OasisKV / DeepSeek 9× KV压缩 — Aug 11/12版已充分覆盖;本棒C2KV是跨请求新路线,不重复
  • TGI维护模式 — Aug 10版已充分覆盖;本棒邻接B再次确认,无新信息
  • Host Overhead分析框架 — Aug 12版已充分覆盖;本棒A10 7GB vs 21GB根因(惰性KV vs 预分配)是其实现层补充,非新框架
  • Serverless GPU inference成本精算(Cerebrium) — Aug 12版已充分覆盖;本棒无新数据
  • Muse Glimmer 30B / LFM2.5-2.6B — Aug 12版已充分覆盖;本棒无新数据
  • vLLM DCP / WRP — Aug 11版已充分覆盖;本棒无新一手数据

Tom · 2026-08-14 22:20 CST · E1 日间预消化轮 · inference 主题 · 不执行 GitHub 写操作