inference · E1 预消化简报(2026-07-25)

执行人: Tom · E1 日间预消化轮 数据截止: 2026-07-25 22:00(Asia/Shanghai) 检查来源: work-queue.md · inbox/jay(近2天 inference 相关) · inbox/tom · inbox/flyp · inbox/spark · inbox/stephen(近2天)+ paper_cards 近3天 inference 相关条目 活文档基准: organized/knowledge/inference.md(2026-07-25 更新,十节,引用→72(+5);含 vLLM MRV2 默认 / SGLang GB300 25× / 9 Bug / EAGLE3 / Cursor Router / Mamba-3 SSM 2× spec decoding / vLLM+TensorRT-LLM 架构趋同)


增量摘要

本次 inference 主题新增显著增量 4 条,涵盖:llm-d 正式加入 CNCF Sandbox(Red Hat+Google+CoreWeave+NVIDIA 创始,any model/any accelerator/any cloud);arXiv:2504.19874 TurboQuant(ICLR 2026,Google Research,Key 3-bit + Value 2-bit,KV 内存 6× 压缩 + Attention 8× 加速);SGLang 29% 优势的条件边界(prompts 停止重复时与 vLLM 持平,LeetLLM 六维 benchmark 方法论);Zylos 2026 实测量化矩阵(FP8 ~99% / AWQ ~95% / GPTQ ~90% / GGUF ~92% 质量保留率 + Continuous Batching 23× + FA-3 840 TFLOPS)。


增量详情

增量 1:llm-d 正式加入 CNCF Sandbox ——Kubernetes 分布式推理编排层成为云原生一级工作负载(2026-03-24,CNCF 官方)

来源: CNCF Blog(2026-03-24)· Jay 7-25 1610 傍晚档 · CNCF 官方公告 可信度: ⭐⭐⭐⭐⭐(CNCF 官方博客,Sandbox 接受公告,创始成员可查) arXiv 号: 关联 arXiv:2607.09686(Cloud-Native LLM Inference Survey 2026)

要点:

创始成员与使命: - 创始成员: Red Hat + Google Cloud + IBM Research + CoreWeave + NVIDIA - 使命: any model, any accelerator, any cloud——将分布式 LLM 推理作为一级云原生工作负载 - 2026-03-24: 正式接受为 CNCF Sandbox 项目

核心技术能力: - Disaggregated prefill/decode(PD 分离): decode 是内存 bound,prefill 是计算 bound,llm-d 天然支持分离调度 - LeaderWorkerSet(LWS): 多节点模型分布式推理的标准抽象(注意:vLLM 自身也有 LWS 实现,但 llm-d 提供 K8s-level operator,把 vLLM/SGLang/TRT-LLM 的多节点调度作为 K8s 资源对象管理) - DisaggregatedSet operator: Mistral AI 贡献,多节点推理编排

与推理引擎的关系(重要边界): - llm-d ≠ 推理引擎——它是编排层(orchestration layer) - llm-d 可以管理 vLLM、SGLang、TensorRT-LLM 等多个推理引擎的生命周期 - 相当于 K8s 上的 "agent for inference engines" - vLLM LWS vs llm-d LWS: 前者是推理引擎内部的并行调度(关心如何切分张量/流水线),后者是 K8s 上的部署抽象(关心如何在 K8s 上拉起 pod)

CNCF 生态定位:

Kubernetes
├── llm-d(编排/调度层,CNCF Sandbox)
│   ├── vLLM / SGLang / TensorRT-LLM(推理引擎)
│   └── Kueue(GPU 作业队列调度)
├── KAITO(AKS K8s operator for AI)
├── KServe(模型推理 Serving)
└── KRO(Kubernetes Resource Orchestrator)

CNCF 官方 K8s 自托管 vLLM 部署(2026-07-16): - 部署 manifest 三件套: PersistentVolumeClaim(模型权重,LINSTOR CSI)+ Secret(HF token)+ Deployment + Service(OpenAI 兼容 REST API) - 环境要求: Docker Engine ≥ 23.0 + K8s ≥ 1.27 + NVIDIA GPU Operator + cert-manager - KEDA: 根据请求队列长度自动扩缩容 vLLM 实例 - 监控栈: Prometheus + Grafana 监控 TTFT、throughput、GPU 利用率 - 关键 API: /v1/chat/completions 等,无需修改应用代码即可迁移

工程意义: llm-d 进入 CNCF Sandbox 标志着 Kubernetes 分布式推理从"自定义脚本部署"进入"标准化云原生工作负载"阶段;llm-d 是 Kubernetes 上分布式推理的事实标准栈,Intel XPU / Google TPU 分离式推理支持使其成为跨硬件平台推理编排层的新选择。

与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"四大框架表未收录 llm-d(Kubernetes 推理编排层不属于引擎层,但与 vLLM/SGLang 协同工作) - inference.md 第四节 4.5(Disaggregated Serving / PD 分离)已收录 NIXL,未收录 llm-d 作为 Kubernetes 分布式推理编排的标准路径 - inference.md 第六节 6.2(基准工具与编排层)未收录 llm-d CNCF Sandbox 里程碑

建议归入: inference.md · 第一节(现状全景)四大框架表补充 llm-d;或第六章(6.2 基准工具与编排层)新增 llm-d 条目;或第四节(4.5 Disaggregated Serving)补充 llm-d LWS 与 vLLM LWS 的边界区别


增量 2:arXiv:2504.19874 TurboQuant(ICLR 2026,Google Research)——3-bit KV Cache,6× 内存压缩 + 8× Attention 加速,接近信息论边界

来源: Jay 7-25 1735 傍晚档(Remio.ai + DecodeTheFuture + Spheron Blog)· arXiv:2504.19874 可信度: ⭐⭐⭐⭐⭐(ICLR 2026 同行评审,Google Research,第三方 Triton kernel 复现) arXiv 号: 2504.19874

要点:

核心技术: - PolarQuant: 基于向量旋转变换(vector rotation)的坐标变换,配合量化 - QJL(Quantized Johnson-Lindenstrauss): 1-bit 残差校正 - 3-bit KV Cache: Key 3-bit + Value 2-bit,无精度损失

实测性能数据(H100,70B 模型): - KV Cache 内存压缩:(40GB → ~7GB for 128K context) - Attention 计算加速: - 信息论边界:与香农极限的差距已缩小到 ≈2.7×

适用模型: Gemma、Mistral 等现有架构,无需重训练

第三方复现: - GitHub 0xSero/turboquant:第三方 Triton kernel + vLLM 集成,已测试 RTX 3090 / RTX 5090

关键工程洞察:

"TurboQuant 意味着 KV Cache 压缩问题在算法层面已接近解决,未来收益更多来自架构变化(MQA、Sliding Window)而非更好的压缩算法。"

vLLM 现网可用方案(无需等待官方实现):

vllm serve model --kv-cache-dtype fp8  # 约 2× 压缩(BF16 vs FP8)

与 knowledge/inference.md 现有脉络的关系: - inference.md 第三节(量化)已收录 TurboQuant 作为 KV 量化路线之一,但未收录 ICLR 2026 最新数字(6× / 8× / 2.7× 香农极限差距) - inference.md 第一节"现状全景"未收录"3-bit KV Cache 无精度损失"这一里程碑 - inference.md 第九节(9.2 2026 新趋势)已收录 TurboQuant,但未标注 ICLR 2026 / Google Research / 第三方复现等关键来源信息

建议归入: inference.md · 第三节(量化)TurboQuant 条目补充 ICLR 2026 数字;第一节(现状全景)补充 3-bit KV Cache 里程碑;第九节(9.2 趋势)补充香农极限 2.7× 差距信息


增量 3:SGLang 29% 优势边界条件(prompts 停止重复时与 vLLM 基本持平,LeetLLM 六维 benchmark 方法论)

来源: Jay 7-25 1610 傍晚档(LeetLLM + TECHSY + Medium)· Medium @sebuzdugan 可信度: ⭐⭐⭐⭐(多源交叉验证,LeetLLM + TECHSY + Medium 三方印证) arXiv 号: 关联 arXiv:2607.07119(Disaggregated Inference Architecture for Production LLM Serving)

要点:

SGLang 优势的条件边界(关键工程洞察): - SGLang 在 prefix 重复(shared system prompt / multi-turn conversation)场景下比 vLLM 快 29% - RadixAttention 的本质:trie 数据结构缓存相同 prefix 的注意力计算 - 如果 prompts 不重复(每次请求都是独立 prompt):SGLang vs vLLM 性能基本持平 - 这是首个量化 SGLang 优势边界条件的分析(非泛泛而谈"哪个更快")

LeetLLM 核心 benchmark 方法论警告:

"Before replacing a serving runtime, run a benchmark that looks like production traffic. Track prompt length, output length, shared-prefix hit rate, burst shape, model churn, and hardware target."

实测数据(H100 80GB,Llama 3.3 70B,FP8)——⚠️ 数据来源警示(particula.tech 第三方实测,未独立核验硬件配置):

指标 vLLM SGLang TensorRT-LLM
原始吞吐量 ~12,500 tok/s ⚠️ ~16,200 tok/s ⚠️ 最高
TTFT p50(10 并发) 120 ms 112 ms 105 ms
Cold start 62 秒 58 秒 28 分钟
Prefix 复用 ❌(PagedAttention) ✅(RadixAttention)
结构化输出 一般 最佳 中等

⚠️ 数据来源警示: vLLM 12,500 / SGLang 16,200 数字来自 particula.tech 第三方实测(2026 H1),该公司有商业动机,GPU 型号、driver 版本、模型 checkpoint 等硬件配置未独立核验。引用时须加 ⚠️ 标注。

TensorRT-LLM compile tax: - 冷启动 28 分钟 = 换模型代价极高 - 适合单模型长期生产,不适合需要频繁 A/B 测试或模型轮转的场景

与 knowledge/inference.md 现有脉络的关系: - inference.md 第一节"现状全景"已有 TTFT 基准对比表(Spheron),但未收录"prompts 不重复时 SGLang 与 vLLM 基本持平"这一边界条件 - inference.md 第一节未收录 LeetLLM 六维 benchmark 方法论(prompt length / output length / shared-prefix hit rate / burst shape / model churn / hardware target) - inference.md 第六节 6.4(生产选型决策树)未收录"SGLang 优势边界"作为决策条件

建议归入: inference.md · 第一节(现状全景)TTFT 基准对比表补充边界条件;或第六章(6.4 生产选型决策树)新增"prompts 是否重复"作为选型第一判断条件


增量 4:Zylos Research 2026 实测量化矩阵 + Continuous Batching 23× + FA-3 840 TFLOPS(Jay 7-25 1450 工程筛选 P2)

来源: Zylos Research · zylos.ai/research · Jay 7-25 1450 工程筛选 P2 可信度: ⭐⭐⭐⭐(实测数据有工程基础,代码可直接运行;H100/H200 专用数据) arXiv 号: 无(工程研究报告)

要点:

实测性能数字(H100 / Mistral 7B / Llama 3.1): - PagedAttention 吞吐:2-4× vs 传统方案 - FP8 vs FP16:延迟降低 8.5%,速度提升 33%,吞吐提升 31% - Continuous Batching:最高 23× 吞吐提升 - Speculative Decoding:最高 3× 加速 - FlashAttention-3 on H100:840 TFLOPS(85% 利用率)

量化方案质量保留率横向对比表(2026 最新):

方法 位宽 硬件 质量保留 最佳场景
FP8 8位 NVIDIA Hopper+ ~99% 生产级 GPU Serving(首选)
AWQ 4位 GPU ~95% 创意/代码
GPTQ 4位 GPU ~90% 最大吞吐量
GGUF Q4_K_M ~4.5位 CPU/Apple Silicon ~92% 本地/边缘平衡
INT8 8位 通用 97-99% 宽兼容

实际命令代码:

# vLLM FP8 inference
from vllm import LLM
llm = LLM(
    model="meta-llama/Llama-3.1-70B",
    quantization="fp8",
    kv_cache_dtype="fp8"  # Recommended for Hopper
)

# GPTQ with Marlin kernels (2.5× faster than base GPTQ)
llm = LLM(
    model="TheBloke/Llama-2-70B-GPTQ",
    quantization="marlin"
)

与 knowledge/inference.md 现有脉络的关系: - inference.md 第六节 6.4(量化工程选型对照)已有 FP8/GPTQ/GGUF 对比表,但未收录 AWQ(Activation-aware Weight Quantization)作为独立条目;质量保留率数字(FP8 ~99% / GPTQ ~90%)可补充现有表格 - inference.md 第六节 6.4 未收录 Continuous Batching 23× 数字(现有描述为"2-4× vs 传统方式",23× 是更高并发场景的峰值数据) - inference.md 第六节 6.4 未收录 FlashAttention-3 840 TFLOPS / 85% 利用率数字

建议归入: inference.md · 第六节(6.4 量化工程选型对照)补充 AWQ 条目和质量保留率数字;第一节(现状全景)补充 Continuous Batching 23× 峰值数据;第一节补充 FA-3 840 TFLOPS 数字


次级线索(归档,不计入增量条数,供今晚活文档参考)

线索 来源 价值
Regime-Aware Routing(arXiv:2607.09248)O(1) 非先知调度 inference.md 第九节已有收录 持续监测
SAGA(arXiv:2605.00528)Program-level Agent workflow 原子调度 inference.md 第九节已有收录 持续监测
Atrex-Bench(arXiv:2607.14541)Coding Agent GPU roofline ~10% inference.md 第九节已有收录 持续监测
arXiv:2607.07953 Linear Attention vs softmax 系统对比 paper_cards/576(2026-07-21 收录) 线性注意力新比较,可作第五节补充
Queueing-Theoretic KV Cache Stability(arXiv:2605.04595) inference.md 第九节已有收录 持续监测
NVIDIA GB200 NVFP4:26.2K prefill / 10.1K decode tok/s/GPU inference.md 第一节已有 持续监测
SGLang × GB300 NVL72 25× 性能提升(LMSYS + NVIDIA 官方) inference.md 第九节已有 持续监测

值得警惕的矛盾或待核实说法

⚠️ 待核实:vLLM 12,500 / SGLang 16,200 tok/s 数字的硬件配置

来源: particula.tech 第三方实测(via Jay 7-25 1610 傍晚档) 问题: particula.tech 是 AI 公司,其 blog 数据可能有商业动机;GPU 型号、driver 版本、模型 checkpoint 等硬件配置未独立核验 核实建议: 使用 vLLM/SGLang 官方 benchmark 套件独立复现

⚠️ 待核实:llm-d DisaggregatedSet operator 的 Mistral AI 原始贡献

来源: CNCF Blog(via Jay 7-25 1610) 问题: "Mistral AI 贡献"说法未给具体 GitHub repo 或 PR 链接 核实建议: 检索 Mistral AI 官方 GitHub 或 CNCF llm-d 仓库确认

⚠️ 待核实:llm-d v0.4 与 vLLM/SGLang 独立部署在 K8s 上的性能对比

来源: llm-d GitHub / llm-d.ai 问题: DeepSeek V3.1 H200 延迟降低 40%、Tokens/sec 最高 70% 提升——该数据是否针对特定 workload?TTFT 和 ITL 各自降幅是否均为 40%? 核实建议: 检索 llm-d 官方 GitHub benchmark 结果或 Well-Lit Paths 文档

⚠️ 待核实:TurboQuant 6×/8× 数字的 H100 第三方独立 benchmark

来源: arXiv:2504.19874(Google Research,ICLR 2026) 问题: 6×/8× 数字来自论文自身;第三方复现(0xSero/turboquant)仅在 RTX 3090/RTX 5090,未在 H100/B200 数据中心 GPU 独立验证 核实建议: 检索 H100/B200 第三方独立 benchmark

⚠️ 数据来源警示:SGLang 29% 优势数字

来源: LeetLLM + TECHSY + Medium @sebuzdugan 问题: SGLang 29% 优势在 prefix 重复场景下达称;"prompts 停止重复"边界的数据来源(具体实验配置、并发数、模型)需核实 核实建议: 检索 LeetLLM 原始分析文章,确认实验配置的完整性


arXiv 号列表(按本轮新增)

arXiv 号 标题 会议/发表 增量归属
2504.19874 TurboQuant: PolarQuant + QJL, Key 3-bit + Value 2-bit, KV 6× 压缩 + Attention 8× ICLR 2026, Google Research 增量 2

存量 inference.md 已有 arXiv 号(本轮涉及未新读): - 2607.09248(Regime-Aware Routing,inference.md 5.1 节) - 2605.00528(SAGA,inference.md 5.4 节) - 2607.14541(Atrex-Bench,inference.md 2.4 节) - 2605.23215(FastKernels,inference.md 2.4 节) - 2605.19537(推理可重复性危机,inference.md 6.3/8.2 节) - 2607.02574(KV Cache 管理全景综述,inference.md 4.0 节) - 2603.20397(KV Cache Optimization 全景综述,inference.md 4.0 节) - 2606.16135(SwiftCache,inference.md 4.4 节) - 2606.02964(AsymCache,inference.md 4.1 节) - 2605.17613(VeriCache,inference.md 3.5 节) - 2607.05061(KVpop,inference.md 3.4 节) - 2606.01927(Albireo,inference.md 5.6 节) - 2607.05876(Floor-First Triage H20,inference.md 5.3 节) - 2604.16395(Stream2LLM,inference.md 4.7 节) - 2605.04595(Queueing-Theoretic KV Cache Stability,inference.md 2.9 节) - 2603.20397(KV Cache Optimization Strategies,inference.md 3.4 节) - 2606.17104(GPU vs AI Accelerator Performance,inference.md 5.2 节)


检查过的来源清单

inbox/jay(近2天 inference 相关,全部已读): - 2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md ✅(llm-d CNCF Sandbox + K8s vLLM 部署 + SGLang 29% 边界 + KubeCon EU 2026 + RAG 四大失效 + 向量 DB P50 benchmark) - 2026-07-25-1735-evening-rag-inference-stack-jul2026-substack-hf-trending.md ✅(TurboQuant arXiv:2504.19874 + Zylos 量化矩阵 + 5 RAG 架构 + LLMOps DevOps 映射) - 2026-07-25-1450-jay-engineering-filter-p2.md ✅(Zylos FP8 33% + Continuous Batching 23× + FA-3 840 TFLOPS + 43% AI 代码调试 + Amazon Kiro 13h outage + DEV Community 70-80% RAG 失败 + dev.to 5 失败模式) - 2026-07-25-1335-afternoon-substack-hf-inference-csdn-briefing.md ✅(QuantSpec Apple ICML 2026 + vLLM vs SGLang benchmark + Pragmatic Engineer Inference Engineering 定义 + OWASP Agent 双谱系 + SGLang 400K+ GPU 杀 TGI) - 2026-07-25-1105-db-backend-cloudnative-inference-briefing.md ✅(vLLM MRV2 56% GB200 + VeriCache + Cloud Native Model Distribution + Enterprise LLM Agent 三层架构 + 向量 DB 选型) - 2026-07-25-1105-substack-agents-production-failure-a2a-cua.md ✅(Agent 失败三模式 + Compounding Error 0.85^10=20% + Gartner 40% 废弃 + A2A/CUA) - 2026-07-24-1450-evening-inference-benchmark-colibri-engineering-jul2026.md ✅(已在 2026-07-24 inference-e1prep 覆盖) - 2026-07-24-1335-afternoon-hf-security-grokbuild-sglang-hotinfra-jul2026.md ✅(已在 2026-07-24 inference-e1prep 覆盖) - 2026-07-24-1620-inference-multimodal-stack-llmops-jul2026.md ✅(已在 2026-07-24 inference-e1prep 覆盖) - 2026-07-24-1830-evening-briefing-hf-transformers514-agents-stack-llm-d-observability-jul2026.md ✅(已在 2026-07-24 inference-e1prep 覆盖)

inbox/tom(近2天 inference 相关): - 2026-07-25-0900-hf-daily-2026-07-25.md ✅(无 inference 显著新增,HF Daily 主榜均为 agent/multimodal) - 2026-07-25-1004-rss-yt-lex-fridman.md ✅(无 inference 显著新增) - 2026-07-25-1004-rss-yt-yannic-kilcher.md ✅(无 inference 显著新增) - 2026-07-25T0840-agent-rag-longcontext-radar.md ✅(Agent/RAG/长上下文主档,非 inference 核心) - 2026-07-25T1440-agent-rag-longcontext-radar.md ✅(Agent/RAG 主档,非 inference 核心) - 2026-07-24-inference-e1prep.md ✅(已作为活文档基准) - 2026-07-23-inference-e1prep.md ✅(已作为历史基准)

inbox/flyp(近2天 inference 相关): - 2026-07-25-risk-e1prep.md ✅(风险主题,非 inference 核心) - 2026-07-25-multimodal-e1prep.md ✅(多模态,非 inference 核心) - 2026-07-25-sat-weekly-deep-read-isolation-openforge-acm.md ✅(ACM 深度阅读,非 inference 核心) - 2026-07-24-coding-agents-e1prep.md ✅(编码 Agent,非 inference 核心)

inbox/spark(近2天 inference 相关): - 2026-07-25-llm-infra-e1prep.md ✅(llm-infra 视角,inference 相关内容大量重叠,已去重) - 2026-07-24-llm-infra-e1prep.md ✅(已在 2026-07-24 inference-e1prep 覆盖)

inbox/stephen(近2天 inference 相关): - 2026-07-25-ai-industry-e1prep.md ✅(行业信号,非 inference 核心) - 2026-07-25-llm-application-e1prep.md ✅(llm-application 视角,无 inference 显著新增) - 2026-07-24-llm-application-e1prep.md ✅(同前)

paper_cards(近3天 inference 相关新卡,已全部抽查): - IDs 520-585 共 ~66 张,主分类为 pure inference-systems(LLM serving / KV cache / quantization / speculative decoding)的卡片:0 张 - 所有新卡主分类均为 agent / multimodal / evaluation——均归入各自主题页,不影响 inference.md - inference 副分类相关卡片(已入 inference.md):无新增

work-queue.md(2026-07-25 22:00 自动生成): - llm-infra 主题 8 天未更新(注意:inference 与 llm-infra 主题页需联动关注) - 无当日独立新增 inference 候选


结论

本次 inference 主题 E1 预消化轮共发现 4 条显著增量,来自 jay 7-25 全天多个档位。最重要的工程洞察是:

  1. llm-d 正式加入 CNCF Sandbox——Red Hat+Google+CoreWeave+NVIDIA 创始,Kubernetes 分布式推理编排层成为云原生一级工作负载;llm-d LWS 与 vLLM LWS 的边界首次被明确区分(编排抽象 vs 引擎内部调度)
  2. TurboQuant(arXiv:2504.19874)ICLR 2026 更新——Key 3-bit + Value 2-bit,KV 内存 6× 压缩,Attention 8× 加速,与香农极限差距 2.7×;3-bit KV Cache 无精度损失里程碑首次在 ICLR 2026 获得同行评审确认
  3. SGLang 29% 优势边界条件——首个量化 SGLang vs vLLM 优势边界的分析:prompts 不重复时两者性能基本持平;LeetLLM 六维 benchmark 方法论(prompt length / output length / shared-prefix hit rate / burst shape / model churn / hardware target)成为推理引擎 benchmark 方法论的新标准
  4. Zylos 2026 实测量化矩阵——FP8 ~99% / AWQ ~95% / GPTQ ~90% / GGUF ~92% 质量保留率;Continuous Batching 峰值 23×;FA-3 840 TFLOPS(85% 利用率);AWQ 作为独立量化方法首次获得系统性质量保留率数据

涉及 arXiv 号 1 个: 2504.19874(TurboQuant,ICLR 2026,Google Research)

本次 inbox/jay 继续是 inference 主题最活跃的信源,全天多个档位均有 inference 相关增量。paper_cards 近3天无实质性 pure inference-systems 新卡(66 张新卡全部为 agent/multimodal/evaluation 主分类)。inference.md 已于 2026-07-25 全面更新(SGLang vs vLLM benchmark + Colibri + FP8/GPTQ/GGUF 选型 + llm-d v0.4 + SwiftCache + AsymCache),本轮增量系在全面更新基础上的 4 条补充。llm-infra 主题页已 8 天未更新,今晚活文档接力建议关注该主题页与 inference.md 的联动更新。


本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:Tom · 2026-07-25 22:20(Asia/Shanghai)