llm-infra · E1 预消化简报(2026-08-22)

作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 22 棒 · 8-22 evening 活文档接力备料 · 周六) 窗口:2026-08-21 18:40 → 2026-08-22 18:40(约 24h) 基线:organized/knowledge/llm-infra.md §IX 54th(2026-08-21 22:30 落定 · 4 件 arXiv 主轴 + 5 CVE + 13 件立基础延展) 承接棒:inbox/spark/2026-08-21-llm-infra-e1prep.md(8-21 evening · 5 主线)+ inbox/tom/2026-08-21-inference-e1prep.md(8-21 evening · 7 主线名义 inference 棒)

方法学状态:立标等级判定四档法 ✅ · 跨实例标签二档法 ✅ · 数字核验闭环段 ✅ · RSS 承接棒近 7 日同源累计 ✅ 棒边界:本棒只扫描与备料,不写活文档;v55 接力棒处理核验 + 升级 / 降级 + §IX 55 主变更


0. 一句话净增量

8-22 evening llm-infra 主轴相对 §IX 54 的真实信号 = "§IX 54 锚入后缺位回补" 6 件:K8s+LLM 推理部署完整数值层(jay 8-22-framsouza)+ DefensiveKV ICLR 2026 SnapKV 基准修正(jay 8-22-FFY0)+ kv-cache-analyzer CLI(jay 8-22-bs258q)+ llm-d 分布式 KV Cache 路由 already-upstreamed-vLLM-v0.23+ vLLM 8 月博客 25K TPS/Decode Context Parallelism+ TurboQuant 数字矛盾(AIxFunda 6×/8× vs jay 6-11 2.69-4.4×)。§1.1/§1.3/§1.8/§1.12 四节均无 net-new arXiv 主轴;所有 net-new 均为工程化层级 / 工具链 / 部署 / 量化经济学


一、综述判断

当日 llm-infra 主轴真实信号密度高于"6 件补位"呈现密度,但低于新 arXiv 主轴候选密度:

  • jay 8-22 共 ≥ 12 棒:0822-1050 engineering-filter round 2 + 0822-0935 inference-vecdb-hf-substack + 0822-1335 ai-engineering-trending-mid-aug + 0822-1450 engineering-filter-pm + 0822-1735 ai-engineering-trending-aug22 + 0822-2300 five-category-supplement + engineering-e1prep + rag-agent-mcp-multimodal-survey + 7× RSS + 2× news
  • tom 8-22 共 ≥ 5 棒:0822-0840 agent-rag-longcontext-radar + 0822-0900 hf-daily-15 件(0 件 llm-infra 主轴)+ rag-e1prep + evaluation-e1prep
  • paper_cards 8-22 净增 ~12 张(700-721 段):0 张主分类 llm-infra 净增;仅 1052(FlowEvo 副分类 llm-infra)+ 1053(τ_0-VLA 副分类 llm-infra)+ 1029(2608.13947 paper_card 误判)

立标等级判定四档过滤结果: 已立 1 件(DefensiveKV ICLR 2026)· 候选 ★ 中档 4 件(K8s 数值 + kv-cache-analyzer + llm-d + vLLM 8 月 blog)· 候选 ☆ 低档 1 件(TurboQuant 数字矛盾)· 观察信号 0 件

对比 8-17 ~ 8-21 棒: - 8-19 = "Albireo + 工程学科化"(可复现性 + 工程学科化) - 8-20 = "SGLang Advanced CUDA Graph + §IX 53 主轴 4 件"(生产配置 + 4 件 arXiv) - 8-21 = "Agent serving 跨层综合 + 长上下文 + 运行时安全"(三主题并行 + 4 arXiv 主轴 + 5 CVE 主轴) - 8-22 = "§IX 54 锚入后缺位回补"(工程化层级 / 工具链 / 部署路径补位)


二、核心增量(6 件补位主线 · 立标等级四档显式标注)

增量 1【部署路径 · §1.(1) + §1.(2)】🟠 K8s + LLM Inference 生产级部署完整数值层

来源: jay 2026-08-22T1050-jay-engineering-filter(条目1)+ jay 2026-08-22-engineering-e1prep(增量1)+ jay 2026-08-22-0935(§五 vLLM 三件 blog)

要点: - Mistral Large 123B 实测(BF16): 每 token KV cache 0.344 MB · 128K 单请求 ~44 GB KV cache · GPU 显存三分 246 GB 权重 + 30 GB activations/CUDA 开销 + 360 GB KV cache 预算 · 单卡 H100 80GB 约 16-44 conversation 并发上限 - K8s 调度完整路径: DRA(GPU 拓扑感知分配)+ LeaderWorkerSet(多 Pod 协同)+ Kueue/Volcano(gang scheduling all-or-nothing)+ KEDA 按 KV cache pressure 扩缩(vllm:gpu_cache_usage_perc > 80-85% 触发,优于 queue depth) - Prefix Routing: K8s Gateway API Inference Extension(GIE)+ KV cache indexer 避免 round-robin 前缀重复计算;SGLang RadixAttention prefix cache 复用 10-20% 优势(沿用 §IX 54) - KServe v0.17 upstreamed: spec.kvCacheOffloading.cpu: 10Gi → 自动 render --kv-transfer-config JSON · spec.prefill.kvCacheOffloading 字段

警示: Mistral Large 123B 数值参考性,MoE vs 稠密差异较大;KEDA 单一信号都需补 queue depth 监控;DRA 在 K8s 1.31+ 才稳定

与活文档关系: §IX 54 §1.(1) 已锚 vLLM 0.27.0 = CVE 修复门槛 + SGLang 400K+ GPU + Cursor/LinkedIn/Azure/xAI Grok 3 + Particula H100;本棒 = §1.(1) 部署路径完整 K8s 链路补位(DRA + LWS + Kueue/Volcano + KEDA + GIE + KServe CRD)

归入节: §1.(1) 新增子节「K8s + LLM Inference 完整数值层」; §1.(2) 新增「KEDA + GIE + DRA/LWS 调度栈」


增量 2【KV Cache 压缩 · §1.(3)】🟠 DefensiveKV(ICLR 2026)= SnapKV 基准修正是工程严肃性重要信号

来源: jay 2026-08-22T1050-jay-engineering-filter(条目3)+ jay 2026-08-22-engineering-e1prep(增量2)

arXiv: 待核(GitHub FFY0/DefensiveKV 标注 ICLR 2026 · 具体 arXiv ID 需从 repo 确认)

要点: - RULER 20% cache size 基准修正: - SnapKV 原文高分 → 实测 39.0 分(非"无损") - DefensiveKV = 85.3 分 - LayerDefensiveKV = 91.4 分 - 实现机制: 基于 NVIDIA KVPRESS + 2 行代码 Defensive Aggregation · ≤1 小时单 RTX 4090 可跑完 RULER 10% - ICLR 2026 接收意义: 工程严肃性方向信号 — "无损压缩"声称需实测验证

警示: arXiv 编号待核;评测仅在 RULER,LMEval / 其他长上下文 benchmark 未对比;不同 model family 一致性待验

与活文档关系: §IX 54 §1.(3) 已锚 DASH + HBF Sucks + vToken + Maglev + FreeToken + KV Cache Transform Coding ICLR 2026 + §IX 54 第 20/21 路线 InferScale + Online KV Cache Compaction;本棒 = §1.(3) 压缩方向"基准修正"信号补位(OasisKV 已锚:加压增密;DefensiveKV = 加固挤压)

归入节: §1.(3) 新增子节「KV Cache 压缩安全: DefensiveKV ICLR 2026 基准修正 + SnapKV 39.0 + DefensiveKV 85.3 + LayerDefensiveKV 91.4」


增量 3【KV Cache 工具链 · §1.(3) + §1.(11)】🟠 kv-cache-analyzer CLI = 生产 KV cache 可观测性工具

来源: jay 2026-08-22T1050-jay-engineering-filter(条目2)+ jay 2026-08-22-engineering-e1prep(增量4)

要点: - CLI 命令: kv-cache-analyzer analyze logs.jsonl --format openai --model llama-3-70b --cache-size 200000 --block-size 16 --session-field session_id --output-json report.json - 多框架 LRU Hit Rate 实测(llama-3-70b):

场景 LRU Hit Rate Within-Session
customer-support ~92% ~67%
code-assistant ~92% ~60%
rag-qa ~93% ~30%
  • RAG QA within-session 30% = RAG 跨会话缓存效果最差(检索新鲜度优先于缓存复用)
  • 安全设计: 512 MB 文件限制 + JSON depth limit + 防 symlink 攻击
  • CI/CD: check_cache_regression() 函数可用于回归测试

警示: 数字来自 llama-3-70b;MoE vs 稠密差异较大;RAG QA 30% 不是 bug 而是 RAG 设计目标;仓库较新需关注 maintenance

与活文档关系: §IX 54 §1.(3) 容量优化路线已有 DASH/HBF Sucks/vToken/Maglev/FreeToken + InferScale + Online Compaction;本棒 = §1.(3) KV Cache 可观测性工具链补位 + §1.(11) Harness Reliability 补位

归入节: §1.(3) 新增「KV Cache 生产可观测性工具链: kv-cache-analyzer CLI + 多场景 LRU hit rate 实测 + RAG QA 30% 警示 + CI/CD 集成」


增量 4【分布式 KV Cache · §1.(3)】🟠 llm-d 分布式 KV Cache 路由 — already upstreamed vLLM v0.23

来源: jay 2026-08-22T1050-jay-engineering-filter(条目4)+ jay 2026-08-22-engineering-e1prep(增量4)

要点: - KVEvents 架构: vLLM pod → 事件流 → KV Block Index → Scheduler 打分 → 路由决策 - 跨 Pod 缓存共享: KV cache indexer 跟踪 fleet 级别 block locality - 生产验证状态: llmd-fs-connector==0.23 = vLLM v0.23 FS tier,已 upstreamed = 生产可用 - 配置命令: KV cache indexer + router 集成文档完整

警示: 需 vLLM v0.23+;与 §IX 53 KV Cache 互联网级重构四件套关系尚未独立核验

与活文档关系: §IX 54 沿用 §IX 51 llm-d CNCF v0.7;本棒 = §1.(3) llm-d 8-22 upstreamed 状态补位

归入节: §1.(3) 新增「分布式 KV Cache 路由: llm-d CNCF + KVEvents + upstreamed vLLM v0.23」


增量 5【量化经济学 · §1.(9)】🟡 vLLM 8 月三件 blog 汇总(25K TPS/GPU + Decode Context Parallelism)

来源: jay 2026-08-22-0935(§2.2 vLLM 官方博客)+ jay 2026-08-22-engineering-e1prep(§六沿用项确认 v59 engineering 已锚入)

要点: vllm-project.github.io 官方博客 2026-07-29 vLLM Reaches 25K Total TPS/GPU on Qwen3.5(吞吐量里程碑)+ 2026-08-06 Decode Context Parallelism(官方详解)+ 2026-08-07 Efficient Decode Context Parallelism(长上下文工作负载解码并行优化)+ 2026-04-21 State of FP8 KV-Cache and Attention Quantization - §IX 53 vLLM 25K TPS/GPU on Qwen3.5 沿用:engineering 活文档 v59 已锚入;llm-infra 活文档 §IX 54 未锚入(双活文档归属差异)

警示: Decode Context Parallelism 加速比需 vLLM blog 原文核验;KServe CRD spec.kvCacheOffloading.cpu: 10Gi 是预览版 API 字段

与活文档关系: §IX 54 §1.(1) 已锚 vLLM 0.27.0 = CVE 修复门槛;本棒 = §1.(1) vLLM 8 月生产特性补位 + §1.(9) 量化经济学补位

归入节: §1.(1) 新增「vLLM 8 月三件 blog 汇总: 25K TPS/GPU + Decode Context Parallelism + State of FP8 KV-Cache」


增量 6【量化经济学矛盾 · §1.(9)】🟡 TurboQuant 数字矛盾需 arXiv 原文核验

来源: jay 2026-08-22-0935(§五 AIxFunda Aug Week 1-3)vs jay 2026-06-11-evening-supplement-k8s-db-inference-updates.md(§条目 5)

要点(两套数字矛盾):

来源 时间 数字
jay 6-11 evening supplement 2026-06-11 KV cache 2.69-4.4× 内存节省 · 接近无损 · SGLang PR #21617/21618 阶段
AIxFunda Substack 2026-08-22 KV cache + 推理加速 · H100 上零精度损失
  • 矛盾点: 同一篇 Google TurboQuant(ICLR 2026 提及)两套数字差异显著;可能是不同 model family / 不同精度 / 不同上下文长度的不同评测

警示: arXiv ID 待核;需 arXiv 原文 PDF 核验是否不同评测条件;SGLang PR #21617/21618 状态需 GH 跟踪;H100 零精度损失声明需 PDF 核验

与活文档关系: §IX 54 §1.(3) KV Cache 已有压缩路线;本棒 = §1.(3) TurboQuant 容量优化路线·独立核验数字矛盾补位 + §1.(9) 量化经济学警示

归入节: §1.(9) 新增「TurboQuant 数字矛盾警示: 2.69-4.4× vs 6×/8× 矛盾需 arXiv 原文核验」


沿用 A【运行时安全 · §1.(12)】🟠 CVE 三件套(vLLM CVE-2026-73558 + LMDeploy CVE-2026-33626 + SGLang CVE-2026-3059/3060/3989)—— §IX 54 §1.(12) 主轴已锚立基础延展,8-22 窗口无新 CVE


沿用 B-D【稀疏注意力 + KV 生命周期 + 推理时反馈】§1.(8) FlashPrefill V2 arXiv:2608.19758 + §1.(3) KV Cache InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 + §1.(12) DualPath arXiv:2602.21548v2 + §1.(11) Chain-of-Experience arXiv:2608.18027 —— §IX 54 §1.(3)+§1.(8)+§1.(11)+§1.(12) 主轴 + 立基础延展已锚;paper_card 1039/139/1045 已建;InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 paper_card 仍待建(cron_s2 优先级)


三、6 件"延后"事项(延后标准显式说明)

# 延后标准 优先级
1 Microsoft Foundry + AgentRx(jay 8-22 engineering 棒增量 3) 偏推理框架 agent 端故障恢复,主框架归属 engineering v59 §2.15;与 llm-infra §1.(12) Agent Security 部分重叠,避免双活文档锚入重复 🟡 P1
2 DefensiveKV arXiv ID 待核 FFY0 repo 标注 ICLR 2026 但具体 arXiv 未确认,v55 PDF 精读 🟢 P2
3 TurboQuant arXiv ID + 数字矛盾闭合 2.69-4.4× vs 6×/8× 矛盾,v55 PDF 核验 🟡 P1
4 SGLang PR #21617/21618 TurboQuant 合并状态 GH 跟踪 🟢 P2
5 InferScale 2607.27090 paper_card 待建 §IX 54 已标待建,v55 cron_s2 优先补建 🟡 P1
6 Online KV Cache Compaction 2608.00902 paper_card 待建 §IX 54 已标待建,v55 cron_s2 优先补建 🟡 P1

延后标准: A 类 = 与 llm-infra 主轴边界相邻但主框架归属其他活文档(避免双活文档锚入);B 类 = 数字或 ID 待核需 PDF; C 类 = paper_card 待建状态触发 cron_s2


四、警示清单(v55 接力棒 P0/P1 优先级 · 立基础延展缺位回补与待核)

P0 优先级(立基础延展缺位回补):

  1. FlashPrefill V2 arXiv:2608.19758 PDF 精读与完整作者列表核验(沿用 §IX 54 D83)
  2. InferScale arXiv:2607.27090 paper_card 补建 + 1.8-4.8 GB/conversation 评测条件 PDF 核验(沿用 §IX 54 + 主轴 missing)
  3. Online KV Cache Compaction arXiv:2608.00902 paper_card 补建 + online vs offline compaction 实现细节 PDF 核验(沿用 §IX 54 + 主轴 missing)
  4. TurboQuant arXiv ID + 数字矛盾闭合(本棒新增 · AIxFunda 6×/8× vs jay 6-11 2.69-4.4×)

P1 优先级(K8s 推理部署验证):

  1. K8s + LLM Inference 完整数值层 Mistral Large 123B 实测复现(本棒新增 · MoE vs 稠密 + 序列长度 + batch 差异)
  2. DefensiveKV arXiv ID + ICLR 2026 接收 PDF 确认(本棒新增 · 评测仅 RULER,LMEval 未对比)
  3. kv-cache-analyzer 仓库 maintenance 状态核验(本棒新增 · bs258q 较新)
  4. Decode Context Parallelism vLLM blog 原文核验 + v59 vs §IX 54 双活文档归属对照(本棒新增)

P2 优先级(沿用 §IX 54):

  1. vLLM CVE-2026-73558 影响版本 "<0.27.0" vs "<0.21.0" 矛盾 v54 D83 NVD 核验(沿用)
  2. SGLang CVE-2026-3059/3060/3989 启用多模态/分拆精确触发条件(沿用)
  3. OasisKV arXiv:2608.08097 KV 6.5-9.7× 压缩未经同行评审状态 + Cross-Model KV Cache Transfer arXiv:2608.03893 跨模型迁移(dense→MoE)适用性(沿用)

五、可引用的 arXiv 号列表

🆕 本棒补位主线未净增新 arXiv(6 件均为工具仓库 / 部署文档 / 博客);沿用立基础延展 arXiv ID 4 件:

arXiv 号 论文 主题 状态
2608.19758 FlashPrefill V2 block-sparse prefill 128K TTFT -2.1× ~ -4.8× paper_card 1039 已建 · §IX 54 沿用
2607.27090 InferScale GPU 原生 KV Injection 1.8-4.8 GB/conversation paper_card 待建 · §IX 54 沿用 · v55 cron_s2
2608.00902 Online KV Cache Compaction online vs offline 压缩 SGLang paper_card 待建 · §IX 54 沿用 · v55 cron_s2
2602.21548v2 DualPath KV-Cache 加载重平衡 1.87× / 1.96× 吞吐 paper_card 139 已建 · §IX 54 沿用

🔄 本棒 6 件补位主线涉及的工具仓库(非 arXiv · 建议归位 §IX 55 引用清单): - framsouza/inference-at-scale-on-kubernetes GitHub · K8s+LLM 部署数值层 - FFY0/DefensiveKV GitHub · ICLR 2026 · SnapKV 基准修正 - bs258q/kv-cache-analyzer GitHub · MIT · KV cache CLI 工具 - llm-d/llm-d-kv-cache GitHub · CNCF · upstreamed vLLM v0.23 - vllm-project.github.io/blog 2026-07-28/29/08-06/07/21 · 25K TPS + Decode Context Parallelism - kserve/kserve PR #5599 CRD kvCacheOffloading


六、建议今晚活文档接力顺序(6 条带 P0/P1 优先级)

  1. §1.(3) KV Cache 新增 3 子节(P0):DefensiveKV + kv-cache-analyzer + llm-d 已 upstreamed vLLM v0.23
  2. §1.(1) 推理引擎 + §1.(2) 部署路径新增 vLLM 8 月三件 blog 汇总子节(P0):25K TPS/GPU + Decode Context Parallelism + KServe CRD 集成
  3. §1.(1) 推理引擎 + §1.(2) 部署路径新增 K8s+LLM Inference 完整数值层子节(P1):Mistral Large 123B 显存三分 + KEDA KV cache pressure 触发 + GIE 前缀路由
  4. §1.(9) 量化经济学新增 TurboQuant 数字矛盾警示子节(P1):2.69-4.4× vs 6×/8× 矛盾需 arXiv 原文核验
  5. paper_card 139→1039 已建 + 2607.27090 + 2608.00902 待建状态补建(沿用 §IX 54):cron_s2 优先
  6. O296/O297/O298 P0 警示 PDF 精读与闭合(沿用 §IX 54):FlashPrefill V2 完整作者列表 + TurboQuant arXiv ID + DualPath Storage→Decode→Prefill 实现细节

七、检查过的来源

来源 文件 llm-infra 相关性
spark/2026-08-21-llm-infra-e1prep.md 8-21 spark 主轴承接棒 核心:FlashPrefill V2 + InferScale + Online KV + CoE + CVE 三件套
tom/2026-08-21-inference-e1prep.md 8-21 tom inference 棒(名义 inference 实际覆盖 llm-infra) 核心:7 主线 = 同上 + SGLang schema 7× + HotInfra'26 PIM-DIMM
jay/2026-08-22-engineering-e1prep.md 8-22 jay engineering 主棒 核心:增量 1/2/3/4 = K8s+LLM + DefensiveKV + Foundry/AgentRx + kv-cache-analyzer + llm-d
jay/2026-08-22T1050-jay-engineering-filter.md 8-22 jay engineering round 2 核心:10 保留 = K8s 推理 + kv-cache-analyzer + DefensiveKV + llm-d + Foundry/AgentRx
jay/2026-08-22-0935-...-inference-vecdb-hf-substack.md 8-22 jay 推理引擎简报 核心:HF State of Open Models + vLLM 8 月三件 blog + LEANN 97% + TurboQuant 6×/8×
jay/2026-08-22T1335-jay-ai-engineering-trending-mid-aug.md 8-22 jay 下午 trending 核心:nanochat + pi-mono + Colibri + omlx + LongHorizon-Harness + Agent Stack 2026
jay/2026-08-22T1450-jay-engineering-filter-pm.md 8-22 jay 下午 PM 核心:Spheron vLLM/SGLang/TRT-LLM 决策框架 + Mem0 2026 基准
jay/2026-08-22T1735-jay-ai-engineering-trending-aug22.md 8-22 jay 下午 trending 参考:KDD 2026 LinkedIn 记忆 + VLDB 2026 记忆统一框架 + Order 66 场景
jay/2026-08-22T2300-jay-five-category-supplement.md 8-22 jay evening 五分类 核心:SWE-Bench ProMax + pgvector vs Qdrant + 开源模型格局 Kimi/DeepSeek/Qwen/MiniMax/GLM
jay/2026-08-22-1001-rss-cool-papers-ir.md 8-22 jay Cool Papers cs.IR 核心:Daedalus-150M 2608.20210 卷积-注意力混合(llm-infra 邻接级)
tom/2026-08-22-0900-hf-daily-2026-08-22.md 8-22 tom HF Daily 参考:15 件 = 0 件 llm-infra 主轴
flyp/2026-08-22-risk-e1prep.md 8-22 flyp risk 主棒 核心:7 件邻接级 = Inadvertent Context Leakage 2608.19857 + ConceptGuard 2608.20338 + CREEP 2606.02643 + OWASP MCP Top 10 43% Shell 注入 + Foundry/AgentRx + Gradient Flow
stephen/2026-08-22-ai-industry-e1prep.md 8-22 stephen ai-industry 参考:OpenAI Astra / Zero Data Retention / Cerebras 750 tok/s,非 llm-infra
spark/2026-08-22-agent-e1prep.md 8-22 spark agent 参考:0 件 llm-infra 主轴 net-new;Daedalus-150M 2608.20210 llm-infra 邻接级
jay/2026-06-11-evening-supplement-... 6-11 jay evening supplement 核心:TurboQuant 2.69-4.4× 数字 + SGLang PR #21617/21618 阶段
paper_cards/1039-2608-19758.md FlashPrefill V2 主分类 llm-infra · 沿用
paper_cards/1045-2608-18027.md Chain-of-Experience 主分类 llm-infra · 沿用
paper_cards/139-2602-21548.md DualPath 主分类 llm-infra · 沿用
organized/knowledge/llm-infra.md v54 2026-08-21 22:30 落定 基线确认 §IX 54 内容边界

八、无显著新增量的领域(如实说明)

以下 §IX 54 已立标方向,本轮确认无新增量,不重复列出:

  • FlashPrefill V2 + InferScale + Online KV Cache Compaction + DualPath —— §IX 54 §1.(8)+§1.(3)+§1.(12) 主轴已锚;InferScale + Online KV Cache Compaction paper_card 仍待建(cron_s2 补建)
  • CVE 三件套 vLLM / LMDeploy / SGLang —— §IX 54 §1.(12) Agent Security 主轴级已锚;8-22 窗口无新 CVE
  • Particula Tech SGLang vs vLLM H100 Benchmark —— §IX 54 §1.(1)+§1.(9) 立基础延展已锚
  • SGLang vs vLLM Schema 7× 差距 —— §IX 54 §1.(1)+§1.(9) 立基础延展已锚
  • TGI 维护模式 + AI Agents Stack 2026 + Eval 37pp gap + Guardrails 范式 —— §IX 54 §1.(10)+§1.(11) 立基础延展已锚
  • HotInfra'26 PIM-DIMM 39.7× Cost/Mtoken —— §IX 54 沿用 §IX 53 二次量化
  • ServerMO 安全部署命令 + vLLM 0.27.0 = CVE-2026-73558 修复门槛 —— §IX 54 §1.(1)+§1.(12) 立基础延展已锚
  • OasisKV arXiv:2608.08097 + Cross-Model KV Cache Transfer arXiv:2608.03893 —— §IX 54 §1.(3) 邻接级 + 研究前沿已锚
  • Chain-of-Experience arXiv:2608.18027 —— §IX 54 §1.(11)+§1.(12) 邻接级 ☆ 已锚

九、本棒总结

本轮 E1 预消化结论:中等密度回补型棒——6 件补位主线 + 6 件延后 = 12 件,与 §IX 54 立的 4 件 arXiv 主轴不重复,但同属 llm-infra 主轴内部工程化层级 / 工具链 / 部署路径;arXiv 主轴候选 0 件净增。

本棒最显著特征:§IX 54 立基础延展在量化/推理引擎线上未覆盖 jay 8-22 工程棒已揭示的 6 件"工程化层级"基线补位——这反映 jay 的 engineering v59 与 spark 的 llm-infra §IX 54 在归档位置上有差异:v59 engineering 已锚入 vLLM 25K TPS / Decode Context Parallelism / DefensiveKV 等,但 §IX 54 llm-infra 主轴未充分覆盖。

本棒最重要发现: - K8s+LLM Inference 完整数值层 把引擎部署从"决策框架"拉到"具体数值"层(Mistral Large 123B 每 token 0.344 MB + 128K 单请求 ~44 GB) - DefensiveKV ICLR 2026 修正 SnapKV 39.0 分 = 工程严肃性方向关键信号 - kv-cache-analyzer + llm-d KV routing already upstreamed vLLM v0.23 = KV Cache 工具链补位成型 - TurboQuant 数字矛盾(2.69-4.4× vs 6×/8×)= 量化经济学 arXiv 原文核验警示

本棒 vs 8-21 结构性差异: - 8-21 = "Agent serving 跨层综合 + 长上下文 + 运行时安全"(三主题并行 + 4 arXiv 主轴 + 5 CVE) - 8-22 = "§IX 54 锚入后缺位回补"(单主题 = 工程化层级 / 工具链 / 部署路径补位)

棒接力建议: 1. v55 接力棒 6 件补位主线升 §IX 55:K8s+LLM + DefensiveKV + kv-cache-analyzer + llm-d + vLLM 8 月三件 blog + TurboQuant 数字矛盾警示 2. cron_s2 优先补 paper_card:InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 3. PDF 精读与 NVD/GHSA 三源核验:FlashPrefill V2 完整作者列表 + TurboQuant arXiv ID + DualPath 实现细节

边界说明: 本棒仅写入 inbox/spark/2026-08-22-llm-infra-e1prep.md;未读取 knowledge/llm-infra.md 全文(由今夜活文档接力棒 v55 负责更新 §IX 55th);未执行 GitHub 写操作;未输出密钥。


spark · 2026-08-22 18:40 CST · E1 日间预消化轮 · llm-infra 主题 · 24h 窗口 · 第 22 棒 · 不执行 GitHub 写操作