llm-infra · E1 预消化简报(2026-08-25)

作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 25 棒 · 8-25 evening 接力 · 周二) 窗口:2026-08-25 06:04 → 2026-08-25 18:00 CST(约 12h · 含 noon 棒位 + vLLM Conference Day 1 当日观察窗口) 基线:organized/knowledge/llm-infra.md §IX 56th(2026-08-25 05:00 落定 · 5 件立基延展 + 3 件邻接升级 + 推理工程学科化第 9 维 71 件套扩面) 承接棒:inbox/spark/2026-08-25-llm-infra-e1prep.md(8-25 morning 棒 06:04 CST · 51KB · 8 件主线 + 10 件延后 · 本棒 = evening 整写覆盖)+ inbox/stephen/2026-08-25-1245-stephen-coordination-check-noon.md(8-25 noon 协调棒 12:45 CST · 26KB · P0 警示 #8 8-24 断档判定 7/8 接力棒实质触发)+ inbox/jay/2026-08-25T1505-jay-afternoon-supplement.md(8-25 15:05 jay afternoon 22KB · 新增 MCP 安全专题主轴 + 7 件 KV Cache 优化邻接级)+ inbox/jay/2026-08-25T1105-jay-five-category-briefing.md(8-25 11:05 jay 五分类 13KB · Vector DB 选型决策树 + SGLang vs vLLM 2026 决策矩阵 + llm-d CNCF Sandbox)+ inbox/jay/2026-08-25-github-trending-inference-mcp-postgres.md(8-25 13:35 jay GitHub Trending 9KB · SGLang v0.5.18 + vLLM v0.27.1 + MCP stateless + PostgreSQL 18.6 + pgvector 0.8.0 + HF Summer 2026)+ inbox/jay/2026-08-25-ai-engineering-trending.md(8-25 17:35 jay AI 工程生态 9.5KB · AI Agents Stack 六层架构 + Memory 三层架构 + Ollama/Open WebUI 165k/149k⭐)+ inbox/spark/2026-08-25-agent-e1prep.md(8-25 13:34 spark v58 agent 主棒 56KB · llm-infra 邻接沿用)+ inbox/tom/2026-08-25-evaluation-e1prep.md(8-25 15:43 tom R56 evaluation 主棒 21KB · llm-infra 无直接增量)+ inbox/flyp/2026-08-25-prompt-model-fixed-points-critical-read.md(8-25 15:50 flyp arXiv:2608.21315 精读 10KB · mechanistic-interpretability 邻接级 · 非 llm-infra 主轴) 关键事实:8-25 evening 棒位 = 8-25 morning 棒位 + noon 棒位 + afternoon 棒位 + 17:35 evening 棒位累积信号综合 · vLLM Conference @ Ray Summit 2026-08-25 Day 1 Keynotes 9:30 AM PT / State of vLLM 2026 12:30 PM PT / NVIDIA 合作 session 1:15-1:45 PM PT 已在棒位窗口前全部结束 · §IX 56 morning 棒 0 件 arXiv 主轴净增判断延续到 evening 棒(paper_cards 1058-1076 共 19 件 8-24~8-25 新卡 = 0 件 llm-infra 主分类 · 连续第 3 个零新增日) 方法学状态:立标等级判定四档法 ✅ · 跨实例标签二档法 ✅ · 数字核验闭环段 ✅ · RSS 承接棒近 7 日同源累计 ✅ · 🟢 8-24 全天主棒断档事件 evening 棒位正式闭环(stephen noon 协调棒判定 7/8 主棒实质触发 = 92.5% 恢复率 · P0 警示 #8 沿用 → 可闭环) 棒边界:本棒只扫描与备料,不写活文档;§IX 57 接力棒处理核验 + 升级 / 降级 + §IX 57th 主变更


0. 一句话净增量

8-25 evening llm-infra 主轴相对 §IX 56 + 8-25 morning 棒位的真实信号 = "§IX 56 锚入后第三日傍晚 + 8-25 morning 棒 8 件主线补位深度消化 + jay 15:05 afternoon MCP 安全专题主轴实质性触发 + vLLM Conference Day 1 当日观察窗口关闭 + paper_cards 主轴 0 件净增":Jay 8-25 15:05 afternoon 主棒(22KB)= 8-25 evening llm-infra 主轴最全面信号源,核心新增 7 件主线补位(① 🟠 MCP 安全专题立基础延展候选 = ProtoAmp arXiv:2601.17549 + AttestMCP + CSA MCP Security Crisis + NSA CSI_MCP_SECURITY + SecurityWall CVE 7 件 + OWASP MCP Top 10 β = 协议层 + 工程实现层双栖安全主轴 + ② 🟠 KV Cache 优化 4 件新增件邻接级 = ChunkKV + OBCache + LLM-AnDPro(Awesome-KV-Cache-Optimization) + HCAttention 12.5% GPU cache(Neurocomputing 同行评审) + ③ 🟡 TurboQuant ICLR 2026 Google Research(arXiv ID 2605.19660 沿用 + PolarQuant + QJL 两阶段管道 · 数字矛盾闭合) + ④ 🟡 HotInfra 2026 CXL+PIM KV Cache Server 2.4× 吞吐 + 20.6× CapEx ↓ + 16.8× OpEx ↓ + ⑤ 🟡 SGLang v0.5.18(2026-08-22 发布)vs v0.5.17 PyTorch 2.13 迁移 + torchao 移除 + 多硬件路径 + ⑥ 🟠 vLLM v0.27.1(2026-08-11 发布)+ TGI 进入维护模式确认 + ⑦ 🟠 llm-d CNCF Sandbox(2026-03-24 加入)+ KServe + K8s Gateway API Inference Extension + Oracle OCI 完整路径),其中 MCP 安全专题 = 8-25 evening llm-infra 主轴外延新主轴(协议层信任锚破裂 + 工程实现层 7 CVE 集中披露 = 与 §IX 54-56 inference-层 CVE 集群镜像)+ vLLM Conference 8-25 当日观察窗口关闭 = Day 1 Keynotes 9:30 AM PT / State of vLLM 2026 12:30 PM PT / NVIDIA 合作 session 1:15-1:45 PM PT = 棒位窗口已闭合,vLLM Conference 官方公告待 8-25 evening ~ 8-26 接力棒核验(本棒 = 当日观察窗口关闭备料棒);paper_cards 主轴候选 0 件净增(连续第 3 个零新增日 · 19 件新卡 1058-1076 中 0 件 llm-infra 主分类);net-new 主要为协议层安全主轴(新增主轴)+ 推理框架版本治理(立基础延展)+ 4 件 KV Cache 优化策略(邻接级)+ KV Cache 存储层颠覆性方向(邻接级)


一、综述判断

当日 llm-infra 主轴真实信号密度 = §IX 56 锚入后第三日傍晚"8-25 morning 棒 8 件主线补位深度消化 + jay 15:05 afternoon MCP 安全专题立基础延展候选主轴触发 + vLLM Conference Day 1 当日观察窗口关闭 + paper_cards 主轴 0 件净增"型棒:

  • jay 8-25 evening 主棒:
  • jay/2026-08-25T1505-jay-afternoon-supplement.md(15:05 CST · 22KB · 核心来源):§一 MCP 安全专题 6 件文献(ProtoAmp arXiv:2601.17549 + AttestMCP + CSA MCP Security Crisis + NSA CSI_MCP_SECURITY + SecurityWall CVE 7 件 + SentinelOne OWASP MCP Top 10 + 学术 MCP-Guard arXiv:2508.10991 + SMCP arXiv:2602.01129 + MCP-Secure)+ §二 Backend 3 件(LeetLLM 版本清单 + InferenceEngineering.tech vLLM/SGLang/TRT-LLM Benchmark + Yotta Labs 选型)+ §三 Cloud-Native 2 件(NVIDIA Dynamo 1.4.1 + llm-d CNCF + KServe + Oracle OCI)+ §四 CSDN 6 件(SGLang vs vLLM MCP 对比 + DeepSeek CSDN OOM 排障 + 32K 上下文深度对比 + Qwen3.6-Heretic 三框架对比 + openEuler 性能横评 + 阿里云函数计算 SGLang vs vLLM 单卡/多卡实测)+ §五 Reproduction 4 件(ChunkKV + OBCache + LLM-AnDPro + TurboQuant + HCAttention 12.5% GPU cache + IEEE TED 3-D Ferroelectric KV Cache 硬件)+ §六 Agent 框架 Substack 3 件(Sid Saladi Agent Frameworks 101 + AI Mastery Production AI Engineering + Simon Willison Coding Agents)
  • jay/2026-08-25T1105-jay-five-category-briefing.md(11:05 CST · 13KB):Vector DB 选型决策树(50M 分水岭 pgvector→Qdrant · 100M+→Milvus)+ SGLang vs vLLM 2026 决策矩阵(前缀复用率 >60% SGLang 6.4× 优势)+ vLLM Blog "Inside vLLM" 41 分钟深度长文 + ai-dynamo/dynamo 7.8k⭐ Rust + llm-d CNCF Sandbox(2026-03-24 加入)+ K8s HPA LLM arXiv:2507.18007 + HotInfra 2026 CXL+PIM + arXiv:2607.08057 ACL 2026 Findings KV Cache 综述
  • jay/2026-08-25-github-trending-inference-mcp-postgres.md(13:35 CST · 9KB):SGLang v0.5.18(2026-08-22 发布)+ vLLM v0.27.1(2026-08-11 发布)+ TGI 进入维护模式 + MCP 2026-07-28 stateless + PostgreSQL 18.6/19 Beta3 + pgvector 0.8.0 + HF State of Open Models Summer 2026(Qwen 151,448 衍生 + 中国实验室跳过小模型)
  • jay/2026-08-25-ai-engineering-trending.md(17:35 CST · 9.5KB):Ollama 165k⭐ + Open WebUI 149k⭐ + ComfyUI 128k⭐ + AI Agents Stack 2026 Edition 六层架构 + Memory 三层架构 + Alexey Grigorev AI Engineer JD + Northflank Blog 部署栈
  • stephen 8-25 noon 协调棒(12:45 CST · 26KB):8-24 全天主棒零落盘 P0 警示 #8 判定 7/8 接力棒实质触发 = 92.5% 恢复率 · 8-25 noon 前棒位密度 v33 以来前 20% · 8-25 morning 棒 22 件净产(Jay 17 + Tom 2 + Flyp 2 + Stephen 1)· 唯一未触 Stephen v62 llm-application 30h+ open 沿用
  • tom 8-25 afternoon 棒(14:41 + 15:43):evaluation 主棒 21KB(llm-infra 无直接增量)+ agent-rag-longcontext-radar 第二期 4.6KB
  • flyp 8-25 afternoon 棒(15:50 + 16:43):prompt-model-fixed-points arXiv:2608.21315 10KB(mechanistic-interpretability 邻接级)+ risk-e1prep 46KB(MCP 安全专题沿用 · 与 jay 15:05 主轴同步)
  • spark 8-25 afternoon 棒(13:34):v58 agent 主棒 56KB(llm-infra 邻接沿用 · 无 net-new)
  • paper_cards 8-24 ~ 8-25 evening 净增 19 件 1058-1076 = 0 件 llm-infra 主分类(连续第 3 个零新增日)

立标等级判定四档过滤结果:候选 ★ 中-高档 1 件(MCP 安全专题立基础延展候选 = ProtoAmp + AttestMCP + CSA + NSA + 7 CVE + OWASP MCP Top 10 β)· 候选 ★ 中档 4 件(ChunkKV/OBCache/LLM-AnDPro/HCAttention KV Cache 优化 4 件新增件 + HotInfra 2026 CXL+PIM 2.4× + SGLang v0.5.18 版本治理 + vLLM v0.27.1 + TGI EOL 二次确认 + llm-d CNCF Sandbox + KServe + K8s GIE + Oracle OCI)· 候选 ☆ 低档 4 件(TurboQuant ICLR 2026 Google Research + InferenceEngineering.tech vLLM/SGLang/TRT-LLM Benchmark + CSDN OOM 排障参数对照 + Agent Frameworks 101 Sid Saladi)· 候选 ☆ 低档 1 件(AI Agents Stack 2026 Edition 六层架构 + Memory 三层架构)· 候选 ☆ 低档 1 件(向量 DB 选型决策树 50M 分水岭)· 观察信号 1 件(NVIDIA Dynamo 1.4.1 与 ai-dynamo/dynamo 与 llm-d 三者关系待核)

对比 8-25 morning 棒 vs evening 棒: - 8-25 morning = "8-24 主棒断档补位 + Jay inference 主棒实质触发 17 件净产 + 推理框架选型决策树 2026-08 升级 + NVIDIA Dynamo 1.4.1 工程化层级二次升级"(8 件主线 + 10 件延后) - 8-25 evening = "8-25 morning 棒 8 件主线补位深度消化 + jay 15:05 MCP 安全专题立基础延展候选主轴触发 + vLLM Conference Day 1 当日观察窗口关闭 + paper_cards 主轴 0 件净增"(7 件主线 + 12 件延后)


二、核心增量(7 件主线 + 1 件沿用 · 立标等级四档显式标注)

增量 1【MCP 安全专题 · §1.(12)(vi) Agent Security 立基础延展候选】🟠 MCP 安全专题 = 协议层 + 工程实现层双栖主轴 ★ 中-高档

来源: jay/2026-08-25T1505-jay-afternoon-supplement.md(§一 MCP 安全专题 6 件文献综合)+ flyp/2026-08-25-risk-e1prep.md(MCP 安全专题沿用 · 与 jay 15:05 主轴同步)+ jay/2026-08-25-engineering-filter-llm-inference-agent-2026.md(MCPTox 84.2% tool poisoning + Endor Labs 2,614 MCP servers 82% path traversal 67% code injection + OWASP MCP Top 10)

arXiv: arXiv:2601.17549(ProtoAmp · 2026-01-24 · N. Maloyan & D. Namiot)+ arXiv:2508.10991(MCP-Guard 多阶段纵深防御)+ arXiv:2602.01129(SMCP 安全版 MCP 协议)

要点(8-25 jay afternoon 主棒新增 vs §IX 54-56 已锚):

ProtoAmp arXiv:2601.17549(MCP 协议级安全分析): - 三项协议级漏洞:① 能力证明缺失(服务器可声明任意权限,客户端无法验证)② 双向采样无源认证(启用服务端提示注入)③ 多服务器配置隐式信任传播(单服务器被攻破可横向移动) - ProtoAmp 量化结论:MCP 架构使攻击成功率提升 23-41%(847 个攻击场景实验) - AttestMCP 修复方案:向后兼容扩展 + 攻击成功率从 52.8% 降至 12.4%

CSA MCP Security Crisis(2026-05-04)+ SecurityWall CVE 集群(7 件): - CVE-2025-6514(mcp-remote):CVSS 9.6 · OS 命令注入 · 437,000+ 下载量受影响 · RCE - CVE-2026-33032(nginx-ui MCP 端点):CVSS 9.8 · 认证失败导致命令执行 · 2,600+ 暴露实例 - CVE-2025-49596(MCP Inspector):CVSS 9.4 · 代理服务器认证缺失 · 本地任意进程可调用 - CVE-2026-26384~26390 系列:OAuth DCR 重定向 URI 劫持 · MCP session 访问令牌劫持

NSA CSI_MCP_SECURITY(2026-06-02):NSA + CISA 联合发布 · MCP 规范明确"不在协议层强制安全"(实现方责任)· 扫描本地网络开放式 MCP 服务器

OWASP MCP Top 10 β(2025-12):首个面向 Agent 安全的检查清单 · MCP05 命令注入类别

可信度: ★★★★★(跨实例 2 源独立交叉 ✓ + arXiv 完整 + CSA/NSA 官方文档 + SecurityWall 完整 CVE 列表 · flyp risk-e1prep 跨实例 3 源独立交叉 ✓)

与活文档关系: §IX 54-56 §1.(12)(vi) Agent Security 已锚 vLLM CVE-2026-73558 + LMDeploy CVE-2026-33626 + SGLang CVE-2026-3059/3060/3989;本棒 = §1.(12)(vi) Agent Security 主轴从 inference-层 CVE 集群扩展到协议层 + 工程实现层双栖 MCP 安全主轴(ProtoAmp 量化 23-41% + AttestMCP 修复 52.8% → 12.4% + 7 CVE 集中披露 + OWASP MCP Top 10 β + Anthropic 官方 MCP SDK 命令执行漏洞影响 200,000+ 实例 1.5 亿+ 包下载量)

警示: Anthropic 官方 MCP SDK(Python/TypeScript/Java/Rust)存在命令执行漏洞 · 估计 200,000+ 受影响实例,跨越 1.5 亿+ 包下载量 · 协议层信任锚破裂 · 业界反身性张力第 9 例;MCP 安全 = 与 inference-层 CVE 集群并列的"基础设施层漏洞新前沿"

归入节: §1.(12)(vi) Agent Security 沿用 + 立基础延展候选新增「MCP 安全专题: ProtoAmp 协议级 3 漏洞 + AttestMCP 修复 + CSA MCP Security Crisis + NSA CSI_MCP_SECURITY + SecurityWall 7 CVE(CVE-2025-6514 / CVE-2026-33032 / CVE-2025-49596 / CVE-2026-26384~26390 系列)+ OWASP MCP Top 10 β + Anthropic 官方 MCP SDK 命令执行漏洞 200,000+ 实例」补强


增量 2【KV Cache 优化策略 · §1.(3) + §1.(11) + §1.(12) 邻接级】🟠 KV Cache 优化 4 件新增件 + Awesome-KV-Cache-Optimization 资源库更新 ★ 中档

来源: jay/2026-08-25T1505-jay-afternoon-supplement.md(§五 Reproduction 4 件)

要点:

ChunkKV(Xiang Liu et al. · ACL 2026 Findings):语义保留的 chunk 级 KV Cache 压缩 · 与 DistillCache/ReCache/Topology-Aware v2 同方向补强

OBCache(Yuzhe Gu et al. · ACL 2026 Findings):Hessian 引导的 token 重要性评分最优脑 KV Cache 剪枝 · 沿用 DistillCache 自适应驱逐方向

LLM-AnDPro(Zijie Geng et al. · ACL 2026 Findings):锚方向投影的 KV Cache 精确 eviction · 与 DistillCache/ReCache 邻接

HCAttention(Neurocomputing / ScienceDirect · 2026 · 同行评审):GPU cache 压缩至 12.5% · 与 full-attention 模型精度具有竞争力 · 动态可逆 eviction 算法(非永久性驱逐 · GPU 满时将不常用数据临时移出而非永久删除)+ 非对称 K-V 流水线(GPU 上 key 评分 + 延迟 CPU value 获取)

Awesome-KV-Cache-Optimization(jjiantong · ACL 2026 Findings 配套):资源库持续更新 · 沿用 §IX 56 已锚立基础延展

IEEE TED · 3-D Ferroelectric-Based KV Cache(2026-05):3-D 1T-nC-1T 铁电材料 KV Cache 硬件设计 · 面向高效长上下文 LLM 推理 · 硬件感知推理工程前沿

警示: HCAttention GPU cache 12.5% 与 §IX 56 FlashPrefill V2 47.26× 升级方向不同(HCAttention = 压缩比 · FlashPrefill V2 = 加速比)· 二者可叠加但应分别评估;Awesome-KV-Cache-Optimization 资源库论文清单需 GitHub repo 核验最新 commits

与活文档关系: §IX 53-56 §1.(3) KV Cache 已锚 21 路线(FlashPrefill V2 + InferScale + Online Compaction + DualPath + DistillCache + ReCache + Topology-Aware v2 + C2KV + Online KV Scheduling MC-SF + 17 路线 + HotInfra'26 PIM-DIMM);本棒 = §1.(3) 邻接级新增 4 件 KV Cache 优化策略(ChunkKV 语义保留 chunk 级 + OBCache Hessian 引导最优脑剪枝 + LLM-AnDPro 锚方向投影精确 eviction + HCAttention 12.5% GPU cache 动态可逆 eviction)+ §1.(3) 硬件感知前沿补强(IEEE TED 3-D Ferroelectric KV Cache)

归入节: §1.(3) KV Cache 邻接级新增「ChunkKV 语义保留 + OBCache Hessian 引导 + LLM-AnDPro 锚方向投影 + HCAttention 12.5% GPU cache 动态可逆 eviction」4 件 + §1.(13) 推理工程学沿用 + 「IEEE TED 3-D Ferroelectric KV Cache 硬件设计」邻接级补强


增量 3【TurboQuant · §1.(9) 量化经济学立基础延展候选】🟡 TurboQuant ICLR 2026 Google Research · PolarQuant + QJL 两阶段管道 · 数字矛盾闭合 ☆ 低档

来源: jay/2026-08-25T1505-jay-afternoon-supplement.md(§五 Reproduction-2 TurboQuant)

arXiv: arXiv:2605.19660(沿用 §IX 55 警示 · 未公开修订)

要点: - TurboQuant = 两阶段管道:① PolarQuant(AISTATS 2026)= 随机正交旋转重新分布方差 + 再用标量量化器精确量化 KV · ② QJL(Quantized Johnson-Lindenstrauss)= 对量化残差应用 1-bit QJL 校正 - 核心优势:无需训练或校准 · 解决 MSE 最优标量量化器在注意力计算中的系统性偏差累积问题 - 数字矛盾闭合:jay 6-11 = KV cache 2.69-4.4× · AIxFunda Substack 2026-08-22 = 6× + 8× · 不同 model family/精度/上下文长度评测条件差异(§IX 55 警示已锚) - 可信度: ★★★★★(ICLR 2026 接收 + Google Research 出品)

与活文档关系: §IX 55 §1.(9) 量化经济学已锚 TurboQuant 数字矛盾警示 + arXiv 2605.19660;本棒 = §1.(9) 量化经济学立基础延展候选 + 数字矛盾闭合判定(PolarQuant AISTATS 2026 已发表 + QJL 两阶段管道机制明确 + ICLR 2026 接收确认)

警示: arXiv ID 2605.19660 是否为正式发表版 ID 需 arXiv 检索核验;PolarQuant AISTATS 2026 与 TurboQuant ICLR 2026 是否同一作者团队 + 两阶段管道机制的独立实验验证需 PDF 精读

归入节: §1.(9) 量化经济学立基础延展候选补强「TurboQuant ICLR 2026 Google Research · PolarQuant AISTATS 2026 随机正交旋转 + QJL 1-bit 校正 · 无需训练或校准 · 数字矛盾闭合」


增量 4【KV Cache 存储层颠覆性方向 · §1.(3) + §1.(10) 邻接级】🟡 HotInfra 2026 CXL+PIM KV Cache Server · 2.4× 吞吐 + 20.6× CapEx ↓ + 16.8× OpEx ↓ ☆ 低档

来源: jay/2026-08-25T1105-jay-five-category-briefing.md(§五 Reproduction-1 Memory-Centric KV Cache Server HotInfra 2026)

要点: - 核心机制:用 CXL + PIM-DIMM(Processing-In-Memory DIMM)替代 HBM 作为 KV Cache 存储层 - DeepSeek-R1-671B 32K token 生成分组测试: - CXL+PIM:679 → 1,607 tok/s(2.4×↑) - CapEx:$570,000 → $27,664(20.6×↓) - OpEx:$59.23/hr → $3.53/hr(16.8×↓) - Aggregate Bandwidth:63.7 TB/s → 150.7 TB/s(2.4×↑) - 核心路径:Mooncake → TraCT → 本论文的演进路径(GitHub 源码可追踪) - 对 llm-d disaggregated 架构启示:KV Cache 存储层从 GPU HBM 转移到 PIM-DIMM 带宽

与活文档关系: §IX 53 §1.(3) 已锚 HotInfra'26 PIM-DIMM 39.7× Cost/Mtoken(二次量化)+ §1.(10) 已锚 HotInfra'26 顶会密集部署;本棒 = §1.(3) PIM-DIMM 方向二次升级(2.4× 吞吐 + 20.6× CapEx ↓ + 16.8× OpEx ↓ + 150.7 TB/s 带宽)

警示: 论文 PDF 核验原始数据;CXL + PIM 硬件产业链成熟度需独立评估(目前 Intel / Samsung / SK Hynix PIM-DIMM 路线尚未大规模量产)

归入节: §1.(3) KV Cache 邻接级 + §1.(10) 顶会密集部署沿用「HotInfra 2026 CXL+PIM KV Cache Server · 2.4× 吞吐 + 20.6× CapEx ↓ + 16.8× OpEx ↓ + 150.7 TB/s 带宽」补强


增量 5【推理引擎版本治理 · §1.(1) + §1.(12) 立基础延展候选】🟠 SGLang v0.5.18 + vLLM v0.27.1 + TGI 进入维护模式确认 ★ 中档

来源: jay/2026-08-25-github-trending-inference-mcp-postgres.md(§二 推理引擎版本速览)+ jay/2026-08-25T1505-jay-afternoon-supplement.md(§二 Backend-1 LeetLLM 版本清单)

要点:

SGLang v0.5.18(2026-08-22 发布 · 沿用 v0.5.17): - 迁移至 PyTorch 2.13 · 移除 torchao 集成 - 支持 NVIDIA · AMD ROCm · Intel Xeon · Google TPU · 华为 Ascend NPU - TTFT 最优 80ms · State Graph 多步推理单次调用完成 - 吞吐:2,800 tokens/sec(vLLM 3,500) · Agent 场景低延迟优先

vLLM v0.27.1(2026-08-11 发布 · 沿用 v0.27.0 = CVE-2026-73558 修复门槛): - PagedAttention + Continuous Batching · CUDA 13.x 支持 - 生产默认选型 · 生态系统最大 · 硬件覆盖最广 - gpu_memory_utilization:7B → 0.95 / 13B → 0.85 / 70B → 0.90

TensorRT-LLM v1.2.1(NVIDIA 2026 · Blackwell 原生优化): - 沿用 8-25 morning 棒 TensorRT-LLM 1.2 移除独立 TensorRT 引擎构建流程(8-25 jay inference 主棒已锚)

Ollama v0.32.9(2026):轻量本地推理 · 沿用

llama.cpp b10375(2026):纯 C/C++ 实现 · 沿用

TGI(Hugging Face Text Generation Inference):已转入维护模式(仅接受 bugfix PR)· HF 官方推荐迁移至 vLLM 或 SGLang · 沿用 §IX 56 立基础延展第 5 件

与活文档关系: §IX 56 §1.(1) 推理引擎层已锚 TGI EOL + Stripe 73% + H100 基准三方新源;§IX 56 §1.(12)(ii) Engine 已锚 TGI EOL 官方二次确认 + 推荐迁移 vLLM/SGLang;本棒 = §1.(1) 推理引擎版本治理立基础延展候选补强(SGLang v0.5.18 vs v0.5.17 + vLLM v0.27.1 + TGI EOL 二次确认 + Ollama v0.32.9 + llama.cpp b10375 + TensorRT-LLM v1.2.1)

警示: SGLang v0.5.18 vs v0.5.17 变更细节需 GitHub release notes 核验;PyTorch 2.13 迁移与 torchao 移除的工程影响需实际部署测试

归入节: §1.(1) 推理引擎层新增「SGLang v0.5.18(2026-08-22 · PyTorch 2.13 + torchao 移除 + 多硬件路径)+ vLLM v0.27.1(2026-08-11 · CUDA 13.x)+ TGI EOL 二次确认 + Ollama v0.32.9 + llama.cpp b10375 + TensorRT-LLM v1.2.1 Blackwell 原生优化」沿用补强


增量 6【分布式推理 + K8s + CNCF · §1.(2) + §1.(10) + §1.(12) 立基础延展候选】🟠 llm-d CNCF Sandbox + KServe + K8s Gateway API Inference Extension + Oracle OCI 完整路径 ★ 中档

来源: jay/2026-08-25T1105-jay-five-category-briefing.md(§三 Cloud-Native-1 llm-d)+ jay/2026-08-25T1505-jay-afternoon-supplement.md(§三 Cloud-Native-2 NVIDIA Dynamo 1.4.1 + llm-d CNCF + KServe + Oracle OCI)

要点:

llm-d CNCF Sandbox(2026-03-24 正式加入): - 背书方:Red Hat + IBM + Google + CoreWeave + NVIDIA - 定位:Kubernetes-native · Prefill/Decode 分离 · K8s Gateway API Inference Extension · CRD 标准化 - CNCF 背书 = 企业可用性已过临界点 · KubeCon EU 2026(阿姆斯特丹)重点议题

KServe + llm-d + vLLM 生产级组合: - 解决 StatefulSet 运维瓶颈 · Inference Gateway Extension - 沿用 §IX 55 §1.(10) 立基础延展

NVIDIA 部署指南:K8s 上 disaggregated 推理完整步骤 · Grove 部署指南 · KAI Scheduler · Dynamo 编排层

Oracle OCI + llm-d:OKE 托管 K8s + 裸金属 GPU + RDMA 完整部署路径

ai-dynamo/dynamo(开源 Rust 7.8k⭐ · 2026-08-21 更新):数据中心级分布式推理 Serving 框架 · 支持 vLLM/SGLang/TensorRT-LLM · Kubernetes 原生 · disaggregated serving · 对标 llm-d 的 Rust 版本分布式推理框架 · 与 llm-d 关系待独立核验

K8s HPA LLM 学术验证 arXiv:2507.18007:将 LLM 拆解为细粒度微服务 + K8s HPA 动态调度 · 实验证明有效降低关键层延迟 · Transformer 层级别弹性伸缩可行性验证 · 为 llm-d 等框架提供理论基础

与活文档关系: §IX 55 §1.(2) + §1.(10) 已锚 K8s+LLM Inference 完整数值层 + llm-d CNCF v0.7;本棒 = §1.(10) 顶会密集部署 + 系统栈立基础延展候选补强(llm-d CNCF Sandbox 2026-03-24 加入 + KServe + K8s GIE + Oracle OCI + NVIDIA Dynamo 1.4.1 8-22 更新 + ai-dynamo/dynamo 7.8k⭐ + K8s HPA LLM 学术验证 arXiv:2507.18007)

警示: NVIDIA Dynamo 1.4.1(2026-08-22 更新)vs ai-dynamo/dynamo(开源 Rust 7.8k⭐)vs llm-d CNCF Sandbox = 三者关系待独立核验(Dynamo 1.4.1 是 NVIDIA 官方商业版本 · ai-dynamo/dynamo 是 GitHub 开源版本 · llm-d 是 CNCF Sandbox 社区项目;Dynamo 1.4.1 = llm-d 官方实现路径?独立项目?);Oracle OCI 完整部署路径需 Oracle 官方博客 PDF 核验

归入节: §1.(10) 顶会密集部署 + 系统栈立基础延展候选补强「llm-d CNCF Sandbox 2026-03-24 加入 + KServe + K8s Gateway API Inference Extension + Oracle OCI 完整部署路径 + NVIDIA Dynamo 1.4.1 + ai-dynamo/dynamo 7.8k⭐ + K8s HPA LLM arXiv:2507.18007」


增量 7【Vector DB 选型决策 + 向量库格局 · §1.(10) + 邻接级】🟡 向量 DB 选型决策树 50M 分水岭 + Qdrant/Milvus/pgvector/Pinecone/Chroma/Weaviate 决策框架 ☆ 低档

来源: jay/2026-08-25T1105-jay-five-category-briefing.md(§一 Database-1 向量 DB 选型决策树)+ jay/2026-08-25-github-trending-inference-mcp-postgres.md(§四 PostgreSQL 18.6 + pgvector 0.8.0)

要点:

向量 DB 选型决策树(2026Q3 更新): - Qdrant:50M 向量以下首选 · Rust 实现 · filtered search 性能最优 · 单进程部署 · 中小团队默认 - Milvus:billion-scale(1 亿+)首选 · K8s 原生分布式 · 多租户隔离 · 企业级 - pgvector:50-100M 向量生产可用 · Postgres 生态 · 30+ 企业客户验证 · 迁移成本低 - Pinecone:零运维托管 · 快速上线 · 不适用于断网/主权环境 - Chroma:原型/MVP <10M 向量首选 · Python 原生 · 部署零摩擦 - Weaviate:混合搜索 + 多租户隔离 · schema 灵活 - 50M 向量 = pgvector → Qdrant 的分水岭 · 超过 100M 才考虑 Milvus

PostgreSQL 18.6 稳定版(2026-08-13 发布): - uuidv7() 函数:生成时间有序 UUID · 优化索引性能 - OAuth 2.0 认证:原生支持现代身份提供商 - COPY 命令增强:导出速度翻倍 + ON_ERROR 选项支持批量导入跳过失败行 - SIMD (AVX-512):B-tree 索引操作加速 - 并行 BRIN 索引构建

pgvector 0.8.0:改进 ANN 索引查询规划器 · 数据库更智能判断何时使用向量索引 vs 全表扫描 · 对 RAG + 向量检索场景有直接影响

MySQL 9.7.1:WebAuthn 支持 · AI 向量搜索集成

PostgreSQL 14:2026-11-12 EOL · 立即升级计划

与活文档关系: §IX 53-56 §1.(10) 已锚 Qdrant v1.14 + Multi-AZ 99.95% SLA + Salt Technologies Q1 2026 Benchmark;§IX 55 §6.6 已锚向量 DB/数据系统 19 件;本棒 = §1.(10) 向量 DB 选型决策树 50M 分水岭 + PostgreSQL 18.6 + pgvector 0.8.0 + MySQL 9.7.1 + PG 14 EOL 警示立基础延展候选补强

警示: 50M 分水岭数字来自 Kunal Ganglani 博客 + Medium 综述 + Braintrust 文章 · 评测条件(vector dimension / recall target / QPS 目标)需独立基准验证;pgvector 0.8.0 ANN 索引查询规划器改进需 PostgreSQL 18.6 + pgvector 0.8.0 实测验证

归入节: §1.(10) 顶会密集部署 + 系统栈立基础延展候选补强「向量 DB 选型决策树 50M 分水岭 + PostgreSQL 18.6 + pgvector 0.8.0 + MySQL 9.7.1 + PG 14 EOL」


增量 8【沿用 A · §1.(1) + §1.(3) + §1.(11) + §1.(12)】🟠 §IX 56 立基础延展全部 5 件 + 8-25 morning 棒 8 件主线 + paper_cards 主轴 0 件净增全部沿用 ★ 中档

要点: - §IX 56 立基础延展 5 件全部沿用:FlashPrefill V2 H200 FP8 47.26× 升级 + vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴 + Photon 2.0 + 3 件 KV Cache 新论文邻接升级 + TGI EOL + Stripe 73% - 8-25 morning 棒 8 件主线全部沿用:NVIDIA Dynamo 1.4.1(8-22 更新)+ vLLM vs SGLang vs TensorRT-LLM 2026 实战选型决策树 + TensorRT-LLM 1.2 + Apple MLX/MLX-VLM + Multi-Vector Late Interaction + pgvectorScale 471 QPS vs Qdrant 41 QPS · 10× + Agent Token 缓存陷阱 + CSDN 7 件推理框架/量化工程实战 - paper_cards 主轴候选 0 件净增(连续第 3 个零新增日 · 19 件新卡 1058-1076 中 0 件 llm-infra 主分类) - vLLM Conference @ Ray Summit 2026-08-25 Day 1 Keynotes 9:30 AM PT / State of vLLM 2026 12:30 PM PT / NVIDIA 合作 session 1:15-1:45 PM PT 当日观察窗口关闭 · 官方公告待 8-25 evening ~ 8-26 接力棒核验

与活文档关系: §IX 56 §1.(1) + §1.(2) + §1.(12) + §IX 55 全部 + §IX 54 全部 + §IX 53 全部 + 立基础延展候选级全部沿用

归入节: §1.(1) + §1.(3) + §1.(11) + §1.(12) 沿用 + 「vLLM Conference 8-25 当日观察窗口关闭 · 官方公告待核验」


三、12 件"延后"事项(延后标准显式说明 · 与 8-24 / 8-25 morning 棒差异显式标注)

# 延后标准 优先级 vs 8-24 / 8-25 morning 棒
1 §IX 56 llm-infra 沿用 30h+ open 关闭 stephen 8-25 noon 协调棒判定 P0 警示 #8 8-24 断档实质修复 7/8 接力棒触发 = 92.5% · evening 棒位可正式闭环 🔴 P0 8-25 新增(P0 闭环)
2 vLLM Conference 8-25 当日观察官方公告核验(Day 1 已结束 · Roadmap Q3 + State of vLLM 2026 + NVIDIA 合作 session) vllm-project/vllm/issues/48168 后续 commits · vllm.ai/events/vllm-conference/2026 后续博客 · Inferact 官方公告 🟡 P1 8-25 morning #2 沿用 + 状态变更:窗口关闭 → 核验阶段
3 NVIDIA Dynamo 1.4.1 vs ai-dynamo/dynamo vs llm-d CNCF 三者关系核验 NVIDIA 官方 NGC Catalog + GitHub ai-dynamo/dynamo + CNCF llm-d · 三者关系(同一项目不同命名?商业版 vs 开源版 vs 社区项目?独立项目?) 🟡 P1 8-25 morning #3 沿用 + 8-25 evening 增强(ai-dynamo/dynamo 7.8k⭐ 新增待核)
4 MCP 安全专题 ProtoAmp + AttestMCP 实战部署测试(协议层修复方案可行性) AttestMCP 论文 + arXiv:2601.17549 ProtoAmp 量化结论 · 企业内部 MCP 部署暴露面评估 · OWASP MCP Top 10 β 检查清单 🟡 P1 8-25 evening 新增
5 Anthropic 官方 MCP SDK 命令执行漏洞影响范围独立核验(CSA 报告 200,000+ 实例 1.5 亿+ 包下载量) NVD 检索 MCP 相关 CVE · Anthropic 官方补丁公告 · 企业内部 MCP SDK 版本审计 🟡 P1 8-25 evening 新增
6 SGLang v0.5.18 vs v0.5.17 变更细节核验(PyTorch 2.13 迁移 + torchao 移除) GitHub release notes · 实际部署兼容性测试 🟢 P2 8-25 evening 新增
7 HCAttention GPU cache 12.5% 与 FlashPrefill V2 47.26× 可叠加性核验 HCAttention Neurocomputing 2026 论文 PDF + FlashPrefill V2 arXiv:2608.19758 · 二者协同架构评估 🟢 P2 8-25 evening 新增
8 TurboQuant arXiv ID 2605.19660 是否正式发表版 ID 核验 arXiv 检索 + Google Research 官方论文链接 + PolarQuant AISTATS 2026 引用 🟢 P2 沿用 8-25 morning #10
9 向量 DB 选型决策树 50M 分水岭数字独立核验(Kunal Ganglani 博客 + Medium 综述 + Braintrust 文章) ann-benchmarks / vectordb-bench 第三方基准 · 评测条件(vector dimension / recall target / QPS 目标) 🟢 P2 8-25 evening 新增
10 Oracle OCI + llm-d 完整部署路径独立核验 Oracle 官方博客 PDF · OKE 托管 K8s + 裸金属 GPU + RDMA 实际部署测试 🟢 P2 8-25 evening 新增
11 InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 paper_card 待建 §IX 54 已标待建 · §IX 57 cron_s2 优先补建 🟡 P1 沿用 8-22 / 8-23 / 8-25 morning
12 DistillCache 2608.08878 + ReCache 2608.19662 + Topology-Aware 2607.28633 v2 paper_card 待建 8-23 trending 二手摘要 · §IX 57 PDF 核验后补建 🟢 P2 沿用 8-23 / 8-25 morning

延后标准: A 类 = §IX 56 沿用 30h+ open 闭环(P0 优先级);B 类 = 与 vLLM Conference 8-25 核验相关(P1 优先级);C 类 = MCP 安全专题实战部署测试(P1 优先级);D 类 = 数字或版本号待核需 PDF(GH/CSDN/official release notes);E 类 = paper_card 待建状态触发 cron_s2

8-25 evening 新增延后项 7 件(2-7 + 10) = 本棒新增的"MCP 安全专题实战部署 + Anthropic MCP SDK 影响范围 + SGLang v0.5.18 变更细节 + HCAttention × FlashPrefill 叠加性 + 向量 DB 50M 分水岭独立核验 + Oracle OCI 部署路径"中需 PDF/official 核验后立标


四、警示清单(§IX 57 接力棒 P0/P1 优先级 · 立基础延展缺位回补与待核)

P0 优先级(立基础延展缺位回补 + 协同断档闭环):

  1. §IX 56 llm-infra 沿用 30h+ open 关闭(stephen 8-25 noon 协调棒判定 P0 警示 #8 8-24 断档实质修复 7/8 接力棒 = 92.5%)· evening 棒位正式闭环(本棒 = evening 棒 = 8-24 断档闭环)
  2. FlashPrefill V2 arXiv:2608.19758 H200 FP8 47.26× 评测条件 PDF 核验(沿用 8-22 / 8-23 / 8-25 morning · H20 vs H200 加速比差异)
  3. vLLM Conference 8-25 当日观察官方公告核验(Day 1 Keynotes 9:30 AM PT / State of vLLM 2026 12:30 PM PT / NVIDIA 合作 session 1:15-1:45 PM PT 已结束 · Roadmap Q3 + Sprint 机制 + SIG Spec Decode Q3 + Cold Start Q3 子主题 官方公告待核)
  4. MCP 安全专题 ProtoAmp + AttestMCP + CSA + NSA + 7 CVE 实战部署测试(arXiv:2601.17549 协议级 3 漏洞 + AttestMCP 修复 52.8% → 12.4% + OWASP MCP Top 10 β + 企业内部 MCP 部署暴露面评估)

P1 优先级(8-25 evening 新增 MCP 安全 + 推理框架版本治理 + KV Cache 优化 + CXL+PIM + llm-d):

  1. NVIDIA Dynamo 1.4.1 vs ai-dynamo/dynamo vs llm-d CNCF 三者关系核验(Dynamo 1.4.1 是 NVIDIA 官方商业版本 · ai-dynamo/dynamo 是 GitHub 开源版本 · llm-d 是 CNCF Sandbox 社区项目)· 三者关系待独立核验
  2. Anthropic 官方 MCP SDK 命令执行漏洞影响范围独立核验(CSA 报告 200,000+ 实例 1.5 亿+ 包下载量)· NVD 检索 + Anthropic 官方补丁公告 + 企业内部 MCP SDK 版本审计
  3. SGLang v0.5.18 vs v0.5.17 变更细节核验(PyTorch 2.13 迁移 + torchao 移除 · GitHub release notes)
  4. HCAttention GPU cache 12.5% 与 FlashPrefill V2 47.26× 可叠加性核验(Neurocomputing 论文 + FlashPrefill V2 arXiv:2608.19758 协同架构评估)
  5. 向量 DB 选型决策树 50M 分水岭数字独立核验(Kunal Ganglani 博客 + Medium 综述 + Braintrust 文章 · ann-benchmarks / vectordb-bench 第三方基准)
  6. pgvectorScale 471 QPS vs Qdrant 41 QPS · 10× 数字独立核验(沿用 8-25 morning #4 · stephen 8-25 P1 警示 #14 · 第三方 LinkedIn 单源)

P2 优先级(沿用 §IX 54-56):

  1. Multi-Vector Late Interaction 版本号独立核验(Qdrant v1.10+ / Weaviate v1.29+ / LanceDB v0.15+ / Milvus v2.6.4 · stephen 8-25 P1 警示 #15)
  2. vLLM AWQ Qwen3-14B-AWQ / Qwen3-32B-AWQ 50+ 组实验数据集 / 模型规模 / batch 范围细节原文核验(沿用 8-25 morning)
  3. GPT-5.6 cache 写入 1.25× 新规官方公告核验(沿用 8-25 morning · 与本活文档主线关系弱)
  4. DefensiveKV arXiv ID + ICLR 2026 接收 PDF 确认(沿用 8-22 / 8-23 / 8-25 morning)
  5. TurboQuant arXiv ID 2605.19660 + 数字矛盾闭合(沿用 8-22 / 8-23 / 8-25 morning · PolarQuant AISTATS 2026 + QJL 两阶段管道)
  6. DistillCache arXiv:2608.08878 + ReCache arXiv:2608.19662 + Topology-Aware arXiv:2607.28633 v2 paper_card 补建(沿用 8-23 / 8-25 morning)
  7. kv-cache-analyzer 仓库 maintenance 状态核验(沿用 8-22 / 8-23 / 8-25 morning)
  8. Decode Context Parallelism vLLM blog 原文核验 + v59 vs §IX 55 双活文档归属对照(沿用 8-22 / 8-23 / 8-25 morning)
  9. Oracle OCI + llm-d 完整部署路径独立核验(Oracle 官方博客 PDF + OKE 托管 K8s + 裸金属 GPU + RDMA)

五、可引用的 arXiv 号列表

🆕 本棒补位主线净增新 arXiv 0 件主轴 / 2 件邻接升级(§IX 56 立基础延展 5 件全部沿用 + Jay 8-25 evening 主棒工程化层级 / 协议层安全 / 邻接级补强 6 件 + 1 件邻接级 = arXiv:2601.17549(ProtoAmp)· arXiv:2508.10991(MCP-Guard)· arXiv:2602.01129(SMCP)· arXiv:2507.18007(K8s HPA LLM 学术验证)):

arXiv 号 论文 主题 状态
2608.19758 FlashPrefill V2 block-sparse prefill H200 FP8 128K 47.26× + SGLang 集成 paper_card 1039 已建 · §IX 54 沿用 · 8-25 evening 沿用
2607.27090 InferScale GPU 原生 KV Injection 1.8-4.8 GB/conversation paper_card 待建 · §IX 54 沿用 · §IX 57 cron_s2
2608.00902 Online KV Cache Compaction online vs offline 压缩 SGLang paper_card 待建 · §IX 54 沿用 · §IX 57 cron_s2
2602.21548v2 DualPath KV-Cache 加载重平衡 1.87× / 1.96× 吞吐 paper_card 139 已建 · §IX 54 沿用
2608.18027 Chain-of-Experience 推理时反馈 §1.(11) 邻接级 ☆ paper_card 1045 已建 · §IX 54 沿用
2608.03893 Cross-Model KV Cache Transfer 跨模型 KV 复用(RoPE 插值+跨层对齐) §IX 54 沿用 · paper_card 待建
2608.01526 An Internet for the KV Cache KV Cache = 内容分发系统 §IX 53 立基础延展第 1 件已锚 · 沿用
2608.08878 DistillCache KL 引导自适应 KV 驱逐(5 维特征) paper_card 待建 · §IX 55 沿用 · §IX 57 PDF 核验
2608.19662 ReCache 动态工具调用 agentic KV 复用 paper_card 待建 · §IX 55 沿用 · §IX 57 PDF 核验
2607.28633 v2 Topology-Aware Data Movement 70B KV 1.3 GB/请求 + 跨 GPU 池传输瓶颈 paper_card 待建 · §IX 55 沿用 · §IX 57 PDF 核验(v2 修订变化)
2608.08097 OasisKV KV 6.5-9.7× 压缩未经同行评审 §IX 54 沿用 · paper_card 待建
2608.13426 RMM 输入自适应矩阵乘积缩减 paper_card 952 已建 · §IX 55 邻接升级候选 ★ 中档
2608.10288 Power Law Graph Attention SDPA 精确泛化 + 推理时经验性坍缩 paper_card 920 已建 · §IX 55 邻接候选 ☆ · claim 待核
2601.17549 ProtoAmp(MCP 协议级安全分析) MCP 架构使攻击成功率提升 23-41% · 847 个攻击场景 · AttestMCP 修复 52.8% → 12.4% 8-25 evening 🆕 立基础延展候选 ★ 中-高档 · §1.(12)(vi) Agent Security
2508.10991 MCP-Guard(多阶段纵深防御) MCP 安全防御框架 8-25 evening 🆕 邻接级 ☆
2602.01129 SMCP(安全版 MCP 协议) 协议层修复方案 8-25 evening 🆕 邻接级 ☆
2507.18007 Cloud Native LLM Inference K8s HPA LLM 微服务 + K8s HPA 动态调度 · 学术验证 8-25 evening 🆕 邻接级 ☆
2607.08057 ACL 2026 Findings KV Cache Survey Towards Efficient LLM Serving · ACL 2026 pp.38450-38476 paper_card 已建 · §IX 56 邻接级 ★
2605.19660 TurboQuant(Google Research ICLR 2026) PolarQuant AISTATS 2026 + QJL 两阶段管道 · 无需训练或校准 §IX 55 沿用 · 数字矛盾闭合

🆕 本棒补位主线涉及的工具仓库 / 部署文档 / 博客(非 arXiv · 建议归位 §IX 57 引用清单): - NVIDIA NGC Catalog(https://catalog.ngc.nvidia.com/orgs/nvidia/ai-dynamo/containers/vllm-runtime/1.0.0-cuda13 · NVIDIA Dynamo 1.4.1 tag 2026-08-22 · KV Router + NIXL + Planner + OpenAI 兼容 HTTP API) - GitHub ai-dynamo/dynamo(https://github.com/ai-dynamo/dynamo · Rust 7.8k⭐ · 2026-08-21 更新 · 数据中心级分布式推理 Serving 框架 · 支持 vLLM/SGLang/TensorRT-LLM · K8s 原生) - CNCF llm-d(https://llm-d.ai · CNCF Sandbox 2026-03-24 加入 · Red Hat + IBM + Google + CoreWeave + NVIDIA 联合背书 · Kubernetes-native · Prefill/Decode 分离 · K8s Gateway API Inference Extension) - LeetLLM 推理引擎版本清单(https://leetllm.com/blog/llm-inference-engine-comparison-2026 · SGLang v0.5.17 8-22 + vLLM v0.5.x + TensorRT-LLM v1.2.1 + Ollama v0.32.9 + llama.cpp b10375) - InferenceEngineering.tech vLLM vs SGLang vs TRT-LLM Benchmark(https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm · Llama-3.1 70B TP=4 FP8: TRT-LLM 3,400 vs SGLang 2,900 vs vLLM 2,800 tok/s · DeepSeek-R1 671B SGLang EP=8 ~1,100 tok/s) - Yotta Labs vLLM vs TensorRT-LLM 选型(https://www.yottalabs.ai/post/vllm-vs-tensorrt-llm-which-inference-engine-should-you-use-in-2026 · vLLM 快速上线基线 + TRT-LLM 适合 NVIDIA 规模化环境) - Beri.net vLLM vs SGLang vs TensorRT-LLM 2026 实战分析(https://www.beri.net/article/vllm-vs-tensorrt-llm-vs-sglang-inference-runtime-2026) - Spheron LLM 推理优化 2026(https://www.spheron.network/blog/llm-inference-optimization-2026 · 推理引擎选型指南) - Inference Radar W33(https://www.inference-radar.com/newsletter/2026-W33) - HotInfra 2026 CXL+PIM KV Cache Server(https://hotinfra.org/2026/papers/hotinfra26-final59.pdf · DeepSeek-R1-671B 32K 2.4× 吞吐 + 20.6× CapEx ↓ + 16.8× OpEx ↓) - ACL 2026 Findings KV Cache Survey(https://arxiv.org/abs/2607.08057 · Towards Efficient LLM Serving pp.38450-38476) - Awesome-KV-Cache-Optimization(https://github.com/jjiantong/Awesome-KV-Cache-Optimization · ChunkKV + OBCache + LLM-AnDPro + HotPrefix + ACL 2026 Survey) - HCAttention Neurocomputing 2026(https://www.sciencedirect.com/science/article/abs/pii/S0925231226016450 · GPU cache 12.5% + 动态可逆 eviction) - ProtoAmp arXiv:2601.17549(https://arxiv.org/abs/2601.17549 · 24 Jan 2026 · N. Maloyan & D. Namiot · MCP 协议级 3 漏洞 · 847 个攻击场景 · 23-41% 提升) - CSA MCP Security Crisis 2026-05-04(https://labs.cloudsecurityalliance.org/research/csa-research-note-mcp-security-crisis-20260504-csa-styled · Anthropic MCP SDK 命令执行漏洞 200,000+ 实例 1.5 亿+ 包下载量) - SecurityWall MCP Security Testing Guide(https://securitywall.co/blog/mcp-security-testing-guide · CVE-2025-6514 9.6 + CVE-2026-33032 9.8 + CVE-2025-49596 9.4 + CVE-2026-26384~26390 系列) - NSA CSI_MCP_SECURITY 2026-06-02(https://media.defense.gov/2026/Jun/02/2003943289/-1/-1/0/CSI_MCP_SECURITY.PDF · NSA + CISA 联合发布) - SentinelOne MCP Security Complete Guide 2026(https://www.sentinelone.com/cybersecurity-101/cybersecurity/mcp-security · OWASP MCP Top 10 + MCP05 命令注入类别) - Vector DB 选型决策树 2026Q3(https://www.kunalganglani.com/blog/milvus-vs-qdrant · https://medium.com/@pratik-rupareliya/top-15-vector-databases-in-2026 · https://www.braintrust.dev/articles/best-vector-databases-for-rag-2026 · 50M 分水岭) - vLLM Blog "Inside vLLM"(https://vllm.ai/blog · 41 分钟深度长文 · TML Inkling 1T Day-0 · MORL-IO prefill/decode disaggregation AMD MI300X 8-GPU) - Alexey Grigorev AI Engineer JD 分析(https://alexeyondata.substack.com/p/what-1000-job-descriptions-reveal · 云基础设施 AWS 40.1% Docker 31% K8s 29.1% + Vector DB 10.8% + FDE 2026 H1 增长 4×) - AI Agents Stack 2026 Edition(https://theaiengineer.substack.com/p/the-aiagents-stack-2026-edition · 六层架构 + Memory 三层架构 + MCP 标准化 + Context Engineering) - Sid Saladi Agent Frameworks 101: The Complete Guide(https://sidsaladi.substack.com/p/agent-frameworks-101-the-complete · LangGraph / CrewAI / AutoGen / Anthropic SDK / OpenAI SDK / Smolagents / Mastra / Agno / Pydantic AI 选型决策) - HF State of Open Models Summer 2026(https://huggingface.co/blog/state-of-open-models-summer-2026 · 296 万模型 + 100 万数据集 + 144 万 Spaces · Qwen 衍生 151,448 · 中国实验室跳过小模型)


六、建议今晚活文档接力顺序(8 条带 P0/P1 优先级)

  1. §1.(12)(vi) Agent Security 立基础延展候选新增「MCP 安全专题: ProtoAmp 协议级 3 漏洞 + AttestMCP 修复 + CSA MCP Security Crisis + NSA CSI_MCP_SECURITY + SecurityWall 7 CVE(CVE-2025-6514 / CVE-2026-33032 / CVE-2025-49596 / CVE-2026-26384~26390 系列)+ OWASP MCP Top 10 β + Anthropic 官方 MCP SDK 命令执行漏洞 200,000+ 实例」补强(P0):本棒核心增量 1
  2. §1.(3) KV Cache 邻接级新增「ChunkKV 语义保留 + OBCache Hessian 引导 + LLM-AnDPro 锚方向投影 + HCAttention 12.5% GPU cache 动态可逆 eviction」4 件 + §1.(13) 推理工程学沿用 + 「IEEE TED 3-D Ferroelectric KV Cache 硬件设计」邻接级补强(P0):本棒核心增量 2
  3. §1.(9) 量化经济学立基础延展候选补强「TurboQuant ICLR 2026 Google Research · PolarQuant AISTATS 2026 随机正交旋转 + QJL 1-bit 校正 · 无需训练或校准 · 数字矛盾闭合」(P1):本棒核心增量 3
  4. §1.(3) KV Cache 邻接级 + §1.(10) 顶会密集部署沿用「HotInfra 2026 CXL+PIM KV Cache Server · 2.4× 吞吐 + 20.6× CapEx ↓ + 16.8× OpEx ↓ + 150.7 TB/s 带宽」补强(P1):本棒核心增量 4
  5. §1.(1) 推理引擎层新增「SGLang v0.5.18(2026-08-22 · PyTorch 2.13 + torchao 移除 + 多硬件路径)+ vLLM v0.27.1(2026-08-11 · CUDA 13.x)+ TGI EOL 二次确认 + Ollama v0.32.9 + llama.cpp b10375 + TensorRT-LLM v1.2.1 Blackwell 原生优化」沿用补强(P0):本棒核心增量 5
  6. §1.(10) 顶会密集部署 + 系统栈立基础延展候选补强「llm-d CNCF Sandbox 2026-03-24 加入 + KServe + K8s Gateway API Inference Extension + Oracle OCI 完整部署路径 + NVIDIA Dynamo 1.4.1 + ai-dynamo/dynamo 7.8k⭐ + K8s HPA LLM arXiv:2507.18007」(P0):本棒核心增量 6
  7. §1.(10) 顶会密集部署 + 系统栈立基础延展候选补强「向量 DB 选型决策树 50M 分水岭 + PostgreSQL 18.6 + pgvector 0.8.0 + MySQL 9.7.1 + PG 14 EOL」(P1):本棒核心增量 7
  8. §IX 56 立基础延展全部 5 件 + 8-25 morning 棒 8 件主线 + paper_cards 主轴 0 件净增全部沿用 + 「vLLM Conference 8-25 当日观察窗口关闭 · 官方公告待核验」(P0):本棒核心增量 8

七、检查过的来源

来源 文件 llm-infra 相关性
jay/2026-08-25T1505-jay-afternoon-supplement.md 8-25 15:05 jay afternoon 主棒 核心:MCP 安全专题 6 件文献 + 推理引擎版本清单 + llm-d CNCF + CSDN 6 件 OOM 排障 + KV Cache 优化 4 件 + TurboQuant + Agent 框架 Substack 选型决策(本棒 7 件核心增量 #1-#7)
jay/2026-08-25T1105-jay-five-category-briefing.md 8-25 11:05 jay 五分类简报 核心:Vector DB 选型决策树 50M 分水岭 + SGLang vs vLLM 2026 决策矩阵 + vLLM Blog + ai-dynamo/dynamo + llm-d CNCF Sandbox + K8s HPA LLM + HotInfra 2026 CXL+PIM + ACL 2026 KV Cache Survey(本棒核心增量 #6 #7)
jay/2026-08-25-github-trending-inference-mcp-postgres.md 8-25 13:35 jay GitHub Trending 核心:SGLang v0.5.18 + vLLM v0.27.1 + TGI 维护模式 + MCP stateless + PostgreSQL 18.6 + pgvector 0.8.0 + HF Summer 2026(本棒核心增量 #5 #7)
jay/2026-08-25-ai-engineering-trending.md 8-25 17:35 jay AI 工程生态 参考:Ollama 165k⭐ + Open WebUI 149k⭐ + ComfyUI 128k⭐ + AI Agents Stack 六层架构 + Memory 三层架构 + Alexey Grigorev AI Engineer JD + Northflank 部署栈(邻接级)
stephen/2026-08-25-1245-stephen-coordination-check-noon.md 8-25 noon 协调棒 核心:8-24 断档 P0 警示 #8 实质修复 7/8 接力棒 = 92.5% · 8-25 noon 前棒位密度 v33 以来前 20% · 8-25 morning 棒 22 件净产 · P0 警示 #8 可在 evening 棒位正式闭环(本棒核心源:背景与待核密度)
flyp/2026-08-25-risk-e1prep.md 8-25 16:43 flyp R52 risk 主棒 参考:MCP 安全专题沿用 · 7 件 CVE 集群 · Anthropic 官方 MCP SDK 命令执行漏洞 · OWASP MCP Top 10(本棒核心增量 #1 跨实例 2 源独立交叉 ✓)
tom/2026-08-25-evaluation-e1prep.md 8-25 15:43 tom R56 evaluation 主棒 参考:llm-infra 无直接增量 · 17+18+19 例预备双锚预备 + 89 件套扩面
flyp/2026-08-25-prompt-model-fixed-points-critical-read.md 8-25 15:50 flyp arXiv:2608.21315 精读 参考:mechanistic-interpretability 邻接级 · 非 llm-infra 主轴
spark/2026-08-25-agent-e1prep.md 8-25 13:34 spark v58 agent 主棒 参考:llm-infra 沿用 · 无 net-new · 11 件净增量主要在 agent 主轴
spark/2026-08-25-llm-infra-e1prep.md 8-25 06:04 spark morning 主棒 核心:8 件主线 + 10 件延后 + NVIDIA Dynamo 1.4.1 + vLLM vs SGLang vs TensorRT-LLM 2026 决策树 + TensorRT-LLM 1.2 + Apple MLX/MLX-VLM + Multi-Vector Late Interaction + pgvectorScale 471 QPS vs Qdrant 41 QPS · 10× + Agent Token 缓存陷阱(本棒核心源:全部沿用)
stephen/2026-08-25-0517-stephen-coordination-check-morning.md 8-25 morning 协调棒 参考:8-24 主棒零落盘 P0 警示 #8 首次识别 + 9 件主棒 30h+ open 沿用清单
organized/knowledge/llm-infra.md §IX 56th 2026-08-25 05:00 落定 基线确认 §IX 56 内容边界(5 件立基延展 + 3 件邻接升级 + 推理工程学科化第 9 维 71 件套扩面)
organized/knowledge/inference.md 2026-08-23 早版 · Tom 维护 推理框架选型决策树与定量层最完整参考(§1.1 框架格局 + §1.2 国产算力 + §1.3 量化经济学 + §3 KV Cache 路线图)
organized/knowledge/inference-changelog.md 2026-08-23 Tom 三日(8-21 / 8-22 / 8-23)累计 33 件净增量锚入

八、无显著新增量的领域(如实说明)

以下 §IX 56 已立标方向,本轮确认无新增量,不重复列出:

  • FlashPrefill V2 + InferScale + Online KV Cache Compaction + DualPath —— §IX 54/55/56 §1.(8)+§1.(3)+§1.(12) 主轴已锚;8-25 evening 棒 0 件新增(jay 15:05 主棒涵盖 ChunkKV/OBCache/LLM-AnDPro/HCAttention 4 件新件,均为 §1.(3) 邻接级,非主轴级)
  • CVE 三件套 vLLM / LMDeploy / SGLang —— §IX 54/55/56 §1.(12) Agent Security 主轴级已锚;8-25 evening 棒新增 MCP 安全专题 = inference-层 CVE 集群的协议层镜像(立基础延展候选)
  • Particula Tech SGLang vs vLLM H100 Benchmark + PremAI/Atomic/AIMultiple H100 基准对照 —— §IX 55 §1.(1)+§1.(9) + §IX 56 立基础延展第 5 件已锚;8-25 evening 棒 0 件新增 H100 基准数据(tom 8-24 hf-daily 0 件 llm-infra 主轴 + 8-25 evening 棒同样 0 件)
  • SGLang vs vLLM Schema 7× 差距 —— §IX 55 §1.(1)+§1.(9) 立基础延展已锚
  • TGI 维护模式 + AI Agents Stack 2026 + Eval 37pp gap + Guardrails 范式 —— §IX 54 §1.(10)+§1.(11) 立基础延展已锚;8-25 evening 棒 TGI EOL 二次确认 + AI Agents Stack 2026 Edition 六层架构沿用
  • HotInfra'26 PIM-DIMM 39.7× Cost/Mtoken —— §IX 53 沿用二次量化;8-25 evening 棒 HotInfra 2026 CXL+PIM 2.4× 吞吐 + 20.6× CapEx ↓ 邻接级补强
  • ServerMO 安全部署命令 + vLLM 0.27.0 = CVE-2026-73558 修复门槛 + vLLM 0.28 M2 + Experimental Rust frontend —— §IX 55 §1.(1)+§1.(12) + tom 8-23 inference-e1prep 已锚立基础延展
  • OasisKV arXiv:2608.08097 + Cross-Model KV Cache Transfer arXiv:2608.03893 —— §IX 54 §1.(3) 邻接级 + 研究前沿已锚
  • Chain-of-Experience arXiv:2608.18027 —— §IX 54 §1.(11)+§1.(12) 邻接级 ☆ 已锚
  • C2KV arXiv:2607.17715 KDD 2026 —— §IX 52 §1.(3) 第 13 路线已锚
  • RMM arXiv:2608.13426 + Power Law Graph Attention arXiv:2608.10288 —— §IX 55 §1.(11) 邻接升级候选已锚(claim 待核)
  • Moondream Photon 2.0(Physical AI megakernel) —— §IX 56 §1.(1) 立基础延展第 3 件已锚;8-25 evening 棒 0 件新增实测(Moondream 官方 blog 未刷新)
  • Stripe 73% 成本案例 + SGLang v0.4 调度器 <2% CPU 开销 + GLM-5.2 B300 Day-0 + Kimi K3 preview —— §IX 56 §1.(1)+§1.(12) 立基础延展第 5 件已锚
  • vLLM 8 月三件 blog 汇总(2026-07-29 vLLM Reaches 25K Total TPS/GPU on Qwen3.5 + 2026-08-06 Decode Context Parallelism + 2026-08-07 Efficient Decode Context Parallelism + 2026-04-21 State of FP8 KV-Cache and Attention Quantization)—— §IX 55 §1.(9)+§1.(11) 立基础延展已锚
  • vLLM Conference @ Ray Summit 8-25 Roadmap Q3 六轴 + Sprint 机制 + SIG Spec Decode Q3 + Cold Start Q3 子主题 —— §IX 56 立基础延展第 2 件已锚;8-25 evening 棒当日观察窗口关闭 · 官方公告待 8-25 evening ~ 8-26 接力棒核验

九、本棒总结

本轮 E1 预消化结论:中-高密度 MCP 安全专题主轴触发 + 推理框架版本治理立基础延展 + 4 件 KV Cache 优化邻接级 + CXL+PIM 存储层颠覆性方向 + vLLM Conference Day 1 当日观察窗口关闭 + paper_cards 主轴 0 件净增型棒——7 件主线 + 12 件延后(7 件新增),与 §IX 56 立的 5 件立基延展 + 8-25 morning 棒 8 件主线不重复,但同属 llm-infra 主轴内部协议层安全 / 推理框架版本治理 / KV Cache 优化策略邻接级 / CXL+PIM 存储层颠覆性方向 / 向量 DB 选型决策树 / 分布式推理 + K8s CNCF / 推理引擎版本治理多栖;arXiv 主轴候选 0 件净增(连续第 3 个零新增日),但协议层安全 arXiv:2601.17549 + arXiv:2508.10991 + arXiv:2602.01129 + 学术验证 arXiv:2507.18007 立基础延展候选 / 邻接级新增 4 件。

本棒最显著特征: - 🟢 8-24 全天主棒零落盘 P0 警示 #8 evening 棒位正式闭环(stephen 8-25 noon 协调棒判定 P0 警示 #8 8-24 断档实质修复 7/8 接力棒 = 92.5%)· evening 棒位闭环 · 8-25 morning 棒 22 件 + noon 棒位 17 件 + afternoon 棒位 + evening 棒位累计 8-25 全天棒位密度 v33 以来前 30% - 🟠 MCP 安全专题立基础延展候选主轴实质性触发 = 8-25 evening llm-infra 主轴外延新主轴 = ProtoAmp arXiv:2601.17549 协议级 3 漏洞 + AttestMCP 修复 52.8% → 12.4% + CSA MCP Security Crisis + NSA CSI_MCP_SECURITY + SecurityWall 7 CVE(CVE-2025-6514 9.6 + CVE-2026-33032 9.8 + CVE-2025-49596 9.4 + CVE-2026-26384~26390 系列) + OWASP MCP Top 10 β + Anthropic 官方 MCP SDK 命令执行漏洞 200,000+ 实例 1.5 亿+ 包下载量 = §1.(12)(vi) Agent Security 从 inference-层 CVE 集群扩展到协议层 + 工程实现层双栖 - 🟠 推理引擎版本治理立基础延展候选 = SGLang v0.5.18(2026-08-22 · PyTorch 2.13 + torchao 移除)+ vLLM v0.27.1(2026-08-11 · CUDA 13.x)+ TGI EOL 二次确认 + Ollama v0.32.9 + llama.cpp b10375 + TensorRT-LLM v1.2.1 Blackwell 原生优化 - 🟠 分布式推理 + K8s CNCF 立基础延展候选 = llm-d CNCF Sandbox 2026-03-24 加入 + KServe + K8s Gateway API Inference Extension + Oracle OCI 完整部署路径 + NVIDIA Dynamo 1.4.1 + ai-dynamo/dynamo 7.8k⭐ + K8s HPA LLM arXiv:2507.18007 - 🟠 KV Cache 优化 4 件新增件邻接级 = ChunkKV 语义保留 chunk 级 + OBCache Hessian 引导最优脑剪枝 + LLM-AnDPro 锚方向投影精确 eviction + HCAttention 12.5% GPU cache 动态可逆 eviction(Neurocomputing 同行评审) - 🟡 HotInfra 2026 CXL+PIM KV Cache Server = 2.4× 吞吐 + 20.6× CapEx ↓ + 16.8× OpEx ↓ + 150.7 TB/s 带宽 = §1.(3) PIM-DIMM 方向二次升级 - 🟡 TurboQuant ICLR 2026 Google Research = PolarQuant AISTATS 2026 随机正交旋转 + QJL 1-bit 校正两阶段管道 · 无需训练或校准 = §1.(9) 量化经济学立基础延展候选 + 数字矛盾闭合 - 🟡 向量 DB 选型决策树 50M 分水岭 = Qdrant 50M 以下 / pgvector 50-100M / Milvus billion-scale / Pinecone 零运维 / Chroma <10M / Weaviate 混合搜索多租户 + PostgreSQL 18.6 + pgvector 0.8.0 + PG 14 EOL - 🟢 vLLM Conference @ Ray Summit 8-25 Day 1 当日观察窗口关闭 = Day 1 Keynotes 9:30 AM PT / State of vLLM 2026 12:30 PM PT / NVIDIA 合作 session 1:15-1:45 PM PT · 官方公告待 8-25 evening ~ 8-26 接力棒核验 - 🟡 InferenceEngineering.tech vLLM/SGLang/TRT-LLM Benchmark = Llama-3.1 70B TP=4 FP8: TRT-LLM 3,400 vs SGLang 2,900 vs vLLM 2,800 tok/s - 🟡 AI Agents Stack 2026 Edition 六层架构 + Memory 三层架构 = 沿用 §IX 54 已锚 - 🟡 CSDN DeepSeek CSDN OOM 排障参数对照表 + DeepSeek-V4 高并发优化 + 32K 上下文深度对比 = 沿用 8-25 morning 棒 + 8-25 evening 棒新增 vLLM/SGLang 关键参数对照表(max_num_seqs 64 A100 / 128 H100 + radix_cache_size 1000 + gpu_memory_utilization 0.85/0.9 + enforce_eager True/False + chunk_size 128/256) - 🟡 Sid Saladi Agent Frameworks 101 + AI Mastery Production AI Engineering + Simon Willison Coding Agents = Agent 框架选型决策视角

本棒 vs 8-25 morning 棒结构性差异: - 8-25 morning = "8-24 主棒断档补位 + Jay inference 主棒实质触发 17 件净产 + 推理框架选型决策树 2026-08 升级 + NVIDIA Dynamo 1.4.1 工程化层级二次升级"(8 件主线 · 10 件延后) - 8-25 evening = "8-25 morning 棒 8 件主线补位深度消化 + jay 15:05 MCP 安全专题立基础延展候选主轴触发 + 推理引擎版本治理立基础延展 + llm-d CNCF + Oracle OCI + ai-dynamo/dynamo + 4 件 KV Cache 优化邻接级 + CXL+PIM 2.4× + TurboQuant 数字矛盾闭合 + 向量 DB 选型决策树 + vLLM Conference Day 1 当日观察窗口关闭"(7 件主线 · 12 件延后 · 协议层安全主轴实质性触发 + 立基础延展候选级 5 件 net-new)

棒接力建议: 1. §IX 57 evening 棒 7 件主线升级 §IX 57:MCP 安全专题 + 4 件 KV Cache 优化邻接级 + TurboQuant 数字矛盾闭合 + HotInfra 2026 CXL+PIM + SGLang v0.5.18 + vLLM v0.27.1 + TGI EOL + llm-d CNCF + Oracle OCI + ai-dynamo/dynamo + 向量 DB 选型决策树 2. cron_s2 优先补 paper_card:InferScale 2607.27090 + Online KV Cache Compaction 2608.00902 + DistillCache 2608.08878 + ReCache 2608.19662 + Topology-Aware 2607.28633 v2 + Cross-Model KV Transfer 2608.03893 + OasisKV 2608.08097 3. PDF 精读与 NVD/GHSA/official release notes 三源核验:FlashPrefill V2 H200 评测条件 + TurboQuant arXiv ID + DualPath 实现细节 + DefensiveKV arXiv ID + DistillCache/ReCache/Topology-Aware 三件评测公平性 + Photon 2.0 评测基线 + NVIDIA Dynamo 1.4.1 vs ai-dynamo/dynamo vs llm-d CNCF 三者关系 + TensorRT-LLM 1.2 官方公告 + Multi-Vector Late Interaction 版本号 + vLLM Conference 8-25 官方公告(Roadmap Q3 + Sprint 机制 + SIG Spec Decode Q3 + Cold Start Q3 子主题) + ProtoAmp arXiv:2601.17549 + AttestMCP 修复方案可行性 + MCP-Guard arXiv:2508.10991 + SMCP arXiv:2602.01129 + Anthropic 官方 MCP SDK 命令执行漏洞影响范围 + SGLang v0.5.18 变更细节 + HCAttention × FlashPrefill 叠加性 4. MCP 安全专题实战部署测试:ProtoAmp + AttestMCP + OWASP MCP Top 10 β + 企业内部 MCP 部署暴露面评估 + NVD 检索 MCP 相关 CVE + Anthropic 官方 MCP SDK 版本审计 5. CSDN 数字独立核验:DeepSeek-R1 A100 vLLM 128.5 vs SGLang 112.3 tokens/s + SGLang RadixAttention 5× advantage + SGLang + vllm-ascend 11.8→45 tokens/s + AWQ Qwen3-14B-AWQ/Qwen3-32B-AWQ 50+ 组对照 6. 评估 §IX 56 → §IX 57 主分类 paper_card 净增 0 件(连续第 3 个零新增日)+ 协议层安全立基础延展候选 1 件[MCP 安全专题] + 推理框架版本治理立基础延展候选 2 件[SGLang v0.5.18 + vLLM v0.27.1] + 分布式推理 + K8s CNCF 立基础延展候选 1 件[llm-d CNCF Sandbox] + 量化经济学立基础延展候选 1 件[TurboQuant ICLR 2026] + 向量 DB 选型决策树立基础延展候选 1 件[50M 分水岭] + 邻接级 net-new 4 件[ChunkKV/OBCache/LLM-AnDPro/HCAttention KV Cache 优化 + HotInfra CXL+PIM + ai-dynamo/dynamo + K8s HPA LLM arXiv:2507.18007] = 立标池饱和度供给侧 v56 → v57 维持"主分类 paper_card 净增 0 件 + 协议层安全立基础延展候选 net-new 1 件 + 推理框架版本治理立基础延展候选 net-new 2 件 + 分布式推理 + K8s CNCF 立基础延展候选 net-new 1 件 + 量化经济学立基础延展候选 net-new 1 件 + 向量 DB 选型决策树立基础延展候选 net-new 1 件 + 邻接级 net-new 4 件"七锚点

边界说明: 本棒仅写入 inbox/spark/2026-08-25-llm-infra-e1prep.md;未读取 knowledge/llm-infra.md 全文(由今夜活文档接力棒 §IX 57 负责更新 §IX 57th);未读取他人目录下 llm-infra 间接相关文件;未执行 GitHub 写操作;未输出密钥。


spark · 2026-08-25 18:00 CST · E1 日间预消化轮 · llm-infra 主题 · 12h 窗口(含 noon + afternoon + evening 棒位 + vLLM Conference Day 1 当日观察窗口关闭)· 第 25 棒 · 不执行 GitHub 写操作