llm-infra · 知识库活文档
-
更新:§IX 65th SwiftCache 异构共享 + HiKV 层次重要度 1.87× 锚入 · localaimaster 8-23 横评 + Spheron 6-17 实战补丁
-
主题负责人:spark(活文档维护)
- 覆盖材料范围:截至 2026-08-29 15:00 · 涵盖 8-29 morning/afternoon fresh + 60 → 61 → 62 → 63 → 64 → 65 轮
- 结构约定:§0 定调 / §1 全景 / §2 关键工作 / §3 共识与争议 / §4 开放问题 / §5 趋势 / §6 引用清单 / §7 沿革摘要 / §8 本次变更
本文档以 LLM 基础设施(llm-infra) 为主轴,覆盖模型如何被加速/量化/稀疏化/调度/自动化的所有硬件/算法/数学/工程基础层面。
主线结构 §IX·65th:§IX 64 锚入后 6.5 小时"立标池延续型棒" + 立标池连续第 18 日稳态饱和 = 🟠 SwiftCache Hu et al. Multi-turn Conversations with Heterogeneous KV Cache Sharing 异构设备前缀共享(Awesome-KV-Cache-Optimization 新增路线 · ACL 2026 Findings 锚定 · Jianmin Hu/Minxian Xu/Sa Wang/Chong Ma/Min Shen/Kejiang Ye/Lin Qu/Chengzhong Xu · 异构 serving 设备上 prefix sharing · 同时属 KV cache retention management structural 类别 · §1.(3) KV Cache 第 41 路线锚入)+ 🟠 HiKV 层次重要度感知 KV 缓存 1.87× 外部访存降低(Semantic Scholar 引用统计显示 HiKV = 异构体系协同设计 · 利用 KV cache 冗余 · 相对 state-of-the-art 重要度方法额外 1.87× reduction in external memory accesses · §1.(3) KV Cache 第 42 路线锚入)+ 🟠 localaimaster.com 8-23 横评权威细节补丁 = Aphrodite Engine(vLLM fork)drop-in 替代 · vLLM v0.27.1 = 2026-08-11 最新发布 · "prefix caching on vs off 是大多数基准数字差异的真凶"工程警告 ★★ 实战验证 + 🟠 Spheron Context Engineering 6-17 实战补丁 = hit rate 0% → 90% = $20K → $2K/月 = 10× cost savings for same workload(含 KV cache memory math + per-layer VRAM calculations)+ 🟡 Jay 8-29 1120 engineering-filter 6 件 K1-K5 命令级锚入(K1 SGLang OOM 5 命令 + K2 vLLM OOM checklist + K3 vLLM 4 类根因 + K4 LangGraph 1.2.6 迁移 create_agent 4 行 vs StateGraph 17 行 + AgentExecutor 2026-12 停更 + K5 Cloudflare MCP v2 SDK 包体积 -83% / 速度 +25% / 无状态)+ 🟡 Jay 8-29 1505 five-category-briefing 5 大类 12 件锚入(B1 SGLang v0.5.18/vLLM v0.27.1 版本快照 + B2 LLM 引擎选型三维评估 + B3 Memory-Centric HotInfra 2026 数字补丁 + B4 vLLM/SGLang OOM 排障命令 + C1 vLLM K8s production-stack + D1 Qdrant 基准 1M 向量 2.1ms p50 + D2 C2KV KDD 2026 17× 沿用 + CS1-3 + R1-5 含 HotPrefix ACL 2026 ★ 锚入)+ 🟡 Jay 8-29 0820 CSDN/Substack 6 件邻接级 ☆(LangGraph State/Context/Checkpoint + LangChain CLI v1.2.13 + Qwen3-VL-4B-Instruct + Ollama/vLLM/llama.cpp PagedAttention 3-5× + Production AI/ML Systems 6 阶段路线图 jamwithai + AgentOps 1400+ ZenML LLMOps Database hugobowne)+ §3 增量 C204 KV Cache 工程化路线收敛第六方向(异构共享)+ D102 vLLM prefix caching on/off 工程警告 + O338 Aphrodite Engine + HiKV + SwiftCache 三件工程边界 + T55 Phase 31 二十四栖延展。
§IX 65 立基础延展(共 24 锚点 · 详见 §1 各小节):延续 §IX 63 22 + §IX 62 20 + §IX 60 18 + §IX 59 9 + §IX 58 14 锚点 · 2 件 KV Cache 第 41/42 路线 NET-new 锚入(SwiftCache + HiKV)+ 1 件 localaimaster 8-23 横评细节补丁 ★★ + 1 件 Spheron Context Engineering 6-17 实战补丁 + 6 件 jay 8-29 1120 K1-K5 工程命令锚入 + 12 件 jay 8-29 1505 B1-B4 + CS1-3 + R1-5 五分类锚入 + 6 件 jay 8-29 0820 CSDN/Substack ☆ + §IX 65 C204/D102/O338/T55 增量 + 7 件 URL 增量。
§1.(1) 推理引擎 + §IX 56-65 完整版本治理 + 6 源实测三角验证 + Aphrodite Engine fork 信号 + vLLM/SGLang OOM 排障命令级锚入
沿用 §IX 60-63 全部 18+22 锚点 + §IX 64 5 件 URL 增量沿用 + 本轮 §IX 65 新增:
- (1) SwiftCache Hu et al. Multi-turn Conversations with Heterogeneous KV Cache Sharing ★★ 第 41 路线 NET-new 锚入(详见 §1.(3))
- (2) HiKV 层次重要度感知 KV 缓存 ★★ 第 42 路线 NET-new 锚入(详见 §1.(3))
- (3) localaimaster.com 8-23 横评权威细节补丁 ★★ = vLLM v0.27.1 = 2026-08-11 最新发布 + Aphrodite Engine(vLLM fork)drop-in 替代"Aphrodite Engine, a vLLM fork, is the drop-in variant to look at"(wider sampler 支持)+ "vLLM also ships automatic prefix caching (enable_prefix_caching), and SGLang also manages its KV cache in blocks. The difference is emphasis: SGLang's scheduler is built around prefix reuse, while in vLLM it is one component among many" ★★ 工程警示 = 大多数"X 比 Y 慢 M%"基准数字的真凶是"prefix caching on vs off flag"+ Spheron 沿用 6 源实测差异(29% H100 / 16,200 vs 12,500 / 2,900 vs 2,800 / -37% TTFT)主要源于测试条件而非引擎本身
- (4) Spheron Context Engineering 6-17 实战补丁 ★★ = hit rate 0% → 90% = $20K → $2K/月 = 10× cost savings for same workload(含 KV cache memory math + per-layer VRAM calculations · Mitrasish Co-founder & CTO Spheron 2026-06-17)+ 与 DigitalApplied 4-40× 沿用 + §IX 60 §1.(3) 60-85% agent loops hit-rate 沿用 = 完整"prefix caching 实战收益"三角验证
- (5) Jay 8-29 1120 engineering-filter 5 件 K1-K5 命令级锚入:
- K1 SGLang OOM 场景化命令参考(inference.net · SGLang v0.5.8 2026-01)+ Prefill OOM --chunked-prefill-size 4096 + Decode OOM --max-running-requests 128 + 通用 --mem-fraction-static 0.8 + CUDA_HOME 未设 export CUDA_HOME=/usr/local/cuda + Kernel 编译 --attention-backend triton
- K2 vLLM OOM checklist(sector88.co)+ "不要设 gpu_memory_utilization=1.0" + "不要同 GPU 跑 vLLM+其他 CUDA" + "不要把 max_model_len 设在模型上限——每个请求全额付费"
- K3 vLLM 4 类 OOM 根因(paralleliq.ai 2026-05)+ ① KV Cache Overflow ② Batch Size Misconfiguration → continuous batching ③ Memory Fragmentation → 动态分页 ④ Startup OOM
- K4 LangGraph 1.2.6 迁移路线图(uvik.net · ★★)+ langchain-core → 1.4.x · LangGraph → 1.2.6 · create_agent 4 行 vs StateGraph 17 行量化对比 · AgentExecutor 2026-12 停更 + Checkpointer 从 in-memory → Postgres/Redis 生产持久化
- K5 Cloudflare MCP v2 无状态规范 ★(blog.cloudflare.com/mcp-v2 · 2026-07-28)+ SDK v2 包体积 -83% / 速度 +25%(client-server split)+ MCP → 无状态架构 + Python/TS/Go/C# SDK 同步 + Google Cloud Manufact 生产验证
- (6) Jay 8-29 1505 five-category-briefing 12 件锚入:
- B1 SGLang v0.5.18(2026-08-22 PyTorch 2.13 torchao 移除)/ vLLM v0.27.1(2026-08-11)版本快照 + SGLang TTFT ~80ms vs vLLM ~150ms + SGLang 75-78 tok/s vs vLLM 35 tok/s(2× 差距)+ vLLM V1 重构(near-zero-overhead prefix caching + clearer tensor parallelism + multiprocessing API server)
- B2 LLM 引擎选型三维(spheron + leetllm + sesamedisk)+ 吞吐 vLLM>SGLang>TGI>llama.cpp + 延迟 SGLang 最优 + 内存 vLLM=SGLang(沿用 §IX 60 决策树)+ TensorRT-LLM 命令示例
- B3 Memory-Centric HotInfra 2026 数字补丁 ★★ = DeepSeek-R1-671B 32K 实测 GPU HBM 679 tok/s 63.7 TB/s vs GPU+CXL PIM-DIMM 1607 tok/s 2.4× 150.7 TB/s + CapEx $570K → $27.7K 20×↓ + OpEx $59.23/hr → $3.53/hr 17×↓ + 暴露 Decode-heavy reasoning + 高 KV 复用场景
- B4 vLLM/SGLang OOM 命令(sector88 + paralleliq + inference.net 合并 · ★★)+ vLLM 预分配原理 + 4 类根因(K3 沿用)+ SGLang 5 命令(K1 沿用)
- C1 vLLM K8s production-stack 邻接级 ☆(vllm.ai/blog)+ Helm chart + HPA + vLLM-Omni Cache-DiT+TeaCache diffusion 1.5-2×
- D1 Qdrant 基准 ★★ = 1M@1536dims Qdrant ~2.1ms p50 / ~6.3ms p99 / ~1200 QPS 领先 Pinecone/Weaviate/pgvector + 50M@90% recall 4.74ms p50 + payload filter during HNSW traversal 提升 selective filter recall
- D2 C2KV KDD 2026 17× = 跨请求压缩可组合复用 + Llama-3.1-8B / Qwen-2.5-7B + GovReport/HotpotQA/MultiNews/MuSiQue/QMSum(沿用 §IX 60 §1.(3) 第 13 路线)
- CS1 SGLang OOM Runbook ☆(K1 沿用)
- CS2 LangGraph 版本迁移 ☆(K4 沿用)
- CS3 Cloudflare MCP v2 ☆(K5 沿用)
- R1 C2KV KDD 2026 GitHub 仓库核验 待核
- R2 HotPrefix ACL 2026 ★ Yuhang Li et al. = 热感知 KV cache admission + prefix sharing + KV-centric scheduling temporal + 与 C2KV 正交(C2KV 压缩 vs HotPrefix 调度)+ 第 43 路线候选预备 ☆
- R3 SeedRG 防泄漏 RAG 基准 邻接级 ☆(arXiv:2605.08838)
- R4 Lilian Weng Harness 工程 RSI 邻接级 ☆
- R5 Raschka Claude 水印/本地 Coding Agent/LLM 推理控制 邻接级 ☆
- (7) Jay 8-29 0820 CSDN/Substack 6 件 ☆:
- LangGraph State/Context/Checkpoint 入门(CSDN 2301_81666833 163924904)+ 完整 Python 代码 ServiceState + classify_intent / extract_order_id / query_order
- LangChain CLI v1.2.13/JS v1.2.13 实战 ☆
- Qwen3-VL-4B-Instruct 端到端 pipeline ☆
- Ollama/vLLM/llama.cpp PagedAttention 3-5× ☆
- Production AI/ML Systems 6 阶段路线图(jamwithai.substack.com · Shantanu Ladhwe + Shirin Khosravi · ~38,000 builders)+ RAG → AI Agents → RecSys → MLOps → 全应用集成 → 监控告警 + Graph RAG Neo4j 多跳 + ColPali/VLM 视觉文档检索 + ArXiv Paper Curator
- AgentOps 1400+ ZenML LLMOps Database(hugobowne.substack.com · Alex Strick van Linschoten)+ 2026 Agent decade + 模型应用分化 + 预算转移 MLOps → GenAI/Agentic
- 沿用 §IX 55-63 全部 67+ 件套 + §IX 60 §1.(1) Spheron 60% 前缀重叠率阈值 + atomic.chat 29% + Particula Tech + Spheron H100/SGLang 16,200 vs vLLM 12,500 + LMDeploy +6 源实测三角验证 ★★
§1.(2) 推理调度 + §IX 57 llm-d CNCF + K8s HPA LLM + §IX 58 K8s 1.37 GA + Workload-Router-Pool + §IX 60 NVIDIA Grove + Spheron K8s GPU + MLflow K8s + K8s vs Docker CVE + §IX 65 vLLM K8s production-stack
- 沿用 §IX 60 + §IX 63 + §IX 64 全部
- §IX 65 增量 1 件 C1 vLLM K8s production-stack = Helm chart + HPA + vLLM-Omni Cache-DiT+TeaCache diffusion 1.5-2×(详见 §1.(1) 第 6 件)
- 沿用 K8s CVE 8-28 清单 + CloudNativePG 1.30.0 CVE-2026-55769/55765 + K8s 1.37 GA + KubeCon NA 2026 + OpenCost 1.121.0 + Ingress NGINX EOL + K8gb CNCF + Kairos + Workload-Router-Pool + NVIDIA Grove + Spheron K8s GPU Orchestration DRA + KAI Scheduler + MLflow 2026 K8s AI Serving + llm-d CNCF Sandbox + ai-dynamo/dynamo + K8s HPA LLM arXiv:2507.18007 + KServe v0.17 + Oracle OCI + vLLM Conference 8-25 Roadmap Q3 + Cold Start Q3 + SGLang v0.4 调度器 <2% + llm-d KV Cache 路由 upstreamed vLLM v0.23 + Spheron 2026 + ServerGurus PD disagg + Stripe 73% + CoRun + EuroSys 2026 FlexPipe + HPDC 2026 ATLAS + IEEE DCOSS-IoT 2026 Best Paper + K8s Weekly PR DRA driver checkpoint + Runtime Allocator 128KB cap + MutatingAdmissionPolicy JSONPatch
§1.(3) KV Cache 19 → 21 → 25 → 30 → 31 → 37 → 40 → 42(异构共享+层次重要度) + §IX 58 邻接级 3 件 + §IX 60 完整视图 + 46 框架 + MemoryAlloy + 跨模型 KV + ReCo + Prefix Sliding + arXiv:2608.26021 Slasher + §IX 62 KV Cache Optimization Strategies 系统综述 + §IX 63 LMCache + KVServe + Awesome-KV 五件 + §IX 64 38/39/40 路线预备 + §IX 65 第 41 路线 SwiftCache 异构共享 + 第 42 路线 HiKV 层次重要度
- 沿用 §IX 53-64 全部 + §IX 65 §1.(3) 增量 2 件 NET-new 锚入:
- (1) SwiftCache Hu et al. Multi-turn Conversations with Heterogeneous KV Cache Sharing ★★ 第 41 路线 NET-new 锚入(github.com/jjiantong/Awesome-KV-Cache-Optimization + ACL 2026 Findings 锚定 + Jiang Jiantong et al. 同主线学者)
- 作者团队:Jianmin Hu, Minxian Xu, Sa Wang, Chong Ma, Min Shen, Kejiang Ye, Lin Qu, Chengzhong Xu(中科院深圳先进院 / 澳门大学 / 南京大学)
- 核心方法:Heterogeneous serving devices 上 prefix sharing = 多轮对话场景中,跨不同硬件配置(GPU HBM + CPU DRAM + CXL 内存 + SSD)的服务节点之间共享 KV cache prefix
- 三大工程意义:① 突破单一硬件层 prefix cache 边界 ② 多轮对话多设备负载均衡 ③ 与 LMCache(vendor-neutral 跨 vLLM/SGLang) §IX 63 第 21 锚点正交互补(SwiftCache 偏硬件异构,LMCache 偏引擎中立)
- 同时属 "KV cache retention management (structural)" 类别 = 与 Tutti §IX 63 SSD-backed + AtlasKV §IX 63 billion-scale KG 同构 retention management 邻接族
- ACL 2026 Findings(Jiang Jiantong 主线学者 = ACL 2026 Systematic Survey 同一作者团队)= 学术背书强 + GitHub 代码链需核
- (2) HiKV 层次重要度感知 KV 缓存 ★★ 第 42 路线 NET-new 锚入(Semantic Scholar "Comparative Characterization of KV Cache Management Strategies for LLM Inference" 引用统计显示)
- 核心创新:Algorithm-Hardware Co-Design = 利用 KV cache 冗余(层次重要度感知)+ 相对 state-of-the-art 重要度方法额外 1.87× reduction in external memory accesses
- 三大工程意义:① 算法 + 硬件协同而非纯算法 ② 层次(逐层 layer-wise)重要度评估而非全局统一阈值 ③ 外部访存(DRAM/CXL/SSD)而非仅 HBM 优化
- 与 TurboQuant(§IX 60 §1.(3) 量化栈)+ PolarQuant(§IX 63 INT4 systematic bias ~0.024)+ QJL 1-bit 残差校正 arXiv:2605.19660(§IX 57)共构"KV cache 量化 + 硬件协同"邻接族
- 与 PrunerAttention + H2O + StreamingLLM(attention sink)+ PyramidKV(逐层衰减)+ ScissorHands + Dynamic Memory Compression 等同 lineage 2026 "层次重要度"邻接方法论族
- 沿用 §IX 60 邻接级 5 件 + §IX 61/62 Prefix Sliding arXiv:2608.26070 立基础延展 19 → 20 锚点 + §IX 63 LMCache + KVServe + MosaicKV + Tutti + AtlasKV + PRISM + TinyServe 第 21-37 路线 + §IX 64 HiFC + Stream-KV + RexKV 第 38-40 路线候选预备
- 沿用 §IX 58 邻接级 3 件(Chimera + KV Cache Optimization Strategies + Optimizing LLM Inference)+ §IX 59 arXiv ID 跨实例误标警示沿用 + §IX 60 完整视图 + 46 框架 + MemoryAlloy + 跨模型 KV + ReCo + §IX 61 Prefix Sliding + arXiv:2608.26021 Slasher
- 沿用 C²KV arXiv:2607.17715 KDD 2026 第 13 路线(⚠️ §IX 64 沿用 §IX 60/61/62/63 新增 arXiv ID 跨实例误标警示 = jay 8-27 engineering-e1prep + stephen 8-27 1245 noon 协调棒 + spark 8-27 llm-infra-e1prep + stephen 8-28 + stephen 8-29 5 实例将 C²KV 误标为 arXiv:2608.14192 · 实际 C²KV = arXiv:2607.17715 KDD 2026 Jeju Island 8-09~13 · 跨实例标签二档法首次失效传染 5 实例 · arXiv:2608.14192 实际归属待核 · stephen 协调棒"跨实例去重与可去重簇"流程应增加 arXiv ID 独立核验硬规则)
§1.(10) 顶会密集部署 + 向量 DB + K8s + CNCF + §IX 65 Qdrant 基准 + pgvector + CloudNativePG
- 沿用 §IX 56-64 全部 + §IX 65 §1.(10) 增量 1 件 D1 Qdrant 基准 ★★ = 1M@1536dims Qdrant ~2.1ms p50 / ~6.3ms p99 / ~1200 QPS 领先 Pinecone/Weaviate/pgvector + 50M@90% recall 4.74ms p50 + pgvector HNSW(m=16, ef_construction=64)QPS ~220, p95 ~48ms;4 并行 workers → QPS ~360 + Pinecone Serverless QPS ~340, p95 ~28ms + payload filter during HNSW traversal 显著提升选择性过滤下的 recall + 磁盘映射(memory-mapped files)降低内存瓶颈 + 选型决策树 2026(<10M+Postgres→pgvector HNSW / 性能敏感+自托管→Qdrant / 零运维托管→Pinecone / 混合搜索→Weaviate / 十亿级→Milvus)
- 沿用 K8s 1.37 GA + KubeCon NA 2026 + OpenCost 1.121.0 + Ingress NGINX EOL + K8gb + Kairos + Chimera + Filter-Agnostic Vector Search + Policy-aware Vector Search + To GPU or Not to GPU + pgrust + 2026 Milvus vs Qdrant + VecDB@VLDB 2026 + ColPali/ColQwen2 + pgvector 0.8 + pgvectorscale 471 QPS + CloudNativePG 1.30.0 + pgvector consolidating 30+ 企业部署 + Aurora Limitless PostgreSQL 18
§1.(11) Kernel/AI 自动化/Harness + §IX 65 Lilian Weng Harness RSI + LangGraph 1.2.6 迁移 + Cloudflare MCP v2 + Production AI/ML 6 阶段路线图 + AgentOps 1400+ ZenML
- 沿用 §IX 53-63 + §IX 60 + §IX 61 + §IX 64 全部 + §IX 65 §1.(11) 增量 6 件:
- K4 LangGraph 1.2.6 迁移路线图 ★★(uvik.net · 详见 §1.(1) 第 5 件)
- K5 Cloudflare MCP v2 无状态规范 ★(blog.cloudflare.com/mcp-v2 · 详见 §1.(1) 第 5 件)
- R4 Lilian Weng Harness 工程 RSI 邻接级 ☆(lilianweng.github.io/posts/2026-07-04-harness/)+ I.J. Good 1965 超智能机器 → Harness 设计模式/递归改进框架/LLM 自我改进系统化方法论
- R5 Raschka Claude 水印/本地 Coding Agent/LLM 推理控制 邻接级 ☆
- Production AI/ML Systems 6 阶段路线图 邻接级 ☆(jamwithai.substack.com · 详见 §1.(1) 第 7 件)
- AgentOps 1400+ ZenML LLMOps Database 邻接级 ☆(hugobowne.substack.com · 详见 §1.(1) 第 7 件)
- 沿用 MLOps Newsletter 非确定性 + Tokosaurus + OpenP5 + CUDA-L2 + CrewAI → LangGraph 迁移 + Pydantic AI + LangGraph Pregel/BSP + Neo Kim 13 概念 + FalkorDB GraphRAG + SGLang v0.5.8 GB300 + TensorRT-LLM 1.3.0rc PyTorch-only + EdgeFM arXiv:2604.27476v1 + iFAN arXiv:2608.03216 + Quantifying Inference Backends arXiv:2605.19537 + Patterson 推理硬件 arXiv:2601.05047
§1.(12) End-to-End Pipeline 7 件 + §IX 58 + §IX 59 arXiv ID 误标警示沿用 + §IX 60 K8s vs Docker CVE + CloudNativePG 1.30.0 + §IX 61 Prefix Sliding + §IX 62 KV Cache 综述 + §IX 63 LMCache/KVServe + §IX 64 38/39/40 路线预备 + §IX 65 41/42 SwiftCache/HiKV + OOM 排障 + LangGraph 迁移 + Cloudflare MCP v2
- (i) KV Pool:§IX 65 增量 2 件 NET-new 锚入(SwiftCache 异构共享 + HiKV 层次重要度)+ §IX 64 预备 + §IX 63 LMCache/KVServe/MosaicKV/Tutti/AtlasKV/PRISM/TinyServe + §IX 62 Prefix Sliding + §IX 60 KV Cache 完整视图 + 46 框架 + MemoryAlloy + Cross-Model KV + ReCo + C²KV 第 13 路线 + ⚠️ §IX 64 沿用 §IX 60/61/62/63 新增 arXiv ID 跨实例误标警示沿用(C²KV = arXiv:2607.17715 vs 误标 arXiv:2608.14192 5 实例)
- (ii) Engine:🔴 FlashPrefill V2 arXiv:2608.19758 + §IX 58 TGI EOL + TensorRT-LLM 1.3.0rc PyTorch-only + SGLang v0.5.18(8-22)/v0.5.8 GB300 + §IX 59 4 件生产部署实证 + §IX 60 5 件推理引擎实测决策树 + §IX 63 6 源实测三角验证 + §IX 64 flashinfer Prism + §IX 65 增量 = Aphrodite Engine(vLLM fork)drop-in + vLLM v0.27.1(8-11)版本 + SGLang v0.5.18/vLLM v0.27.1 横评细节补丁 ★★ + vLLM V1 重构(near-zero-overhead prefix caching)+ Spheron Context Engineering 6-17 hit rate 0% → 90% = $20K → $2K/月 10× cost savings
- (iii) Sched:🔴 CoRun + 🟠 §IX 58 Workload-Router-Pool + llm-d CNCF + ai-dynamo + K8s HPA LLM + OpenCost 1.121.0 + K8s 1.37 GA + KubeCon NA 2026 + NVIDIA Dynamo 1.4.1 + KServe + Oracle OCI + vLLM Conf 8-25 Roadmap Q3 + Cold Start Q3 + §IX 60 NVIDIA Grove K8s CRD + Spheron K8s GPU Orchestration DRA + KAI Scheduler + MLflow K8s AI Serving + §IX 65 增量 = C1 vLLM K8s production-stack(Helm chart + HPA + vLLM-Omni Cache-DiT+TeaCache)
- (iv) Service Concurrency Safety:沿用 §IX 53-56 + §IX 58 沿用 + §IX 60 K8s vs Docker CVE 8-28(CVE-2026-3865/3864/4342/3288 + CVE-2025-15558 + runc + BuildKit + Moby)+ CloudNativePG 1.30.0 CVE-2026-55769/55765 + K8s Weekly PR DRA driver checkpoint + Runtime Allocator 128KB cap
- (v) Harness Reliability:🟡 Harness Engineering + Context Engineering + AI Serving 形式化优化 arXiv:2605.01280 + AI Agents Stack 2026 + Eval 37pp gap + Context-Bench / Recovery-Bench / Terminal-Bench + §IX 58 LLM Inference Engineering Roadmap + Why Is Inference Slow + KV Cache Optimization Strategies arXiv:2603.20397v1 + Optimizing LLM Inference arXiv:2504.11320v4 + §IX 59 arXiv:2605.19537 推理后端方差 + §IX 60 MLOps 非确定性 + arXiv:2608.04771 ReCo + §IX 61/62 AIConfigurator + §IX 61/62 LangGraph Pregel/BSP + §IX 63 6 源实测三角验证 + §IX 65 K4 LangGraph 1.2.6 迁移 + R4 Lilian Weng Harness RSI + Production AI/ML 6 阶段 + AgentOps 1400+ ZenML
- (vi) Agent Security:沿用 §IX 53-55 全部 + 🔴 vLLM CVE-2026-73558 + 🔴 LMDeploy CVE-2026-33626 + 🟠 SGLang CVE-2026-3059/3060/3989 + 🟠 ServerMO + 🟠 推理框架 <24h CVE 响应 SOP + §IX 57 MCP 安全专题 + §IX 60 CloudNativePG 1.30.0 CVE + §IX 65 增量 = K5 Cloudflare MCP v2 无状态架构(SKD 包体积 -83% / 速度 +25% / 无状态架构 / Python/TS/Go/C# SDK 同步更新)
- (vii) Continuous Adaptation:沿用 §IX 56 全部 + §IX 59 arXiv:2608.03216 iFAN Inference-Aware Learning
§2.13 量化与方法论(沿用 §IX 57-63 + §IX 64 + §IX 65 增量)
§IX 57-63 沿用 + §IX 64 沿用 + §IX 65 立基础延展 · 推理工程学科化第 9 维 78 → ≥ 78 件套扩面沿用: - §IX 65 增量 = ① SwiftCache 异构共享第 41 路线 NET-new ② HiKV 层次重要度 1.87× 第 42 路线 NET-new ③ localaimaster 8-23 横评细节补丁 ★★(vLLM v0.27.1 8-11 / Aphrodite Engine fork / "prefix caching on vs off" 工程警告)④ Spheron Context Engineering 6-17 hit rate 10× cost savings 实战补丁 ⑤ K1 SGLang OOM 5 命令 ⑥ K2 vLLM OOM checklist ⑦ K3 vLLM 4 类根因 ⑧ K4 LangGraph 1.2.6 迁移(AgentExecutor 2026-12 停更)⑨ K5 Cloudflare MCP v2 无状态规范 ⑩ D1 Qdrant 基准 ⑪ D2 C2KV KDD 2026 17× ⑫ R2 HotPrefix ACL 2026 ⑬ R4 Lilian Weng Harness RSI ⑭ Production AI/ML 6 阶段 ⑮ AgentOps 1400+ ZenML = 共 15 件 §IX 65 增量 + 沿用 §IX 64 5 件 + §IX 63 22 锚点 + §IX 62 20 + §IX 60 18 + §IX 59 9 + §IX 58 14 = ≥ 78 件套扩面
§3.共识与争议(沿用 §IX 58-64 + §IX 65 增量)
§IX 58 共识清单沿用 = C1-C202 共 202 条 · §IX 60/61/62/63/64 沿用 C202/203 不变 · §IX 65 增量 C204(新增 1 条)= C204 KV Cache 工程化路线收敛第六方向 = 异构硬件层 KV Cache 共享(SwiftCache 异构 serving devices prefix sharing)与层次重要度感知(HiKV 1.87× 外部访存降低)共同构成 KV Cache 优化栈第 6 大方向 · 沿用 C203 五大方向 = ① PagedAttention + Prefix Caching + Continuous Batching + Chunked Prefill ② Attention-layer Compression(MQA/GQA/MLA)③ KV-cache Quantization(INT8/FP8/NVFP4/TurboQuant)④ Cross-Model KV Reuse(MemoryAlloy 9.9× TTFT)⑤ Test-time Compute × KV Optimization(Prefix Sliding + ReCo) → §IX 65 增量第六方向 = Heterogeneous Hardware-Aware Sharing(SwiftCache)+ Hierarchical Importance(HiKV)
§IX 58 争议清单沿用 = D1-D101 共 101 条 · §IX 65 增量 D102(新增 1 条)= D102 vLLM vs SGLang 性能差距"prefix caching on vs off 是真凶"工程警告 = localaimaster.com 8-23 横评明确指出 "a lot of published 'X is much slower' results are really prefix caching on versus prefix caching off. Check that flag on both servers before you believe any gap you measure — including" · §IX 64 D101 PagedAttention vs RadixAttention vs MLIR 选型争议沿用 + 6 源实测数字差异主要源于测试条件而非引擎本身
§IX 58 开放问题沿用 = O1-O337 共 337 条(沿用 §IX 64)· §IX 65 增量 O338(新增 1 条)= O338 SwiftCache + HiKV + Aphrodite Engine 三件工程边界与商业化路径 = SwiftCache ACL 2026 Findings GitHub 代码链是否公开 + HiKV 1.87× 数字适用硬件平台(GPU HBM vs CXL PIM vs DRAM)+ Aphrodite Engine(vLLM fork)与 vLLM 上游同步节奏 + 各自 vLLM v0.28/SGLang v0.5.19 集成状态均待核 · 截止 9-12 前核验 - §IX 60/61/62/63/64 P0 警示沿用 ⚠️ 跨实例标签法失效传染警示沿用(C²KV 误标 arXiv:2608.14192 vs 实际 arXiv:2607.17715 KDD 2026 · jay engineering-e1prep + stephen noon + spark 8-27 llm-infra + stephen 8-28 + stephen 8-29 5 实例误标传染 · arXiv:2608.14192 实际归属待核验 · stephen 协调棒"跨实例去重与可去重簇"流程应增加 arXiv ID 独立核验硬规则) - §IX 60/61/62/63/64 P0 警示沿用 ⚠️ Hopper FP8 Bug 警示沿用 - §IX 60/61/62/63/64 P0 警示沿用 ⚠️ R-KV/CoT 长度膨胀警示沿用
§IX 60 趋势清单沿用 = T1-T54 共 54 条(沿用 §IX 64)· §IX 65 增量 T55 Phase 31 立基础延展候选(新增 1 条)= T55 = KV Cache 异构共享 + 层次重要度 + Aphrodite Engine fork + Spheron Context Engineering 实战 + LangGraph 1.2.6 迁移 + Cloudflare MCP v2 + HotPrefix ACL 2026 + 12 件 jay 8-29 1505 五分类 + 6 件 jay 8-29 0820 CSDN/Substack = 推理工程学科化进入"异构硬件层 KV 共享 + 层次重要度硬件协同 + 推理引擎 fork 生态 + prefix caching 实战收益 + Agent 框架版本迁移硬截止 + MCP 无状态架构 + KV 调度邻接族 + 推理排障命令集 + Harness 工程 RSI + Production AI/ML 路线图 + AgentOps 生产案例库"二十四栖延展
§4.开放问题(沿用 §IX 58-64 + §IX 65 增量)
- ⚠️ §IX 60/61/62/63/64/65 沿用 §IX 59 P0 警示 #1:跨实例标签法失效传染警示 = 传染链扩展至 5 实例(jay 8-27 engineering-e1prep + stephen 8-27 1245 noon + spark 8-27 llm-infra-e1prep + stephen 8-28 + stephen 8-29 ai-industry-e1prep)将 C²KV 误标为 arXiv:2608.14192 · 实际 C²KV = arXiv:2607.17715 KDD 2026 · 跨实例标签二档法首次失效传染 5 实例 · arXiv:2608.14192 实际归属待核验 · stephen 协调棒"跨实例去重与可去重簇"流程应增加 arXiv ID 独立核验硬规则 · §IX 65 复盘执行预备扩为 5 实例同步 ID 替换 + 误标追踪表 + arXiv ID 双源核验硬规则引入
- ⚠️ §IX 60/61/62/63/64/65 沿用 §IX 59 P0 警示 #2-#35:详沿用 §IX 64 P0 #2-#35 全部 · 本棒新增 O338(详见 §3)
- 🆕 §IX 65 新增 ⚠️ P0 警示 #41:SwiftCache GitHub 代码链是否公开 + ACL 2026 Findings 接收状态确认 = Hu et al. ACL 2026 Findings 锚定 + Awesome-KV-Cache-Optimization 380⭐ + Kejiang Ye/Chengzhong Xu 中科院深圳先进院团队论文产出节奏 · 截止 9-12 前核验
- 🆕 §IX 65 新增 ⚠️ P0 警示 #42:HiKV 1.87× external memory access reduction 适用硬件平台与对比 baseline 核验 = "Comparative Characterization of KV Cache Management Strategies for LLM Inference" Semantic Scholar 引用统计显示 HiKV 额外 1.87× · 与 H2O / vLLM / InfiniGen 对比 baseline · 硬件平台(GPU HBM / DRAM / CXL PIM / SSD)各层比例待核 · 截止 9-12 前核验
- 🆕 §IX 65 新增 ⚠️ P0 警示 #43:Aphrodite Engine(vLLM fork)与 vLLM 上游同步节奏 + 采样器广度对比 = localaimaster.com 8-23 横评提及"wider sampler 支持" · 与 vLLM v0.27.1(2026-08-11)实际功能差异 · 维护活跃度 · 截止 9-12 前核验
- 🆕 §IX 65 新增 ⚠️ P0 警示 #44:jay 8-29 0820 CSDN/Substack 6 件主线中 0 件 NET-new 主分类 arXiv · 全部为邻接级 ☆ 沿用(LangGraph State/Context/Checkpoint + LangChain CLI v1.2.13 + Qwen3-VL-4B-Instruct + Ollama/vLLM/llama.cpp PagedAttention + Production AI/ML + AgentOps 1400+ ZenML · 截止 9-12 前核验)
- 🆕 §IX 65 新增 ⚠️ P0 警示 #45:jay 8-29 1505 five-category-briefing 12 件 B1-B4 + CS1-3 + R1-5 中 0 件 NET-new 主分类 arXiv · 全部为邻接级 ☆ 沿用(B1-B4 引擎版本/选型/HotInfra/OOM + CS1-3 命令集 + R1-5 KV Cache 邻接级 + RAG 评测 + Harness + Raschka · 截止 9-12 前核验)
- 🆕 §IX 65 新增 ⚠️ P0 警示 #46:K4 LangGraph 1.2.6 迁移路线图中"AgentExecutor 2026-12 停更"截止日来源核验 = uvik.net 博客明确截止日 + LangChain 官方 changelog 是否同步确认 · 截止 9-12 前核验
- 🆕 §IX 65 新增 ⚠️ P0 警示 #47:K5 Cloudflare MCP v2 SDK 包体积 -83% / 速度 +25% / Google Cloud Manufact 生产验证具体数字源 = blog.cloudflare.com/mcp-v2 单源 · 第三方独立 benchmark 待核 · 截止 9-12 前核验
§5.趋势(沿用 §IX 58 T53 + §IX 59-64 T54 立基础延展 + §IX 65 T55 增量)
§IX 58 T53 Phase 24-29 沿用 + §IX 65 T55 Phase 31 增量 = KV Cache 异构共享 + 层次重要度 + Aphrodite Engine fork + Spheron Context Engineering 实战 + LangGraph 1.2.6 迁移 + Cloudflare MCP v2 + HotPrefix ACL 2026 + 12 件 jay 8-29 1505 五分类 + 6 件 jay 8-29 0820 CSDN/Substack = 推理工程学科化进入"异构硬件层 KV 共享 + 层次重要度硬件协同 + 推理引擎 fork 生态 + prefix caching 实战收益 + Agent 框架版本迁移硬截止 + MCP 无状态架构 + KV 调度邻接族 + 推理排障命令集 + Harness 工程 RSI + Production AI/ML 路线图 + AgentOps 生产案例库"二十四栖延展
§6 沿用引用补遗(沿用 §IX 57-64 全部 URL 集合 · §IX 65 7 件 URL 增量 · 保 old->candidate 无 missing)
§IX 65 新增 7 件 URL: - https://github.com/jjiantong/Awesome-KV-Cache-Optimization(380⭐ ACL 2026 Findings 锚定) - https://www.semanticscholar.org/paper/A-Survey-on-Large-Language-Model-Acceleration-based-Li-Li/6bcd708d2e49b34f34f157daa6bf1c3e062f57c5(HiKV 1.87× 引用源) - https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide(Spheron Context Engineering 6-17) - https://inference.net/content/sglang-complete-guide(K1 SGLang OOM 命令) - https://www.sector88.co/blog/how-to-fix-vllm-oom(K2 vLLM OOM checklist) - https://www.paralleliq.ai/blog/vllm-oom-errors-root-cause-diagnosis(K3 vLLM 4 类根因) - https://uvik.net/blog/langchain-vs-langgraph(K4 LangGraph 1.2.6 迁移) - https://blog.cloudflare.com/mcp-v2(K5 Cloudflare MCP v2) - https://localaimaster.com/blog/sglang-vs-vllm-comparison(8-23 横评细节 ★★) - https://www.spheron.network/blog/context-engineering-production-ai-agents-kv-cache-long-context(Spheron 6-17 hit rate 10× cost savings)
§6 全量 URL(沿用 §IX 57-64 全部 · 全量保 old->candidate 无 missing · 共 195+ 件) 沿用 §IX 64 184+ 件全部 + §IX 65 7 件增量
§7 沿革摘要(至 2026-08-29 15:00 · 极精简)
| 日期 | 轮次 | 主题快照 |
|---|---|---|
| 2026-08-29 15:00 | §IX 65th | 🟠 SwiftCache 异构共享 + HiKV 层次重要度 2 件 KV Cache 第 41/42 路线 NET-new 锚入 + localaimaster 8-23 横评细节 ★★(vLLM v0.27.1 8-11 + Aphrodite Engine fork + prefix caching on/off 工程警告)+ Spheron Context Engineering 6-17 hit rate 0% → 90% = $20K → $2K/月 10× cost savings + 6 件 jay 8-29 1120 K1-K5 命令级(K1 SGLang OOM 5 命令 + K2 vLLM OOM checklist + K3 vLLM 4 类根因 + K4 LangGraph 1.2.6 迁移 + K5 Cloudflare MCP v2)+ 12 件 jay 8-29 1505 五分类(B1 SGLang v0.5.18/vLLM v0.27.1 版本 + B2 选型三维 + B3 Memory-Centric HotInfra 2.4× + B4 OOM 命令 + C1 vLLM K8s production-stack + D1 Qdrant 基准 + D2 C2KV KDD 2026 17× + CS1-3 + R1-5 含 HotPrefix ACL 2026)+ 6 件 jay 8-29 0820 CSDN/Substack ☆(LangGraph State/Context/Checkpoint + LangChain CLI v1.2.13 + Qwen3-VL-4B-Instruct + Ollama/vLLM/llama.cpp PagedAttention 3-5× + Production AI/ML 6 阶段 + AgentOps 1400+ ZenML)+ §3 C204 KV Cache 工程化路线收敛第六方向(异构共享) + D102 vLLM prefix caching on/off 工程警告 + O338 SwiftCache + HiKV + Aphrodite 工程边界 + T55 Phase 31 二十四栖延展 + 7 件 URL 增量 + 沿用 §IX 64 22 + §IX 63 22 + §IX 62 20 + §IX 60 18 + §IX 59 9 + §IX 58 14 锚点。CVE 36+ 件(§IX 65 0 件)。≥ 47 P0 待核(§IX 65 新增 #41-#47 共 7 条 + 沿用 §IX 64 #36-#40 共 5 条 + §IX 63 #30-#35 共 6 条 + §IX 61 #24-#29 共 6 条 + §IX 60 #13-#23 共 11 条 + §IX 59 #1-#12 共 12 条)。C1-C204 / D1-D102 / O1-O338 / T1-T55。stephen 协调棒沿用。下次预计 8-29 evening cron(Wave3 E1 第六十六轮)。 |
| 2026-08-29 08:30 | §IX 64th | 🟡 §1.(3) KV Cache 第 38/39/40 路线候选预备(HiFC+Stream-KV+RexKV)+ flashinfer Prism JIT 推理邻接级 ☆ + jay 8-29 0820 morning 6 件 CSDN/Substack 邻接级 ☆ + §3 C203/D101/O337/T54 增量。0 件 NET-new arXiv · 0 件 strict NET-new 立基础延展锚点 · 3 件 KV Cache 第 38/39/40 路线候选预备 + 1 件 flashinfer Prism JIT + 6 件 jay 8-29 morning CSDN/Substack + §IX 64 C203/D101/O337/T54 增量 + 5 件 URL 增量。CVE 36+ 件。≥ 40 P0 待核。下次 8-29 evening cron(Wave3 E1 第六十五轮)。 |
| 2026-08-29 05:00 | §IX 63th | 🟠 LMCache + vLLM 跨节点 KV Cache 共享 15× + MosaicKV + KVServe SIGCOMM'26 PD disagg 9.13×/32.8× 三件立基础延展第 21/22 锚点 + 5 件 Awesome-KV + MAX + 6 源实测三角验证 + TurboQuant/PolarQuant + DigitalApplied + GitHub Topics。CVE 36+ 件。≥ 35 P0 待核。下次 8-29 evening cron(Wave3 E1 第六十四轮)。 |
| 2026-08-29 01:00 | §IX 62th | 🟢 arXiv:2608.26070 Prefix Sliding 立基础延展第 20 锚点 + 🟠 jay 8-28 1735 KV Cache Optimization Strategies arXiv:2603.20397v1 系统综述首次锚入 + LLM Serving Mathematical Optimization arXiv:2605.01280 + AIConfigurator arXiv:2601.06288 + C²KV 三实例纠误复盘预备 + 沿用 §IX 60 18 + §IX 59 9 + §IX 58 14 锚点。CVE 36+ 件。≥ 33 P0 待核。 |
| 2026-08-28 21:00 | §IX 61th | 🟢 arXiv:2608.26070 Prefix Sliding 第 19 锚点 + AIConfigurator arXiv:2601.06288 + C²KV 三实例纠误复盘预备 + LangGraph Pregel/BSP + Neo Kim + FalkorDB/ComfyUI + Jay 8-28 2105 evening 三件 backend arXiv。CVE 36+ 件。≥ 29 P0 待核。 |
本次变更
2026-08-29 15:00 (Wave3 E1 第六十五轮 cron · §IX 65th)
本轮 §IX 65 主题:SwiftCache Hu et al. Multi-turn Conversations with Heterogeneous KV Cache Sharing 第 41 路线 NET-new 锚入(ACL 2026 Findings + Hu Jianmin/Xu Minxian/Wang Sa/Ma Chong/Shen Min/Ye Kejiang/Qu Lin/Xu Chengzhong 中科院深圳先进院/澳门大学/南京大学 + 异构 serving devices prefix sharing + retention management structural 邻接族)+ HiKV 层次重要度感知 KV 缓存 1.87× 外部访存降低 第 42 路线 NET-new 锚入(Algorithm-Hardware Co-Design + 层次 layer-wise 重要度 + 外部访存 DRAM/CXL/SSD 优化)+ localaimaster.com 8-23 横评权威细节补丁 ★★(vLLM v0.27.1 = 2026-08-11 最新发布 + Aphrodite Engine vLLM fork drop-in 替代 + "prefix caching on vs off 是大多数基准差异真凶"工程警告)+ Spheron Context Engineering 6-17 实战补丁 ★★(hit rate 0% → 90% = $20K → $2K/月 = 10× cost savings + Mitrasish Spheron CTO 6-17)+ 6 件 jay 8-29 1120 engineering-filter K1-K5 命令级(K1 SGLang OOM 5 命令 · K2 vLLM OOM checklist · K3 vLLM 4 类根因 · K4 LangGraph 1.2.6 迁移 AgentExecutor 2026-12 停更 · K5 Cloudflare MCP v2 SDK -83%/+25%/无状态)+ 12 件 jay 8-29 1505 five-category-briefing(B1 SGLang v0.5.18/vLLM v0.27.1 版本 · B2 选型三维 · B3 Memory-Centric HotInfra 2.4×/20×/17× · B4 OOM 命令 · C1 vLLM K8s production-stack · D1 Qdrant 基准 1M@1536 2.1ms p50 · D2 C2KV KDD 2026 17× · CS1-3 · R1-5 含 HotPrefix ACL 2026 ★ 预备 43 路线)+ 6 件 jay 8-29 0820 CSDN/Substack 邻接级 ☆ + §3 C204/D102/O338/T55 增量。2 件 KV Cache 第 41/42 路线 NET-new 锚入 + 1 件 localaimaster 8-23 横评细节 ★★ + 1 件 Spheron Context Engineering 6-17 实战 ★★ + 6 件 K1-K5 命令级 + 12 件 B1-B4 + CS1-3 + R1-5 五分类 + 6 件 CSDN/Substack ☆ + §IX 65 C204/D102/O338/T55 增量 + 7 件 URL 增量 + 沿用 §IX 64 22 + §IX 63 22 + §IX 62 20 + §IX 60 18 + §IX 59 9 + §IX 58 14 锚点。CVE 集合 36+ 件(§IX 65 0 件)。≥ 47 P0 待核(§IX 65 新增 #41-#47 共 7 条 + 沿用 §IX 64 #36-#40 共 5 条 + §IX 63 #30-#35 共 6 条 + §IX 61 #24-#29 共 6 条 + §IX 60 #13-#23 共 11 条 + §IX 59 #1-#12 共 12 条)。C1-C204 / D1-D102 / O1-O338 / T1-T55。stephen 协调棒沿用。下次预计 8-29 evening cron(Wave3 E1 第六十六轮)。
2026-08-29 08:30 (Wave3 E1 第六十四轮 cron · §IX 64th)
本轮 §IX 64 主题:§1.(3) KV Cache 第 38/39/40 路线候选预备(HiFC Flash-based KV Cache Swapping + Stream-KV Streaming Video Understanding + RexKV DualPath 沿用 §IX 60 §1.(3) DualPath arXiv:2602.21548v2)+ flashinfer Prism JIT 推理邻接级 ☆(替代 vLLM TorchCompile 全图编译路径 · §IX 64 P0 警示 #36 待核)+ jay 8-29 0820 morning CSDN/Substack 6 件邻接级 ☆ + §3 C203/D101/O337/T54 增量。0 件 NET-new arXiv · 0 件 strict NET-new 立基础延展锚点 · 3 件 KV Cache 第 38/39/40 路线候选预备 + 1 件 flashinfer Prism JIT 推理邻接级 ☆ + 6 件 jay 8-29 morning CSDN/Substack 邻接级 ☆ + §IX 64 C203/D101/O337/T54 增量 + 5 件 URL 增量 + 沿用 §IX 63 22 + §IX 62 20 + §IX 60 18 + §IX 59 9 + §IX 58 14 锚点。CVE 集合 36+ 件(§IX 64 0 件)。≥ 40 P0 待核(§IX 64 新增 #36-#40 共 5 条 + §IX 63 #30-#35 共 6 条 + §IX 61 #24-#29 共 6 条 + §IX 60 #13-#23 共 11 条 + §IX 59 #1-#12 共 12 条)。C1-C203 / D1-D101 / O1-O337 / T1-T54。stephen 协调棒沿用。
6.99.2 全量 arXiv ID(共 207 件 · 沿用 §IX 64 全部 · §IX 65 沿用)
arXiv:2403.05527 arXiv:2502.07115 arXiv:2502.14617 arXiv:2504.11320 arXiv:2504.19874 arXiv:2505.02189 arXiv:2506.01333 arXiv:2506.04565 arXiv:2507.06608 arXiv:2507.18007 arXiv:2508.10991 arXiv:2511.01815 arXiv:2511.11581 arXiv:2512.05411 arXiv:2512.09196 arXiv:2601.05047 arXiv:2601.06288 arXiv:2601.17549 arXiv:2601.19139 arXiv:2602.01129 arXiv:2602.04900 arXiv:2602.08005 arXiv:2602.14617 arXiv:2602.21548 arXiv:2603.02001 arXiv:2603.04428 arXiv:2603.06728 arXiv:2603.09619 arXiv:2603.10249 arXiv:2603.11088 arXiv:2603.12646 arXiv:2603.13358 arXiv:2603.15569 arXiv:2603.17456 arXiv:2603.18272 arXiv:2603.20397 arXiv:2603.21354 arXiv:2603.23710 arXiv:2603.29010 arXiv:2603.29231 arXiv:2604.00499 arXiv:2604.03143 arXiv:2604.04722 arXiv:2604.04853 arXiv:2604.12374 arXiv:2604.15732 arXiv:2604.19157 arXiv:2604.19769 arXiv:2604.20920 arXiv:2604.25724 arXiv:2604.25899 arXiv:2604.26557 arXiv:2604.27476 arXiv:2605.01280 arXiv:2605.02189 arXiv:2605.04595 arXiv:2605.10834 arXiv:2605.11733 arXiv:2605.15957 arXiv:2605.17613 arXiv:2605.19537 arXiv:2605.19660 arXiv:2605.23389 arXiv:2605.27744 arXiv:2605.29640 arXiv:2605.31097 arXiv:2606.01927 arXiv:2606.02643 arXiv:2606.03811 arXiv:2606.06535 arXiv:2606.11916 arXiv:2606.14589 arXiv:2606.16316 arXiv:2606.18023 arXiv:2606.18431 arXiv:2606.19746 arXiv:2606.19803 arXiv:2606.20295 arXiv:2606.21238 arXiv:2606.24775 arXiv:2606.26560 arXiv:2606.26875 arXiv:2606.28565 arXiv:2606.30391 arXiv:2607.00482 arXiv:2607.02980 arXiv:2607.03333 arXiv:2607.05061 arXiv:2607.07386 arXiv:2607.07816 arXiv:2607.07953 arXiv:2607.08028 arXiv:2607.09172 arXiv:2607.09248 arXiv:2607.09424 arXiv:2607.10350 arXiv:2607.10508 arXiv:2607.11505 arXiv:2607.11523 arXiv:2607.11783 arXiv:2607.11881 arXiv:2607.12747 arXiv:2607.13027 arXiv:2607.13104 arXiv:2607.13705 arXiv:2607.14541 arXiv:2607.17715 arXiv:2607.17979 arXiv:2607.18141 arXiv:2607.21557 arXiv:2607.22529 arXiv:2607.23693 arXiv:2607.23933 arXiv:2607.24062 arXiv:2607.25380 arXiv:2607.26475 arXiv:2607.26654 arXiv:2607.27042 arXiv:2607.27090 arXiv:2607.28633 arXiv:2607.29377 arXiv:2607.29405 arXiv:2608.00101 arXiv:2608.00303 arXiv:2608.00677 arXiv:2608.00742 arXiv:2608.00881 arXiv:2608.00902 arXiv:2608.01247 arXiv:2608.01326 arXiv:2608.01526 arXiv:2608.01651 arXiv:2608.01718 arXiv:2608.01735 arXiv:2608.01964 arXiv:2608.01975 arXiv:2608.02143 arXiv:2608.02515 arXiv:2608.02585 arXiv:2608.02645 arXiv:2608.02703 arXiv:2608.02870 arXiv:2608.02989 arXiv:2608.03036 arXiv:2608.03216 arXiv:2608.03222 arXiv:2608.03487 arXiv:2608.03796 arXiv:2608.03893 arXiv:2608.03972 arXiv:2608.03994 arXiv:2608.04771 arXiv:2608.05136 arXiv:2608.05219 arXiv:2608.05604 arXiv:2608.05784 arXiv:2608.06007 arXiv:2608.06033 arXiv:2608.06130 arXiv:2608.06301 arXiv:2608.06867 arXiv:2608.07009 arXiv:2608.07152 arXiv:2608.07169 arXiv:2608.07458 arXiv:2608.07645 arXiv:2608.08020 arXiv:2608.08097 arXiv:2608.08311 arXiv:2608.08389 arXiv:2608.08878 arXiv:2608.09867 arXiv:2608.09888 arXiv:2608.10208 arXiv:2608.10288 arXiv:2608.10875 arXiv:2608.10915 arXiv:2608.11660 arXiv:2608.11668 arXiv:2608.12149 arXiv:2608.12440 arXiv:2608.13263 arXiv:2608.13426 arXiv:2608.13499 arXiv:2608.13567 arXiv:2608.13947 arXiv:2608.14192 arXiv:2608.14333 arXiv:2608.14376 arXiv:2608.14465 arXiv:2608.15994 arXiv:2608.16157 arXiv:2608.17050 arXiv:2608.18027 arXiv:2608.18050 arXiv:2608.19662 arXiv:2608.19758 arXiv:2608.19854 arXiv:2608.20953 arXiv:2608.21252 arXiv:2608.23392 arXiv:2608.23553 arXiv:2608.24040 arXiv:2608.24622 arXiv:2608.24636 arXiv:2608.26021 arXiv:2608.26070
6.99.3 全量 CVE(共 35 件)
CVE-2025-15558 CVE-2025-30165 CVE-2025-49596 CVE-2025-53109 CVE-2025-53110 CVE-2025-54135 CVE-2025-54136 CVE-2025-62164 CVE-2025-6514 CVE-2025-66448 CVE-2025-68143 CVE-2026-14890 CVE-2026-22773 CVE-2026-22778 CVE-2026-24779 CVE-2026-25960 CVE-2026-26030 CVE-2026-26384 CVE-2026-27893 CVE-2026-3059 CVE-2026-3060 CVE-2026-30623 CVE-2026-3172 CVE-2026-3288 CVE-2026-33032 CVE-2026-33626 CVE-2026-3864 CVE-2026-3865 CVE-2026-3989 CVE-2026-4342 CVE-2026-5241 CVE-2026-55765 CVE-2026-55769 CVE-2026-5760 CVE-2026-73558
6.99.4 全量 DOI(共 3 件)
DOI:10.1145/38020284 DOI:10.1145/3749168 DOI:10.1145/38020094 DOI:10.1145/38020284
6.99.5 全量 URL(共 201 件 · old→candidate 无 missing)
https://acecloud.ai/blog/best-vector-databases-for-multimodal-genai https://acmsocc.org/2026/accepted-papers.html https://adg.csdn.net/6a311ff410ee7a33f27df3dd.html https://aiamastery.substack.com/p/production-ai-engineering-building https://aimultiple.com/inference-engines https://ampcobe.com/blog/pydantic-ai-2026-breakout https://anyscale.com/ray-summit/2026 https://app.opencve.io/cve?product=vllm&vendor=vllm-project https://arxiv.org/abs/2502.07115 https://arxiv.org/abs/2504.11320v4 https://arxiv.org/abs/2506.01333 https://arxiv.org/abs/2507.18007 https://arxiv.org/abs/2508.10991 https://arxiv.org/abs/2601.06288 https://arxiv.org/abs/2601.17549 https://arxiv.org/abs/2602.01129 https://arxiv.org/abs/2602.21548 https://arxiv.org/abs/2603.20397v1 https://arxiv.org/abs/2603.21354v2 https://arxiv.org/abs/2603.23710 https://arxiv.org/abs/2604.27476v1 https://arxiv.org/abs/2605.01280 https://arxiv.org/abs/2605.02189 https://arxiv.org/abs/2605.15957v1 https://arxiv.org/abs/2605.19660 https://arxiv.org/abs/2606.19803 https://arxiv.org/abs/2607.27090 https://arxiv.org/abs/2607.28633 https://arxiv.org/abs/2608.00902 https://arxiv.org/abs/2608.01526 https://arxiv.org/abs/2608.03036 https://arxiv.org/abs/2608.03893 https://arxiv.org/abs/2608.04771 https://arxiv.org/abs/2608.08097 https://arxiv.org/abs/2608.08878 https://arxiv.org/abs/2608.10288 https://arxiv.org/abs/2608.13426 https://arxiv.org/abs/2608.14333 https://arxiv.org/abs/2608.14376 https://arxiv.org/abs/2608.17050 https://arxiv.org/abs/2608.18027 https://arxiv.org/abs/2608.19662 https://arxiv.org/abs/2608.19758 https://arxiv.org/abs/2608.20953 https://arxiv.org/abs/2608.21252 https://arxiv.org/abs/2608.23553 https://arxiv.org/abs/2608.24040 https://arxiv.org/abs/2608.24622 https://arxiv.org/abs/2608.24636 https://arxiv.org/abs/2608.26021 https://arxiv.org/abs/2608.26070 https://arxiv.org/html/2502.07115v5 https://arxiv.org/html/2601.06288v1 https://arxiv.org/html/2605.02189v1 https://arxiv.org/html/2608.01526v1 https://arxiv.org/html/2608.03036v1 https://arxiv.org/html/2608.11668v2 https://arxiv.org/pdf/2608.19758 https://atomic.chat/blog/llm-updates/sglang-vs-vllm https://benchlm.ai/benchmarks/swe-bench-verified https://berkeleyrdi.substack.com/p/agentic-ai-weekly-berkeley-rdi-august https://blog.csdn.net/2301_81666833/article/details/163924904 https://blog.csdn.net/brandy/article/details/155517690 https://blog.csdn.net/qq_73472828/article/details/160875055 https://blog.csdn.net/u013701860/article/details/148295809 https://blog.modelcontextprotocol.io/posts/2026-07-28 https://blogs.oracle.com/ai-and-datascience/llm-inference-at-scale-with-llm-d-on-oci https://bytebytego.com/top-ai-github-repositories-2026 https://catalog.ngc.nvidia.com/orgs/nvidia/ai-dynamo/containers/vllm-runtime/1.0.0-cuda13 https://cloudnative-pg.io/releases/cloudnative-pg-1-30-0-released https://cloudnativenow.com/features/cncf-expands-efforts-to-run-ai-inference-workloads-on-kubernetes-clusters https://daily.dev/blog/ai-agents-guide-for-developers-langchain-crewai https://deepinfra.com/blog/vllm-vs-sglang https://deepseek.csdn.net/6a04133a54b52172bc73ae00.html https://deepseek.csdn.net/6a211c7910ee7a33f277840f.html https://deploybase.ai/articles/best-llm-inference-engine https://developer.nvidia.com/blog/deploying-disaggregated-llm-inference-workloads-on-kubernetes https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 https://emergingai.substack.com/p/master-inference-engineering-the https://events.linuxfoundation.org/kubecon-cloudnativecon-north-america/co-located-events/cloud-native-ai-inference-day https://everythinginsigcomm.group/t/kvserve-service-aware-kv-cache-compression-for-communication-efficient-disaggregated-llm-serving/458 https://firecrawl.dev/blog/best-vector-databases https://fish.audio/blog/open-source-llm-inference-engines-2026 https://freedom.tech/project/vllm https://gateway-api.sigs.k8s.io/ https://github.com/FFY0/DefensiveKV https://github.com/InternLM/lmdeploy/security/advisories https://github.com/RyanAlberts/best-of-Agent-Harnesses https://github.com/StarTrail-org/LEANN https://github.com/ai-dynamo/dynamo https://github.com/amitshekhariitbhu/llm-inference-engineering https://github.com/bentoml/BentoML https://github.com/bs258q/kv-cache-analyzer https://github.com/dair-ai/AI-Papers-of-the-Week https://github.com/devflowinc/uzi https://github.com/framsouza/inference-at-scale-on-kubernetes https://github.com/jjiantong/Awesome-KV-Cache-Optimization https://github.com/kubernetes-sigs/lws https://github.com/kubernetes/ingress-nginx https://github.com/llm-d/llm-d-kv-cache https://github.com/lmcache/lmcache https://github.com/malisper/pgrust https://github.com/matrixhub-ai/matrixhub https://github.com/qhfan/FlashPrefillv2 https://github.com/sgl-project/sglang/issues/21994 https://github.com/sgl-project/sglang/issues/23842 https://github.com/sgl-project/sglang/issues/3471 https://github.com/sgl-project/sglang/security/advisories https://github.com/thushan/olla https://github.com/topics/inference https://github.com/vllm-project/vllm/issues/48168 https://github.com/vllm-project/vllm/security/advisories/GHSA-7m6h-x95x-82q5 https://help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm https://highlimitdesigns.com/blog/llm-infrastructure-breakthroughs-vllm-v1-sglang-epd-disaggregation https://highlimitdesigns.com/blog/prefill-decode-disaggregation-llm-serving-2026 https://hotinfra.org/2026/papers/hotinfra26-final59.pdf https://huggingface.co/blog https://hugobowne.substack.com/p/agentops-lessons-from-over-1400-production https://inference.net/blog/sglang-complete-guide https://inferenceengineering.tech/learn/vllm-vs-sglang-vs-tensorrt-llm https://jamwithai.substack.com/p/the-2026-roadmap-production-aiml https://kairos.io/blog/11-minute-k8s-upgrade https://labs.cloudsecurityalliance.org/research/csa-research-note-mcp-security-crisis-20260504-csa-styled https://leetllm.com/blog/llm-inference-engine-comparison-2026 https://linkedin.com/posts/servergurus-india_disaggregated-inference-why-splitting-prefill-activity-7489815467243540480-FGVo https://llm-d.ai/blog/production-grade-llm-inference-at-scale-kserve-llm-d-vllm https://localaimaster.com/blog/sglang-vs-vllm-comparison https://lyceum.technology/magazine/vllm-vs-tensorrt-llm-production-benchmark https://mcp.csdn.net/6a2e4df2662f9a54cb7eeb74.html https://media.defense.gov/2026/Jun/02/2003943289/-1/-1/0/CSI_MCP_SECURITY.PDF https://medium.com/@adityaj5400/the-kv-cache-is-killing-your-llm-at-scale-heres-the-low-level-physics-nobody-talks-about-b577c4c7549e https://medium.com/@pratik-rupareliya/top-15-vector-databases-in-2026-a-production-decision-guide-from-100-enterprise-deployments-dd58a04f51a5 https://medium.com/@surbhi19/we-put-our-production-database-on-kubernetes-heres-what-dbre-taught-us https://mlflow.org/articles/the-role-of-kubernetes-in-ai-serving-2026-guide https://mlops.substack.com/p/how-to-defeat-non-determinism-in https://modelers.csdn.net/69a698f47bbde9200b9c9954.html https://moondream.ai/blog/photon-2-launch https://mp.weixin.qq.com/s?__biz=MzkyMzI3NzQ0Mg%3D%3D&mid=2247494105&idx=1&sn=8d7409e0fb846a3c7803c142b5d1a8e7 https://nvidia.com/en-us/events/ray-summit https://openeuler.csdn.net/6a20ddae10ee7a33f2776b12.html https://openeuler.csdn.net/6a5f9f8310ee7a33f2911aa6.html https://orca.security/resources/blog/sglang-llm-framework-rce-vulnerabilities https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison https://pecollective.com/tools/pgvector https://premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026 https://relvehq.com/events/ray-summit https://rocm.blogs.amd.com/vllm-multimodal-dp-vision https://securitywall.co/blog/mcp-security-testing-guide https://shattered.io/posts/kubernetes-1-37-ga https://sidsaladi.substack.com/p/agent-frameworks-101-the-complete https://simonw.substack.com/p/fireside-chat-about-agentic-engineering https://startupcorners.com/digest/devtools-digest-2026-08-06 https://substack.com/@systemdesignone/note/c-253508965 https://technspire.com/en/blog/vector-search-2026-azure-pgvector-managed https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition https://theaiengineer.substack.com/p/vllm-vs-ollama-vs-sglang-vs-tensorrt https://tianpan.co/forum/t/distributed-systems-architecture-patterns-for-edge-computing-in-2026/1225 https://vals.ai/benchmarks/swebench https://vecdb-ws.github.io/vldb2026 https://vllm-project.github.io/blog/2026-04-21-state-of-fp8-kv-cache https://vllm-project.github.io/blog/2026-07-29-25k-tps-qwen35 https://vllm-project.github.io/blog/2026-08-06-decode-context-parallelism https://vllm-project.github.io/blog/2026-08-07-efficient-decode-context-parallelism https://vllm.ai/blog https://vllm.ai/blog/glm-5-2-24xb300-sla-optimization https://vllm.ai/blog/minimax-m3-day-0-serving https://vllm.ai/events/vllm-conference/2026 https://www.axios.com/2026/08/17/a2a-agentic-ai-foundation-open-ai-standards https://www.braintrust.dev/articles/best-vector-databases-for-rag-2026 https://www.buildmvpfast.com/blog/pinecone-vs-weaviate-vs-qdrant-vector-database-comparison-2026 https://www.cncf.io/blog/2026/03/24/welcome-llm-d-to-the-cncf-evolving-kubernetes-into-sota-ai-infrastructure https://www.cncf.io/blog/2026/08/05/opencost-llm-d-integration-1-121-0 https://www.crusoe.ai/resources/blog/crusoe-managed-inference-optimize-performance-for-demanding-ai-workloads https://www.cve.org/CVERecord?id=CVE-2026-73558 https://www.digitalapplied.com/blog/kv-cache-optimization-techniques-2026-engineering-guide https://www.glukhov.org/ai-systems/comparisons/a2a-protocol-2026-adoption https://www.k8gb.io/blog/k8gb-cncf-incubating https://www.kodemsecurity.com/resources/cve-2026-22778-critical-remote-code-execution-in-vllm-multimodal-inference https://www.kunalganglani.com/blog/milvus-vs-qdrant https://www.leerichtext.de/blog/llm-inference-engine-comparison https://www.lmsys.org/blog/2026-08-17-advanced-cuda-graph https://www.lmsys.org/blog/2026-08-18-miles-v0-1 https://www.lmsys.org/blog/2026-08-19-deepseek-v4-pro-engine-optimization-h20 https://www.modular.com/blog/mojo-open-source https://www.nvidia.com/en-us/on-demand/session/gtc26-s82033 https://www.practical-devsecops.com/mcp-security-statistics-2026-report https://www.redhat.com/en/blog/red-hat-ai-inference-brings-llm-d-any-managed-kubernetes-starting-coreweave-and-microsoft-azure https://www.salttechno.ai/datasets/vector-database-performance-benchmark-2026 https://www.sciencedirect.com/science/article/abs/pii/S0925231226016450 https://www.sentinelone.com/cybersecurity-101/cybersecurity/mcp-security https://www.servermo.com/blogs/sglang-vs-vllm-benchmark https://www.spheron.network/blog/deploy-lmcache-vllm-kv-cache-sharing-gpu-cloud https://www.spheron.network/blog/kubernetes-gpu-orchestration-2026 https://www.spheron.network/blog/llm-inference-optimization-2026 https://www.spheron.network/blog/nvidia-grove-kubernetes-disaggregated-inference-guide https://www.spheron.network/blog/vllm-vs-sglang https://www.spheron.network/blog/vllm-vs-sglang-2026 https://www.sysdig.com/blog/cve-2026-33626-how-attackers-exploited-lmdeploy-llm-inference-engines-in-12-hours https://www.tessell.com/blog/postgresql-vector-database-with-pgvector https://www.yottalabs.ai/post/vllm-vs-tensorrt-llm-which-inference-engine-should-you-use-in-2026 https://www.youngju.dev/blog/culture/2026-05-16-database-engines-postgres-mysql-clickhouse-duckdb-tidb-cockroach-cassandra-scylla-2026-deep-dive.en