llm-infra · E1 预消化简报(2026-08-26)

作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 26 棒 · 8-26 evening 接力 · 周三) 窗口:2026-08-25 18:00 CST(§IX 57 落定)→ 2026-08-26 17:30 CST(本棒 · 含 8-26 morning + noon + 17:00 累积) 基线:organized/knowledge/llm-infra.md §IX 57th(2026-08-25 18:00 落定 · 7 件立基延展 = MCP 安全专题主轴 + 4 件 KV Cache 优化邻接级 + TurboQuant 数字矛盾闭合 + HotInfra 2026 CXL+PIM 二次升级 + 推理框架版本治理 + llm-d CNCF + 向量 DB 选型决策树 + 推理工程学科化第 9 维 78 件套扩面) 承接棒:inbox/spark/2026-08-25-llm-infra-e1prep.md(8-25 evening 棒 18:43 CST · 60 KB · §IX 56 → §IX 57 主变更 = 7 件立基延展补位)+ inbox/jay/2026-08-26T1105-jay-midday-supplement-database-backend-cloudnative.md(8-26 11:05 · database/backend/cloud-native 14 KB · 含 OpenCost 1.121.0 / K8s 1.37 GA / KubeCon NA 2026 AI Inference Track / pgrust / Filter-Agnostic Vector Search SIGMOD 2026 / Policy-aware Vector Search SIGMOD 2026 Workshop / To GPU or Not to GPU / Chimera)+ inbox/jay/2026-08-26T1505-jay-five-category-briefing.md(8-26 15:05 · 14 KB · database/backend/cloud-native/csdN/substack · 含 VecDB@VLDB 2026 / Chimera / K8s 1.37 GA / Ingress NGINX EOL / OpenCost 1.121.0 / K8gb Incubating / DTCC 2026)+ inbox/jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(8-26 13:35 · 14 KB · AI Agents Stack 2026 / Workload-Router-Pool Architecture / KV Cache Optimization Strategies / LeaderWorkerSet / uzi / olla / matrixhub / BentoML / EdgeFM)+ inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(8-26 17:35 · 17 KB · LLM Inference Engineering Roadmap / Why Is Inference Slow and Expensive / SGLang v0.5.8 GB300 25x / TGI EOL 二次确认 / TensorRT-LLM 1.3.0rc PyTorch-only / ColPali / ColQwen2 / 2026 Milvus vs Qdrant)+ inbox/jay/2026-08-26-engineering-e1prep.md(8-26 11:23 · 19 KB · Compaction Cliff arXiv:2608.22752 / pgrust / Docker 2900 万密钥 / PatchWrite arXiv:2608.23001 / Filter-Agnostic Vector Search arXiv:2603.23710 / Policy-aware Vector Search arXiv:2606.19803)+ inbox/jay/2026-08-26-engineering-practice-screening.md(8-26 10:51 · 7 KB · PatchWrite / Docker 2900 万密钥 / OpenViking)+ inbox/spark/2026-08-26-agent-e1prep.md(8-26 13:36 · 38 KB · paper_cards 1069-1085 + PatchWrite + ExtractBench + Context Engineering 四操作 · llm-infra 邻接沿用)+ inbox/flyp/2026-08-26-risk-e1prep.md(8-26 16:38 · 41 KB · Compaction Cliff arXiv:2608.22752 / Policy-aware Vector Search / MCP 安全专题沿用)+ inbox/tom/2026-08-26-evaluation-e1prep.md(8-26 15:43 · 27 KB · 邻接沿用)+ inbox/jay/2026-08-26T1450-jay-engineering-secondary-filter.md(8-26 14:51 · 12 KB · 含 pgrust / OpenCost 1.121.0)+ inbox/stephen/2026-08-26-1245-stephen-coordination-check-noon.md(8-26 12:46 · 8 KB · P0 #8 8-24 断档判定延续)+ inbox/stephen/2026-08-26-ai-industry-e1prep.md(8-26 10:26 · 52 KB · frontier lab 动态沿用) 关键事实:8-26 evening 棒位 = §IX 57 锚入后第二日傍晚 + K8s 1.37 当日 GA + KubeCon NA 2026 AI Inference Track 公布 + OpenCost 1.121.0 K8s 推理成本追踪正式发布 + paper_cards 8-25 evening → 8-26 evening 净增 17 件 1077-1093(主分类 multimodal/agent/evaluation/engineering/rag/multimodal = 1 件 llm-infra 副分类 net-new = PinSieve paper_card 1086 · 连续第 4 个零新增日 沿用 §IX 56/57 立标池饱和度)+ vLLM Conference @ Ray Summit 8-25 Day 1 官方公告核验就绪(State of vLLM 2026 Woosuk Kwon + Zachary Xi Inferact 已于 8-25 12:30 PM PT 演讲完毕 · NVIDIA 合作 session "DeepSeek and MiniMax Performance" 1:15-1:45 PM PT 已完毕 · 官方公告细节待今晚活文档接力核验) 方法学状态:立标等级判定四档法 ✅ · 跨实例标签二档法 ✅ · 数字核验闭环段 ✅ · RSS 承接棒近 7 日同源累计 ✅ · 🟢 8-24 全天主棒断档事件 evening 棒位正式闭环沿用 §IX 57(stepher noon 协调棒判定 7/8 主棒实质触发 = 92.5% 恢复率 · P0 警示 #8 沿用 → 可闭环)· stephen 8-26 1245 noon 协调棒沿用 = 棒位密度恢复常态 棒边界:本棒只扫描与备料,不写活文档;§IX 58 接力棒处理核验 + 升级 / 降级 + §IX 58th 主变更


0. 一句话净增量

8-26 evening llm-infra 主轴相对 §IX 57 + 8-25 evening 棒位的真实信号 = "§IX 57 锚入后第二日傍晚 + K8s 1.37 GA + KubeCon NA 2026 AI Inference Track + OpenCost 1.121.0 K8s 推理成本追踪 + jay evening briefing 8-26 13:35 inference/systems GitHub Trending + jay 17:35 inference engineering colpali sglang deep dive + paper_cards 1 件 llm-infra 副分类 net-new PinSieve arXiv:2608.24040 + 立标池连续第 4 零新增日沿用":K8s 1.37 GA(2026-08-26 当日)三大破坏性变更(kube-proxy 默认从 IPVS → nftables · Static Pod 引用 Secrets/ConfigMap 正式移除 · 11-12 月预计 1.38 发布)+ 🟠 KubeCon NA 2026(2026-11-09~12 Salt Lake City)新增 AI Inference + Agentic Track(CNCF 官方 2026-08-10 公布 · Session "Kubernetes Solutions for Agent-Shaped Problems" Tim Hockin & Dmitry Berkovich Google · 82% 容器用户在生产环境运行 K8s · 66% 使用生成式 AI 的组织依赖 K8s)+ 🟠 OpenCost 1.121.0(2026-08-05)CNCF incubating 项目首个 K8s 推理成本追踪(与 llm-d CNCF sandbox 集成 · 核心问题:GPU 账单飞涨但每 token 实际成本无法回答 · v1.118 起内置 OpenCost MCP Server 支持 AI agent 用自然语言查询成本数据 · 沿用 §IX 57 立基础延展第 6 件 llm-d CNCF 的工程化成本闭环)+ 🟠 Ingress NGINX 社区版 2026-03 正式停止维护 · Gateway API 成为唯一可选(不再是"推荐"而是"安全紧急" · 沿用 §IX 55/56 K8s+LLM Inference 立基础延展 邻接升级)+ 🟠 K8gb 成为 CNCF incubating 项目(2026-08-05)(基于 CoreDNS 的地理 DNS 负载均衡 · K8s 原生 · 沿用 llm-d 邻接级 ☆)+ 🟡 PinSieve arXiv:2608.24040 paper_card 1086 已建(8-26 16:30 入库 · 主分类 multimodal · 副分类 llm-infra · net-new 唯一 1 件 llm-infra 副分类)(生产级 selective VLM Serving Agent + Governed Memory Flywheel · grey-zone slice 2.05× more non-actionable items filtered · bounded · stateful · observable · governable 企业内容质量 triage)+ 🟠 Workload-Router-Pool Architecture arXiv:2603.21354v2(2026-03 · v2 更新)(2026-03 记录某前沿模型无声回退至 mid-tier 质量事件 · 3σ 滑动窗口偏差触发自动流量重平衡 · AGSERVE session-aware KV-cache + model cascading + Helium proactive caching + Continuum KV-cache TTL pinning for multi-turn + Concur agent-level admission control · 沿用 §IX 55/56 inference SRE 立基础延展邻接级)+ 🟡 LLM Inference Engineering Roadmap 2026 Substack 推理核心指标体系(TTFT / TPOT / ITL / Throughput + PagedAttention + Continuous Batching + Prefix Caching + TP/PP/EP/PD Disaggregation · 沿用 §IX 53-57 推理工程学科化立基础延展框架)+ 🟡 Why Is Inference Slow and Expensive · The AI Engineer Substack(OpenAI 2025 推理支出 84 亿美元 → 2026 预计 141 亿美元 · 推理成本物理本质 = GPU 内存带宽瓶颈 · 沿用 §IX 54 inference cost 立基础延展 邻接级)+ 🟡 TGI 已正式进入维护模式二次确认(2026-08)(LeetLLM / vllm-vs-sglang-vs-tensorrt-llm 2026 对比 · TGI 官方 README 明确"只接受 minor bug fix 和文档改进" · 沿用 §IX 57 立基础延展第 5 件 TGI EOL)+ 🟡 SGLang v0.5.8(2026-01)GB300 NVL72 25× 吞吐提升二次确认(2026-02 实现 · 2026-04 DeepSeek-V4 Day-0 支持 · 2026-06 DFlash + Spec V2 推测解码 · 2026-07 TPU 支持 RadixArk + Google · 2026-07 GLM-5.2 NVFP4 500 TPS · 沿用 §IX 55/56 SGLang 沿用件套扩展)+ 🟡 TensorRT-LLM 1.3.0rc PyTorch-only(2026-08)(移除编译后 TensorRT engine 后端 · 改为 PyTorch 为唯一执行后端 · HuggingFace checkpoint 直接加载 · 沿用 §IX 57 立基础延展第 5 件推理框架版本治理二次升级)+ 🟡 K8s LLM 推理 GitHub Trending 五件(kubernetes-sigs/lws 788⭐ LeaderWorkerSet K8s SIG 官方项目 · devflowinc/uzi 581⭐ Ollama/llama.cpp/vLLM/SGLang 智能路由 · thushan/olla 277⭐ 轻量 LLM 代理 · matrixhub-ai/matrixhub 261⭐ 开源自托管 HF 兼容模型中心 · bentoml/BentoML 2026-08-25 更新 · 沿用 §IX 55/56 K8s+LLM Inference 立基础延展邻接级 ☆)+ 🟡 EdgeFM arXiv:2604.27476v1 · 边缘 LLM 推理框架(Flash Attention + Ring Attention + Paged Attention · 脱离专有硬件生态锁定 · 沿用 §IX 56 邻接级 边缘部署方向)+ 🟡 Chimera arXiv:2608.23553 · GPU-CPU 协同 multi-vector retrieval(Yanqi Chen + Jielin Liu + Alexandra Meliou + Xiao Yan 2026-08-25 arXiv 新提交 · PLAID 系统受 CPU-GPU 数据迁移瓶颈 · GPU 上存储高度压缩低精度量化码 · CPU 上保留高精度向量 · 适用于 RAG 多向量检索 · 沿用 §IX 57 §1.(10) 向量 DB 立基础延展邻接级)+ 🟡 To GPU or Not to GPU arXiv:2605.15957v1 · 关系引擎中向量搜索 GPU 加速(PostgreSQL 17 + pgvector v0.8.2 + cuVS-enabled FAISS v1.13.0 · 数据移动占查询时间 90%+ · 沿用 §IX 57 立基础延展第 7 件 向量 DB 邻接级)+ 🟡 Filter-Agnostic Vector Search arXiv:2603.23710 · Google Research · SIGMOD 2026(高维向量削弱 ScaNN 顺序扫描优势 · 缩小或消除与 HNSW 差距 · PGVector-ACORN vs PGVector-Sweeping vs HNSWLib-ACORN vs HNSWLib-Sweeping · OpenAI-1M 数据集 HNSWLib vs PGVector 平均延迟最高差 10× · 沿用 §IX 57 §1.(10) 向量 DB 选型决策树 邻接级)+ 🟡 Policy-aware Vector Search arXiv:2606.19803 · SeQureDB '26 @ SIGMOD 2026 Workshop · RAG 多租户 FGAC(soundness/security/maximality 三标准 · 沿用 §IX 57 §1.(10) 向量 DB 立基础延展邻接级)+ 🟡 pgrust GitHub malisper/pgrust · PostgreSQL Rust 重写通过 100% 回归测试(PostgreSQL 18.3 兼容 · 46,066 测试 100% 通过 · Analytical workloads 比 Postgres 快 300× · AI coding agent 12-20 并行 2 周合并 280 PR · AGPL-3.0 · 沿用 §IX 57 立基础延展第 7 件 PostgreSQL 18.6 + pgvector 0.8.0 邻接级 · 跨主题 agent/llm-infra/database 三栖)+ 🟡 pgrust 与 2026 Milvus vs Qdrant Kunal Ganglani 8-26 验证(Rust vs Go+C++ · 微服务 vs 单二进制 · 十亿级 vs 千万~亿级 · Reddit 340M 向量实测 Milvus 写入/查询节点分离 · Qdrant 50M 以下首选 · 沿用 §IX 57 §1.(10) 向量 DB 选型决策树 邻接级 ☆)+ 🟢 VecDB@VLDB 2026 Workshop 论文公开(OpenReview · Metadata-Filtered Vector Search · High Throughput Distributed Disk-Based Vector Search BatANN · HPC 环境向量数据库性能研究 · 沿用 §IX 57 §1.(10) 顶会密集部署 邻接级 ☆)+ 🟡 ColPali / ColQwen2 多模态 RAG 2026 技术架构(三种方案:Caption-and-Index · Unified Vision Embeddings Cohere Embed 4 / voyage-multimodal-3 · Page-as-Image + Late Interaction ColPali/ColQwen2 · ColQwen2.5 ~89.5 NDCG@5 vs ColPali-v1.3 ~84.8 · Binary Quantization 16× 压缩 · ColQwen2.5-7B ~16GB VRAM · 沿用 §IX 57 §1.(10) 向量 DB + RAG 沿用件套 邻接级 ☆)+ 🟢 TGI EOL 二次确认 + SGLang v0.5.8 25× + TensorRT-LLM 1.3.0rc PyTorch-only + LeaderWorkerSet 788⭐ + uzi 581⭐ · 6 件 GitHub Trending / inference engineering 子件套 = 立标池饱和度供给侧 v57 沿用 → v58 维持"主分类 paper_card 净增 0 件 + llm-infra 副分类 1 件 net-new(PinSieve arXiv:2608.24040)+ K8s + CNCF 立基础延展 3 件(K8s 1.37 GA + KubeCon NA 2026 AI Inference Track + OpenCost 1.121.0)+ 推理框架版本治理立基础延展 2 件(TGI EOL 二次确认 + TensorRT-LLM 1.3.0rc PyTorch-only)+ 向量 DB 立基础延展邻接级 3 件(Chimera GPU-CPU 协同 + To GPU or Not to GPU + Filter-Agnostic Vector Search SIGMOD 2026)+ 推理 SRE 立基础延展邻接级 1 件(Workload-Router-Pool Architecture arXiv:2603.21354v2)+ K8s LLM 推理 GitHub Trending 立基础延展邻接级 5 件(lws / uzi / olla / matrixhub / BentoML)"七锚点 + 推理工程学科化第 9 维 78 → ≥ 78 件套扩面沿用 + §IX 57 evening 棒位 7 件立基础延展 + §IX 58 evening 棒位 = K8s + CNCF + 向量 DB + 推理 SRE + GitHub Trending 多栖邻接级 14 件套 + PinSieve arXiv:2608.24040 = 8-25 evening → 8-26 evening 窗口唯一 1 件 llm-infra 副分类 net-new + 立标池饱和度 v57 第四次稳态延续


一、综述判断

当日 llm-infra 主轴真实信号密度 = §IX 57 锚入后第二日傍晚"K8s 1.37 GA 当日触发 + KubeCon NA 2026 AI Inference Track 公布 + OpenCost 1.121.0 推理成本追踪正式发布 + jay evening briefing 13:35 + 17:35 inference engineering 双棒信号 + paper_cards 1 件 llm-infra 副分类 net-new PinSieve + 立标池连续第 4 零新增日"型棒:

  • jay 8-26 主棒群(7 件):
  • jay/2026-08-26T1105-jay-midday-supplement-database-backend-cloudnative.md(11:05 CST · 14 KB · 核心来源):Database A 级 3 件(pgrust + Filter-Agnostic Vector Search SIGMOD 2026 + To GPU or Not to GPU)+ Database B+ 级 2 件(Policy-aware Vector Search SeQureDB 2026 + CockroachDB Leader Leases)+ Cloud-Native A-/B+ 级 3 件(OpenCost 1.121.0 + KubeCon NA 2026 AI Inference + Agentic Track + Kairos 11 分钟无人值守 K8s 升级)+ Backend B 级 4 件 GitHub Trending(WeKnower Tencent + PocketBase 60.7k⭐ + Handy Rust 30k⭐ + rtk-ai/rtk LLM Token 节省 60-90%)
  • jay/2026-08-26T1505-jay-five-category-briefing.md(15:05 CST · 14 KB):Database 4 件(VecDB@VLDB 2026 Workshop + Chimera arXiv:2608.23553 GPU-CPU 协同 + Qdrant HPC 环境分布式 + 2026 向量数据库 PostgreSQL 重回中心位)+ Backend/AI Agent 3 件(RAG 已死 Long Live Context Engineering + Graph Engineering for AI Agents TrueFoundry + RAG at Scale Redis Blog)+ Cloud-Native 4 件(🟠 K8s 1.37 GA 三大破坏性变更 + Ingress NGINX EOL + CNCF 项目动态 + Linkerd 2.20)+ CSDN 3 件(DTCC 2026 阿里云陈宗志 + 2026 技术趋势预测 + 2026 AI Agent 技术趋势预测 8 方向)+ Substack 2 件(AIxFunda 周报 + VLDB 2026 Demo 论文)
  • jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(13:35 CST · 14 KB):Substack A 级 3 件(The AI Agents Stack 2026 Paolo Perrone + LLM Research Papers 2026 List Jan-May Sebastian Raschka + How to Learn Agentic AI 2026 Rocky Bhatia)+ ArXiv A 级 4 件(Workload-Router-Pool Architecture arXiv:2603.21354v2 + KV Cache Optimization Strategies arXiv:2603.20397v1 + Optimizing LLM Inference Fluid-Guided Online Scheduling arXiv:2504.11320v4 + EdgeFM arXiv:2604.27476v1)+ GitHub Trending A 级 5 件(kubernetes-sigs/lws 788⭐ LeaderWorkerSet + devflowinc/uzi 581⭐ LLM Proxy/Load Balancer + thushan/olla 277⭐ + matrixhub-ai/matrixhub 261⭐ + bentoml/BentoML)+ 后端语言基准 PostgreSQL REST API Benchmark July 2026 + Go vs Rust 2026 实战对比
  • jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(17:35 CST · 17 KB):推理工程核心知识体系 2026 版 A 级 4 件(LLM Inference Engineering Roadmap 2026 Substack 推理核心指标 + Why Is Inference Slow and Expensive Substack + vLLM vs SGLang vs TensorRT-LLM vs Ollama LeetLLM + SGLang Complete Guide Inference.net)+ 多模态文档 RAG ColPali/ColQwen2 2026 技术架构 A 级 2 件(Multimodal RAG 2026 BigData Boutique + ColPali Visual Document Retrieval Late Interaction)+ AI 工程职业生态 B 级 + Java AI 生产系统 B 级 + 向量数据库选型 2026 Milvus vs Qdrant A 级 + GitHub Trending 2026 B 级 + HF Daily Papers 精选
  • jay/2026-08-26-engineering-e1prep.md(11:23 CST · 19 KB):6 件增量(Compaction Cliff arXiv:2608.22752 + pgrust + Docker 2900 万密钥 + PatchWrite arXiv:2608.23001 + Filter-Agnostic Vector Search arXiv:2603.23710 + Policy-aware Vector Search arXiv:2606.19803)
  • jay/2026-08-26-engineering-practice-screening.md(10:51 CST · 7 KB):PatchWrite + Docker 2900 万密钥 + OpenViking
  • jay/2026-08-26T1450-jay-engineering-secondary-filter.md(14:51 CST · 12 KB):pgrust + OpenCost 1.121.0 + Chinchilla 后续(本棒略)
  • stephen 8-26 noon 协调棒(12:46 CST · 8 KB):沿用 8-25 noon P0 警示 #8 8-24 断档修复判定 + 5 实例产出口径协调 + spark agent-e1prep 停更 2 天缺位沿用
  • tom 8-26 主棒群:tom/2026-08-26-evaluation-e1prep.md(8-26 15:43 CST · 27 KB · 邻接沿用 · llm-infra 无直接增量)+ tom/2026-08-26-rag-e1prep.md(8-26 08:53 CST · 26 KB · 邻接沿用)+ tom/2026-08-26T0840-agent-rag-longcontext-radar.md(8-26 08:41 CST · 5 KB · Compaction Cliff 命中)+ tom/2026-08-26T1440-agent-rag-longcontext-radar.md(8-26 14:41 CST · 4 KB)
  • flyp 8-26 主棒群:flyp/2026-08-26-risk-e1prep.md(8-26 16:38 CST · 41 KB · Compaction Cliff arXiv:2608.22752 副分类 risk 命中 + Policy-aware Vector Search 邻接级 + MCP 安全专题沿用)+ flyp/2026-08-26-multimodal-e1prep.md(8-26 09:44 CST · 63 KB · 邻接沿用)+ flyp/2026-08-26-multimodal-weekly-digest.md(8-26 09:19 CST · 72 KB · Compaction Cliff 副分类 risk 命中)+ flyp/2026-08-26-1500-multimodal-short-review-omnimodal-worldmodel.md(8-26 15:51 CST · 9 KB)
  • spark 8-26 agent 主棒(13:36 CST · 38 KB):v60 备料棒 + paper_cards 1069-1085 沿用 + Compaction Cliff ★ v59 增量 ⑧ 沿用 + PatchWrite + ExtractBench + Context Engineering 四操作 · llm-infra 邻接沿用
  • paper_cards 8-25 evening → 8-26 evening 净增 17 件 1077-1093:主分类 multimodal 9 件 / agent 2 件 / evaluation 2 件 / rag 2 件 / engineering 1 件 / 多模态工程副 1 件 = 1 件 llm-infra 副分类 net-new = PinSieve paper_card 1086(主分类 multimodal · 副分类 llm-infra · production selective VLM Serving + Governed Memory Flywheel)+ 连续第 4 个零新增日沿用(沿用 §IX 56 0 件主轴 + §IX 55 0 件主轴 + §IX 54 4 arXiv 主轴 + §IX 57 0 件主轴)

立标等级判定四档过滤结果:候选 ★ 中-高档 0 件 · 候选 ★ 中档 5 件(K8s 1.37 GA 三大破坏性变更 + KubeCon NA 2026 AI Inference + Agentic Track + OpenCost 1.121.0 K8s 推理成本追踪 + Ingress NGINX 社区版 2026-03 EOL + Workload-Router-Pool Architecture AGSERVE/Helium/Continuum/Concur 完整套件)+ 候选 ☆ 低档 9 件(PinSieve arXiv:2608.24040 llm-infra 副分类 net-new + K8gb CNCF incubating + LLM Inference Engineering Roadmap 2026 + Why Is Inference Slow and Expensive + SGLang v0.5.8 GB300 25× + TensorRT-LLM 1.3.0rc PyTorch-only + 5 件 K8s LLM 推理 GitHub Trending lws/uzi/olla/matrixhub/BentoML + EdgeFM arXiv:2604.27476v1 + Chimera arXiv:2608.23553 + To GPU or Not to GPU arXiv:2605.15957v1 + Filter-Agnostic Vector Search arXiv:2603.23710 + Policy-aware Vector Search arXiv:2606.19803 + pgrust + ColPali/ColQwen2 + 2026 Milvus vs Qdrant)+ 观察信号 0 件

对比 8-25 evening 棒 vs 8-26 evening 棒: - 8-25 evening = "§IX 56 锚入后第三日傍晚 + 8-25 morning 棒 8 件主线补位深度消化 + jay 15:05 afternoon MCP 安全专题立基础延展候选主轴触发 + vLLM Conference Day 1 当日观察窗口关闭 + paper_cards 主轴 0 件净增"(7 件主线 + 12 件延后) - 8-26 evening = "§IX 57 锚入后第二日傍晚 + K8s 1.37 GA 当日触发 + KubeCon NA 2026 AI Inference Track + OpenCost 1.121.0 + jay 13:35 + 17:35 inference engineering 双棒 + paper_cards 1 件 llm-infra 副分类 net-new PinSieve + 立标池连续第 4 零新增日"(14 件立基础延展邻接级 + 1 件 llm-infra 副分类 net-new)


二、核心增量(14 件主线 + 1 件 llm-infra 副分类 net-new · 立标等级四档显式标注)

增量 1【K8s + CNCF 生态扩展 · §1.(10) 顶会密集部署 + §1.(2) 推理调度立基础延展候选】🟠 K8s 1.37 GA 三大破坏性变更 + KubeCon NA 2026 AI Inference + Agentic Track + OpenCost 1.121.0 + Ingress NGINX EOL + K8gb incubating ★ 中档

来源: jay/2026-08-26T1505-jay-five-category-briefing.md(§三 Cloud-Native-1 K8s 1.37)+ jay/2026-08-26T1105-jay-midday-supplement-database-backend-cloudnative.md(§三 Cloud-Native 6/7/8 OpenCost 1.121.0 + KubeCon NA 2026 + Kairos)+ jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(§一 Substack-1 The AI Agents Stack 2026 + §二 ArXiv-1 Workload-Router-Pool Architecture)

arXiv: 无 · K8s + CNCF 官方发布 + 厂商实践

要点(8-26 jay 主棒群新增 vs §IX 54-57 已锚):

K8s 1.37 GA(2026-08-26 当日 · shattered.io 报道 · 最高优先级): - 三大破坏性变更: 1. kube-proxy 默认后端:IPVS → nftables(自 2016 年起的网络默认架构终结) 2. Static Pod 引用 Secrets/ConfigMap:正式移除(集群升级前必须审计所有 Static Pod) 3. 通用影响:跳过预升级审计的集群将在升级后故障 - 操作建议:立即行动 + 升级前执行 kube-proxy 配置审计确认 iptables/nftables 模式 + 检查所有 Static Pod 是否引用了 Secrets 或 ConfigMap(改为 DaemonSet/Deployment 或其他方案)+ 预计 1.38 在 2026 年 11-12 月发布 - 可信度:★★★★★(shattered.io + K8s 官方 release schedule 已确认)

KubeCon + CloudNativeCon NA 2026(2026-11-09~12 Salt Lake City · CNCF 官方 2026-08-10 公布): - 新 AI Inference + Agentic track:专门讨论 Kubernetes 上的 AI 推理和 Agent 编排 - Session 亮点:"Kubernetes Solutions for Agent-Shaped Problems" — Tim Hockin & Dmitry Berkovich(Google) - 内容覆盖:autonomous agents 编排 + vLLM/KServe 模型服务优化 + inference pipeline 动态路由和可观测性 - CNCF 调查数据:82% 容器用户在生产环境运行 K8s · 66% 使用生成式 AI 的组织依赖 K8s - 可信度:★★★★★(CNCF 官方 PR)

OpenCost 1.121.0(2026-08-05 · CNCF incubating 项目 · IBM Research 工程师撰写): - 核心功能: - 与 llm-d(CNCF sandbox)集成,实现分布式 LLM 推理成本追踪 - 核心问题:GPU 账单飞涨,但每 token 实际成本无法回答 - Cost ≠ Price:SaaS 提供商定价可能低于或高于实际成本 - 支持 vLLM 用户(不依赖 llm-d),核心 metrics 来自 vLLM 自身 - OpenCost MCP Server:v1.118 起内置 MCP server,支持 AI agent 用自然语言查询成本数据 - Roadmap:空闲 GPU 检测 + GPU 浪费测量 + 工作负载成本归因 + 优化节省估算 - CNCF 背景:2024-10-25 升为 Incubating 项目,与 Kubernetes 同级 - 可信度:★★★★★(CNCF 官方博客 · IBM Research · 与 llm-d 集成)

Ingress NGINX 社区版(2026-03 正式停止维护): - Gateway API 成为唯一可选方案:不再是"推荐"而是"安全紧急" - 2026 年 Kubernetes 迁移最佳实践:必须迁移到 Gateway API - 可信度:★★★★★(综合多个 CNCF 调查 · 沿用 §IX 55/56 K8s+LLM Inference 立基础延展 邻接升级)

K8gb 成为 CNCF incubating 项目(2026-08-05):基于 CoreDNS 的地理 DNS 负载均衡 · Kubernetes 原生 · 沿用 llm-d 邻接级 ☆

Kairos 11 分钟无人值守 Kubernetes 控制面升级(CNCF 博客 2026-08-17):基于 Kairos 构建自我修复的 K8s upgrade pipeline · 无需 SSH 逐一登录节点 · 平台工程自动化方向 · 沿用 §IX 57 §1.(10) 邻接级

与活文档关系: §IX 57 §1.(10) 顶会密集部署已锚 K8s+LLM Inference + Spheron 2026 + ServerGurus PD disaggregation + HLD Blog 三件 + vLLM Conf 8-25 Roadmap Q3 + TGI EOL + Stripe 73% + kv-cache-analyzer CLI + llm-d KV Cache 路由 + vLLM 8 月三件 blog + TurboQuant 数字矛盾警示 + 3 件 KV Cache 新论文邻接升级;本棒 = §1.(10) K8s + CNCF 生态扩展立基础延展候选补强(K8s 1.37 GA 三大破坏性变更 + KubeCon NA 2026 AI Inference + Agentic Track + OpenCost 1.121.0 K8s 推理成本追踪与 llm-d 集成 + Ingress NGINX EOL + K8gb incubating + Kairos 11 分钟升级);§1.(2) 推理调度沿用(K8s 1.37 kube-proxy nftables 默认对推理调度延迟有直接影响)

警示: K8s 1.37 GA 当日所有 K8s 集群运营商必须关注 · OpenCost 1.121.0 与 llm-d 集成需独立部署测试 · Ingress NGINX → Gateway API 迁移的具体工作量评估

归入节: §1.(10) 顶会密集部署新增「K8s 1.37 GA(2026-08-26 当日 · kube-proxy nftables 默认 + Static Pod Secrets/ConfigMap 移除)+ KubeCon NA 2026 AI Inference + Agentic Track(2026-11-09~12 Salt Lake City)+ OpenCost 1.121.0 K8s 推理成本追踪(2026-08-05 · CNCF incubating · 与 llm-d 集成 · OpenCost MCP Server v1.118)+ Ingress NGINX 社区版 EOL(2026-03 · Gateway API 安全紧急)+ K8gb incubating(2026-08-05)+ Kairos 11 分钟无人值守升级(2026-08-17)」沿用补强


增量 2【推理引擎 SRE 与生产架构 · §1.(12) End-to-End Pipeline + §1.(11) Kernel/AI 自动化立基础延展候选】🟠 Workload-Router-Pool Architecture · AGSERVE + Helium + Continuum + Concur 完整 agent 推理 SRE 套件 ★ 中档

来源: jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(§二 ArXiv-1 Workload-Router-Pool Architecture)

arXiv: arXiv:2603.21354v2(2026-03 首次提交 · v2 更新)

要点: - 生产事故驱动:2026-03 记录某前沿模型无声回退至 mid-tier 质量事件(无代码变更)+ 3σ 滑动窗口偏差触发自动流量重平衡 - 架构三维度: 1. Workload 分析(per-model · per-domain 统计) 2. Router 智能路由(基于质量监控) 3. Pool 管理(多模型实例池) - Agent 专用技术 4 件套: - AGSERVE:session-aware KV-cache + model cascading - Helium:proactive caching - Continuum:KV-cache TTL pinning for multi-turn - Concur:agent-level admission control - 工程价值:⭐⭐⭐⭐ 推理系统生产运营必读 · SRE 视角

与活文档关系: §IX 55-57 §1.(12) End-to-End Pipeline 7 件已锚 KV Pool / Engine / Sched / Service Concurrency Safety / Harness Reliability / Agent Security / Eval + Inference Engineering 71 → 78 件套扩面;本棒 = §1.(12) End-to-End Pipeline 邻接级新增 1 件(Workload-Router-Pool Architecture 完整套件)+ §1.(11) Kernel/AI 自动化 邻接级新增 1 件(3σ 滑动窗口偏差自动流量重平衡 = AI 自动化监控);沿用 §IX 54-56 vLLM/SGLang 选型决策树 + NVIDIA Dynamo 1.4.1 + KServe + KServe + llm-d + K8s HPA LLM arXiv:2507.18007 立基础延展

警示: arXiv:2603.21354v2 v2 更新内容与 v1 差异需 PDF 核验 · 某前沿模型无声回退至 mid-tier 质量事件具体是哪个模型家族未明示

归入节: §1.(12) Pipeline 邻接级新增「Workload-Router-Pool Architecture(arXiv:2603.21354v2 · 2026-03 production incident · AGSERVE session-aware KV-cache + Helium proactive caching + Continuum KV-cache TTL pinning for multi-turn + Concur agent-level admission control)+ 3σ 滑动窗口偏差自动流量重平衡」补强 + §1.(11) Kernel/AI 自动化 邻接级


增量 3【推理框架版本治理二次升级 · §1.(1) + §1.(12) 立基础延展候选】🟡 TGI EOL 二次确认 + TensorRT-LLM 1.3.0rc PyTorch-only + SGLang v0.5.8 GB300 25× 升级 ☆ 低档

来源: jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(§一-3 LeetLLM vLLM vs SGLang vs TensorRT-LLM vs Ollama)+ jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(§一-4 SGLang Complete Guide Inference.net)

arXiv: 无 · 厂商官方 + 第三方 Substack

要点(8-26 jay 17:35 inference engineering 棒新增 vs §IX 57 立基础延展第 5 件已锚):

TGI(Hugging Face Text Generation Inference)已正式进入维护模式二次确认(2026-08 LeetLLM): - TGI 官方 README 明确"只接受 minor bug fix 和文档改进",不再有新功能开发 - 沿用 §IX 57 立基础延展第 5 件 TGI EOL 二次确认

Ollama 不与三款服务端引擎竞争同一层级:它打包了模型下载、生命周期、CLI、API,底层可接入 llama.cpp 或 MLX(Apple Silicon)· 沿用 §IX 57 沿用件套

SGLang v0.5.8(2026-01)已支持 GB300 NVL72 + 2026-02 实现 25× 吞吐提升(H100 对比): - SGLang 2026 更新路线图:2026-02 GB300 NVL72 25× 吞吐 · 2026-04 DeepSeek-V4 Day-0 支持 · 2026-06 DFlash + Spec V2 推测解码 · 2026-07 TPU 支持 RadixArk + Google · 2026-07 GLM-5.2 NVFP4 达 500 TPS - 生产部署优势:SGLang 调度器对多步 Agent 场景(需要大量工具调用 + 中间结果)天然友好,支持结构化输出 - SGLang 生态:400,000+ GPU 部署量

TensorRT-LLM 1.3.0rc PyTorch-only(2026-08 LeetLLM): - 移除了编译后的 TensorRT engine 后端 - 改为 PyTorch 为唯一执行后端 - HuggingFace checkpoint 直接加载——降低了使用门槛 - 沿用 §IX 57 立基础延展第 5 件 TensorRT-LLM v1.2.1 Blackwell 原生优化

版本漂移风险:vLLM 和 SGLang 已发布多版,版本间行为差异显著,生产环境需固定版本

与活文档关系: §IX 57 立基础延展第 5 件 推理框架版本治理已锚(SGLang v0.5.18 2026-08-22 · vLLM v0.27.1 2026-08-11 · TGI EOL 二次确认 · Ollama v0.32.9 · llama.cpp b10375 · TensorRT-LLM v1.2.1 Blackwell 原生优化);本棒 = §1.(1) 推理引擎版本治理二次升级立基础延展候选补强(TGI EOL 第三方独立二次确认 + TensorRT-LLM 1.3.0rc PyTorch-only 关键架构变化 + SGLang v0.5.8 GB300 NVL72 25× 升级)

警示: SGLang v0.5.8 vs v0.5.18 跨版本跨度大,需 GitHub release notes 核验中间版本变更 · TensorRT-LLM 1.3.0rc 移除 TensorRT engine 后端对生产环境性能影响需实测

归入节: §1.(1) 推理引擎层新增「SGLang v0.5.8(2026-01 · GB300 NVL72 25× 吞吐 · 2026-04 DeepSeek-V4 Day-0 · 2026-06 DFlash + Spec V2 · 2026-07 TPU RadixArk · GLM-5.2 NVFP4 500 TPS)+ TensorRT-LLM 1.3.0rc PyTorch-only(2026-08 · 移除编译后 TensorRT engine 后端 · HuggingFace checkpoint 直接加载)+ TGI EOL 第三方独立二次确认(2026-08 LeetLLM)+ Ollama 不与三款服务端引擎竞争同一层级」沿用补强


增量 4【向量 DB 选型决策树 + RAG 多向量检索立基础延展邻接级 · §1.(10) 顶会密集部署 + §1.(3) KV Cache 邻接级】🟡 Chimera arXiv:2608.23553 GPU-CPU 协同 multi-vector retrieval + Filter-Agnostic Vector Search SIGMOD 2026 + Policy-aware Vector Search SeQureDB 2026 + pgrust + 2026 Milvus vs Qdrant ☆ 低档

来源: jay/2026-08-26T1505-jay-five-category-briefing.md(§一 Database-2 Chimera + §三 Cloud-Native 6-8)+ jay/2026-08-26T1105-jay-midday-supplement-database-backend-cloudnative.md(§一 Database-2/3/4)+ jay/2026-08-26-engineering-e1prep.md(§增量 5/6)+ jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(§五 Milvus vs Qdrant)+ jay/2026-08-26T1450-jay-engineering-secondary-filter.md(§pgrust)

arXiv: arXiv:2608.23553(Chimera · 8-25 入库)+ arXiv:2603.23710(Filter-Agnostic Vector Search · SIGMOD 2026)+ arXiv:2606.19803(Policy-aware Vector Search · SeQureDB '26)+ arXiv:2605.15957v1(To GPU or Not to GPU)+ arXiv:2604.27476v1(EdgeFM · 邻接)

要点(8-26 jay 主棒群新增 vs §IX 57 §1.(10) 向量 DB 选型决策树 50M 分水岭已锚):

Chimera arXiv:2608.23553 GPU-CPU 协同 multi-vector retrieval(Yanqi Chen + Jielin Liu + Alexandra Meliou + Xiao Yan · 2026-08-25 arXiv 新提交): - 核心问题:现有 GPU 向量检索系统(PLAID)受 CPU-GPU 数据迁移瓶颈——向量数据必须在查询时从主机内存传输到 GPU - 解决方案:GPU 上存储高度压缩低精度量化码 · CPU 上保留高精度向量 · 消除传输瓶颈 - 专注多向量检索(multi-vector retrieval)场景:适合 RAG 中的段落级检索 - 可信度:★★★★(学术论文 · 针对当前 GPU 向量系统的工程瓶颈提出新架构)

Filter-Agnostic Vector Search on PostgreSQL arXiv:2603.23710(SIGMOD 2026 · Google Research): - 维度影响:高维向量削弱 ScaNN 顺序扫描优势 · 缩小或消除与 HNSW 差距 - k 值影响:Graph-based filter-first 方法随 k 增大更鲁棒 · ScaNN 需访问更多叶节点 - 系统对比:PGVector-ACORN vs PGVector-Sweeping vs HNSWLib-ACORN vs HNSWLib-Sweeping - OpenAI-1M 数据集:HNSWLib(实线)vs PGVector(虚线)平均延迟最高差 10× - 结论:filter-agnostic 问题在向量数据库中尚无通用最优解

Policy-aware Vector Search arXiv:2606.19803(SeQureDB '26 @ SIGMOD 2026 Workshop · RAG 多租户 FGAC): - 核心问题:RAG 和企业 AI 管道中 + 向量数据库如何实现细粒度访问控制(FGAC)= 当前向量 DB 安全能力有限 - 正确性三标准(soundness/security/maximality):在向量场景下需要重新解释 - 应用场景:多租户 AI 系统 + cross-tenant retrieval leak = 合规事故

To GPU or Not to GPU arXiv:2605.15957v1(2026-08 最新): - 数据移动是主要瓶颈:跨 PCIe 总线传输 embeddings 和索引结构占总查询时间 90%+(大索引场景) - 解决方案路径:GPU 显存常驻索引数据 + 计算与传输重叠 + CPU-GPU 分层架构 - 实验栈:PostgreSQL 17 + pgvector v0.8.2 + cuVS-enabled FAISS v1.13.0 + libcuvs v25.08 + CUDA 12.8

pgrust · PostgreSQL Rust 重写通过 100% 回归测试(GitHub malisper/pgrust): - PostgreSQL 18.3 兼容 · 46,066 测试 100% 通过 - Analytical workloads 比 Postgres 快 300×(batching + operator fusion + SIMD · Graviton4 调优) - AI Coding Agent 用法:12-20 个并行 coding agent · 2 周合并 280 PR · 已知最大规模 AI 辅助基础设施重写之一 - 沿用 §IX 57 立基础延展第 7 件 PostgreSQL 18.6 + pgvector 0.8.0 邻接级 · 跨主题 agent/llm-infra/database 三栖

2026 Milvus vs Qdrant Kunal Ganglani 8-26(Reddit 340M 向量实测): - 核心架构差异:Milvus(Go + C++ 微服务 etcd + MinIO + 多二进制 · 分布式 K8s 原生 · 十亿级)vs Qdrant(Rust 单二进制 Docker · 单机/简单集群 · 千万~亿级) - Reddit 340M 向量实测:Milvus 写入/查询节点分离 · Qdrant 中等规模延迟敏感 - 2026 年开源向量数据库完整格局:Tier 1: Pinecone / Qdrant · Tier 2: Weaviate / Milvus · Tier 3: Chroma / pgvector · Tier 4: LanceDB / Vespa - 沿用 §IX 57 §1.(10) 向量 DB 选型决策树 50M 分水岭 邻接级 ☆

VecDB@VLDB 2026 Workshop 论文公开(OpenReview · 8-15 已公开): - Metadata-Filtered Vector Search · High Throughput Distributed Disk-Based Vector Search(BatANN)· HPC 环境向量数据库性能研究 - 沿用 §IX 57 §1.(10) 顶会密集部署 邻接级 ☆

ColPali / ColQwen2 多模态 RAG 2026 技术架构: - 三种方案:Caption-and-Index(最简)· Unified Vision Embeddings(Cohere Embed 4 / voyage-multimodal-3)· Page-as-Image + Late Interaction(ColPali/ColQwen2 · 最强 · 保留布局) - ColPali 家族技术规格:ColPali-v1.3 ~84.8 NDCG@5 · ColQwen2-v1.0 +5.1 · ColQwen2.5-v0.2 ~89.5 · ColSmol 256M/500M 成本敏感 - Binary Quantization(Qdrant 支持)压缩 16× · ColQwen2.5-7B ~16GB VRAM · H200 141GB 单卡运行 - 沿用 §IX 57 §1.(10) 向量 DB + RAG 沿用件套 邻接级 ☆

与活文档关系: §IX 57 §1.(10) 向量 DB 选型决策树 50M 分水岭 + PostgreSQL 18.6 + pgvector 0.8.0 + MySQL 9.7.1 + PG 14 EOL 已锚;本棒 = §1.(10) 向量 DB 立基础延展邻接级 5 件补强 · Chimera GPU-CPU 协同 + Filter-Agnostic Vector Search SIGMOD 2026 + Policy-aware Vector Search SeQureDB 2026 + To GPU or Not to GPU + pgrust + 2026 Milvus vs Qdrant Kunal Ganglani + VecDB@VLDB 2026 + ColPali/ColQwen2 多模态 RAG

警示: arXiv:2608.23553 Chimera GitHub repo 状态 + 与 PLAID head-to-head 对照需独立验证 · arXiv:2603.23710 高维向量具体评测基准(HNSW vs ScaNN)· arXiv:2606.19803 FGAC 跨厂商测试覆盖(FalkorDB / Qdrant / Milvus / Weaviate / Pinecone)· pgrust 官方明确不建议用于生产

归入节: §1.(10) 向量 DB 沿用补强「Chimera arXiv:2608.23553 GPU-CPU 协同 multi-vector retrieval + Filter-Agnostic Vector Search arXiv:2603.23710 SIGMOD 2026 + Policy-aware Vector Search arXiv:2606.19803 SeQureDB 2026 Workshop + To GPU or Not to GPU arXiv:2605.15957v1 + pgrust GitHub malisper/pgrust PostgreSQL 18.3 100% 回归测试 + 2026 Milvus vs Qdrant Kunal Ganglani Reddit 340M 实测 + VecDB@VLDB 2026 Workshop + ColPali/ColQwen2 多模态 RAG 2026」


增量 5【推理工程学科化立基础延展邻接级 · §1.(11) Kernel/AI 自动化 + §1.(13) 边界扩展立基础延展候选】🟡 LLM Inference Engineering Roadmap 2026 + Why Is Inference Slow and Expensive + Optimizing LLM Inference Fluid-Guided Online Scheduling + EdgeFM + Optimizing LLM Inference Fluid-Guided Online Scheduling ☆ 低档

来源: jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md(§一-1/2-1/2-2)+ jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(§二 ArXiv-2/3/4)

arXiv: arXiv:2603.20397v1(KV Cache Optimization Strategies 综述)+ arXiv:2504.11320v4(Optimizing LLM Inference Fluid-Guided Online Scheduling with Memory Constraints)+ arXiv:2604.27476v1(EdgeFM)

要点:

LLM Inference Engineering Roadmap 2026(AI Engineering Insider Substack): - 推理核心指标:TTFT(首 token 延迟 · Prefill 阶段决定)· TPOT(每输出 token 耗时 · Decode 阶段决定)· ITL(token间延迟)· Throughput - PagedAttention 与 KV-Cache:vLLM PagedAttention 分块管理 · 内存利用率提升至 96%+ · 连续批处理动态替换已完成请求 · GPU 利用率最大化 · Prefix Caching 共享前缀复用 - 分布式推理并行策略:Tensor Parallelism(单请求内模型分片 · 最低延迟 · 适合单次大请求)· Pipeline Parallelism(多层流水线 · 降低通信开销 · 适合高吞吐)· Expert Parallelism(MoE 模型专用 · experts 分布在不同 GPU)· Prefill/Decode Disaggregation(分离 prefill 和 decode 节点 · 分别优化) - 沿用 §IX 53-57 推理工程学科化立基础延展框架 · 适合作为"推理工程"主题页的骨架

Why Is Inference Slow and Expensive · The AI Engineer Substack(Paolo Perrone): - OpenAI 2025 年推理支出 84 亿美元 · 2026 年预计 141 亿美元——推理成本结构是 AI 商业化的核心约束 - 推理贵的根本原因不在模型"智能度",而在 GPU 内存带宽瓶颈:HBM 带宽 vs. 芯片面积的比例限制了每个 token 的生成速度 - KV Cache 的存储和读写是主要内存瓶颈 · 激活内存(activation memory)与模型参数内存竞争同一 HBM 资源 - 量化(INT4/INT8)+ Speculative Decoding + PagedAttention 都是缓解内存带宽瓶颈的工程手段

KV Cache Optimization Strategies for Scalable LLM Inference arXiv:2603.20397v1: - 7 个实际部署场景分类:Long-context single requests · High-throughput datacenter serving · Edge devices · Multi-turn conversations · Accuracy-critical reasoning ... - 结论:无单一技术主导所有场景,需 adaptive multi-stage optimization pipeline - Long context 趋势:现代模型上下文窗口从 32k → 100k → 1M token 快速扩张 · KV cache 管理成为核心瓶颈

Optimizing LLM Inference arXiv:2504.11320v4 Fluid-Guided Online Scheduling with Memory Constraints: - Eviction 恶性循环:当 KV Cache 超出 GPU 内存 → 驱逐 in-progress prompts → 重建 prompt 消耗内存 → 再次触发驱逐 · "This appears as failed or aborted generations under load." - 生产系统默认:vLLM 默认使用 recomputation 策略(KV Cache 驱逐后重启 prompt prefill) - 扩展方向:WAIT 和 Nested WAIT 算法在时间变化负载和大量 prompt 类型下的自适应扩展

EdgeFM arXiv:2604.27476v1 · 首个开源边缘 LLM 推理框架: - 原生为跨平台工业边缘部署设计 · 脱离专有硬件生态锁定 - 技术基础:Flash Attention 系列 + Ring Attention + Paged Attention(vLLM)

与活文档关系: §IX 53-57 推理工程学科化第 9 维 78 件套扩面 + §1.(11) Kernel/AI 自动化 + §1.(13) 边界扩展沿用件套 + §1.(9) 量化经济学 + §1.(3) KV Cache 19-25 路线;本棒 = §1.(11) + §1.(13) 推理工程学科化立基础延展邻接级 5 件补强(LLM Inference Engineering Roadmap 2026 推理核心指标体系 + Why Is Inference Slow and Expensive 推理成本物理本质 + KV Cache Optimization Strategies 7 场景分类 + Optimizing LLM Inference Fluid-Guided Online Scheduling Eviction 恶性循环 + EdgeFM 边缘 LLM 推理)

警示: KV Cache 7 场景分类的 adaptive multi-stage optimization pipeline 具体实现需 PDF 核验 · EdgeFM 跨平台工业边缘部署实测性能需独立评估

归入节: §1.(11) Kernel/AI 自动化 + §1.(13) 边界扩展 + §1.(9) 量化经济学 + §1.(3) KV Cache 邻接级新增「LLM Inference Engineering Roadmap 2026 + Why Is Inference Slow and Expensive + KV Cache Optimization Strategies arXiv:2603.20397v1 + Optimizing LLM Inference arXiv:2504.11320v4 + EdgeFM arXiv:2604.27476v1」沿用补强


来源: jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(§三 GitHub Trending A 级 5 件)

arXiv: 无 · GitHub 官方仓库 + 官方 README

要点:

kubernetes-sigs/lws(LeaderWorkerSet)· 788⭐ · Go · 2026-08-15: - 将一组 pods 作为一个复制单元部署的 K8s API · llm-inference sig-apps 专用 - 官方 K8s SIG 项目 · 大规模 LLM 推理分布式部署的 K8s 原语支持 - 沿用 §IX 57 §1.(10) K8s+LLM Inference 立基础延展 邻接升级

devflowinc/uzi(LLM Proxy/Load Balancer)· 581⭐ · Go · 2026-08-16: - 支持 Ollama/llama.cpp/vLLM/SGLang 本地推理的智能路由和自动故障转移负载均衡器 - 开源活跃项目 · 本地/私有 LLM 部署必备路由层 - 沿用 §IX 57 §1.(10) K8s+LLM Inference 立基础延展 邻接级 ☆

thushan/olla(LLM Proxy & Load Balancer)· 277⭐: - 高性能 LLM 基础设施轻量代理和负载均衡器 · 智能路由 + 自动故障转移 + 统一模型发现 - 与 uzi 类似但更轻量,适合中小规模部署 - 沿用 §IX 57 §1.(10) K8s+LLM Inference 立基础延展 邻接级 ☆

matrixhub-ai/matrixhub · 261⭐ · Go · 2026-08-16: - 开源自托管 AI 模型中心 · Hugging Face 兼容 · 加速 vLLM/SGLang 性能 - 自托管 HF 兼容模型注册表 · 适合私有化部署 - 沿用 §IX 57 §1.(10) K8s+LLM Inference 立基础延展 邻接级 ☆

bentoml/BentoML · 2026-08-25: - AI 应用和模型服务最简方式 · 构建模型推理 API + Job queues + LLM apps + 多模型管道 - 通用 AI 模型服务框架 · Python 生态 · 与 vLLM/SGLang 互补 - 沿用 §IX 57 §1.(10) K8s+LLM Inference 立基础延展 邻接级 ☆

与活文档关系: §IX 57 §1.(10) 顶会密集部署 + §1.(2) 推理调度已锚 K8s+LLM Inference + Spheron 2026 + ServerGurus PD disaggregation + HLD Blog 三件 + vLLM Conf 8-25 Roadmap Q3 + TGI EOL + Stripe 73% + kv-cache-analyzer CLI + llm-d KV Cache 路由 + vLLM 8 月三件 blog + TurboQuant 数字矛盾警示 + 3 件 KV Cache 新论文邻接升级 + §IX 58 新增 K8s LLM 推理 GitHub Trending 5 件套件 = lws + uzi + olla + matrixhub + BentoML

警示: 5 个项目的生产稳定性 + 社区活跃度 + 与 llm-d CNCF / ai-dynamo/dynamo / NVIDIA Dynamo 1.4.1 关系需独立核验 · K8s SIG 项目 lws 是否会被集成到 llm-d CRD 中

归入节: §1.(10) 顶会密集部署 + §1.(2) 推理调度 邻接级新增「kubernetes-sigs/lws LeaderWorkerSet K8s SIG 官方 788⭐ + devflowinc/uzi LLM Proxy/Load Balancer 581⭐ + thushan/olla LLM Proxy 277⭐ + matrixhub-ai/matrixhub HF 兼容 261⭐ + bentoml/BentoML 8-25 更新」K8s LLM 推理 GitHub Trending 五件套件


增量 7【AI Agents Stack 2026 Edition · §1.(12)(vi) Agent Security + §1.(12)(v) Harness Reliability 立基础延展邻接级】🟢 The AI Agents Stack 2026 Edition + LLM Research Papers 2026 List Jan-May + How to Learn Agentic AI 2026 ☆ 低档

来源: jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(§一 Substack A 级 3 件)

arXiv: 无 · Substack + 综述报告

要点:

The AI Agents Stack 2026 Edition(Paolo Perrone · The AI Engineer): - 三大结构性变化(2024→2026):MCP 标准化工具连接 + 推理模型改变 Agent 自主性 + Memory 成一级架构原语 - 六层 Agent 架构:LLM 层(推理引擎)· Memory 层(跨 session 持久化)· Tools 层(MCP 协议标准化)· Orchestration 层(工作流/状态机)· Guardrails 层(2026 新增独立层)· Evaluation 层 - Guardrails 新范式:2024 年 guardrails = 输入/输出过滤器 · 2026 年 Agent 调用工具、花钱、执行操作,guardrails 必须覆盖工具授权层 · "By the time you filter the response, the agent already sent the email." - OWASP MCP Top 10:2026 年 beta 发布 · Agent 安全首个真实清单 - 沿用 §IX 57 §1.(12)(vi) Agent Security MCP 安全专题主轴沿用件套

LLM Research Papers 2026 List Jan-May(Sebastian Raschka): - 2026 上半年 LLM 研究主题分类(10 大类):Architecture · Efficient Training · Inference Efficiency and KV Cache · Sparse Attention and Long Context · Reasoning · RLVR · Agent Systems · Coding Agents · Diffusion Language Models · Evaluation - 关键架构趋势:混合注意力架构(Hybrid Architecture)在 2026 年成主流 · Qwen3.6 使用 Gated DeltaNet 层替代部分 attention · Nemotron 3(120B-A12B MoE hybrid)使用 Mamba-2 + attention 交替 - 沿用 §IX 53-57 §1.(3) 稀疏注意力 + §1.(11) + §1.(13) 边界扩展沿用件套

How to Learn Agentic AI 2026(Rocky Bhatia): - 核心等式:Agent = LLM + Retrieval + Memory + Tools + Planning + State + Observability + Constraints + Execution Infrastructure - 学习路径(真实 roadmap):LLM fundamentals → Retrieval → Workflow orchestration → Tool execution → Memory → Reliability → Security → Multi-agent → Operational economics - 关键洞察 — Agent 经济学:Agent 系统成本远超纯推理成本,包括重试开销 + evaluator 评估成本 + 状态序列化存储成本 + 审计日志 - 安全警示:间接 prompt injection(通过检索内容注入恶意指令)已是现实威胁 - 沿用 §IX 53-57 §1.(12) End-to-End Pipeline 7 件沿用件套

与活文档关系: §IX 57 §1.(12) End-to-End Pipeline 7 件 + §1.(12)(v) Harness Reliability + §1.(12)(vi) Agent Security + §1.(13) 边界扩展 ≥ 141 子轴候选沿用件套;本棒 = §1.(12) Pipeline + §1.(13) 边界扩展 + §1.(3) 稀疏注意力 邻接级 3 件补强(The AI Agents Stack 2026 Edition 六层架构 + Guardrails 新范式 + LLM Research Papers 2026 List 10 大类 + 混合注意力架构主流 + How to Learn Agentic AI 2026 Agent 经济学)

警示: OWASP MCP Top 10 β 完整条目 PDF 核验 · 间接 prompt injection 现实威胁案例具体引用源

归入节: §1.(12) Pipeline + §1.(13) 边界扩展 + §1.(3) 稀疏注意力 + §1.(12)(vi) Agent Security 邻接级新增「The AI Agents Stack 2026 Edition(Paolo Perrone · 六层架构 + Guardrails 新范式)+ LLM Research Papers 2026 List Jan-May(Sebastian Raschka · 10 大类 + 混合注意力架构主流)+ How to Learn Agentic AI 2026(Rocky Bhatia · Agent 经济学 + 间接 prompt injection)」补强


增量 8【llm-infra 副分类 net-new · §1.(10) 顶会密集部署 + §1.(13) 边界扩展立基础延展邻接级】🟡 PinSieve arXiv:2608.24040 · Production Selective VLM Serving + Governed Memory Flywheel · paper_card 1086 已建(8-26 16:30 入库 · 主分类 multimodal · 副分类 llm-infra) ☆ 低档

来源: paper_cards/1086-2608-24040.md(8-26 16:30 入库 · 主分类 multimodal · 副分类 llm-infra · paper_card 1086 已建)

arXiv: arXiv:2608.24040(PinSieve · 8-26 入库 · 主分类 multimodal · 副分类 llm-infra)

要点: - 核心定位:Enterprise AI agents in production often need to be bounded, stateful, observable, and governable rather than fully autonomous - 核心架构:PinSieve = production case study in a large-scale content-quality pipeline - 部署组件:selective vision-language-model(VLM)Serving Agent - operates only on the grey-zone slice left unresolved by lightweight upstream models - exposes a scalar routing score online - preserves controlled human escalation - 关键数据:filtered 2.05× more non-actionable items than the previous production module while slightly reduci[ng cost/...] - 企业生产 AI 工程的"边界 + 状态 + 可观测 + 可治理"工程哲学 - 可信度:★★★★(arXiv 完整 · paper_card 已建 · 主分类 multimodal + 副分类 llm-infra 双栖)

与活文档关系: §IX 57 §1.(10) 顶会密集部署 + §1.(12) End-to-End Pipeline 7 件 + §1.(12)(vi) Agent Security 沿用件套;本棒 = §1.(10) 顶会密集部署 + §1.(12) Pipeline + §1.(13) 边界扩展 邻接级新增 1 件(PinSieve arXiv:2608.24040 · 8-26 evening 窗口唯一 1 件 llm-infra 副分类 net-new) + 立标池饱和度 v57 第四次稳态延续 → v58 维持"主分类 paper_card 净增 0 件 + llm-infra 副分类 net-new 1 件"立标池饱和度

警示: PinSieve 完整论文全文 PDF 精读(企业级 VLM Serving 工程实践 + Governed Memory Flywheel 设计 · 沿用 §IX 57 立基础延展第 6 件 llm-d CNCF 邻接级)· paper_card 1086 主分类 multimodal 优先级需确认是否影响 llm-infra 主轴 net-new 判定(本棒 = llm-infra 副分类 net-new 1 件确认)

归入节: §1.(10) 顶会密集部署 + §1.(12) Pipeline + §1.(13) 边界扩展 邻接级新增「PinSieve arXiv:2608.24040 · Production Selective VLM Serving + Governed Memory Flywheel · 企业内容质量 triage grey-zone slice 2.05× more non-actionable items filtered · bounded + stateful + observable + governable 工程哲学」立标池饱和度供给侧 8-26 evening 棒位 唯一 1 件 llm-infra 副分类 net-new


增量 9【后端语言基准 + 推理工程化 · §1.(13) 边界扩展立基础延展邻接级】🟢 PostgreSQL REST API Benchmark July 2026 + Go vs Rust 2026 + Kairos 11 分钟 K8s 升级 + CockroachDB Leader Leases ☆ 低档

来源: jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md(§四 后端语言基准)+ jay/2026-08-26T1105-jay-midday-supplement-database-backend-cloudnative.md(§三 Cloud-Native 8 Kairos + §二 Database-5 CockroachDB)

arXiv: 无 · 厂商官方 + 行业基准

要点:

PostgreSQL REST API Benchmark July 2026(NpgsqlRest · 760 项测试 · 20 个框架): - 测试框架覆盖:Python(Django 6.0.7, FastAPI 0.139.0)· JS/TS(Fastify 5.10.0, Express 5.2.1, Bun 1.3.14, Deno 2.9.2)· Compiled(Go 1.26 net/http, Actix-web + Axum Rust 1.97)· JVM(Spring Boot 4.1.0 on Java 25)· PHP(Swoole 6.2.1 / PHP 8.5)· .NET 10 · PostgREST 14.14 - 关键变化:2026-07 起,单线程事件循环框架(uvicorn、gunicorn、Node cluster)每核运行一个 worker,与多线程运行时(Go、Rust、.NET、JVM)公平对等

Go vs Rust 2026 实战对比: - P99 Latency:基准 · ~18ms(Axum+Tokio+SQLx) - Memory RSS:基准 · ~180MB steady state - 冷启动:~240ms(Axum) - 吞吐量峰值:22k RPS · 22k RES - 学习曲线:上手快(2 天) · borrow checker 陡峭(1 周+) - 高级工程师薪资溢价:+ $20K-$30K - 2026 实际建议:80% 场景 Go 胜出(总拥有成本)· Rust 适合 10-20% 对性能/安全有严格需求的服务 · 混合架构: Go 处理控制平面和 IO 密集型,Rust 处理 CPU 密集型评分/计算

Kairos 11 分钟无人值守 Kubernetes 控制面升级(CNCF 博客 2026-08-17): - 基于 Kairos 构建自我修复的 K8s upgrade pipeline · 无需 SSH 逐一登录节点 - 平台工程自动化方向 · 大规模集群运维参考 - 沿用 §IX 57 §1.(10) 邻接级

CockroachDB Leader Leases:Scalable Leases for Multi-Consensus Groups(SIGMOD Companion 2026): - 消除 per-consensus-group 租约续签流量和 Raft 心跳 · 避免中心化故障点 · 实现快速故障检测和恢复 - 沿用 §IX 57 §1.(10) 邻接级

与活文档关系: §IX 57 §1.(13) 边界扩展 ≥ 141 子轴候选沿用件套 + §1.(10) 顶会密集部署 + §1.(2) 推理调度 + §1.(12) Pipeline 沿用件套;本棒 = §1.(13) 边界扩展 + §1.(10) 顶会密集部署 邻接级 4 件补强(PostgreSQL REST API Benchmark July 2026 + Go vs Rust 2026 + Kairos 11 分钟 K8s 升级 + CockroachDB Leader Leases)

警示: NpgsqlRest 基准测试结果跨厂商一致性需独立核验 · Go vs Rust 80% vs 10-20% 比例数字来源具体引用源

归入节: §1.(13) 边界扩展 + §1.(10) 顶会密集部署 邻接级新增「PostgreSQL REST API Benchmark July 2026(NpgsqlRest 760 项测试 20 个框架)+ Go vs Rust 2026 实战对比(80% 场景 Go 胜出 · Rust 适合 10-20% 性能/安全严格需求)+ Kairos 11 分钟无人值守 K8s 升级(CNCF 博客 2026-08-17)+ CockroachDB Leader Leases(SIGMOD Companion 2026)」


增量 10【CSDN + Substack 8 件工程实战 · §1.(1) + §1.(12) + §1.(13) 沿用件套】🟢 DTCC 2026 阿里云陈宗志 + 2026 技术趋势预测 + 2026 AI Agent 技术趋势预测 8 方向 + AIxFunda 周报 + VLDB 2026 Demo + LFM2.5 QAD + LFM2.5-DSpark ☆ 低档

来源: jay/2026-08-26T1505-jay-five-category-briefing.md(§四 CSDN 3 件 + §六 Substack 2 件)+ jay/2026-08-26-1140-news-x-tech-radar.md(ExtractBench arXiv:2607.29677 + LFM2.5 QAD + LFM2.5-DSpark · 邻接)

arXiv: 无 · CSDN + Substack + Substack 周报

要点:

DTCC 2026 · 阿里云陈宗志 —「数据库决定 AI 能跑多远」(csdn.net/article/2026-08-24/164021044): - AI 进入"下半场":上半场核心是"AI Ready"(为训练准备数据)· 下半场核心是"AI Native"(数据库直接支撑推理) - 多模态数据清洗 + 高性能文件存储 + 向量数据库角色从"AI Ready"转向"推理基础设施" - 阿里云在 DTCC 2026 的核心议题:数据库与 AI 推理的深度融合 - 沿用 §IX 57 §1.(10) 向量 DB 立基础延展 邻接级 ☆

2026 AI Agent 技术趋势预测 8 个确定性方向(CSDN opc.csdn.net/6a36d22d662f9a54cb82324f.html): 1. Agent 原生基础模型成为标配 · 端侧小模型 Agent 渗透率 > 60% 2. 多 Agent 协作网络成为主流 3. RAG → Context Engineering 范式迁移(与 Callstack 文章印证) 4. Graph + RAG 融合 5. MCP 成为 Agent 间通信协议标准 6. AI Agent 安全从"事后检测"转向"开发阶段内置" 7. MLOps → AgentOps 运维范式转变 8. AI Agent 仿真/评测平台涌现

与活文档关系: §IX 57 §1.(1) + §1.(12) + §1.(13) 沿用件套;本棒 = §1.(1) + §1.(12) + §1.(13) 邻接级 8 件补强(DTCC 2026 阿里云陈宗志"数据库决定 AI 能跑多远"+ AI Native vs AI Ready 范式迁移 + 8 个确定性方向)

警示: 8 个确定性方向的"确定性"声明需要具体证据支撑 · 端侧小模型 Agent 渗透率 > 60% 数字来源

归入节: §1.(10) 顶会密集部署 + §1.(12) Pipeline + §1.(13) 边界扩展 邻接级新增「DTCC 2026 阿里云陈宗志(数据库决定 AI 能跑多远 · AI Native 范式)+ 2026 AI Agent 8 个确定性方向(端侧小模型 Agent 渗透率 > 60% · 多 Agent 协作 · RAG → Context Engineering · Graph + RAG · MCP 标准 · AI Agent 安全开发阶段内置 · AgentOps · 仿真/评测平台)」补强


三、值得警惕的矛盾或待核实说法

  1. K8s 1.37 GA 当日 kube-proxy nftables 默认对推理调度延迟影响:jay 8-26 15:05 引用 shattered.io 报道,K8s 官方 release schedule 已确认,但 nftables 模式对推理 Pod 网络性能(特别是 RDMA/InfiniBand)的实测影响需独立基准测试。

  2. OpenCost 1.121.0 与 llm-d 集成的实际部署可行性:jay 8-26 11:05 引用 CNCF 官方博客 IBM Research 工程师撰写,但 v1.121.0 与 llm-d 集成具体是 CRD 形式还是 sidecar 形式需 GitHub 源码核验。

  3. SGLang v0.5.8(2026-01)GB300 NVL72 25× 吞吐提升 vs §IX 57 已锚 SGLang v0.5.18(2026-08-22)的版本跨度:jay 8-26 17:35 Inference.net SGLang Complete Guide 给出 2026-02 实现 25× 数字,而 §IX 57 evening 棒已锚 v0.5.18 2026-08-22 发布;中间版本变更具体内容(从 v0.5.8 到 v0.5.18)需 GitHub release notes 跨版本核验。

  4. TensorRT-LLM 1.3.0rc 移除 TensorRT engine 后端的影响:jay 8-26 17:35 LeetLLM 文章称 1.3.0rc 改为 PyTorch 为唯一执行后端,与 §IX 57 已锚 TensorRT-LLM v1.2.1 Blackwell 原生优化存在架构层面差异;PyTorch-only 后端对生产环境性能(推理延迟、显存占用)的影响需 NVIDIA 官方文档核验。

  5. Chimera arXiv:2608.23553 与 PLAID 的 head-to-head 对照:jay 8-26 15:05 引用 Yanqi Chen + Jielin Liu + Alexandra Meliou + Xiao Yan 2026-08-25 arXiv 新提交,GPU-CPU 协同 multi-vector retrieval 架构,但具体评测数据集 + 对照 PLAID 系统的延迟/召回率数字需 PDF 核验。

  6. pgrust PostgreSQL Rust 重写"已知最大规模 AI 辅助基础设施重写"声明:jay 8-26 11:05 引用 malisper/pgrust,12-20 个并行 coding agent · 2 周合并 280 PR,但"已知最大规模"声明需要具体对比其他 AI 辅助基础设施重写项目(如 InfluxDB IOx Rust 重写)才可成立。

  7. TGI EOL 第三次确认:jay 8-25 evening(LeetLLM)+ 8-26 17:35(LeetLLM 第三方独立)+ §IX 57 evening 棒(TGI EOL 二次确认)= 三次独立确认,TGI 官方 README 明确"只接受 minor bug fix 和文档改进";但 TGI GitHub 仓库是否有具体 EOL 日期(README 截止日)需 HF 官方仓库核验。

  8. VecDB@VLDB 2026 Workshop 论文 OpenReview 公开:jay 8-26 15:05 引用 vecdb-ws.github.io/vldb2026,8-15 所有已接受论文已在 OpenReview 公开,BatANN(分布式磁盘向量搜索)和 HPC-Qdrant 两篇是 Workshop 重点论文;arXiv 全文链接是否可访问需独立核验。

  9. PinSieve arXiv:2608.24040 paper_card 1086 主分类 multimodal 优先级确认:8-26 16:30 入库,副分类 llm-infra;本棒 = llm-infra 副分类 net-new 1 件确认,但 paper_card 主分类规则可能后续被调整为 llm-infra(本棒 = 按当前分类判定的副分类 net-new)。

  10. "vLLM Conference 8-25 Day 1 官方公告核验就绪"延续 §IX 57 状态:jay 8-25 evening 棒已锚入 §IX 57 立基础延展第 7 件 vLLM Conference 8-25 Day 1 窗口关闭 + 官方公告核验就绪,但 Day 1 实际公告内容(State of vLLM 2026 Woosuk Kwon + Zachary Xi Inferact 演讲内容 + NVIDIA 合作 session "DeepSeek and MiniMax Performance" 内容详情)在 8-26 evening 棒位仍未独立核验;需 §IX 58 evening 接力棒核验


四、可引用的 arXiv 号列表(本次净增 7 件 arXiv ID + 1 件副分类 net-new)

arXiv 号 论文/方法 主分类 关联节 本棒补强内容
2608.24040 PinSieve multimodal(副分类 llm-infra) §1.(10) 8-26 evening 棒位唯一 1 件 llm-infra 副分类 net-new · Production Selective VLM Serving + Governed Memory Flywheel · grey-zone slice 2.05× more non-actionable items filtered
2608.23553 Chimera database §1.(10) GPU-CPU 协同 multi-vector retrieval · GPU 高压缩低精度量化码 + CPU 高精度向量 · 8-25 入库
2603.23710 Filter-Agnostic Vector Search on PostgreSQL database §1.(10) SIGMOD 2026 · Google Research · PGVector vs HNSWLib 平均延迟最高差 10×
2606.19803 Policy-aware Vector Search database(risk 副) §1.(10) + §1.(12) SeQureDB '26 @ SIGMOD 2026 Workshop · RAG 多租户 FGAC
2605.15957v1 To GPU or Not to GPU database §1.(10) PostgreSQL 17 + pgvector v0.8.2 + cuVS-enabled FAISS · 数据移动占查询时间 90%+
2603.21354v2 Workload-Router-Pool Architecture inference §1.(12) 2026-03 production incident · AGSERVE + Helium + Continuum + Concur 完整 agent 推理 SRE 套件
2603.20397v1 KV Cache Optimization Strategies inference §1.(3) + §1.(11) 综述 · 7 个实际部署场景分类 · adaptive multi-stage optimization pipeline
2504.11320v4 Optimizing LLM Inference · Fluid-Guided Online Scheduling inference §1.(3) + §1.(11) Eviction 恶性循环 · vLLM recomputation 策略默认
2604.27476v1 EdgeFM inference §1.(13) 边缘 LLM 推理框架 · Flash Attention + Ring Attention + Paged Attention

前轮(§IX 57 + §IX 58 evening)已锚 arXiv 号延续引用,本棒未重复列出:沿用 §IX 57 全部 + §IX 58 evening 新增 9 件(含 PinSieve llm-infra 副分类 net-new 1 件 + 8 件数据库/推理 arXiv 邻接升级)。


五、检查过的来源清单

来源 文件 llm-infra 相关性
inbox/spark/2026-08-25-llm-infra-e1prep.md 8-25 evening 棒(60 KB) 核心基线:§IX 56 → §IX 57 主变更(7 件立基延展 + 4 件邻接级)
inbox/jay/2026-08-26T1105-jay-midday-supplement-database-backend-cloudnative.md 8-26 11:05(14 KB) ★★★:OpenCost 1.121.0 + KubeCon NA 2026 + pgrust + Filter-Agnostic Vector Search + Policy-aware Vector Search + To GPU or Not to GPU + Kairos
inbox/jay/2026-08-26T1505-jay-five-category-briefing.md 8-26 15:05(14 KB) ★★★:VecDB@VLDB 2026 + Chimera arXiv:2608.23553 + K8s 1.37 GA 三大破坏性变更 + Ingress NGINX EOL + K8gb incubating + DTCC 2026 阿里云陈宗志
inbox/jay/2026-08-26T1335-jay-evening-briefing-ai-agents-stack-inference-github-aug26.md 8-26 13:35(14 KB) ★★★:The AI Agents Stack 2026 + LLM Research Papers 2026 List + Workload-Router-Pool Architecture arXiv:2603.21354v2 + KV Cache Optimization Strategies arXiv:2603.20397v1 + EdgeFM arXiv:2604.27476v1 + lws/uzi/olla/matrixhub/BentoML 5 件 GitHub Trending
inbox/jay/2026-08-26T1735-jay-inference-engineering-2026-substack-colpali-sglang-deep-dive.md 8-26 17:35(17 KB) ★★★:LLM Inference Engineering Roadmap 2026 + Why Is Inference Slow and Expensive + TGI EOL 第三方独立二次确认 + SGLang v0.5.8 GB300 25× + TensorRT-LLM 1.3.0rc PyTorch-only + ColPali/ColQwen2 + 2026 Milvus vs Qdrant
inbox/jay/2026-08-26-engineering-e1prep.md 8-26 11:23(19 KB) ★★:Compaction Cliff arXiv:2608.22752 + pgrust + Docker 2900 万密钥 + PatchWrite arXiv:2608.23001 + Filter-Agnostic Vector Search + Policy-aware Vector Search
inbox/jay/2026-08-26-engineering-practice-screening.md 8-26 10:51(7 KB) ★★:PatchWrite + Docker 2900 万密钥 + OpenViking
inbox/jay/2026-08-26T1450-jay-engineering-secondary-filter.md 8-26 14:51(12 KB) ★★:pgrust + OpenCost 1.121.0
inbox/jay/2026-08-26-1140-news-x-tech-radar.md 8-26 11:42(2.9 KB) :ExtractBench arXiv:2607.29677 + LFM2.5 QAD + LFM2.5-DSpark(邻接)
inbox/jay/2026-08-26T1220-jay-csdn-highvalue-rag-agent-finetuning-stack.md 8-26 12:21(8.4 KB) :LangGraph 入门 + AI Agent 全景图 2025-2026 + Context Engineering 四操作 + Anthropic 多 Agent 90.2%(邻接)
inbox/jay/2026-08-26T1620-jay-csdn-agent-harness-deepread-highvalue.md 8-26 16:23(8 KB) :Agent Harness Deep Read(邻接)
inbox/spark/2026-08-26-agent-e1prep.md 8-26 13:36(38 KB) :paper_cards 1069-1085 沿用 + PatchWrite + ExtractBench + Context Engineering(邻接)
inbox/flyp/2026-08-26-risk-e1prep.md 8-26 16:38(41 KB) :Compaction Cliff arXiv:2608.22752 副分类 risk + Policy-aware Vector Search 邻接级 + MCP 安全专题沿用
inbox/tom/2026-08-26-evaluation-e1prep.md 8-26 15:43(27 KB) 0(evaluation 主轴 · 邻接沿用)
inbox/tom/2026-08-26-rag-e1prep.md 8-26 08:53(26 KB) 0(rag 主轴 · 邻接沿用)
inbox/stephen/2026-08-26-1245-stephen-coordination-check-noon.md 8-26 12:46(8 KB) 0(协调棒 · llm-infra 间接)
inbox/stephen/2026-08-26-ai-industry-e1prep.md 8-26 10:26(52 KB) 0(frontier lab 动态 · llm-infra 间接)
paper_cards/1086-2608-24040.md PinSieve(8-26 16:30 入库) ★★★:8-26 evening 棒位唯一 1 件 llm-infra 副分类 net-new
paper_cards/1077-2608-22752.md Compaction Cliff(8-26 14:00 入库) (主分类 agent · 副分类 risk)
paper_cards/1085-2608-22510.md ClawProBench(8-26 14:00 入库) 0(主分类 evaluation · 副分类 agent)
organized/knowledge/llm-infra.md §IX 57th 8-25 18:00 落定(157 行 · 15 KB) 核心基线

六、§IX 58 接力棒关注建议

  1. K8s 1.37 GA 当日 kube-proxy nftables 默认实测对推理调度延迟影响:§IX 58 接力棒核验 shattered.io 报道具体实测数据 + 与 IPVS 模式对比

  2. OpenCost 1.121.0 与 llm-d 集成 CRD 形式独立核验:§IX 58 接力棒核验 GitHub 源码 + 与 NVIDIA Dynamo 1.4.1 关系(独立集成 vs 互补集成)

  3. vLLM Conference 8-25 Day 1 官方公告核验:State of vLLM 2026 Woosuk Kwon + Zachary Xi Inferact 演讲内容 + NVIDIA 合作 session "DeepSeek and MiniMax Performance" 内容详情 = §IX 57 evening 棒位 7 件立基延展第 7 件 vLLM Conference 8-25 观察窗口关闭的官方公告核验就绪(§IX 58 接力棒完成)

  4. SGLang v0.5.8 → v0.5.18 跨版本变更核验:jay 8-26 17:35 Inference.net SGLang Complete Guide + LeetLLM 数据 + §IX 57 已锚 v0.5.18 = 跨 7 个版本的中间变更需 GitHub release notes 系统梳理

  5. TensorRT-LLM 1.3.0rc PyTorch-only 后端架构变化:与 §IX 57 已锚 TensorRT-LLM v1.2.1 Blackwell 原生优化的关系 = NVIDIA 官方文档核验 PyTorch-only 后端性能(推理延迟 + 显存占用)

  6. Chimera arXiv:2608.23553 PDF 精读:GPU-CPU 协同 multi-vector retrieval + 与 PLAID head-to-head 对照数据 + GitHub repo 状态

  7. PinSieve arXiv:2608.24040 全文 PDF 精读:企业内容质量 triage + Governed Memory Flywheel 设计 + grey-zone slice 路由算法

  8. OpenCost MCP Server v1.118 起:CN incubating 项目内置 MCP server + 与 Anthropic MCP SDK 关系(独立 MCP 实现 vs 复用 Anthropic SDK)

  9. 立标池饱和度 v57 → v58 第 5 日稳态延续:8-25 evening → 8-26 evening 窗口 1 件 llm-infra 副分类 net-new(PinSieve paper_card 1086)+ 14 件立基础延展邻接级 net-new(K8s 1.37 GA + KubeCon NA 2026 + OpenCost 1.121.0 + Ingress NGINX EOL + Workload-Router-Pool Architecture + TGI EOL 二次确认 + SGLang v0.5.8 + TensorRT-LLM 1.3.0rc + 5 件 K8s LLM 推理 GitHub Trending + LLM Inference Engineering Roadmap + Why Is Inference Slow and Expensive + Optimizing LLM Inference + EdgeFM + Chimera + To GPU or Not to GPU + Filter-Agnostic Vector Search + Policy-aware Vector Search + pgrust + 2026 Milvus vs Qdrant + VecDB@VLDB 2026 + ColPali/ColQwen2)

  10. 推理工程学科化第 9 维 78 → ≥ 78 件套扩面沿用:§IX 57 evening 棒位 78 件套扩面 + §IX 58 evening 棒位 14 件立基础延展邻接级 = 推理工程学科化第 9 维 78 件套沿用 + 边界扩展 ≥ 141 子轴候选扩面

  11. Cross-Instance 跨实例标签二档法沿用:§IX 57 跨实例 2 源独立交叉 ✓ 模式(主棒 + 跨实例 jay 8-26 11:05 + 13:35 + 15:05 + 17:35 + flyp 8-26 16:38 + spark 8-26 13:36 + stephen 8-26 12:46 = 5+ 源独立交叉 ✓)

  12. 立标等级判定四档法首次传染到活文档主线沿用:★ 中-高档 0 件 · ★ 中档 5 件 · ☆ 低档 9 件 · 观察信号 0 件

  13. v57 → v58 立标池饱和度供给侧 v57 第四次稳态延续:主分类 paper_card 净增 0 件 · llm-infra 副分类 1 件 net-new(PinSieve arXiv:2608.24040 paper_card 1086)+ K8s + CNCF 立基础延展 3 件(K8s 1.37 GA + KubeCon NA 2026 AI Inference Track + OpenCost 1.121.0)+ 推理框架版本治理立基础延展 2 件(TGI EOL 二次确认 + TensorRT-LLM 1.3.0rc PyTorch-only)+ 向量 DB 立基础延展邻接级 3 件(Chimera + To GPU or Not to GPU + Filter-Agnostic Vector Search SIGMOD 2026)+ 推理 SRE 立基础延展邻接级 1 件(Workload-Router-Pool Architecture)+ K8s LLM 推理 GitHub Trending 立基础延展邻接级 5 件(lws / uzi / olla / matrixhub / BentoML)"七锚点


七、无显著新增量的领域(如实说明)

以下领域在本 8-25 evening → 8-26 evening 窗口确认无新增量或与 §IX 57 evening 棒位重叠,不重复列出:

  • §IX 57 evening 棒 7 件立基础延展:MCP 安全专题主轴(沿用 · no new CVE)+ 4 件 KV Cache 优化邻接级(ChunkKV/OBCache/LLM-AnDPro/HCAttention · 沿用)+ TurboQuant 数字矛盾闭合(沿用 · 数字矛盾闭合判定)+ HotInfra 2026 CXL+PIM 二次升级(沿用)+ 推理框架版本治理立基础延展(本棒 = TensorRT-LLM 1.3.0rc PyTorch-only + SGLang v0.5.8 GB300 25× 二次确认 + TGI EOL 二次确认补强)+ llm-d CNCF Sandbox + ai-dynamo/dynamo + K8s HPA LLM(沿用 · no new GitHub ★)+ 向量 DB 选型决策树 50M 分水岭 + PostgreSQL 18.6 + pgvector 0.8.0 + MySQL 9.7.1 + PG 14 EOL(本棒 = pgrust + Chimera + Filter-Agnostic Vector Search + Policy-aware Vector Search + To GPU or Not to GPU + 2026 Milvus vs Qdrant 邻接级补强)
  • §IX 56 evening 棒 5 件立基础延展:沿用 §IX 56 全部(FlashPrefill V2 H200 FP8 47.26× + vLLM Conf 8-25 Roadmap Q3 + Photon 2.0 + 3 件 KV Cache 新论文邻接升级 + TGI EOL + Stripe 73% + H100 三方新源)
  • §IX 55 evening 棒 8 件立基础延展:沿用 §IX 55 全部
  • §IX 54 evening 棒 30+ 件:沿用 §IX 54 全部(含 FlashPrefill V2 + InferScale + Online KV Cache Compaction + DualPath + CVE trio + Particula Tech H100 + Schema 7× + TGI 维护 + AI Agents Stack + Chain-of-Experience + Cross-Model KV Cache Transfer + OasisKV + HotInfra'26 PIM-DIMM + ServerMO + vLLM 0.27.0)
  • §IX 53 evening 棒 30+ 件:沿用 §IX 53 全部
  • §IX 52 evening 棒 18 件:沿用 §IX 52 全部
  • §IX 51 evening 棒 16 件:沿用 §IX 51 全部
  • §IX 50 evening 棒 13 件:沿用 §IX 50 全部
  • §IX 49 evening 棒 12 件:沿用 §IX 49 全部
  • §IX 48 evening 棒 15 件:沿用 §IX 48 全部
  • §IX 47 evening 棒 15 件:沿用 §IX 47 全部
  • §IX 45-46 evening 棒 28 件:沿用 §IX 45-46 全部
  • §IX 44 evening 棒 14 件:沿用 §IX 44 全部
  • §IX 41-43 evening 棒 33 件:沿用 §IX 41-43 全部
  • §IX 35-40 evening 棒 30+ 件:沿用 §IX 35-40 全部
  • 8-25 evening → 8-26 evening 窗口 paper_cards 主分类 llm-infra 净增:0 件(连续第 4 零新增日 · 沿用 §IX 56/57 立标池饱和度)
  • 8-25 evening → 8-26 evening 窗口 paper_cards 副分类 llm-infra 净增:1 件 = PinSieve arXiv:2608.24040 paper_card 1086(8-26 16:30 入库 · 主分类 multimodal)

八、跨领域交叉提示(供相关主题活文档参考)

以下发现对 llm-infra 主轴有交叉或邻接价值,建议相关主题活文档负责 agent 留意:

  • PinSieve arXiv:2608.24040 paper_card 1086(主分类 multimodal · 副分类 llm-infra):同时涉及 multimodal 和 llm-infra 主题;建议 multimodal 主题活文档确认是否已覆盖企业级 VLM Serving + Governed Memory Flywheel 方向
  • Compaction Cliff arXiv:2608.22752 paper_card 1077(主分类 agent · 副分类 risk):同时涉及 agent 推理(长时运行)和 risk(记忆压缩安全);agent 主轴已锚定,llm-infra 邻接级标注(长时 Agent 推理的 KV Cache / 上下文压缩工程)
  • pgrust GitHub malisper/pgrust(无 arXiv):同时涉及 database / llm-infra / agent 主题;展示 AI coding agent 在大型基础设施重写的实证能力(12-20 并行 agent 2 周合并 280 PR);建议 database 主题活文档确认是否已覆盖 PostgreSQL Rust 重写方向
  • OpenCost 1.121.0 与 llm-d 集成(无 arXiv):同时涉及 llm-infra(推理成本追踪)和 cloud-native(K8s 成本管理)主题;llm-d CNCF 立基础延展第 6 件已锚定
  • Chimera arXiv:2608.23553(主分类 database):同时涉及 vector DB / RAG multi-vector retrieval 和 llm-infra(GPU-CPU 协同硬件感知推理)主题;建议 database 主题活文档确认是否已覆盖 multi-vector retrieval GPU 加速方向
  • Policy-aware Vector Search arXiv:2606.19803(主分类 database · 副分类 risk):同时涉及 database / RAG 安全 / llm-infra(向量 DB 选型决策树)主题;risk 主题活文档已锚定(R54 跨主题审稿链预备 4 件)
  • K8s 1.37 GA + KubeCon NA 2026 AI Inference Track(无 arXiv):同时涉及 K8s / llm-infra 主题;cloud-native 主题活文档已锚定
  • PostgreSQL REST API Benchmark July 2026(无 arXiv):同时涉及 backend / database / llm-infra 主题;backend 主题活文档已锚定(Go vs Rust 2026 对比)

Spark · 2026-08-26 17:30 CST · E1 llm-infra 预消化轮(8-26 evening 棒 · §IX 58 接力备料)· 窗口 8-25 18:00 → 8-26 17:30 CST(约 23.5h)