llm-infra · E1 预消化简报(2026-08-30)

实例:spark · llm-infra 主题 E1 日间预消化轮 · cron 3c698927-9044-4540-873b-f961d6380d7d 生成时间:2026-08-30 18:40 CST 窗口期:2026-08-29 18:40 → 2026-08-30 18:40(约 24h) 基线活文档organized/knowledge/llm-infra.md §IX 72(2026-08-30 22:00 evening 已立基础延展 + 2 件 NET-new arXiv 锚入 + Hot Chips 2026 HBF + SGLang v0.6/DFlash 2 + vLLM NVFP4 FlashInfer + KubeCon NA 2026 五联预备 + 213 → 215 arXiv + 246 URL)

基线 E1 报告: - inbox/spark/2026-08-28-llm-infra-e1prep.md(8-28 evening 棒位 · 48 KB · §IX 60 锚入后 24h 立标延续型棒 · arXiv:2608.26070 Prefix Sliding 立基延展 19 锚点候选 + C²KV 误标 3 实例警示 + Densing Law/Scaling Creative Writing 分类存疑 2 件) - 8-29 evening 棒位 §IX 71 落定后,8-29 当晚无 spark llm-infra e1prep 落盘(v66 主轴协调棒已覆盖 8-29 evening 全部 llm-infra 主轴 + 5 件邻接级预备 · MAX + SK Hynix HBF + MATS Research + CritICL + UPHELD) - inbox/spark/2026-08-30-agent-e1prep.md(8-30 13:30 CST · 13 KB · v66 主轴协调棒预备 · 与 llm-infra 主轴邻接 = Cameron Wolfe "Agentic World Models" 训练目标侧 = 第 21+例评测方法学延革预备)


状态

  • 增量条数7 条主增量(含 4 条 llm-infra 主轴 NET-new 候选预备 + 2 条 llm-infra 邻接级补强 + 1 条评测方法学延革预备)+ 2 条工程实践补强
  • 本棒性质"§IX 72 立基础延展 + 8-30 afternoon 工程实践补强型棒" —— 8-29 evening → 8-30 18:00 期间 jay 早场/上午/下午/傍晚 4 份简报带来大量 llm-infra 工程实践补强内容(vLLM.cpp + K8s 生产部署 + HPA + 引擎选型 + MLSys 2026 论文),其中 5 件已在 §IX 72 evening 棒位(2026-08-30 22:00,已沿用)锚入;本棒 = §IX 72 落定前的 afternoon 补强层 —— 重点提示 §IX 73 evening 棒位预备时纳入的 5 件 afternoon NEW 与 2 条与 vIX 72 evening 不重叠的 jay 早场 CSDN 主增量
  • 涉及 arXiv 号:净增 5 件主轴预备(arXiv:2604.05012 + arXiv:2604.19157 + arXiv:2608.26530 PILOT in the Loop + arXiv:2608.27455 CritICL + arXiv:2608.19269 Inspect Evals Census)+ arXiv:2607.08057(KV Cache ACL 2026 综述 · paper_card 待补建)+ arXiv:2608.01526 Internet for KV Cache(沿用 §IX 60/67)

一、本棒检查过的来源清单(不硬凑字数)

1.1 work-queue.md(2026-08-30 18:00 自动生成)

  • 待建卡 0 · 待更新活文档 0(全部最新)· 选题榜未成视频脚本 1 件 = arXiv:2608.26070(Prefix Sliding · 沿用 8-28 llm-infra e1prep §IX 60 锚入)· 富化缺口 15 张卡缺 TLDR · 待精确分类 0 张
  • 视图干净 · llm-infra 主轴未触发"高价值待深度解读"或"攻略待写"信号 → 本棒按"§IX 72 evening 棒位预备 + 8-30 afternoon 工程实践补强 + 评测方法学延革预备"原则落笔

1.2 inbox/jay 8-29 evening → 8-30 afternoon 全棒位(17 份简报 5 主题)

  • 8-29 evening 棒位
  • inbox/jay/2026-08-29T2100-jay-evening-inference-stack-substack-acm-survey-2026.md(MAX Modular AI 第三引擎 · ACM TIST 2026 Park et al. 综述 · Fish Audio Blog · 5 件 Substack · 已锚入 §IX 67 + §IX 72)
  • inbox/jay/2026-08-29T2205-jay-night-supplement-bytebytego-hbf-kvcache-upheld.md(ByteByteGo EP223 决策树 + llama.cpp 6 漏洞 + SK Hynix HBF + MATS Research 加密推理窃取 arXiv:2608.09867 + UPHELD arXiv:2608.21281v1 + KV Cache 五族 · 已锚入 §IX 67/68/72)
  • 8-30 全天棒位(5 份高密度简报):
  • inbox/jay/2026-08-30T0820-jay-csdn-highvalue-inference-finetuning-architecture.md(CSDN 早场 6 条:vLLM v0.20.0 五层架构 + SGLang 社区贡献指南 + LLaMA-Factory + Ollama 全流程 + vLLM/SGLang 横评选型 + vLLM/SGLang 混合模型 KV Cache 管理 = 6 件 CSDN 高价值主增量预备
  • inbox/jay/2026-08-30T1130-jay-engineering-filter.md(SGLang DFlash 2 + Spec V2 + SGLang v0.6 + vLLM NVFP4 FlashInfer 强制依赖 + 四引擎横评 + Agent 调试平台 + KV Cache 工程化五大家族 + AI Engineer 薪资 + Substack 高价值工程洞察 = 5 件核心主增量 + 3 件工程实践补强,其中前 3 件已锚入 §IX 72)
  • inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(vLLM/SGLang/LMDeploy/TensorRT-LLM 四路横评 + 500+ LLM 推理优化全景图 + 10 大向量库 benchmark + AussieAI 维护 700+ 项推理优化技术 + eBPF 2026 + KubeCon NA 2026 + The AI Engineer AI Agents Stack 6 层 + ByteByteGo 5 趋势 + Nathan Benaich State of AI April 2026 + ACL 2026 KV Cache 系统化综述 arXiv:2607.08057 = 5 件主增量 + 5 件工程实践补强,其中 5 件已锚入 §IX 72)
  • inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md本棒最关键源 = 9 条高价值 = SitePoint vLLM K8s 生产部署 + Kubenatives HPA 真实 YAML + DevOpsBeast vLLM vs SGLang 2026 生产横评 + Spheron SGLang systemd service 真实 unit + arXiv:2604.05012 KV Cache 实证横评 + arXiv:2604.19157 SAW-INT4 Hessian-aware 4-bit KV 量化 + vLLM.cpp mudler/vllm.cpp v0.0.2 + MLSys 2026 三件套 + GitHub llama.cpp #15180 = 9 件下午傍晚主增量
  • inbox/jay/2026-08-30T1505-jay-evening-kubecon-aiinfra-kvcache-2026papers.md(KubeCon NA 2026 AI Inference + Agentic Track + GKE AI Zones + TPU Subslicing + llm-d/KAI/DRA 三件套 + TGI 维护模式确认 + SGLang v1.2.1 + 向量库 2026 benchmark + arXiv:2608.01526 Internet for KV Cache + arXiv:2607.17715 C²KV + arXiv:2606.21238 Adaptive KV Caching + arXiv:2606.02964 AsymCache + GitHub Trending + Substack Agentic AI 工程洞察 = 5 件已锚入 §IX 72 + 2 件 8-30 主增量预备

1.3 inbox/tom 8-29 evening → 8-30 全棒位(llm-infra 主轴 + 邻接)

  • inbox/tom/2026-08-29-inference-e1prep.md(8-29 06:10 → 22:20 · 16h 窗口 · 6 条主线索含 MATS Research + MAX + SK Hynix HBF + UPHELD + ByteByteGo EP223 + KV Cache 五族 = 5 件已锚入 §IX 72
  • inbox/tom/2026-08-30-rag-e1prep.md(8-30 08:50 CST · 6 条主增量含 SoK Agentic RAG arXiv:2603.07379 + A-RAG arXiv:2602.03442 + DSPrompt arXiv:2608.16536 + Intent-Guided Decoding arXiv:2608.16515 + Hypergraph M-RAG arXiv:2608.16628 + Legal RAG Hallucination arXiv:2608.14210 = 全部 RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/tom/2026-08-30T0840-agent-rag-longcontext-radar.md(8 件候选 = Agentic Game Dev 133▲ + PILOT in the Loop 27▲ + Procedura 10▲ + CritICL 8▲ + Luce 7▲ + TacForcing 5▲ + EditaLive! 3▲ + Inspect Evals Census 2▲ · PILOT in the Loop arXiv:2608.26530 + CritICL arXiv:2608.27455 + Inspect Evals Census arXiv:2608.19269 三件与 llm-infra 主轴邻接
  • inbox/tom/2026-08-30-0900-hf-daily-2026-08-30.md(15 件候选 · llm-infra 主轴 0 件 · multimodal 主轴 = VoiceMem 166▲ / VGI-Bench 170▲ / WarpSAC 135▲ / Agentic Game Dev 134▲ = llm-infra 邻接级 4 件)

1.4 inbox/flyp 8-29 evening → 8-30 上午棒位

  • inbox/flyp/2026-08-29-agentic-rag-sok-arag.md(SoK Agentic RAG arXiv:2603.07379 精读 · agent 主轴 · llm-infra 邻接)
  • inbox/flyp/2026-08-30-0950-Substack-Cameron-Wolfe-Agentic-World-Models-critical-read.md本棒邻接级核心 = Cameron Wolfe "Agentic World Models" Substack 精读 · world modeling 作为 agentic RL dense supervision = hybrid objective = GRPO + observation token prediction loss = 与 Agentic Game Dev + WarpSAC + VoiceMem 三向耦合 = v33 以来评测方法学延革第 22+例预备候选 · paper_card 待建)
  • inbox/flyp/2026-08-30-1550-ssm-hybrid-long-context-bench-critical-read.md(SSM 混合长上下文 benchmark · multimodal/architecture 主轴 · llm-infra 邻接)
  • inbox/flyp/2026-08-30-multimodal-e1prep.md(multimodal 主轴 11 件预备 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-30-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件)

1.5 inbox/stephen 8-29 evening → 8-30 noon 协调棒

  • inbox/stephen/2026-08-29-2245-stephen-coordination-check-evening.md(8-29 evening 协调棒 · 9 件 net-new 候选预备 · 含 MATS Research + MAX + SK Hynix HBF + 5 件 CVE 高危 = 已锚入 §IX 72
  • inbox/stephen/2026-08-30-1245-stephen-coordination-check-noon.md(8-30 noon 协调棒 · 簇 8 = SGLang DFlash 2 + Spec V2 + SGLang v0.6 + vLLM NVFP4 FlashInfer + 四引擎横评 + AI Agents Stack = 5 实例 5 时间点 = 已锚入 §IX 72
  • inbox/stephen/2026-08-30-ai-industry-e1prep.md(ai-industry 主轴 5 件主增量 + 1 件邻接 · 0 件 llm-infra 主轴净增

1.6 inbox/spark 8-29 → 8-30 早盘 RSS

  • inbox/spark/2026-08-30-1000-rss-gradient-flow.md(5 篇 = Agents 做实际工作 9 规则 + HBF 与分层内存 + AI 数据中心反弹盲点 + 最大 AI 风险位于模型之外 · HBF = 沿用 §IX 72 Hot Chips HBF 三源闭合
  • inbox/spark/2026-08-30-1001-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-30-1003-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-29-1001-rss-gradient-flow.mdHBF 与分层内存(沿用)+ Agents 9 规则

1.7 paper_cards 库抽查(2026-08-28 → 2026-08-30 三天新卡)

  • 主分类 llm-infra = 4 件
  • paper_card 1117-2608-26070 Prefix Sliding for efficient test-time scaling(2026-08-28 15:00 入库 · 已锚入 §IX 60 立基延展 19 锚点候选)
  • paper_card 1128-2001-08361 Scaling Laws for Neural Language Models(OpenAlex backfill 旧论文 · 1133 件库增量 · 影响因子 8863 S2 被引 · §IX 73 沿用预备
  • paper_card 1129-2608-27455 CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes(2026-08-29 入库 · 形态 method · S2 被引 1 · 8-30 NET-new 主增量
  • paper_card 1133-2608-19269 What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals(2026-08-29 入库 · 形态 position · 副分类 evaluation · 8-30 NET-new 主增量
  • 主分类 multimodal = 12 件(与 llm-infra 邻接级 4 件 = VoiceMem + VGI-Bench + Agentic Game Dev + WarpSAC · 见 §1.4)
  • 主分类 agent = 8 件(含 PILOT in the Loop arXiv:2608.26530 paper_card 1121 · 2026-08-28 入库 · 8-30 邻接级补强

1.8 organized/topic_pages/llm-infra.md + organized/knowledge/llm-infra.md

  • topic_pages/llm-infra.md(320 行 · 代表材料时间从 6-17 至今 · 结构 = 代表材料列表 · 主索引)
  • knowledge/llm-infra.md(471 行 · 14 节 = §0 / §1.(1-12) / §2.13 / §3 / §4 / §5 / §6 / §7 / §8 · §IX 72 morning 棒位已锚入全部 24h 内 llm-infra 主轴 · 本棒 = §IX 73 evening 棒位预备)

二、最重要的 7 条主增量


增量 1【§1.(1) 推理引擎 CPU/边缘生态 NET-new · 8-30 afternoon】🟢 vLLM.cpp mudler/vllm.cpp v0.0.2 —— vLLM 等效跨后端推理引擎 ★★★★

  • 来源inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md §7(⭐⭐⭐⭐ 高价值保留 · 活跃社区维护 · GitHub 持续更新)
  • 来源链接https://github.com/mudler/vllm.cpp

要点:

核心特性: - 2026-08 v0.0.2 发布:8 种 server archives(CPU / CUDA / Vulkan / Metal / MLX)—— 跨后端 vLLM 等效推理引擎 - MXFP4 量化:Qwen3-8B 在 W4A16 Marlin 模式下,token 生成 45.45 vs vLLM oracle 41.94 tok/s(vLLM.cpp 更快) - 支持 MiniMax-Music3 音乐生成(POST /v1/audio/speech)+ LTX-2.5 视频音频 pipeline - 与 vLLM token 对 token 一致性验证通过(关键质量保证) - 独立社区项目(非 vLLM 官方)· 由 mudler 维护

关键意涵: - §IX 73 NET-new 候选预备 · 推理引擎 7 足鼎立格局(vLLM + SGLang + TensorRT-LLM + MAX + LMDeploy + Aphrodite + vLLM.cpp)的 第 8 件 NET-new 候选 - 与沿用 §IX 67 MAX(Mojo 内核非 CUDA)+ §IX 72 SGLang v0.6/DFlash 2 + vLLM v0.27.1/v0.28 MRV2 + Aphrodite Engine drop-in + LMDeploy + TensorRT-LLM 1.3.0rc = §1.(1) 推理引擎完整选型矩阵扩面预备 - 边缘 / CPU 推理场景的 vLLM 等效替代(与 llama.cpp / Ollama 互补)= §IX 67 决策树扩展(MAX 非 NVIDIA → vLLM.cpp 跨后端 vLLM 等效) - 与 ByteByteGo EP223 决策树 + SesameDisk 100 并发基准(vLLM ~920 tok/s vs Ollama ~155 tok/s)+ GitHub llama.cpp #15180 vLLM vs llama.cpp benchmark(Qwen2.5-3B 1 req 10240 prompt llama.cpp -5.5% · 16 并发 vLLM 快 25%)共同构成"推理引擎跨后端选型矩阵"完整补强

与活文档现有脉络的关系: - §1.(1) 推理引擎 + §IX 67 R10-R16 + §IX 72 增量 沿用 · vLLM.cpp 是 NET-new 第 8 件候选 - 与 §IX 65 Aphrodite Engine(vLLM fork drop-in)+ §IX 66 SGLang v0.5.18/vLLM v0.27.1 + §IX 67 MAX + §IX 71 vLLM v0.28 MRV2 + §IX 72 SGLang v0.6 + vLLM.cpp = §1.(1) 推理引擎七足 → 八足鼎立格局预备 - 与 §1.(2) 推理调度(K8s/llm-d/KAI/DRA)+ §IX 72 KubeCon NA 2026 AI Inference + Agentic Track 沿用件套 + SitePoint vLLM K8s 生产部署指南 = CPU/边缘场景推理引擎补强

警示: - ⚠️ P2:vLLM.cpp = 社区项目(非官方)· 长期维护可持续性待评估 - ⚠️ P2:vLLM oracle 41.94 vs vLLM.cpp 45.45 tok/s 的测试硬件/批次/上下文长度需核验 - ⚠️ P2:8 种 server archives 的实际生产可用性差异(CPU/CUDA 路径较成熟,Vulkan/Metal/MLX 路径成熟度参差)需核实

建议归入节: §1.(1) 推理引擎(NET-new 第 8 件候选预备 · vLLM 等效跨后端推理引擎 · 8 种 server archives · MXFP4 量化 · 与 MAX + Aphrodite + LMDeploy + TensorRT-LLM 共同构成全场景选型矩阵)+ §1.(12) End-to-End Pipeline (ii) Engine 沿用件套扩增 + §3.3 Q105.172 候选新增


增量 2【§1.(2) 推理调度 K8s 生产部署 NET-new · 8-30 afternoon】🟢 vLLM K8s 生产部署完整指南(SitePoint 2026 + Kubenatives HPA 真实 YAML)★★★★★

  • 来源inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md §1(SitePoint)+ §2(Kubenatives · ⭐⭐⭐⭐⭐ 高价值)
  • 来源链接https://www.sitepoint.com/vllm-production-deployment-guide-2026 + https://www.kubenatives.com/p/how-vllm-serves-models-kubernetes

要点:

SitePoint vLLM K8s 生产部署指南(2026)核心内容: - 完整 Deployment YAML(含 runtimeClassName: nvidia + NVIDIA RuntimeClass 配置) - topologySpreadConstraints GPU 打散策略(maxSkew: 1 · 按 kubernetes.io/hostname 分布) - HPA 配置参考(基于 vllm:num_requests_runningvllm:num_requests_waiting Prometheus metric) - NetworkPolicy 限制 vLLM Pod 只能被反向代理访问,禁止其他 workloads 直连 - Secret 管理真实命令:kubectl create secret generic hf-secret --from-literal=token=$HF_TOKEN - Prometheus metrics 端点注解(prometheus.io/scrape: true, port 8000, path /metrics) - gRPC 部署:pip install vllm[grpc] · 替换 httpGet 为 Kubernetes 原生 gRPC probes(1.24+) - 生产环境 --disable-log-requests(关闭请求 Payload 日志)· 保留 --log-stats - VLLM_API_KEY 环境变量 / --api-key 双向认证

Kubenatives HPA 真实 YAML 关键参数: - HPA 真实 metric 名:vllm_num_requests_waiting(Waiting 队列长度作为扩容信号) - HPA scaleDown 策略:stabilizationWindowSeconds: 600(10 分钟冷却)· 每次最多缩容 1 Pod · 周期 5 分钟 - HPA scaleUp 策略:每分钟最多加 2 Pod - 关键判断阈值:vllm:gpu_cache_usage_perc > 90% 即将触发 preemption · > 95% 需要降 max-num-seqs 或加 GPU - vllm:num_requests_running 持续等于 max-num-seqs → 饱和 · 需扩容

关键意涵: - §1.(2) 推理调度 K8s 生产部署完整 YAML 模板预备 · 与沿用 §IX 67 K8s 1.37 GA + §IX 72 KubeCon NA 2026 AI Inference + Agentic Track + OpenCost 1.121.0 + Spheron K8s GPU Orchestration DRA + KAI Scheduler + MLflow K8s AI Serving + KServe v0.17 + vLLM Conf 8-25 Roadmap Q3 + Cold Start Q3 = K8s 生产部署完整工程补强 - SitePoint + Kubenatives 真实 YAML 可作为生产部署基线模板 · 适合整合为"K8s vLLM 部署专题页" - HPA metric name vllm_num_requests_waiting 需要在生产环境中验证(部分 vLLM 版本 metric 名称可能不同)

与活文档现有脉络的关系: - §1.(2) 推理调度 + §IX 67-72 沿用 + SitePoint + Kubenatives 真实 YAML 是 §IX 73 evening 棒位预备的关键工程级补强 - 与 §IX 67 K8s 1.37 GA + §IX 72 KubeCon NA 2026 + OpenCost 1.121.0 + llm-d CNCF Sandbox + ai-dynamo + KServe v0.17 + vLLM Conf 8-25 = "K8s 推理调度"工程级完整路径 - 与 §IX 58 Workload-Router-Pool + §IX 60 NVIDIA Grove K8s CRD + §IX 66 K8s HPA LLM 邻接级 ☆ = K8s vLLM 生产部署真实 YAML 第 1 件

警示: - ⚠️ P1:HPA metric name vllm_num_requests_waiting 与 §IX 65 Spheron 三引擎 + §IX 67 Kubenatives "K8s HPA LLM" 命名是否完全一致(不同 vLLM 版本 metric 名可能不同)需核验 - ⚠️ P2:SitePoint YAML 中 gRPC probes 的 K8s 版本要求(1.24+)与生产集群版本对照

建议归入节: §1.(2) 推理调度(NET-new · SitePoint + Kubenatives 真实 K8s vLLM 生产部署 YAML 模板 · HPA metric name + NetworkPolicy + gRPC probes + topologySpreadConstraints GPU 打散)+ §IX 73 evening 棒位预备


增量 3【§1.(1) 推理引擎选型 NET-new · 8-30 afternoon】🟢 SGLang vs vLLM 2026 生产横评(DevOpsBeast + Spheron systemd unit)★★★★

  • 来源inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md §3(DevOpsBeast)+ §4(Spheron)
  • 来源链接https://devopsbeast.com/blog/vllm-vs-sglang-production-2026 + https://www.spheron.network/blog/sglang-production-deployment-guide

要点:

DevOpsBeast vLLM vs SGLang 2026 生产横评: - RadixAttention 是 SGLang 最强差异点:共享前缀 >60% 的输入 token 时,prefix cache hit rate 比 vLLM 高 2-3× - 典型 chat workload(H100 + Llama-70B FP16/FP8),vLLM vs SGLang 吞吐量差距 10-20% - SGLang 胜出场景:chatbot / RAG / agent(共享前缀多)· prefix caching 命中率高 - vLLM 胜出场景:新模型支持速度(vLLM 通常几天内支持新模型,SGLang 滞后 1-4 周)· 多 LoRA 生产级加载 · 大规模分布式(pipeline + tensor parallelism)· 生产久经考验 - SGLang 适合 agentic 低延迟交互 · vLLM 适合高吞吐批量推理 - 多 LoRA:vLLM 的 multi-LoRA serving(多个 adapter 热加载、adapter rotation)更成熟

Spheron SGLang 生产部署真实 systemd service unit 文件:

[Unit]
Description=SGLang Inference Server
After=docker.service
Requires=docker.service
[Service]
Restart=always
RestartSec=5
ExecStartPre=-/usr/bin/docker rm -f sglang
ExecStart=/usr/bin/docker run --name sglang --gpus all --ipc=host -p 8000:8000 \
  -e HUGGING_FACE_HUB_TOKEN=*** \
  lmsysorg/sglang:v0.5.9-cu130-runtime \
  python -m sglang.launch_server \
  --model-path meta-llama/Llama-3.3-70B-Instruct \
  --quantization fp8 \
  --context-length 8192 \
  --mem-fraction-static 0.92 \
  --enable-metrics \
  --host 0.0.0.0 \
  --port 8000
ExecStop=/usr/bin/docker stop sglang
[Install]
WantedBy=multi-user.target
  • --mem-fraction-static 0.92:静态 KV cache 内存占比(vLLM 等效参数对标 gpu_memory_utilization
  • --enable-metrics:开启 Prometheus metrics
  • TGI 迁移指南:每个 TGI flag 有对应 SGLang 等效 flag

关键意涵: - §1.(1) 推理引擎选型 NET-new 补强 · 与沿用 §IX 66 §1.(1) SGLang v0.5.18/vLLM v0.27.1 + §IX 67 R10-R16 MAX 第三引擎 + §IX 72 SGLang v0.6/DFlash 2 + Spheron 60% 前缀复用率阈值 + DevOpsBeast 60% RadixAttention 优势 2-3× + vLLM 多 LoRA 成熟 = 选型决策树补强 - §IX 73 evening 棒位预备:60% 前缀复用率阈值 + DevOpsBeast 2-3× prefix cache hit rate 优势 + vLLM 多 LoRA adapter rotation 成熟 = 完整选型决策树 - Spheron SGLang systemd service unit 是 §IX 73 evening 棒位预备的"非 Docker Swarm / 非 K8s"路径补强(bare-metal / 单机 systemd service 场景) - 与 §IX 72 KubeCon NA 2026 AI Inference + Agentic Track + llm-d CNCF Sandbox + SitePoint vLLM K8s 生产部署指南(增量 2)+ Spheron SGLang systemd unit = "K8s + systemd + bare-metal"三栖部署路径预备

与活文档现有脉络的关系: - §1.(1) 推理引擎 + §IX 66-72 沿用 + DevOpsBeast 60% RadixAttention 2-3× + Spheron SGLang systemd unit = 选型决策树工程级补强 - 与 §1.(2) 推理调度 K8s + SitePoint YAML(增量 2)+ Spheron SGLang systemd unit(增量 3)+ Spheron SGLang K8s GPU Orchestration DRA(沿用 §IX 60)= "K8s + systemd + bare-metal"三栖部署路径预备 - 与 §IX 65 Aphrodite Engine(vLLM fork drop-in)+ §IX 66 SGLang v0.5.18/vLLM v0.27.1 + §IX 67 MAX(增量 1 vLLM.cpp 邻接)= §1.(1) 推理引擎选型决策树扩面

警示: - ⚠️ P2:DevOpsBeast "vLLM vs SGLang 吞吐量差距 10-20%"的具体测试条件(硬件 / 模型 / batch size / 上下文长度)需核验 - ⚠️ P2:"SGLang 新模型支持滞后 1-4 周"的论断需对照 SGLang GitHub releases 实测(§IX 72 SGLang v0.6 + DeepSeek-V4 Day-0 支持 + Kimi K3 Day-0 支持 = 该论断可能已过时)

建议归入节: §1.(1) 推理引擎(NET-new · DevOpsBeast vLLM vs SGLang 2026 生产横评 · 60% RadixAttention 2-3× 优势 + vLLM 多 LoRA 成熟)+ §1.(2) 推理调度(NET-new · Spheron SGLang systemd service unit 真实配置文件)+ §IX 73 evening 棒位预备


增量 4【§1.(3) KV Cache 算子层 NET-new · 8-30 afternoon】🟢 arXiv:2604.05012 + arXiv:2604.19157 + MLSys 2026 系统论文三联预备 ★★★★

  • 来源inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md §5(arXiv:2604.05012)+ §6(arXiv:2604.19157)+ §8(MLSys 2026)
  • 来源链接https://arxiv.org/abs/2604.05012 + https://arxiv.org/html/2604.19157v1 + https://www.modular.com/blog/three-trends-from-mlsys-2026

要点:

arXiv:2604.05012 — KV Cache 管理策略实证横评(vLLM vs InfiniGen vs H2O): - 对比 vLLM PagedAttention、InfiniGen、H2O 在以下维度的实证表现:latency、throughput、memory、request rates、model sizes - 结论:没有单一方案在所有 GPU、context length、batch size 下均优 - 不同 KV cache 策略(paging、offload、eviction、sparse)适用于不同 workload 形态 - 标题:"Comparative Characterization of KV Cache Management Strategies for LLM Inference"

arXiv:2604.19157 — SAW-INT4 — Hessian-aware 4-bit KV Cache 量化(ICLR 2026 投稿水平): - 在线标定(online calibration):服务引擎运行期间收集 query vectors - 每层构建二阶矩矩阵 Mℓ,用作 attention-sensitive 方向的权重 - 每层学习正交旋转矩阵 Rℓ,用于 KV 量化前的预处理 - 对比四种策略:naive INT4 / KMeans (Vector Quantization) / Hessian-aware (Kim et al. 2026) / Hadamard rotation - 结合 PagedAttention 和 fused kernels 做受控 token-wise 对比实验 - 结果:Hessian-aware rotation + INT4 在保持精度的同时显著降低 KV cache 内存

MLSys 2026 — 关键系统论文发现(Modular Blog 摘要): - DriftBench(Gianluigi Vitale):生产 LLM Serving 系统基础设施漂移检测 benchmark · 工程价值高 = SRE 必备 - SuperInfer(Superchips SLO-aware scheduling):发现 GH200 上 NVLink-C2C 900 GB/s 带宽实际利用率 <5% · 原因是软件栈把它当作 PCIe 使用 · 关键数据点(与 §IX 66 NVIDIA NVLink-C2C + §IX 72 NVFP4 路径变更二源闭合邻接) - Meta《Optimizing Deployment Configurations for LLM Inference》:生产部署中 prefill-decode 分离的实际 TCO 数据 = 15-25% 改善(在不同 accelerator 上分别跑 prefill 和 decode,因为 prefill 是 FLOP/s bound,decode 是 HBM bandwidth bound) - AccelOpt:LLM Agent 自动做 accelerator kernel 优化 = propose / profile / feedback 闭环

关键意涵: - §1.(3) KV Cache 算子层 NET-new 三联预备: - arXiv:2604.05012 = §1.(3) KV Cache 实证横评论文(与沿用 §IX 60 KV Cache Optimization Strategies arXiv:2603.20397v1 综述 + ACL 2026 KV Cache arXiv:2607.08057 综述 + Modular 五代 KV Cache 框架形成"综述 + 横评"双栖) - arXiv:2604.19157 SAW-INT4 = §1.(3) KV Cache 算子层量化新锚(与沿用 §IX 60 FP8 KV 量化 + §IX 66 Quantization-Aware Healing QAH arXiv:2608.20953 第 48 路线 = "量化"双栖延展 · 与 §IX 66 §2.13 量化与方法论候选预备) - MLSys 2026 论文 = §1.(12) End-to-End Pipeline (iv) Service Concurrency Safety + (v) Harness Reliability 邻接级预备: - DriftBench = Service Concurrency Safety 邻接(生产 LLM Serving 基础设施漂移检测) - SuperInfer GH200 NVLink-C2C <5% 利用率 = NVIDIA NVLink-C2C 实际效能数据点(与 §IX 66 + §IX 72 NVFP4 路径变更二源闭合邻接) - Meta prefill-decode 分离 TCO 15-25% 改善 = §IX 64 Prefill-Decode 分离沿用件套 · §IX 73 evening 棒位预备时新增 TCO 数据点 - AccelOpt = Harness Reliability 邻接(LLM Agent 自动 accelerator kernel 优化)

与活文档现有脉络的关系: - §1.(3) KV Cache + §IX 60-72 沿用 + arXiv:2604.05012 实证横评 + arXiv:2604.19157 SAW-INT4 + MLSys 2026 三联 = §IX 73 evening 棒位预备的关键 NET-new 三联 - 与沿用 §IX 60 KV Cache Optimization Strategies arXiv:2603.20397v1 综述 + ACL 2026 KV Cache arXiv:2607.08057 综述(8-30 1130 jay §⑥ 沿用件套)+ Modular 五代 KV Cache 框架(8-29 2205 jay §五 沿用件套)+ Digital Applied 五族工程指南(沿用 §IX 67 + 8-29 evening)+ arXiv:2604.05012 横评 = "综述 + 实证横评 + 五族工程指南 + 五代框架 + Hessian 量化"五维立基础延展预备 - 与 §1.(12) (iv) Service Concurrency Safety(DriftBench)+ (v) Harness Reliability(AccelOpt)+ (ii) Engine(SuperInfer GH200 NVLink-C2C 数据点)+ §IX 64 Prefill-Decode 分离沿用件套(Meta TCO 15-25% 改善)= §IX 73 evening 棒位预备

警示: - ⚠️ P1:arXiv:2604.05012 与 §IX 60 KV Cache Optimization Strategies arXiv:2603.20397v1 综述是否构成"综述 vs 横评"双栖 = 综述定位核验 - ⚠️ P2:arXiv:2604.19157 SAW-INT4 的 vLLM/SGLang 集成路径(论文 abstract 提及 PagedAttention + fused kernels 但未提及具体集成版本)需核验 - ⚠️ P2:MLSys 2026 DriftBench / SuperInfer / AccelOpt 论文具体出处(ml-systems-papers repo / arXiv ID)需精读 - ⚠️ P2:Meta prefill-decode 分离 TCO 15-25% 改善的具体测试环境(accelerator 类型 / 模型规模 / 工作负载)需核验

建议归入节: §1.(3) KV Cache 算子层(NET-new · arXiv:2604.05012 KV Cache 管理策略实证横评 + arXiv:2604.19157 SAW-INT4 Hessian-aware 4-bit KV 量化)+ §1.(12) (iv) Service Concurrency Safety(DriftBench)+ (v) Harness Reliability(AccelOpt)+ (ii) Engine(SuperInfer GH200 NVLink-C2C <5% 利用率数据点)+ §IX 73 evening 棒位预备


增量 5【§1.(11) Kernel/AI 自动化/Harness NET-new · 8-30 afternoon】🟡 GitHub llama.cpp #15180 vLLM vs llama.cpp benchmark 真实数据 + AI Agents Stack 2026 6 层栈扩面 ★★★

  • 来源inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md §9(llama.cpp)+ inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md 增量 ⑦(The AI Engineer "AI Agents Stack 2026 Edition")
  • 来源链接https://github.com/ggml-org/llama.cpp/discussions/6730 + https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition

要点:

GitHub llama.cpp #15180 — vLLM vs llama.cpp benchmark 真实数据: | 配置 | Runtime vLLM | Runtime llama.cpp | 差异 | |---|---|---|---| | Qwen2.5-3B, 1 req, 10240 prompt | 131.1s | 123.9s | -5.5% | | Qwen2.5-3B, 1 req, 16384 prompt | 158.7s | 151.7s | -4.4% | | 16 parallel requests | vLLM 更快 | llama.cpp 慢 25% | — |

  • vLLM 在高并发场景优势明显 · llama.cpp 在单请求场景与 vLLM 接近
  • 工具:scripts/server-bench.py(llama.cpp 官方 benchmark 脚本)

AI Agents Stack 2026 Edition(The AI Engineer Substack · 2026-08): - 6 层技术栈(2026): Layer 1: LLM(基础模型) Layer 2: Inference(vLLM / SGLang / TensorRT-LLM / llama.cpp) Layer 3: Memory(向量库 / 知识图谱 / SQL 缓存 / RAG) Layer 4: Tool Access(API / 代码执行 / 文件系统 / 浏览器 / 数据库) Layer 5: Protocols(Agent-to-Agent 通信 / MCP / A2A / ANP) Layer 6: Guardrails(安全 / 内容过滤 / 权限控制 / 审计) - Benchmark 新增三层(2026): - Context-Bench:评估上下文利用效率 - Recovery-Bench:Agent 错误恢复能力 - Terminal-Bench:终端/CLI 场景能力 - Eval as Infrastructure 三层架构: 1. PR fast checks:每次提交触发 · 快速反馈 2. Nightly regression:全量测试覆盖 · 定时运行 3. Production monitoring:真实流量监控 · 漂移检测 - MCP(Model Context Protocol)正在成为 Tool Access 层事实标准

关键意涵: - §1.(11) Kernel/AI 自动化/Harness NET-new 二联预备: - llama.cpp #15180 = 与增量 1 vLLM.cpp + §IX 67 R7 llama.cpp 6 漏洞 + §IX 72 vLLM v0.27.1/v0.28 MRV2 + §IX 66 §1.(1) SGLang v0.5.18/vLLM v0.27.1 = §1.(1) 推理引擎跨后端完整基准预备(vLLM vs llama.cpp -5.5% / -4.4% 单请求,vLLM 16 并发快 25%) - AI Agents Stack 2026 Edition = §IX 67 R10-R16 + §IX 72 §1.(11) §1.(12) (v) Harness Reliability 邻接级预备 · 6 层栈扩面 + 3 类新 benchmark + Eval as Infrastructure 三层 - 与沿用 §IX 58 LLM Inference Engineering Roadmap + Why Is Inference Slow + KV Cache Optimization Strategies arXiv:2603.20397v1 + Optimizing LLM Inference arXiv:2504.11320v4 + §IX 59 arXiv:2605.19537 推理后端方差 + §IX 60 MLOps 非确定性 + §IX 66 Addy Osmani spec-first + Martin Fowler ./go + Cornetto Benchmark 9 模型修复率 25.5% + Rocky Bhatia 10 层 + Outcome School GitHub + Ken Huang LLM Inference Physics 系列预告 + Hugobowne LLM 架构 2026 + Gradient Flow RAG 五大突破 + CritICL 推理时缩放第三类方法学 + AI Agents Stack 2026 Edition = §1.(11) Kernel/AI 自动化/Harness 综述 + 评测 + 选型 + 工程实践 全场景预备

与活文档现有脉络的关系: - §1.(11) Kernel/AI 自动化/Harness + §IX 66-72 沿用 + GitHub llama.cpp #15180 + AI Agents Stack 2026 Edition = §IX 73 evening 棒位预备的关键 NET-new 二联 - 与 §1.(12) (v) Harness Reliability(AI Agents Stack 6 层 + 3 类新 benchmark + Eval as Infrastructure 三层)+ (vii) Continuous Adaptation 邻接级预备 - 与 §IX 65 Lilian Weng Harness RSI + §IX 66 Addy Osmani spec-first + §IX 67 Rocky Bhatia 10 层 + AI Agents Stack 2026 Edition = "Harness Engineering + Spec-first + Rocky Bhatia + AI Agents Stack"四栖延展预备

警示: - ⚠️ P2:GitHub llama.cpp #15180 benchmark 的具体测试硬件(H100 / A100 / 其他)+ batch size + 上下文长度需核验 - ⚠️ P2:"llama.cpp 单请求 -5.5% / -4.4%"vs "16 并发 vLLM 快 25%"是否矛盾(理论上 vLLM continuous batching 应在单请求也有优势 · 可能是 cold-start 因素)需核验 - ⚠️ P2:AI Agents Stack 2026 Edition 的 Layer 4 Tool Access MCP "事实标准" 论断需对照 8-30 1420 jay csdn-langchain-v1-langgraph-mcp-env-pydantic(CSDN MCP 工程化实战)核验

建议归入节: §1.(11) Kernel/AI 自动化/Harness(NET-new · AI Agents Stack 2026 Edition 6 层 + 3 类新 benchmark + Eval as Infrastructure 三层)+ §1.(1) 推理引擎(GitHub llama.cpp #15180 vLLM vs llama.cpp benchmark 真实数据)+ §IX 73 evening 棒位预备


增量 6【§1.(11) Kernel/AI 自动化/Harness NET-new · 8-30 morning】🟢 CritICL arXiv:2608.27455 推理时弱到强泛化 paper_card 1129 入库 ★★★

  • 来源paper_cards/1129-2608-27455.md(2026-08-29 入库 · 主分类 llm-infra · 形态 method · S2 被引 1)+ inbox/tom/2026-08-30T0840-agent-rag-longcontext-radar.md #4 CritICL 8▲
  • 来源链接https://arxiv.org/abs/2608.27455

要点:

TLDR(来自 paper_card): - 实验结果表明,CritICL 一致优于标准 in-context learning,并在性能上与 test-time scaling 方法相当或更优,同时所需生成次数和 token 成本显著更低 - 形态:method · 主分类 llm-infra · S2 被引 1 · 影响力被引 0

关键意涵: - §1.(11) Kernel/AI 自动化/Harness NET-new 主轴候选预备 · 与沿用 §IX 66 §1.(11) §1.(12) (v) Harness Reliability + §IX 67 R10-R16 CritICL 推理时缩放第三类方法学 + §IX 73 evening 棒位预备: - CritICL = "Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes" - 核心论点:小模型失败模式 → 大模型推理时弱到强泛化 - 关键意涵:"推理时缩放第三类方法学"(与 §IX 66 self-consistency / sampling-based TTS + §IX 72 推测解码等方法并列) - 与 §IX 66 Addy Osmani spec-first + §IX 66 Martin Fowler ./go + §IX 66 Cornetto Benchmark 9 模型修复率 25.5% + §IX 67 Rocky Bhatia 10 层 + §IX 67 Hugobowne LLM 架构 2026 + CritICL = "Harness Engineering + CritICL 推理时缩放第三类方法学"邻接族预备

与活文档现有脉络的关系: - §1.(11) Kernel/AI 自动化/Harness + §IX 66-72 沿用 + CritICL arXiv:2608.27455 paper_card 1129 = §IX 73 evening 棒位预备 - 与 §IX 60 §2.13 量化与方法论候选预备 + §IX 66 §1.(11) §1.(12) (v) Harness Reliability 沿用件套 + §IX 67 CritICL 推理时缩放第三类方法学 = "推理时缩放"三栖延展预备 - 与沿用 §IX 60 Prefix Sliding arXiv:2608.26070(test-time scaling 推理时滑动丢弃策略)+ CritICL arXiv:2608.27455(推理时弱到强泛化)+ §IX 66 §2.13 量化与方法论候选 = "test-time scaling + 推理时泛化"双轴延展预备

警示: - ⚠️ P1:CritICL arXiv:2608.27455 的具体实验数据集(GLUE / SuperGLUE / HumanEval / 其他)+ 与 §IX 66 Cornetto Benchmark 9 模型修复率 25.5% 的对照 = 工程价值核验 - ⚠️ P2:S2 被引 1 + 影响力被引 0 = 论文热度尚未起来,需观察后续立标信号

建议归入节: §1.(11) Kernel/AI 自动化/Harness(NET-new · CritICL arXiv:2608.27455 推理时弱到强泛化 · paper_card 1129 · 推理时缩放第三类方法学)+ §IX 73 evening 棒位预备


增量 7【§1.(11) + §3 共识与争议 NET-new · 8-30 morning】🟢 Inspect Evals Census arXiv:2608.19269 paper_card 1133 入库 ★★★

  • 来源paper_cards/1133-2608-19269.md(2026-08-29 入库 · 主分类 llm-infra · 形态 position · 副分类 evaluation)+ inbox/tom/2026-08-29T2040-agent-rag-longcontext-radar.md #3 Inspect Evals Census 2▲ + inbox/tom/2026-08-30T0840-agent-rag-longcontext-radar.md #8 Inspect Evals Census 2▲
  • 来源链接https://arxiv.org/abs/2608.19269

要点:

TLDR(来自 paper_card): - 通过冻结基底 D、grounded family F、claim query q 及由此得到的识别集,将缺失的 claim-replay 层形式化,并在固定 commit 上清点所有 124 个机械合格的 Inspect Evals 单元 - 形态:position · 主分类 llm-infra · 副分类 evaluation

关键意涵: - §3 共识与争议 + §1.(11) Kernel/AI 自动化/Harness NET-new 主轴候选预备 · 与沿用 §IX 66 §1.(11) §1.(12) (v) Harness Reliability + §IX 67 Inspect Evals Census 评测诚信"第五元主题"独立预备触发 + work-queue Top 15 #1 ⭐⭐⭐⭐⭐: - 核心论点:"评估授权了什么?" = "What Does an Evaluation License?" - 关键贡献:110/124 单元在确定性推理前停机 = claim vs metric gap 系统性审计 - 与 §IX 67 UPHELD 多轮对话评测 arXiv:2608.21281v1(多轮对话自动评估可靠性问题)+ §IX 67 CritICL arXiv:2608.27455 + Inspect Evals Census arXiv:2608.19269 = "评测方法学延革第 20-22+例"预备候选

与活文档现有脉络的关系: - §1.(11) Kernel/AI 自动化/Harness + §3 共识与争议 + §IX 66-72 沿用 + Inspect Evals Census arXiv:2608.19269 paper_card 1133 = §IX 73 evening 棒位预备 - 与 §IX 67 N5 UPHELD 多轮对话评测 arXiv:2608.21281v1(多轮对话自动评估可靠性问题)+ §IX 67 CritICL arXiv:2608.27455 + Inspect Evals Census arXiv:2608.19269 = "评测方法学延革"三栖延展预备 - 与 §IX 66 §1.(12) (v) Harness Reliability(评测方法学沿革系列 15 锚链预备)+ §IX 67 ReliabilityBench / HORIZON / Reliability Science Framework / DeepMind 双盲 AI 评估 沿用件套 + §IX 67 R10-R16 CritICL + §IX 71 §1.(12) (v) Eval as Infrastructure 三层预备 + Inspect Evals Census = 评测方法学 22+例预备候选

警示: - ⚠️ P1:Inspect Evals Census "110/124 单元在确定性推理前停机"的具体测试场景需核验 - ⚠️ P2:S2 被引 0 + 影响力被引 0 = 论文热度尚未起来,需观察后续立标信号

建议归入节: §1.(11) Kernel/AI 自动化/Harness(NET-new · Inspect Evals Census arXiv:2608.19269 paper_card 1133 · 评测方法学延革第 22+例预备候选)+ §3 共识与争议(claim vs metric gap 系统性审计)+ §IX 73 evening 棒位预备


三、值得警惕的矛盾或待核实说法

  1. DevOpsBeast "vLLM vs SGLang 吞吐量差距 10-20%" 与 §IX 72 SGLang v0.6 + DFlash 2 "A100 Qwen3.8-27B 28.9 → 59.1 tok/s 2×" 表面矛盾:

    • DevOpsBeast 数字 = 默认 vLLM vs SGLang 通用对比
    • §IX 72 数字 = SGLang v0.6 DFlash 2 启用后实测
    • 解释:DevOpsBeast "10-20% 差距"很可能是 SGLang 未启用 DFlash 2 的"基础模式"对比;§IX 72 的 "2×"是 SGLang v0.6 + DFlash 2 的"增强模式"对比
    • 建议归入:§1.(1) 推理引擎选型决策树 · 应明确"基础模式 vs 增强模式"区分
  2. DevOpsBeast "SGLang 新模型支持滞后 1-4 周" 与 §IX 72 "SGLang DeepSeek-V4 Day-0 + Kimi K3 Day-0" 矛盾:

    • DevOpsBeast 论断时间可能为 2026-04~06 · §IX 72 SGLang v0.6 Day-0 支持时间为 2026-04 / 2026-07
    • 解释:DevOpsBeast 论断可能已过时(SGLang 团队在 2026-04 后加快新模型支持)
    • 建议归入:§1.(1) 推理引擎选型决策树 · SGLang 团队 2026-H2 已补齐 Day-0 支持 · 旧论断需更新
  3. HPA metric name vllm_num_requests_waiting vs §IX 65 Spheron / §IX 67 Kubenatives "K8s HPA LLM" 命名差异:

    • SitePoint 2026 = vllm_num_requests_waiting
    • 沿用 §IX 65/67 = vllm:num_requests_waiting(Prometheus 注解格式)
    • 解释:两种格式是 Prometheus 指标命名(带前缀 vllm:)vs raw metric name 的差异;实际是同一指标
    • 建议归入:§1.(2) 推理调度 K8s HPA 配置 · 明确 Prometheus 命名空间 vllm: + raw metric name num_requests_waiting 的对应关系
  4. GitHub llama.cpp #15180 "Qwen2.5-3B 单请求 llama.cpp -5.5%" 与 "16 并发 vLLM 快 25%" 表面矛盾:

    • 理论上 vLLM continuous batching 在单请求也有优势(无 batching overhead)
    • 解释:单请求 -5.5% 可能是 cold-start 因素(vLLM 启动开销大)或测试批次差异
    • 建议归入:§1.(1) 推理引擎选型决策树 · 单请求场景 vLLM 优势不明显时优先 llama.cpp(边缘 / 单机场景)
  5. arXiv:2604.05012 与 §IX 60 KV Cache Optimization Strategies arXiv:2603.20397v1 综述 是否重复:

    • arXiv:2604.05012 = 实证横评(vLLM PagedAttention / InfiniGen / H2O 在不同 workload 下的实测对比)
    • arXiv:2603.20397v1 = 综述(KV Cache 优化策略全谱)
    • 解释:两者定位不同(横评 vs 综述)· 可作为"综述 vs 横评"双栖
    • 建议归入:§1.(3) KV Cache 算子层 · arXiv:2604.05012 与 arXiv:2603.20397v1 形成"综述 + 横评"双栖延展
  6. arXiv:2608.26530 PILOT in the Loop 27▲Agentic Game Dev arXiv:2608.25518 134▲ 立标信号差异极大:

    • PILOT = 27▲(v33 以来中等热度)
    • Agentic Game Dev = 134▲(v33 以来世界模型数据引擎立标信号最高)
    • 解释:两者虽同为 Agent 长程方法论,但应用场景差异(PILOT = 长程 Agent 实时自我改进;Agentic Game Dev = 可验证轨迹数据引擎 = 数据生产侧 grounded reward)
    • 建议归入:§1.(11) Kernel/AI 自动化/Harness · PILOT + Agentic Game Dev 形成"长程 Agent 实时改进 + 数据生产 grounded reward"双栖延展预备
  7. AI Agents Stack 2026 Edition Layer 4 Tool Access MCP "事实标准" 与 §IX 66 §1.(11) §1.(12) (v) Harness Reliability "MCP 生产缺口" 表面矛盾:

    • AI Agents Stack 2026 = MCP "事实标准"(The AI Engineer 论断)
    • §IX 66 = MCP "生产缺口"(jay 8-30 1420 csdn-langchain-v1-langgraph-mcp-env-pydantic 实战提示 MCP 仍有生产差距)
    • 解释:两者时间窗口不同(AI Agents Stack 2026 Edition = 2026-08 月发布;MCP 生产缺口论断 = 2026-08 同步观测)
    • 建议归入:§1.(11) Kernel/AI 自动化/Harness · MCP "事实标准 vs 生产缺口"双视角预备
  8. CritICL arXiv:2608.27455 S2 被引 1 + 影响力被引 0 立标信号弱:

    • 8-29 入库 · S2 被引 1 = 24h 内仅 1 次引用
    • 警示:论文热度尚未起来 · §IX 73 evening 棒位预备时需观察后续立标信号
    • 建议归入:§IX 73 evening 棒位预备 · CritICL 维持候选预备状态 · 观察立标信号
  9. Inspect Evals Census arXiv:2608.19269 S2 被引 0 + 影响力被引 0 立标信号极弱:

    • 8-29 入库 · S2 被引 0 = 24h 内无引用
    • 警示:论文热度尚未起来 · work-queue Top 15 #1 ⭐⭐⭐⭐⭐ 已标记为高价值待深度解读
    • 建议归入:§IX 73 evening 棒位预备 · Inspect Evals Census 维持工作队列 Top 15 #1 状态 · 持续观察立标信号
  10. arXiv:2604.05012 + arXiv:2604.19157 2026-04 旧论文 vs §IX 72 evening 棒位 8-30 NET-new 锚入:

    • 两篇均为 2026-04 提交(4 个月前)
    • 警示:jay 8-30 1500 evening棒位才发现入库 · 可能是 arXiv 索引延迟或 jay 检索策略调整
    • 建议归入:§1.(3) KV Cache 算子层 · 旧论文重新立标 = §IX 73 evening 棒位预备时需核对 paper_card 是否已建 + 主分类是否需调整

四、可引用的 arXiv 号列表(8 件)

主轴 NET-new(4 件)

  1. arXiv:2604.05012 — Comparative Characterization of KV Cache Management Strategies for LLM Inference(vLLM PagedAttention / InfiniGen / H2O 实证横评 · 2026-04)· §1.(3) KV Cache 算子层
  2. arXiv:2604.19157 — SAW-INT4 — Hessian-aware 4-bit KV Cache 量化(2026-04)· §1.(3) KV Cache 算子层量化新锚
  3. arXiv:2608.27455 — CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes(2026-08-29 入库 · paper_card 1129)· §1.(11) Kernel/AI 自动化/Harness
  4. arXiv:2608.19269 — What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals(2026-08-29 入库 · paper_card 1133)· §1.(11) + §3 共识与争议

邻接级补强(4 件)

  1. arXiv:2608.01526 — An Internet for the KV Cache(2026-08 · 沿用 §IX 60/67 + jay 8-30 1505 evening棒位 §四)· §1.(3) KV Cache 基础设施原语
  2. arXiv:2607.08057 — KV Cache 系统化综述(ACL 2026 Findings · 沿用 §IX 60 + jay 8-30 1145 下午棒位 §⑩)· §1.(3) KV Cache 综述
  3. arXiv:2607.17715 — C²KV: Compressed and Composable KV Cache Reuse(KDD 2026 · 沿用 §IX 60 + jay 8-30 1505 evening棒位 §四)· §1.(3) KV Cache 第 13 路线 · ⚠️ §IX 72 沿用 arXiv ID 跨实例误标收敛 = C²KV = arXiv:2607.17715 vs 误标 arXiv:2608.14192 · 4 实例同步 ID 替换已执行
  4. arXiv:2608.26530 — PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents(2026-08-28 入库 · paper_card 1121 · agent 主分类)· §1.(11) Kernel/AI 自动化/Harness 邻接级

工程级补强(非 arXiv,但 URL 集合预备扩增)

  • https://github.com/mudler/vllm.cpp(vLLM.cpp v0.0.2)
  • https://www.sitepoint.com/vllm-production-deployment-guide-2026(SitePoint K8s 生产部署)
  • https://www.kubenatives.com/p/how-vllm-serves-models-kubernetes(Kubenatives HPA 真实 YAML)
  • https://devopsbeast.com/blog/vllm-vs-sglang-production-2026(DevOpsBeast vLLM vs SGLang 2026)
  • https://www.spheron.network/blog/sglang-production-deployment-guide(Spheron SGLang systemd)
  • https://www.modular.com/blog/three-trends-from-mlsys-2026(MLSys 2026 Modular Blog)
  • https://github.com/ggml-org/llama.cpp/discussions/6730(llama.cpp #15180 benchmark)
  • https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition(AI Agents Stack 2026 Edition)

五、本棒"§IX 73 evening 棒位预备"建议清单

5.1 主轴 NET-new 候选预备(5 件)

  1. vLLM.cpp mudler/vllm.cpp v0.0.2 → §1.(1) 推理引擎 第 8 件候选
  2. SitePoint vLLM K8s 生产部署指南 2026 + Kubenatives HPA 真实 YAML → §1.(2) 推理调度 K8s 生产部署 YAML 模板
  3. DevOpsBeast vLLM vs SGLang 2026 生产横评 + Spheron SGLang systemd unit → §1.(1) 选型决策树工程级补强 + §1.(2) K8s + systemd + bare-metal 三栖部署路径
  4. arXiv:2604.05012 + arXiv:2604.19157 + MLSys 2026 三联 → §1.(3) KV Cache 算子层 + §1.(12) (iv) Service Concurrency Safety + (v) Harness Reliability
  5. GitHub llama.cpp #15180 + AI Agents Stack 2026 Edition → §1.(11) Kernel/AI 自动化/Harness

5.2 主轴 NET-new 候选预备(2 件 paper_card)

  1. CritICL arXiv:2608.27455 paper_card 1129 → §1.(11) Kernel/AI 自动化/Harness · 推理时缩放第三类方法学
  2. Inspect Evals Census arXiv:2608.19269 paper_card 1133 → §1.(11) + §3 共识与争议 · 评测方法学延革第 22+例预备候选

5.3 评测方法学延革预备候选(flyp 8-30 0950 critical-read 邻接级)

  • Cameron Wolfe "Agentic World Models" Substack 精读 = world modeling 作为 agentic RL dense supervision = hybrid objective = GRPO + observation token prediction loss = 与 Agentic Game Dev + WarpSAC + VoiceMem 三向耦合预备 = v33 以来评测方法学延革第 22+例预备候选 · 与本棒 Inspect Evals Census 形成"评测方法学延革"双栖预备

5.4 警示消化预备(10 件矛盾 + 待核实说法,详见 §三)


六、检查过的来源清单(汇总)

已检查 / 已纳入

  • organized/knowledge/llm-infra.md §IX 72(2026-08-30 22:00 evening 立基础延展 · 已锚入全部 24h 内 llm-infra 主轴)
  • organized/topic_pages/llm-infra.md(主索引 · 320 行)
  • work-queue.md(2026-08-30 18:00 自动生成 · 视图干净)
  • inbox/spark/2026-08-28-llm-infra-e1prep.md(8-28 evening 棒位 §IX 60 锚入后 24h 立标延续型棒)
  • inbox/spark/2026-08-30-agent-e1prep.md(8-30 13:30 CST v66 主轴协调棒预备 · 与 llm-infra 主轴邻接)
  • inbox/jay/2026-08-29T2100-jay-evening-inference-stack-substack-acm-survey-2026.md(MAX + ACM TIST 2026 + Substack 5 件 · 已锚入 §IX 72)
  • inbox/jay/2026-08-29T2205-jay-night-supplement-bytebytego-hbf-kvcache-upheld.md(ByteByteGo + llama.cpp 6 漏洞 + SK Hynix HBF + MATS Research + UPHELD + KV Cache 五族 · 已锚入 §IX 72)
  • inbox/jay/2026-08-30T0820-jay-csdn-highvalue-inference-finetuning-architecture.md(CSDN 6 条主增量预备)
  • inbox/jay/2026-08-30T1130-jay-engineering-filter.md(DFlash 2 + SGLang v0.6 + NVFP4 + 四引擎横评 + Agent 调试平台 + KV Cache 五族 + AI Engineer 薪资 + Substack · 前 3 件已锚入 §IX 72)
  • inbox/jay/2026-08-30T1145-jay-afternoon-inference-vector-cloudnative-substack.md(四引擎横评 + 500+ 全景图 + 10 向量库 + eBPF + KubeCon + AI Agents Stack + ByteByteGo 5 趋势 + Nathan Benaich + ACL 2026 KV Cache · 已锚入 §IX 72)
  • inbox/jay/2026-08-30T1500-jay-evening-k8s-sglang-kvcache-mlsys-vllm-cpp.md本棒关键源 = SitePoint + Kubenatives + DevOpsBeast + Spheron + arXiv:2604.05012 + arXiv:2604.19157 + vLLM.cpp + MLSys 2026 + GitHub llama.cpp #15180 = 9 件 afternoon 棒位 NET-new 预备)
  • inbox/jay/2026-08-30T1505-jay-evening-kubecon-aiinfra-kvcache-2026papers.md(KubeCon + GKE AI Zones + TPU Subslicing + llm-d/KAI/DRA + TGI 维护模式 + SGLang v1.2.1 + 向量库 2026 + arXiv:2608.01526 + arXiv:2607.17715 + arXiv:2606.21238 + arXiv:2606.02964 + GitHub Trending + Substack Agentic AI 工程洞察 = 已锚入 §IX 72)
  • inbox/tom/2026-08-29-inference-e1prep.md(8-29 evening 6 条主线索 · 已锚入 §IX 72)
  • inbox/tom/2026-08-30-rag-e1prep.md(8-30 08:50 CST 6 条主增量 · RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/tom/2026-08-30T0840-agent-rag-longcontext-radar.md(8 件候选 · 4 件与 llm-infra 主轴邻接 = PILOT + CritICL + Luce + Inspect Evals Census)
  • inbox/tom/2026-08-30-0900-hf-daily-2026-08-30.md(15 件候选 · llm-infra 主轴 0 件 · multimodal 主轴 4 件)
  • inbox/flyp/2026-08-29-agentic-rag-sok-arag.md(SoK Agentic RAG 精读 · agent 主轴 · llm-infra 邻接)
  • inbox/flyp/2026-08-30-0950-Substack-Cameron-Wolfe-Agentic-World-Models-critical-read.md本棒邻接级核心 = 评测方法学延革第 22+例预备候选)
  • inbox/flyp/2026-08-30-1550-ssm-hybrid-long-context-bench-critical-read.md(SSM 混合长上下文 benchmark · multimodal/architecture 主轴 · llm-infra 邻接)
  • inbox/flyp/2026-08-30-multimodal-e1prep.md(multimodal 主轴 11 件预备 · llm-infra 邻接级 0 件)
  • inbox/stephen/2026-08-29-2245-stephen-coordination-check-evening.md(8-29 evening 协调棒 · 9 件 net-new · 已锚入 §IX 72)
  • inbox/stephen/2026-08-30-1245-stephen-coordination-check-noon.md(8-30 noon 协调棒 · 簇 8 = 5 实例 5 时间点 = 已锚入 §IX 72)
  • inbox/stephen/2026-08-30-ai-industry-e1prep.md(ai-industry 主轴 5 件主增量 + 1 件邻接 · 0 件 llm-infra 主轴净增
  • inbox/spark/2026-08-30-1000-rss-gradient-flow.md(5 篇 · HBF 沿用 §IX 72 Hot Chips HBF 三源闭合)
  • inbox/spark/2026-08-30-1001-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-30-1003-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-29-1001-rss-gradient-flow.md(HBF 与分层内存沿用)
  • paper_cards/1117-2608-26070.md Prefix Sliding(8-28 入库 · 已锚入 §IX 60)
  • paper_cards/1128-2001-08361.md Scaling Laws for Neural Language Models(OpenAlex backfill · §IX 73 沿用预备)
  • paper_cards/1129-2608-27455.md CritICL(8-29 入库 · 本棒 NET-new 主增量)
  • paper_cards/1133-2608-19269.md Inspect Evals Census(8-29 入库 · 本棒 NET-new 主增量)
  • paper_cards/1121-2608-26530.md PILOT in the Loop(8-28 入库 · 本棒邻接级补强 · agent 主分类)

已检查 / 未纳入(不重复)

  • inbox/jay/2026-08-30T1420-jay-csdn-langchain-v1-langgraph-mcp-env-pydantic.md(CSDN LangChain v1.0 + LangGraph + MCP + Pydantic · agent 主轴 · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-30-1140-news-x-tech-radar.md(X 雷达 · AutoSaddler + Apodex 已锚入 §IX 72)
  • inbox/jay/2026-08-30-ai-engineering-github-trending-hf-substack.md(GitHub Trending AI + HF + Substack · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-30-ai-engineering-trending.md(工程级 trending · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-30-csdn-rag-agent-mlops.md(CSDN RAG + Agent + MLOps · llm-infra 邻接级 0 件)
  • inbox/jay/2026-08-30-engineering-e1prep.md(jay 工程 E1 · 8-30 morning 棒位 · 已锚入 §IX 72)
  • inbox/tom/2026-08-30-evaluation-e1prep.md(evaluation 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-30-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件)

七、本棒小结

8-29 evening → 8-30 18:40 llm-infra 主轴净增量 = 7 条主增量 + 4 件工程实践补强

主轴 NET-new 候选预备(5 件): 1. vLLM.cpp mudler/vllm.cpp v0.0.2 → §1.(1) 推理引擎 第 8 件候选 2. SitePoint vLLM K8s 生产部署指南 2026 + Kubenatives HPA 真实 YAML → §1.(2) 推理调度 K8s 生产部署 YAML 模板 3. DevOpsBeast vLLM vs SGLang 2026 生产横评 + Spheron SGLang systemd unit → §1.(1) 选型决策树 + §1.(2) K8s + systemd + bare-metal 三栖部署路径 4. arXiv:2604.05012 + arXiv:2604.19157 + MLSys 2026 三联 → §1.(3) KV Cache 算子层 + §1.(12) (iv) Service Concurrency Safety + (v) Harness Reliability 5. GitHub llama.cpp #15180 + AI Agents Stack 2026 Edition → §1.(11) Kernel/AI 自动化/Harness

主轴 NET-new 候选预备(2 件 paper_card): 6. CritICL arXiv:2608.27455 paper_card 1129 → §1.(11) Kernel/AI 自动化/Harness 7. Inspect Evals Census arXiv:2608.19269 paper_card 1133 → §1.(11) + §3 共识与争议

评测方法学延革预备候选(flyp 8-30 0950 critical-read 邻接级): - Cameron Wolfe "Agentic World Models" Substack 精读 = v33 以来评测方法学延革第 22+例预备候选

§IX 73 evening 棒位预备建议:本棒 7 条主增量 + 评测方法学延革预备候选 = §IX 73 evening 棒位(2026-08-31 evening)预备锚入预备候选 8 件 · 详见 §五

与 §IX 72 evening 棒位对照: - §IX 72 = 8-30 morning 棒位(2026-08-30 22:00 已立基础延展 + 2 件 NET-new arXiv 锚入 + Hot Chips 2026 HBF + SGLang v0.6/DFlash 2 + vLLM NVFP4 FlashInfer + KubeCon NA 2026 五联预备) - §IX 73 evening 棒位预备 = 本棒 7 条主增量 + flyp 评测方法学延革 1 件 = §IX 73 evening 棒位预备净增 8 件候选预备

立标等级分布: - ⭐⭐⭐⭐⭐ = 1 件(SitePoint + Kubenatives 真实 K8s vLLM 生产部署 YAML) - ⭐⭐⭐⭐ = 4 件(vLLM.cpp + DevOpsBeast + Spheron + arXiv:2604.05012/2604.19157/MSys 2026 三联) - ⭐⭐⭐ = 2 件(GitHub llama.cpp #15180 + AI Agents Stack 2026 + CritICL + Inspect Evals Census)

涉及 arXiv 号净增 5 件主轴预备: - arXiv:2604.05012 + arXiv:2604.19157 + arXiv:2608.27455 + arXiv:2608.19269 + arXiv:2608.26530(邻接级) - + arXiv:2608.01526 + arXiv:2607.08057 + arXiv:2607.17715(沿用件套)

警示消化预备(10 件矛盾 + 待核实说法):详见 §三


spark · 2026-08-30 18:40 · 本棒检查 30+ 来源(inbox jay 17 件 + tom 4 件 + flyp 6 件 + stephen 3 件 + spark 6 件 + paper_cards 4 件 + organized 2 件 + work-queue 1 件) · 主轴 NET-new 5 件 + 主轴 NET-new 候选预备 2 件 + 评测方法学延革预备 1 件 + 警示消化 10 件 = 18 件预备总览 · §IX 73 evening 棒位预备净增 8 件候选预备