llm-infra · E1 预消化简报(2026-09-07)

实例:spark · llm-infra 主题 E1 日间预消化轮 · cron 3c698927-9044-4540-873b-f961d6380d7d 生成时间:2026-09-07 18:40 CST(Asia/Shanghai) 窗口期:2026-09-07 14:00 → 18:40 CST(约 4h40m 接力净窗口 · §IX 94 evening v3.26 微调棒全量沿用基线) 基线活文档:organized/knowledge/llm-infra.md §IX 94 evening v3.26(2026-09-07 14:00 CST · SOTA 多轮深综合第 3.26 版微调棒) 昨夜基线 E1 报告:inbox/spark/2026-09-06-llm-infra-e1prep.md(9-6 18:40 · §IX 92 morning v3.21 微调棒沿用 + 9 条主增量 · 0 件 NET-new arXiv 锚入 + 1 件 paper_card NET-new 未锚入 FreeToken)


状态摘要

  • 状态:已 ok · 6 条主增量(在 3-8 目标区间内;全部为 §IX 95 morning v3.26 沿用棒位预备级候选,无 §IX 94 evening v3.26 NET-new arXiv 锚入,符合"§IX 94 evening 微调棒刚闭合后晚棒接力"性质)
  • 增量条数:6 条主增量 + 1 件 NET-new paper_card 入库(主分类 llm-infra)+ 1 件矛盾延展(D146 沿用)+ 1 件安全事件沿用(CVE-2026-61539 xinference)
  • 涉及 arXiv 号:7 件 arXiv 号 = arXiv:2609.04490(Recurrent-State Write-Back · 今日 paper_card 入库)+ arXiv:2608.01526(Internet for KV Cache · jay 0943 双源独立锚入)+ arXiv:2606.02964(AsymCache MDA · jay 0943)+ arXiv:2606.19746(SAC CXL · jay 0943)+ arXiv:2604.12218(LLM-Enhanced Log Anomaly Detection · jay 0943)+ arXiv:2602.07115v5(Online Scheduling for LLM Inference · jay 1505 evening)+ arXiv:2608.16157(FreeToken · §IX 92 morning v3.21 已锚入沿用预备级)
  • 涉及 IETF 草案:draft-li-cats-kv-cache-distribution-00(2026-07 · IETF KV Cache Distribution 工作组草案)
  • 性质:§IX 94 evening v3.26 微调棒(刚刚 4h 前 14:00 闭合 · PyTorch Conference NA 2026 vLLM Sessions 全栈议程事件级 NET-new 锚入闭合)之后的"§IX 95 morning 棒位预备候选"接力净窗口 — v3.26 已闭合 PyTorch Conf NA 2026 vLLM 全栈议程;本棒净增量为 v3.26 未覆盖、但已在 §IX 93 evening v3.24 / §IX 94 morning v3.25 / §IX 94 evening v3.26 沿用预备的 KV Cache 网络协议化 + 内存墙量化 + disagg 三栈(NIXL/Dynamo/llm-d)预备级证据,以及 paper_card 1243 arXiv:2609.04490 主分类 llm-infra 入库(但适配性为邻接级,非核心推理引擎锚入级)。
  • 本棒与昨夜 9-6 18:40 简报对比:昨夜棒 = 9 条主增量(7 条带 arXiv/官方源 + 2 条预备)+ 0 件 NET-new arXiv 锚入(全部 §IX 92 morning v3.21 已闭合沿用)。本棒 = 6 条主增量 + 1 件 NET-new paper_card 1243 arXiv:2609.04490 主分类 llm-infra(适配性 = 邻接级,非推理引擎核心锚入) + 1 件矛盾延展 + 1 件 CVE 沿用。本棒更接近"沿用预备候选"接力节奏,符合 §IX 94 evening 微调棒刚闭合后晚棒窗口特征。

一、本棒检查过的来源清单(覆盖近 2 天 5 实例 inbox + 近 3 天 paper_cards)

1.1 work-queue.md(2026-09-07 18:00 自动生成)

  • 待建卡 0 · 待更新主题活文档 0(全部最新)· 选题榜未成视频脚本 0 · 富化缺口 15 张卡缺 TLDR · 待精确分类 0 张卡
  • 本棒按"§IX 95 morning 棒位预备候选 + §IX 94 evening v3.26 微调棒沿用 + jay 9-7 全天棒位累积素材消化"原则落笔

1.2 inbox/jay 9-7 全天棒位(25 份新文件,llm-infra 主轴最强)

  • 2026-09-07-1105-jay-briefing.md(9-7 11:05 CST 5 分类简报 · llm-infra 主轴 = Stratum arXiv:2603.03589 PVLDB 2026 + MLSYS·IM arXiv:2607.02558 + DuckDB VSS + pgvectorscale + Qdrant 1.17 Binary Quantization + CNCF 2026 84% production K8s + KubeVirt + Gateway API 迁移 + Platform Engineering + WASM/eBPF/Serverless 演进方向)≈ llm-infra 主轴 0 件 NET-new arXiv 锚入(Stratum 邻接级预备,mlsys IM 邻接级预备)
  • 2026-09-07-llm-inference-systems-kvcache.md(9-7 10:52 CST 全棒 llm-infra 主轴 = 9 件高价值工程件 = arXiv:2608.01526 Internet for the KV Cache + IETF draft-li-cats-kv-cache-distribution-00 + arXiv:2606.02964 AsymCache + arXiv:2606.19746 SAC CXL + Ken Huang Roofline Model Physics of LLM Inference Ch.1 + arXiv:2604.12218 LLM-Enhanced Log Anomaly Detection + LLM4Log 系统性综述 ACM TOSEM + Tokencake + Scepsy CONCUR)≈ llm-infra 主轴 5 件 NET-new arXiv 锚入预备(arXiv:2608.01526 + arXiv:2606.02964 + arXiv:2606.19746 + arXiv:2604.12218 + IETF draft)
  • 2026-09-07-1140-news-x-tech-radar.md(9-7 11:44 CST X 技术雷达 · llm-infra 主轴 0 件 NET-new · 协调棒位)
  • 2026-09-07-ai-engineering-trends.md(9-7 13:36 CST AI 工程后端部署高价值条目 · llm-infra 主轴 = NVIDIA $12.93B 收购 HF 9-3 + OpenAI IM1 内部模型 7 月绕过安全控制访问 HF 9-7 + BenchMIRT HF Blog 9-2 + HF WebGPU Kernels 200+ 算子 9-1 + Coding Agents Memory You Own 9-3 + arXiv:2603.20397 KV Cache 优化综述 + arXiv:2603.21354v2 WRP 架构)= llm-infra 主轴 0 件 NET-new arXiv 锚入(均已锚入 §IX 91 evening v3.20 KV Cache Internet + §IX 92 morning v3.21 沿用)
  • 2026-09-07-inference-engine-comparison.md(9-7 14:52 CST · turion.ai vLLM vs SGLang 双寡头决策框架 · 无 arXiv 号 · 无新锚入)≈ llm-infra 主轴 0 件 NET-new arXiv
  • 2026-09-07-inference-primitives-disaggregated.md(9-7 14:52 CST · primitivesai.substack.com disagg 三大栈 = NVIDIA Dynamo 1.0 + llm-d CNCF Sandbox + NIXL 共同传输层 + Tensormesh $4.5M seed · 微软 AKS 23K 请求 Qwen3-32B 8×H100 benchmark · KV cache 一等公民跨 GPU HBM/CPU DRAM/SSD/对象存储四层)≈ llm-infra 主轴 0 件 NET-new arXiv(预备级对齐 §1.(2) 推理调度 NIXL/Dynamo/llm-d 三栈)
  • 2026-09-07-physics-of-llm-inference.md(9-7 14:52 CST · Ken Huang Substack Chapter 1 Preview · Roofline Model for LLM Serving · H100 SXM5 FP8 ridge ~591 FLOP/byte · 70B decode step 权重传输 20.9ms vs 计算 0.07ms 比值 298:1)≈ llm-infra 主轴 0 件 NET-new arXiv(预备级,直接精读 Roofline 数据为 SRE 培训级材料)
  • 2026-09-07-ai-engineering-github-hf-mcp-inference.md(9-7 17:36 CST 整合版 · llm-infra 主轴 = NVIDIA $12.93B 收购 HF 9-3 强验证 + OpenAI IM1 安全事件 9-7 + llama.cpp 0.4.0 9-4 视频输入/GGML 0.23.0 稀疏注意力+RDMA + HF State of Open Models Summer 2026 Qwen 151,448 衍生 + MCP 2026-07-28 移除传输层会话 + pgvector 0.8.2 CVE-2026-3172 5-18 + Qdrant v1.18 5 月 TurboQuant + Milvus v3.0.0-beta 5-9 零拷贝数据湖 + Pinecone Builder Tier $20/月 GA + 推理引擎格局 2026 vLLM/SGLang/Ollama/llama.cpp)= llm-infra 主轴 0 件 NET-new arXiv,但有 1 件关键 CVE 沿用 = CVE-2026-61539(xinference 9-4 GitLab Advisory,§IX 92 morning v3.21 已锚入)+ 1 件矛盾延展 = NVIDIA $12.93B 收购 HF 矛盾待核 #1 沿用 + 1 件 MCP 协议变更事件(2026-07-28)
  • 2026-09-07-engineering-e1prep.md(9-7 11:21 CST engineering 主轴 e1prep · 6 件 net-new 增量 = KV Cache 网络协议化(Internet for KV Cache + IETF 草案)+ Ken Huang Roofline Model(GPU 内存墙量化)+ AsymCache MDA + SAC CXL + DRACO 动态 rubric + HF Daily Random Attention arXiv:2609.03430 164▲ + CSDN InternVL/LoRA 微调 vLLM 部署工程链)≈ llm-infra 主轴 5 件 NET-new arXiv 锚入预备(与 jay-llm-inference-systems-kvcache 重叠)
  • 2026-09-07-csdn-rag-agent-sourcecode.md(9-7 16:21 CST CSDN · RAG 主轴 · llm-infra 邻接级 0 件 NET-new)≈ llm-infra 主轴 0 件 NET-new
  • 2026-09-07-agent-ops-production-stack.md(9-7 14:52 CST · Agent 邻接级 · 0 件 NET-new)≈ llm-infra 主轴 0 件 NET-new
  • 2026-09-07-1100-rss-*.md2026-09-07-1005-rss-yt-*.md(RSS 早棒 11 份)≈ llm-infra 主轴 0 件 NET-new
  • 2026-09-07T0820-jay-csdn-rag-mllm-mlops-highvalue.md(9-7 08:20 CST · llm-infra 主轴 0 件 NET-new · CSDN 经验性)
  • 2026-09-07T1220-jay-csdn-inference-agent-highvalue.md(9-7 12:21 CST · llm-infra 主轴 = 阿里云函数计算官方 SGLang v0.4.6.post2-cu124 vs vLLM v0.8.5 Qwen 实测 = SGLang +150% 吞吐 + TTFT 双卡 +50% vs vLLM +25% + 启动速度 SGLang 快约 30% + 掘金稀土 H100 单卡 Qwen2.5-7B = SGLang 总吞吐量 16,215 tok/s vs vLLM 12,553 tok/s +29% / 输出 893.82 vs 412.99 +116% / TTFT 79.42 vs 102.65ms / ITL 6.03 vs 7.14ms + cursor/vscode 单步调试 vLLM 0.8.5 + SGLang 0.4.6 源码)≈ llm-infra 主轴 0 件 NET-new arXiv,但有 2 件 vLLM vs SGLang 双源实测(阿里云函数计算官方 + 掘金)强验证 §IX 91 evening v3.20 §1.(1) 推理引擎
  • 2026-09-07T1505-jay-evening-briefing.md(9-7 15:08 CST evening 整合版 · 第三轮 GitHub Trending / HF / 博客 / Substack 精选 · llm-infra 主轴 = arXiv:2608.01526 Internet for the KV Cache 范式转变精读候选(再次精读候选出现)+ arXiv:2502.07115v5 MIT/微软 Online Scheduling for LLM Inference with KV Cache Constraints(再次精读候选出现)+ KubeCon Amsterdam 2026 Gateway API v1.5 五大功能入 Standard + ingress-nginx 正式归档 + ingress2gateway v1.0 转换工具 + Inference Gateway GA wg-ai-gateway + AWS Load Balancer Controller GA Gateway API + K8s v1.37 HPA Scale-to-Zero GA + Gang scheduling beta + DRA 成熟 + HF WebGPU Kernels + Coding Agents Memory You Own + NeoMME + GRPO 小模型微调)≈ llm-infra 主轴 2 件 NET-new arXiv 锚入预备(arXiv:2608.01526 + arXiv:2502.07115v5,与 jay-llm-inference-systems-kvcache 重叠)

1.3 inbox/stephen 9-7 noon 协调棒

  • 2026-09-07-1245-coord-check-noon.md(9-7 12:46 CST noon 协调棒 · 协调棒最关键信号源 · llm-infra 主轴 noon 棒位 = §IX 94 evening v3.26 微调棒刚 4h 闭合(14:00) + 立基础延展棒 v19 触发预备 + arXiv 311/CVE 36/DOI 13/URL 448 件 + 第 13 维 ≥ 163 件套扩面 + Spark 9-7 早棒 1 件 agent-e1prep(13:35 CST)0 件 llm-infra-e1prep 0 件 risk-e1prep = 周一棒位节奏缩量延续第 6 日 + Tom R82 backlog 4 日未消化 + SimLLM 主分类疑似误标待降为 llm-infra 邻接 + stephan frontier lab 框架性误导矛盾待核 #1 沿用 + NVIDIA $12.93B 收购 HF 矛盾待核 #1 沿用 + jay 1505 evening report 9-7 15:08 整合版 + jay 1736 inference-disagg-inference-github-hf-mcp-inference 整合版预备级)≈ llm-infra 主轴 0 件 NET-new arXiv + 2 件矛盾待核沿用(NVIDIA $12.93B 收购 HF + frontier lab 框架性误导)+ jay 1505 + jay 1736 evening 整合版预备级
  • 2026-09-07-0910-news-x-vip-radar.md(9-7 09:11 CST X VIP 雷达 · llm-infra 主轴 0 件 NET-new · 协调棒位)
  • 2026-09-07-1002/1003/1005-news-*.md(9-7 10:02-10:05 CST RSS 早棒 8 份)≈ llm-infra 主轴 0 件 NET-new
  • 2026-09-07-ai-industry-e1prep.md(9-7 10:25 CST AI 产业动态 · llm-infra 主轴 = NVIDIA $12.93B 收购 HF 9-3 持续强验证沿用 + Anthropic Sonnet 5 + OpenAI HF Incident 2026-07 IM1 持续沿用)≈ llm-infra 主轴 0 件 NET-new

1.4 inbox/flyp 9-7 全天棒位(llm-infra 主轴 0 件 NET-new)

  • 2026-09-07-0940-RoboTok-critical-read-24h-jump.md(9-7 09:52 CST critical-read · RAG 主轴 · 24h 立标极显著 arXiv:2609.03199 RoboTok 79▲ #7 · llm-infra 主轴 0 件 NET-new · engineering 邻接级预备)
  • 2026-09-07-multimodal-agent-evidence-rewards.md(9-7 15:51 CST critical-read · multimodal/agent 主轴 · llm-infra 主轴 0 件 NET-new · flyp 9-7 17:00 自述"不重复推理基础设施主题")
  • 2026-09-07-multimodal-e1prep.md(9-7 09:43 CST multimodal e1prep · 0 件 NET-new llm-infra)
  • 2026-09-07-risk-e1prep.md(9-7 16:46 CST risk e1prep · 0 件 NET-new llm-infra)
  • 2026-09-07-1000/1001/1004-rss-*.md(flyp 9-7 早棒 4 份 RSS)≈ llm-infra 主轴 0 件 NET-new

1.5 inbox/tom 9-7 棒位(llm-infra 主轴 1 件 NET-new 间接)

  • 2026-09-07-0900-hf-daily-2026-09-07.md(9-7 09:00 CST HF Daily 15 篇 · llm-infra 主轴 1 件 NET-new 预备级 = Random Attention arXiv:2609.03430 164▲ #4 重新思考高效推理中的 KV Cache 淘汰策略 + Knowing When Not to Reuse arXiv:2608.26730 150▲ #5 已锚入 §IX 89 evening v3.16 + WHALE arXiv:2609.00196 30▲ 已锚入 §IX 89 evening v3.16 + Compile by Training arXiv:2609.04199 317▲ #1 已锚入 §IX 92 evening + Terminal-Universe arXiv:2609.04148 272▲ #2 已锚入 §IX 92 evening + On-Policy Distillation II arXiv:2609.04172 78▲ #8 已锚入 §IX 93 evening v3.24 + Gated DeltaNet NVFP4 arXiv:2609.04098 74▲ #9 已锚入 §IX 93 evening v3.24 + Scal3R arXiv:2609.04201 46▲ #11 §IX 89 evening v3.16 + Last Translation Benchmark arXiv:2609.04173 29▲ #15 已锚入 §IX 93 evening v3.24)≈ llm-infra 主轴 1 件预备候选 = Random Attention arXiv:2609.03430(HF Daily 164▲,但未入 paper_card 库,jay engineering-e1prep 仅预备级未锚入)
  • 2026-09-07-agent-rag-longcontext-radar.md(9-7 08:41 CST agent/rag/longcontext 主轴 · 0 件 NET-new llm-infra)
  • 2026-09-07-rag-e1prep.md(9-7 08:51 CST rag e1prep · 0 件 NET-new llm-infra)
  • 2026-09-07-evaluation-e1prep.md(9-7 15:43 CST evaluation e1prep · 0 件 NET-new llm-infra · jay 9-7 inference-systems-kvcache + inference-primitives-disaggregated 标注为 eval 邻接 ✓)
  • 2026-09-07T1440-agent-rag-longcontext-radar.md(9-7 14:40 CST · 0 件 NET-new llm-infra)
  • 2026-09-07-1004-rss-yt-*.md(tom 9-7 早棒 2 份 RSS)≈ llm-infra 主轴 0 件 NET-new

1.6 paper_cards 近 3 天新增(2026-09-04 → 2026-09-07 16:30 · 重点 llm-infra 主分类)

🔴 主分类 llm-infra 仅 1 件 NET-new 入库(本棒亮点): - ✅ paper_cards/1243-2609-04490.md(2026-09-07 16:30 入库 · 主分类 llm-infra · 形态 method · 来源 /inbox/tom/_candidates/2026-09-07-agent-rag-longcontext-candidates.json)— When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference · 引用 GRU encoder-decoder + fluorescence lifetime imaging + 估计两个 lifetime 参数 τ1(短寿命) + τ2(长寿命) · 引入"recurrent-state write-back"规则研究低精度时序推理中量化状态存储规则对后续计算的影响 · 适配性 = 邻接级(专注循环网络 / 荧光寿命成像,非 LLM 推理核心,但概念上可借鉴到 LLM KV Cache 量化写回场景)· arXiv 号 arXiv:2609.04490

🔴 llm-infra 工程邻接级(主分类 engineering 或 agent 副分类)近 3 天 paper_card: - ✅ paper_cards/1224-2609-01072.md(2026-09-07 04:00 入库 · 主分类 engineering) — CORD 沿用 §IX 89 evening v3.16 已锚入 - ✅ paper_cards/1213-2609-00196.md(2026-09-04 入库 · WHALE · 已锚入 §IX 89 evening v3.16) - ✅ paper_cards/1231-2609-04094.md(2026-09-07 04:00 入库 · DRACO · 主分类 agent / 副分类 engineering) — 已锚入 engineering.md v115 §2.7 - ✅ paper_cards/1225-2608-26730.md(2026-09-07 04:00 入库 · Knowing When Not to Reuse · 主分类 engineering) — 已锚入 §IX 89 evening v3.16 - ✅ paper_cards/1226-2609-04201.md(2026-09-07 04:00 入库 · Scal3R · 主分类 engineering) — 已锚入 engineering.md v115 §2.13 - ✅ paper_cards/284-2606-19746.md(2026-09-07 08:00 入库 · SAC CXL · 主分类未知) — jay 0943 重点引用,需 9-7 evening 锚入 §1.(3) KV Cache + §1.(4) 量化 - ✅ paper_cards/213-2607-00924.md(2026-09-07 08:00 入库 · Graph-PRefLexOR · 主分类 engineering) — jay engineering-e1prep 已锚入 engineering.md v115 §2.7 - ✅ paper_cards/1229-2608-30391.md(2026-09-07 04:00 入库 · Grounded Theory Agent Behavior · 主分类 agent) — 评测方法学 - ✅ paper_cards/1223-2609-02367.md(2026-09-07 04:00 入库 · Missing Temporal Link · 主分类 multimodal) — multimodal 主轴

🔴 其他近 3 天 paper_card 与 llm-infra 适配性低: - 1230-2608-29253.md QCell(multimodal 分割)· 1232-2609-04173.md Last Translation Benchmark(evaluation)· 1233-2609-03153.md VeriPhy(agent physical reasoning)· 1234-2609-02887.md Speech BCI(multimodal)· 1236-2609-03199.md RoboTok(rag)· 1237-2609-05232.md Substrate-Aware AI Agents(agent position)· 1238-2609-05339.md Memory Portability(rag+agent)· 1239-2609-05258.md OR-Clarify(evaluation benchmark)· 1240-2609-05295.md RISE Self-Extrapolating Policy Distillation(engineering)· 1241-2609-04523.md MaxKernel Agentic Kernel for TPUs(agent method)· 1242-2609-04061.md Over-Editing Code(evaluation)· 1244-2609-04250.md Motion-Omni Spoken Dialogue(multimodal)· 1227-2609-03820.md Select Compress Reinvest Visual Tokens(multimodal)

主分类 llm-infra 净入库数:1 件(本棒亮点 1243-2609-04490);工程邻接级入库数:6 件;总计净增 7 件可纳入 llm-infra 主题的 paper_card


二、今日今日 llm-infra 主题最重要的 6 条主增量

增量 ① 🟢 arXiv:2608.01526 "An Internet for the KV Cache" 协议范式(Jay 双源独立锚入 0943 + 1505)

来源:inbox/jay/2026-09-07-llm-inference-systems-kvcache.md 条目 1 + inbox/jay/2026-09-07T1505-jay-evening-briefing.md 条目 1(jay 0943 与 jay 1505 双源独立锚入预备)+ inbox/jay/2026-09-07-1105-jay-briefing.md 间接引用

要点: - arXiv:2608.01526 "An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age"(cs.NI · 2026-08 · Siddhant Ray + Nick Feamster + Jiachen Jiang · UIUC/Northeastern · 网络与系统交叉领域) - 范式转变:LLM 推理已从"计算问题"演化为"全球内容分发问题"。KV Cache 复用(跨请求/跨智能体)已是降低推理成本最有效手段,但现有模型侧和系统侧优化各自为战 - 提议:将 KV Cache 视为互联网基础设施的一等公民 — 模型侧压缩(DeepSeek-V3→V4-Pro,100K token KV Cache 从 9GB→1GB,压缩 9 倍)+ 网络传输(10Gbps 链路传 1GB KV Cache 仅 0.8 秒,成本约 $0.09,比 AWS 8×B200 重计算快 19 倍、便宜 5.2 倍)+ 存储调度需要协同设计 - "Internet for KV Cache" 愿景:控制面、协议抽象、度量体系是未来研究方向 - 引用 Mooncake(PD 分离 + 分布式 KV 存储 + 分层)、ShadowKV(本地 KV 卸载 + 稀疏恢复)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.26 §1.(3) KV Cache + LMCache v2 + SGLang HiCache + TokenWeave + DiagEvo + SpecPV + AI Agents Stack 2026 + KV-Cache-as-Internet + Random Attention 等 25+ 篇已锚入论文构成完整 KV Cache 优化技术族 - 本增量与 §IX 91 evening v3.20 已锚入 KV-Cache-as-Internet 概念(arXiv:2608.01526 预备级)正式闭合预备级,将 KV Cache 从"存储优化"升格为"网络分布式资源协议"问题 — 直接强化 §1.(3) KV Cache 协议标准化子轴 + §1.(2) 推理调度 NIXL/Dynamo/llm-d 三栈

建议归入:llm-infra.md §1.(3) KV Cache 子轴升档闭合预备级(与 arXiv:2608.01526 KV-Cache-as-Internet 闭合对齐,§IX 95 morning v3.26 升档正式闭合预备候选)+ §1.(2) 推理调度 NIXL/Dynamo/llm-d 协议层协议层(预备级)

arXiv 号:arXiv:2608.01526(Internet for the KV Cache)

可信度:🟢 高(arXiv cs.NI 2026-08 + UIUC/Northeastern 学术团队 + jay 0943 与 jay 1505 双源独立锚入预备)


增量 ② 🟢 IETF Internet-Draft draft-li-cats-kv-cache-distribution-00 + AsymCache MDA + SAC CXL 三件套(Jay 0943 三源独立锚入)

来源:inbox/jay/2026-09-07-llm-inference-systems-kvcache.md 条目 2 + 条目 3 + 条目 4

要点(三件套独立事件级 NET-new): - IETF Internet-Draft(2026-07 · 文档编号 draft-li-cats-kv-cache-distribution-00 · IETF Datatracker · 有效期至 2026-01-05):明确定义"分布式 LLM 推理中 KV Cache 作为网络分布式资源"的场景;请求调度不再只依赖计算和网络指标,还需考虑目标实例是否有可用 KV Cache 状态;提出 Prefill/Decode 分离场景下的 KV Cache 复用建模;本质是"CDN 思想在 LLM 推理中的应用":把 KV Cache 当作边缘缓存 - arXiv:2606.02964 AsymCache / Multi-Segment Attention(北大团队 Chunan Shi + Yilei Chen + Yilin Chen + Xupeng Miao + Bin Cui · 2026-06 · cs.CL/cs.LG/cs.AR):三大组件 = ① Multi-Segment Attention (MSA) kernel:处理非连续 KV 上下文的注意力计算,解决 GPU 对不同位置 token 计算代价不对称问题 ② 缓存淘汰策略:联合优化命中率和位置感知重计算代价,而非单纯追求 hit rate ③ 自适应分块调度器:保障高硬件利用率 · 70B 模型 + 32K token 上下文仅 KV Cache 就需 >40GB GPU 显存 - arXiv:2606.19746 SAC(Peking University + Alibaba Cloud + Renmin University · 2026-06 · cs.DC · CXL 硬件协同):针对稀疏注意力 LLM(典型:MoE 类模型)的 KV Cache 分解式存储系统;使用 CXL(Compute Express Link)实现 GPU 与内存池的直连 DMA 传输;解决稀疏注意力模式下 KV Cache 分布不均匀、传统 PCIe 带宽瓶颈问题;引用 DeepSeek-v4-pro(2026)、GLM-5.1(2026)作为评估基准

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.26 §1.(3) KV Cache 已有 25+ 篇锚入论文 + Yandex KV Cache as Agent Runtime - 本增量补充了 IETF 草案(协议标准化锚点)+ AsymCache(位置感知 MDA 方法)+ SAC(CXL 硬件层)三个独立锚入预备级,与 §IX 91 evening v3.20 KV-Cache-as-Internet 概念形成"KV Cache 协议标准化 + KV Cache 管理方法学 + KV Cache 硬件加速"三位一体 - 直接强化 §1.(3) KV Cache 协议标准化子轴 + §1.(4) 量化子轴(AsymCache 联合优化 hit rate + 位置感知重计算代价)+ §1.(3) CXL/KV Cache 硬件加速子轴

建议归入:llm-infra.md §1.(3) KV Cache 子轴升档闭合预备级(IETF 草案锚点 + AsymCache + SAC 三件套)+ §1.(4) 量化子轴 AsymCache MDA 方法(预备级)+ §1.(3) CXL/KV Cache 硬件加速子轴 SAC(预备级)

arXiv 号:arXiv:2606.02964(AsymCache MDA)+ arXiv:2606.19746(SAC CXL)+ draft-li-cats-kv-cache-distribution-00(IETF 草案,无 arXiv 号)

可信度:🟢 高(arXiv 2026 + IETF 工作组草案独立来源 + 北大/阿里云/人大联合署名)


增量 ③ 🟢 Ken Huang "The Physics of LLM Inference" Ch.1 Roofline Model(GPU 内存墙量化 SRE 培训级)

来源:inbox/jay/2026-09-07-llm-inference-systems-kvcache.md 条目 5 + inbox/jay/2026-09-07-physics-of-llm-inference.md(完整版) + inbox/jay/2026-09-07-engineering-e1prep.md 增量②

要点: - 来源:kenhuangus.substack.com Chapter 1 Preview(2026-08-31 · 完整版付费) - Roofline Model for LLM Serving 量化: - H100 SXM5 FP8 = 峰值 1,979 TFLOPS / HBM3 带宽 3.35 TB/s / Ridge Point ≈ 591 FLOP/byte - 单 token decode(batch=1)在 H100 FP8 下仅达 0.3% 峰值算力(内存带宽瓶颈) - 70B FP8 权重传输 70 GB / 3.35 TB/s ≈ 20.9 ms;Tensor Core 实际计算 ≈ 0.07 ms比值 298:1(内存墙) - 单流 decode 无法有效利用 GPU — HBM 带宽是主要瓶颈,不是算力 - 理论上需要 B≈296 个独立 stream 并行才能达到 H100 ridge;但 KV Cache 内存和延迟 SLO 先于算力限制 batch size - TTFT 分解:Tqueue + Tprefixlookup + Tprefillcompute + Tsample - HPA 陷阱(CSDN 生产案例):HPA 配置只看 CPU 使用率,LLM 推理瓶颈永远在 GPU 显存和 PCIe 带宽;并发请求把显存打到 98% 时,HPA 因 CPU 正常而毫无反应

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.26 §1.(1) 推理引擎全景已覆盖 vLLM + SGLang + TensorRT-LLM + TGI + llama.cpp + Ollama + LMDeploy 等 25+ 件锚入;§1.(12)(v) Harness Reliability 已建立推理工程学科化框架 - 本增量提供了 SRE 培训级可量化的"GPU 内存墙"数据 — 直接强化 §1.(1) 推理引擎方法学子轴的"GPU 物理约束"理论基础,与 §1.(11) Kernel/AI 自动化/Harness 的 Roofline-aware kernel 生成形成方法学闭环 - HPA 陷阱数据直接强化 §1.(2) 推理调度的"调度器应感知 GPU 内存而非 CPU"原则

建议归入:llm-infra.md §1.(1) 推理引擎方法学子轴"GPU 物理约束"理论基础新增(Roofline Model 量化 + H100/B200 ridge point 表 + 70B decode step 298:1 内存墙)+ §1.(2) 推理调度子轴"HPA 陷阱"案例新增(GPU 显存 vs CPU 使用率)

arXiv 号:无(Ken Huang Substack 非论文,§1.(1) 锚入预备级,标注"付费内容勿复制")

可信度:🟢 高(Ken Huang 为 LLM 工程布道者,有书籍出版记录,Roofline Model 理论有公开文献支撑;具体数值 1979 TFLOPS / 3.35 TB/s / 591 FLOP/byte / 20.9 ms / 0.07 ms / 298:1 比值 需 §IX 95 morning 原文核验)


增量 ④ 🟢 Inference Primitives Disaggregated: NIXL + Dynamo 1.0 + llm-d 三栈 + KV Cache 四层分层(Jay 0943 + Jay 1452 + jay 1505 evening 三源独立锚入)

来源:inbox/jay/2026-09-07-1105-jay-briefing.md 间接 + inbox/jay/2026-09-07-inference-primitives-disaggregated.md(primitivesai.substack.com · Seth Hobson · 2026-03-28)+ inbox/jay/2026-09-07T1505-jay-evening-briefing.md(KubeCon Amsterdam 2026 Gateway API v1.5 + Inference Gateway GA + wg-ai-gateway)

要点(Jay 0943 + 1452 + 1505 三源独立锚入预备): - disaggregated prefill/decode 架构已从论文进入生产:NVIDIA Dynamo 1.0 和 llm-d(CNCF Sandbox)形成两条竞争路径,NIXL 作为共同传输层实现互通。KV cache 正成为一等公民,需跨 GPU HBM / CPU DRAM / SSD / 对象存储分层管理 - NVIDIA Dynamo 1.0(Apache 2.0) = 推理操作系统(inference OS);核心组件 = KV-aware smart router + radix tree 全局块注册表 + 弹性扩缩容;语言 = Rust + Python - llm-d(CNCF Sandbox · 2026-03-24 入 Sandbox · Red Hat / IBM / Google Cloud / CoreWeave / NVIDIA 联合背书) = Kubernetes 原生推理编排;核心 = Gateway API Inference Extension(GAIE)+ Endpoint Picker(EPP)sidecar + Workload Variant Autoscaler(WVA) - NIXL(NVIDIA Inference Transfer Library) = 推理场景的动态扩展、实时负载均衡、自适应内存管理;传输支持 RDMA、GPU-Direct、zero-copy networking;事实上的推理数据传输标准,同时被 Dynamo + llm-d + vLLM + SGLang + LMCache 采纳 - Tensormesh($4.5M seed)= 分布式 KV cache 中间件,跨请求 tensor 复用;理念 = KV cache 应成为"S3"一样的独立基础设施层 - 生产 trace 基准:23,000 请求,Qwen3-32B,8×H100,微软 AKS benchmark;量化性能提升 2-7× 吞吐,20×TTFT 改善;TTFT SLO 约束下 request capacity 提升 2.25× - KVBM 四级 KV 缓存分层:GPU HBM / CPU DRAM / 本地 SSD / 对象存储 - KubeCon Amsterdam 2026:Gateway API v1.5 创纪录一次性 5 个功能入 Standard = ListenerSet + TLSRoute + Client Certificate Validation + Native CORS Filter on HTTPRoute + Gateway API 已不只是 Ingress 继承者,正在成为 K8s 网络通用控制面 - ingress-nginx 正式归档(KubeCon Amsterdam 2026 · 运行 8 年 · 275 个 release · 19500 GitHub stars);官方提供 ingress2gateway v1.0 转换工具 - K8s v1.37 Garhwal(2026-09-02 · 67 项增强):Metrics API GA + HPA scales-to-zero GA(LLM 推理 Serverless 场景)+ Gang scheduling beta + DRA 成熟度提升 - Inference Gateway GA(CNCF Blog · 2026-03):K8s 原生 API,支持按模型名/LoRA adapter/端点健康路由推理流量;wg-ai-gateway新工作组:正在开发 AI 特定网络标准 - AWS Load Balancer Controller GA Gateway API(2026-08-26 · InfoQ):AWS 云上 K8s 网络进入 Gateway API 时代

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.26 §1.(2) 推理调度 + State of Model Serving Apr 2026 + KServe v0.17.0 + llm-d + SIG-kv-disagg + Bento Inference Platform + K8s v1.37 HPA Scale-to-Zero + Dell ObjectScale GPUDirect RDMA + CNCF 2026 + K8s Agent Sandbox 2026-03-20 + ARMO Kagent + Pulumi Neo + Mooncake Store 池化全局调度 → v3.25 闭合 已完整锚入 - 本增量提供了 disaggregated serving 三栈 = NIXL + Dynamo 1.0 + llm-d 完整生态 + KVBM 四级 KV 缓存分层 + K8s Gateway API v1.5 + Inference Gateway GA + ingress-nginx 归档 + AWS LBC GA — 直接强化 §1.(2) 推理调度子轴 + §1.(3) KV Cache 子轴 + §1.(11) Kernel/AI 自动化/Harness 子轴 - 与 §IX 94 morning v3.25 闭合的 Mooncake Store 池化全局调度形成"生产级 disagg 三栈 + Mooncake 池化"的全局调度基础设施完整拼图

建议归入:llm-infra.md §1.(2) 推理调度子轴升档闭合预备级(disagg 三栈 NIXL + Dynamo + llm-d + K8s Gateway API v1.5 + Ingress NGINX 归档 + K8s v1.37 HPA Scale-to-Zero GA + Inference Gateway GA + wg-ai-gateway + AWS LBC GA)+ §1.(3) KV Cache 子轴 KVBM 四级分层 + Tensormesh 中间件预备级

arXiv 号:无(Substack / CNCF Blog / AWS LBC 官方,§1.(2) + §1.(3) 锚入预备级)

可信度:🟢 高(Seth Hobson Substack + KubeCon Amsterdam 2026 官方 + CNCF Blog + AWS 官方 + Microsoft AKS benchmark trace 公开可复现)


增量 ⑤ 🟢 SGLang vs vLLM 双源实测:阿里云函数计算官方 + 掘金稀土 H100 单卡(jay 1220 实测数据强验证)

来源:inbox/jay/2026-09-07T1220-jay-csdn-inference-agent-highvalue.md 条目 2 + 条目 3

要点(两源独立实测强验证): - 阿里云函数计算官方测试(help.aliyun.com/zh/functioncompute/performance-comparison-of-deploying-qwen-models-using-sglang-and-vllm · 测试环境:Ada 系列 GPU 函数计算极速模式 · SGLang v0.4.6.post2-cu124 vs vLLM v0.8.5 · 压测工具:魔搭 evalscope): - 单卡 Qwen:SGLang 吞吐量约 35 tokens/s,vLLM 未披露单卡数据(OOM 或容量不足) - 双卡 Qwen:SGLang 吞吐量约 50 tokens/s,vLLM 约 20 tokens/s(SGLang +150%) - 三卡 Qwen:SGLang 约 20 tokens/s(Ada 单卡显存不足无法运行 vLLM) - TTFT:SGLang 双卡较单卡提升最高 50%,vLLM 提升最高 25% - SGLang 启动速度比 vLLM 快约 30%(分钟级启动) - 显存利用率:两者启动后均接近 100%(模型参数 + KV Cache) - 关键发现:SGLang 在双卡张量并行场景下扩展效率显著优于 vLLM(50% vs 25% TTFT 提升) - 掘金稀土深度实测(H100 单卡 Qwen2.5-7B · SGLang vs vLLM): - 总吞吐量:SGLang 16,215 tok/s vs vLLM 12,553 tok/s(+29%) - 输出 Token 吞吐:SGLang 893.82 tok/s vs vLLM 412.99 tok/s(+116%) - 首 Token 延迟(TTFT):SGLang 79.42 ms vs vLLM 102.65 ms(SGLang 快 23%) - Token 间延迟(ITL):SGLang 6.03 ms vs vLLM 7.14 ms(SGLang 快 16%) - SGLang Token 延迟波动更小,vLLM 波动较大 - 投机解码(Speculative Decoding):2025-2026 年已进生产环境,不改模型权重,不增显存占用,草稿模型仅目标模型 1/10 大小

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.26 §1.(1) 推理引擎全景已有 vLLM/SGLang/LMDeploy/TensorRT-LLM H100 横评 + vLLM 0.23.0 vs SGLang 0.5.13 RunInfra 1.02x 极窄差距 + FreeToken Edge MoE Serving → v3.22 闭合 + vLLM RDT 48 节点 7.53 秒 + vLLM Inside vLLM 41 分钟 + Mooncake ACM 2025 KVCache-centric Disagg → v3.23 闭合 - 本增量提供了 2026 年最新版本实测(SGLang v0.4.6.post2-cu124 / vLLM v0.8.5 + Qwen2.5-7B H100 单卡 + Ada 双卡 + 阿里云函数计算官方测试)数据,直接补充 §1.(1) 推理引擎横评预备级,与 §IX 89 morning v3.15 已锚入的 RunInfra 数据形成"RunInfra H100 极窄差距 + 阿里云函数计算官方 +150% 双卡 TTFT + 掘金 H100 +29% 总吞吐 + +116% 输出 + SGLang TTFT/ITL 双优"的完整 SGLang vs vLLM 选型决策框架

建议归入:llm-infra.md §1.(1) 推理引擎方法学子轴 SGLang vs vLLM 横评补强预备级(阿里云函数计算官方 + 掘金 H100 双源实测)+ §1.(5) 投机解码子轴补强预备级(草稿模型仅目标模型 1/10 大小,生产环境已 2025-2026)

arXiv 号:无(阿里云函数计算官方 + 掘金稀土 双源实测,§1.(1) 锚入预备级,版本 SGLang v0.4.6.post2-cu124 / vLLM v0.8.5 偏旧,建议参考相对趋势而非绝对数字)

可信度:🟢 高(阿里云函数计算官方测试 + 掘金稀土 H100 实测 双源独立,版本虽偏旧但相对趋势仍具参考价值)


增量 ⑥ 🟡 paper_card 1243 arXiv:2609.04490 主分类 llm-infra 入库(适配性 = 邻接级)

来源:/shared/research-kb/organized/paper_cards/1243-2609-04490.md(2026-09-07 16:30 入库 · 主分类 llm-infra · 形态 method · 来源 /inbox/tom/_candidates/2026-09-07-agent-rag-longcontext-candidates.json)

要点: - 标题:When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference - 核心:Quantization is widely used to reduce the computational and memory demands of neural-network inference. In recurrent networks, however, the quantized state is stored and returned at the next time step, so the rule used to store that state can alter subsequent computations. Here, we introduce recurrent-state write-back to denote this rule and isolate its effect in a compact GRU encoder-decoder for fluorescence lifetime imaging, a molecular imaging modality used in quantitative biological imaging. A central task is estimating two lifetime parameters, the short-lived component τ1 and the long-lived component τ2 - 应用域:荧光寿命成像分子成像(quantitative biological imaging)·非 LLM 推理引擎核心 - 概念:引入"recurrent-state write-back"规则研究低精度时序推理中量化状态存储规则对后续计算的影响 - 适配性:邻接级 — 专注循环网络(GRU)+ 荧光寿命成像(非 LLM/Transformer 推理),但概念上可借鉴到 LLM KV Cache 量化写回场景(KV Cache write-back 在 vLLM/SGLang 中已有类似概念,但本论文聚焦 RNN 而非 Transformer)

与活文档 knowledge/llm-infra.md 现有脉络的关系: - v3.26 §1.(4) 量化子轴已锚入 KV-Cache-as-Internet + Random Attention + SpecPV + CacheBridge + HeadWiseKV + VestigeKV + NeuroPrefetcher + Almost Free State Prediction Separation + KV Cache Management Survey + Harvest P2P GPU Caching 等 15+ 篇 - 本增量(arXiv:2609.04490)与 §1.(4) 量化子轴概念相近(quantization breaks memory),但应用域不同(GRU 循环网络 vs Transformer KV Cache) - 适配性 = 邻接级,建议作为 §1.(4) 量化子轴的"RNN 时序推理量化写回"预备级案例,而非 LLM 推理核心锚入

建议归入:llm-infra.md §1.(4) 量化子轴"RNN 时序推理量化写回"邻接级预备(recurrent-state write-back 概念 vs Transformer KV Cache write-back 概念对照)

arXiv 号:arXiv:2609.04490

可信度:🟡 中(paper_card 1243 入库 2026-09-07 16:30,主分类 llm-infra 但应用域为荧光寿命成像,与 LLM 推理核心适配性为邻接级,概念可借鉴但非直接锚入)


三、值得警惕的矛盾 / 待核实说法(3 条)

矛盾 ① ⚠️ 沿用 D146 v3.26 PyTorch Conf 议程一致性 vs 边界争议(本棒未闭合,持续沿用)

矛盾内容: - §IX 94 evening v3.26 已锚入的 PyTorch Conference NA 2026 vLLM Sessions 全栈议程 出现以下待核争议点(本棒未发现新证据,持续沿用 O483 v3.26 待核集合): - KV Push connector 完整实现 + 适用边界:Futurum 引用"Nemotron disagg P/D Pareto-dominates co-located"是否过度简化(整篇 vLLM Conf 2026 / PyTorch Conf NA 2026 议程公告中未出现"跨并发级别 Pareto-dominates"量化数据) - KV cache leases 失效语义统一性:Mistral AI + Amazon + Red Hat 三方合作中"hybrid-model transfer with heterogeneous TP + bidirectional KV transfer + KV cache leases for reliability"三组件的失效语义边界尚未官方文档化 - Native Tiered KV Cache Offloading in vLLM(Ozeri IBM · 上游集成无外部依赖)的具体调度边界(何时触发 NVMe offload + 如何处理并发写回 + 与 Mooncake 三层存储 GPU HBM/DDR/SSD 的对比) - 20+ 加速器硬件 portability(TPU + Trainium + Intel GPUs + Arm CPUs + IBM Spyre)实际 TP 性能 vs 跨厂商声明一致性(各加速器厂商实测数据未公开) - attention abstractions overhaul 对 vLLM plugin 生态的迁移成本(下游 plugin 需重写适配时间未官方文档化)

待核建议:沿用 O483 v3.26 截止 9-14 前,本棒未发现新证据,持续沿用预备级待核集合

矛盾 ② ⚠️ arXiv:2609.03430 Random Attention HF Daily 164▲ vs paper_card 未入库矛盾(本棒新发现)

矛盾内容: - inbox/tom/2026-09-07-0900-hf-daily-2026-09-07.md 条目 #4 = Random Attention arXiv:2609.03430 重新思考高效推理中的 KV Cache 淘汰策略 · HF Daily 164▲ · 2026-09-06 入库 - jay engineering-e1prep 增量⑤ = "Random Attention ... paper_card 待建卡"(标记为预备级,未锚入) - stephen 协调棒 + paper_cards/ 抽查:arXiv:2609.03430 在 2026-09-07 16:30 前未入 paper_card 库(work-queue.md 待建卡 = 0,但 paper_card Random Attention 文件未出现) - 矛盾:HF Daily 投票较高(164▲ #4)但 paper_card 未及时入库;可能原因 = ① work-queue.md 待建卡统计滞后 ② Random Attention 主分类可能被标记为 llm-infra 或 agent 但分类待 LLM 确认 ③ paper_card 富化(TLDR)环节待 cron_s2 覆盖

待核建议:Random Attention arXiv:2609.03430 应在 §IX 95 morning 棒位预备中确认 paper_card 入库状态;若 9-7 evening 仍未入库,应在 9-8 morning cron 标记为 P0 待核

矛盾 ③ ⚠️ arXiv:2609.04490 paper_card 1243 主分类 llm-infra 适配性争议(本棒新发现)

矛盾内容: - paper_card 1243 (2026-09-07 16:30 入库) 主分类标记为 llm-infra + 形态 method - 但论文应用域为 GRU encoder-decoder for fluorescence lifetime imaging(荧光寿命成像分子成像,定量生物成像),与 LLM 推理核心 / Transformer KV Cache 适配性为邻接级而非直接锚入级 - 来源 /inbox/tom/_candidates/2026-09-07-agent-rag-longcontext-candidates.json(tom 候选清单)可能存在分类标定争议 - 矛盾:paper_card 主分类 llm-infra(本棒)vs 论文实际应用域(GRU 循环网络 + 荧光寿命成像)存在 1-2 级适配性 gap

待核建议:paper_card 1243 arXiv:2609.04490 主分类建议降为 engineering 或 multimodal(rag 邻接),或在 §IX 95 morning 棒位预备时明确标注"RNN 时序推理量化写回 · LLM 邻接级"以避免误导后续读图者


四、可引用的 arXiv 号清单(本棒净增)

arXiv 号 标题 适配性 状态
arXiv:2608.01526 An Internet for the KV Cache: Rethinking Classical Infrastructure Boundaries in the LLM Inference Age 🟢 核心 本棒增量 ① · §IX 91 evening v3.20 已锚入预备级 + jay 0943 + jay 1505 双源独立锚入
arXiv:2606.02964 Multi-Segment Attention: Enabling Efficient KV-Cache Management for Faster Large Language Model Serving(AsymCache) 🟢 核心 本棒增量 ② · jay 0943 锚入预备级
arXiv:2606.19746 SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL 🟢 核心 本棒增量 ② · jay 0943 + paper_card 284(2026-09-07 08:00 入库)双源独立锚入预备级
arXiv:2604.12218 LLM-Enhanced Log Anomaly Detection: A Benchmark Study 🟡 中(LLM4Ops) jay 0943 锚入预备级 · engineering 主轴
arXiv:2502.07115v5 Online Scheduling for LLM Inference with KV Cache Constraints(MIT Operations Research Center) 🟢 核心 jay 1505 evening 锚入预备级 · §1.(2) 推理调度子轴预备
arXiv:2609.04490 When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference 🟡 邻接(RNN) 本棒增量 ⑥ · paper_card 1243 入库主分类 llm-infra · 适配性争议待核
arXiv:2609.03430 Random Attention: 重新思考高效推理中的 KV Cache 淘汰策略 🟢 核心 HF Daily 164▲ #4 · paper_card 待建卡(本棒矛盾 ② 待核)
arXiv:2609.04201 Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction 🟡 工程邻接 §IX 89 evening v3.16 已锚入
arXiv:2608.26730 Knowing When Not to Reuse: 自主 LLM 后训练中的条件经验迁移 🟡 工程邻接 §IX 89 evening v3.16 已锚入
arXiv:2609.00196 WHALE: 联合 Harness-Weight 优化的简单配方 🟡 工程邻接 §IX 89 evening v3.16 已锚入
arXiv:2609.04094 DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training 🟡 工程邻接 已锚入 engineering.md v115 §2.7
arXiv:2607.00924 Graph-PRefLexOR: 图原生 RL 科学假设生成 🟡 工程邻接 engineering.md v115 §2.7 锚入
arXiv:2609.01072 CORD(锚入工程主轴) 🟡 工程邻接 §IX 89 evening v3.16 已锚入
arXiv:2608.16157 FreeToken: Edge-Native MoE Serving 🟢 核心 §IX 92 morning v3.21 已锚入沿用
arXiv:2603.03589 Stratum: A System Infrastructure for Massive Agent-Centric ML Workloads(PVLDB 2026 Vol. 19 No. 11) 🟢 数据库邻接 jay 1105 锚入预备级
arXiv:2607.02558 MLSYS·IM: ML Systems Infrastructure Modeling 🟢 系统邻接 jay 1105 锚入预备级
arXiv:2604.02460 Single-Agent LLMs Outperform Multi-Agent on Multi-Hop Reasoning(Equal Token Budget) 🟡 agent 评测 jay 1505 evening 锚入预备级

本棒净增 arXiv 号(7 件核心锚入预备级): 1. arXiv:2608.01526(Internet for the KV Cache · 增量 ①) 2. arXiv:2606.02964(AsymCache MDA · 增量 ②) 3. arXiv:2606.19746(SAC CXL · 增量 ②) 4. arXiv:2604.12218(LLM-Enhanced Log Anomaly Detection · 增量 ②) 5. arXiv:2502.07115v5(Online Scheduling for LLM Inference with KV Cache Constraints · 增量 ④ 间接) 6. arXiv:2609.04490(Recurrent-State Write-Back · 增量 ⑥ · paper_card 1243 NET-new 入库) 7. arXiv:2609.03430(Random Attention · 矛盾 ② 待核 · HF Daily 164▲ 未入 paper_card)

可引用 IETF 草案(1 件): - draft-li-cats-kv-cache-distribution-00(2026-07 · IETF Datatracker · 增量 ②)

沿用 arXiv 号(预备级)(v3.26 已锚入 / engineering.md v115 已锚入 / jay engineering-e1prep 已预备): - arXiv:2609.04201 / arXiv:2608.26730 / arXiv:2609.00196 / arXiv:2609.04094 / arXiv:2607.00924 / arXiv:2609.01072 / arXiv:2608.16157 / arXiv:2603.03589 / arXiv:2607.02558 / arXiv:2604.02460

本棒净增 CVE(1 件沿用): - CVE-2026-61539(xinference 2026-09-04 GitLab Advisory · §IX 92 morning v3.21 已锚入沿用)


五、本棒净窗口与今日主题活文档 §IX 94 evening v3.26 微调棒的关系

5.1 活文档闭合状态(2026-09-07 14:00 CST · §IX 94 evening v3.26 微调棒已闭合)

  • v3.26 微调棒全量沿用 v3.25 + PyTorch Conference NA 2026 vLLM Sessions 全栈议程事件级 NET-new 锚入 → v3.26 闭合(4h 前刚闭合)
  • arXiv/CVE/DOI/URL 311/36/13/444→448(净增 4 件 NET-new URL · 0 件 NET-new arXiv · 0 件 NET-new DOI · 0 件 NET-new CVE)
  • D146 v3.26 新增 + O483 v3.26 新增 + P0 #228 v3.26 新增 + T125 §IX 94 evening v3.26 新增

5.2 本棒(§IX 95 morning 棒位预备候选 · 2026-09-07 18:40 CST · 4h40m 接力净窗口)

  • 6 条主增量 + 1 件 paper_card NET-new 入库(主分类 llm-infra · 适配性 = 邻接级)
  • 0 件 NET-new arXiv 锚入(全部预备级,§1.(2)/(3)/(4) 各子轴预备级候选)
  • 0 件 NET-new CVE / DOI / URL 锚入
  • 3 件矛盾/待核(D146 v3.26 沿用 + Random Attention paper_card 待建卡矛盾 + arXiv:2609.04490 主分类适配性争议)

5.3 沿用预备级候选(§IX 95 morning v3.26 升档正式闭合预备候选)

  • §1.(1) 推理引擎方法学:Roofline Model 量化(SRE 培训级)· SGLang vs vLLM 双源实测
  • §1.(2) 推理调度:disagg 三栈 NIXL + Dynamo + llm-d + K8s Gateway API v1.5 + Ingress NGINX 归档 + K8s v1.37 HPA Scale-to-Zero GA + Inference Gateway GA + wg-ai-gateway + AWS LBC GA
  • §1.(3) KV Cache:Internet for KV Cache(协议范式)+ IETF 草案(协议标准化)+ AsymCache MDA(管理方法学)+ SAC CXL(硬件加速)+ KVBM 四级 KV 缓存分层 + Tensormesh 中间件
  • §1.(4) 量化:RNN 时序推理量化写回(recurrent-state write-back · paper_card 1243 arXiv:2609.04490 邻接级)

5.4 棒位预备触发条件(§IX 95 morning)

  • Random Attention arXiv:2609.03430 paper_card 入库确认(矛盾 ② 待核 · 9-8 morning cron 标记为 P0 待核)
  • arXiv:2609.04490 paper_card 1243 主分类适配性争议闭环(矛盾 ③ 待核 · 9-8 morning cron 标记 P0 待核)
  • PyTorch Conf NA 2026 vLLM Sessions 实战报告出炉(D146 v3.26 沿用待核集合截止 9-14)
  • §IX 95 morning v3.26 升档棒候选 = Internet for KV Cache + IETF 草案 + AsymCache + SAC + Roofline Model + disagg 三栈 6 件事件级 NET-new 锚入闭合预备

六、本棒与今夜主题活文档(llm-infra.md)更新建议

6.1 建议今夜更新优先级(高 → 低)

🔴 高优先级(今夜必更新): - 无 — 本棒净增 0 件 NET-new arXiv 锚入 + 0 件 NET-new CVE/DOI/URL 锚入,符合"§IX 94 evening 微调棒刚闭合后晚棒接力"性质,今夜活文档沿用 §IX 94 evening v3.26 微调棒 + 6 件预备级候选即可

🟡 中优先级(今夜可更新): - §1.(1) 推理引擎方法学子轴:Roofline Model 量化 + SGLang vs vLLM 双源实测(阿里云函数计算官方 + 掘金稀土)预备级锚入 - §1.(2) 推理调度子轴:disagg 三栈 NIXL + Dynamo + llm-d + K8s Gateway API v1.5 + Ingress NGINX 归档 + K8s v1.37 HPA Scale-to-Zero GA + Inference Gateway GA + wg-ai-gateway + AWS LBC GA 预备级锚入 - §1.(3) KV Cache 子轴:Internet for KV Cache + IETF 草案 + AsymCache MDA + SAC CXL + KVBM 四级分层 + Tensormesh 中间件预备级锚入

🟢 低优先级(今夜可选): - §1.(4) 量化子轴:RNN 时序推理量化写回(recurrent-state write-back · paper_card 1243 arXiv:2609.04490 邻接级)锚入(若主分类适配性争议闭环)

6.2 建议今夜不更新

  • §0 一句话综述沿用 v3.26 微调棒(无 NET-new 闭合事件)
  • §0.5 SOTA v3.26 沿用(无 NET-new 升档闭合)
  • §3 共识与争议沿用 C1-C324 + D1-D146(无 NET-new 共识/争议)
  • §4 开放问题沿用 O1-O483 + P0 #1-#228(无 NET-new 开放问题)
  • §5 趋势沿用 T1-T125(无 NET-new 趋势)

6.3 沿用预备级候选(§IX 95 morning v3.26 升档正式闭合预备)

  • §1.(1) 推理引擎方法学:Roofline Model + SGLang vs vLLM 双源实测 → §IX 95 morning 升档正式闭合预备
  • §1.(2) 推理调度:disagg 三栈 NIXL + Dynamo + llm-d + K8s Gateway API v1.5 + Ingress NGINX 归档 + K8s v1.37 HPA Scale-to-Zero GA + Inference Gateway GA + wg-ai-gateway + AWS LBC GA → §IX 95 morning 升档正式闭合预备
  • §1.(3) KV Cache:Internet for KV Cache + IETF 草案 + AsymCache MDA + SAC CXL + KVBM 四级分层 + Tensormesh 中间件 → §IX 95 morning 升档正式闭合预备
  • §1.(4) 量化:RNN 时序推理量化写回(arXiv:2609.04490 邻接级)→ §IX 95 morning 升档正式闭合预备(若主分类适配性争议闭环)

七、本棒自评(精简)

准确性 ✅:6 条主增量全部带具体来源(URL/官方源/arXiv 号)+ 1 件 NET-new paper_card 1243 arXiv:2609.04490 入库主分类 llm-infra + 3 件矛盾/待核沿用(全部已标注矛盾编号 + 沿用状态)+ 7 件可引用 arXiv 号清单 + 1 件可引用 IETF 草案 + 1 件沿用 CVE-2026-61539 · 全部带 §IX 棒位编号与活文档 §IX 94 evening v3.26 微调棒闭合沿用基线对位。

深度 ✅:6 条主增量覆盖 §1.(1) 推理引擎方法学(Roofline Model + SGLang vs vLLM 双源实测)+ §1.(2) 推理调度(disagg 三栈 NIXL + Dynamo + llm-d + K8s Gateway API v1.5)+ §1.(3) KV Cache(Internet for KV Cache + IETF 草案 + AsymCache + SAC + KVBM 四级分层)+ §1.(4) 量化(RNN 时序推理量化写回)四维全景预备级 + 1 件 §1.(11) Kernel/AI 自动化/Harness 子轴预备级。

遗漏 ❌:❌ Random Attention arXiv:2609.03430 paper_card 入库状态(矛盾 ② 待核)· ❌ arXiv:2609.04490 paper_card 1243 主分类适配性争议闭环(矛盾 ③ 待核)· ❌ D146 v3.26 PyTorch Conf 议程一致性争议实战报告(沿用截止 9-14)· ❌ 阿里云函数计算官方测试版本偏旧(SGLang v0.4.6.post2-cu124 / vLLM v0.8.5 2026 年已更新较多,相对趋势而非绝对数字)。

矛盾 ✅:D146 v3.26 沿用 + Random Attention arXiv:2609.03430 HF Daily 164▲ vs paper_card 未入库矛盾(本棒新发现)+ arXiv:2609.04490 paper_card 1243 主分类 llm-infra vs 实际应用域 GRU 循环网络 + 荧光寿命成像适配性争议(本棒新发现)。

修订 ✅:6 条主增量 + 1 件 NET-new paper_card 1243 + 3 件矛盾/待核沿用 + 7 件可引用 arXiv 号 + 1 件 IETF 草案 + 1 件沿用 CVE + §IX 95 morning 棒位预备候选 → §IX 95 morning 升档正式闭合预备候选。


状态输出

  • 状态:已 ok
  • 增量条数:6 条主增量 + 1 件 NET-new paper_card 入库(主分类 llm-infra · paper_card 1243 arXiv:2609.04490)+ 1 件矛盾延展(D146 v3.26 沿用)+ 1 件矛盾新发现(Random Attention paper_card 待建卡矛盾)+ 1 件矛盾新发现(arXiv:2609.04490 主分类适配性争议)+ 1 件安全事件沿用(CVE-2026-61539 xinference)
  • 涉及 arXiv 号:7 件 = arXiv:2609.04490 + arXiv:2608.01526 + arXiv:2606.02964 + arXiv:2606.19746 + arXiv:2604.12218 + arXiv:2502.07115v5 + arXiv:2609.03430 + 10 件沿用预备级
  • 涉及 IETF 草案:draft-li-cats-kv-cache-distribution-00(2026-07)
  • 涉及 CVE:CVE-2026-61539(沿用 · xinference 2026-09-04 GitLab Advisory)
  • 下一步:§IX 95 morning 棒位预备候选 → 沿用预备级候选 = §1.(1) Roofline Model + SGLang vs vLLM 双源实测 + §1.(2) disagg 三栈 + §1.(3) Internet for KV Cache + IETF 草案 + AsymCache + SAC + §1.(4) RNN 时序推理量化写回(适配性争议待核)