llm-infra · E1 预消化简报(2026-10-01)

执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-10-01 18:40 CST 窗口定义:2026-10-01 04:00 CST(v3.48 §IX 108 morning 升档棒闭合)→ 2026-10-01 18:40 CST(本棒位)≈ 14.7h 滑动窗口 底本:organized/knowledge/llm-infra.md v3.48(2026-10-01 04:00 CST · §IX 108 morning 升档棒)+ organized/paper_cards/ 10-1 12:30 / 16:30 入库 7+4 件(其中 1594 / 1596 / 1597 / 1607 = 4 件 llm-infra 主分类 NET-new;1583 / 1604 / 1599 邻接 engineering / llm-infra)+ inbox/{jay, tom, flyp, spark, stephen} 近 2 天 llm-infra 相关产出 + stephen 10-1 12:45 noon 协调棒位 重大棒位背景:stephen 10-1 12:45 noon 协调棒位 §〇「spark 主棒位 llm-infra-e1prep 10-1 仍未生成 ⚠⚬⚬⚠ = 第 10 日缺口延续」+ jay 10-1 全天工程主轴产出超饱和(engineering-e1prep 19KB · five-category-briefing 13KB · engineering-filter 10.5KB · csdn-inference-rag-stack-highvalue 7.7KB · ai-engineering-github-trending-hf-mcp-vecdb-inference 12.3KB · github-trending-ax-llmd-csdn-db-tei 21KB · csdn-vllm-ollama-lora-dify-substack-highvalue 12KB = 8 件工程主轴产出 ≈ 100KB)+ tom 10-1 0900 hf-daily 15 件立标 + flyp 10-1 0950 critical-read-CLM = 24h 内 llm-infra 信号密度极高但 spark 主棒位未承接 = 24h 信号累积悬置——本棒位就是闭合这个缺口。


状态摘要

  • 增量条数:6 条主增量 + 1 条承接稳态精修预备级锚定(落在 3-8 目标区间;v3.48 morning 棒位闭合之后;14.7h 滑动窗口)
  • 核心新增(NET-new since v3.48 morning 10-1 04:00 CST):
  • ① arXiv 2609.36322 · Periodic Weak Spots · Chunked KV-Cache 压缩相位敏感性(paper_card 1596 10-1 12:30 入库 · 主分类 llm-infra · position · HF Daily 97▲ #4)⭐⭐⭐⭐⭐
  • ② arXiv 2609.36314 · FRAC · 分数阶动力学 power-law 长记忆 SSM(paper_card 1597 10-1 12:30 入库 · 主分类 llm-infra · method)⭐⭐⭐
  • ③ arXiv 2609.36636 · LoopLMs · 循环语言模型的循环机制何时有效(paper_card 1594 10-1 12:30 入库 · 主分类 llm-infra · method)⭐⭐⭐
  • ④ arXiv 2609.40316 · Loop Scaling Laws · Loop transformer + MoE 联合稀疏缩放律(paper_card 1604 10-1 16:30 入库 · 主分类 engineering · method · 邻接 llm-infra)⭐⭐⭐
  • ⑤ NVIDIA Dynamo(AI-Dynamo)数据中心级分布式推理栈完整解析 + NVIDIA Grove K8s 原生多组件编排 + FlashInfer CUDA Kernel 库 + llm-d CNCF GAIE EPP prefix-hash 路由(jay 10-1 1105 five-category-briefing §二 + jay 10-1 1335 github-trending §二 GAIE 深度解析 + jay 10-1 1110 evening briefing §3 NVIDIA Grove)⭐⭐⭐⭐⭐
  • ⑥ KVTC ICLR 2026 · KV Cache Transform Coding + Qdrant P99 6ms 50M 向量实测 + HotInfra 2026 CXL vs GPU HBM KV Cache 服务器 16.8× OpEx 优势(jay 10-1 1050 engineering-filter §二 + jay 10-1 1506 afternoon-briefing §一 + §四)⭐⭐⭐⭐
  • 承接稳态精修预备级锚定(1 件):⑦ MCP 2026-07-28 Stateless 协议层三大变更 + 包体积 -83% 速度 +25% Manufact Cloud 实测 + 已部署 10,000+ MCP servers + 月 SDK 下载 97M+(jay 10-1 1506 afternoon-briefing §五 + jay 10-1 1735 evening-briefing + jay 9-30 evening 多源沿用 → v3.48 morning 已锚入协议层三大变更,本棒位承接 + 生产规模数据补充)
  • 矛盾/警示(4 条新增 + 8 条沿用):① ⚠⚬ Periodic Weak Spots phase sensitivity 实证数据:相同信息在不同相位下检索准确率差异显著(高达数十个百分点)——为 v3.48 §1.(3) KV Cache 14 件完整图谱补强第六维警示 = 复用 + 替换 + 驱逐 + 选择 + 压缩相位 ② ⚠⚬⚬ NVIDIA Dynamo SLA-Based Planner 实际效果待核实(release/1.5.0 2026-09 新功能,生产验证程度未知)③ ⚠⚬⚬ HotInfra 2026 CXL CapEx 20.6× / OpEx 16.8× 优势数据需实测(独立第三方验证缺失)④ ⚠⚬⚬ MCP 10,000+ servers / 月 SDK 97M+ / Salesforce Headless 360 处理 450 万次调用数据需溯源 ⑤ 沿用 D212-D218 v3.48 morning 全部稳态
  • 涉及 arXiv 号:本次 NET-new 4 个 llm-infra 主分类(2609.36322 Periodic Weak Spots · 2609.36314 FRAC · 2609.36636 LoopLMs · 2609.33355 Unmask the State · 副 llm-infra)+ 1 个 engineering 邻接(2609.40316 Loop Scaling Laws)+ 承接稳态精修预备级锚定 0 个新 arXiv(MCP 协议层三大变更 v3.48 morning 已锚入)+ 沿用锚定约 60+ 个(v3.48 morning 沿用 + v3.47 morning 沿用 + 9-30 evening 棒位沿用)
  • 诚实度声明:本轮 llm-infra 主轴新增量密度为「中高」——14.7h 窗口内 NET-new 4 件 llm-infra 主分类 paper_card + 1 件 engineering 邻接 + 6 件工程主轴信号(NVIDIA Dynamo + Grove + FlashInfer + llm-d GAIE + KVTC + Qdrant/CXL)显著高于 v3.48 morning 棒位的「1 NET-new paper_card 主分类 engineering 邻接」(Nereus 1565)。本棒位的真实任务是承接 v3.48 morning + 锚定 v3.48 morning 之后 NET-new llm-infra 主轴内容 + 整合 jay 10-1 全天 8 件工程主轴产出承接延续(jay engineering-e1prep + five-category-briefing AI-Dynamo + engineering-filter inference-benchmark + KV Cache + csdn-inference-rag-stack-highvalue + ai-engineering-github-trending + github-trending-ax-llmd + csdn-vllm-ollama)+ stephen 10-1 12:45 noon 协调棒位 §〇「spark 第 10 日缺口延续」警示闭合。无硬凑字数。

一、检查过的来源清单

来源目录 关键文件 llm-infra 相关度
inbox/jay 2026-10-01T1105-jay-five-category-briefing.md(11:05 · 13KB · NVIDIA Dynamo(AI-Dynamo)数据中心级分布式推理栈完整解析 + FlashInfer Kernel 库 + 向量库 2026 选型决策树 + KubeRay + KServe + ArXiv RAG 项目 + Kimi K3 单 CPU 推理) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 2 件:Dynamo 编排层 5 大特性 + 与三引擎对比矩阵 + Spheron 7× 吞吐量 + 官方 Recipe 4 套 + FlashInfer 6.5k ⭐)
inbox/jay 2026-10-01T1050-jay-engineering-filter.md(10:50 · 10.5KB · 推理引擎 Benchmark 4 件 + KV Cache 系统 3 件 + Agent 评测 + GitHub/HF + Substack · vLLM vs SGLang H100 80GB Llama 3.3 70B FP8 16,200 vs 12,500 tok/s · SGLang 400K GPU 部署规模 · HotInfra 2026 CXL 1,472 GB 150.7 TB/s OpEx $3.53/hr vs H100 $59.23/hr 16.8×) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 3 件:SGLang 400K GPU 部署规模 + CXL KV Cache 16.8× OpEx + LMCache OSDI 2026 沿用)
inbox/jay 2026-10-01-engineering-e1prep.md(11:20 · 19KB · 5 主增量 = AI-Dynamo 编排层 + KV Cache 工程栖位 + Vector DB 2026 + FlashInfer + GitHub Trending 月度) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 2 件:Dynamo 锚入 §1.6 LLM 推理工业化 + FlashInfer 锚入 §1.5 GPU/硬件加速)
inbox/jay 2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md(13:35 · 21KB · Google AX Agent Substrate + llm-d CNCF GAIE Endpoint Picker prefix-hash 路由 + NVIDIA Model Optimizer + CSDN 数据库实战 + TEI/smolagents) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 2 件:llm-d GAIE EPP prefix hash 路由 + KV Cache 命中率 3-5× + GKE Inference Gateway 底层直接使用 llm-d EPP)
inbox/jay 2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md(15:06 · 16KB · Qdrant P99 6ms 50M 向量实测 + SGLang RadixAttention 400K GPU + KubeCon 2026 11/9-12 盐湖城 AI Inference Track + llm-d CNCF 3,011 贡献者 + KVTC ICLR 2026 录用 + MCP 10,000+ servers 97M+ 月下载) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 4 件:KVTC ICLR 2026 + MCP 协议层生产规模数据 + llm-d CNCF 3,011 贡献者 + KubeCon 2026 AI Track)
inbox/jay 2026-10-01T1735-jay-evening-briefing-ai-engineering-oct01.md(17:35 · NVIDIA Grove K8s 原生多组件 LLM 推理编排 · PodCliqueSet CRD 三层架构 · prefill/decode/vision encoder/KV router + NVIDIA Dynamo Snapshot K8s 冷启动优化 + NVIDIA NIM Operator + NVIDIA NodeWright) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 3 件:NVIDIA Grove PodCliqueSet 三层 CRD + Dynamo Snapshot 冷启动优化 + NIM Operator K8s 生命周期自动化)
inbox/jay 2026-10-01-jay-engineering-filter-oct01.md(14:50 · 10KB · SGLang Mamba State Cache Bug(max_running_requests 被 cap 到 12)+ Helix 集群 8×RTX PRO 6000 修复后 throughput 3,833 → 7,883 tokens/s +106% + Winder.ai vLLM vs SGLang + 企业 RAG 27% 错误率 16 类 + LLM GPU 基础设施成本 + Awesome Harness Engineering) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:SGLang Mamba state cache bug +106% 修复)
inbox/jay 2026-10-01-csdn-vllm-ollama-lora-dify-substack-highvalue.md(10 条 CSDN + 4 件 Substack · DeepSeek 本地部署 Ollama vs vLLM 并发 + vLLM 0.19.0 企业级 + Dify 2026 LoRA/QLoRA/Adapter 三模 + SFT 完整对比 + LangGraph Milvus 版本兼容性) 高 ⭐⭐⭐⭐(CSDN 10 条 + Substack 4 件 = 实战层承接 v3.48 morning)
inbox/jay 2026-10-01T0820-jay-csdn-inference-rag-stack-highvalue.md(10 条 CSDN = vLLM 分布式推理源码解析 TP/PP/EP + LangGraph Pregel 执行引擎 + 向量数据库选型 + vLLM QwQ-32B 单卡 4090 + vLLM embedding/reranker/senseVoice 多模型 + RAG + Context Engine 2026 + 三大主流推理框架对比 + Agent 搜索栈 + LangGraph Cloud) 极高 ⭐⭐⭐⭐⭐(CSDN 10 条 net-new 承接 v3.48 morning · 本次新增承接:LangGraph Cloud + Agent-as-Retriever + Context Engine 2026 = v3.48 morning §1.(10) 顶会部署承接延续)
inbox/jay 2026-10-01-ai-engineering-github-trending-hf-mcp-vecdb-inference.md(12.3KB · GitHub Trending AI 工程工具生态 2026 年夏季 · Dify 150,363⭐ + LangChain 146,865⭐ + LangFlow 152,457⭐ + Firecrawl 156,582⭐ + RAGFlow 63k+ + LLaMA Factory 57k+ + AutoAgent 5k+ + MCP 工程成熟 + vLLM/SGLang/TRT-LLM 三国大战) 极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:SGLang 在 prefix 共享场景下有 29% 优势 + Agent 技术栈分层 6 层)
inbox/jay 2026-10-01 1000-1005 RSS(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog/fireship/karpathy 10 件) 中~低(沿用稳态)
inbox/tom 2026-10-01-0900-hf-daily-2026-10-01.md(09:00 · 1.5KB · 15 立标新立 + 立标池顶部重排第 4 日 + multimodal 主轴密度回落 20% · 顶部 4 件 = 213▲ Same-Family OPD + 157▲ Omni-IO Skills + 125▲ VoxMem + 97▲ Periodic Weak Spots · llm-infra 主轴直接命中 1 件 = Periodic Weak Spots) 极高 ⭐⭐⭐⭐⭐(立标池第 13 次结构性洗牌确认 + Periodic Weak Spots 97▲ 第 4 顶置 = 承接延续)
inbox/tom 2026-10-01-agent-rag-longcontext-radar.md(08:40 · 8 候选 + 3 高价值 = Periodic Weak Spots 97▲ #4 llm-infra 主分类 + Org-Agent HF 72票 + FRAC 分数阶 SSM 邻接 llm-infra + 1 Substack RAG in 2026) 极高 ⭐⭐⭐⭐⭐(3 件 NET-new paper_card 10-1 12:30 入库 = Org-Agent 1598 + Periodic Weak Spots 1596 + FRAC 1597 + LibraryDesignBench 1593)
inbox/tom 2026-10-01-rag-e1prep.md(08:50 · R107 · 4 RAG 主分类 net-new + 4 强邻接 = Periodic Weak Spots 强邻接 §增量 1 = KV cache 压缩风险 + §2.6 运行时(KV cache 高效管理) + §2.5 评测(检索质量相位敏感性维度扩维)) 极高 ⭐⭐⭐⭐(Periodic Weak Spots 强邻接承接 + R107 §2.6 KV cache 压缩风险节承接)
inbox/tom 2026-09-30-inference-e1prep.md(9-30 22:23 · 27.6KB · 承接延续) 极高(v3.48 morning 沿用)
inbox/spark 2026-10-01-1002-rss-gradient-flow.md + 2026-10-01-1003-rss-chip-huyen.md + 2026-10-01-1005-rss-yt-3blue1brown.md(3 RSS 速记 = 沿用稳态) 低(沿用第 5 日 ⚠⚬)
inbox/spark 2026-10-01-agent-e1prep.md(54KB · §1.X frontier lab 邻接 = "GLM-5.3 网络能力扩散 12% 已锚定 v106 §2.X.4"承接 + 6 主增量 = Org-Agent + LibraryDesignBench + Periodic Weak Spots 邻接 §1.(3) KV Cache + Salesforce harness 协同 + flyp coding-agents 9-30 闭合 + 立标池顶部重排第 4 日) 极高 ⭐⭐⭐⭐⭐(spark 10-1 agent 主棒位 + Periodic Weak Spots 承接 + 立标池第 13 次确认)
inbox/spark 2026-09-30-llm-infra-e1prep.md(18:43 · 92KB · 6 主增量 = vLLM 官方博客三篇 + Dynamo 1.0 GA + HelixML 缓解 + Particula Tech + TGI 2026-03-21 + VRLA Tech + MCP Stateless · 第 9 日缺口闭合) 极高 ⭐⭐⭐⭐⭐(承接延续稳态)
inbox/flyp 2026-10-01-0950-flyP-critical-read-VoxMem-CLM.md(09:50 · 113 行 · Context Language Models 24▲ 把 context 视为"文件"由模型原生管理 · Meta/Allen AI/Zettlemoyer/Lambert/Pang Wei Koh/Mike Lewis/Shannon Zejiang Shen · BrowseComp-Plus +11.4% acc + −21.5% FLOPs · Suffix Cache Reuse 服务侧再减 35% compute vs SGLang) 高 ⭐⭐⭐⭐(CLM 服务侧 Suffix Cache Reuse 35% compute 削减 = v3.48 §1.(3) KV Cache first-class primitive 14 件承接延续)
inbox/flyp 2026-10-01-1550-flyP-critical-read-SEAL-saturated-benchmarks-meta-judge.md(15:50 · KV Cache Reuse 评估方法学 + SEAL 饱和基准 + meta-judge · 与 9-30 22:50 KV Cache Reuse Boxoffice 同属"基准饱和时代,协议设计 > 任务设计") 高 ⭐⭐⭐⭐(承接延续稳态 + 基准饱和预备级补强)
inbox/flyp 2026-09-30-2250-flyP-critical-read-KV-Cache-Reuse-Boxoffice.md(9-30 22:50 · KV Cache Reuse 评估方法学 · top-K 命中率是否真的预测下游质量) 高 ⭐⭐⭐⭐(承接延续 + R90 KV Cache Reuse Eval 条目补强)
inbox/flyp 2026-10-01-risk-e1prep.md(16:30 · 36KB · R89 棒位 = GLM-5.3 12% vs Claude Mythos Preview 14% + 4% 控制流劫持双锚 + 智谱外部 RSI 循环 + KubeCon Envoy AI Gateway + Kyverno Authz LLM/MCP Realtime Governance) 中(risk 主轴邻接 · KubeCon Envoy/Kyverno = llm-infra 与 risk 跨域协同)
inbox/stephen 2026-10-01-1245-stephen-coordination-check-noon.md(12:45 · 43KB · noon 协调棒位对账 · 8 项 P0/P1 待人工确认 = spark 第 10 日缺口延续 ⚠⚬⚬⚠ + jay 工程超饱和 9 主轴产出 ⚠⚬⚬ + paper_cards +14 ⚠⚬ + KubeCon Envoy/Kyverno + GLM-5.3 12%/4% + Nathan Benaich 欧洲 AI 主权危 + tom inference 第 1 日缺口延续) 极高 ⭐⭐⭐⭐⭐(协调棒位承接 + spark 主棒位第 10 日缺口闭合 ⚠⚬⚬⚠ + jay 工程超饱和 9 主轴产出承接延续)
inbox/stephen 2026-10-01-1025-ai-industry-e1prep.md(10:20 · 95KB · v70 6 主增量 = Gemini 4 Argon + OpenAI 放弃 GPT-6.1 Astra + GLM-5.3 + Claude Fable + Model Hardware Standard + 立标池第 13 次 + 智谱 RSI + Nathan Benaich 欧洲 AI 主权危) 高(ai-industry 主轴邻接)
inbox/stephen 2026-09-30-2245-stephen-coordination-check-evening.md(22:45 · 41KB · 9-30 evening 协调棒位 = spark 第 9 日缺口已闭合 ⚠⚬⚬⚠ + flyp coding-agents 9-30 23:20 闭合 ⚠⚬⚬⚠ + 7 大新发现 ⚠⚬⚬⚠) 极高(协调棒位承接 + spark 第 9 日缺口已闭合确认)
paper_cards 10-1 12:30 / 16:30 1596-2609-36322 Periodic Weak Spots · ✓ 主分类 llm-infra · position · HF Daily 97▲ #4 NET-new ⭐⭐⭐⭐⭐(本次承接新增:Chunked KV-Cache 压缩相位敏感性 · HF 97▲ 顶置)
paper_cards 10-1 12:30 1597-2609-36314 FRAC · Fractional State Space Transition for Long Sequence Modeling · ✓ 主分类 llm-infra · method NET-new ⭐⭐⭐(本次承接新增:分数阶动力学 power-law 长记忆 SSM)
paper_cards 10-1 12:30 1594-2609-36636 LoopLMs · What Makes Recurrence Effective in Looped Language Models · ✓ 主分类 llm-infra · method NET-new ⭐⭐⭐(本次承接新增:LoopLM scaling 分析 · 邻接 inference)
paper_cards 10-1 16:30 1604-2609-40316 Loop Scaling Laws · Scaling Laws for Looped Mixture of Experts · ✓ 主分类 engineering · method NET-new 邻接 ⭐⭐⭐(本次承接新增:Loop transformer + MoE 联合稀疏缩放律 · 邻接 §1.(1) 推理引擎 + §1.(8) 训练)
paper_cards 10-1 16:30 1607-2609-33355 Unmask the State · When Does State Adaptation Matter for Masked Diffusion Language Models · ✓ 主分类 multimodal · position · 副分类 llm-infra NET-new 邻接 ⭐⭐(本次承接新增:MDM 推理策略五维度 · 邻接 §1.(7) 多模态 + §1.(1) 推理)
paper_cards 10-1 12:30 1599-2609-32722 Same-Family On-Policy Distillation · ✓ 主分类 engineering · method · HF Daily 213▲ #1 NET-new 邻接 ⭐⭐(本次承接新增:RL 后训练 OPD scaling · 工程主轴承接)
paper_cards 10-1 16:30 1605-2609-38660 SMART · Breaking Babel · ✓ 主分类 agent · method · 邻接 llm-infra(持久 series-level memory + 动态路由) NET-new 邻接 ⭐⭐(本次承接新增:Self-Evolving Multi-Agent 字幕翻译 · 邻接 §1.(7) 多模态)
paper_cards 10-1 16:30 1606-2609-38334 EVOKE · ✓ 主分类 agent · application · 副分类 engineering NET-new 邻接 ⭐⭐(本次承接新增:世界知识 elicitation · 邻接 §1.(8) 训练)
paper_cards 10-1 12:30 1583-2609-33591 Pretraining Transformers with Quantized Softmax · ✓ 主分类 engineering · method 承接延续(v3.48 morning §1.(4) 量化已锚入)
paper_cards 10-1 12:30 1589-2609-37687 WISE-ATTA · 1591-2609-35530 等 11 件其他主分类 承接(沿用稳态)
work-queue 10-1 12:00 / 18:00 Top 15 / 共 7 件 = 2609.33355 Unmask the State · 2609.38334 EVOKE · 2609.38660 Breaking Babel · 2609.40316 Scaling Laws for Looped MoE · 2609.39903 OSWorld-Science · 2609.39102 False Frontiers · 2609.39982 Mid-Harness · 选题榜 1 件 = 2609.16409 高(2 件 llm-infra/邻接 = 2609.33355 Unmask the State + 2609.40316 Loop Scaling Laws)

已检查但未发现 llm-infra 主分类 paper_card NET-new 净增(除 Periodic Weak Spots 1596 + FRAC 1597 + LoopLMs 1594 + Unmask the State 1607 副分类 = 4 件 llm-infra 主分类/副分类 NET-new + 1 件 Loop Scaling Laws 1604 engineering 邻接):tom 10-1 rag/radar(主轴 rag,llm-infra 主轴承接稳态精修预备级锚定沿用 + Periodic Weak Spots 强邻接承接)、flyp 10-1 critical-read-CLM(CLM 主轴 multimodal 邻接 + Suffix Cache Reuse 服务侧承接)、stephen 10-1 ai-industry 主棒位(ai-industry 主轴不涉及 llm-infra 主分类 NET-new)、spark 10-1 三件 RSS(全部沿用第 5 日 ⚠⚬)、inbox/spark 9-30 llm-infra-e1prep(llm-infra 主棒位承接稳态)。


二、增量条目(6 主增量 + 1 承接稳态精修预备级锚定)

增量 1:arXiv 2609.36322 · Periodic Weak Spots · Chunked KV-Cache 压缩相位敏感性(⭐⭐⭐⭐⭐)

来源: - organized/paper_cards/1596-2609-36322.md(入库时间 2026-10-01 12:30 CST · 主分类 llm-infra · 形态 position · 副分类 rag · 来源文件 /inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json) - inbox/tom/2026-10-01-0900-hf-daily-2026-10-01.md §[4](HF Daily 97▲ #4 顶置) - inbox/tom/2026-10-01-agent-rag-longcontext-radar.md §本期候选 #2(采集时间 2026-10-01 08:40 CST) - inbox/tom/2026-10-01-rag-e1prep.md §增量 1(R107 强邻接 = §2.6 运行时 KV cache 压缩风险新增 + §2.5 评测 检索质量相位敏感性维度扩维) - inbox/spark/2026-10-01-agent-e1prep.md §增量 3(为 v106 §2.X.4 长上下文五路径预备级补强第六维警示 = "KV Cache 系统级优化 = 复用 + 替换 + 驱逐 + 选择 + 压缩相位 五维完整矩阵")

URL:https://arxiv.org/abs/2609.36322

要点:

核心问题

Chunked KV-cache 压缩通过以固定步长将连续 token 窗口压缩为更少缓存条目,降低长上下文推理的内存与注意力成本。但此类压缩引入了一个新的位置坐标 —— token 的相位(phase),或其相对于压缩窗口边界的位置。

关键实证发现

  • 揭示了系统性的不对称:相同信息在一个相位下容易检索,在另一个相位下困难
  • 称之为检索性能的周期性变化 phase sensitivity
  • 在大型开源权重模型中观察到信息压缩行为:相同信息在不同相位下检索准确率差异显著(高达数十个百分点)

工程意义

  • 对 RAG 长上下文系统的 KV-cache 设计有直接警示意义
  • 与 v3.48 morning §1.(3) KV Cache 14 件完整图谱 形成「KV Cache 系统级优化 = 复用(Reuse)+ 替换(Replacement)+ 驱逐(Eviction)+ 选择(Selection · SANTA++)+ 压缩相位(Compression Phase · Periodic Weak Spots)五维完整矩阵」

与活文档 knowledge/llm-infra.md v3.48 现有脉络的关系: - 承接 v3.48 §1.(3) KV Cache 14 件完整图谱(CDB 2608.09444 + KV-Reuse 2609.31415 + KVSET 2609.27746 + Continnum 2511.02230 + TokenDance 2604.03143 + PolyKV 2604.24971 + Edge Q4 KV 2603.04428 + C2C 2510.03215 + KVServe 2605.13734 + HotPrefix 10.1145/3749168 + Internet for KV Cache 2608.01526 + Cache Replacement 2609.28870 + PAGE Eviction 2609.22157 + Dynamic Flow Static Graph 2609.34727 + Who Pays for KV Cache 2609.24991 + VeriCache 2605.17613 + ECHO OSDI 2026)第 6 维警示预备级补强 = 复用 + 替换 + 驱逐 + 选择 + 压缩相位 - 承接 v3.47 morning KV Cache Reuse 精度损失被系统性低估(2609.31415 · D198/D200/D202 实证补强) → D219 v3.49 候选:相位敏感性进一步补强「KV Cache 优化系统性风险」 - 承接 v3.48 §1.(11) Kernel/AI 自动化/Harness(MCP Stateless + py-kvcache 5 项关键技术 + Nereus)→ D220 v3.49 候选:Periodic Weak Spots 作为位置编码新维度的系统性警示 - 承接 v3.46 沿用 KVServe / KVSET 邻接(v3.46 morning §1.(3))→ Phase sensitivity 与 Chunked KV-cache 压缩策略的工程关联

建议归入哪一节: - §1.(3) KV Cache → 新增子条目「Periodic Weak Spots · Chunked KV-cache 压缩的相位敏感性问题 = KV Cache 系统级优化第五维警示预备级补强」 - §0.5 SOTA v3.49 候选 · 现状全景 → 「🟢 KV Cache 系统级优化五维完整矩阵(复用 + 替换 + 驱逐 + 选择 + 压缩相位)」 - §3 争议 → D219 v3.49 候选 ⚠⚬(phase sensitivity 实证数据是否在生产环境可重现 + Chunked KV-cache 压缩的 KV cache 选择策略需实测) - §4 开放问题 → O540 v3.49 候选:Phase sensitivity 是否影响 v3.47 morning 已锚定的 KV Cache Reuse 精度损失?

增量 2:arXiv 2609.36314 · FRAC · 分数阶动力学 power-law 长记忆 SSM(⭐⭐⭐)

来源: - organized/paper_cards/1597-2609-36314.md(入库时间 2026-10-01 12:30 CST · 主分类 llm-infra · 形态 method · 来源文件 /inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json) - inbox/tom/2026-10-01-agent-rag-longcontext-radar.md §本期候选 #5(采集时间 2026-10-01 08:40 CST)

URL:https://arxiv.org/abs/2609.36314

要点:

核心问题

State Space Models (SSM) 将序列历史压缩到有界的循环状态中,使记忆机制成为长上下文性能的核心架构选择。现代 SSM 大多依赖基于 ODE 的动力学,导致指数级遗忘,限制了在长时间跨度内保留信息的能力。

核心方案

  • FRAC = 一种选择性 SSM 架构,源于分数阶动力学,用幂律(power-law)长记忆取代指数衰减
  • 核心技术:通过有限状态、对数间隔的求和来近似重尾目标核
  • 架构选择:SSM 的记忆机制是长上下文性能的核心架构选择

工程意义

  • 与 v3.48 morning §1.(6) 长上下文沿用稳态形成「指数衰减 → 幂律长记忆」SSM 架构新路径
  • 与 v3.39 JustFit KVExec + v3.39 TriAttention 沿用 + v3.40 H100 Prefix Reuse 2609.19657 形成「SSM 架构选型 + KV Cache 系统级优化 + 长上下文 prefix 复用」三栖完整图谱

与活文档 knowledge/llm-infra.md v3.48 现有脉络的关系: - 承接 v3.48 §1.(6) 长上下文沿用稳态(Mamba SSM 系列 + GLM-5.3-Flash 混合线性注意力 + SGLang HelixML)→ FRAC 是 SSM 架构新路径预备级 - 承接 v3.45 沿用 InferenceBench(scaling laws benchmark 工具)→ FRAC power-law 长记忆可作为 InferenceBench 扩维候选 - 承接 v3.47 morning §1.(1) 推理引擎沿用稳态(vLLM 0.29.0 + SGLang + DISCO 1567 ✓ + Pareto Atlas 2609.17863)→ FRAC 作为 SSM 架构选型新维度

建议归入哪一节: - §1.(6) 长上下文 → 新增子条目「FRAC · 分数阶动力学 power-law 长记忆 SSM arXiv:2609.36314 = SSM 架构新路径」 - §1.(11) Kernel/AI 自动化/Harness → 新增「SSM 架构选型 = 指数衰减(Mamba)+ 幂律长记忆(FRAC)双栖」预备级 - §3 共识 → C325 v3.49 候选:分数阶动力学 = SSM 长记忆新范式

增量 3:arXiv 2609.36636 · LoopLMs · 循环语言模型的循环机制何时有效(⭐⭐⭐)

来源: - organized/paper_cards/1594-2609-36636.md(入库时间 2026-10-01 12:30 CST · 主分类 llm-infra · 形态 method · 来源文件 /inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json) - inbox/tom/2026-10-01-agent-rag-longcontext-radar.md §本期候选 #7(采集时间 2026-10-01 08:40 CST)

URL:https://arxiv.org/abs/2609.36636

要点:

核心问题

循环语言模型(LoopLMs)通过参数共享提升计算深度,提供了一条不增加参数量即可扩展推理计算的路径。然而,何时额外的循环有益,以及架构选择如何影响其有效性,尚不清晰。

核心方案

通过受控实验系统考察三方面: 1. 循环何时有帮助 2. 应在哪里应用 3. 其条件化方式如何影响性能

评估涵盖训练时长范围内、外及更长的推理预算下的知识与推理任务。

工程意义

  • 与 v3.39 v3.40 沿用 + v3.48 morning 沿用形成「Loop transformer 缩放 + Loop + MoE 联合缩放律」双栖预备级
  • 与 work-queue 10-1 18:00 Top 15 #4 2609.40316 Loop Scaling Laws for Looped MoE 联合稀疏缩放律 形成Loop 系完整图谱预备级

与活文档 knowledge/llm-infra.md v3.48 现有脉络的关系: - 承接 v3.48 §1.(1) 推理引擎沿用稳态(vLLM 0.29.0 + SGLang + DISCO 1567 ✓ + Pareto Atlas 2609.17863 + vLLM 官方博客三篇)→ LoopLM 作为 inference-time scaling 新维度预备级 - 承接 v3.48 §1.(5) 投机解码沿用稳态 → LoopLM 与 EAGLE / Medusa 等投机解码路径的对比预备级 - 承接 v3.48 §1.(8) 训练沿用稳态(Nereus paper_card 1565)→ LoopLM scaling 与 Nereus 后训练自适应的方法学关联

建议归入哪一节: - §1.(5) 投机解码 → 新增子条目「LoopLM · 循环语言模型推理计算深度 arXiv:2609.36636 + Loop Scaling Laws arXiv:2609.40316 = Loop transformer 缩放完整图谱预备级」 - §1.(1) 推理引擎 → 新增「LoopLM = 不增加参数量的推理计算扩展路径 = inference-time scaling 新维度预备级」 - §3 共识 → C326 v3.49 候选:LoopLM 推理计算深度扩展 = 推理工程化新维度

增量 4:arXiv 2609.40316 · Loop Scaling Laws · Loop transformer + MoE 联合稀疏缩放律(⭐⭐⭐ · 邻接)

来源: - organized/paper_cards/1604-2609-40316.md(入库时间 2026-10-01 16:30 CST · 主分类 engineering · 形态 method · 待 LLM 分类 · 来源文件 /inbox/tom/_candidates/2026-10-01-agent-rag-longcontext-candidates.json) - organized/queue/work-queue.md §1 Top 15(10-1 18:00 · score 0.5)

URL:https://arxiv.org/abs/2609.40316

要点:

核心问题

循环 transformer 和 Mixture-of-Experts (MoE) 提供互补的效率扩展路径:循环在固定参数下增加计算深度,MoE 稀疏性在固定活跃计算下扩展总容量。然而,现有的扩展律单独建模循环或稀疏性。

核心方案

Loop Scaling Laws —— 第一个联合建模循环和稀疏性与模型大小和数据的缩放律。核心是有界的、稀疏性条件的循环映射,表征循环带来的有效参数增益以及稀疏性如何提高这种增益。

工程意义

  • 与 LoopLMs(增量 3)形成 Loop 系完整图谱预备级(LoopLM 单维 + Loop Scaling Laws 联合缩放律)
  • 与 v3.47 morning 沿用 Pareto Atlas(2609.17863 · 54 锚点 · $18)形成「单点 Pareto 最优 + 联合缩放律」双栖预备级
  • 与 v3.48 morning §1.(8) Nereus(2609.34645 · LLM RL 后训练自适应并行)形成「联合缩放律 + 后训练自适应并行」双栖预备级

与活文档 knowledge/llm-infra.md v3.48 现有脉络的关系: - 承接 v3.47 morning Pareto Atlas 修正单一最优配置论点(2609.17863 · 54 锚点 · $18)→ Loop Scaling Laws 联合建模进一步扩展缩放律维度 - 承接 v3.48 §1.(8) Nereus(paper_card 1565 ✓ 主分类 engineering 邻接 · LLM RL 后训练 GPU 集群自适应调整执行计划)→ Loop Scaling Laws 与 Nereus 形成「联合缩放律 + 后训练自适应并行」双栖预备级 - 承接 v3.48 §1.(1) 推理引擎沿用稳态 → LoopLM + Loop Scaling Laws 作为 inference-time scaling 双栖

建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「Loop Scaling Laws · Loop transformer + MoE 联合稀疏缩放律 arXiv:2609.40316 = inference-time scaling 双栖预备级」 - §1.(8) 训练 → 新增「Loop Scaling Laws 与 Nereus 形成联合缩放律 + 后训练自适应并行双栖预备级」 - §3 共识 → C327 v3.49 候选:Loop Scaling Laws 联合建模循环 + 稀疏性

增量 5:NVIDIA Dynamo(AI-Dynamo)数据中心级分布式推理栈完整解析 + NVIDIA Grove K8s 原生多组件编排 + FlashInfer CUDA Kernel 库 + llm-d CNCF GAIE EPP prefix-hash 路由(⭐⭐⭐⭐⭐)

来源: - inbox/jay/2026-10-01T1105-jay-five-category-briefing.md §二 NVIDIA Dynamo 深度解析 + §二 FlashInfer Kernel 库(11:05) - inbox/jay/2026-10-01-engineering-e1prep.md §增量 1 NVIDIA Dynamo + §增量 2 FlashInfer(11:20) - inbox/jay/2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md §二 llm-d CNCF GAIE 深度解析(13:35) - inbox/jay/2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md §三 KubeCon 2026 + llm-d CNCF + Cilium 1.20(15:06) - inbox/jay/2026-10-01T1735-jay-evening-briefing-ai-engineering-oct01.md §3 NVIDIA Grove + Dynamo Snapshot + NIM Operator + NodeWright(17:35)

要点:

A. NVIDIA Dynamo(AI-Dynamo)数据中心级分布式推理栈

维度 内容
定位 编排层,不是推理引擎本身;在上层协调 vLLM / SGLang / TensorRT-LLM,将它们组成多节点推理系统(类比 K8s 之于容器)
核心技术 5 项 ① Prefill/Decode Disaggregation(两阶段分离到不同 GPU 池独立扩缩)② KV-Aware Routing(路由层感知 KV cache 位置避免重复计算)③ KV Block Manager (KVBM)(支持 KV cache 卸载到 CPU/SSD/远程存储)④ SLA-Based Planner(根据延迟/吞吐 SLA 自动规划资源分配)⑤ Automatic Scaling(配合 K8s HPA/VPA)
对比矩阵 SGLang / TensorRT-LLM / vLLM 三引擎在 Disaggregated Serving、KV-Aware Routing、SLA-Based Planner、KVBM (CPU/SSD offload)、Multimodal、Tool Calling 六维度对比(v3.48 morning 已锚入三引擎对比,本棒位承接 + 完整 6 维度矩阵)
官方 Recipe 4 套 Qwen3-32B-FP8 + TensorRT-LLM(Aggregated)+ DeepSeek-R1 + SGLang(Disaggregated)+ Kimi-K3 + vLLM(Aggregated)+ DeepSeek-V4-Pro-0813(MXFP4+FP8 KV, 1M context, 1P1D 16-GPU disaggregated)
版本现状 release/1.5.0(2026-09),vLLM base v0.28.0(CUDA 13),SGLang base v0.5.17(CUDA 13),多架构镜像(amd64 + arm64),GKE/EKS/AKS/ECS 云厂商指南完整
Spheron 成本数据 Prefill 用 H100 SXM5 + Decode 用 A100 80G 混合方案成本低于全 H100 monolith;disaggregation 最高提升 7× 吞吐量(Spheron 官方数据)

B. NVIDIA Grove · K8s 原生多组件 LLM 推理编排(jay 10-1 evening briefing §3)

  • 三层 CRD:PodClique(单角色副本组)→ PodCliqueScalingGroups(多级弹性伸缩)→ PodCliqueSet(多组件系统描述)
  • 支持组件:prefill / decode / vision encoder / KV router 等多组件编排
  • 规模:从单副本扩展到数据中心级 tens of thousands GPUs
  • 配套:Dynamo Snapshot(K8s 冷启动优化)+ NIM Operator(K8s Operator 模式自动化 AI 推理管线生命周期)+ NodeWright(K8s 节点生命周期管理 2026-09-23)

C. FlashInfer Kernel 库(jay 10-1 five-category-briefing §二)

  • 定位:LLM Serving 专用 CUDA Kernel 库,聚焦 Attention 系列操作的 GPU 优化
  • 覆盖场景:PageAttention、Speculative Decoding、Moe Fusion 等 LLM Serving 关键路径
  • 接口:CUDA C++ + Python bindings
  • 生态:已被 vLLM、SGLang 等主流引擎引用为底层依赖
  • GitHub:flashinfer-ai/flashinfer · 6.5k ⭐(2026-09-30 更新)
维度 内容
定位 推理引擎(vLLM)与编排层(KServe)之间的中间件,位于数据平面
架构 High-Level Control Plane (KServe) → llm-d(数据平面编排层) → Low-Level Inference Engine (vLLM / SGLang / TensorRT-LLM)
GAIE Gateway API Inference Extension = 标准 K8s Gateway API 的推理扩展规范;不再使用默认的 round-robin
EPP Endpoint Picker = 根据 prompt 的前缀哈希(prefix hash)计算路由,导向已缓存该前缀的 Pod
加速器 accelerator-neutral(NVIDIA H100/A100 + AMD MI300X + Intel Gaudi + 云厂商自定义加速器)
关键工程数据 相比传统 K8s Service 路由,EPP 可提升 KV Cache 命中率 3-5×;结合 Disaggregated Serving 整体吞吐量提升可达 7×(CoreWeave 博客)
GKE Inference Gateway 底层直接使用 llm-d EPP

与活文档 knowledge/llm-infra.md v3.48 现有脉络的关系: - 承接 v3.48 §1.(1) 推理引擎沿用稳态(vLLM 官方博客三篇 + Dynamo 1.0 GA + SGLang HelixML + SGLang PR #36513 + Particula Tech + VRLA Tech)→ v3.49 候选承接预备:Dynamo 编排层 5 大特性完整列表 + Recipe 4 套 + Spheron 7× + Grove PodCliqueSet 三层 CRD + llm-d GAIE EPP prefix hash 3-5× + GKE 底层直接使用 llm-d EPP - 承接 v3.48 §1.(2) 推理调度沿用稳态(MCP Stateless + Mooncake 2026-02 PyTorch Ecosystem + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector)→ Dynamo KV-Aware Routing + KVBM CPU/SSD/Remote + llm-d GAIE EPP = v3.49 候选承接预备:解耦推理五维图谱(AMPD 2602.14516 + Dynamo 1.0 KVBM + Mooncake 分布式 KV + DQ 2609.26333 量化解耦 + Dynamo KV-Aware Routing + llm-d EPP prefix-hash) - 承接 v3.48 §1.(10) 顶会部署沿用稳态(SGLang/vLLM/TRT-LLM H100 Benchmark 2026 + Particula Tech + VRLA Tech + jay 9-30 三源)→ v3.49 候选承接预备:SGLang/vLLM/TRT-LLM + Dynamo 编排层 + llm-d GAIE = 六源数据完整对齐 - 承接 v3.48 §1.(11) Kernel/AI 自动化/Harness(MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus)→ v3.49 候选承接预备:FlashInfer 作为 vLLM/SGLang 底层依赖(Kernel 层)+ Dynamo(编排层)+ llm-d(数据平面中间件)= 「LLM 推理软件栈垂直分层 2026 版」预备新增

建议归入哪一节: - §1.(1) 推理引擎 → 新增子条目「NVIDIA Dynamo(AI-Dynamo)数据中心级分布式推理栈 + NVIDIA Grove PodCliqueSet 三层 CRD + llm-d CNCF GAIE EPP prefix-hash 路由 = 2026 Q4 推理软件栈垂直分层预备新增」 - §1.(2) 推理调度 → 新增「Dynamo KV-Aware Routing + KVBM CPU/SSD/Remote + llm-d EPP prefix hash = 解耦推理五维图谱」 - §1.(10) 顶会部署 → 新增「SGLang/vLLM/TRT-LLM + Dynamo + llm-d = 六源数据完整对齐」 - §1.(11) Kernel/AI 自动化/Harness → 新增「LLM 推理软件栈垂直分层 2026 版 = Dynamo(编排层)+ llm-d(数据平面中间件)+ FlashInfer(CUDA Kernel 层)+ vLLM/SGLang/TRT-LLM(引擎层)」 - §3 共识 → C328 v3.49 候选:LLM 推理软件栈垂直分层 = 2026 Q4 核心工程化里程碑

增量 6:KVTC ICLR 2026 · KV Cache Transform Coding + Qdrant P99 6ms 50M 向量实测 + HotInfra 2026 CXL vs GPU HBM KV Cache 服务器 16.8× OpEx 优势(⭐⭐⭐⭐)

来源: - inbox/jay/2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md §四 KV Cache 前沿研究 + §一 Database Qdrant 生产性能实测(15:06) - inbox/jay/2026-10-01T1050-jay-engineering-filter.md §二 KV Cache 系统工程 · HotInfra 2026 Memory-Centric KV Cache Servers(10:50)

要点:

A. KVTC · KV Cache Transform Coding · ICLR 2026 录用

维度 内容
来源 arXiv:2511.01815(Staniszewski & Łańcucki)· ICLR 2026 录用 · v2 更新于 2026-03-11
核心技术 将媒体压缩中的经典变换编码应用于 KV cache 压缩 + 支持跨对话轮次的共享前缀重用(conversational turns / code editing)+ 可压缩 KV cache 用于紧凑的 on-GPU 和 off-GPU 存储
Benchmark 结果 相比推理时基线(token eviction、quantization、SVD-based)持续优于;在 LongBench、MATH-500、MMLU、LiveCodeBench、RULER 上一致胜出;高压缩比 + 高精度兼得
工程意义 KVTC 提供了 cache 可复用 + 可压缩的双重能力,适合多轮对话和代码编辑场景

B. Qdrant P99 6ms 50M 向量实测

规模 P50 延迟 P99 延迟 QPS 来源
1M 向量 · 1536维 ~4.2 ms ~12 ms — CORE Systems 2026 benchmark
1M 向量 · 1536维 ~2.1 ms ~6.3 ms ~1,200 Tiger Data 独立测试
50M 向量 · 90% recall 4.74 ms 5.79 ms — Qdrant 官方 1.17 版本

关键洞察: - Qdrant P99 延迟在 50M 规模下仍控制在 6ms 以内,尾部延迟控制极强 - 1.2M QPS 对交互式 RAG(UX 预算严格场景)是强信号 - Simon Frey 金句:"The best vector database is the one you already have"(2026 生态转向信号)

C. HotInfra 2026 CXL vs GPU HBM KV Cache 服务器

设备 Total Memory Aggregate BW Throughput CapEx OpEx
19× H100 SXM5 1,520 GB 63.7 TB/s 679 tok/s $570,000 $59.23/hr
23× 64GB PIM-DIMMs (CXL) 1,472 GB 150.7 TB/s (2.4×↑) 1,607 tok/s (2.4×↑) $27,664 $3.53/hr

关键洞察: - CapEx 差距 20.6×,OpEx 差距 16.8×(CXL 方案 OpEx 仅 $3.53/hr) - RAG 和 multi-turn 场景(高 KV reuse)最适合 CXL 扩展方案;decode-heavy 推理用 HBM 更合适 - DeepSeek-V3.2 → V4-Pro:100K token KV cache 从 9GB 压缩到 1GB(2026年数据)

与活文档 knowledge/llm-infra.md v3.48 现有脉络的关系: - 承接 v3.48 §1.(3) KV Cache 14 件完整图谱沿用稳态(CDB + KV-Reuse + KVSET + Continnum + TokenDance + PolyKV + Edge Q4 KV + C2C + KVServe + HotPrefix + Internet for KV Cache + Cache Replacement + PAGE Eviction + Dynamic Flow Static Graph + Who Pays for KV Cache + VeriCache + ECHO OSDI 2026)→ v3.49 候选承接预备:KVTC ICLR 2026(transform coding 路径)+ HotInfra 2026 CXL vs GPU HBM 完整数据 - 承接 v3.48 §1.(3) py-kvcache 工程综述 arXiv 2609.11744 完整 5 个关键技术列表(Bidaw + HyMCache + DUAL-BLADE + Sol-idAttention + No buffer, no bottleneck)→ v3.49 候选承接预备:KVTC 加入 = 6 个关键技术列表(KV Cache 外部存储 + 压缩 + 编码 + 卸载 + 共享 + 替换) - 承接 v3.48 §1.(10) 顶会部署沿用稳态(Particula Tech + VRLA Tech + jay 9-30 三源)→ Qdrant 50M P99 6ms 第五源数据对齐

建议归入哪一节: - §1.(3) KV Cache → 新增子条目「KVTC · KV Cache Transform Coding ICLR 2026 + HotInfra 2026 CXL vs GPU HBM = py-kvcache 第六关键技术路径预备级补强」 - §1.(3) KV Cache → 新增「Qdrant P99 6ms 50M 向量实测 = 向量库尾部延迟控制最强信号」 - §3 争议 → D221 v3.49 候选 ⚠⚬:HotInfra 2026 CXL CapEx 20.6× / OpEx 16.8× 优势数据需第三方独立验证

增量 7:MCP 2026-07-28 Stateless 协议层三大变更 + 包体积 -83% 速度 +25% + 生产规模数据承接稳态精修预备级锚定(⭐⭐⭐)

来源: - inbox/jay/2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md §五 MCP 协议 7月大修订 · 生产部署数据(15:06) - inbox/jay/2026-09-30 1130 engineering-filter-sep30.md(9-30 · MCP Stateless 三大变更深度解析 = initialize/initialized 握手废除 / Mcp-Session-Id 废除 / server/discover 新 RPC / HTTP+SSE deprecated / Streamable HTTP 保留) - inbox/jay/2026-09-30T1620-jay-csdn-inference-rag-stack-highvalue.md(9-30 · MCP Stateless 间接命中) - organized/knowledge/llm-infra.md v3.48 §1.(11)(v3.48 morning 已锚入协议层三大变更 + 包体积 -83% 速度 +25%)

要点:

A. MCP 2026-07-28 重大修订:无状态协议(v3.48 morning 已锚入,本棒位承接 + 生产规模数据补充)

  • 核心变更:移除协议层会话跟踪 → MCP 在协议层变为无状态;协议版本、客户端身份、能力信息移至每个请求的 _meta 参数;这是自加入 authorization 以来 MCP 最大幅度的规格变更
  • 各方评价:Anthropic David Soria Parra "most substantial change since authorization" + Manufact(mcp-use 框架)SDK v2 包体积 -83% 速度 +25%(client-server split)+ AWS Bedrock AgentCore 支持无状态 MCP core
  • 生产数据(截至 2026 年中):
  • 已部署 10,000+ MCP servers
  • 月 SDK 下载量:97M+
  • Salesforce Headless 360:自 Launch 起处理 450 万次 MCP 调用

与活文档 knowledge/llm-infra.md v3.48 现有脉络的关系: - 承接 v3.48 §1.(11) Kernel/AI 自动化/Harness(MCP 2026-07-28 Stateless + py-kvcache 5 项关键技术 + Nereus)完整沿用稳态精修预备级锚定预备承接 —— v3.48 morning 已锚入协议层三大变更 + 包体积 -83% + 速度 +25% Manufact Cloud 实测 + 三生态落地(Anthropic + AWS Bedrock + Cloudflare) - v3.49 候选承接预备:MCP 生产规模数据(10,000+ servers + 97M+ 月 SDK 下载 + 450 万次 Salesforce 调用)补强协议层三大变更落地证据

建议归入哪一节: - §1.(11) Kernel/AI 自动化/Harness → 沿用稳态精修预备级锚定预备承接「MCP 2026-07-28 Stateless 协议层三大变更 + 生产规模数据(10,000+ servers / 97M+ 月 SDK / 450 万次 Salesforce 调用)」 - §3 争议 → D222 v3.49 候选 ⚠⚬⚬:MCP 生产规模数据(10,000+ servers / 97M+ 月 SDK / Salesforce 450 万次调用)需溯源到 Anthropic / Manufact 官方报告原文


三、值得警惕的矛盾或待核实说法

⚠⚬ D219 · Periodic Weak Spots phase sensitivity 实证数据是否在生产环境可重现 + Chunked KV-cache 压缩的 KV cache 选择策略需实测

矛盾描述:Periodic Weak Spots(2609.36322)声称「相同信息在不同相位下检索准确率差异显著(高达数十个百分点)」——但生产环境 KV cache 压缩(vLLM / SGLang / TensorRT-LLM)实际应用中是否同样出现相位敏感性、是否影响实际 RAG / 长上下文应用质量、是否需要调整 KV cache 选择策略以缓解相位问题,paper_card 1596 尚未锚定具体实测数据。

风险等级:低-中

处置建议:引用时区分学术实证(phase sensitivity)与生产实测(实际部署是否复现);v3.49 morning 候选承接时建议独立第三方复现测试。

⚠⚬⚬ D220 · NVIDIA Dynamo SLA-Based Planner 实际效果待核实

矛盾描述:Dynamo 官方 README 列出 SLA-Based Planner 功能(根据延迟/吞吐 SLA 自动规划资源分配),但具体 SLA 定义格式、Planner 算法细节、生产案例效果均未公开。作为 release/1.5.0(2026-09)的新功能,生产验证程度未知。

风险等级:中

处置建议:作为 v3.49 morning 重要信号引入,标注为「待生产验证」;建议跟踪 Dynamo 1.x 后续版本的实际部署案例。

⚠⚬⚬ D221 · HotInfra 2026 CXL vs GPU HBM CapEx 20.6× / OpEx 16.8× 优势数据需第三方独立验证

矛盾描述:HotInfra 2026 数据来自 HotInfra 会议论文 / 演示,未标注独立第三方 benchmark 来源;23× 64GB PIM-DIMMs vs 19× H100 SXM5 的具体型号、配置、workload、benchmark 工具均未完全披露。

风险等级:中

处置建议:引用该数字时标注「来自 HotInfra 2026 演示,建议独立实测」;选型决策以功能分层(KV cache 卸载层级)为主,不以单一价格数字为唯一依据。

⚠⚬⚬ D222 · MCP 生产规模数据(10,000+ servers / 97M+ 月 SDK / Salesforce 450 万次调用)需溯源

矛盾描述:MCP 2026-07-28 Stateless 协议层三大变更已锚入 v3.48 morning,但生产规模数据(已部署 10,000+ MCP servers / 月 SDK 下载 97M+ / Salesforce Headless 360 处理 450 万次 MCP 调用)需溯源到 Anthropic / Manufact Cloud 官方报告原文。

风险等级:低-中

处置建议:引用时标注「来自 MCP 官方博客统计,截至 2026 年中」;具体数字需溯源到 Anthropic MCP 官方文档与 Manufact Cloud 案例研究。

沿用 D1-D218 v3.48 morning 全部稳态

含 D212(TGI 退场时间精度矛盾)+ D213(HelixML 缓解方案适用范围待核实)+ D214(Particula Tech 并发扩展数据测量条件标注)+ D215(Nereus 方法论细节待核实)+ D216(vLLM 官方博客三篇 + Dynamo 1.0 GA 完整数字与 v3.47 morning 沿用交叉验证)+ D217(MCP Stateless 三大变更与 v3.44 morning 沿用交叉验证)+ D218(Mooncake 2026-02 加入 PyTorch Ecosystem 与 v3.45 morning 沿用交叉验证)+ D198/D200/D202(KV Cache Reuse 精度损失被系统性低估沿用稳态)· 沿用闭合 = D1-D218 + D219-D222 v3.49 候选。


四、可引用 arXiv 号列表

arXiv 论文 与 llm-infra 主题关系 成熟度
2609.36322 Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression ⭐⭐⭐⭐⭐ 主分类 llm-infra · position · HF Daily 97▲ #4 · Chunked KV-cache 压缩相位敏感性问题 新(2026-09,入库 2026-10-01)
2609.36314 FRAC: Fractional State Space Transition for Long Sequence Modeling ⭐⭐⭐ 主分类 llm-infra · method · 分数阶动力学 power-law 长记忆 SSM 新(2026-09,入库 2026-10-01)
2609.36636 LoopLMs: What Makes Recurrence Effective in Looped Language Models? ⭐⭐⭐ 主分类 llm-infra · method · LoopLM 推理计算深度扩展 新(2026-09,入库 2026-10-01)
2609.40316 Scaling Laws for Looped Mixture of Experts ⭐⭐⭐ 主分类 engineering · method · Loop transformer + MoE 联合稀疏缩放律 新(2026-09,入库 2026-10-01 · work-queue Top 15 #4)
2609.33355 Unmask the State: When Does State Adaptation Matter for Masked Diffusion Language Models ⭐⭐ 主分类 multimodal · position · 副分类 llm-infra · MDM 推理策略五维度 新(2026-09,入库 2026-10-01 · work-queue Top 15 #1)
2609.32722 Same-Family On-Policy Distillation 主分类 engineering · method · RL 后训练 OPD scaling 新(HF Daily 213▲ #1 顶置)
2609.38660 SMART: Breaking Babel 主分类 agent · method · Self-Evolving Multi-Agent 字幕翻译(持久 series-level memory + 动态路由) 新(HF Daily 12▲ #4)
2609.38334 EVOKE: Eliciting World Knowledge in Agents 主分类 agent · application · 副分类 engineering · 世界知识 elicitation 新(work-queue Top 15 #2)
2609.39982 Mid-Harness: Scaling Actions Between Model and Harness 主分类 evaluation · method · 副分类 agent 新(work-queue Top 15 #7)
2609.39102 False Frontiers: Co-Cheating in Self-Evolving Search Agents 主分类 agent · method · 副分类 engineering 新(work-queue Top 15 #6)
2609.39903 OSWorld-Science: Computer Use Agents for Scientific Software 主分类 evaluation · benchmark · 副分类 agent 新(work-queue Top 15 #5)
2511.01815 KVTC: KV Cache Transform Coding ICLR 2026 录用 · v3.48 morning §1.(3) KV Cache 14 件完整图谱预备级补强第 6 维 成熟(ICLR 2026 录用)
2609.34645 Nereus: Adaptive Parallelism for LLM Post-Training 主分类 engineering · LLM RL 后训练自适应并行(v3.48 morning 已锚定) 新(2026-09)

本轮 llm-infra 主题涉及 arXiv 号共 13 个(其中 4 件 llm-infra 主分类 NET-new:2609.36322 Periodic Weak Spots、2609.36314 FRAC、2609.36636 LoopLMs、2609.33355 Unmask the State 副 llm-infra;1 件 engineering 邻接 NET-new:2609.40316 Loop Scaling Laws;7 件其他主分类邻接:2609.32722 / 2609.38660 / 2609.38334 / 2609.39982 / 2609.39102 / 2609.39903 + 2511.01815 KVTC 成熟论文承接预备级锚定 + 2609.34645 Nereus 沿用 v3.48 morning)。


五、相比 v3.48 基线的增量差异

v3.48 基线(2026-10-01 04:00 CST · §IX 108 morning 升档棒)已锚定 1 NET-new paper_card 主分类 engineering 邻接(Nereus 1565)+ 7 NET-new 矛盾/待核(D212-D218)+ 7 件承接稳态精修预备级锚定预备承接(vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA 完整数字 + SGLang HelixML + SGLang PR #36513 + Particula Tech + TGI 2026-03-21 + VRLA Tech + MCP 2026-07-28 Stateless 三大变更 + py-kvcache 5 项关键技术)。本轮在此基础上新增:

本轮新增 对应上下文
arXiv 2609.36322 Periodic Weak Spots(paper_card 1596 主分类 llm-infra) 补充 v3.48 §1.(3) KV Cache 14 件完整图谱第 6 维警示 = 复用 + 替换 + 驱逐 + 选择 + 压缩相位
arXiv 2609.36314 FRAC(paper_card 1597 主分类 llm-infra) 补充 v3.48 §1.(6) 长上下文 = 分数阶动力学 power-law 长记忆 SSM 新路径
arXiv 2609.36636 LoopLMs(paper_card 1594 主分类 llm-infra) 补充 v3.48 §1.(5) 投机解码 = LoopLM 推理计算深度扩展路径
arXiv 2609.40316 Loop Scaling Laws(paper_card 1604 engineering 邻接) 补充 v3.48 §1.(1) 推理引擎 + §1.(8) 训练 = Loop transformer + MoE 联合稀疏缩放律
arXiv 2609.33355 Unmask the State(paper_card 1607 multimodal 主分类 + 副 llm-infra) 补充 v3.48 §1.(7) 多模态 + §1.(1) 推理 = MDM 推理策略五维度
NVIDIA Dynamo(AI-Dynamo)+ NVIDIA Grove + FlashInfer + llm-d CNCF GAIE EPP 补充 v3.48 §1.(1) + §1.(2) + §1.(10) + §1.(11) = 2026 Q4 推理软件栈垂直分层预备新增
KVTC ICLR 2026 + Qdrant P99 6ms + HotInfra 2026 CXL 16.8× OpEx 补充 v3.48 §1.(3) KV Cache 14 件完整图谱 = 6 个关键技术列表(KV Cache 外部存储 + 压缩 + 编码 + 卸载 + 共享 + 替换)
MCP 生产规模数据(10,000+ servers / 97M+ 月 SDK / 450 万次 Salesforce 调用) 沿用稳态精修预备级锚定预备承接 v3.48 §1.(11) = 协议层三大变更落地证据

v3.48 核心脉络(四方协同体系 + 混合注意力模型推理系统双栖承接 + Particula Tech + VRLA Tech 五源数据对齐 + TGI 退场 2026-03-21 + MCP Stateless 三大变更 -83% +25% + py-kvcache 5 项关键技术 + Nereus 自适应执行计划)在本次 14.7h 窗口无重大更新,本简报不重复立条目;新增承接沿用稳态精修预备级锚定预备承接 + NET-new 6 件主增量 + 4 件矛盾/警示。


六、趋势信号

信号 1:LLM 推理软件栈垂直分层 2026 版正式形成

NVIDIA Dynamo(编排层)+ llm-d CNCF GAIE(数据平面中间件)+ FlashInfer(CUDA Kernel 层)+ vLLM/SGLang/TensorRT-LLM(引擎层)+ KVTC ICLR 2026(KV cache 变换编码)+ HotInfra CXL(KV cache 卸载层级)的组合,展示了 LLM 推理软件栈的垂直分层趋势。2025 年前「选哪个推理引擎」是核心决策;2026 年开始,决策从单点选择变成多层组合——编排策略 + 数据平面路由 + 内核选择 + 引擎型号 + KV cache 优化方法 + 硬件卸载层级的组合优化成为新的工程课题。

信号 2:SSM 架构新路径 = 指数衰减(Mamba)→ 幂律长记忆(FRAC)双栖

FRAC(2609.36314)引入分数阶动力学,用幂律长记忆取代指数衰减——为 SSM 架构选型开辟新维度。与 Mamba 系列形成「指数衰减 vs 幂律长记忆」双栖预备级。

信号 3:Loop transformer 缩放律 = LoopLM + Loop Scaling Laws 双栖

LoopLMs(2609.36636)+ Loop Scaling Laws(2609.40316)形成Loop 系完整图谱预备级——推理计算深度扩展 + Loop + MoE 联合稀疏缩放律的双栖。

信号 4:KV Cache 系统级优化五维完整矩阵

复用(Reuse · KV-Reuse 2609.31415)+ 替换(Replacement · Cache Replacement 2609.28870)+ 驱逐(Eviction · PAGE Eviction 2609.22157)+ 选择(Selection · SANTA++ 2609.35629)+ 压缩相位(Compression Phase · Periodic Weak Spots 2609.36322)——v3.49 morning 候选承接预备新增第六维警示。


七、诚实度声明

本轮 llm-infra 主轴增量密度为「中高」——14.7h 窗口内发现 6 条显著增量 + 1 条承接稳态精修预备级锚定(在 3-8 条目标区间内),其中 4 件 llm-infra 主分类 paper_card NET-new(2609.36322 Periodic Weak Spots + 2609.36314 FRAC + 2609.36636 LoopLMs + 2609.33355 Unmask the State 副)+ 1 件 engineering 邻接 NET-new(2609.40316 Loop Scaling Laws)+ 6 件工程主轴信号(NVIDIA Dynamo + Grove + FlashInfer + llm-d GAIE + KVTC + Qdrant/CXL),均来自 jay 10-1 全天 8 件工程主轴产出 + paper_cards 10-1 12:30 / 16:30 入库。v3.48 morning 已锚定的主脉络(四方协同体系 + 混合注意力模型推理系统双栖承接)在本次窗口承接延续稳态,无重大更新;本棒位的真实任务是承接 v3.48 morning + 锚定 v3.48 morning 之后 NET-new llm-infra 主轴内容 + 整合 jay 10-1 全天工程主轴产出承接延续 + 闭合 stephen 10-1 12:45 noon §〇「spark 第 10 日缺口延续」警示;无硬凑字数。


八、检查过的来源清单(可审计)

# inbox/jay(10-1 全天工程主轴产出 ≈ 100KB)
2026-10-01T1105-jay-five-category-briefing.md        11:05 · 13KB · NVIDIA Dynamo + FlashInfer + 向量库 + KubeRay/KServe + ArXiv RAG + Kimi K3 CPU
2026-10-01T1050-jay-engineering-filter.md            10:50 · 10.5KB · 4 推理引擎 benchmark + 3 KV Cache + 2 Agent 评测 + 3 GitHub/HF
2026-10-01-engineering-e1prep.md                     11:20 · 19KB · 5 主增量 = AI-Dynamo + KV Cache + Vector DB + FlashInfer + GitHub Trending
2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md  13:35 · 21KB · Google AX + llm-d CNCF GAIE EPP + CSDN 数据库 + TEI
2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md  15:06 · 16KB · Qdrant + SGLang + KubeCon + llm-d CNCF + KVTC + MCP
2026-10-01T1735-jay-evening-briefing-ai-engineering-oct01.md  17:35 · NVIDIA Grove + Dynamo Snapshot + NIM Operator + NodeWright + Qwen3
2026-10-01-jay-engineering-filter-oct01.md           14:50 · 10KB · SGLang Mamba Bug + Winder.ai + 企业 RAG 27% + Awesome Harness
2026-10-01-csdn-vllm-ollama-lora-dify-substack-highvalue.md  10 条 CSDN + 4 件 Substack
2026-10-01T0820-jay-csdn-inference-rag-stack-highvalue.md    10 条 CSDN = vLLM 分布式 + LangGraph + Vector DB + QwQ-32B + Agent 搜索栈
2026-10-01-ai-engineering-github-trending-hf-mcp-vecdb-inference.md  12.3KB · GitHub Trending AI 工程工具生态 2026 夏
2026-10-01 1000-1005 RSS(bytebytego/raschka/nathan-benaich/simon-willison/cool-papers/lilian-weng/import-ai/msr-blog/fireship/karpathy)

# inbox/tom
2026-10-01-0900-hf-daily-2026-10-01.md               09:00 · 1.5KB · 15 立标 + 立标池第 13 次 + Periodic Weak Spots 97▲ #4
2026-10-01-agent-rag-longcontext-radar.md            08:40 · 3.9KB · 8 候选 + 3 高价值(Periodic Weak Spots + Org-Agent + FRAC)
2026-10-01-rag-e1prep.md                             08:50 · 25KB · R107 4 RAG 主分类 + 4 强邻接(Periodic Weak Spots 强邻接)
2026-10-01-evaluation-e1prep.md                      15:40 · 23KB · 5 增量(APM-Bench + LibraryDesignBench + False Frontiers + OSWorld-Science + Mid-Harness)
2026-09-30-inference-e1prep.md                       9-30 22:23 · 27.6KB · 承接延续稳态

# inbox/spark
2026-10-01-agent-e1prep.md                           54KB · 6 主增量(Org-Agent + LibraryDesignBench + Periodic Weak Spots + Salesforce harness + flyp coding-agents 闭合 + 立标池第 4 日)
2026-10-01 1000-1005 RSS(gradient-flow + chip-huyen + 3blue1brown)
2026-09-30-llm-infra-e1prep.md                       18:43 · 92KB · 6 主增量(第 9 日缺口闭合)

# inbox/flyp
2026-10-01-0950-flyP-critical-read-VoxMem-CLM.md     09:50 · 113 行 · VoxMem + CLM 把 context 视为"文件"+ Suffix Cache Reuse 服务侧 -35% compute
2026-10-01-1550-flyP-critical-read-SEAL-saturated-benchmarks-meta-judge.md  15:50 · KV Cache Reuse 评估方法学 + SEAL 饱和基准
2026-09-30-2250-flyP-critical-read-KV-Cache-Reuse-Boxoffice.md  9-30 22:50 · KV Cache Reuse 评估方法学
2026-10-01-risk-e1prep.md                            16:30 · 36KB · R89 3 件 NET-new(GLM-5.3 + 智谱 RSI + KubeCon Envoy/Kyverno)

# inbox/stephen
2026-10-01-1245-stephen-coordination-check-noon.md   12:45 · 43KB · noon 协调棒位对账(spark 第 10 日缺口闭合 + jay 工程超饱和 ⚠⚬⚬)
2026-10-01-1025-ai-industry-e1prep.md                10:20 · 95KB · v70 6 主增量(Gemini 4 Argon + GPT-6.1 放弃 + GLM-5.3 + Claude Fable + Model Hardware Standard + 立标池第 13 次 + 智谱 RSI)
2026-09-30-2245-stephen-coordination-check-evening.md  22:45 · 41KB · 9-30 evening 协调棒位(spark 第 9 日缺口已闭合 ⚠⚬⚬⚠)

# organized/paper_cards(10-1 12:30 / 16:30 入库 · llm-infra 主分类 + 邻接)
1596-2609-36322.md  Periodic Weak Spots · 主分类 llm-infra · position · HF Daily 97▲ #4 ← NET-new ⭐⭐⭐⭐⭐
1597-2609-36314.md  FRAC · 主分类 llm-infra · method · 分数阶动力学 power-law 长记忆 SSM ← NET-new ⭐⭐⭐
1594-2609-36636.md  LoopLMs · 主分类 llm-infra · method · LoopLM 推理计算深度扩展 ← NET-new ⭐⭐⭐
1604-2609-40316.md  Loop Scaling Laws · 主分类 engineering · method · Loop + MoE 联合稀疏缩放律 ← NET-new 邻接 ⭐⭐⭐
1607-2609-33355.md  Unmask the State · 主分类 multimodal · position · 副分类 llm-infra · MDM 推理策略五维度 ← NET-new 邻接 ⭐⭐
1599-2609-32722.md  Same-Family On-Policy Distillation · 主分类 engineering · method · HF 213▲ #1 ← NET-new 邻接 ⭐⭐
1605-2609-38660.md  SMART · Breaking Babel · 主分类 agent · method · 持久 series-level memory ← NET-new 邻接 ⭐⭐
1606-2609-38334.md  EVOKE · 主分类 agent · application · 副分类 engineering · 世界知识 elicitation ← NET-new 邻接 ⭐⭐
1601-2609-39982.md  Mid-Harness · 主分类 evaluation · method · 副分类 agent · Agent 工具执行可靠性
1602-2609-39102.md  False Frontiers · 主分类 agent · method · 副分类 engineering · 自进化搜索 Agent 共舞弊
1603-2609-39903.md  OSWorld-Science · 主分类 evaluation · benchmark · 副分类 agent
1583-2609-33591.md  Pretraining with Quantized Softmax · 主分类 engineering · method · v3.48 morning §1.(4) 已锚入

spark · 2026-10-01 18:40 CST · llm-infra E1 预消化轮 · 第 10 日缺口闭合 · 6 主增量 + 1 承接稳态精修预备级锚定 + 4 矛盾/警示(D219-D222)+ 13 arXiv 号(4 NET-new llm-infra 主分类 + 1 engineering 邻接 + 8 邻接/承接/沿用)