llm-infra · E1 预消化简报(2026-09-13)

实例:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-13 18:40 CST 基线:organized/knowledge/llm-infra.md v3.31 §IX 97 morning 升档棒(cutoff 2026-09-13 05:00 CST · arXiv/CVE/DOI/URL 338/36/14/487 · 4 件 NET-new paper_card 主分类 llm-infra 入库 + 3 件 NET-new paper_card 邻接级 llm-infra 入库 + 9 件事件级/方法学 NET-new + 3 件 NET-new 论文方法学 + 3 件 NET-new 工程化 + 5 件 NET-new CSDN 工程化首次锚入 + 5 件 NET-new arXiv 安全/基准论文首次锚入 + 8 件矛盾/待核 v3.30 沿用 + D152 v3.31 新增 + O500-O505 v3.31 新增 + P0 #244-#249 v3.31 新增 + T130 v3.31 新增) 本棒窗口:v3.31 cutoff 05:00 → 18:40 = 约 13h 40min 净窗口期延长 + 9-12 18:47 → 9-13 18:40 = 24h 滑动窗口对照 核心判断:本轮属于"v3.31 落定后 13h 40min 净窗口期延长稳态 + 24h 滑动窗口内 0 件 NET-new paper_card 主分类 llm-infra 入库(paper_cards 1334 张净增确认在 v3.31 cutoff 前已落档)+ 1 件 NET-new 论文方法学 arXiv:2607.05708 Akashic MemAttention 首次锚入预备级(vLLM 0.10.0 扩展 + 长期/短期记忆张力解决 + 13h 窗口内 jay 9-13 1335 下午场重新点燃 Akashic 价值认知 · 7 月已雷达但 v3.31 未实质锚入)+ 1 件 NET-new 论文方法学 arXiv:2605.19537 推理引擎可复现性首次锚入预备级(系统性研究 vLLM/TRT-LLM/SGLang/llama.cpp/transformers 等输出分布显著不同 · 推理后端应被列为 LLM 评估"隐性超参数" · 9-13 1335 下午场首次在 E1 棒位正式讨论)+ 4 件 NET-new 事件级/方法学补充精修(ai-dynamo/dynamo KV-aware routing + KV offload to S3/Azure + Video generation FastVideo/SGLang Diffusion 双栈新增 + NVIDIA NIM Operator for Kubernetes LLM NIM 容器生命周期管理 + SGLang vs vLLM vs LMDeploy 2026 Q2-Q3 实证基准对照:SGLang ~16,200 vs vLLM ~12,500 vs LMDeploy ~16,200 tokens/s on H100 + DeepSeek V3 SGLang 3.1× faster + p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixAttention 6.4× 前缀复用优势)+ 1 件 NET-new 工业 Substack 立场:Ken Huang @ DistributedApps.ai《Physics & Engineering of Frontier LLM Inference》10 章系列 · Chapter 2 = KV Cache Frontier (Hybrid CSA/HCA DeepSeek-V4 + MLA + Global Prefix Caching & KVShare) · 沿用 v3.31 8 件矛盾/待核 + D152"型窗口。本棒位关键作用 = 承接 v3.31 升档棒预备 + Akashic MemAttention 长期记忆持久化方法学正式锚入预备级 + 推理引擎可复现性首次纳入预备级 + ai-dynamo/NIM Operator 事件级锚入预备级预备扩增 + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测基准新增至预备级 + Ken Huang 10 章 KV Cache Frontier 工业立场扩增预备级 + v3.32 升档棒预备候选预备预备**。


一、检查过的来源清单

1.1 工作队列 + v3.31 知识库活文档(沿用稳态)

  • organized/queue/work-queue.md(2026-09-13 18:00 自动生成):待建卡 0 件 · Top 15 高价值待深度解读 0 件 · 待更新/缺失的主题活文档 0 件 · 选题榜未成视频脚本 1 件(arXiv:2609.11561 Negative Self-Distillation · jay 认领 · paper_card 1322 ✓ 已入库 9-12 · 非 llm-infra 主轴)· 待写攻略 Top 15 / 共 1 件(Tom 认领 bishop555/Solana-Drainer-Tool)· spark 认领段 = 无 · 富化缺口 15 张卡缺 TLDR · 待精确分类 0 张卡 · 无 llm-infra 专项主题缺货警告 · work-queue 4.3 项 spark 认领 = 空
  • organized/knowledge/llm-infra.md v3.31 §IX 97 morning 升档棒(2026-09-13 05:00):arXiv/CVE/DOI/URL 328→338/36/14/476→487 精确闭合 + paper_cards 1334(arXiv:2609.11085 Beyond Solver Verdicts 9-12 12:30 + arXiv:2609.10445 Building Multilingual Bridges 9-12 12:30 + arXiv:2608.15380 Adaptive Bridge 9-12 12:30 + arXiv:2609.11699 Negative Self-Distillation 9-12)NET-new 主分类 llm-infra 入库 + paper_cards 1314(EBL-Core 9-12) + 1322(MaP-WAM 9-12) + 1304(KVShareArena 9-10)NET-new 邻接级 llm-infra 入库 + 9 件 NET-new 事件级/方法学(NVIDIA Dynamo 1.0 + SGLang v0.5.19 + vLLM v0.20.2 + vLLM v0.29.0 + SGLang × TPU RadixArk + Miles SGLang 后训练 + SGLang DeepSeek GLM5.2 NVFP4 500 TPS + SGLang GB300 25× + Dynamo Day 2026 16 场)+ 3 件 NET-new 论文方法学(Albireo arXiv:2606.01927 + Helium arXiv:2603.16104 + KVShareArena arXiv:2609.10266)+ 3 件 NET-new 工程化(vLLM 调优实战命令 + Colibri + Ollama/vLLM/llama.cpp benchmark)+ 5 件 NET-new CSDN 工程化首次锚入(2026 年 AI 大模型推理服务器部署实战 + Ollama/vLLM/llama.cpp 深度对比 + 2026 年 AI Agent 实用指南 + LlamaIndex vs LangGraph + LangGraph 驱动的 Agentic RAG)+ 5 件 NET-new arXiv 安全/基准论文首次锚入(OpenShell NVIDIA GTC 2026 + Detokenization Leaks arXiv:2609.06674 + CoRL arXiv:2609.07529 + Φ-Bench arXiv:2609.10226 + ICML 2026 Open Reproductions)+ D152 v3.31 新增 + O500-O505 v3.31 新增 + P0 #244-#249 v3.31 新增 + T130 v3.31 新增

1.2 inbox/spark(2026-09-12 18:47 → 2026-09-13 13:35)

  • 2026-09-12-llm-infra-e1prep.md(2026-09-12 18:47 CST · spark 9-12 18:40 cron 棒位主力补位 121KB · 19 件 NET-new 预备候选精修预备级 · 本棒位承接基线)
  • 2026-09-12-agent-e1prep.md(2026-09-12 13:36 CST · spark agent e1prep · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(11) Kernel/Harness + §1.(2) 推理调度 沿用稳态)
  • 2026-09-13-1001-rss-gradient-flow.md(2026-09-13 10:01 CST · Gradient Flow 5 件 = 自改进不含科幻色彩 + 闭环才是资产 + 中国 AI 内卷 + 模型不是护城河 + 防御错误对象 · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(2) 推理调度 沿用稳态)
  • 2026-09-13-1002-rss-chip-huyen.md(2026-09-13 10:02 CST · Chip Huyen 5 件 = 构建生成式 AI 应用陷阱 + Agents + GenAI 平台 + 个人成长 + 900 热门开源 AI 工具 · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13-1004-rss-yt-3blue1brown.md(2026-09-13 10:04 CST · 3Blue1Brown 5 件 = 跳钉子谜题 + 64 块方糖 + 交叉熵第二部分 + 100 条随机弦交点 + 英语熵测量 · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-agent-e1prep.md(2026-09-13 13:35 CST · spark 9-13 午棒主力补位 68KB · agent 主轴 · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(11) Kernel/Harness 沿用稳态)

spark 9-13 早棒位空窗延续:13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 3 份 RSS 抓取 + 1 份 agent 主题补位 = 本棒位空窗延续 9-10/9-11/9-12/9-13 四棒位(stephen 9-13 1245 协调棒判定 = spark 9-13 evening 棒位补位需求 + llm-infra e1prep 9-13 evening 棒位预备)。

1.3 inbox/jay(2026-09-12 18:47 → 2026-09-13 17:35 · llm-infra 主轴主承载)

  • 2026-09-13T1105-jay-five-category-briefing.md(2026-09-13 11:07 CST · Jay 五类研究简报 · Microsoft Orchard arXiv:2605.15040 ⭐⭐⭐ + VikingRAG arXiv:2609.11390 + OpenViking VLDB 2026 + Multi-Agent 并发写入 arXiv:2608.18092 + Tencent/teamai-cli + llmfit + Agent Infrastructure · 0 件 llm-infra 主轴 net-new 主分类 · 邻接 v3.31 §1.(1) 推理引擎 + §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13-engineering-e1prep.md(2026-09-13 11:22 CST · jay 9-13 早棒 engineering 主轴 18KB · 5 件 engineering 主轴首次锚入 = ① Microsoft Orchard arXiv:2605.15040(3B 活跃参数 + BAR + K8s harness + SWE-bench Verified 69.7%)+ ② VikingRAG arXiv:2609.11390(目录片段 + drill-down retrieval token 效率新范式)+ ③ ai-dynamo/dynamo(GB200/B200/H200 K8s 分布式推理 + KV-aware routing + KV offload to S3/Azure)+ ④ NVIDIA NIM Operator(K8s NIM 容器自动化部署)+ ⑤ AgentGrad arXiv:2609.08572(干预引导 multi-agent prompt 优化)+ 6 件 arXiv 邻接级新增 = REVA arXiv:2609.11209 + Mr.LHDR arXiv:2609.11318 + Memory Compression arXiv:2609.11294 + Microsoft Orchard arXiv:2605.15040 + AgentGrad arXiv:2609.08572 + VikingRAG arXiv:2609.11390 = v3.31 §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级预备触发持续**)
  • 2026-09-13-morning-briefing-multimodal-vecdb-inference.md(2026-09-13 11:07 CST · jay 9-13 早棒 morning briefing 6 候选 · vLLM vs SGLang vs TensorRT-LLM 2026 选型指南(Lyceum Technology)+ SGLang BCG + ai-dynamo/dynamo K8s recipes + NVIDIA NIM Operator + Mr.LHDR arXiv:2609.11318 25 系统 4 组评测 + REVA arXiv:2609.11209 RAG serving 成本优化 + EmoMed arXiv:2609.07194 = v3.31 §1.(1) 推理引擎 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级预备触发持续)
  • 2026-09-13T1230-jay-csdn-inference-finetuning-highvalue-sep13.md(2026-09-13 12:22 CST · jay 9-13 午棒 CSDN 高价值 · 17 条候选 12 件保留 = 推理框架 6 件(vLLM v0.20.0 系统架构 ⭐⭐⭐⭐ + NVIDIA vLLM 源码 git commit 9ff7041 ⭐⭐⭐⭐ + Qwen3 vs GLM-5.1 实测 ⭐⭐⭐ + SGLang/vLLM 对比体验 ⭐⭐⭐ + 调度黑箱解析 ⭐⭐⭐)+ 微调 3 件(2026 LoRA/QLoRA 完全指南 ⭐⭐⭐⭐ + 32GB GPU OOM 排障 ⭐⭐⭐⭐ + 单卡微调 ⭐⭐⭐)+ GraphRAG 4 件(KDD 2026 MKG-RAG-Bench ⭐⭐⭐⭐ + GraphRAG 2026 ⭐⭐⭐ + LLM Wiki 三层混合 ⭐⭐⭐ + LightRAG+Ollama ⭐⭐)+ 向量 DB 1 件(Qdrant/Pinecone/Milvus 五大方案 ⭐⭐⭐)+ MCP/A2A 2 件(2026-07-28 重构 + A2A 协议)+ 选型 1 件(vLLM/SGLang/TRT-LLM 2026 ⭐⭐⭐⭐) = v3.31 §1.(1) 推理引擎 + §1.(11) Kernel/Harness + §1.(8) 训练子轴 NET-new 锚入预备级预备触发持续**)
  • 2026-09-13T1335-jay-afternoon-briefing-mcp-production-inference-stack-sep13.md(2026-09-13 13:36 CST · jay 9-13 下午棒 · 6 件主增量 = ① MCP 生产安全三重挑战(Lenses.io · 2026-07-28 重构后开放标准)+ ② AI Agents Stack 2026 Edition(The AI Engineer Substack · Agent guardrails ≠ LLM guardrails · 2026 新增 tool call 授权/rate limit/action 验证 · Eval as Infrastructure 三层收敛 · Context-Bench/Recovery-Bench/Terminal-Bench)+ ③ Akashic arXiv:2607.05708 ⭐⭐⭐⭐⭐(MemAttention vLLM 0.10.0 扩展 · 长期记忆 vs 短期上下文张力解决 · 记忆检索插入请求准入层 + 记忆回写插入请求完成层 + 物理布局维护拆分为在线迁移路径 + 后台存储 · GPU 执行路径/注意力后端/KV-cache 管理器保持不变)+ ④ GPU MCP 服务器生产部署指南(Spheron Blog · CPU-only MCP 引入 10-100× 延迟 · 7B-13B → RTX 4090 $0.51/hr · 70B 或高并发 → H100 PCIe $2.01/hr)+ ⑤ 推理后端对 LLM 可复现性的影响 arXiv:2605.19537 ⭐⭐⭐⭐⭐(不同推理引擎对同一模型同一输入输出分布显著不同 · top-5 候选 token 整体换血 · 推理后端应被列为 LLM 评估"隐性超参数" · benchmark 对比必须标准化报告推理栈 · 调查截至 2026-01 完整推理引擎生态)+ ⑥ Jam with AI Substack — LLM Inference 101 + Graph RAG + ColPali + Production RAG 评估(RAGAS + LLM-as-judge · Faithfulness/Relevance/Answer Quality) = 3 件 NET-new 论文方法学 + 工程化 + 工业立场预备扩增(① Akashic MemAttention ⭐⭐⭐⭐⭐ + ② 推理引擎可复现性 arXiv:2605.19537 ⭐⭐⭐⭐⭐ + ③ Jam with AI LLM Inference 101 系列)= v3.31 §1.(1) 推理引擎 + §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 NET-new 锚入预备级预备触发**)
  • 2026-09-13T1450-jay-afternoon-engineering-filter-sep13.md(2026-09-13 14:52 CST · jay 9-13 下午场 engineering filter · 本棒保留 4 条 = AgentGrad arXiv:2609.08572 ⭐⭐⭐⭐ + MaP-WAM arXiv:2609.11561 ⭐⭐⭐⭐(已锚 paper_card 1322 v3.31 §1.(11) Kernel/Harness)+ Memory Compression Sandboxes arXiv:2609.11294 ⭐⭐⭐ + δ-mem(Poria 团队 · 待溯源 ⭐⭐⭐)+ Agent 记忆系统三路对比框架发现(vLLM 扩展型 Akashic MemAttention vs RAG 引入型 MaP-WAM vs 微型关联记忆型 δ-mem 4.87M)= v3.31 §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 NET-new 锚入预备级预备触发持续**)
  • 2026-09-13T1505-jay-evening-briefing-frontier-governance-agent-memory-substack-sep13.md(2026-09-13 15:07 CST · jay 9-13 晚棒 frontier 治理 + agent memory substack · Inference Systems 2 件 = Akashic MemAttention(vLLM 0.10.0 扩展 / 长期记忆持久化)⭐⭐⭐⭐ + 推理引擎可复现性研究(arXiv:2605.19537 / vLLM vs TRT-LLM vs SGLang 输出差异显著)⭐⭐⭐⭐⭐ + CSDN 12 件 + Stack 2026 vLLM vs SGLang vs TensorRT-LLM + NVIDIA Dynamo K8s recipes + NIM Operator + AI Agents Stack 2026 + frontier 治理 8 件 + Agent Memory Akashic MemAttention vLLM 扩展型 = v3.31 §1.(1) 推理引擎 + §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 NET-new 锚入预备级预备触发持续**)
  • 2026-09-13T1620-jay-csdn-rag-embedding-finetuning-highvalue-sep13.md(2026-09-13 16:21 CST · jay 9-13 下午 CSDN · RAG + embedding + 微调 · 6 条目保留 = Qwen3-Embedding-0.6B 轻量化部署(SGLang 生产调优)⭐⭐ + LangChain4j + LlamaIndex + Elasticsearch + BGE-M3 + SpringBoot + Qwen3 等 = v3.31 §1.(1) 推理引擎子轴 NET-new 锚入预备级预备触发持续)
  • 2026-09-13T1735-jay-evening-briefing-sep13-2026.md(2026-09-13 17:36 CST · jay 9-13 晚棒 · 主题:九月模型发布潮 × Inference Engine 选型 × Agentic RAG 新范式 × HF WebGPU Kernels · 2026 Q2-Q3 vLLM vs SGLang vs LMDeploy 实测 = SGLang ~16,200 tok/s vs LMDeploy ~16,200 tok/s vs vLLM ~12,500 tok/s on H100 + Prefill SGLang = LMDeploy 最优 vs vLLM -29% + p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixAttention 6.4× 优势 + DeepSeek V3 SGLang 3.1× faster vs vLLM 基线 + MAX 50.6s TTFT(最快但更新)+ 2026 新变量 RadixArk($400M 融资专攻 SGLang 上层基础设施)+ NVIDIA TensorRT-LLM 大 batch 吞吐量优势 + Ken Huang Substack 10 章系列 Chapter 2 = KV Cache Frontier: Hybrid CSA/HCA(DeepSeek-V4)+ MLA + Global Prefix Caching & KVShare + The AI Agents Stack 2026 Edition · Agent guardrails ≠ LLM guardrails · Eval as Infrastructure 三层收敛 · 新 benchmark Context-Bench/Recovery-Bench/Terminal-Bench · Deep|LLM 2026 模型中心 → agent-driven 真实系统需求阶段转型 · Agentic RAG 范式转变:向量数据库降级 · agent-as-retriever/agentic search/vectorless RAG · Search-R1(RL 检索策略)比 RAG 高 24% · HF WebGPU Kernels 200+ 本地 AI 推理 · State of Open Models Summer 2026 · GitHub Trending 6 件(ai-boost/awesome-harness-engineering ⭐⭐⭐ + volcengine/OpenViking VLDB 2026 ⭐⭐⭐ + bentoml/llm-inference-handbook ⭐⭐ + llm-d/llm-d-inference-sim ⭐ + oracle-devrel/oracle-ai-developer-hub ⭐) = v3.31 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 NET-new 锚入预备级预备触发持续 + 工业 Substack 立场扩增预备扩增预备级(Ken Huang 10 章 KV Cache Frontier)**)
  • 2026-09-13T1050-jay-engineering-filter.md(2026-09-13 10:52 CST · jay 9-13 engineering filter 6 候选 5 保留 = ① Microsoft Orchard ⭐⭐⭐ + ② Simon Willison osint OpenAI RubyGems 攻击 ⭐⭐ + ③ VikingRAG ⭐⭐ + ④ OpenAI RubyGems 事件本体 ⭐ + ⑤ Lilian Weng Harness Engineering ⭐ = v3.31 §1.(11) Kernel/Harness + §1.(2) 推理调度子轴 沿用稳态)
  • 2026-09-13T1105-jay-five-category-briefing.md(已覆盖)
  • 2026-09-13T1335-jay-afternoon-briefing-mcp-production-inference-stack-sep13.md(已覆盖)
  • 2026-09-13T1450-jay-afternoon-engineering-filter-sep13.md(已覆盖)

jay 9-13 全天棒位 llm-infra 主轴承接总计 = 13 件 NET-new 事件级/方法学(ai-dynamo/dynamo KV-aware routing + KV offload to S3 + NVIDIA NIM Operator + Microsoft Orchard 3B + BAR + K8s harness + VikingRAG drill-down retrieval + AgentGrad + SGLang v0.5.19 BCG + vLLM v0.20.0 系统架构 + vLLM git commit 9ff7041 + SGLang/vLLM 选型对比 + 调度黑箱解析 + CSDN 12 件 + ai-dynamo recipes DeepSeek-V4-Flash)+ 6 件 NET-new 论文方法学首次锚入预备级(Akashic arXiv:2607.05708 + 推理引擎可复现性 arXiv:2605.19537 + Memory Compression Sandboxes arXiv:2609.11294 + Microsoft Orchard arXiv:2605.15040 + VikingRAG arXiv:2609.11390 + REVA arXiv:2609.11209 + Mr.LHDR arXiv:2609.11318)+ 3 件 NET-new 工业立场/Substack(Jam with AI LLM Inference 101 + The AI Agents Stack 2026 + Ken Huang 10 章 KV Cache Frontier)+ 1 件 NET-new GitHub Trending(ai-boost/awesome-harness-engineering ⭐⭐⭐ + bentoml/llm-inference-handbook ⭐⭐)+ 1 件 NET-new GitHub HF WebGPU Kernels 200+ 本地 AI 推理

1.4 inbox/tom(2026-09-12 18:47 → 2026-09-13 15:42)

  • 2026-09-13-rag-e1prep.md(2026-09-13 08:52 CST · R89 早棒 21KB · 0 件 llm-infra 主分类 net-new paper_card · 7 件新增 = Substack Agent Memory Is Not RAG + Think Before You Link paper_card 1329 入库确认 + Agentic RAG 生产栈 2026 + Alternate Agentic AI Architecture + Microsoft Orchard + Retrieval Adequacy QPP + VikingRAG = v3.31 §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13T0840-agent-rag-longcontext-radar.md(2026-09-13 08:41 CST · Tom 研究雷达 · 8 候选 3 高价值 · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(2) 推理调度 + §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13-0900-hf-daily-2026-09-13.md(2026-09-13 09:00 CST · HF Daily 9-13 早棒 15 件 · WMRL 444▲ 立标极显著首次 + NCP-ArchPreview 231▲ + SenseNova-U1.5 183▲ + AgentGrad 92▲ + SpatialBlock 91▲ + T1 53▲ + EvoSafeHarness 47▲ + Mi-Ripple 37▲ + WearableQA 37▲ + X-AuT 30▲ + MaP-WAM 26▲ + SWE-Bench Pro Verified 23▲ + FreeFlow 22▲ + IMO Gold 22▲ + PARSER 20▲ = v3.31 §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13T1440-agent-rag-longcontext-radar.md(2026-09-13 14:42 CST · Tom 14:40 雷达 · 邻接 v3.31 §1.(2) 推理调度 + §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13-evaluation-e1prep.md(2026-09-13 15:42 CST · Evaluation E1 预消化 · R87 主分类 = 评测主题 · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-1003-rss-yt-yannic-kilcher.md(2026-09-13 10:03 CST · Yannic Kilcher · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-1004-rss-yt-lex-fridman.md(2026-09-13 10:04 CST · Lex Fridman · 0 件 llm-infra 主轴 net-new)

1.5 inbox/flyp(2026-09-12 18:47 → 2026-09-13 16:40)

  • 2026-09-12-multimodal-e1prep.md(2026-09-12 09:43 CST · multimodal 73KB v88 → v89 接力棒 · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(7) 多模态子轴 沿用稳态)
  • 2026-09-12-risk-e1prep.md(2026-09-12 16:37 CST · flyp 9-12 risk 棒 75KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(9) 安全子轴 沿用稳态)
  • 2026-09-12-weekly-deep-read-critical-review.md(2026-09-12 10:36 CST · flyP 周六精读 · 反方审稿 · 0 件 llm-infra 主轴 net-new)
  • 2026-09-12-weekly-deep-read-reproduction-risk.md(2026-09-12 10:37 CST · flyP 周六精读 · 复现风险分析专文 · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-multimodal-e1prep.md(2026-09-13 09:43 CST · flyp 9-13 multimodal 棒 73KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(7) 多模态 + §1.(9) 安全子轴 沿用稳态)
  • 2026-09-13-0950-WMRL-World-Model-RL-Research-Agents-critical-read.md(2026-09-13 09:51 CST · WMRL critical-read 16KB · 立标极显著首次 24h+ 续立稳态首例 ⚠️ + 撞事实 1 件 ★★★★(Pareto frontier 4B > 48B / 9B > 120B 的可比性需 ablation + CI 验证)+ 撞主题 5 件 + 7 件 Semantic Scholar 相似论文清单 = v3.31 §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13-1550-MaP-WAM-Memory-as-Plans-Robot-Manipulation-critical-read.md(2026-09-13 15:50 CST · flyp 9-13 MaP-WAM critical-read · paper_card 1322 已锚 v3.31 §1.(11) Kernel/Harness)
  • 2026-09-13-risk-e1prep.md(2026-09-13 16:40 CST · flyp 9-13 risk 棒 75KB · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-1000-rss-cameron-wolfe.md(2026-09-13 10:00 CST · Cameron Wolfe · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-1001-rss-interconnects.md(2026-09-13 10:01 CST · Interconnects · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-1003-rss-yt-ai-explained.md(2026-09-13 10:03 CST · AI Explained · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-1003-rss-yt-two-minute-papers.md(2026-09-13 10:03 CST · Two Minute Papers · 0 件 llm-infra 主轴 net-new)

1.6 inbox/stephen(2026-09-12 18:47 → 2026-09-13 12:48)

  • 2026-09-12-ai-industry-e1prep.md(2026-09-12 10:36 CST · stephen 9-12 ai-industry 棒 38KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(10) 顶会部署 + §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13-0910-news-x-vip-radar.md(2026-09-13 09:11 CST · Stephen 9-13 早棒 X 名人雷达 4KB · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-ai-industry-e1prep.md(2026-09-13 10:23 CST · stephen 9-13 ai-industry 棒 38KB · 0 件 llm-infra 主轴 net-new · 邻接 v3.31 §1.(10) 顶会部署 + §1.(11) Kernel/Harness 沿用稳态)
  • 2026-09-13-1245-stephen-coordination-check-noon.md(2026-09-13 12:48 CST · stephen 9-13 午间协调棒 65KB · 七分类 + 二邻接级覆盖矩阵 + 跨实例去重与协同点 + 🔥 P0 数字错误修复追踪(P0-001 NVIDIA × HF 收购金额 $129.3B → $12.93B 部分修复 30% · P0-002 Think Before You Link 数字方向反转已修复 60% · P0-003 Bloomberg 措辞过度强化部分修复)+ 12 件 Substack 七字段 + Substack #1 Agent Memory Is Not RAG 新增锚入 + 36 个高频 arXiv 跨实例承接 + Spark 早棒缺位警示 9-10/9-11/9-12/9-13 四棒位 + 5 实例跨日去重对账沿用稳态 = v3.31 §3.2 #109-#111 v91 争议候选预备级承接 + v3.31 §3.3 Q105.277-Q105.280 v91 开放问题候选新增预备触发预备级 4 件承接**)
  • 2026-09-13-1002-news-*.md(2026-09-13 10:02 CST · Anthropic / DeepMind / Google AI / HF / OpenAI / TLDR / Bens Bites 7 件 · 0 件 llm-infra 主轴 net-new)
  • 2026-09-13-1004-news-yt-*.md(2026-09-13 10:04 CST · Anthropic / DeepMind / OpenAI 3 件 · 0 件 llm-infra 主轴 net-new)

1.7 paper_cards 近 3 天新卡(2026-09-10 ~ 2026-09-13 14:10 入库 · 1327-1334 张)

编号 arXiv 标题 主分类 llm-infra 关联
1328 arXiv:2609.11085 Beyond Solver Verdicts: Generative Reward Models for Autoformalization llm-infra v3.31 §1.(12) 压缩与编解码 子轴 NET-new 锚入预备级补强"自动形式化可靠性验证"理论维度 · 已锚 v3.31
1330 arXiv:2609.10445 Building Multilingual Bridges llm-infra v3.31 §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31
1334 arXiv:2608.15380 Adaptive Bridge(ROS 2 + DDS backpressure 缓解) llm-infra v3.31 §1.(2) 推理调度子轴 NET-new 锚入预备级 · 已锚 v3.31
1323 arXiv:2609.11699 Negative Self-Distillation(OPSD 缺陷形式化) llm-infra v3.31 §1.(8) 训练子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31
1314 arXiv:2609.11596 EBL-Core(5 类高风险 AI 操作语义契约) agent 邻接 llm-infra v3.31 §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31
1322 arXiv:2609.11561 MaP-WAM(Memory-as-Plans + RMBench 83.3% SOTA) agent 邻接 llm-infra v3.31 §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级 · 已锚 v3.31
1304 arXiv:2609.10266 KVShareArena(RAG/multi-agent 场景 KV cache 复用失效) llm-infra v3.31 §1.(3) KV Cache 子轴 NET-new 锚入预备级 · 已锚 v3.31
1305 arXiv:2609.10355 Why Is Video Still So Expensive(VideoLLM 推理效率 survey) multimodal 邻接 llm-infra 邻接 v3.31 §1.(7) 多模态子轴 沿用稳态
1308 arXiv:2609.08149 SWE-Bench Pro Verified(评测标准) evaluation 邻接 agent 邻接 v3.31 §1.(11) Kernel/Harness 沿用稳态
1309 arXiv:2609.09264 StochBench(Lean 4 随机过程基准) evaluation 邻接 v3.31 §1.(11) Kernel/Harness 沿用稳态
1310 arXiv:2609.08126 SchemeArena(LLM Agent 阴谋行为压力测试) agent 邻接 v3.31 §1.(11) Kernel/Harness 沿用稳态
1329 arXiv:2609.10745 Think Before You Link(多语言实体链接稀有性) rag 邻接 llm-infra 邻接 v3.31 §1.(11) Kernel/Harness 沿用稳态
1331 arXiv:2609.10539 IdeaAMBIG(研究构想规范基准) evaluation 邻接 v3.31 §1.(11) Kernel/Harness 沿用稳态
1332 arXiv:2609.09143 Studying Image Tokenizers as Visual Languages multimodal 邻接 v3.31 §1.(7) 多模态子轴 沿用稳态
1333 arXiv:2609.09076 ActReview: Rebuttal-Guided Training Data multimodal 邻接 v3.31 §1.(7) 多模态子轴 沿用稳态

结论:13h 40min 净窗口期内(2026-09-13 05:00 → 18:40 CST)0 件 NET-new paper_card 主分类 llm-infra 入库(1334 张净增确认在 v3.31 cutoff 前已落档 · 14:10 批次已是 RAGSieve / Mechanist 等邻接级或主题异质卡片)。


二、NET-new 增量(7 条主增量 + 5 条矛盾/待核)

增量 ① Akashic MemAttention · arXiv:2607.05708 · vLLM 0.10.0 扩展型长程 Agent 记忆管理 ⭐⭐⭐⭐⭐ 必读

  • 来源:jay 9-13 1335 jay-afternoon-briefing-mcp-production-inference-stack-sep13 §3(arXiv 链接 https://arxiv.org/html/2607.05708v1 · jay 9-13 1505 evening briefing Inference Systems 段确认)+ jay 9-13 1450 afternoon-engineering-filter(与 MaP-WAM/δ-mem 三路对比框架)
  • 要点:vLLM 0.10.0 控制路径扩展 · GPU 执行路径 / 注意力后端 / KV-cache 管理器 保持不变 · 三个接入点 = ① 记忆检索插入请求准入层 + ② 记忆回写插入请求完成层 + ③ 物理布局维护拆分为在线迁移路径 + 后台存储 · MemAttention 解决 agentic workflow 中长期记忆(long-term memory)与短期上下文(short-term context)之间的张力——长期记忆需要持久化但又不能无限增长 · bounded chunks + cross-chunk inference(受 Claude Code 启发)
  • 与 v3.31 现有脉络的关系:1 件 NET-new 论文方法学首次锚入预备级 · 填补 v3.31 §1.(3) KV Cache 子轴 + §1.(11) Kernel/Harness 子轴的方法学空白——v3.31 已锚 KVShareArena(arXiv:2609.10266 · RAG/multi-agent 场景 KV cache 复用失效 · 离线修补)与 MaP-WAM(arXiv:2609.11561 · Memory-as-Plans · RAG 思想引入 Agent 记忆)但 Akashic 提供 vLLM 主线 0.10.0 扩展型实现——前者是离线修补/算法层方案,Akashic 是生产级 vLLM 扩展型基础设施 · 首次提供"生产级 Agentic Workflow 持久化 KV-cache + 记忆回写"完整工程实现路径 · 与 v3.31 §1.(1) 推理引擎子轴 vLLM V1 1.7× throughput + near-zero-overhead prefix caching 工程化补强形成"主线推理性能 + 持久化记忆"双引擎 · 与 jay 9-13 1450 afternoon-engineering-filter Agent 记忆系统三路对比框架完美对齐 = vLLM 扩展型(Akashic)vs RAG 引入型(MaP-WAM)vs 微型关联记忆型(δ-mem · 4.87M · Poria 团队)
  • 建议归入:§1.(11) Kernel/AI 自动化/Harness 子轴 + §1.(3) KV Cache 子轴 NET-new 锚入预备级补强"Akashic MemAttention:生产级 vLLM 0.10.0 扩展 · KV-cache 管理器保持不变 · 长期记忆持久化基础设施工具"(首条生产级 vLLM 持久化记忆工作)
  • arXiv 号:arXiv:2607.05708
  • 可信度:⭐⭐⭐⭐⭐ 极高(arXiv 论文 · 基于 vLLM 0.10.0 扩展 · jay 9-13 1335 下午棒 + 1450 工程筛 + 1505 evening briefing 三棒位连续确认 · 7 月已雷达但 v3.31 cutoff 5:00 CST 前未实质锚入 · 本次 13h 40min 净窗口期内的核心 NET-new)

增量 ② 推理引擎可复现性 · arXiv:2605.19537 · "推理后端隐性超参数"方法学 ⭐⭐⭐⭐⭐ 必读

  • 来源:jay 9-13 1335 jay-afternoon-briefing-mcp-production-inference-stack-sep13 §5(arXiv 链接 https://arxiv.org/html/2605.19537v1 · jay 9-13 1505 evening briefing Inference Systems ⭐⭐⭐⭐⭐ 段确认)
  • 要点:系统性研究截至 2026-01 完整推理引擎生态 · 不同推理引擎(vLLM / TensorRT-LLM / SGLang / llama.cpp / transformers 等)对同一模型、同一输入产生的输出分布显著不同——这种差异可大到将 top-5 候选 token 整体换血 · 核心结论 = 推理后端应被列为 LLM 评估中的"隐性超参数" · benchmark 对比必须标准化报告推理栈
  • 与 v3.31 现有脉络的关系:1 件 NET-new 论文方法学首次锚入预备级 · arXiv:2605.19537 已锚入 v3.31 arXiv ID 列表(338 件闭合)但未在 §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴正式锚入预备级 · 本棒位填补其方法学锚定空白 · 为 v3.31 §1.(2) 推理调度子轴"vLLM vs SGLang vs LMDeploy 选型决策树"(Prem AI + Atomic.Chat + JarvisLabs 2026-04-08)+ v3.31 §1.(1) 推理引擎 SGLang v0.5.19 + vLLM v0.20.2 + vLLM v0.29.0 三联提供学理基础——9-13 1735 evening briefing 给出更精细数字(SGLang ~16,200 / vLLM ~12,500 / LMDeploy ~16,200 tokens/s on H100 + p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixAttention 6.4× 前缀复用优势 + DeepSeek V3 SGLang 3.1× faster)正是 arXiv:2605.19537 论断的实证支持 · 同时为 §1.(4) 量化(TurboQuant PolarQuant + QJL · NVIDIA NVFP4 Blackwell B200 · SGLang DeepSeek GLM5.2 NVFP4 500 TPS · vLLM V1 KV-Cache fp8 1.6× H100)提供"同量化级别不同引擎仍可能输出分布显著不同"的扩展警示
  • 建议归入:§1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"arXiv:2605.19537:推理后端应被列为 LLM 评估中的'隐性超参数' · benchmark 对比必须标准化报告推理栈"(首条推理可复现性方法学)
  • arXiv 号:arXiv:2605.19537
  • 可信度:⭐⭐⭐⭐⭐ 极高(系统性 arXiv 研究 · jay 9-13 1335 下午棒 + 1505 evening briefing 双棒位确认 · v3.31 沿用 arXiv ID 列表已含但方法学锚入首次落地)

增量 ③ ai-dynamo/dynamo · GB200/B200/H200 K8s 分布式推理 + KV-aware Routing + KV offload to S3/Azure

  • 来源:jay 9-13 1122 engineering-e1prep §增量 ③(GitHub ai-dynamo/dynamo + https://github.com/ai-dynamo/dynamo/blob/main/recipes/README.md · jay 9-13 1107 morning-briefing-multimodal-vecdb-inference §3 backend 段)
  • 要点:数据中心级分布式推理编排框架(NVIDIA 官方支持)· 位于 vLLM/SGLang/TensorRT-LLM 之上做多节点协同编排(非推理引擎)· Sep 13 最新 = GB200/B200/H200 多硬件配置支持 + K8s recipes 现已支持 DeepSeek-V4-Flash(vLLM 和 SGLang 双后端) + Video generation 支持:FastVideo + SGLang Diffusion + K8s Inference Gateway 插件:KV-aware routing(智能路由基于 KV cache 状态)+ KV offload 到 S3/Azure(超长上下文不依赖本地 GPU 内存)
  • 与 v3.31 现有脉络的关系:补充精修 v3.31 §1.(1) NVIDIA Dynamo 1.0 推理操作系统正式生产预备扩增预备级——v3.31 已锚 NVIDIA Dynamo 1.0(KV-aware Router 4× lower TTFT + 1.5× higher throughput + ModelExpress 7× + 取代 Triton + Apache-2.0 · NVIDIA 新闻稿 + 技术博客 + DigitalOcean + ClearML + DigitalApplied 5 源验证)· 本次细化 = KV-aware routing 在 K8s Inference Gateway 插件层(而非仅在 NVIDIA 官方 NVIDIA Dynamo 框架)+ KV offload 到 S3/Azure(超长上下文突破本地 GPU 内存)+ DeepSeek-V4-Flash 双后端支持 · 与 v3.31 §1.(11) Kernel/Harness 子轴 Agentic Workflow 持久化基础设施(Akashic MemAttention 增量 ①)互补——Akashic 是 vLLM 扩展层 · Dynamo 是多节点 K8s 编排层 · VikingRAG(arXiv:2609.11390)drink 目录片段 + drill-down retrieval 邻接级也使用同构分层加载思想
  • 建议归入:§1.(1) 推理引擎子轴 NET-new 锚入预备级补强"ai-dynamo/dynamo:GB200/B200/H200 K8s 分布式推理 + KV-aware routing(K8s Inference Gateway)+ KV offload S3/Azure + DeepSeek-V4-Flash 双后端 + Video generation FastVideo/SGLang Diffusion"
  • arXiv 号:无(GitHub 项目)
  • 可信度:高(GitHub 活跃项目 · NVIDIA 官方支持 · 有具体 K8s deployment recipes · Sep 13 morning briefing 精选)

增量 ④ NVIDIA NIM Operator for Kubernetes · LLM NIM 容器生命周期管理

  • 来源:jay 9-13 1122 engineering-e1prep §增量 ④(NVIDIA Docs · https://docs.nvidia.com/nim/large-language-models/2.0.12/deployment/kubernetes-deployment/nim-operator-deployment.html · jay 9-13 1107 morning-briefing §2 NVIDIA NIM Operator)
  • 要点:K8s 原生 Operator 模式 · 自动化处理 NIM 容器镜像拉取、认证、持久化存储等常见运维问题 · 覆盖范围 = LLM NIM 容器(vLLM/TensorRT-LLM backend)全生命周期管理 · 与 Dynamo 关系 = Dynamo 是编排层(multi-node coordination)· NIM Operator 是单节点 container lifecycle management · 两者互补
  • 与 v3.31 现有脉络的关系:补充精修 v3.31 §1.(1) NVIDIA NIM 2.0(one container one backend 基于 vLLM)+ §1.(2) 推理调度 vLLM V1 K8s 探针延迟建议(initialDelaySeconds=120/180) · 与 ai-dynamo/dynamo 增量 ③共同构成 "K8s 推理基础设施栈"(Operator lifecycle + 编排层 + 推理引擎)· 与 v3.31 §1.(1) vLLM 性能调优命令集(Red Hat 2026-03-03)构成"命令行调优 + K8s 自动化部署"互补
  • 建议归入:§1.(2) 推理调度子轴 NET-new 锚入预备级补强"NVIDIA NIM Operator for Kubernetes:LLM NIM 容器生命周期管理 · 与 ai-dynamo/dynamo 构成 K8s 推理基础设施栈"
  • arXiv 号:无(NVIDIA 官方文档)
  • 可信度:高(NVIDIA 官方文档 · 2026-09 最新版本 · K8s Operator 模式有明确实现)

增量 ⑤ SGLang vs vLLM vs LMDeploy 2026 Q2-Q3 实测基准对照 · 数字精细化精修

  • 来源:jay 9-13 1735 jay-evening-briefing-sep13-2026 §二(Prem AI Blog https://blog.premai.io/llm-inference-servers-compared-vllm-vs-tgi-vs-sglang-vs-triton-2026 + Turion AI https://turion.ai/blog/vllm-vs-sglang-inference-comparison-2026 + DEV Community https://dev.to/jaipalsin/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026-5h04 + LeetLLM https://leetllm.com/blog/llm-inference-engine-comparison-2026 · 四源对照)
  • 要点:H100 实测 · Prefill 吞吐量 = SGLang ~16,200 tok/s vs LMDeploy ~16,200 tok/s vs vLLM ~12,500 tok/s(vLLM -29%)· Decode 吞吐量 = SGLang = LMDeploy 最优 · TTFT 一致性 = p99 TTFT SGLang 54.2s vs vLLM 58.9s · 前缀复用场景 = RadixAttention 6.4× 优势 · 关键结论 = ① SGLang 多轮对话/agent 工作流场景领先(前缀复用 >60% 时 3-5× prefetch 提升)② vLLM 生态最成熟 · 仍是新团队首选 safe choice ③ LMDeploy 专精量化模型(MoE、高压缩比场景)④ RadixAttention 是 SGLang 核心差异点 ⑤ TGI 已被标记为"gone"不再推荐 · 2026 新变量 = RadixArk($400M 融资专攻 SGLang 上层基础设施)+ NVIDIA TensorRT-LLM 大 batch 吞吐量场景仍保持优势 · DeepSeek V3 SGLang 3.1× faster vs vLLM 基线
  • 与 v3.31 现有脉络的关系:补充精修 v3.31 §1.(2) 推理调度子轴 vLLM vs SGLang vs LMDeploy 选型决策树(PremAI + Atomic.Chat + JarvisLabs 2026-04-08 · SGLang ~16,200 vs vLLM ~12,500 tokens/s on H100 · DeepSeek V3 SGLang 3.1× faster vs vLLM 基线)——本次给出更精细 p99 TTFT 数字(SGLang 54.2s vs vLLM 58.9s)+ RadixAttention 6.4× 前缀复用优势 + TGI 已"gone"标记 + RadixArk $400M 融资 · 与增量 ② 推理引擎可复现性 arXiv:2605.19537 形成"实测数字 + 方法学锚入"双联预备级
  • 建议归入:§1.(1) 推理引擎子轴 + §1.(2) 推理调度子轴 NET-new 锚入预备级补强"SGLang vs vLLM vs LMDeploy 2026 Q2-Q3 实测基准:p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixAttention 6.4× 前缀复用 + TGI 已'gone' + RadixArk $400M"
  • arXiv 号:无(实测试验报告)
  • 可信度:高(四源 Prem AI + Turion AI + DEV Community + LeetLLM 交叉验证 · H100 实测 · 9-13 1735 evening briefing 最新棒位)

增量 ⑥ Ken Huang @ DistributedApps.ai《Physics & Engineering of Frontier LLM Inference》10 章系列 · Chapter 2 KV Cache Frontier

  • 来源:jay 9-13 1735 jay-evening-briefing-sep13-2026 §3.1(https://kenhuangus.substack.com/p/announcing-the-10-part-series-the)
  • 要点:10 章系列 · Chapter 1 已于 8 月发布 = Memory Walls / Arithmetic Intensity / Compute Ceilings · Chapter 2 主题 = KV Cache Frontier:Hybrid CSA/HCA(DeepSeek-V4)+ MLA + Global Prefix Caching & KVShare · 定位 = 从 DeepSeek、Moonshot AI、Zhipu AI、NVIDIA、Google DeepMind 前沿研究中提炼生产工程蓝图 · 与"vLLM 傻瓜式部署"的差距 = Memory Wall 解决需要 Megawatt MoE 级别系统设计
  • 与 v3.31 现有脉络的关系:1 件 NET-new 工业 Substack 立场扩增预备扩增预备级 · 与 v3.31 §1.(3) KV Cache 子轴 KVShareArena(arXiv:2609.10266)+ MaP-WAM Memory-as-Plans(arXiv:2609.11561 邻接级)+ Akashic MemAttention(增量 ①)形成"工业 Substack 系统蓝图 + 学术论文方法学 + 工程实现"三维预备扩增 · Chapter 2 直接关联 KVShare 概念——与 paper_card 1304 KVShareArena 标题级对应 · DeepSeek-V4 Hybrid CSA/HCA + MLA + Global Prefix Caching = 9-13 HF Daily 9-13 SenseNova-U1.5 183▲ + FreeFlow 22▲ 的工业背景延续
  • 建议归入:§1.(3) KV Cache 子轴 NET-new 锚入预备级补强"Ken Huang @ DistributedApps.ai 10 章系列 Chapter 2 KV Cache Frontier:Hybrid CSA/HCA(DeepSeek-V4)+ MLA + Global Prefix Caching & KVShare"(首条工业 KV Cache 战略级立场)
  • arXiv 号:无(Substack 付费专栏 · 仅引用目录和摘要)
  • 可信度:中高(工程系统向 · 10 章深度系列 · 仅引用目录和摘要)

增量 ⑦ HF WebGPU Kernels 200+ 本地 AI 推理

  • 来源:jay 9-13 1735 jay-evening-briefing-sep13-2026 §五(huggingface.co/blog · 9 月 3 日发布)
  • 要点:@huggingface/kernels:200+ WebGPU Kernels for Local AI · 目标 = 本地 AI 推理无需服务器端 GPU · 信号 = WebGPU inference 进入 HF 一级支持 · 相关 = Inference Providers API 支持 WebGPU backend
  • 与 v3.31 现有脉络的关系:1 件 NET-new 工业平台锚入预备扩增预备级 · 与 v3.31 §1.(1) 推理引擎子轴 Colibri 纯 C 推理引擎(微软 Build 2026 · 744B GLM-5.2 MoE 25GB RAM 流式专家按需加载)形成"消费级零依赖 + Web 浏览器零依赖"双引擎预备扩增 · 与增量 ① Akashic MemAttention(生产级 vLLM 扩展)+ 增量 ③ ai-dynamo/dynamo(K8s 分布式推理)+ 增量 ⑤ SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测构成"边缘 + 数据中心 + Web 浏览器"三层推理基础设施预备扩增
  • 建议归入:§1.(1) 推理引擎子轴 NET-new 锚入预备级补强"HF WebGPU Kernels 200+:本地 AI 推理无需服务器端 GPU · WebGPU inference 进入 HF 一级支持"
  • arXiv 号:无(HF 官方博客 · GitHub 仓库)
  • 可信度:高(HF 官方发布 · 200+ kernels · Inference Providers API 配套支持)

三、值得警惕的矛盾或待核实说法

警惕 ① Akashic MemAttention 7 月已雷达但 v3.31 未实质锚入 — 锚入节奏争议

  • 警惕点:Akashic arXiv:2607.05708 在 jay 2026-07-09 engineering-roundup.md 与 jay 2026-07-12 midday-briefing-database-backend-cloudnative-csdn-reproduction.md 已两次雷达引用 · 但 v3.31(2026-09-13 05:00)CST 截止未实质锚入 §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 · jay 9-13 1335 下午棒首次在 v3.31 升档棒后再次正式讨论 · 本次 E1 棒位首次建议正式锚入预备级 · 锚入节奏争议 = 9-13 13:35 jay 棒位 vs 7-9 7-12 jay 历史雷达 vs 9-13 18:40 spark E1 棒位 — 本次棒位应以 E1 棒位首次正式建议锚入为准(7-9 雷达属"邻接级预备",本次 13h 40min 净窗口期内 jay 1335 + 1450 + 1505 三棒位连续确认属"预备级正式锚入触发")
  • 建议动作:9-14 morning 棒位 v3.32 升档棒预备候选精修闭合预备级 · Akashic MemAttention 锚入 v3.32 §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴

警惕 ② arXiv:2605.19537 已锚入 v3.31 arXiv ID 列表但 §1 方法学未实质锚入 — 锚入维度争议

  • 警惕点:arXiv:2605.19537 已锚入 v3.31 arXiv ID 列表(338 件闭合)但未在 §1.(1) 推理引擎子轴 + §1.(11) Kernel/Harness 子轴正式锚入预备级 · 本次 E1 棒位首次建议补强方法学锚入 · 锚入维度争议 = "arXiv ID 列表 vs 章节预备级锚入"是两层不同锚入维度 · v3.31 arXiv ID 列表闭合不代表章节预备级锚入闭合
  • 建议动作:9-14 morning 棒位 v3.32 升档棒预备候选精修闭合预备级 · arXiv:2605.19537 锚入 v3.32 §1.(1) + §1.(11) 方法学预备扩增预备级

警惕 ③ SGLang p99 TTFT 54.2s vs vLLM 58.9s · 数字相对差距 vs 绝对差距争议

  • 警惕点:jay 9-13 1735 evening briefing 给出 p99 TTFT SGLang 54.2s vs vLLM 58.9s = 绝对差距仅 4.7s(8% 相对差距)· 但 v3.31 §1.(2) 推理调度子轴 vLLM vs SGLang vs LMDeploy 选型决策树锚入"vLLM vs SGLang vs LMDeploy 选型决策树"沿用 · 数字解读争议 = 8% 差距是否足以支撑"vLLM 仍是新团队首选 safe choice"(jay 9-13 1735 evening briefing 结论)vs "SGLang 多轮对话/agent 工作流场景领先"(同 briefing 结论)· 绝对数字不应被过分放大或缩小
  • 建议动作:9-14 morning 棒位精读 Prem AI + Turion AI + DEV Community + LeetLLM 四源原文,核对 p99 TTFT 数字精度与硬件配置前提(单 batch vs bursty · p95 vs p99 · 70B vs 8B)

警惕 ④ ai-dynamo/dynamo KV-aware routing 与 NVIDIA Dynamo 1.0 KV-aware Router 概念重叠争议

  • 警惕点:增量 ③ ai-dynamo/dynamo K8s Inference Gateway 插件:KV-aware routing(智能路由基于 KV cache 状态)与 v3.31 §1.(1) NVIDIA Dynamo 1.0 已锚入的 KV-aware Router 4× lower TTFT + 1.5× higher throughput 概念重叠 · 二者关系 = ai-dynamo/dynamo 是 GitHub 项目(NVIDIA 官方支持)· NVIDIA Dynamo 1.0 是 NVIDIA 官方发布的推理操作系统 · 可能为同源(ai-dynamo/dynamo 即 NVIDIA Dynamo 1.0 上游)但 GitHub 与官方新闻稿表述有差异 · 是否同源待核
  • 建议动作:9-14 morning 棒位精读 ai-dynamo/dynamo GitHub releases + NVIDIA Dynamo 1.0 新闻稿,核对二者关系(同源 / 子集 / 并行)

警惕 ⑤ Ken Huang Substack Chapter 2 KV Cache Frontier · 章节编号与标题差异争议

  • 警惕点:jay 9-13 1735 evening briefing 引用 Ken Huang @ DistributedApps.ai 10 章系列 Chapter 2 主题 = KV Cache Frontier:Hybrid CSA/HCA(DeepSeek-V4)+ MLA + Global Prefix Caching & KVShare · 9-13 1735 棒位访问时 Substack 原文是否仅 8 月发布的 Chapter 1 + 已预告 Chapter 2 主题还是 Chapter 2 已正式发布待核 · Chapter 2 实际发布日期待核 · jay 9-13 1735 evening briefing 表述"Chapter 2 主题:..."暗示 Chapter 2 已预告但未必已发布
  • 建议动作:9-14 morning 棒位访问 https://kenhuangus.substack.com 主页确认 Chapter 2 实际发布日期 · 若仅预告则降级为"10 章系列预告锚入预备级"

四、可引用的 arXiv 号列表

4.1 本棒位 13h 40min 净窗口期 NET-new 论文方法学(2 件 · 锚入预备级)

  1. arXiv:2607.05708 · Akashic: A Low-Overhead LLM Inference Service with MemAttention(增量 ① · vLLM 0.10.0 扩展 · 长期记忆持久化基础设施)
  2. arXiv:2605.19537 · 推理后端对 LLM 可复现性的影响(增量 ② · 系统性研究 · 推理后端应被列为 LLM 评估"隐性超参数")

4.2 v3.31 cutoff 前已锚入 arXiv ID 列表 338 件闭合 · 本棒位承接 v3.31 沿用

主分类 llm-infra NET-new 4 件: - arXiv:2609.11085 · Beyond Solver Verdicts: Generative Reward Models for Autoformalization(paper_card 1328) - arXiv:2609.10445 · Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning(paper_card 1330) - arXiv:2608.15380 · Adaptive Bridge: A Proxy-Based Decoupling Layer for Mitigating DDS Backpressure in ROS 2(paper_card 1334) - arXiv:2609.11699 · Negative Self-Distillation: Learning to Reason by Avoiding Flaws(paper_card 1323)

邻接级 llm-infra NET-new 3 件: - arXiv:2609.11596 · EBL-Core(paper_card 1314) - arXiv:2609.11561 · MaP-WAM(paper_card 1322) - arXiv:2609.10266 · KVShareArena(paper_card 1304)

NET-new 论文方法学 3 件 v3.31 沿用: - arXiv:2606.01927 · Albireo - arXiv:2603.16104 · Helium - arXiv:2609.10266 · KVShareArena(双计)

NET-new arXiv 安全/基准论文 5 件 v3.31 沿用: - arXiv:2609.06674 · Detokenization Leaks - arXiv:2609.07529 · CoRL - arXiv:2609.10226 · Φ-Bench - ICML 2026 Open Reproductions(无 arXiv 号)

4.3 工程主轴 6 件邻接级 arXiv(v3.31 §1.(11) Kernel/Harness + §1.(2) 推理调度 沿用预备级 · jay 9-13 1122 engineering-e1prep + 1107 morning-briefing + 1450 afternoon-engineering-filter):

  • arXiv:2609.08572 · AgentGrad(增量已锚 v3.31 候选预备级)
  • arXiv:2609.11294 · Memory Compression Sandboxes
  • arXiv:2609.11209 · REVA(🟡 候选观察)
  • arXiv:2605.15040 · Microsoft Orchard(BAR + K8s harness + SWE-bench Verified 69.7%)
  • arXiv:2609.11390 · VikingRAG(目录片段 + drill-down retrieval token 效率新范式)
  • arXiv:2609.11318 · Mr.LHDR(25 系统 4 组评测)

4.4 13h 40min 净窗口期无 NET-new arXiv ID · arXiv ID 列表净增 = 0 件 · 沿用 v3.31 338 件闭合


五、与活文档 knowledge/llm-infra.md 现有脉络的关系(精简 · §IX 97 evening 棒位预备候选)

5.1 v3.31 升档棒全量沿用(§IX 97 morning 棒位已闭合)

  • 4 件 NET-new paper_card 主分类 llm-infra 入库预备级闭合(Beyond Solver Verdicts + Building Multilingual Bridges + Adaptive Bridge + Negative Self-Distillation)
  • 3 件 NET-new paper_card 邻接级 llm-infra 入库预备级闭合(EBL-Core + MaP-WAM + KVShareArena)
  • 9 件 NET-new 事件级/方法学预备扩增预备级闭合(NVIDIA Dynamo 1.0 + SGLang v0.5.19 + vLLM v0.20.2 + vLLM v0.29.0 + SGLang × TPU RadixArk + Miles SGLang 后训练 + SGLang DeepSeek GLM5.2 NVFP4 500 TPS + SGLang GB300 25× + Dynamo Day 2026 16 场)
  • 3 件 NET-new 论文方法学预备扩增预备级闭合(Albireo + Helium + KVShareArena)
  • 3 件 NET-new 工程化预备扩增预备级闭合(vLLM 调优实战命令 + Colibri + Ollama/vLLM/llama.cpp benchmark)
  • 5 件 NET-new CSDN 工程化预备扩增预备级闭合
  • 5 件 NET-new arXiv 安全/基准论文预备扩增预备级闭合(OpenShell + Detokenization Leaks + CoRL + Φ-Bench + ICML 2026 Open Reproductions)
  • 8 件矛盾/待核 v3.30 沿用 + D152 v3.31 新增
  • O500-O505 v3.31 新增 + P0 #244-#249 v3.31 新增 + T130 v3.31 新增

5.2 本棒位 v3.32 升档棒预备候选预备级(§IX 97 evening 棒位补强预备候选)

🟢 主分类 llm-infra NET-new 7 件锚入预备扩增预备级: - 增量 ① Akashic MemAttention arXiv:2607.05708 · §1.(11) Kernel/Harness + §1.(3) KV Cache 子轴 NET-new 锚入预备级补强"生产级 vLLM 0.10.0 扩展 · KV-cache 管理器保持不变 · 长期记忆持久化基础设施工具" · 首条生产级 vLLM 持久化记忆工作 · 与 jay 9-13 1450 Agent 记忆系统三路对比框架对齐 - 增量 ② 推理引擎可复现性 arXiv:2605.19537 · §1.(1) 推理引擎 + §1.(11) Kernel/Harness 子轴 NET-new 锚入预备级补强"推理后端应被列为 LLM 评估中的'隐性超参数' · benchmark 对比必须标准化报告推理栈" · 首条推理可复现性方法学 - 增量 ③ ai-dynamo/dynamo · §1.(1) 推理引擎子轴 NET-new 锚入预备级补强"GB200/B200/H200 K8s 分布式推理 + KV-aware routing(K8s Inference Gateway)+ KV offload S3/Azure + DeepSeek-V4-Flash 双后端 + Video generation FastVideo/SGLang Diffusion" - 增量 ④ NVIDIA NIM Operator for Kubernetes · §1.(2) 推理调度子轴 NET-new 锚入预备级补强"LLM NIM 容器生命周期管理 · 与 ai-dynamo/dynamo 构成 K8s 推理基础设施栈" - 增量 ⑤ SGLang vs vLLM vs LMDeploy 2026 Q2-Q3 实测基准对照 · §1.(1) 推理引擎 + §1.(2) 推理调度子轴 NET-new 锚入预备级补强"p99 TTFT SGLang 54.2s vs vLLM 58.9s + RadixAttention 6.4× 前缀复用 + TGI 已'gone' + RadixArk $400M" - 增量 ⑥ Ken Huang 10 章系列 Chapter 2 KV Cache Frontier · §1.(3) KV Cache 子轴 NET-new 锚入预备级补强"Hybrid CSA/HCA(DeepSeek-V4)+ MLA + Global Prefix Caching & KVShare" · 首条工业 KV Cache 战略级立场 - 增量 ⑦ HF WebGPU Kernels 200+ · §1.(1) 推理引擎子轴 NET-new 锚入预备级补强"本地 AI 推理无需服务器端 GPU · WebGPU inference 进入 HF 一级支持"

🟢 矛盾/待核 5 件新标记: - 警惕 ① Akashic MemAttention 7 月已雷达但 v3.31 未实质锚入 — 锚入节奏争议 · 截止 9-14 morning 棒位 v3.32 升档棒预备候选精修闭合预备级 - 警惕 ② arXiv:2605.19537 已锚入 v3.31 arXiv ID 列表但 §1 方法学未实质锚入 — 锚入维度争议 · 截止 9-14 morning 棒位精修闭合预备级 - 警惕 ③ SGLang p99 TTFT 54.2s vs vLLM 58.9s · 数字相对差距 vs 绝对差距争议 · 截止 9-14 morning 棒位精读四源原文核对数字精度与硬件配置前提 - 警惕 ④ ai-dynamo/dynamo KV-aware routing 与 NVIDIA Dynamo 1.0 KV-aware Router 概念重叠争议 · 截止 9-14 morning 棒位精读 releases 核对二者关系 - 警惕 ⑤ Ken Huang Substack Chapter 2 实际发布日期待核 · 截止 9-14 morning 棒位访问主页确认 · 若仅预告则降级为"10 章系列预告锚入预备级"

🟢 v3.31 8 件矛盾/待核沿用 + D152 v3.31 新增: - D150 BeaconKV + 矛盾 ② Random Attention + 矛盾 ③ Speculative Speculative Decoding + 矛盾 ④ DeepSeek V4 Flash Vision ApexBench + 矛盾 ⑤ arXiv:2609.04490 paper_card 1243 + 矛盾 ⑥ vLLM AMD MI300X disaggregation + 矛盾 ⑦ vLLM 冷启动 8→1min + 矛盾 ⑧ Snowflake Semi-Persistence vLLM 5.6×~19.9× + D152 NVIDIA Dynamo 1.0 4× TTFT + SGLang v0.5.19 786 PR + Albireo CPU time 100× + vLLM V1 1.7× throughput + Colibri 25GB RAM + Think Before You Link 方向写反校正 6 件矛盾/待核新标记 · 沿用闭合 = D1-D152

5.3 §IX 97 evening 棒位预备候选预判

核心:本棒位承接 v3.31 升档棒全量沿用 + 7 件 NET-new 主分类 llm-infra 锚入预备扩增预备级(Akashic MemAttention ⭐⭐⭐⭐⭐ + 推理引擎可复现性 arXiv:2605.19537 ⭐⭐⭐⭐⭐ + ai-dynamo/dynamo + NVIDIA NIM Operator + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测 + Ken Huang 10 章 KV Cache Frontier + HF WebGPU Kernels 200+)+ 5 件矛盾/待核新标记 + 3 件沿用矛盾/待核预备候选(待核 arXiv:2605.19537 章节预备级锚入 + Akashic vLLM 0.10.0 持久化记忆 + ai-dynamo KV-aware routing K8s 概念区分 NVIDIA Dynamo 1.0)→ §IX 97 evening 棒位预备候选预备扩增预备级 · v3.32 升档棒预备候选预备预备级 · 下次预计 9-14 morning cron(Wave3 E1 §IX 98 morning 棒位预备候选 / v3.31 升档棒沿用或 §IX 98 morning v3.32 升档棒)


本次变更

2026-09-13 18:40 (Wave3 E1 §IX 97 evening 棒位预备候选)

本轮 §IX 97 evening 棒位预备候选预备级承接主题:v3.31 升档棒全量沿用 + 0 件 NET-new paper_card 主分类 llm-infra 入库(13h 40min 净窗口期内 paper_cards 1334 张净增确认在 v3.31 cutoff 前已落档)+ 2 件 NET-new 论文方法学首次锚入预备级(Akashic arXiv:2607.05708 + 推理引擎可复现性 arXiv:2605.19537)+ 5 件 NET-new 事件级/方法学补充精修(ai-dynamo/dynamo + NVIDIA NIM Operator + SGLang/vLLM/LMDeploy 2026 Q2-Q3 实测 + Ken Huang 10 章 KV Cache Frontier + HF WebGPU Kernels 200+)+ 5 件矛盾/待核新标记 + 8 件矛盾/待核 v3.31 沿用 → §IX 98 morning 棒位预备候选预备扩增预备级核心 = ① Akashic MemAttention ⭐⭐⭐⭐⭐ 首条生产级 vLLM 0.10.0 持久化记忆工作 + ② 推理引擎可复现性 arXiv:2605.19537 ⭐⭐⭐⭐⭐ 首条推理可复现性方法学 = 双必读锚入预备级 · 与 jay 9-13 1450 Agent 记忆系统三路对比框架 + jay 9-13 1735 evening briefing Ken Huang 工业 Substack 立场扩增预备级 = v3.32 升档棒预备候选预备扩增预备级