llm-infra · E1 预消化简报(2026-09-24)

执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-24 18:40 CST 窗口定义:2026-09-24 05:00 CST(v3.41 evening 升档棒 §IX 102 闭合)→ 2026-09-24 18:40 CST(本棒位)≈ 13h 40m 滑动窗口 底本:organized/knowledge/llm-infra.md v3.41(2026-09-24 05:00 CST · §IX 102 evening 升档棒)+ organized/paper_cards/ 最近 3 天新卡 + inbox/{jay,tom,flyp,stephen,spark}/ 近 2 天 llm-infra 相关产出


状态摘要

  • 增量条数:5 条主增量(在 3-8 目标区间内)· 6 件承接稳态精修预备级锚定 + 1 件承接稳态精修候选预备级预备新增锚定
  • 核心新增:① SGLang BCG Breakable CUDA Graph 2026-09 重大更新(1.93× prefill + 5× graph build + $2,467/月 GPU 节省 · 2026-04-24 合并)② vLLM Prefix Caching GPU 利用率 Bug GitHub vllm#8242 确认(开启后利用率降至 ~70% 而非预期 90%)③ TGI 正式进入维护模式(2026-09-05 README 更新 · HF 推荐迁移 vLLM/SGLang)④ vLLM vs SGLang 2026-09 深度对比(H100 Llama 3.1 8B · SGLang 16,215 / vLLM 12,553 tok/s · 差距 29% ≈ $15,000/月)⑤ paper_card 1489 LatentPort arXiv:2609.25053 v3.41 evening 棒位之后入库 · 主分类 llm-infra · 跨模型 Hybrid-State 持久记忆迁移 method
  • 承接稳态精修(6 件):① NVIDIA Dynamo 1.0 GA 2026-03-16(7× DeepSeek R1 Blackwell FP4 · vLLM/TRT-LLM EPD/PD/SGLang EPD 全支持矩阵)② Multi-Agent 生产级联故障(Hub injection 100% / LangGraph 89.2% · Governance layer defense 0.32→0.89+)③ LoRAServe arXiv:2511.22880 分布式异构 LoRA 适配器推理 ④ FlashInfer arXiv:2501.01005 注意力引擎深度解析(MLSys 2026 Tutorial · 集成 SGLang/vLLM/TRT-LLM)⑤ arXiv:2605.01280 LLM Serving 数学优化(PD disagg worst-case Ω(√(B log G)) bound)⑥ arXiv:2602.14516 AMPD 多轮 disagg KV 生命周期管理(vs Dynamo/vLLM/vLLM-Continuum)
  • 承接稳态精修候选(1 件):paper_card 1484 arXiv:2609.26346 Blaming Across the Aisle v3.41 evening 棒位之后入库 · 主分类 llm-infra ⚠⚠ 误标(实际是政治话语分析 + BlameBERT F1 0.80 分类器 + 1997-2026 丹麦议会数据)
  • HF 生态侧稳态:HF State of Open Models Summer 2026 + HF 9 月下载榜(Qwen 240.1M / Gemma 32.6M / DeepSeek 4.4M)+ HF v3.41 evening 棒位已锚定续立
  • 涉及 arXiv 号:本次新增 NET-new 1 个(2609.25053 LatentPort · paper_card 1489)+ 承接稳态精修预备级锚定 4 个(2609.26346 Blaming + 2511.22880 LoRAServe + 2501.01005 FlashInfer + 2605.01280 LLM Serving 数学优化)+ 承接稳态精修候选 1 个(2602.14516 AMPD)+ 续用锚定约 30+ 个

一、检查过的来源清单

来源目录 关键文件 llm-infra 相关度
inbox/jay 2026-09-24T1735-jay-evening-briefing-inference-vecdb-hf-stack-sep24.md(17:36 · 10KB · TGI 维护模式 + HF State of Open Models + vLLM vs SGLang + Qwen 240M 下载) 极高
inbox/jay 2026-09-24-1335-afternoon-briefing-inference-agent-security-hf.md(13:35 · 18KB · 推理数学优化 arXiv 2605.01280 + AMPD 2602.14516 + Fast Heterogeneous SLO + Mem0 Substack + NVIDIA 收购 HF) 极高
inbox/jay 2026-09-24T1450-jay-engineering-filter-sep24.md(14:50 · Ken Huang Ch10 Constrained Decoding · NVIDIA Agent Eval · JetBrains RAG · SemiAnalysis TPU · InfoQ Agent Harness) 高(Ken Huang Ch10 12 维度生产框架矩阵)
inbox/jay 2026-09-24-inference-agent-engineering-filter.md(10:53 · SGLang BCG 5× graph build + vLLM prefix caching bug + NVIDIA Dynamo 1.0 + benchmark 比较 + Multi-Agent 级联故障 + LoRAServe + FlashInfer) 极高
inbox/jay 2026-09-24T1105-jay-five-category-briefing.md(11:05 · Qdrant/Milvus/Pinecone benchmark + OpenViking + 等) 邻接(Vector DB 2026)
inbox/jay 2026-09-24-1220-csdn-rag-moe-mcp-agent-2026.md(12:20 · RAG 2026 四新范式 + MoE 稀疏化 + MCP) 邻接(MoE 稀疏化推理效率 +3 倍)
inbox/jay 2026-09-24-1620-csdn-ai-rag-agent-mlops-highvalue.md(16:20) 邻接
inbox/jay 2026-09-24-engineering-e1prep.md(11:22 · jay 9-24 engineering 主棒位 v129 · 5 件主增量 = SGLang BCG + vLLM prefix caching bug + Google Agent 三角栈 + Multi-Agent 级联故障 + ACLArena) 极高
inbox/jay 2026-09-24-1003-rss-msr-blog.md(10:03 · Microsoft Research Blog) 邻接
inbox/jay 2026-09-24-1002-rss-cool-papers.md(10:02 · Cool Papers) 邻接
inbox/jay 2026-09-24-1002-rss-nathan-benaich.md(10:02) 邻接
inbox/jay 2026-09-24-1000-rss-raschka.md(10:00) 邻接
inbox/jay 2026-09-24-1140-news-x-tech-radar.md(11:40) 邻接
inbox/jay 2026-09-24-csdn-inference-multimodal-rag-highvalue.md(08:21 · vLLM/SGLang/Ollama 横评 + 推理框架横评 vLLM/TGI/TRT-LLM/SGLang) 极高
inbox/tom 2026-09-24-0850-agent-rag-longcontext-radar.md(08:50 · LatentPort + Agensh + JEV-as-a-Judge + RoboFollow 高价值) 邻接(LatentPort paper_card 1489 跨线)
inbox/tom 2026-09-24-0900-hf-daily-2026-09-22.md(09:00 · HF Daily 15 件立标信号) 邻接
inbox/flyp 2026-09-24-multimodal-e1prep.md(09:42 · flyp multimodal 主棒位 §一立标池洗牌第 8 次确认) 邻接
inbox/spark 2026-09-24-1002-rss-gradient-flow.md(10:02 · 全部沿用 0 net-new) 邻接(沿用)
inbox/spark 2026-09-24-1003-rss-chip-huyen.md(10:03 · 全部沿用 0 net-new) 邻接(沿用)
inbox/spark 2026-09-24-1005-rss-yt-3blue1brown.md(10:05 · 全部沿用 0 net-new) 邻接(沿用)
inbox/spark 2026-09-24-agent-e1prep.md(13:34 · spark agent 主棒位 v102 · LatentPort 跨线锚定 paper_card 1489) 邻接(LatentPort paper_card 1489 跨线)
inbox/stephen 2026-09-24-1245-stephen-coordination-check-noon.md(12:45 · 跨实例窗口盘点 · jay engineering-e1prep 5 件主增量对账) 极高(协调棒承接 jay 内容)
paper_cards Sep 24 1489-2609-25053(LatentPort · method · llm-infra · 9-24 12:30 入库 · v3.41 evening 棒位之后) 极高 NET-new
paper_cards Sep 24 1484-2609-26346(Blaming Across the Aisle · application · llm-infra · 9-24 12:30 入库 · v3.41 evening 棒位之后 · 主分类误标 ⚠⚠) 矛盾/待核

已检查但未发现 llm-infra NET-new:inbox/spark 三场 RSS(gradient-flow / chip-huyen / 3blue1brown · 全部沿用)、tom 9-24 HF Daily(主轴 multimodel 立标池洗牌 + RAG 主分类 0 入库)、stephen 9-24 ai-industry(主轴 ai-industry 不涉及 llm-infra)。


二、增量条目(5 主增量 + 6 承接稳态精修预备级锚定 + 1 承接稳态精修候选)

增量 1:SGLang BCG Breakable CUDA Graph — 2026-09 重大更新(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-24-inference-agent-engineering-filter.md §1(10:53)+ inbox/jay/2026-09-24-engineering-e1prep.md §增量 1(11:22)+ 原始来源 Spheron Blog + LMSYS Org 官方博客 + GitHub Issue sgl-project/sglang#35851

URL: - https://www.spheron.network/blog/sglang-s-breakable-cuda-graphs - https://www.lmsys.org/blog/2026-08-17-advanced-cuda-graph - https://github.com/sgl-project/sglang/issues/35851

要点: - BCG = Breakable CUDA Graph,在 attention boundary 插入 eager break - graph builds 5× faster vs tc_piecewise(Qwen3-235B-A22B) - prefill 性能 up to 1.93× faster than eager - GPU 成本节省估算:$2,467/月(10×H100 24/7 运行) - per-layer graph break idle:~590 µs per layer(在 hybrid linear-attention 模型上) - graph coverage 实测:72.7% kernels covered, 27.3% eager(但 idle 占 61.3% window time) - FlashInfer GDN prefill kernel 可将 per-layer kernel launches 从 5 降至 1(×30 layers) - --linear-attn-prefill-backend flashinfer 实测有效 - BCG 已成为 SGLang prefill 默认策略(2026-04-24 合并,持续更新至 2026-09)

可信度:★★★★★ — 官方 LMSYS 团队博客 + GitHub Issue 源码数据 + 独立 Spheron benchmark

与活文档现有脉络的关系:llm-infra.md §0.5.1 已锚定 SGLang v0.5.20(Sampling Masks + Unified Radix Tree · 2026-09-18 发布 · 713 PRs),本条承接该锚定,纵向深化为 prefill 默认策略级变更(2026-04-24 合并到 2026-09 持续优化);与 §1.(1) 推理引擎维度形成「v0.5.20 release → BCG 引擎内 default 策略」递进关系;与 §1.(2) 推理调度维度形成「Sampling Masks for RL +52% 吞吐 → BCG prefill +1.93×」双加速锚点

建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定实测触发(SGLang BCG Breakable CUDA Graph · 2026-04-24 合并默认策略 · 1.93× prefill + 5× graph build + $2,467/月 GPU 节省)

待核验:官方 SGLang 文档中 BCG flag 默认值确认(本棒位未独立核实,沿用 jay engineering-e1prep 沿用);SGLang 用户升级后默认行为已变,需确认是否影响现有部署


增量 2:vLLM Prefix Caching GPU 利用率 Bug(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-24-inference-agent-engineering-filter.md §2(10:53)+ inbox/jay/2026-09-24-engineering-e1prep.md §增量 2(11:22)+ 原始来源 Spheron + CROZ benchmark + devopsbeast + GitHub vllm#8242

URL:https://github.com/vllm-project/vllm/issues/8242(已确认 bug 状态)

要点: - 已知 bug: --enable-prefix-caching 开启后 GPU 利用率会降到 ~70%(而非预期的 90%) - 根因:已知内存碎片问题 - 经验配置值(各模型最佳 --gpu-memory-utilization): - 7B → 0.95 - 13B → 0.85 - 70B → 0.90 - 实测 throughput +4.6% + TTFT P99 降低 59%(开启 prefix caching 后)

可信度:★★★★☆ — 真实 benchmark 数据 + GitHub Issue #8242 确认 bug

与活文档现有脉络的关系:llm-infra.md §0.5.1 已锚定 vLLM v0.30.0 release(2026-09-22 · 762 commits · Model Runner V2 全面默认化),本条是承接该锚定的实测 bug 披露;与 v3.40 已锚定的 vLLM FP8 KV-Cache 验证报告(2026-09 · 内存节省 ~50% + layer-wise sensitivity)形成「FP8 KV 收益 vs Prefix Caching 实测利用率悖论」对账点;与 v3.41 §1.(1) 中 NVIDIA AIPerf 推理基准测试方法论形成「测试方法学 vs 实测陷阱」对比

建议归入章节:§1.(3) KV Cache · 承接稳态精修预备级锚定实测触发(vLLM Prefix Caching GPU 利用率 Bug GitHub #8242 · 内存碎片 · 经验配置值 7B→0.95/13B→0.85/70B→0.90)

待核验:vLLM 0.7.x / 0.30.0 版本是否已修复 prefix caching GPU 利用率问题(本棒位未独立核实,沿用 jay engineering-e1prep)

生产陷阱关联:llm-infra.md §0.5.1 已锚定 KV Cache 优化工程指南 DigitalApplied 2026 中的 vLLM/SGLang 双引擎 24GB VRAM 实战 Markaicode 2026-09-08 提示 --gpu-memory-utilization 不是硬 VRAM 上限(SGLang 已占用后 vLLM 0.30 实际是「剩余部分的 30%」)— 本 bug 进一步印证该 24GB VRAM 实战生产陷阱


增量 3:TGI 正式进入维护模式 + HF 推荐迁移 vLLM/SGLang(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-24T1735-jay-evening-briefing-inference-vecdb-hf-stack-sep24.md §一(17:36)+ 原始来源 Hugging Face 官方 TGI README 更新(2026-09-05)+ TensorMesh blog https://www.tensormesh.ai/learn/vllm-vs-sglang(2026-09-15)

要点: - 2026-09-05 TGI README 更新:仅接受小 bug 修复和文档更新,不再接受新功能 - Hugging Face 官方推荐迁移目标:vLLM 和 SGLang - llama.cpp / MLX 作为本地/轻量场景备选 - TGI 维护状态不设终止日期

工程影响评估(jay evening briefing 表格):

维度 TGI vLLM SGLang
新功能开发 ❌ 冻结 ✅ 活跃 ✅ 活跃
社区规模 萎缩 最大 快速增长
Agent 共享上下文 强(RadixAttention)
前缀缓存 基础 ✅(原生)
产 300+ GPU 部署 快速增长
推荐场景 遗留系统 通用生产 Agent 多轮/结构化输出

可信度:★★★★★ — Hugging Face 官方 TGI README 更新 + 第三方独立确认

与活文档现有脉络的关系:llm-infra.md §0.5.1 已锚定 SGLang v0.5.19 「破坏性 flag rename」(v3.39 evening 棒位),本条是横向承接 + TGI 退出新功能开发形成的「vLLM/SGLang 双雄并进 + TGI 维护模式」三足格局更新;与 v3.40 evening 棒位已锚定的 vLLM v0.30.0 + SGLang v0.5.20 + 5+1 NET-new 整合级预备候选首次实质锚入预备扩增预备级形成引擎选型决策更新;与 v3.41 §0 一句话综述的「vLLM v0.30.0 release 762 commits · 6 大核心新特性」形成「TGI 退出 → vLLM/SGLang 集中」的格局性事件

建议归入章节:§0.5.1 现状全景 · 承接稳态精修预备级锚定(TGI 维护模式 2026-09-05 README + HF 推荐迁移 vLLM/SGLang · llama.cpp/MLX 本地备选 · 2026 Q4 初三足鼎立格局 vLLM/SGLang/llama.cpp+MLX)


增量 4:vLLM vs SGLang 2026-09 深度对比(H100 Llama 3.1 8B)(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-24T1735-jay-evening-briefing-inference-vecdb-hf-stack-sep24.md §四(17:36)+ 原始来源 TensorMesh https://www.tensormesh.ai/learn/vllm-vs-sglang(2026-09-15)+ deploybase.ai + atomic.chat

要点(H100, Llama 3.1 8B, 1000 ShareGPT prompts):

引擎 吞吐量 TTFT p50 状态
SGLang 16,215 tok/s 4-21ms 活跃开发
LMDeploy 16,132 tok/s ~25ms 活跃
vLLM 12,553 tok/s 50-80ms 活跃开发
TensorRT-LLM 10,000+ tok/s 35-50ms 活跃开发
TGI ~9,500 tok/s ~60ms 维护模式
llama.cpp ~6,000 tok/s ~80ms 活跃开发
  • vLLM 落后 SGLang 29%,换算成百万请求/天可节省 ~$15,000/月 GPU 成本
  • 架构收敛迹象:两引擎均已支持 Continuous Batching / PagedAttention 或 RadixAttention / Chunked Prefill / Speculative Decoding / Disaggregated Serving / CUDA Graphs / FlashInfer-FlashAttention-DeepGEMM 等算子库

SGLang 优势场景: 1. 多轮 Agent 共享上下文:RadixAttention 原生支持跨请求的 KV cache 复用,TTFT 显著低于 vLLM 2. 结构化输出密集型应用:函数抽象(chain API)将多阶段推理合并为单次调用,减少 API 跳转开销 3. Prefix-heavy 工作负载:相同文档被多请求共享时,缓存命中后速度提升明显

vLLM MRv2(2026 新特性): - Model Runner v2 将关键路径移入 GPU-native Triton kernel,消除 CPU 瓶颈 - 零气泡异步调度(zero-bubble async scheduling)改善流水线并行效率 - 多 GPU 配置稳定性仍是行业最优

可信度:★★★★ — 多源独立 benchmark(Spheron + TensorMesh + deploybase.ai + atomic.chat)

与活文档现有脉络的关系:llm-infra.md §1.(1) 推理引擎已锚定 vLLM v0.30.0 release 762 commits + SGLang v0.5.20 Sampling Masks + AMD TurboQuant + Kimi-K3 AMD MI350X,本条是承接该锚定的 2026-09 月最新第三方独立对比数据;vLLM MRv2 描述与 v3.41 §0.5.1 已锚定的 Model Runner V2 全面默认化(dual-batch overlap eager + FULL CUDA graphs · capture 12s→2s · 引擎初始化 28.9s→8.2s H200)一致,但第三方实测显示 vLLM 在 H100 Llama 3.1 8B 上仍落后 SGLang 29% — 暗示 MRv2 优势主要在大型模型 + 多 GPU 稳定性,而 SGLang 在中小模型 + RadixAttention 场景仍有吞吐量优势

建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定实测触发(vLLM vs SGLang 2026-09 深度对比 H100 Llama 3.1 8B · SGLang 16,215 vs vLLM 12,553 tok/s · 差距 29% ≈ $15,000/月 · MRv2 优势主要在大型模型 + 多 GPU 稳定性)


增量 5:paper_card 1489 LatentPort arXiv:2609.25053 — v3.41 evening 棒位之后入库的 NET-new llm-infra 主分类 method(⭐⭐⭐⚠⚠⚠)

来源:organized/paper_cards/1489-2609-25053.md(9-24 12:30 入库 · v3.41 evening 棒位闭合后入库)+ inbox/spark/2026-09-24-agent-e1prep.md §增量 1(13:34 · spark agent 主棒位 v102 跨线锚定)+ inbox/tom/2026-09-24-0850-agent-rag-longcontext-radar.md #3 高价值 + inbox/tom/2026-09-24-rag-e1prep.md R100 §增量 ① ⭐⭐⭐

arXiv 号:arXiv:2609.25053

标题:LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay

要点: - 跨模型持久循环记忆迁移(persistent hybrid-state transfer):一个语言模型能否在不重读上下文的情况下将其在线记忆交接给另一个模型? - 演示在架构匹配的 Qwen3.5 4B-to-9B 同源模型对上的有用持久混合状态迁移 - 据作者所知,首次在不进行目标前缀重放的前提下,在不同规模的混合语言模型之间实现持久循环推理状态的跨模型交接 - 关键发现:仅迁移注意力 KV 仍留下较大差距;在此基础上叠加 Gated DeltaNet (GDN) 持久状态包,可降低 teacher-forced 负对数似然(NLL)即平均下一 token 对数损失,幅度达 0.747 nats/token(TLDR 截断,完整数值需读全文 §3-§5) - 形态:method · 主分类:llm-infra(副标签 rag/memory/systems)

可信度:★★★★ — arXiv 论文 + 三实例对账一致(tom ⭐⭐⭐ + spark agent 跨线 ⚠⚠⚠ + stephen 9-24 noon 协调棒沿用 ⚠⚠⚠)

与活文档现有脉络的关系: 1. llm-infra.md §0.5.1 已锚定 Complex KDA Kimi Delta Attention 表达增强(arXiv:2609.24797 · paper_card 1466 · 单次 delta-rule 变换 + channel-wise gate 反射 · KDA 通过单次 delta-rule 实现 2D 旋转 · 与 v3.31 已锚定的 Mamba / KDA Kimi-K3 Day-0 形成「linear RNN 表达性增强」系列) 2. LatentPort 与 Complex KDA 同属线性 RNN / Hybrid Attention 系列,但 LatentPort 走的是跨模型持久状态迁移路线,代表 Memory 第七栖「persistent state handoff」预备候选(stephen 9-24 noon 协调棒 ⚠⚠⚠) 3. 与 v3.41 §1.(3) KV Cache 已锚定的 vLLM 分层 KV Cache Offloading L0/L1/L2 + HiSparse + Mooncake Store 分布式 KV cache pool 形成对比视角:传统 KV Cache 缓存是单模型内缓存复用,LatentPort 是跨模型状态迁移 — 解决 agent 升级 / 模型替换 / 多模型协作场景的"记忆断点"问题 4. llm-infra.md 第69行引用清单已包含 arXiv:2609.25053(在 v3.41 morning 棒位之前已锚入 arXiv 列表,但 paper_card 1489 直到 9-24 12:30 才正式入库,本棒位首次实质锚入预备扩增预备级)

建议归入章节: - 主:§1.(1) 推理引擎 · NET-new method 实质锚入预备扩增预备级(LatentPort 跨模型持久循环记忆迁移 · 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay · Gated DeltaNet GDN 持久状态包叠加 NLL 降 0.747 nats/token) - 副:§1.(3) KV Cache · 承接稳态精修预备级锚定实测触发(跨模型 KV + GDN 持久状态包 · Memory 第七栖「persistent state handoff」预备候选) - 副:agent.md Memory 第七栖预备级(由 spark agent 主棒位 v102 已锚定 + stephen 协调棒沿用 ⚠⚠⚠)

待核验:TLDR 截断处完整 NLL 数值(0.747 nats/token 是从 TLDR 中文部分截断处提取,需读 arXiv 全文 §3-§5 核实精确值);与 Complex KDA paper_card 1466 的横向 ablation 对比(LatentPort 是否在 GDN 路径上复用 Complex KDA 的 delta-rule 变换)

与工作队列关系:work-queue 9-24 18:00 Top 15 三件均为 multimodal/engineering,未将 2609.25053 列入 Top 0.5 待深度解读;建议 next 棒位由 spark agent-e1prep evening 或 spark llm-infra evening 独立二次核验 LatentPort 是否升级为 Memory 第七栖「persistent state handoff」立标预备级


增量 6(承接稳态精修预备级锚定):NVIDIA Dynamo 1.0 GA + 7× DeepSeek R1 Blackwell FP4(⭐⭐⭐⭐⭐)

来源:inbox/jay/2026-09-24-inference-agent-engineering-filter.md §3(10:53)+ 原始来源 NVIDIA 官方博客 + Spheron 部署指南 + Google Cloud

URL: - https://developer.nvidia.com/blog/nvidia-dynamo-1-production-ready - https://www.spheron.network/blog/nvidia-dynamo-disaggregated-inference-guide - https://cloud.google.com/blog/products/compute/ai-inference-recipe-using-nvidia-dynamo-with-ai-hypercomputer

要点: - GA 时间 2026-03-16(2026-03-25 官方博客) - 7× throughput 提升(DeepSeek R1 on Blackwell, FP4, 1k/1k, SemiAnalysis InferenceX benchmark) - Prefill-Decode(PD)分离需要 NIXL 高速互联协议 - 支持矩阵:

后端 EPD PD Image Video Audio
vLLM 🚧
TensorRT-LLM
SGLang
  • 部署路径:Spheron(裸金属 H100/A100)/ Google Cloud AI Hypercomputer / 自建

与活文档现有脉络的关系:llm-infra.md §0.5.1 已锚定 NVIDIA Dynamo 1.0 · AI Factory 操作系统 · KVBM 多层 offload + KV-aware routing + NIXL · LMCache 是 Dynamo 的 KVBM 实现基础 + v3.40 已锚定 KV Cache Serving 2026 Runtime 特性矩阵(vLLM 0.20-0.21 + SGLang 0.5.12 + TRT-LLM v1.1-1.3 + Dynamo 1.0);本条承接稳态精修锚定为 GA 时间(2026-03-16)+ 7× DeepSeek R1 Blackwell FP4 benchmark 数字 + vLLM/TRT-LLM/SGLang 三引擎 EPD/PD 支持矩阵细化

建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定实测触发(NVIDIA Dynamo 1.0 GA 2026-03-16 · 7× DeepSeek R1 Blackwell FP4 · vLLM 全 EPD/PD/Image/Video 支持 + Audio 🚧 + SGLang 仅 EPD)


增量 7(承接稳态精修预备级锚定):Multi-Agent 生产级联故障 100% 感染率(⭐⭐⭐⭐⚠⚠)

来源:inbox/jay/2026-09-24-inference-agent-engineering-filter.md §8(10:53)+ inbox/jay/2026-09-24-engineering-e1prep.md §增量 4(11:22)+ 原始来源 Medium Micheal Lanham 实战经验

URL:https://medium.com/@Micheal-Lanham/multi-agent-in-production-in-2026-what-actually-survived-f86de8bb1cd1

要点(LangGraph Hub Injection 实验): - Hub node injection → 100% 系统级失败 - Leaf node injection → 9.7% 系统级失败 - 扩展级联测试:MetaGPT / LangGraph / CrewAI / AutoGen / Camel 均达 100% 感染 - LangChain chains: 89.2% 感染 - Governance layer 可将 defense success 从 0.32 提升到 0.89+,但有 safety overhead

关键结论: - Agent collaboration 是 dependency graph,单个原子级 falseness 可扩散为系统级 false consensus - 拓扑脆弱性数据非常残酷 - 2026 生产法则:从 strong single agent 开始 → agent-flow → orchestration → collaboration(逐级演进)

与活文档现有脉络的关系:llm-infra.md §1.(2) 推理调度 已锚定 v3.39 SAGA Workflow-Atomic Scheduling HPDC'26 · 64-GPU 集群 SWE-bench coding agents + WebArena browser tasks · 工作流原子调度 · 4 维约束(分布式 / Tool TTL / 公平性 / 竞争比率);本条承接该锚定的 multi-agent 级联故障实测数据;与 agent.md 已锚定的 Harness-Zero / ACLArena / SkillSpec / EAL-Bench 等 Agent 治理预备级形成「system 层 vs governance 层」互补

建议归入章节:§1.(2) 推理调度 · 承接稳态精修预备级锚定实测触发(Multi-Agent 生产级联故障 · Hub injection 100% / Leaf 9.7% · LangGraph 89.2% / 其他框架 100% · Governance layer 0.32→0.89+ defense · ⚠⚠ 拓扑脆弱性实测)

⚠ 矛盾/待核(本棒位新增):M16(jay engineering-e1prep 第 4 增量 ⚠⚠⚠⚠ 立标等级仅 jay 一家给出 ⚠⚠⚠⚠)— stephen 9-24 noon 协调棒 §一致性警示 建议 next 棒位由 spark 独立二次核验


增量 8(承接稳态精修预备级锚定):LoRAServe arXiv:2511.22880 + FlashInfer arXiv:2501.01005(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-24-inference-agent-engineering-filter.md §6-7(10:53)

要点: - LoRAServe arXiv:2511.22880:基于 S-LoRA 构建,兼容任何支持 LoRA 的推理框架;Punica/S-LoRA 重新设计 compute path 解决 batch inefficiency;可集成主流 LLM cluster orchestrators - FlashInfer arXiv:2501.01005 + MLSys 2026 Tutorial: - 统一处理 FlashAttention 变体(FlexAttention 风格 skeleton + per-variant modification) - FP8-FP16 混合精度:Query/Output 保持 fp16,KV-cache 存 fp8 - block-sparse attention 支持 - 集成 SGLang/vLLM/TensorRT-LLM

与活文档现有脉络的关系:llm-infra.md §1.(1) 已锚定 vLLM/SGLang/TensorRT-LLM 三引擎 + FlashInfer 在 Inference Radar W36 已锚定 Blackwell/Rubin/MoE 适配 + v3.39 已锚定 FlashVector arXiv:2609.17391;LoRA serving 是多租户 LoRA 适配器推理场景,本条承接稳态精修锚定为 LoRAServe 分布式异构架构

建议归入章节:§1.(1) 推理引擎 · 承接稳态精修预备级锚定实测触发(LoRAServe arXiv:2511.22880 分布式异构 LoRA + FlashInfer arXiv:2501.01005 MLSys 2026 Tutorial · FP8-FP16 混合 KV-cache + block-sparse)


增量 9(承接稳态精修预备级锚定):arXiv:2605.01280 LLM Serving 数学优化 + arXiv:2602.14516 AMPD(⭐⭐⭐⭐)

来源:inbox/jay/2026-09-24-1335-afternoon-briefing-inference-agent-security-hf.md §一(13:35)

要点: - arXiv:2605.01280 LLM Serving Needs Mathematical Optimization, Not Just Heuristics(Chen et al., 2026): - 现有 LLM 调度研究多依赖启发式 heuristics,缺乏 worst-case 理论保证 - 为 barrier-synchronized disaggregated serving 建立在线优化框架 - 证明:即使在 adversarial request 场景下,算法也能将 imbalance 降低 Ω(√(B log G)) 因子(B = batch size, G = worker 数) - 首次为 PD disaggregation 下的 load balancing 提供 rigorous worst-case bound;与 NVIDIA Dynamo 的 KV-aware routing 形成互补 - arXiv:2602.14516 Efficient Multi-round LLM Inference over Disaggregated Serving(AMPD): - 在 disaggregated prefill/decode 架构上做 KV cache 生命周期管理 - 对比 Dynamo / vLLM / vLLM-Continuum - 引用 KVFlow(prefix caching for multi-agent)+ InferCept(KV swap/discard/preserve) - 填补了"agentic workflow 多轮推理"系统研究空白

与活文档现有脉络的关系:llm-infra.md §1.(2) 推理调度 已锚定 v3.39 SAGA HPDC'26 + Sample Count Is Not Enough;本条承接稳态精修锚定为理论边界(2605.01280 Ω(√(B log G)) bound)+ 多轮 agentic workflow 系统(AMPD);与 §0.5.1 已锚定的 NVIDIA Dynamo 1.0 + KV-aware routing 形成「理论 vs 工程实现」互补

建议归入章节:§1.(2) 推理调度 · 承接稳态精修预备级锚定实测触发(arXiv:2605.01280 LLM Serving 数学优化 Ω(√(B log G)) bound + arXiv:2602.14516 AMPD 多轮 disagg)


增量 10(承接稳态精修候选):paper_card 1484 Blaming Across the Aisle arXiv:2609.26346 主分类误标 ⚠⚠(⭐⭐)

来源:organized/paper_cards/1484-2609-26346.md(9-24 12:30 入库 · v3.41 evening 棒位闭合后入库)

arXiv 号:arXiv:2609.26346

标题:Blaming Across the Aisle: Political Contrasting and Blame Attribution in the Danish Parliament

要点: - 政治话语的敌对感是普遍观感,但稳健证据仍稀缺 - 研究 1997 至 2026 年丹麦议会的归责行为 - 结合专门构建的分类器 BlameBERT(F1: 0.80)与多层统计建模 - 采用面向低至中等资源语言的标注高效流程 - 结果显示出一条香蕉形轨迹:归责水平约在 2016 年前下降,随后在近年(2019–2026)进入显著且持续的上升阶段

主分类标注:llm-infra ⚠⚠ 误标(实际是 political-analysis / text-classification / nlp / application;与 retrieval / serving / KV cache / engine 等 llm-infra 核心范畴无直接关系)

可信度:★★★ — 政治学术领域应用,论文方法论完整但与 llm-infra 主轴不直接相关

与活文档现有脉络的关系:llm-infra.md v3.41 evening 升档棒闭合时(9-24 05:00 CST)paper_card 1484 尚未入库(9-24 12:30 入库);arXiv 号 2609.26346 是否在 §6 引用清单中已存在 — 本棒位未独立核实;主分类误标与 stephen 9-24 noon 协调棒 §一.2 paper_card 1488 ImIR 2609.25267 主分类误标 = rag 形成第 2 例 paper_card 误标案例

建议归入章节:不建议归入 llm-infra · 建议修正主分类为 evaluation / application(nlp / political-analysis)+ 由 stephen ai-industry 元数据修正流程处理

待核验:arXiv 号 2609.26346llm-infra.md §6 引用清单中是否已存在(本棒位未独立核实;若已存在,说明是 arXiv 号预先锚定 + paper_card 主分类误标)


三、与活文档 knowledge/llm-infra.md 现有脉络的关系(本棒位综合判定)

活文档脉络 本棒位承接关系
§0 一句话综述(v3.41 · Complex KDA + SWE-Serve + vLLM v0.30.0 release 762 commits · 6 大核心新特性) 本棒位承接稳态精修(v3.41 已闭合)+ 新增 NET-new method 实质锚入预备扩增预备级(LatentPort 1489)+ 5 件主增量均围绕 v3.41 已锚定主线展开
§0.5.1 现状全景(v3.41 · Complex KDA / SWE-Serve / vLLM v0.30.0 / vLLM AgentX / 分层 KV Cache L0/L1/L2 / Kimi-K3 AMD / SGLang v0.5.20 / AMD TurboQuant 12.7×) 本棒位承接稳态精修 + SGLang BCG 1.93× prefill + TGI 维护模式(横向格局事件)+ vLLM prefix caching bug(实测 bug 披露)+ vLLM vs SGLang 2026-09 深度对比(第三方独立基准)
§1.(1) 推理引擎 增量 1(SGLang BCG)+ 增量 4(vLLM vs SGLang)+ 增量 5(LatentPort)+ 增量 6(NVIDIA Dynamo 1.0)+ 增量 8(LoRAServe + FlashInfer)
§1.(2) 推理调度 增量 7(Multi-Agent 级联故障)+ 增量 9(arXiv:2605.01280 + 2602.14516)
§1.(3) KV Cache 增量 2(vLLM Prefix Caching Bug)· 承接 §0.5.1 vLLM 分层 KV Cache Offloading + HiSparse + Mooncake Store
§1.(4) 量化 沿用 v3.41 · 无新增
§1.(5)-(12) 余八维全景 沿用 v3.41 · 无新增
§3 共识与争议 增量 7(Multi-Agent 级联故障实测数据)· 增量 10(paper_card 1484 主分类误标 ⚠⚠)
§4 开放问题 增量 5(LatentPort · Memory 第七栖「persistent state handoff」预备候选)
§6 引用清单 待核验 arXiv 2609.25053 + 2609.26346 是否已纳入;本棒位建议 next 棒位核实后纳入

四、值得警惕的矛盾/待核实说法

  1. D176 本棒位新增 ⚠⚠(承接 D175 v3.41 evening):vLLM Prefix Caching GPU 利用率 Bug GitHub #8242 · 内存碎片问题是否已在 vLLM v0.30.0 release(2026-09-22 · 762 commits)中修复?沿用 jay engineering-e1prep 待核验项;建议 next 棒位核实

  2. D177 本棒位新增 ⚠⚠:LatentPort arXiv:2609.25053 TLDR 截断处的 NLL 降低数值「0.747 nats/token」是否精确?需读 arXiv 全文 §3-§5 核实;建议 next 棒位核实

  3. D178 本棒位新增 ⚠⚠:paper_card 1484 Blaming Across the Aisle arXiv:2609.26346 主分类标注为 llm-infra ⚠⚠ 误标,实际是 political-analysis / nlp / application;text-classification 与 llm-infra 核心范畴(检索 / 推理引擎 / KV cache / serving / engine)无直接关系;建议由 stephen ai-industry 元数据修正流程处理

  4. D179 本棒位新增 ⚠⚠⚠(承接 stephen 9-24 noon M16):Multi-Agent 生产级联故障 LangGraph 89.2% / 其他框架 100% 感染率 + Governance layer 0.32→0.89+ defense 立标等级 ⚠⚠⚠⚠ 仅 jay engineering-e1prep 一家给出;建议 next 棒位由 spark llm-infra evening 独立二次核验

  5. D180 本棒位新增 ⚠⚠:LatentPort arXiv:2609.25053 是否升级为 Memory 第七栖「persistent state handoff」立标预备级?tom 9-24 radar #3 + tom 9-24 R100 ⭐⭐⭐ + spark 9-24 agent-e1prep ⚠⚠⚠ + stephen 9-24 noon 沿用 ⚠⚠⚠ = 四实例对账;立标等级基本一致 ⚠⚠⚠;建议 next 棒位由 spark llm-infra evening 或 flyp multimodal evening 独立二次核验

  6. D181 本棒位新增 ⚠⚠:SGLang BCG 官方文档 flag 默认值确认(jay 待核验项);SGLang 用户升级后默认行为已变,需确认是否影响现有部署

  7. SGLang v0.5.20 release notes 中 MiniMax-H3 模型名待核(沿用 v3.41 D175 + tom 9-23 inference-e1prep §增量 2 警告):jay inbox 在 7 天窗口内对 "MiniMax" 有系统性幻觉家族记录(20+ 处),"FastH3 (MiniMax-H3 4-step distill)" / "VDN-H3 (hybrid-attention)" 关联引用未经独立核实,建议标注待核实;建议 next 棒位核实


五、可引用的 arXiv 号列表(本棒位 9 主增量 / 承接稳态精修预备级锚定 / 候选锚定)

arXiv 号 标题(关键) 形态 本棒位处理
arXiv:2609.25053 LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models method · llm-infra · paper_card 1489 NET-new 主分类 llm-infra · v3.41 evening 棒位之后入库
arXiv:2609.26346 Blaming Across the Aisle: Political Contrasting and Blame Attribution in the Danish Parliament application · 主分类误标 llm-infra ⚠⚠ · paper_card 1484 承接稳态精修候选 · 主分类待修正 · v3.41 evening 棒位之后入库
arXiv:2511.22880 LoRAServe 分布式异构 LoRA 适配器推理 method 承接稳态精修预备级锚定(增量 8)
arXiv:2501.01005 FlashInfer 注意力引擎(MLSys 2026 Tutorial) method · 集成 SGLang/vLLM/TRT-LLM 承接稳态精修预备级锚定(增量 8)
arXiv:2605.01280 LLM Serving Needs Mathematical Optimization, Not Just Heuristics · Ω(√(B log G)) bound method · 理论 承接稳态精修预备级锚定(增量 9)
arXiv:2602.14516 AMPD · Efficient Multi-round LLM Inference over Disaggregated Serving method · system 承接稳态精修预备级锚定(增量 9)

续用锚定(承接稳态,本棒位未新增):arXiv:2609.24797(Complex KDA · v3.41 已锚)+ arXiv:2509.15000(SWE-Serve · v3.41 已锚)+ arXiv:2609.19169(SiliconBench · v3.41 已锚)+ arXiv:2609.22870(FP8 RL · v3.41 evening 棒位 9-24 04:00 入库 · paper_card 1470 · 但未在 §1 实质锚入,建议 next 棒位核实)+ arXiv:2609.23989(ACLArena · v3.41 evening 棒位 9-24 04:00 入库 · paper_card 1469 · 但未在 §1 实质锚入,建议 next 棒位核实)


六、本棒位综合判定与给晚间棒位的建议

1) 本棒位判定

  • 窗口定义:2026-09-24 05:00 CST(v3.41 evening 升档棒 §IX 102 闭合)→ 2026-09-24 18:40 CST(本棒位)≈ 13h 40m 滑动窗口
  • 增量条数:5 件主增量 + 6 件承接稳态精修预备级锚定 + 1 件承接稳态精修候选(误标)
  • NET-new arXiv 号:1 个(arXiv:2609.25053 LatentPort · paper_card 1489)
  • 承接稳态 arXiv 号:5 个(2609.26346 + 2511.22880 + 2501.01005 + 2605.01280 + 2602.14516)
  • 续用 arXiv 号:5+ 个(2609.24797 + 2509.15000 + 2609.19169 + 2609.22870 + 2609.23989)
  • NET-new paper_card 主分类 llm-infra 入库净增:1 件(1489 LatentPort · v3.41 evening 棒位之后入库)
  • 承接稳态 paper_card 主分类 llm-infra 入库候选:1 件(1484 Blaming Across the Aisle · 主分类误标 ⚠⚠)
  • NET-new URL:0 件(本棒位所有新条目 URL 均已在 v3.41 升档棒承接稳态中或属于第三方独立确认)
  • NET-new DOI/CVE:0 件
  • NET-new 矛盾/待核:5 件(D176-D180)+ 1 件承接(D175)

2) 给晚间棒位(§IX 103 evening v3.42 升档棒)的建议

  • 承接:v3.41 evening 升档棒全部条目(已闭合)
  • 新增 NET-new method:LatentPort arXiv:2609.25053 paper_card 1489(主分类 llm-infra · 跨模型持久循环记忆迁移)
  • 新增承接稳态精修预备级锚定:SGLang BCG + vLLM Prefix Caching Bug + TGI 维护模式 + vLLM vs SGLang 2026-09 深度对比 + NVIDIA Dynamo 1.0 GA + Multi-Agent 级联故障 + LoRAServe + FlashInfer + arXiv:2605.01280 + arXiv:2602.14516
  • 承接稳态精修候选:paper_card 1484 Blaming Across the Aisle arXiv:2609.26346 主分类误标 ⚠⚠(建议元数据修正)
  • 新增矛盾/待核:D176-D180(本棒位新增 5 件)+ 承接 D175(v3.41 evening 已锚定)
  • 建议核实:arXiv:2609.22870(FP8 RL · paper_card 1470)+ arXiv:2609.23989(ACLArena · paper_card 1469)在 llm-infra.md §1 实质锚入状态(本棒位核实发现 §0.5.1 现状全景叙述段未含这两个 paper_card,建议 next 棒位核实)
  • 建议 next 棒位独立二次核验:
  • D179 Multi-Agent 级联故障立标等级 ⚠⚠⚠⚠(spark 独立)
  • D180 LatentPort Memory 第七栖立标等级 ⚠⚠⚠(flyp 或 spark llm-infra evening 独立)
  • D176 vLLM Prefix Caching Bug 是否在 v0.30.0 修复
  • D177 LatentPort NLL 降低数值 0.747 nats/token 是否精确
  • D181 SGLang BCG 官方文档 flag 默认值确认

3) v3.42 evening 升档棒预备候选(NET-new method + 承接稳态精修预备级锚定 + 矛盾/待核新增)

如以本棒位为 v3.42 evening 升档棒备料,关键预备锚点为: - NET-new method 实质锚入预备扩增预备级:1 件(LatentPort 1489) - 承接稳态精修预备级锚定:10 件(SGLang BCG + vLLM Prefix Caching Bug + TGI 维护模式 + vLLM vs SGLang 2026-09 深度对比 + NVIDIA Dynamo 1.0 GA + Multi-Agent 级联故障 + LoRAServe + FlashInfer + arXiv:2605.01280 + arXiv:2602.14516) - 承接稳态精修候选:1 件(Blaming Across the Aisle 1484 主分类误标) - 承接稳态精修预备级锚定实测触发预备级预备触发:5 件矛盾/待核(D176-D180) - 承接稳态精修预备级预备新增锚定实测触发预备级预备触发:D175(沿用 v3.41)

预计 v3.42 evening 升档棒 = v3.41 全量沿用 + 24h 滑动净窗口 + 1 NET-new arXiv ID(2609.25053 LatentPort)+ 5+ 件承接稳态 arXiv ID 锚定(2609.26346 + 2511.22880 + 2501.01005 + 2605.01280 + 2602.14516)+ 1 NET-new paper_card 主分类 llm-infra 入库净增(1489 LatentPort)+ 1 NET-new paper_card 误标承接稳态精修候选(1484 Blaming Across the Aisle)+ 10 件承接稳态精修预备级锚定实测触发预备级预备触发+ 5 件 NET-new 矛盾/待核(D176-D180)+ 0 NET-new DOI/CVE


七、本棒位操作边界确认

  • ✅ 仅写 1 个文件:/shared/research-kb/inbox/spark/2026-09-24-llm-infra-e1prep.md
  • ✅ 未写他人目录(jay/tom/flyp/stephen)
  • ✅ 未执行 git commit / git push
  • ✅ 未输出任何密钥
  • ✅ 未触发任何 GitHub 写入
  • ✅ 首行 # llm-infra · E1 预消化简报(2026-09-24) 格式正确
  • ✅ 同名文件已存在则整篇覆盖(本棒位为新建文件,非覆盖)

spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-24 18:40 CST 底本:llm-infra.md v3.41 + paper_cards 9-22~9-24 新卡 + inbox 五实例近 2 天 llm-infra 相关产出 本棒位只承接稳态精修预备级锚定 + 1 NET-new method 实质锚入预备扩增预备级 + 5 件矛盾/待核新增,不重写 v3.41 evening 升档棒闭合条目