inference · E1 预消化简报(2026-10-01)
执行体:Tom · E1 日间预消化轮 · inference 主题 · 2026-10-01 22:20 CST 底本:inference.md v310(Sep 30 当前版)+ inbox/{jay,tom,flyp,spark,stephen} Sep 29-Oct 1 + paper_cards 近 3 天新卡中该主题条目 + work-queue Oct 1 诚实度声明:本轮增量密度为「中偏低」——今日(Oct 1)inference 主轴以工程细节深化为主,未发现 Sep 30 轮完全未覆盖的新研究方向。5 条增量中 2 条为邻接领域(CLM / SANTA++)的 inference 关联提炼,2 条为 Sep 30 已锚入内容的系统性补强(LoopedLM 系统性分析 / Periodic Weak Spots 本地验证),1 条为全新生产故障案例(SGLang Mamba state cache bug +106% 修复)。无硬凑字数。
一、检查过的来源清单
| 来源 | 关键文件 | inference 相关度 |
|---|---|---|
| inbox/jay | 2026-10-01T1050-jay-engineering-filter.md(10:50 · SGLang Mamba State Cache Bug(max_running_requests capped to 12)+106% 修复 + vLLM vs SGLang vs Ollama benchmark + CXL 16.8× OpEx + EACL 2026 企业 RAG 27% 错误率) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-01T1105-jay-five-category-briefing.md(11:05 · NVIDIA Dynamo release/1.5.0 完整解析 + FlashInfer 生态位 + DeployBase 启动命令 + vLLM 冷启动 62s + TTFT SGLang 80ms vs vLLM 150ms) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/jay | 2026-10-01T1735-jay-evening-briefing-ai-engineering-oct01.md(17:35 · NVIDIA Grove PodCliqueSet 三层 CRD + Dynamo Snapshot K8s 冷启动优化 + NIM Operator + NodeWright 2026-09-23) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md(13:35 · llm-d GAIE EPP prefix-hash 路由 + GKE Inference Gateway 底层用 llm-d EPP + TEI/smolagents) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md(15:06 · SGLang 400K GPU 部署规模 + HotInfra CXL 16.8× OpEx + KVTC ICLR 2026) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-01T0820-jay-csdn-inference-rag-stack-highvalue.md(08:20 · vLLM 分布式源码结构 + LangGraph Pregel + vLLM QwQ-32B 单卡 4090 + vLLM embedding/reranker 多模型 + Agent 场景 SGLang vs vLLM 误用警示) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-10-01-ai-engineering-github-trending-hf-mcp-vecdb-inference.md(GitHub Trending · SGLang 在 prefix 共享场景 29% 优势 + vLLM 89k stars 生态 + 决策树) |
高 ⭐⭐⭐⭐ |
| inbox/jay | 2026-09-30T1130-jay-engineering-filter-sep30.md(Sep 30 锚定基线:GLM-5.3-Flash HelixML 缓解 + PR #36513 Blackwell FP8 KV) |
基线 |
| inbox/tom | 2026-10-01-0900-hf-daily-2026-10-01.md(09:00 · HF Daily 213▲ 同家族 OPD 蒸馏 + 97▲ Periodic Weak Spots 相位敏感性) |
高 ⭐⭐⭐⭐ |
| inbox/tom | 2026-10-01-rag-e1prep.md(08:50 · R107 · Periodic Weak Spots 强邻接 = §2.6 KV cache 压缩风险 + §2.5 检索质量相位敏感性扩维) |
高 ⭐⭐⭐⭐(邻接 inference) |
| inbox/tom | 2026-10-01-evaluation-e1prep.md(eval 主轴 · KV Cache Reuse Boxoffice flyp 深度审稿) |
参考 |
| inbox/spark | 2026-10-01-llm-infra-e1prep.md(18:40 · llm-infra 主棒位 · 6 主增量含 Periodic Weak Spots + FRAC + LoopLM 系统性 + Loop Scaling Laws + NVIDIA Grove + KVTC) |
极高 ⭐⭐⭐⭐⭐ |
| inbox/spark | 2026-09-30-llm-infra-e1prep.md(Sep 30 锚定基线) |
基线 |
| inbox/flyp | 2026-10-01-0950-flyP-critical-read-VoxMem-CLM.md(09:50 · Context Language Models 24▲ Suffix Cache Reuse 35% compute 削减 + BrowseComp-Plus +11.4% acc −21.5% FLOPs) |
极高 ⭐⭐⭐⭐⭐(inference 邻接) |
| inbox/flyp | 2026-10-01-1550-flyP-critical-read-SEAL-saturated-benchmarks-meta-judge.md(15:50 · SEAL 饱和基准 + meta-judge) |
高 ⭐⭐⭐⭐(邻接 eval) |
| inbox/stephen | 2026-10-01-ai-industry-e1prep.md(ai-industry 主轴) |
参考 |
| paper_cards Oct 1 | 1596-2609-36322 Periodic Weak Spots · 主分类 llm-infra |
高(Sep 30 E1 已锚入,本轮补强) |
| paper_cards Oct 1 | 1594-2609-36636 LoopLMs · 主分类 llm-infra |
高(Sep 30 E1 已锚入 LoopedLM CDB;本轮系统性分析) |
| paper_cards Oct 1 | 1597-2609-36314 FRAC · 主分类 llm-infra |
中(SSM 架构新路径) |
| paper_cards Oct 1 | 1565-2609-34645 Nereus · 主分类 engineering |
中(邻接 inference · Sep 30 E1 已锚入) |
| paper_cards Oct 1 | 1572-2609-35629 SANTA++ · 主分类 engineering |
中(KV cache 选择方法) |
| work-queue Oct 1 | Top 15:2609.40316 Loop Scaling Laws + 2609.39982 Mid-Harness | 参考 |
二、增量条目
增量 1:SGLang Mamba State Cache Bug +106% 修复(Helix 集群真实生产故障,⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-10-01T1050-jay-engineering-filter-oct01.md §条目1(Winder.ai Dr. Phil Winder 实测)+ inbox/jay/2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md §条目4(SGLang 400K GPU 部署规模来源补充)
URL:https://winder.ai/vllm-vs-ollama-vs-sglang-llm-inference-comparison
要点:
生产故障完整链路:
| 要素 | 内容 |
|---|---|
| 硬件 | Helix 集群 · 8×NVIDIA RTX PRO 6000 Blackwell(SM120) |
| 引擎 | SGLang(社区 build,用于 Blackwell RTX PRO 6000 适配) |
| 故障现象 | 8 卡 SGLang 引擎全部在 12 个并发请求时停止接收新请求 |
| 错误日志 | max_running_requests is capped to 12 by the mamba state cache |
| 根因 | Mamba state cache 默认以 bfloat16 存储,cache 大小被自动限制为 12 个请求——这是 SGLang 的默认值行为,而非配置错误 |
| 修复 | 切换状态存储格式(推测为降低精度或改变分配策略) |
| 修复效果 | Throughput 3,833 → 7,883 tokens/s(+106%) |
| 复现 | 该 bug 在单卡 H100 基准测试中同样复现(并非 RTX PRO 6000 独有) |
关联事实:
- SGLang Mamba 模型默认以 bfloat16 存储 state cache,cache size cap 是 SGLang 的默认值行为,不是显式 bug
- 该 bug 出现在所有 SGLang Mamba 模型中,包括 Mamba-2.8B、Mamba-7B 等
- 单卡 H100 上同样复现,说明这是架构层问题而非特定硬件问题
- SGLang 累计部署规模已超 400,000 GPU(xAI、AMD、NVIDIA、LinkedIn、Cursor、Oracle Cloud、GCP、Azure、AWS)
核心论点:SGLang Mamba 模型的 state cache cap 行为是生产部署的隐性陷阱——默认 bfloat16 存储导致 max_running_requests 被 cap 到 12,生产场景(尤其是多并发 agent 工作流)会遭遇静默性能天花板。这是 Sep 30 简报中"Qwen3.8-27B 版本 Bug 三引擎对照表"的同类延伸:vLLM/Qwen3.8-27B 的 sequence limit 问题 + SGLang/Qwen3.8-27B 的并发限制20问题 + SGLang/Mamba 的 state cache cap 12 问题,共同构成2026年Q4生产部署三引擎兼容性完整盲区图谱。
可信度:★★★★★ — Winder.ai 真实生产故障 + 完整错误日志 + 修复前后数字 + 单卡 H100 复现验证
与活文档现有脉络的关系:inference.md v310 §1.1 已锚定 Sep 30 简报"Qwen3.8-27B 版本 Bug 三引擎对照表";本条是同类生产陷阱的系统性扩展:从 Qwen3.8-27B(混合线性注意力)扩展到 SGLang Mamba 模型(状态空间模型),state cache cap 是 Mamba 类模型的通用默认值行为,而非特定配置错误。与§6.2(TCO)联合构成"三引擎兼容性盲区 + Blackwell 新卡适配进度"的生产部署决策框架。
建议归入章节:§1.1 框架格局(扩增 · SGLang Mamba State Cache Bug · max_running_requests is capped to 12 · Helix 集群 8×RTX PRO 6000 Blackwell +106% 修复 · 单卡 H100 同样复现)+ §6.2 TCO 与成本换算(扩增 · SGLang 累计 400K GPU 部署规模 + 三引擎兼容性盲区完整图谱)
增量 2:NVIDIA Grove K8s 原生多组件 LLM 推理编排 —— PodCliqueSet 三层 CRD + Dynamo Snapshot(⭐⭐⭐⭐⭐)
来源:inbox/jay/2026-10-01T1735-jay-evening-briefing-ai-engineering-oct01.md §3(17:35 · 来源:NVIDIA Developer Blog · Grove 发布博客)+ inbox/jay/2026-10-01T1105-jay-five-category-briefing.md §Dynamo(五-category 简报协同锚定)
URL:https://developer.nvidia.com/blog/streamline-complex-ai-inference-on-kubernetes-with-nvidia-grove
要点:
三层 CRD 架构:
| 层级 | CRD | 作用 |
|---|---|---|
| L1 | PodClique | 单角色副本组(prefill 角色/decode 角色等) |
| L2 | PodCliqueScalingGroups | 多级弹性伸缩(同一角色的多副本集) |
| L3 | PodCliqueSet | 多组件系统描述(将 L1/L2 组件组合为完整系统) |
支持的组件:prefill / decode / vision encoder / KV router 等多组件统一编排
规模:从单副本扩展到数据中心级 tens of thousands GPUs
配套工具链(2026-09 新增):
| 工具 | 作用 | 状态 |
|---|---|---|
| Dynamo Snapshot | K8s 冷启动优化(snapshot 恢复替代从头加载) | 2026-09 |
| NIM Operator | K8s Operator 模式自动化 AI 推理管线生命周期 | GA |
| NodeWright | K8s 节点生命周期管理 | 2026-09-23 |
与 Dynamo 的关系:Dynamo 是编排逻辑层(负责 PD disaggregation、KV-aware routing、SLA planner),Grove 是 K8s 部署执行层(PodCliqueSet CRD 负责 Pod 拓扑、弹性伸缩、多组件协调)。两者互补——Dynamo 解决"怎么调度",Grove 解决"怎么部署"。
与 llm-d 的对比:llm-d 是 CNCF Sandbox 项目(Red Hat + Google Cloud + IBM Research + CoreWeave + NVIDIA),基于 Kubernetes Gateway API;Grove 是 NVIDIA 专有 K8s 方案。两者不互斥——llm-d 专注流量路由(EPP prefix-hash),Grove 专注 Pod 拓扑与弹性。
核心论点:Grove 将 Dynamo 的分布式推理逻辑落地为 K8s 原生 CRD,是推理引擎从"跑在 K8s 上"到"作为 K8s 对象"的标志性转变。NIM Operator 的 GA 状态表明 NVIDIA 已将 AI 推理管线生命周期管理纳入 K8s Operator 标准路径。
可信度:★★★★★ — NVIDIA 官方 Developer Blog + NIM Operator GA 状态 + NodeWright 2026-09-23 发布
与活文档现有脉络的关系:inference.md v310 §1.2(llm-d CNCF Sandbox + K8s 推理编排)已锚定 llm-d + llm-d×vLLM×Mooncake 真实数据;§1.3(NVIDIA Dynamo 1.0)已锚定 Dynamo 1.0 取代 Triton。本条是K8s 部署执行层的系统性扩展:Grove PodCliqueSet CRD 是首个将 PD disaggregation 的 Pod 拓扑落地的 K8s 原生方案,与 Dynamo(编排层)+ llm-d(流量路由层)共同构成「分布式推理三层架构:编排(Dynamo)→ K8s 部署(Grove)→ 流量路由(llm-d)」。
建议归入章节:§1.2 llm-d CNCF Sandbox + K8s 推理编排(扩增 · NVIDIA Grove PodCliqueSet 三层 CRD + PodClique/PodCliqueScalingGroups/PodCliqueSet + Dynamo Snapshot + NIM Operator GA + NodeWright 2026-09-23 · 与 llm-d(流量路由)+ Dynamo(编排层)形成「分布式推理三层架构」完整图谱)
增量 3:Context Language Models —— 新型推理架构 + Suffix Cache Reuse 35% compute 削减(⭐⭐⭐⭐⭐)
来源:inbox/flyp/2026-10-01-0950-flyP-critical-read-VoxMem-CLM.md(09:50 · flyp critical-read · 来源:VoxMem arXiv + CLM 原始论文 · HF Daily 24▲)+ inbox/tom/2026-10-01-rag-e1prep.md §Periodic Weak Spots 邻接
URL(待补充):https://arxiv.org/abs/2609.xxxxx(VoxMem,paper_card 待入库)
要点:
Context Language Models 架构理念: - 将 LLM 的 context 视为"文件"由模型原生管理——这是与标准 RAG/prefix caching 完全不同的设计哲学 - 模型直接管理自身 context 的生命周期,而非依赖外部 KV cache 层 - Meta / Allen AI / Zettlemoyer / Lambert / Pang Wei Koh / Mike Lewis / Shannon Zejiang Shen 联合署名
关键数据:
| 指标 | 数值 | 说明 |
|---|---|---|
| BrowseComp-Plus 精度提升 | +11.4% | vs 非 CLM 基线 |
| FLOPs 降低 | −21.5% | 同等精度下 |
| Suffix Cache Reuse | −35% compute | vs SGLang 基线(服务侧额外削减) |
核心洞察:Suffix Cache Reuse 是服务侧优化——在 SGLang 等引擎已做 prefix caching 的基础上,CLM 的 suffix 语义去重能额外削减 35% compute。这意味着即使 RAG 的 retrieval 结果不同,只要 suffix 语义重叠,仍可复用缓存。
与 inference.md 现有脉络的关系:inference.md v310 §3.2(KV Cache 五大家族)+ §5.2(Context Engineering)已锚定 prefix caching / RadixAttention / PagedAttention 等缓存策略。CLM 从架构层面重新定义"context 作为文件"——这不是对现有 KV cache 策略的改进,而是一种全新的推理哲学,与 §5.2 Context Engineering 形成理念层面的对话:Context Engineering 是外部优化(如何在有限 context 中放入更多有效信息),CLM 是内部优化(让模型原生管理 context 生命周期)。
建议归入章节:§5.2 Context Engineering(扩增 · Context Language Models · context 作为原生文件 · Suffix Cache Reuse 额外削减 35% compute vs SGLang · BrowseComp-Plus +11.4% acc −21.5% FLOPs · 与 Context Engineering 外部优化策略形成内外互补)
增量 4:SANTA++(arXiv 2609.35629)—— 免训练随机注意力 + 代表性 Key 高效选择(⭐⭐⭐⭐)
来源:organized/paper_cards/1572-2609-35629.md(入库时间 2026-10-01 12:30 · 主分类 engineering · method · paper_card 1572 ✓)+ inbox/tom/2026-10-01-rag-e1prep.md §候选关联
URL:https://arxiv.org/abs/2609.35629
arXiv 号:2609.35629
paper_card 状态:paper_card 1572 ✓ 主分类 engineering · method · 2026-10-01 入库
要点:
- 核心问题:Attention 往往集中在上下文的一小部分 token 上,但每个 query 关注的关键子集各不相同——这使得全量扫描 KV cache 成为内存密集型瓶颈
- 核心方案:SANTA++ = 免训练的随机注意力方法,通过代表性 key(representative keys)进行内存高效选择,无需扫描整个 KV cache
- 技术机制:将缓存的 key 组织为若干 team,query 对每个 team 中的代表性 key 打分以决定采样哪些 team;在采样得到的 team 内计算精确注意力分数,并通过采样概率的倒数对各 team 贡献重新加权
- 与 SANTA(上一代)的区别:SANTA++ 是完整版本(SANTA 为前身)
核心论点:SANTA++ 代表 KV Cache 选择策略的"代表性采样"路线——与 BeaconKV(预测重访)、HeadWiseKV(per-head capacity)、Random Attention(注意力分布评估)形成 KV cache 选择策略的完整技术图谱。与 Periodic Weak Spots(压缩相位敏感性)共同构成"压缩+选择"的 KV cache 效率双轨。
可信度:★★★★ — paper_card 1572 已入库 · 主分类 engineering · method · 有具体机制描述
与活文档现有脉络的关系:inference.md v310 §3.3(Cache Compression Era 5)已锚定 GEAR / TurboQuant / KVTC / HiSparse / DASH / OasisKV / OmniKVQuant 等压缩方案,以及 BeaconKV / HeadWiseKV / Random Attention / LiteKV 等选择策略。SANTA++ 是选择策略的新成员,以"代表性 key 采样"替代"全量扫描",与 BeaconKV(预测重访)和 Random Attention(注意力分布)形成选择策略三轴。§3.4(KV Cache 选择策略)可新增 SANTA++ 作为代表性采样路线。
建议归入章节:§3.4 KV Cache 选择策略(扩增 · arXiv 2609.35629 · SANTA++ · 免训练随机注意力 + 代表性 key 高效选择 · paper_card 1572 ✓ · 与 BeaconKV(预测重访)+ Random Attention(注意力分布)形成选择策略三轴)
增量 5:Looped LM 系统性分析 —— 何时/何处/何种条件下循环有益(arXiv 2609.36636,Sep 30 已锚入 LoopedLM CDB,本轮系统性补强)
来源:organized/paper_cards/1594-2609.36636.md(入库时间 2026-10-01 12:30 · 主分类 llm-infra · method · paper_card 1594 ✓)+ inbox/tom/2026-10-01-0900-hf-daily-2026-10-01.md §HF Daily 97▲ · inbox/spark/2026-10-01-llm-infra-e1prep.md §增量 3
URL:https://arxiv.org/abs/2609.36636
arXiv 号:2609.36636
paper_card 状态:paper_card 1594 ✓ 主分类 llm-infra · method · 2026-10-01 入库
要点(Sep 30 E1 已锚入 LoopedLM(arXiv 2608.09444)CDB 批处理机制;本条补充系统性实验结论):
- 研究问题:Looped Language Models 通过参数共享增加计算深度,但目前尚不清楚:①何时额外的 recurrence 有益;②应该在哪里应用;③条件如何影响其效果
- 系统性实验发现(①何时):recurrence 在低于训练视野的推理预算(知识任务)和超出训练视野的推理预算(推理任务)均有帮助,但在训练视野内的推理预算帮助有限
- 系统性实验发现(②何处):recurrence 应应用在模型深层,而非浅层;浅层的 recurrence 收益有限
- 系统性实验发现(③条件):recurrence 的效果高度依赖于条件类型(知识 vs 推理);conditioning 在不同任务类型上的收益存在显著差异
- 工程意义:Looped LM 的 CDB 批处理策略应与任务类型联合优化——简单 token 用更少循环,困难 token 用更多循环;这为 CDB 的「何时停止循环」提供了任务自适应的决策依据
核心论点:Sep 30 E1 锚入了 LoopedLM(2608.09444)作为"深度自适应推理"的新方法,但其 CDB 批处理机制缺少系统性 guidance;本条提供了完整的"何时/何处/何种条件下"实验结论,使 LoopedLM 从"可行方法"升级为"有据可依的生产决策"。
可信度:★★★★ — paper_card 1594 已入库 · 主分类 llm-infra · method · 系统性实验,有具体维度分解
与活文档现有脉络的关系:inference.md v310 §4.2(蒸馏与部署压缩)已锚入 LoopedLM arXiv 2608.09444(CDB 批处理);§2.4(推理引擎可复现性)邻接 LoopedLM。本条是系统性补强:从"有 CDB 批处理机制"升级为"何时/何处/何种条件下有效"的生产级 guidance,与 Nereus(2609.34645,RL 后训练自适应并行)共同构成"自适应计算分配"的训练/推理双轨。
建议归入章节:§4.2 蒸馏与部署压缩(扩增 · arXiv 2609.36636 · LoopedLM 系统性分析 · 何时(训练视野内外均有帮助 / 视野内有限)/ 何处(深层而非浅层)/ 条件(知识 vs 推理任务差异显著)· 为 CDB「何时停止循环」提供任务自适应决策依据 + paper_card 1594 ✓)
三、值得警惕的矛盾或待核实说法
⚠️ C1(修订Sep30 C3沿用):vLLM v0.30.1rc1生产pin建议
问题:Sep 30 简报已标注 AI Infrastructure Digest 建议生产 pin 到 v0.30.1rc1(避免 v0.30.0 已知 bug:GLM-5.3 DFlash/DSpark 内存损坏 + Mamba/GDN 元数据 bug)。本轮未发现新证据,维持标注。 风险等级:中 处置建议:§1.1 vLLM v0.30.0 条目下维持生产警示注记
⚠️ C2(修订Sep30 C4沿用):SGLang TTFT 三源条件未对齐
问题:DeployBase 测得 SGLang TTFT 80ms,vLLM 150ms(vs VRLA Tech SGLang 42ms,vLLM 45ms)。差异可能来自 prefix caching 启用状态和 H100 型号(SXM vs PCIe)未注明。 风险等级:中 处置建议:在§1.1 benchmark 数据旁标注测试条件;不同来源数据不能直接对比
⚠️ C3(新增):HotInfra 2026 CXL 16.8× OpEx 优势待独立第三方核验
问题:HotInfra 2026 报告 CXL vs H100 OpEx 差距 16.8×,CapEx 差距 20.6×——数据来自 HotInfra 官方,未经独立第三方验证。Jay engineering-filter-oct01 已标注此条为"待核验"。 风险等级:中 处置建议:CXL vs HBM KV Cache 服务器的成本优势数字标记⚠待核实,不作为确定性结论锚入§6.2
⚠️ C4(新增):NVIDIA Dynamo release/1.5.0 SLA-Based Planner 生产验证程度未知
问题:Dynamo release/1.5.0(2026-09)新增 SLA-Based Planner,根据延迟/吞吐 SLA 自动规划资源分配。spark Oct 1 llm-infra e1prep 标注此功能为"⚠⚬⚬ 生产验证程度未知"。 风险等级:中 处置建议:在§1.3 Dynamo 条目下标注 SLA-Based Planner 为"2026-09 新增功能,生产验证程度待核实"
⚠️ C5(修订Sep30 C1延续):KV Cache Reuse 评测方法学系统性偏差
问题:arXiv 2609.31415 核心结论——RAG 场景下 KV Cache 复用技术的精度损失被系统性低估。flyp Oct 1 下午已对 KV Cache Reuse Boxoffice 工具做深度审稿,Boxoffice 代码可获得性仍待核实(P0)。 风险等级:中-高 处置建议:维持§3.5警示注记;关注 Boxoffice 代码开源进展
四、可引用的arXiv号列表
| arXiv | 主题 | 关联章节 | 可信度 |
|---|---|---|---|
| 2609.35629 | SANTA++ · 免训练随机注意力 + 代表性 key 高效选择 | §3.4 KV Cache 选择策略 | ★★★★ |
| 2609.36636 | LoopedLM 系统性分析 · 何时/何处/条件 | §4.2 蒸馏与部署压缩 | ★★★★ |
| 2609.34645 | Nereus · LLM RL 后训练自适应并行(Sep 30 已锚入) | §2.2 调度理论 | ★★★★ |
| 2609.36322 | Periodic Weak Spots · KV-cache 压缩相位敏感性(Sep 30 已锚入) | §3.3/§3.5 | ★★★★★ |
| 2609.31415 | KV Cache Reuse 评测方法学(Sep 29 已锚入) | §3.5 | ★★★★★ |
| 2609.26333 | Disaggregated Quantization(Sep 29 已锚入) | §2.3 | ★★★★ |
| 2609.23130 | Inference Control Plane(Sep 27 已锚入) | §1.1/§2.2 | ★★★★ |
| 2608.09444 | LoopedLM CDB 批处理(Sep 28 已锚入) | §4.2 | ★★★★ |
| 2608.01526 | Internet for KV Cache(Sep 29 已锚入) | §3.3 | ★★★★ |
| 2605.17613 | VeriCache Lossy→Lossless(Sep 28 已锚入) | §3.3 | ★★★★ |
五、检查过的来源汇总(可审计)
inbox/jay/2026-10-01T1050-jay-engineering-filter-oct01.md(10:50 · SGLang Mamba bug +106% + EACL 2026 RAG 27% 错误率)
inbox/jay/2026-10-01T1105-jay-five-category-briefing.md(11:05 · Dynamo release/1.5.0 + FlashInfer + DeployBase 命令)
inbox/jay/2026-10-01T1735-jay-evening-briefing-ai-engineering-oct01.md(17:35 · NVIDIA Grove 三层 CRD + Dynamo Snapshot)
inbox/jay/2026-10-01T1335-jay-github-trending-ax-llmd-csdn-db-tei.md(13:35 · llm-d GAIE EPP)
inbox/jay/2026-10-01T1506-jay-afternoon-briefing-database-backend-cloudnative-oct01.md(15:06 · SGLang 400K GPU + HotInfra CXL)
inbox/jay/2026-10-01T0820-jay-csdn-inference-rag-stack-highvalue.md(08:20 · vLLM 分布式源码 + Agent 场景误用警示)
inbox/jay/2026-10-01-ai-engineering-github-trending-hf-mcp-vecdb-inference.md(GitHub Trending · SGLang 29% 优势)
inbox/jay/2026-09-30T1130-jay-engineering-filter-sep30.md(Sep 30 锚定基线)
inbox/tom/2026-10-01-0900-hf-daily-2026-10-01.md(09:00 · HF Daily 213▲ + 97▲)
inbox/tom/2026-10-01-rag-e1prep.md(08:50 · R107 · Periodic Weak Spots 邻接)
inbox/tom/2026-10-01-evaluation-e1prep.md(eval 主轴 · KV Cache Reuse Boxoffice 审稿)
inbox/spark/2026-10-01-llm-infra-e1prep.md(18:40 · llm-infra 主棒位含 6 主增量)
inbox/spark/2026-09-30-llm-infra-e1prep.md(Sep 30 锚定基线)
inbox/flyp/2026-10-01-0950-flyP-critical-read-VoxMem-CLM.md(09:50 · CLM Suffix Cache Reuse)
inbox/flyp/2026-10-01-1550-flyP-critical-read-SEAL-saturated-benchmarks-meta-judge.md(15:50 · SEAL + meta-judge)
paper_cards/1572-2609-35629.md(SANTA++ · paper_card 1572 ✓)
paper_cards/1594-2609-36636.md(LoopLMs 系统性 · paper_card 1594 ✓)
paper_cards/1596-2609-36322.md(Periodic Weak Spots · Sep 30 已锚入)
paper_cards/1565-2609-34645.md(Nereus · Sep 30 已锚入)
paper_cards/1597-2609-36314.md(FRAC · SSM 架构邻接)
work-queue Oct 1 12:00/18:00(Top 15 · 2609.40316 Loop Scaling Laws)
六、本次变更摘要
2026-10-01 | Tom E1 晚间预消化
| # | 增量 | arXiv | 建议归入章节 |
|---|---|---|---|
| 1 | SGLang Mamba State Cache Bug:max_running_requests capped to 12 → +106% 修复(Helix 集群 8×RTX PRO 6000 Blackwell + 单卡 H100 复现) | — | §1.1 + §6.2 |
| 2 | NVIDIA Grove PodCliqueSet 三层 CRD + Dynamo Snapshot + NIM Operator GA + NodeWright 2026-09-23 | — | §1.2 llm-d/K8s编排 |
| 3 | Context Language Models:Suffix Cache Reuse 额外削减 35% compute vs SGLang + BrowseComp-Plus +11.4% acc −21.5% FLOPs | — | §5.2 Context Engineering |
| 4 | SANTA++ 2609.35629:免训练随机注意力 + 代表性 key 高效选择 | 2609.35629 | §3.4 KV Cache 选择策略 |
| 5 | LoopedLM 系统性分析 2609.36636:何时/何处/何种条件下循环有益(训练视野内外差异 / 深层而非浅层 / 知识 vs 推理条件差异) | 2609.36636 | §4.2 蒸馏与部署压缩 |
警示 5 条:v0.30.1rc1 生产 pin(沿用 Sep30 C3)/ SGLang TTFT 三源条件未对齐(沿用 Sep30 C4)/ HotInfra CXL 16.8× OpEx 待核验(新增 C3)/ Dynamo SLA-Based Planner 生产验证未知(新增 C4)/ KV Cache Reuse 精度方法学(沿用 Sep30 C1,Boxoffice 代码可获得性待核实)
涉及 arXiv 号:本次 NET-new 2 个(2609.35629 / 2609.36636);本轮承接 3 个(2609.36322 Periodic Weak Spots / 2609.34645 Nereus / 2608.09444 LoopedLM);续用锚定 50+ 个
Tom · inference E1 预消化 · 2026-10-01 22:20 CST · 增量 5 条(含 NET-new 2 条)· 涉及 arXiv:2609.35629 / 2609.36636(含本轮承接 3 条)