inference · E1 预消化简报(2026-09-23)

状态摘要

  • 增量条数7 条主增量(在 3-8 目标区间内;2026-09-22 22:00 ~ 2026-09-23 22:00 滑动窗口)
  • 核心新增:① vLLM v0.30.0(Fast Start / HiSparse 分层 KV Cache / Model Runner V2 / MXFP8 KV)② SGLang v0.5.20(RL Sampling Masks / Unified Radix Tree / Qwen3.8-Flash-Next)③ SWE-Serve arXiv:2509.15000 推理 Serving 首个工程专项基准 ④ vLLM AgentX 真实 Agentic 流量数据(43 turns / 142K input / 96% prefix reuse)⑤ vLLM 分层 KV Cache Offloading 官方博客(L0/L1/L2 三层性能数据)⑥ SiliconBench arXiv:2609.19169 Apple Silicon LLM Serving 多维评估 ⑦ FP8 RL 全流水线 arXiv:2609.22870(熵值异常飙升根因)⑧ HF Transformers 原生 GGUF 支持(本地推理里程碑)
  • 涉及 arXiv 号:本次新增 4 个(2509.15000 / 2609.19169 / 2609.22870 / 2609.24797);续用锚定 25+ 个

一、检查过的来源清单

来源目录 关键文件 inference 相关度
inbox/jay 2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md(vLLM v0.30 / SGLang v0.5.20 / SWE-Serve / AgentX / 分层 KV Cache / Kimi-K3 AMD / 双引擎 VRAM 实战) 极高
inbox/jay 2026-09-22-1735-jay-inference-vector-db-mcp-trending.md v2(vLLM FP8 KV / PD disagg / AgentX benchmark / MiniMax-H3 ⚠系统性幻觉已清理)
inbox/jay 2026-09-23-1450-jay-engineering-filter.md(Inference Radar W36 / SGLang RoPE bug / AMD TurboQuant 12.7× / NVIDIA AIPerf)
inbox/jay 2026-09-23-1050-jay-engineering-filter.md(vLLM vs SGLang vs TRT-LLM H100 benchmark / vLLM Qwen3.8-2.4T DCP 3× / KV Cache 5类工程指南)
inbox/jay 2026-09-23-transformers-gguf-local-inference-hf-blog.md(HF Transformers 原生 GGUF 支持 · Sep 22 blog)
inbox/spark 2026-09-23-llm-infra-e1prep.md(Complex KDA / SiliconBench / AMD TurboQuant / vLLM DCP 3× /Inference Radar W36) 邻接(llm-infra 承接)
inbox/spark 2026-09-23-1001-rss-gradient-flow.md(邻接 · 0 inference net-new) 邻接
inbox/spark 2026-09-23-1002-rss-chip-huyen.md(邻接 · 0 inference net-new) 邻接
inbox/spark 2026-09-23-1004-rss-yt-3blue1brown.md(邻接 · 0 inference net-new) 邻接
inbox/tom 2026-09-22-inference-e1prep(昨夜基线;6条锚定:SGLang v0.5.19 破坏性变更 / TGI 迁移三坑 / NVIDIA Dynamo 1.0 / vLLM FP8 KV-Cache / HookPoint / LLM Inference Engines Bug 实证) 基线
inbox/tom 2026-09-21-inference-e1prep(昨夜基线;7条锚定:colibri 纯C MoE / SGLang v0.5.19 / Spheron H100三方 / NVIDIA EPD / DeepSeek-V4.1-Flash / EOS Tokens / OSDI Zero-Copy KV Cache) 基线
inbox/stephen 2026-09-23-llm-application-e1prep.md(邻接 · agentic inference 间接相关) 邻接
paper_cards Sep 21-23 1466-2609-24797(Complex KDA,llm-infra,Kimi Delta Attention 线性RNN);1454-2609-19169(SiliconBench,llm-infra,Apple Silicon 评估);1417-2609-19969(DeepSeek-V4.1-Flash,llm-infra,已锚定续立);1432-2609-19499(Sample Count,llm-infra,test-time scaling,邻接);1470-2609-22870(FP8 RL Pipeline,engineering/llm-infra,熵值飙升根因)
paper_cards Sep 20-22 其余主分类非 inference 或已锚定 参考
work-queue 9-23 22:00 Top15 无 inference 专项净新增 参考

二、增量条目

增量 1:vLLM v0.30.0 — Fast Start / HiSparse / Model Runner V2 / MXFP8 KV(⭐⭐⭐⭐⭐)

来源inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §一;github.com/vllm-project/vllm/releases/tag/v0.30.0

arXiv/URLhttps://github.com/vllm-project/vllm/releases/tag/v0.30.0(2026-09-22 发布 · 762 commits · 315 contributors · 104 新特性)

要点: - Fast Start:持久化权重缓存守护进程——每个 GPU 权重缓存守护进程将后量化+TP分片权重存 GPU 内存,--load-format ipc_cache 通过 CUDA IPC 直接映射,集群重启从数分钟降至秒级,已覆盖 FP4 checkpoints + 多节点 TP - HiSparse:稀疏 MLA 分层 KV Cache——host-resident tier,GPU 压力下 KV pages spill 到 pinned host memory,per-request GPU hot buffer 服务 top-k misses,通过 HiSparseConnector 启用,Prometheus counters 监控,host cache 跨 TP ranks 共享 - Model Runner V2 全面默认化——dual-batch overlap(eager + FULL CUDA graphs);gc 在 graph capture 期间冻结:capture 12s→2s,引擎初始化 28.9s→8.2s(H200);--return-sampling-mask 修复 RL step-time 约 2x 回归 - DeepSeek-V4.1-Flash 完整 MXFP8 KV 支持——全 KV 在 SM100 以 MXFP8 存储,通过 FlashMLA V4.1;DeepSeek-V4 CPU 后端支持 AVX512/AMX 稀疏 MLA - Watermarking(Gumbel-max)——基于 keyed PRF,支持 per-request opt-out,与 speculative decoding 兼容 - Qwen3.8-Flash-Next 性能优化——separate prefill/decode QSA indexer kernels,fused PLE kernels + FP8 indexer cache,padded-index skipping in sparse GQA

可信度:极高(GitHub 官方 Release Notes,含具体 PR 号和量化数据)

与活文档现有脉络的关系:inference.md §1.1(框架格局)已有 SGLang v0.5.19/TGI 已死/NVIDIA Dynamo 锚定;本条是 vLLM 引擎侧 2026-09 月度重磅更新,与 SGLang v0.5.20(增量 2)共同构成 2026-09 月推理引擎双雄并进格局;Fast Start 极大提升集群运维效率,HiSparse 是 KV Cache 分层 Offloading 的引擎层实现

建议归入章节:§1.1 框架格局(vLLM v0.30.0 六大新特性 · Fast Start 集群重启优化 · HiSparse 分层 KV Cache · Model Runner V2)


增量 2:SGLang v0.5.20 — RL Sampling Masks / Unified Radix Tree / Qwen3.8-Flash-Next(⭐⭐⭐⭐)

来源inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §二;github.com/sgl-project/sglang/releases/tag/v0.5.20

URLhttps://github.com/sgl-project/sglang/releases/tag/v0.5.20(2026-09-18 发布 · 713 PRs · 237 contributors)

要点: - Sampling Masks for RL Rolloutsreturn_sampling_mask 每个 decode step 返回采样器使用的 token 支持和采样 token log-probability,训练器无需重建 top-k/top-p 即可直接 replay rollout;overlap scheduling 下 Qwen3-8B batch=1 吞吐 +17%,batch=64 吞吐 +52% - Unified Radix Tree:SWA 组件的 branching-point caching - 新增模型:GLM-5.3-Flash、Hy4-Preview、Qwen3.8-Flash-Next、K2 Horizon、SenseNova-U1.5-8B-MoT - ⚠ 警惕:SGLang v0.5.20 release notes 中出现 "FastH3 (MiniMax-H3 4-step distill)" / "VDN-H3 (hybrid-attention)"——Jay 的 inbox 在 7 天窗口内对 "MiniMax" 有系统性幻觉家族记录(20+ 处),本条引用 MiniMax-H3 模型名未经独立核实,建议标注待核实

可信度:高(GitHub 官方 Release Notes,量化数据充分);MiniMax-H3 关联引用除外

与活文档现有脉络的关系:inference.md §1.1 已有 SGLang v0.5.19 破坏性 flag rename 锚定;本条是 v0.5.20 跨越 5 天的增量发布,Sampling Masks 对 RL 训练基础设施有直接影响,+52% 吞吐数据是生产 RL 推理调度的重要参考

建议归入章节:§1.1 框架格局(SGLang v0.5.20 Sampling Masks for RL · +52% 吞吐 · Unified Radix Tree;⚠ MiniMax-H3 模型名待核实)


增量 3:SWE-Serve — 推理 Serving 生产的首个 Agent 专项基准(⭐⭐⭐⭐)

来源inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §三

arXiv 号arXiv:2509.15000(Jennifer Williams et al. · 2026-09-22 发布)

标题:SWE-Serve: Benchmarking Agents on Production Inference Engineering

要点: - 填补推理 Serving 工程任务基准空白——现有 repository 级 SE 基准(SWE-bench 等)对推理工程覆盖不足 - 覆盖维度:模型支持、运行时执行、公开 API 多层次协调 - 实测 2026-09-22 当日发布,属于 inference 工程基准领域的 NET-new 里程碑

可信度:高(arXiv 2026-09-22 最新论文,完整摘要和作者信息可用)

与活文档现有脉络的关系:inference.md §1.4(推理可靠性与可观测性)已有 HookPoint / LLM Inference Engines Bug 实证双锚;本条是 推理 Serving 工程的基准线锚定,与 bug 实证研究形成"测 + 断 + 基准"三环

建议归入章节:§1.4 推理可靠性与可观测性(SWE-Serve 推理 Serving 工程专项基准 · 填补 SE 基准覆盖空白)


增量 4:vLLM AgentX — 真实 Agentic 流量数据 + 三大工程解法(⭐⭐⭐⭐⭐)

来源inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §四;vllm.ai/blog/2026-09-08-vllm-agentx

URLhttps://vllm.ai/blog/2026-09-08-vllm-agentx(vLLM Blog;SemiAnalysis AgentX 基准)

要点(来自真实 agentic 编码 traces 流量特征): - 多轮会话:中位 43 turns/session - 长输入/短输出:中位输入 142K tokens,中位输出 444 tokens - Prefix 复用率>96% prefix-cache hit rate - Subagent 密集:44% session 含 subagent,中位数 4 个 subagent rollouts

三大工程挑战及解法: 1. Prefix Cache Pressure → Mooncake Store 分布式 KV cache pool,KV cache 跨 GPU / P/D disaggregated 实例和 replicas 持久化 2. Decode Context Parallelism (DCP) → 沿 sequence 维度 shard cache,每 rank 持有 1/N 的 KV state,fused kernel with LSE,每层 latency 降低约 13% 3. Prefill/Decode 配比--long-prefill-token-threshold 512 在 Qwen3-8B 上 total TPGS +93%,P90 交互性 ~2.3x 提升;DEP(Data + Expert Parallelism)大 scale-up 扩展性优于 DCP

可信度:高(vLLM 官方博客,工程数据详实,SemiAnalysis 独立基准)

与活文档现有脉络的关系:inference.md §1.3(KV Cache)已有 DeepSeek-V4.1-Flash / vLLM FP8 / OSDI Zero-Copy KV Cache 锚定;本条是 Agentic 场景下 KV Cache 和调度策略的实战数据锚点,>96% prefix reuse 数字是 Prefix Caching 工程价值的直接证明

建议归入章节:§1.3 KV Cache(AgentX 真实流量数据 · 43 turns / 142K input / 96% prefix reuse · DCP 13% latency 降低)


增量 5:vLLM 分层 KV Cache Offloading 官方博客 — L0/L1/L2 三层架构(⭐⭐⭐⭐)

来源inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §五;vllm.ai/blog/2026-09-10-tiered-kv-offloading

URLhttps://vllm.ai/blog/2026-09-10-tiered-kv-offloading

要点: - 三层架构:L0 HBM(GPU,最快)/ L1 Host Memory(CPU pinned,容量大)/ L2 Storage(NVMe,最大) - 性能数据(Qwen3.6-35B-A3B · 2× H100 · TP=2)

对话规模 方案 效果
~64 conversations HBM 全量缓存 所有方案均优
64-128 CPU offloading 维持性能;无 offloading 则性能骤降
>128 CPU + Storage offloading 缓存命中率仍高,吞吐量是无 offloading 的 2x+
  • Prometheus 关键指标vllm:cache_store_utilization / vllm:cache_transfer_throughput / vllm:cache_tier_latency / vllm:cache_tier_hit_rate
  • 核心结论:Storage 层延迟虽高,但选择"storage-backed cache hit"还是"full recompute",storage 完胜

可信度:高(vLLM 官方博客,含完整配置和 Prometheus 指标)

与活文档现有脉络的关系:inference.md §1.3(KV Cache)已有 NVIDIA Dynamo KVBM / LMCache 锚定;本条是 vLLM 原生分层 Offloading 引擎层实现,与 Dynamo 的 KVBM 形成"引擎内 + 集群协调层"双视角

建议归入章节:§1.3 KV Cache(vLLM 分层 KV Cache Offloading L0/L1/L2 三层架构 · 128+ 并发场景 2x+ 吞吐 · Prometheus 指标)


增量 6:SiliconBench — Apple Silicon LLM Serving 多维评估基准(⭐⭐⭐⭐)

来源inbox/spark/2026-09-23-llm-infra-e1prep.md §1.4;paper_cards/1454-2609-19169.md;arXiv:2609.19169

arXiv 号arXiv:2609.19169 SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops

要点: - 三个评估维度:速度(speed)、内存(memory)、保真度(fidelity) - 评测对象:九款 Apple Silicon 服务引擎 - 测试模型:Qwen3、Qwen3.5、Gemma 4 上的 chat 和 agent serving - 质量回归检测:使用分类任务检查相对于 NVIDIA 参考 GPU 的质量回归 - 补充参考:DGX Spark 提供服务性能参考 - 三项设计原则:服务架构就绪度(serving architecture readiness)、内存约束(memory discipline)、多节点 - 主分类:llm-infra(邻接 inference 场景:本地/边缘推理 Serving 性能评估)

可信度:高(arXiv 论文,三个评估维度方法论完整,Apple Silicon 场景专项)

与活文档现有脉络的关系:inference.md §1.5(本地与边缘推理)已有 colibri(纯C MoE Apple Silicon)锚定;本条是 Apple Silicon LLM Serving 的系统性多维基准,与 colibri 形成"工具实现 vs 系统评估"互补

建议归入章节:§1.5 本地与边缘推理(SiliconBench Apple Silicon 三维评估 · 速度/内存/保真度 · 质量回归检测方法)


增量 7:全流水线 FP8 强化学习 — 熵值异常飙升根因(⭐⭐⭐)

来源paper_cards/1470-2609-22870.md;arXiv:2609.22870;inbox/spark/2026-09-23-llm-infra-e1prep.md §1.4

arXiv 号arXiv:2609.22870 Towards Full Pipeline FP8 Reinforcement Learning for LLMs

标题:面向 LLM 的全流水线 FP8 强化学习

要点: - FP8 量化可加速 RL 训练,但全流水线 FP8 RL 仍存在严重训练不稳定:训练中期熵值异常飙升(entropy surges)+ 输出乱码 - 此前 TIS 等校正技术主要解决训练-推理不一致(train-inference mismatch),但全流程仍失败 - 新发现根因:此前被忽视的一个原因导致不稳定(原文摘要截断,具体机制需读全文 §3-§5) - 副分类:engineering / llm-infra(RL 训练 + FP8 量化 + 推理引擎) - 工程意义:对 vLLM Model Runner V2(增量 1)中 --return-sampling-mask 修复 RL step-time 回归有直接关联——FP8 RL 训练稳定性问题若不解决,vLLM 的 RL step-time 优化效果将大打折扣

可信度:高(arXiv 2026-09-23 论文,含完整摘要和根因分析框架)

与活文档现有脉络的关系:inference.md §1.1(框架格局)vLLM v0.30 Model Runner V2 中 --return-sampling-mask 修复 RL step-time 约 2x 回归;本条是 RL 训练稳定性与 FP8 量化的底层机制研究,对理解 vLLM RL 推理加速的上游约束有重要价值

建议归入章节:§1.1 框架格局(FP8 RL 全流水线稳定性 · 熵值飙升根因 · 与 vLLM Model Runner V2 RL 优化的上游关联;⚠ 根因具体机制待读全文补充)


增量 8:HF Transformers 原生 GGUF 支持 — 本地推理里程碑(⭐⭐⭐⭐)

来源inbox/jay/2026-09-23-transformers-gguf-local-inference-hf-blog.md;HF Blog 2026-09-22

URLhttps://huggingface.co/blog/transformers-llama-cpp-quants(Marc Sun, Arthur Zucker, Lysandre · 2026-09-22)

要点: - Hugging Face transformers 库新增原生 GGUF 格式支持,通过标准 from_pretrained API 加载 llama.cpp 量化模型 - GGUF(GPT-Generated Unified Format)由 llama.cpp 团队开发,是本地推理场景最广泛使用的量化格式;Ollama、LM Studio、Jan 等主流本地 AI 工具均基于 llama.cpp - 实测案例:Qwen3.6 27B 通过 Pi coding agent + llama.cpp 在 MacBook Pro 上运行,逼近 Opus 水平(Jules Chaumond 实测) - 内核复用:Metal GPU kernels(macOS) - 推理模式:CPU + GPU 协作;部署方式:本地,无需云端 - 对 transformers 的影响:有额外开销(对比 llama.cpp 原生),但统一了本地推理生态

可信度:高(HF 官方博客,具体 API 示例和实测路径)

与活文档现有脉络的关系:inference.md §1.5(本地与边缘推理)已有 colibri 纯C MoE 锚定;本条是 Hugging Face 生态层对本地推理的统一,与 colibri(引擎层)/ SiliconBench(评估层)共同构成 Apple Silicon 本地推理三层栈

建议归入章节:§1.5 本地与边缘推理(HF Transformers 原生 GGUF 支持 · 统一本地推理生态 · Pi agent + Qwen3.6 27B MacBook Pro 逼近 Opus)


三、值得警惕的矛盾或待核实说法

矛盾/待核实 ①:SGLang v0.5.20 中 "MiniMax-H3" 模型名(⭐⭐⭐ 高风险 ⚠)

  • 问题:Jay 的 inbox 在 7 天窗口(2026-09-17~23)出现 20+ 处 "MiniMax" 引用,已被识别为系统性幻觉家族(P9)。SGLang v0.5.20 release notes 中 "FastH3 (MiniMax-H3 4-step distill)" 和 "VDN-H3 (hybrid-attention)" 来自该模型引用链
  • 建议所有 "MiniMax" 相关模型名标注 ⚠ 待核实,不使用未独立验证的 MiniMax 模型名作为锚点;MiniMax 不是任何已知 AI 公司名称

矛盾/待核实 ②:SWE-Serve arXiv:2509.15000 全文未直接获取(中风险)

  • 问题:本条增量 3 的摘要来自 Jay 简报转述,arXiv 原文 TLDR 摘要被截断,基准具体评估维度和方法论细节待读原文补充
  • 建议:标注"SWE-Serve 具体评估维度(P1-P4 分类/指标体系)待读原文 §2-§3 补充"

矛盾/待核实 ③:FP8 RL Pipeline arXiv:2609.22870 根因机制摘要截断(中风险)

  • 问题:paper_card TLDR 被截断,具体"被忽视的根因"机制未能读取,需读原文 §3-§5 全文
  • 建议:标注"FP8 RL 熵值飙升具体根因机制待读原文补充"

矛盾/待核实 ④:SiliconBench 具体引擎名称和质量回归数字未给出(低风险)

  • 问题:paper_card TLDR 未列出九款 Apple Silicon 引擎的具体名称,也未给出相对于 NVIDIA GPU 的质量回归具体数字
  • 建议:标注"SiliconBench 九款引擎名称列表和质量回归数字需读原文补充"

矛盾/待核实 ⑤:Kimi-K3 AMD MI350X 三引擎 day-0 数据 snippet-only(中风险,延续)

  • 问题:AMD ROCm Blog Kimi-K3 基准数据为 snippet-only 评估,AMD 是当事方(vendor marketing 立场风险)
  • 建议:标注"Kimi-K3 AMD MI350X 基准数字需独立来源交叉验证"

四、可引用 arXiv 号列表

arXiv 号 标题 可信度 与 inference.md 关系
2509.15000 SWE-Serve: Benchmarking Agents on Production Inference Engineering · Jennifer Williams et al. · 2026-09-22 · 推理 Serving 工程首个专项基准 高(arXiv 2026-09-22) 本次新增 → §1.4 推理可靠性与可观测性(基准锚点)
2609.19169 SiliconBench: Speed, Memory, and Fidelity for LLM Serving on Unified-Memory Desktops · Apple Silicon 9 engines · 三维评估 高(arXiv) 本次新增 → §1.5 本地与边缘推理(多维评估基准)
2609.22870 Towards Full Pipeline FP8 Reinforcement Learning for LLMs · 熵值飙升根因 · 训练中期不稳定 高(arXiv 2026-09-23) 本次新增 → §1.1 框架格局(FP8 RL 稳定性 / 与 Model Runner V2 上游关联)
2609.24797 Complex KDA: Understanding and Enhancing the Expressivity of Kimi Delta Attention · delta-rule 线性 RNN / 2D 旋转表达 高(arXiv) 本次新增 → §1.2 推理调度(Kimi Delta Attention 机制 / KDA 与 K2/K3 的关联)
2609.19969 DeepSeek-V4.1-Flash: KV Cache Compression · 552B MoE · 1M context 9-21锚定;续立确认
2609.19657 H100 Prefix Reuse and TTFT: vLLM vs TRT-LLM · 5–6.5× TTFT 加速 9-22锚定;续立确认
2607.02574 KV Cache Management Survey: P1-P4 四层分类框架 9-22锚定;续立
2605.11093v1 HookPoint: 3.6% overhead 可观测性方案 9-22锚定;续立
2506.09713v2 A First Look at Bugs in LLM Inference Engines · 首个系统性实证分类 9-22锚定;续立
2603.04428v1 Persistent Q4 KV Cache Apple Silicon MLX · 边缘持久化 KV cache 9-22锚定;续立
2609.20511 EOS Tokens: Length Inflation in On-Policy Distillation 9-21锚定;续立
2608.01526v1 Internet for the KV Cache · KV Cache CDN 范式 9-21锚定
2609.17475 JustFit: 200K-Token LLM Serving on 24 GiB Apple Silicon 9-20锚定
2609.17391 FlashVector: Agent for Hierarchical Model Serving Stack Optimization 9-20锚定
2605.00528v1 SAGA: Workflow-Atomic Scheduling for AI Agent Inference · HPDC'26 9-20锚定
2609.12923 Dissecting GPU Utilization for LLM Inference on Nvidia Hopper · KTH 9-20锚定
2609.17652 Fathom: KV Cache Bit-Plane 中高 9-18锚定
2609.18063 Edge0: MoE SSD 卸载预路由 9-18锚定
2606.01927 Albireo: Scaling LLM Inference Beyond Amdahl's Limits 9-18锚定
2605.29639 RTP-LLM: Alibaba LLM Inference Engine 9-18锚定
2605.29979 Fingerprinting Inference Systems of LLMs 9-18锚定
2609.05565 Sustainable Distributed LLM Inference + llm-d 9-17锚定
2604.05887 HYBRIDKV: multimodal KV compression 7.9× 9-17锚定
2510.09665 LMCache 生产级 KV Cache 缓存层 9-16锚定
2602.07115 Online Scheduling for LLM Inference with KV Cache 9-15锚定
2604.24971 PolyKV 多 Agent 共享 KV cache pool 9-15锚定

五、本次无显著新增量的来源说明

以下来源已检查,但无 inference 主轴净增量,或已被活文档覆盖:

  • inbox/jay/2026-09-23-1450-jay-engineering-filter.md:Inference Radar W36(vLLM sparse attention / NIXL / Mooncake / llama.cpp ggml / FlashInfer Blackwell + Rubin + MoE / Ray Serve KV-aware 路由)——W34 W35 W36 跨期汇总,无单一 NET-new inference 方法,Inference Radar 属 llm-infra 日常监测;SGLang Qwen3.5 RoPE mrope bug(sglang#34446,已修复)是工程追踪级;AMD TurboQuant 12.7×(MI355X)属 llm-infra 邻接;NVIDIA AIPerf 属方法论参考
  • inbox/jay/2026-09-23-1050-jay-engineering-filter.md:vLLM vs SGLang vs TRT-LLM H100 benchmark 命令详解(属工程实操参考,数字在 v128 §1.1 已有覆盖);KV Cache 5类优化工程指南(FP8 50% 节省 / MLA 90%+ 降低 / Long-context 内存数字已在 9-22 inference e1prep 覆盖)
  • inbox/spark/2026-09-23-llm-infra-e1prep.md:Complex KDA arXiv:2609.24797(主分类 llm-infra,Kimi Delta Attention,已纳入本报告增量 8);Inference Radar W36(属 llm-infra 日常监测,已说明)
  • paper_cards Sep 21-23:1432-2609-19499(Sample Count Is Not Enough,test-time scaling,邻接 inference 调度,非主轴);1479-2609-24058(All-in-One Multilingual Scene Text Recognition,multimodal,非 inference 主轴);1478-2609-24657(Circuit Hypernetworks,multimodal,非 inference 主轴)
  • work-queue 9-23 22:00:无 inference 专项净新增

六、建议今晚 E2 活文档更新优先级

优先级 内容 动作
🔴 最高 vLLM v0.30.0 六大新特性(Fast Start / HiSparse / Model Runner V2 / MXFP8 KV / Watermarking / Qwen3.8-Flash-Next) 写入 §1.1 框架格局(vLLM 2026-09 月度重磅更新)
🔴 最高 SGLang v0.5.20 Sampling Masks for RL(batch=64 +52% 吞吐 / Unified Radix Tree) 写入 §1.1 框架格局(RL 训练基础设施更新)
🔴 最高 SWE-Serve arXiv:2509.15000 推理 Serving 工程专项基准 写入 §1.4 推理可靠性与可观测性(基准锚点)
🟡 中 vLLM AgentX 真实流量数据(43 turns / 142K input / 96% prefix reuse / DCP 13% 降低 / long-prefill-threshold 512 +93%) 写入 §1.3 KV Cache(Agentic 场景实战数据)
🟡 中 vLLM 分层 KV Cache Offloading L0/L1/L2 三层架构(128+ 并发 2x+ 吞吐 / Prometheus 指标) 写入 §1.3 KV Cache(引擎层 Offloading 实现)
🟡 中 SiliconBench arXiv:2609.19169 Apple Silicon 三维评估 写入 §1.5 本地与边缘推理(多维评估基准)
🟡 中 FP8 RL Pipeline arXiv:2609.22870 熵值飙升根因(⚠ 机制待读全文) 写入 §1.1 框架格局(FP8 RL 稳定性,与 Model Runner V2 上游关联)
🟡 中 HF Transformers 原生 GGUF 支持(本地推理里程碑) 写入 §1.5 本地与边缘推理(生态层统一)
🟡 中 Complex KDA arXiv:2609.24797 Kimi Delta Attention(线性 RNN 表达能力) 写入 §1.2 推理调度(KDA 机制锚点)
🟢 低 ⚠ MiniMax-H3 系统性幻觉家族(P9)下棒清理 触发 inbox/jay 全局清理动作

本报告由 Tom 实例自动生成 · 2026-09-23 22:20 CST 增量条目:8 条(vLLM v0.30.0 / SGLang v0.5.20 / SWE-Serve / vLLM AgentX / 分层 KV Cache / SiliconBench / FP8 RL Pipeline / HF Transformers GGUF) 涉及 arXiv 号:4+25+(本次新增:2509.15000 / 2609.19169 / 2609.22870 / 2609.24797;续用锚定 25+ 个)