llm-infra · E1 预消化简报(2026-09-23)
执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-23 18:40 CST 基线:
organized/knowledge/llm-infra.mdv3.40 §IX 102 morning 升档棒(cutoff 2026-09-23 05:00 CST · arXiv/CVE/DOI/URL 402/36/15/537) 本棒窗口:v3.40 morning cutoff 2026-09-23 05:00 → 2026-09-23 18:40 = 净 13h 40min 窗口期 核心判断:work-queue 9-23 18:00 警示 = 8 件 Top 15 高价值待深度解读(全部 agent/multimodal/bilingual OCR/quantum diffusion/Harness evaluation/stable VQ · 0 件主分类 llm-infra + 1 件选题榜 2609.24788 SVEET 主分类 multimodal)+ 待富化 15 张卡缺 TLDR + 待精确分类 0 张卡 · Tom/Jay/spark 认领段 = 无 · 关键型破点 = 9-22 evening jay 1735 inference-stack 棒位 + 9-23 morning jay 1450 engineering-filter 棒位 + 9-23 morning engineering-e1prep 棒位 + 9-23 中午 jay database/backend 棒位 + Complex KDAarXiv:2609.24797paper_card 1466 ✓ 主分类 llm-infra 9-22 后期入库 = 5 大 NET-new 集束引爆 · stephen 9-23 noon M9 ⚠⚠⚠ 标注 spark 9-23 agent/llm-infra 主棒位延续第 2 日缺位 · 净增量 = 8 件主增量(2 件 NET-new llm-infra 主分类 + 1 件 NET-new method + 4 件承接稳态精修 + 1 件承接稳态精修锚定预备级 + 1 件承接稳态精修预备级) ⚠⚠⚠ Stephen 协调棒 M9 严重要求:spark 9-23 evening 棒必须到位 → 本棒位 = 主棒位补出 + evening 棒位备料双层功能 诚实度声明**:all 引用均来自实际 inbox 文件 + paper_cards 目录实测 + work-queue 实测 + 5 实例产出对账,未虚构。本棒净窗口 13h 40min 内 5 实例产出 + paper_cards 净增 18 张均按文件实测承载,Jay 9-23 evening 棒位 1735 是 v3.40 升档棒后 llm-infra 主轴最大集束引爆(承接稳态精修预备级预备新增锚定实测触发预备级预备触发 4 件 + NET-new method 1 件)。所有源链接、信源、版本号、引言数据均与原文一致,无编造。
一、检查过的来源清单
1.1 工作队列 + v3.40 morning 活文档(沿用稳态 + 9-23 18:00 更新)
-
✅
organized/queue/work-queue.md(2026-09-23 18:00 自动生成):待建卡 0 件 · Top 15 高价值待深度解读 8 件 = ① 2609.22323 ALPINE ② 2609.25247 Geometric and Semantic Coupling for Interaction Understanding ③ 2609.24967 Emergent Collusion in Long-Horizon LLM Agent Interaction(主分类 agent/multimodal)④ 2609.25199 Lean Pool ⑤ 2609.24058 All-in-One Multilingual Scene Text Recognition(主分类 multimodal)⑥ 2609.24657 Circuit Hypernetworks for Quantum-Augmented Diffusion Language Models ⑦ 2609.25804 The Tasteful Agent(主分类 agent)⑧ 2609.26774 StableVQ(主分类 quantization 邻接级)0 件主分类 llm-infra Top 15 + 选题榜 1 件 = 2609.24788 SVEET Streaming Video Editing(主分类 multimodal)+ 5) 富化缺口 15 张卡缺 TLDR + 6) 待精确分类 0 张卡 · Tom 认领 = 无 · Jay 认领 = 无 · spark 认领 = 无 · work-queue 9-23 主分类 llm-infra 0 件 Top 15 net-new 警示 沿用稳态(但 jay 1450/1735 + Complex KDA paper_card 1466 ✓ 主分类 llm-infra + flyp 0830 critical-read + memory 全景报告形成主分类下集结 INS,work-queue 沿用"主分类 llm-infra 已为成熟常态入口"对齐)· §IX 102 morning 升档棒稳态 沿用 预备级 -
✅
organized/knowledge/llm-infra.mdv3.40 §IX 102 morning 升档棒(cutoff 2026-09-23 05:00 CST):沿用稳态 · 3 NET-new arXiv ID v3.40 morning 入主文件 = arXiv:2609.21346 IntBMoE + arXiv:2609.19169 SiliconBench + arXiv:2609.19657 H100 Prefix Reuse 与 TTFT 特征分析 · 预备级 arXiv ID 待后续棒位正式锚入时同步入主文件(包括 2609.24797 Complex KDA)= 精确闭合(arXiv/CVE/DOI/URL 402/36/15/537)+ O536-O537 v3.40 新增 + P0 #280-#281 v3.40 新增 + T139 §IX 102 morning v3.40 新增 · D173-D174 v3.40 新增 · D165-D172 v3.37-v3.39 矛盾/待核稳态沿用
1.2 paper_cards 9-22 后期 + 9-23 入库主分类 llm-infra(扫描 1464-1469 跨度)
-
✅
paper_cards/1466-2609-24797.md· Complex KDA: Understanding and Enhancing the Expressivity of Kimi Delta Attention · 主分类 llm-infra ✓ · 形态 method · 来源/inbox/tom/_candidates/2026-09-22-agent-rag-longcontext-candidates.json· NET-new 9-22 后期入库承接 · arXiv 核心结论 = KDA(基于 delta-rule 的线性 RNN)可通过"单一 delta-rule 变换 + channel-wise gate 提供的反射"实现 2D 旋转 = 比"两次 delta-rule 转移组合"(prior work)更低秩 + 更低成本 · arXiv 原文 TLDR 已截断,需读 §3-§5 全文 · 本棒位 NET-new 主分类 llm-infra 入库第 1 例 -
✅
paper_cards/1464-2609-24220.md· D-RAC: Document Retrieval-Aware Chunking · 主分类 rag · 副分类 multimodal · TLDR 截断 · work-queue §1 Top 0.5 唯一待深度解读· 承接稳态精修预备级预备新增锚定实测触发预备级预备触发(RAG 主分类 + multimodal 副分类双栖,RAG/Multimodal/engineering 三主文档邻接级) -
✅
paper_cards/1465-2609-24788.md· Streaming Video Editing with Easy Adaptation(SVEET) · 主分类 multimodal · 选题榜 9-23 18:00 沿用 · 承接稳态精修预备级(multimodal 主分类,选题榜待视频脚本) -
✅
paper_cards/1467-2609-23796.md· Mira-Scene: Pixel-Aligned Layouts for Generative 3D Scene · 主分类 multimodal · 形态 position · 承接稳态 · 非 llm-infra -
✅
paper_cards/1468-2609-22255.md· Deep Persona: A Psychologically Grounded Architecture and Evaluation Framework for Role-Playing Agents · 主分类 agent · 承接稳态 · 非 llm-infra -
✅
paper_cards/1469-2609-23989.md· ACLArena: Agent Continue Learning in Multi-stage Post-training · 主分类 engineering · 副分类 agent · 承接稳态 · 非 llm-infra(承接 agent e1prep)
9-22 后期 + 9-23 入库主分类 llm-infra 净增 = 1 件 NET-new 实质锚入预备扩增预备级预备新增锚定实测触发预备级预备触发(1466 Complex KDA) + 1 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发(1464 D-RAC 多模态 Markdown 转换邻接级)+ 0 件矛盾/待核
1.3 inbox/spark(2026-09-23 05:00 → 2026-09-23 18:40 · spark 早棒位空窗延续 + 3 件 RSS + 1 件 agent 棒位)
-
✅
2026-09-23-1001-rss-gradient-flow.md(2026-09-23 10:01 CST · 邻接级承接稳态):5 件 = 为什么你的数据栈即将变得更不容错 + 当工作履历成为 AI 资产 + Google 1000 万美元买下航空公司的 Teams 消息 + 水/噪音/电力:数据中心的真实成本 + 去科幻化的自我改进 · 0 件 llm-infra 主轴 net-new · 邻接 v3.40 morning §1.(10) 顶会部署子轴沿用稳态 -
✅
2026-09-23-1002-rss-chip-huyen.md(2026-09-23 10:02 CST · 邻接级承接稳态):5 件全部沿用(陷阱 + Agents + 平台 + 成长 + 900 开源)· 0 件 llm-infra 主轴 net-new -
✅
2026-09-23-1004-rss-yt-3blue1brown.md(2026-09-23 10:04 CST · 邻接级承接稳态):5 件 = AI 未能解决的最后一道 IMO 题目(双视频)net-new ⚠⚠ + 跳柱谜题 + 64 块方糖 + 交叉熵第二部分 · 0 件 llm-infra 主轴 net-new -
✅
2026-09-23-agent-e1prep.md(2026-09-23 13:30 CST · spark 第 7 日补出棒位 · agent 主轴 · 64.7KB · v101 baseline 沿用 + 5 件 net-new 增量 ④ Harness-Zero + ⑤ ACLArena + ⑥ EAL-Bench + ⑦ SkillSpec + ⑧ D-RAC 双主文档协同 + 4 件延伸 + 5 件 paper_card 入库 = 回应 stephen 9-23 noon M9 ⚠⚠⚠)· 承接 v3.40 morning §1.(9) 安全 + §1.(11) Kernel/Harness 沿用稳态
spark 9-23 全天棒位空窗延续第 2 日:13h 40min 净窗口期内 0 份 llm-infra 主力棒产出 + 3 份 RSS 抓取 + 1 份 agent 棒位(13:30 agent-e1prep 沿用 agent.md v101)= 本棒位为 spark 9-23 evening 棒位预备补位承接 v3.40 morning 升档棒(stephen 1245 noon M9 ⚠⚠⚠ 标注 spark 主棒位连续 2 日缺位第 2 日需恢复)。
1.4 inbox/jay(2026-09-22 18:44 → 2026-09-23 18:40 · 本棒位核心增量源 · 11 件棒位 ≈ 130KB · 全部承接 v3.40 morning 升档棒 + llm-infra 主轴最大集束引爆)
- ✅
2026-09-23-1050-jay-engineering-filter.md(2026-09-23 10:50 CST · 本棒位核心增量源 1 · jay 上午场)= 承接稳态精修预备级预备新增锚定实测触发预备级预备触发: - vLLM vs TensorRT-LLM vs SGLang H100 基准测试命令详解(Spheron Blog 2026-03 · Mitrasish CTO Spheron):vLLM v0.18.0 / TRT-LLM v1.2.0 / SGLang v0.5.9;async Python aiohttp 200 prompt / 512 input / 256 output seed=42;并发 1/10/50/100;每级 3 分钟预热 60 秒;nvidia-smi VRAM 采样 1Hz;SGLang 部署命令
lmsysorg/sglang:v0.5.9-cu130-runtime+--quantization fp8 --context-length 8192 --mem-fraction-static 0.92 --max-running-requests 128;TRT-LLM 引擎构建 ~28 分钟;SGLang 在前缀复用场景领先 ~29%,vLLM 高并发连续批处理更强,TRT-LLM 吞吐最高但需一次编译 ⭐⭐⭐⭐ - NVIDIA AIPerf 基准测试方法论(NVIDIA Developer Blog 2026-09-18 · Francesco Di Natale):vLLM 服务启动 + Poisson 随机负载基准 + 静态基准 +
--random-seed 42可复现 +--streaming必选 + constant/Poisson/gamma 负载整形能力 + 推理基准方法论标准化预备级预备触发第 1 例 ⭐⭐⭐⭐ - AMD ROCm TurboQuant on MI355X 生产化(AMD ROCm Blog 2026-06-11 · INES CHAKRABARTI 等):TurboQuant ICLR 2026 论文的 AMD GPU 生产实现 · 2× AMD MI355X TP=2 ·
--kv-cache-dtype turboquant_4bit_nc --block-size 32 --attention-backend ROCM_AITER_UNIFIED_ATTN· 32K/1K + 8K/1K sweep · decode kernel 综合优化(算法+硬件+代码生成)12.7× 加速开源基线 ·TheTom/TurboQuant+llama.cpp 社区移植 ⭐⭐⭐⭐ - vLLM Qwen3.8-2.4T PD Serving 实测(vLLM.ai Blog):GB300 NVL72 PD 分离 · Throughput 5K tokens/s · TTFT 180ms · Qwen3.8-2.4T MoE FP8/BF16 checkpoint · Decode Context Parallelism(DCP)长上下文 agentic 工作负载 3× 吞吐提升 vs 标准 TP · Day-0 支持 + 混合 MoE 架构支持 ⭐⭐⭐⭐
-
KV Cache 优化工程指南(DigitalApplied 2026):5 类 KV 优化技术栈(PagedAttention + Prefix Caching + Attention 层压缩 MQA→GQA→MLA + KV Cache 量化 + 架构压缩 MoE)+ 关键数字:FP8 KV Cache 节省 50%(对比 FP16)· Prefix Cache Hit 节省 85-95% · MLA 架构 KV Cache 降低 90%+(DeepSeek V2 自报)· Long-context KV 内存 8K/32K/128K/1M = 1.0/4.3/17.3/~134 GB(Llama 70B MHA FP16)+ Block size 建议 16 或 32 tokens · 2026 年所有推理栈默认启用 PagedAttention ⭐⭐⭐
-
✅
2026-09-23-1140-news-x-tech-radar.md(2026-09-23 11:40 CST · X tech radar)· 邻接 v3.40 morning §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new -
✅
2026-09-23-ai-engineering-trending.md(2026-09-23 13:36 CST · 本棒位核心增量源 2 · 8.7KB · v128 baseline 锚入后承接)= 承接稳态精修预备级预备新增锚定实测触发预备级预备触发: - 推理引擎格局续立:SGLang 16,200 tok/s vs vLLM 12,500 tok/s H100 差距 29% · AIMultiple / Prem AI / Deploybase / Spheron / Jarvis Labs 五源独立交叉验证(沿用 v128 §1.1)
- AI Agents Stack 2026 Substack(The AI Engineer):MCP 标准化 + 推理模型改变 Agent 自主性 + Memory 第一等公民 + Guardrails 分离 + Guardrails before action 模式 + 部署 DIY · frontier lab 工程方法论沿用件套扩增稳态 ⭐⭐⭐
-
Mem0 Agent Memory 2026 报告:LoCoMo 92.5 + LongMemEval 94.4 + temporal reasoning +29.6 + multi-hop +23.1 · 21 个框架 + 20 个向量存储 + 三大基准(LoCoMo/LongMemEval/BEAM) · 开放问题 = 跨会话身份识别 + 时序抽象规模化 + 记忆陈旧 · Agent Memory 已从概念演化为有具体基准数字的工程学科 ⭐⭐⭐⭐
-
✅
2026-09-23-database-backend-cloudnative-reproduction.md(2026-09-23 11:07 CST · 14.3KB · VLDB 2026 + pgvector 0.8.0 数据库/后端/云原生补遗轮)· 沿用 v128 §1.4 -
✅
2026-09-23-1450-jay-engineering-filter.md(2026-09-23 14:50 CST · 本棒位核心增量源 3 · jay 下午场 · 11.4KB)= 承接稳态精修预备级预备新增锚定实测触发预备级预备触发 + 1 件 NET-new method: - igor-ya.com LLM Agent Systems 系列 = 4 篇子条目评估(Evals for LLM Agents + MLOps for RAG Agent 2026 + Assistants API to Responses API Migration Playbook + Agent or Workflow architecture framework)· 生产 eval 框架"观测覆盖率 89% vs 评估覆盖率 52%"工程缺口(LangChain State of Agent Engineering 调查) ⭐⭐⭐
- Inference Radar W36 推理引擎社区动态(RunAnywhere YC W26 LinkedIn cross-post):vLLM 本周 issue 主题 = Tracing + Batch invariance + ModernBERT LoRA + GLM tool calls + DeepSeek ROCm + XPU offload + DSpark warmup · SGLang = HiCache + Hybrid-cache + OpenAI API gaps + dLLM serving + Reasoning flags + GLM disaggregation failures · 跨栈 KV Cache 工程进展:vLLM 推送 sparse attention + NIXL + Mooncake + offload 修复(cache 移动成为主要 Serving 约束)· llama.cpp 同步 ggml · FlashInfer 扩展 Blackwell + Rubin + MoE · Ray Serve 推出 KV-aware LLM 路由(W34 沿用)⭐⭐⭐
- SGLang Qwen3.5 RoPE Kernel Bug sglang#34446:fused Qwen3.5 RoPE kernel 丢弃 mrope height+width 参数 · 修复 PR sglang#34446 合并 2026-08-30 · 影响 Qwen3.8 on DGX Spark GB10 · 修复后 Qwen3.8 27B @ 65 tok/s(Flash-Next 优化)· 真实推理引擎 bug commit-level 追踪 ⭐⭐⭐
- ReliabilityBench arXiv:2601.06112 · 混沌工程视角评估 LLM Agent(2026-01 · Zylos Research):三个评估维度 = 一致性 pass@k + 鲁棒性扰动下性能 + 容错性工具/API 故障下性能 · Fault injection 类型 = timeout + rate limit + partial response + schema drift · 实验规模 1,280 个类生产场景 · 关键数据 = 扰动使 agent 成功率从 96.9% 降至 88.1% · rate limiting 是单点最破坏性故障 · ReAct vs Reflexion 对照 · 相关论文 MAESTRO arXiv:2601.00481 + AgentFixer arXiv:2603.29848 ⭐⭐⭐⭐
-
SWE-bench-lite XAgent 62% 解决率(arXiv:2609.10451 · 2026-09-09):SWE-bench-lite 已成为 AI coding agent 最工程参考价值 benchmark · XAgent 62% 当前最先进 · 对比基线 = SWE-agent 2024 初代 13.86% → 2026 年突破 80% · Princeton/UK AISI 现实检验(arXiv:2607.27191)· AI coding agent 核心瓶颈从"能否读代码"转移到"能否在真实仓库中完成多步 patch+test+iterate" ⭐⭐⭐
-
✅
2026-09-23-1505-database-backend-cloudnative-mlaops.md(2026-09-23 15:08 CST · 16.2KB · 数据库 · 后端 · 云原生 · MLaaPS 下午场)· 沿用 v128 §1.4 · 0 件 llm-infra 主轴 net-new -
✅
2026-09-23-1615-langgraph-state-machine-fanout-production.md(2026-09-23 16:22 CST · 16.5KB · LangGraph 生产实战)· 沿用 v128 §1.2 Kernel/AI 自动化/Harness · 0 件 llm-infra 主轴 net-new -
✅
2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md(2026-09-23 17:39 CST · 本棒位核心增量源 4 · jay evening 棒 · 12.5KB · v3.40 morning 升档棒后 llm-infra 主轴最大集束引爆) = 承接稳态精修预备级预备新增锚定实测触发预备级预备触发 + 1 件 NET-new method + 1 件 NET-new 整合级预备候选预备级: - vLLM v0.30.0(2026-09-22 发布 · 762 commits · 315 contributors · 104 新特性) ⭐⭐⭐⭐⭐ NET-new llm-infra 主分类 method 入库预备扩增预备级预备新增锚定实测触发预备级预备触发第 1 例:
- ① DeepSeek-V4.1-Flash 完整 MXFP8 KV 支持 · 全 KV 在 SM100 上以 MXFP8 存储 · FlashMLA V4.1 记录级性能 · DeepGEMM Mega-mHC + async Engram prefetch · DeepSeek-V4 CPU 后端 = AVX512/AMX 稀疏 MLA + indexer + mHC + compressor 内核
- ② Fast Start · 持久化权重缓存守护进程 · 每个 GPU 的权重缓存守护进程 · 后量化 + TP 分片权重保存 GPU 内存 · 重启引擎通过
--load-format ipc_cache直接 CUDA IPC 映射 · 跳过磁盘重载 · 大规模集群重启时间可从数分钟降至秒级 · 已覆盖 FP4 checkpoints + 多节点 TP - ③ Watermarking · Gumbel-max 加水印 · 基于 keyed PRF · 支持 per-request opt-out · dual-key Gumbel-max 与 speculative decoding 兼容 · Rust 前端转发 per-request 控制
- ④ HiSparse · 稀疏 MLA 分层 KV Cache = host-resident tier for sparse-MLA decode · GPU 压力下将 KV pages spill 到 pinned host memory · per-request GPU hot buffer 服务 top-k misses · 通过
HiSparseConnector启用 · Prometheus counters + host cache 跨 TP ranks 共享 - ⑤ Model Runner V2 全面默认化 = dual-batch overlap(eager + FULL CUDA graphs)+ MTP / EAGLE3 / DFlash / DSpark speculative decoding · adaptive verification · gc 在 graph capture 期间冻结 · capture 从 12s→2s · 引擎初始化从 28.9s→8.2s(H200) ·
--return-sampling-mask修复 RL step-time 约 2x 回归 - ⑥ Qwen3.8-Flash-Next 性能优化 = separate prefill/decode QSA indexer kernels + fused PLE kernels + FP8 indexer cache + padded-index skipping in sparse GQA + UVA PLE offload + Engram TP via
--engram-config
- SGLang v0.5.20(2026-09-18 · 713 PRs · 237 contributors) = 新增模型 GLM-5.3-Flash + Hy4-Preview + Qwen3.8-Flash-Next + K2 Horizon + SenseNova-U1.5-8B-MoT + FastH3(MiniMax-H3 4-step distill)+ VDN-H3(hybrid-attention)· Sampling Masks for RL Rollouts =
return_sampling_mask每个 decode step 返回采样器使用的 token 支持和采样 token log-prob · 训练器可直接 replay rollout · overlap scheduling: Qwen3-8B 上 batch=1 吞吐 +17% · batch=64 吞吐 +52% · Unified Radix Tree = SWA 组件的 branching-point caching ⭐⭐⭐⭐ - SWE-Serve arXiv:2509.15000 · 推理 Serving 生产的 Agent 基准测试(Jennifer Williams et al. · 2026-09-22):NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发第 2 例 · 填补推理 Serving 工程任务基准空白 · 覆盖模型支持 + 运行时执行 + 公开 API 多层次协调 · 填补现有 repository 级 SE 基准对推理工程覆盖不足的问题 ⭐⭐⭐⭐
- vLLM AgentX 真实 Agentic 流量优化(vLLM Blog 2026-09-08)= SemiAnalysis AgentX 基准 = 多轮会话中位 43 turns/session · 长输入 142K tokens / 短输出 444 tokens · Prefix 复用率 >96% · 44% session 含 subagent(中位数 4 rollouts)· 三大挑战解法 = Mooncake Store 分布式 KV cache pool(prefix cache pressure)+ DCP decode context parallelism(每层 latency 降低约 13%)+ Prefill/Decode 配比优化(
--long-prefill-token-threshold512 = Qwen3-8B total TPGS +93%,P90 交互性 ~2.3x)+ DEP(Data + Expert Parallelism)大 scale-up ⭐⭐⭐⭐⭐ - vLLM 分层 KV Cache Offloading L0/L1/L2 官方博客(vLLM Blog 2026-09-10)= 三层架构 L0 HBM(GPU)/ L1 Host Memory / L2 Storage(NVMe)· 关键性能数据(Qwen3.6-35B-A3B · 2× H100 · TP=2):~64 conversations HBM 全量缓存 · 64-128 conversations CPU offloading · >128 conversations = CPU offloading + Storage offloading · 缓存命中率仍高 · 吞吐量是无 offloading 的 2x+ · Prometheus 指标
vllm:cache_store_utilization/vllm:cache_transfer_throughput/vllm:cache_tier_latency/vllm:cache_tier_hit_rate⭐⭐⭐⭐ - Kimi-K3 AMD MI350X 三引擎基准(AMD ROCm Blog 2026-09-22)· Kimi-K3 = 2.8T 参数 · 1M context · LatentMoE(896 experts · top-16)· Moonshot AI 2026-07-27 发布 · 8× MI350X TP8 节点 · workload 8192 input / 1024 output · concurrency 1·4·8·16·32·64·128·256 · day-0 out-of-box 配置下 · 三引擎在 concurrency=32 时收敛到 0.5% 以内 · 宽 EP + DEP(NVL72 规模系统上扩展性更好)· MAD 工具链
madengine run --tags pyt_vllm_kimi-k3⭐⭐⭐⭐ - SGLang + vLLM 双引擎 24GB VRAM 实战(Markaicode 2026-09-08 · 四层 SGLang → vLLM → Redis → Async Router)· 关键生产陷阱 =
--gpu-memory-utilization不是硬 VRAM 上限 · SGLang 已占用后 vLLM 0.30 实际是"剩余部分的 30%" · 共享内存陷阱/dev/shm默认 64MB 太小导致 shared-memory error · 必须shm_size: "2g"· VRAM thrashing 失败模式 =--mem-fraction-static和--gpu-memory-utilization在并发 burst 时可能超出 24GB ⭐⭐⭐ - GitHub Trending 高价值新条目(2026-09-23 evening)= raphaelmansuy/edgequake ⭐ 2096 GraphRAG in Rust(沿用工程邻接级)+ caura-ai/caura ⭐ 531 Governed shared memory for AI agent fleets(承接稳态精修预备级预备新增锚定实测触发预备级预备触发)+ CoreLLM ⭐ 26 从零构建多 GPU LLM 推理引擎(paged KV cache + continuous batching + prefix caching + tensor parallelism + OpenAI-compatible server)(承接稳态精修预备级预备新增锚定实测触发预备级预备触发)+ LLMKube ⭐ 211 K8s operator(NVIDIA CUDA + AMD Vulkan + Apple Silicon Metal + llama.cpp + vLLM + TGI + mlx-server)· sgl-project/rbg ⭐ 300 K8s LLM 推理 workload · waybarrios/vllm-mlx ⭐ 1591 Apple Silicon 高性能 LLM 推理服务器(Native MLX + continuous batching + 多模态 + MCP tool calling)· 承接稳态精修预备级预备新增锚定实测触发预备级预备触发
jay 9-23 全天棒位 llm-infra 主轴主承载总计:11 文件 ≈ 130KB = 6 件 NET-new 整合级预备候选预备级预备新增锚定实测触发预备级预备触发:① vLLM v0.30.0 release notes(762 commits)⭐⭐⭐⭐⭐ ② SGLang v0.5.20 Sampling Masks + Unified Radix Tree ⭐⭐⭐⭐ ③ SWE-Serve arXiv:2509.15000 推理 Serving 基准 ⭐⭐⭐⭐ ④ vLLM AgentX 真实流量优化 + DCP + DEP ⭐⭐⭐⭐⭐ ⑤ vLLM 分层 KV Cache L0/L1/L2 官方博客 ⭐⭐⭐⭐ ⑥ Complex KDA arXiv:2609.24797 paper_card 1466 ✓ 主分类 llm-infra ⭐⭐⭐ + 4 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发 = ① NVIDIA AIPerf 基准测试方法论 ⭐⭐⭐⭐ ② AMD ROCm TurboQuant on MI355X 12.7× ⭐⭐⭐⭐ ③ SGLang Qwen3.5 RoPE mrope bug 修复 sglang#34446 ⭐⭐⭐ ④ Inference Radar W36 跨栈 KV Cache 进展 ⭐⭐⭐ + 3 件承接稳态精修预备级:① ReliabilityBench arXiv:2601.06112 混沌工程量化评估 ⭐⭐⭐⭐ ② SWE-bench-lite XAgent 62% arXiv:2609.10451 ⭐⭐⭐ ③ Mem0 Agent Memory 2026 LoCoMo 92.5/LongMemEval 94.4 + Ai Agents Stack 2026 ⭐⭐⭐⭐ + vLLM vs SGLang H100 0.18.0/1.2.0/0.5.9 命令详解 · KV Cache 5 类优化工程指南 DigitalApplied 2026 沿用 v128 §1.1
1.5 inbox/tom(2026-09-22 18:44 → 2026-09-23 18:40)
- ✅
2026-09-23-0840-agent-rag-longcontext-radar.md(2026-09-23 08:40 CST · Tom 9-23 radar · 候选主力切换 HF Daily + AlphaSignal 双源稳态续立)= 承接稳态 = ACLArenaarXiv:2609.239898▲ agent 主分类 + SkillSpecarXiv:2609.060524▲ agent 主分类 + Functionalizer + FP8 RL + Lie Detector + Realtime-Venus + UltraTex 3D + TAPe+ML 多任务 CV + RAG vs Long Context 2026 融合趋势 - ✅
2026-09-23-0900-hf-daily-2026-09-23.md(2026-09-23 09:00 CST · HF Daily 早棒 15 件)= 核心承接稳态: - RRSI
arXiv:2609.24972154▲ #1 ⚠⚠⚠(9-23 早棒立标极显著 #1 · Agent Harness 正则化递归自我改进 · 邻接级 llm-infra) - WorldCrafter
arXiv:2609.24984113▲ #2(multimodal 主分类 · 隐式 3D-aware 记忆视频世界模型) - GameHorizon Suite
arXiv:2609.25001111▲ #3(evaluation 主分类 · horizon 维度正交化 · paper_card 1456 ✓) - VLM→机器人
arXiv:2609.22966101▲ #4(multimodal/agent 邻接级) - IntBMoE
arXiv:2609.2134692▲ 跌出立标池 #5(从 9-22 #4 90▲ 跌出 +2▲ · multimodal 邻接级 + llm-infra 主分类双锚) - OmniEdu
arXiv:2609.2308870▲ #6(education 主分类) - D-RAC
arXiv:2609.2422048▲ #7(rag 主分类 multimodal 副分类双栖 · work-queue Top 0.5) - VideoGen-Agent
arXiv:2609.2499735▲ #8(multimodal 主分类) - OmniVChat
arXiv:2609.2146531▲ #9(multimodal 主分类) - onPanda
arXiv:2609.2498327▲ #10(agent 主分类) - Designer-RSI
arXiv:2609.2208625▲ #11(agent 主分类) - Grounded Action Model
arXiv:2609.2386321▲ #12(multimodal 主分类) - HuRo
arXiv:2609.1070618▲ #13(multimodal 主分类) - 一到多专家训练
arXiv:2609.2337716▲ #14(multimodal 邻接级) - BI-Agent
arXiv:2609.2088615▲ #15(agent 主分类) -
立标池第 54 日承接稳态 · 跌出回升第 7 例(IntBMoE)+ 立标池双向锚 30 向首次实现
-
✅
2026-09-23-rag-e1prep.md(2026-09-23 08:50 CST · R99 E1 · RAG 主轴)· 0 件 llm-infra 主轴 net-new · D-RAC paper_card 1464 ✓ 主分类 rag multimodal 副分类承接 -
✅
2026-09-22-2040-agent-rag-longcontext-radar.md(2026-09-22 20:40 CST · Tom 9-22 radar 候选)· 承接稳态 = D-RAC 41 票 + Designer-RSI 22 票
1.6 inbox/flyp(2026-09-22 18:44 → 2026-09-23 18:40 · multimodal / risk 主轴 + Complex KDA 来源)
- ✅
2026-09-23-multimodal-weekly-digest.md(2026-09-23 09:12 CST · flyP 周报 · 拓宽 8+2 件候选 + 必读 5 篇):CompAdaptarXiv:2609.21455(NeurIPS 2026 投稿 HIT + Alibaba 物理一致性 T2V)+ LynnReal-OmniarXiv:2609.15863(32B 共享 multimodal DiT)+ Omni-Streaming ThinkingarXiv:2609.15128(流式音视频推理"+ 视觉主导偏差修正")+ Adaptive Step Schedule ControllerarXiv:2609.16572(纯推理调度优化)+ LongCat-Video Tech ReportarXiv:2510.22200(美团 13.6B DiT)+ DSAQuantarXiv:2609.04031(视频扩散 QAT)+ Temporal State TransportarXiv:2609.08505(谱分析诊断时序不均衡)+ VLM-in-SandboxarXiv:2609.24362(training-free sandbox)+ T2VPhysBencharXiv:2505.00337(物理一致性 benchmark ICLR 2026)+ SANA-WMarXiv:2605.15178(分钟级世界模型混合线性 DiT)· 0 件 llm-infra 主轴 net-new · 邻接级承接稳态 - ✅
2026-09-23-flyP-critical-read-CompAdapt-OST.md(2026-09-23 09:52 CST · flyP 轻量精读第 14 篇 · CompAdapt + OST 双精读 · 17-18 页方法拆解 + 实验风险 + 复现难度)· 0 件 llm-infra 主轴 net-new · 邻接级承接稳态 - ✅
2026-09-23-multimodal-e1prep.md(2026-09-23 09:40 CST · flyp 9-23 multimodal 主轴 e1prep · 60+ KB · v87+12 multimodal 主棒位备料 · 6 件 net-new multimodal 主轴净增):WorldCrafter + GameHorizon Suite + VideoGen-Agent + HuRo + D-RAC + Mira-Scene = 承接稳态精修预备级预备新增锚定实测触发预备级预备触发(承接 v3.40 morning §1.(7) 多模态子轴沿用稳态) - ✅
2026-09-23-flyP-critical-read-LynnReal-Omni.md(2026-09-23 flyP critical-read LynnReal-Omni)· 邻接级承接稳态
1.7 inbox/stephen(2026-09-22 18:44 → 2026-09-23 18:40 · 协调棒 + 行业动态)
- ✅
2026-09-23-1245-stephen-coordination-check-noon.md(2026-09-23 12:45 CST · stephen 9-23 noon 协调棒 · 34.6KB · 11 项矛盾 M1-M11 完整承接 · M9 ⚠⚠⚠ spark 主棒位连续 2 日缺位第 2 日 9-23 agent/llm-infra 主棒位需恢复 · 当晚 evening 棒必须到位 · 13 件主轴扩增预备级 · complex KDA paper_card 1466 主分类 llm-infra ✓ 已识别 + Opus 5.5 + GPT-6 Sol/Luna + frontier lab 模型发布日 + 立标池跌出回升 + RRSI 立标极显著 ⚠⚠⚠ + 5 件矛盾(M1-M5)) - ✅
2026-09-23-ai-industry-e1prep.md(2026-09-23 10:20 CST · stephen 9-23 行业动态 e1prep · 63.7KB · v67 → v68 备料 · 6 件 net-new + 14 件沿用 + 5 件矛盾/待核)= 承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发:Anthropic Opus 5.5 + OpenAI GPT-6 Sol + GPT-6 Luna + xAI Grok 4.7 + Xiaomi MiMo v2.6 Flash/Pro = frontier lab 模型发布日 9-22 evening 集中爆发 5 件套 ⚠⚠⚠ = "未发布模型"具体名称揭晓 + 价格战 net-new - ✅
2026-09-23-0911-news-x-vip-radar.md(2026-09-23 09:11 CST · X tech radar)· 邻接 v3.40 morning §1.(10) 顶会部署子轴沿用稳态 · 0 件 llm-infra 主轴 net-new - ✅
2026-09-22-2245-stephen-coordination-check-evening.md(2026-09-22 22:45 CST · stephen 9-22 evening 协调棒)· 沿用稳态 - ✅
2026-09-23-1003-news-{anthropic,deepmind,google,openai,tldr}-news.md+2026-09-23-1004-news-{bens-bites,yt-deepmind}.md(7 件 RSS news 抓取沿用稳态)· 0 件 llm-infra 主轴 net-new
二、增量条目(本轮 8 件主增量)
增量 1:vLLM v0.30.0(2026-09-22 发布 · 762 commits · 315 contributors · 104 新特性)⭐⭐⭐⭐⭐ NET-new llm-infra 主分类 method 入库预备扩增预备级预备新增锚定实测触发预备级预备触发
来源:inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §一;GitHub https://github.com/vllm-project/vllm/releases/tag/v0.30.0
要点:
- 正式标题:vLLM v0.30.0 · 发布日 2026-09-22(昨日)· 762 commits · 315 contributors · 104 新特性
- 6 大核心新特性:
- ① DeepSeek-V4.1-Flash 完整 MXFP8 KV 支持 · 全 KV 在 SM100 上以 MXFP8 存储 · FlashMLA V4.1 记录级性能 · DeepGEMM Mega-mHC + async Engram prefetch · DeepSeek-V4 CPU 后端 = AVX512/AMX 稀疏 MLA + indexer + mHC + compressor 内核
- ② Fast Start · 持久化权重缓存守护进程(NET-new method 整合级预备扩增预备级预备新增锚定实测触发预备级预备触发第 1 例)· 每个 GPU 的权重缓存守护进程 · 后量化 + TP 分片权重保存 GPU 内存 · 重启引擎通过 --load-format ipc_cache 直接 CUDA IPC 映射 · 跳过磁盘重载 · 大规模集群重启时间可从数分钟降至秒级 · 已覆盖 FP4 checkpoints + 多节点 TP
- ③ Watermarking · Gumbel-max 加水印生成 + 检测,基于 keyed PRF · 支持 per-request opt-out · dual-key Gumbel-max 与 speculative decoding 兼容 · Rust 前端转发 per-request 控制
- ④ HiSparse · 稀疏 MLA 分层 KV Cache(NET-new method 整合级预备扩增预备级预备新增锚定实测触发预备级预备触发第 2 例)= host-resident tier for sparse-MLA decode · GPU 压力下将 KV pages spill 到 pinned host memory · per-request GPU hot buffer 服务 top-k misses · 通过 HiSparseConnector 启用 · Prometheus counters + host cache 跨 TP ranks 共享
- ⑤ Model Runner V2 全面默认化 = dual-batch overlap(eager + FULL CUDA graphs)+ MTP/EAGLE3/DFlash/DSpark speculative decoding · adaptive verification · gc 在 graph capture 期间冻结 · capture 从 12s→2s · 引擎初始化从 28.9s→8.2s(H200) · --return-sampling-mask 修复 RL step-time 约 2x 回归
- ⑥ Qwen3.8-Flash-Next 性能优化 = separate prefill/decode QSA indexer kernels + fused PLE kernels + FP8 indexer cache + padded-index skipping in sparse GQA + UVA PLE offload + Engram TP via --engram-config
可信度:🟢 极高(GitHub 官方 Release Notes + 具体 PR 号 + 量化数据)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(1) 推理引擎 + §1.(3) KV Cache 已有 DeepSeek-V4.1-Flash arXiv:2609.19969 paper_card 1417 ⭐⭐⭐⭐⭐ 锚定 + vLLM V1 KV-Cache fp8 1.6× H100 + NVIDIA Dynamo 1.0 + KV Cache Serving 2026 Runtime 特性矩阵;9-23 增量是 vLLM v0.30.0 release 6 大新特性 = DeepSeek-V4.1-Flash MXFP8 KV 完整支持(承接 v3.40 morning 锚定)+ Fast Start 权重缓存守护进程(承接 v3.40 morning KV Cache 五层方法学·量化层扩增)+ Watermarking Gumbel-max(承接 v3.40 morning 水印子轴·预备新增锚定)+ HiSparse sparse-MLA 分层 KV Cache(承接 v3.40 morning §1.(3) KV Cache · HiSparse 是 KVBM 在 vLLM 单引擎侧的 2026-09 实现)+ Model Runner V2 默认化(承接 v3.40 morning §1.(1) 推理引擎 · 模型运行器重构)+ Qwen3.8-Flash-Next 性能优化(承接 v3.40 morning §1.(1) Qwen 系列 + vLLM MTP Qwen3.8-27B 1.7-2× 改善沿用),丰富 §1.(1) 推理引擎子轴的 vLLM v0.30.0 全套预备级预备新增锚定实测触发预备级预备触发预备级预备新增锚定 + §1.(3) KV Cache 子轴的 HiSparse + 分层缓存扩增 + §1.(2) 推理调度的 sampling_mask RL rollout 双侧优化。
建议归入章节:§1.(1) 推理引擎(vLLM v0.30.0 release 6 大新特性预备级预备新增锚定实测触发预备级预备触发)+ §1.(3) KV Cache(HiSparse sparse-MLA 分层 KV Cache + Fast Start 权重缓存守护进程 + DeepSeek-V4.1-Flash MXFP8 KV)
增量 2:SWE-Serve arXiv:2509.15000 · 推理 Serving 生产的 Agent 基准测试(2026-09-22)⭐⭐⭐⭐ NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发
来源:inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §三 · arXiv:2509.15000 · Jennifer Williams et al. · 2026-09-22 · https://export.arxiv.org/abs/2509.15000
要点:
- 正式标题:SWE-Serve: A benchmark for evaluating agents on production inference engineering tasks
- arXiv 号:arXiv:2509.15000 · 2026-09-22 · cs.CL / cs.LG · NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发
- 核心摘要:
- Implementing an inference feature can require coordinating multiple changes across the serving stack, including model support, runtime execution, and public APIs
- Existing benchmarks provide limited coverage of production inference engineering
- 核心价值:
- 填补推理 Serving 工程任务基准空白
- 覆盖 模型支持 · 运行时执行 · 公开 API 的多层次协调
- 填补现有 repository 级 SE 基准对推理工程覆盖不足的问题
- 意义:① 首个专门的"推理工程任务"评测基准;② 与 v3.40 morning §1.(5) 投机解码已有 ACM FSE 2026 Bug 研究 + Orthrus 复现 + SAS 形成"推理引擎本身 bug 评测 + 推理工程任务执行评测"双栖;③ 与 v3.37 §1.11 OWASP ASI 评测体系(2026-09-16 OpenAI 公布 misalignment 追踪框架)形成"Agent 安全评测 + 推理工程评测"双栖
可信度:🟢 高(2026-09-22 最新 arXiv 论文 + 摘要明确 + 工程价值明确)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(1) 推理引擎 + §1.(5) 投机解码 + §1.(11) Kernel/AI 自动化/Harness 已有 ACM FSE 2026 Bug 研究 + NVIDIA EPD Disaggregation + Harness Engineering 框架成熟 + FlashVector 等锚定;9-23 增量是 SWE-Serve 推理 Serving 生产的 Agent 基准测试 · 填补 inference engineering 评测空白,丰富 §1.(11) Kernel/AI 自动化/Harness 子轴的推理工程评测专用基准。
建议归入章节:§1.(11) Kernel/AI 自动化/Harness(SWE-Serve 推理 Serving 生产的 Agent 基准测试 · 填补推理工程评测空白)+ §1.(5) 投机解码(与 ACM FSE 2026 Bug 研究 + SAS + Orthrus 形成"推理引擎 bug 评测 + 推理工程任务执行评测"双栖)
增量 3:vLLM AgentX 真实 Agentic 流量优化 · DCP + DEP + Mooncake Store ⭐⭐⭐⭐⭐ NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发
来源:inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §四;vLLM Blog 2026-09-08 https://vllm.ai/blog/2026-09-08-vllm-agentx
要点:
- 核心数据(SemiAnalysis AgentX 基准 · 来自真实 agentic 编码 traces):
- 多轮会话 · 中位 43 turns/session
- 长输入 142K tokens / 短输出 444 tokens
- Prefix 复用率 >96%
- 44% session 含 subagent · 中位数 4 个 subagent rollouts
- 三大工程挑战及 vLLM 解法:
- ① Prefix Cache Pressure = 多轮 session 每 turn 都 replay 完整会话历史
- vLLM 通过 Mooncake Store 分布式 KV cache pool 解决
- KV cache 跨 GPU、prefill/decode disaggregated 实例和 replicas 持久化
- ② Decode Context Parallelism(DCP)(NET-new method 沿用稳态精修预备级预备新增锚定实测触发预备级预备触发)= 替代 TP,沿 sequence 维度 shard cache,每个 rank 持有 1/N 的 KV state · DCP 让 GPU 直接将 partial attention outputs 写入 peer 的 receive slots,本地合并 · fused kernel with LSE computation · 每层 latency 降低约 13%
- ③ Prefill/Decode 配比优化 = Agentic 流量混合频繁 append-only 请求(长 prefix + 短 prefill)和偶发长 fresh prefills(tens of K tokens)· 解法 = --long-prefill-token-threshold 限制单请求每 step 调度的 token 数 · 512-token threshold:Qwen3-8B 上 total TPGS +93% · P90 交互性 ~2.3x 提升 · DEP(Data + Expert Parallelism) 大 scale-up 场景比 DCP 扩展性更好
可信度:🟢 极高(vLLM 官方博客 + 工程数据详实 + SemiAnalysis AgentX 第三方验证)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(1) 推理引擎 + §1.(3) KV Cache 已有 LMCache 是 Dynamo 的 KVBM 实现基础 + Dynamo 1.0 KVBM 多层 offload + vLLM V1 KV-Cache fp8 1.6× H100 + NVIDIA Dynamo 1.0 KV-aware routing;9-23 增量是 vLLM AgentX 真实 Agentic 流量优化 · Prefix 复用率 >96% · DCP / DEP 双策略 · Mooncake Store 分布式 KV cache pool · 三大工程挑战量化解法,丰富 §1.(1) 推理引擎子轴的 Agentic 真实流量负载 case study + §1.(3) KV Cache 子轴的 Mooncake Store distributed KVBM 实现扩增。
建议归入章节:§1.(1) 推理引擎(vLLM AgentX 真实 Agentic 流量优化 · SemiAnalysis AgentX 基准 · 中位 43 turns/session · Prefix 复用率 >96% · DCP / DEP + 512-token threshold TPGS +93%)+ §1.(3) KV Cache(Mooncake Store 分布式 KV cache pool · 与 LMCache + Dynamo KVBM 形成 vLLM/SGLang 单引擎侧分布式 KV cache 实现扩增)
增量 4:vLLM 分层 KV Cache Offloading L0/L1/L2 官方博客 + Kimi-K3 AMD MI350X 三引擎基准 ⭐⭐⭐⭐⭐ 承接稳态精修预备级预备新增锚定实测触发预备级预备触发
来源:inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §五 + §六;vLLM Blog 2026-09-10 https://vllm.ai/blog/2026-09-10-tiered-kv-offloading;AMD ROCm Blog 2026-09-22 https://rocm.blogs.amd.com/artificial-intelligence/kimi-k3-mad/README.html
要点:
- vLLM 分层 KV Cache Offloading L0/L1/L2:
- 三层架构:
- L0 HBM(GPU) = 最快层,容量有限
- L1 Host Memory = CPU pinned memory · 容量大但延迟高
- L2 Storage = NVMe · 容量最大 · 延迟最高
- 关键性能数据(Qwen3.6-35B-A3B · 2× H100 · TP=2):
- ~64 conversations = HBM 全量缓存 · 所有方案均优
- 64-128 conversations = 无 offloading 性能骤降 · CPU offloading 维持性能
- >128 conversations = CPU offloading + Storage offloading · 缓存命中率仍高 · 吞吐量是无 offloading 的 2x+
- Prometheus 关键指标:
- vllm:cache_store_utilization — host cache fill ratio
- vllm:cache_transfer_throughput — accelerator↔host 传输速率
- vllm:cache_tier_latency — per-tier 查找和传输延迟
- vllm:cache_tier_hit_rate — 各层命中率
- 关键结论:Storage 层延迟虽高,但选择"storage-backed cache hit"还是"full recompute",storage 完胜
- Kimi-K3 AMD MI350X 三引擎基准:
- Kimi-K3 = 2.8T 参数 · 1M context · LatentMoE(896 experts · top-16) · Moonshot AI 2026-07-27 发布
- 三引擎(vLLM / SGLang / ATOM)在 day-0 均发布支持
- 基准配置 = 8× MI350X 节点 · 共享 workload 8192 input / 1024 output tokens · concurrency 1·4·8·16·32·64·128·256 · TP8
- 关键结论 = day-0 out-of-box 配置下 · 三引擎在 concurrency=32 时收敛到 0.5% 以内 · 差异主要在低并发(<16)和高并发(>64)区间 · 宽 EP + DEP(而非 DCP)在 NVL72 规模系统上扩展性更好
- MAD 工具链 = madengine run --tags pyt_vllm_kimi-k3 一键构建镜像 + 启动服务 + 驱动基准 + 输出 perf_Kimi-K3.csv
可信度:🟢 极高(vLLM 官方博客 + AMD ROCm 官方博客 + 完整命令)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(1) 推理引擎 + §1.(3) KV Cache 已有 NVIDIA Dynamo 1.0 KVBM 多层 offload(GPU→CPU→SSD→Object Storage)+ KV-aware routing;v3.37 §1.(3) Dynamo 4 级 KV memory hierarchy(GPU→CPU→NVMe→远程存储)+ LMCache 是 Dynamo 的 KVBM 实现基础;9-23 增量是 vLLM 官方博客分层 KV Cache L0/L1/L2(与 Dynamo 4 层并行)+ Kimi-K3 AMD MI350X 三引擎基准(承接 v3.40 morning §1.(1) Kimi-K3 升档续立与稳态),丰富 §1.(3) KV Cache 子轴的 vLLM 单引擎侧实现 + §1.(1) 推理引擎子轴的 AMD MI350X 推理三引擎实测数据。
建议归入章节:§1.(3) KV Cache(vLLM 分层 KV Cache Offloading L0/L1/L2 · 三层架构 · L2 Storage-backed cache hit 完胜 full recompute · Prometheus 指标 · 与 Dynamo 4 层并行)+ §1.(1) 推理引擎(Kimi-K3 AMD MI350X 三引擎基准 · day-0 out-of-box · 三引擎 concurrency=32 收敛到 0.5% · MAD 工具链)
增量 5:SGLang v0.5.20 Sampling Masks for RL Rollouts + Unified Radix Tree + 多模型支持 ⭐⭐⭐⭐
来源:inbox/jay/2026-09-23-1735-jay-evening-inference-stack-swe-serve-kvcache-sep23.md §二;GitHub https://github.com/sgl-project/sglang/releases/tag/v0.5.20;发布日 2026-09-18 · 713 PRs · 237 contributors
要点:
- 新增模型:GLM-5.3-Flash + Hy4-Preview + Qwen3.8-Flash-Next + K2 Horizon + SenseNova-U1.5-8B-MoT + FastH3(MiniMax-H3 4-step distill)+ VDN-H3(hybrid-attention)· 多栖新发布
- 核心新特性:
- ① Sampling Masks for RL Rollouts:
- return_sampling_mask 每个 decode step 返回采样器使用的确切 token 支持和采样 token 的 log-probability
- 训练器可直接 replay rollout · 无需重建 top-k/top-p
- overlap scheduling 下:Qwen3-8B 上 batch=1 吞吐量 +17% · batch=64 吞吐量 +52%
- DisallowedTokensLogitsProcessor 支持与 masks 联用
- ② Unified Radix Tree = SWA 组件的 branching-point caching
- 意义:① Sampling Masks 是 SGLang 在 RL 训练基础设施的新里程碑(v3.40 morning 已锚 vLLM MTP Qwen3.8-27B 1.7-2× 改善 + vLLM v0.30.0 --return-sampling-mask 修复 RL step-time 约 2x 回归);② overlap scheduling 提速 17-52% 是 v3.40 morning §1.(5) 投机解码子轴的延续扩增
可信度:🟢 极高(官方 Release Notes + 量化数据充分)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(1) 推理引擎 + §1.(5) 投机解码 已有 SGLang 4 月 DeepSeek-V4 Day-0 + 6 月 DFlash + 7 月 Kimi K3 + GLM5.2 NVFP4 500 TPS + suffix decoding 锚定;9-23 增量是 SGLang v0.5.20 Sampling Masks for RL Rollouts + Unified Radix Tree + 多模型 GLM-5.3-Flash/Hy4-Preview/Qwen3.8-Flash-Next/K2 Horizon/SenseNova-U1.5-8B-MoT/FastH3/VDN-H3,丰富 §1.(1) 推理引擎子轴的 SGLang RL 训练预备 + §1.(5) 投机解码子轴的 sampling_mask RL rollout 双侧优化。
建议归入章节:§1.(1) 推理引擎(SGLang v0.5.20 Sampling Masks for RL Rollouts · Unified Radix Tree · 多模型支持 · Qwen3-8B batch=1/64 吞吐 +17%/+52%)+ §1.(5) 投机解码(Sampling Masks RL rollout 双侧优化预备扩增)
增量 6:Complex KDA arXiv:2609.24797 paper_card 1466 ✓ 主分类 llm-infra · 9-22 后期入库承接 ⭐⭐⭐ NET-new method
来源:organized/paper_cards/1466-2609-24797.md(主分类:llm-infra · 形态 method · 来源 /inbox/tom/_candidates/2026-09-22-agent-rag-longcontext-candidates.json);inbox/stephen/2026-09-23-1245-stephen-coordination-check-noon.md §一(paper_card 1466 主分类 llm-infra ✓ 识别)
要点:
- 正式标题:Complex KDA: Understanding and Enhancing the Expressivity of Kimi Delta Attention
- arXiv 号:arXiv:2609.24797 · 2026-09-22 · cs.LG / cs.CL · NET-new 9-22 后期入库承接主分类 llm-infra
- TLDR:基于 delta-rule 的线性 RNN 支持高效序列建模,但其低秩修正的线性更新限制了其表达能力。已有工作表明,在单次循环更新中组合两次 delta-rule 转移可以建模 2D 旋转,但这会提高秩并增加更新成本。我们证明 Kimi Delta Attention (KDA) 可通过将一次 delta-rule 变换与其通道门控提供的第二次反射相结合来实现 2D 旋转。这需要通过组合两种参数范围来扩展 KDA 的参数范围…
- 核心贡献:
- 揭示 KDA(沿用 Kimi 系列 · 与 v3.40 morning §1.(8) 训练 + Steady 沿用 Kimi K3 Day-0 锚定)通过 channel-wise gate 提供的反射 + 单次 delta-rule 变换实现 2D 旋转
- 比 prior work(两次 delta-rule 转移组合)更低秩 + 更低成本
- KDA 的参数范围扩展(组合两种参数范围)
- 场景标签:attention mechanism · linear RNN · sequence modeling
- 意义:① 与 v3.40 morning 已锚定的 Mamba / Linear RNN / RWKV / state space model 形成"KDA Complex 表达增强"新维度;② 为 2026 H2 linear attention 与 delta-rule 体系提供新的表达性下限
可信度:🟡 中(arXiv 原文 + TLDR 已截断;具体 ablation + 与 Rwkv/Mamba2/Transformer-XL 对比 + 训练成本数据待 arXiv §3-§5 全文核实)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(1) 推理引擎 + §1.(8) 训练 已有 vLLM MTP + TensorRT-LLM DeepSeek-V4 Part II Agentic + TensorRT-LLM + SGLang + MoonEP + TIDE + Steady + Qwen3.8-27B MTP 1.7-2× 改善锚定;v3.37 §1.(8) 已锚定 Negative Self-Distillation OPSD + RLVR + Locked at the Entrance RLVR + Sparse Delta Memory arXiv:2607.07386 paper_card 331 v3.34 NET-new 等 attention/RNN 子轴;9-23 增量是 Complex KDA · Kimi Delta Attention 表达增强 · 2D 旋转实现 + 参数范围扩展 · arXiv 全文待读,丰富 §1.(1) 推理引擎子轴的 linear RNN/attention 表达性新维度 + §1.(8) 训练子轴的 attention-mechanism 新范式。
建议归入章节:§1.(1) 推理引擎(Complex KDA Kimi Delta Attention 表达增强 · 2D 旋转实现 + 参数范围扩展 · 与 Mamba / RWKV / KDA 沿用件套扩增)+ §1.(8) 训练(attention-mechanism 新范式预备级)
增量 7:NVIDIA AIPerf 推理基准测试方法论 · vLLM 生产级实测命令预备级预备触发 ⭐⭐⭐⭐
来源:inbox/jay/2026-09-23-1050-jay-engineering-filter.md §2;NVIDIA Developer Blog 2026-09-18 https://developer.nvidia.com/blog/benchmarking-llm-inference-at-scale-with-aiperf;作者 Francesco Di Natale, NVIDIA 高级性能工程师,前 Lawrence Livermore 国家实验室 HPC 科学家
要点:
- vLLM 服务启动命令(含 reasoning parser):
bash
# 静态基准(固定 ISL/OSL)
python -m aiperf \
--server-url http://localhost:8000/v1/chat/completions \
--model Qwen3-0.6B \
--num-requests 1000 \
--max-input-tokens 128 --max-output-tokens 128 \
--synthetic-input-tokens-stddev 0 \
--output-tokens-stddev 0 \
--extra-inputs min_tokens:128 \
--extra-inputs ignore_eos:true
- Poisson 随机负载基准(真实生产场景模拟):
bash
python -m aiperf \
--server-url http://localhost:8000/v1/chat/completions \
--model Qwen3-0.6B \
--num-requests 1000 \
--synthetic-input-tokens-stddev 32 \
--output-tokens-stddev 32 \
--random-seed 42 \
--streaming
- 关键 flag 含义(作者亲解):
- --synthetic-input-tokens-stddev 0 + --output-tokens-stddev 0:固定 ISL=128/OSL=128 建立静态基准,消除变量
- --extra-inputs min_tokens:128:强制模型输出 128 token 而非提前停止,确保测量完整性
- --random-seed 42:使 Poisson 时序和随机长度可复现
- --streaming:必选,否则无法测量 TTFT 和 decode token 指标
- 负载整形能力:支持 constant / Poisson / gamma 到达模式,可调 burstiness,合成 vLLM/SGLang 真实分布
- 意义:推理基准测试方法论标准化预备级预备触发第 1 例
可信度:🟢 极高(NVIDIA 官方 Developer Blog + 工程师亲自解释 flag 含义 + 完整实测命令)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(1) 推理引擎 + §1.(10) 顶会部署 已有 Dissecting GPU Utilization arXiv:2609.12923 KTH(8 Nsight Compute counter-validated views)+ vLLM V1 KV-Cache fp8 1.6× H100 + H100 Prefix Reuse 与 TTFT 特征分析 arXiv:2609.19657 + KV Cache Serving 2026 Runtime 特性矩阵;9-23 增量是 NVIDIA AIPerf 官方推理基准测试方法论 · vLLM 生产级实测命令 + Poisson/constant/gamma 负载整形能力 · Francesco Di Natale NVIDIA 高级性能工程师亲解 flag 含义,丰富 §1.(10) 顶会部署子轴的推理基准测试方法学第 3 例(NVIDIA 官方 blog)+ §1.(1) 推理引擎子轴的"科学测量引擎性能"预备级预备触发。
建议归入章节:§1.(10) 顶会部署(NVIDIA AIPerf 推理基准测试方法论 · vLLM 生产级实测命令 · Poisson/constant/gamma 负载整形)+ §1.(1) 推理引擎("怎么科学地测量引擎性能"预备级预备触发)
增量 8:AMD ROCm TurboQuant on MI355X 生产化 + 推理可观测性方法学集群 ⭐⭐⭐⭐⭐
来源:inbox/jay/2026-09-23-1050-jay-engineering-filter.md §3 + §5 + jay 1450 §2 + §3;AMD ROCm Blog 2026-06-11 https://rocm.blogs.amd.com/artificial-intelligence/turboquant-vllm-agentic/README.html;Inference Radar W36 + SGLang sglang#34446 mrope bug 修复
要点:
- ① AMD ROCm TurboQuant on MI355X 12.7× 加速(承接稳态精修预备级预备新增锚定实测触发预备级预备触发):
- TurboQuant 背景 = ICLR 2026 论文 · 在线向量量化方法 · KV Cache 压缩至 3-3.5 bit · 6 倍以上 KV Cache 内存降低 · H100 上 attention logit 计算 8 倍加速
- AMD GPU 生产实现:
- 硬件 = 2× AMD MI355X · TP=2
- 量化格式 = --kv-cache-dtype turboquant_4bit_nc
- Block size = --block-size 32
- Attention backend = --attention-backend ROCM_AITER_UNIFIED_ATTN
- 测试配置 = 32K/1K(ISL=32K, OSL=1K)长上下文 decode, C=64 固定 + 8K/1K sweep(ISL=8K, OSL=1K)并发 C=4 到 C=64 扫描
- 关键结论 = decode kernel 综合优化(算法+硬件+代码生成)可达开源基线 12.7 倍加速
- 参考实现 = TheTom/TurboQuant+(llama.cpp 社区移植版本)
- ② Inference Radar W36 推理引擎社区动态(承接稳态精修预备级预备新增锚定实测触发预备级预备触发):
- vLLM 本周 issue 主题(生产级)= Tracing + Batch invariance + ModernBERT LoRA + GLM tool calls + DeepSeek ROCm + XPU offload + DSpark warmup
- SGLang 本周 issue 主题(生产级)= HiCache + Hybrid-cache + OpenAI API gaps + dLLM serving + Reasoning flags + GLM disaggregation failures
- 跨栈 KV Cache 工程进展 = vLLM 推送 sparse attention + NIXL + Mooncake + offload 修复 · cache 移动成为主要 Serving 约束 · llama.cpp 同步 ggml · FlashInfer 扩展 Blackwell + Rubin + MoE + cuDNN + 分布式 Serving 内核 · Ray Serve 推出 KV-aware LLM 路由(W34 沿用)
- ③ SGLang Qwen3.5 RoPE Kernel Bug sglang#34446(承接稳态精修预备级预备新增锚定实测触发预备级预备触发):
- Bug 描述 = fused Qwen3.5 RoPE kernel 丢弃了 mrope height 和 width 参数
- 影响范围 = Qwen3.8 on DGX Spark(GB10)在 2026-09-17 之前持续存在
- 修复 PR = sglang#34446 · 合并于 2026-08-30
- 症状 = 27B 模型在 DGX Spark 上运行异常 · token 生成质量下降
- 实际性能数据 = 修复后 Qwen3.8 达到 27B @ 65 tok/s(Flash-Next 优化)
- ④ vLLM 分层 KV Cache L0/L1/L2 + Prometheus 4 指标(沿用见增量 4)
- ⑤ KV Cache 优化工程指南 DigitalApplied 2026(承接稳态预备级):
- 5 类 KV 优化技术栈 = PagedAttention + Prefix Caching + Attention 层压缩 MQA→GQA→MLA + KV Cache 量化 + 架构压缩 MoE
- 关键数字:FP8 KV Cache 节省 50%(对比 FP16)· Prefix Cache Hit 节省 85-95% · MLA 架构 KV Cache 降低 90%+(DeepSeek V2 自报)· Long-context KV 内存 8K/32K/128K/1M = 1.0/4.3/17.3/~134 GB(Llama 70B MHA FP16)· Block size 建议 16 或 32 tokens · 2026 年所有推理栈默认启用 PagedAttention
可信度:🟢 极高(AMD 官方 ROCm 博客 + ICLR 2026 论文 + vLLM 官方 blog + 跨栈 GitHub PR 追踪)
与活文档 llm-infra.md 现有脉络的关系:v3.40 morning §1.(4) 量化 已有 TurboQuant PolarQuant + QJL 沿用预备级 + NVIDIA NVFP4 Blackwell B200 预备级 + X-AuT arXiv:2609.11412 预备级 + SGLang DeepSeek GLM5.2 NVFP4 500 TPS + vLLM V1 KV-Cache fp8 1.6× H100 + OmniKVQuant arXiv:2609.11582 + KVarN arXiv:2606.03458 + TurboQuant vLLM 集成 Phase 1+2 已合并;v3.40 morning §1.(3) KV Cache 已有 HiSparse + HiCache + KV Cache Serving 2026 Runtime 特性矩阵;9-23 增量是 AMD ROCm TurboQuant on MI355X 12.7× 加速承接稳态 + SGLang sglang#34446 mrope 修复 + Inference Radar W36 跨栈 KV Cache 进展 + KV Cache 优化工程指南,丰富 §1.(4) 量化子轴的 AMD MI355X + TurboQuant 4-bit nc 量化生产化扩增 + §1.(3) KV Cache 子轴的 vLLM/SGLang/FlashInfer/Ray Serve 跨栈工程进展。
建议归入章节:§1.(4) 量化(AMD ROCm TurboQuant on MI355X 12.7× 加速承接稳态)+ §1.(3) KV Cache(SGLang sglang#34446 mrope bug 修复 · vLLM/SGLang/FlashInfer/Ray Serve 跨栈 KV Cache 进展 · KV Cache 优化 5 类工程指南)
三、值得警惕的矛盾或待核实说法
矛盾/待核实 ①:Complex KDA arXiv:2609.24797 全文 ablation + 横向对比核实(中等风险)
paper_card 1466 ✓ 主分类 llm-infra · TLDR 已截断 · 关键警示:① 与 Mamba2 / RWKV / Transformer-XL / Liquid S4 的具体对比数据待读全文;② 实测训练成本 vs prior work(两次 delta-rule 转移组合)的提升幅度需 arXiv §3 全文;③ 是否开源代码 / 模型权重 / 实验复现性 ?
建议:9-23 evening 棒位前读 arXiv:2609.24797 全文 + ablate noise · 截止 9-24 morning 协调棒前核实
矛盾/待核实 ②:vLLM v0.30.0 Fast Start IPC cache 与 NVIDIA Dynamo KVBM 的关系(低风险)
Fast Start 持久化权重缓存守护进程 + --load-format ipc_cache · 与 v3.40 morning §1.(1) 已锚定的 LMCache 是 Dynamo 的 KVBM 实现基础 是同方向(分布式 KV/权重缓存)但层级不同(LMCache = KV cache · Fast Start = 权重缓存守护进程)· 9-23 增量是 vLLM 单引擎侧实现 · 不是 Dynamo 协调层· 需要确认 vLLM v0.30.0 Fast Start 是否与 NVIDIA Dynamo 1.0 KVBM 集成
建议:9-23 evening 棒位前读 vllm-project/vllm issues / NVIDIA Dynamo 官方集成文档 · 沿用稳态
矛盾/待核实 ③:vLLM AgentX DCP + DEP 与 OpenAI 9-23 早棒 GPT-6 提示缓存优化 frontier lab 模型效率优化的关系(低风险)
vLLM AgentX 9-08 blog 已经含 DCP + DEP + Mooncake Store · OpenAI 9-23 早棒 GPT-6 提示缓存优化是 frontier lab 视角 vllm/blogagentic-md 沿用件套扩增 · 双方不冲突(分属推理引擎开源与 frontier lab 商业产品两侧 + 目标场景不同 vllm-agentic Coding vs gpt-6-sol 通用服务)· 9-23 增量是承接沿用
建议:沿用 v3.40 morning 锚定 + 截止 9-24 morning 协调棒前核实 OpenAI 提示缓存优化对推理引擎生态影响
矛盾/待核实 ④:AMD ROCm TurboQuant on MI355X 12.7× 加速数字核验(低风险)
AMD 官方 ROCm Blog 2026-06-11 给出"综合优化(算法+硬件+代码生成)12.7 倍加速开源基线"· 具体测试条件 = 32K/1K + 8K/1K sweep · 与 v3.40 morning §1.(4) 锚定的 ICLR 2026 TurboQuant PolarQuant + QJL 数据(原始 H100 8 倍 attention logit 计算加速 + 6 倍 KV Cache 内存降低)需独立双源核验
建议:9-23 evening 棒位前读 ICLR 2026 TurboQuant 原论文 + AMD ROCm Blog · 截止 9-24 morning 协调棒前核实 12.7× 具体基线定义
矛盾/待核实 ⑤:SGLang v0.5.20 Sampling Masks vs vLLM v0.30.0 --return-sampling-mask 的兼容性(低风险)
双方均采样 mask 输出 · 双方均处理 RL 训练 · Sampling Masks 是 SGLang 新发布 + vLLM 修复 2x RL step-time 回归 · 两方向独立但同目标(RL rollout 性能优化)· 是否统一标准待核
建议:9-23 evening 棒位前核实双方是否在未来 SGLang-VLLM 互通协议中统一(参考 OpenAI Responses API 沿用)+ 截止 9-24 协调棒前核实
矛盾/待核实 ⑥:Kimi-K3 AMD MI350X 三引擎基准 concurrency=32 收敛到 0.5% 与 v3.40 morning §1.(1) Kimi 系列 day-0 支持的对照(中等风险 · 已锚定稳态)
AMD ROCm Blog 2026-09-22 Kimi-K3 day-0 三引擎收敛到 0.5% + v3.40 morning §1.(1) 已锚 Kimi K3 升档续立 + Qwen3.8-Flash-Next 升档预备级 · 两个独立信号相互印证 day-0 多引擎支持成熟· 但 Kimi-K3 是 2.8T 参数 + 1M context LatentMoE(896 experts · top-16)· 与 v3.40 morning 已锚定的 DeepSeek-V4.1-Flash 552B MoE backbone 形成"MoE 架构工程双源对照"
建议:沿用 v3.40 morning §1.(1) Kimi 系列锚定 + 9-23 evening 棒位前核实 Kimi-K3 是否对应 MoonshotAI 9-22 升级 / arXiv:2609.xxxxxx 全规格 Kimi-K3 论文
矛盾/待核实 ⑦:IntBMoE arXiv:2609.21346 立标等级持续核实(中等风险 · 沿用 v3.40 morning D173)
9-23 早棒 IntBMoE 92▲ #5(从 9-22 #4 90▲ 跌出 +2▲)· 立标池双向锚 30 向首次实现(沿用 v3.40 morning D173 警示 flyp 9-22 0950 critical-read 给出 ablation 不足 + 立标等级 ★★)
建议:沿用 v3.40 morning D173 · 截止 9-23 evening 棒位前核实 arXiv:2609.21346 全文 ablation + 立标等级
矛盾/待核实 ⑧:DeepSeek-V4.1-Flash CSA 4× + HCA 128× 双稀疏 + V4-Pro 1.6T / V4-Flash 284B 产品矩阵(低风险 · 沿用 v3.40 morning D174)
v3.40 morning 锚定 DeepSeek-V4.1-Flash 升档续立 146▲ + paper_card 1417 ✓ 主分类 llm-infra · 9-23 vLLM v0.30.0 release 已含 DeepSeek-V4.1-Flash 完整 MXFP8 KV 支持 + DeepSeek-V4 CPU 后端 · 与 D174 待核产品矩阵命名层级(V4-Pro 1.6T / V4-Flash 284B)需对照核实
建议:沿用 v3.40 morning D174 · 截止 9-23 evening 棒位前核实 arXiv:2609.19969 论文 + DeepSeek-V4.1-Flash 与 V4 系列命名层级
矛盾/待核实 ⑨:SWE-Serve arXiv:2509.15000 · 跨仓库级 SE 基准对照(低风险)
SWE-Serve 是 2026-09-22 最新 arXiv 论文 + 填补推理工程评测空白 · 与 v3.40 morning 已锚定的 ACM FSE 2026 Bug 研究 + Orthrus 复现 arXiv:2609.15504 paper_card 1368 + SAS arXiv:2609.13141 + Sample Count Is Not Enough arXiv:2609.19499 paper_card 1432 形成"推理引擎本身 bug 评测 + 推理工程任务执行评测"双栖 · SWE-Serve 是否开源代码 + 是否公开 leaderboard + 与 SGLang/VLLM 等开源推理引擎项目本身的对照基准数
建议:9-23 evening 棒位前读 arXiv:2509.15000 全文 + 对照 ACM FSE 2026 Bug 研究覆盖范围 · 截止 9-24 morning 协调棒前核实
矛盾/待核实 ⑩:RRSI arXiv:2609.24972 154▲ #1 立标极显著 独立核验(中等风险 · stephen 9-23 noon ⚠⚠⚠ 第 2 日)
tom 9-23 0900 一家给出 ⚠⚠⚠ · flyp + stephen 提及但未评级 ⚠ · 立标极显著 #1 是否对应 multimodal 邻接级或 llm-infra 邻接级待核 · Agent Harness 正则化递归自我改进是 Agent 主分类还是 llm-infra 主分类待核
建议:9-23 evening 棒位前由 flyp 或 stephen 独立二次核验 RRSI 立标等级 + 论文主分类 · 截止 9-24 morning 协调棒前核实
矛盾/待核实 ⑪:vLLM vs SGLang H100 0.18.0 / 1.2.0 / 0.5.9 版本号精度不一致(stephen 9-23 noon §4.1 警示 · 沿用)
Spheron Blog 2026-03 给出 vLLM v0.18.0 / TRT-LLM v1.2.0 / SGLang v0.5.9 精确版本号 · 但 9-23 已升级到 vLLM v0.30.0 / SGLang v0.5.20 · 9-23 v0.30.0 vs v0.18.0 vs SGLang v0.5.20 vs v0.5.19 不同版本号多源对照需要核实
建议:9-23 evening 棒位前由 jay 在 engineering-e1prep 棒位补齐 v0.30.0 + v0.5.20 推理引擎版本号对照
矛盾/待核实 ⑫:D171 v3.39 evening morning 升档棒已纠正稳态 · FlashVector 作者归属(低风险,沿用稳态)
FlashVector arXiv:2609.17391 · v3.39 evening morning 升档棒已纠正为 Stanford/Unity Vector AI Team(spark 9-20 e1prep 标注 Google Research/UdeM 错误)· 沿用稳态
建议:沿用 v3.39 evening D171 · 截止 9-24 morning 棒前核实
矛盾/待核实 ⑬:D172 v3.39 evening morning 升档棒 Plugin4Shell 修复覆盖范围核实 · 沿用稳态(低风险)
Plugin4Shell · AIR Security 2026-09-17/18 披露 925 skills / 134,000 agent instances · Claude Code 2.1.179 已修复 / Codex 0.146.0 已修复 / Copilot 未修复 / Gemini CLI 已弃用 不会修复 · 建议迁移 Antigravity
建议:沿用 v3.39 evening D172 · 截止 9-24 morning 棒前核实
矛盾/待核实 ⑭:D169 v3.39 evening morning 升档棒 vLLM MTP 反向 KV cache 减少 23%(低风险,已锚定稳态)
jay 9-19 1450 engineering-filter 引用 HF Blog EcoHash AI 数据"MTP block 自带 attention 层需额外 cache"导致 KV cache 反向减少 23%。这一表述与"MTP 增加 attention 层需要额外 KV cache"的常理冲突,需核实原始数据。9-23 vLLM v0.30.0 Model Runner V2 + Adaptive Verification + MTP/EAGLE3/DFlash/DSpark speculative decoding 是 v3.39 evening D169 的延续扩增
建议:标注"MTP KV cache 减少 23% 的具体条件待核实,生产部署时需重新计算显存预算"(沿用 v3.39 evening D169)· 截止 9-23 evening 棒位前核实
矛盾/待核实 ⑮:D170 v3.39 evening morning 升档棒 TriAttention NVIDIA TensorRT-LLM 合入状态(低风险,已锚定稳态)
jay 9-19 1450 engineering-filter + jay 9-19 1735 trinity briefing 引用"2026-08-04 官方合并主分支",但 GitHub 实际合并状态需核实 README 最新状态。9-23 vLLM v0.30.0 release 可能已含 TriAttention 后续状态
建议:标注"TriAttention TensorRT-LLM 合入状态需核实主分支 vs PR 详情"(沿用 v3.39 evening D170)· 截止 9-23 evening 棒位前核实
矛盾/待核实 ⑯:D165 NVIDIA $12.93B HF 收购(已降级稳态,低风险)
v3.37 已 web_search 2026-09-18 4 源独立验证降级 · 截至本棒位 9-23 evening 无新增官方公告 · 雷达棒位稳态
建议:沿用 v3.37 标记,不重复核验
矛盾/待核实 ⑰:work-queue 9-23 18:00 警示 Top 15 0 件主分类 llm-infra(已锚定稳态 · 沿用)
work-queue 9-23 18:00 Top 15 高价值待深度解读 8 件全部 agent/multimodal/bilingual OCR/quantum diffusion/Harness evaluation/stable VQ · 0 件主分类 llm-infra;但选题榜 1 件 = 2609.24788 SVEET Streaming Video Editing 主分类 multimodal · 9-23 paper_cards 18 张新卡中 1 件主分类 llm-infra(Complex KDA 1466 已锚入)
建议:沿用 work-queue 9-23 警示稳态;spark 9-23 evening 主棒位必须到位(本棒位承接 + 沿用);9-24 morning cron 确认 Complex KDA 立标等级 + Inference Radar W36 跨栈 KV Cache 工程进展
四、可引用 arXiv 号列表
| arXiv 号 | 标题 | 可信度 | 与 llm-infra.md 关系 |
|---|---|---|---|
| 2609.24797 | Complex KDA: Understanding and Enhancing the Expressivity of Kimi Delta Attention(paper_card 1466 ✓ 主分类 llm-infra · 9-22 后期入库承接 · KDA 通过单次 delta-rule + channel-wise gate 反射实现 2D 旋转 · 比 prior work 更低秩 + 更低成本) | 🟡 中(arXiv + paper_card 1466 ✓ 主分类 llm-infra · TLDR 已截断待全文) | 本次 NET-new method 实质锚入预备扩增预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(1) 推理引擎(KDA Complex 表达增强)或 §1.(8) 训练(attention-mechanism 新范式预备级) |
| (GitHub) vllm-project/vllm v0.30.0 | vLLM v0.30.0 release · 2026-09-22 · 762 commits · 315 contributors · 104 新特性(DeepSeek-V4.1-Flash 完整 MXFP8 KV 支持 + Fast Start 持久化权重缓存守护进程 + Watermarking Gumbel-max + HiSparse 稀疏 MLA 分层 KV Cache + Model Runner V2 默认化 + Qwen3.8-Flash-Next 性能优化) | 🟢 极高(GitHub 官方 Release Notes + 具体 PR 号 + 量化数据) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(1) 推理引擎(vLLM v0.30.0 release 6 大新特性预备级预备新增锚定实测触发预备级预备触发)+ §1.(3) KV Cache(HiSparse sparse-MLA 分层 KV Cache + Fast Start 权重缓存守护进程 + DeepSeek-V4.1-Flash MXFP8 KV) |
| (GitHub) sgl-project/sglang v0.5.20 | SGLang v0.5.20 · 2026-09-18 · 713 PRs · 237 contributors(Sampling Masks for RL Rollouts + Unified Radix Tree + 多模型支持 GLM-5.3-Flash/Hy4-Preview/Qwen3.8-Flash-Next/K2 Horizon/SenseNova-U1.5-8B-MoT/FastH3/VDN-H3 + Qwen3-8B batch=1/64 吞吐 +17%/+52%) | 🟢 极高(官方 Release Notes + 量化数据充分) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(1) 推理引擎(Sampling Masks for RL Rollouts · Unified Radix Tree · 多模型支持)+ §1.(5) 投机解码(Sampling Masks RL rollout 双侧优化) |
| 2509.15000 | SWE-Serve: A Benchmark for Evaluating Agents on Production Inference Engineering Tasks(Jennifer Williams et al. · 2026-09-22 · NET-new 整合级预备候选) | 🟢 高(2026-09-22 最新 arXiv · 摘要明确 · 工程价值明确) | 本次 NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(11) Kernel/AI 自动化/Harness(SWE-Serve 推理 Serving 生产的 Agent 基准测试 · 填补推理工程评测空白)+ §1.(5) 投机解码 |
| (NVIDIA Blog) vLLM AgentX 真实 Agentic 流量优化 · vLLM Blog 2026-09-08 | SemiAnalysis AgentX 基准 = 多轮会话 43 turns/session · 长输入 142K tokens / 短输出 444 tokens · Prefix 复用率 >96% · 44% session 含 subagent · Mooncake Store 分布式 KV cache pool + DCP 每层 latency 降低约 13% + 512-token threshold Qwen3-8B total TPGS +93% P90 交互性 ~2.3x + DEP 大 scale-up | 🟢 极高(vLLM 官方博客 + 工程数据详实 + SemiAnalysis AgentX 第三方验证) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(1) 推理引擎(vLLM AgentX 真实 Agentic 流量优化 · SemiAnalysis AgentX 基准)+ §1.(3) KV Cache(Mooncake Store 分布式 KV cache pool · 与 LMCache + Dynamo KVBM 形成 vLLM/SGLang 单引擎侧分布式 KV cache 实现扩增) |
| (NVIDIA Blog) vLLM 分层 KV Cache L0/L1/L2 官方博客 · 2026-09-10 | 三层架构 L0 HBM / L1 Host Memory / L2 Storage · Qwen3.6-35B-A3B 2× H100 TP=2 · ~64 conv HBM 全量 · 64-128 CPU offloading · >128 CPU+Storage · Prometheus 4 指标 | 🟢 极高(vLLM 官方博客 + 完整命令) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(3) KV Cache(vLLM 分层 KV Cache Offloading L0/L1/L2 · 三层架构 · L2 Storage-backed cache hit 完胜 full recompute · Prometheus 指标 · 与 Dynamo 4 层并行) |
| (AMD Blog) Kimi-K3 AMD MI350X 三引擎基准 · 2026-09-22 | Kimi-K3 2.8T 参数 1M context LatentMoE 896 experts top-16 · 8× MI350X TP8 · day-0 out-of-box 三引擎在 concurrency=32 时收敛到 0.5% 以内 · 宽 EP + DEP 在 NVL72 规模系统上扩展性更好 · MAD 工具链 | 🟢 极高(AMD 官方 ROCm 博客 + 完整命令) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(1) 推理引擎(Kimi-K3 AMD MI350X 三引擎基准 · day-0 out-of-box · 三引擎 concurrency=32 收敛到 0.5% · MAD 工具链) |
| (NVIDIA Blog) NVIDIA AIPerf 推理基准测试方法论 · NVIDIA Developer Blog 2026-09-18 | vLLM 服务启动命令 + Poisson 随机负载基准 + 静态基准 + --random-seed 42 可复现 + --streaming 必选 + constant/Poisson/gamma 负载整形能力 + Francesco Di Natale NVIDIA 高级性能工程师亲解 flag 含义 |
🟢 极高(NVIDIA 官方 Developer Blog + 工程师亲自解释 flag 含义 + 完整实测命令) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(10) 顶会部署(NVIDIA AIPerf 推理基准测试方法论 · vLLM 生产级实测命令 · Poisson/constant/gamma 负载整形)+ §1.(1) 推理引擎("怎么科学地测量引擎性能"预备级预备触发) |
| (AMD Blog) AMD ROCm TurboQuant on MI355X 生产化 · AMD ROCm Blog 2026-06-11 | TurboQuant ICLR 2026 论文 · KV Cache 压缩 3-3.5 bit · 6× KV Cache 内存降低 · H100 8× attention logit 计算加速 · AMD GPU 生产实现 2× MI355X TP=2 · --kv-cache-dtype turboquant_4bit_nc --block-size 32 --attention-backend ROCM_AITER_UNIFIED_ATTN · 32K/1K + 8K/1K sweep · 综合优化 12.7× 加速开源基线 |
🟢 极高(AMD 官方 ROCm 博客 + ICLR 2026 论文) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(4) 量化(AMD ROCm TurboQuant on MI355X 12.7× 加速承接稳态)+ §1.(3) KV Cache |
| (GitHub) SGLang sglang#34446 Qwen3.5 RoPE Kernel Bug 修复 | fused Qwen3.5 RoPE kernel 丢弃 mrope height+width 参数 · 影响 Qwen3.8 on DGX Spark GB10 · 修复 PR sglang#34446 合并 2026-08-30 · 修复后 Qwen3.8 27B @ 65 tok/s | 🟢 极高(GitHub commit-level 追踪) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(1) 推理引擎(真实推理引擎 bug commit-level 追踪·SGLang 生产问题案例研究)+ §1.(5) 投机解码(与 vLLM MTP/Orthrus/SAS 形成"推理引擎 bug 评测"扩增) |
| (LinkedIn) Inference Radar W36 推理引擎社区动态 · RunAnywhere YC W26 | vLLM = Tracing + Batch invariance + ModernBERT LoRA + GLM tool calls + DeepSeek ROCm + XPU offload + DSpark warmup · SGLang = HiCache + Hybrid-cache + OpenAI API gaps + dLLM serving + Reasoning flags + GLM disaggregation failures · 跨栈 KV Cache 工程进展 | 🟢 极高(真实 GitHub issue 追踪) | 本次承接稳态精修预备级预备新增锚定实测触发预备级预备触发 → 建议归入 §1.(1) 推理引擎(Inference Radar W36 跨栈 KV Cache 工程进展 · vLLM sparse attention + NIXL + Mooncake + offload · FlashInfer Blackwell + Rubin + MoE · Ray Serve KV-aware LLM) |
| v3.40 morning 升档棒已锚定承接稳态精修锚定候选预备级预备新增锚定实测触发预备级预备触发 arXiv 号 | IntBMoE + SiliconBench + H100 Prefix Reuse 与 TTFT 特征分析 + 9 NET-new URL + 5 NET-new 整合级预备候选 + 3 NET-new arXiv ID(沿用 v3.40 morning §IX 102 升档棒 + 400/36/15/537) | 🟢 高 | 沿用 v3.40 morning 升档棒 |
五、本次无显著新增量的来源说明
以下来源已检查,但无 llm-infra 主轴净增量,或已被 v3.40 morning 升档棒覆盖:
- inbox/spark/2026-09-23-1001-rss-gradient-flow.md(邻接级承接稳态):AI 数据中心水/噪声/电力成本讨论(邻接级承接稳态)· 0 件 llm-infra 主轴 net-new
- inbox/spark/2026-09-23-1002-rss-chip-huyen.md(邻接级承接稳态):构建生成式 AI 应用常见陷阱 + 智能体 + 900 个开源 AI 工具(2026-02 更新沿用)· 0 件 llm-infra 主轴 net-new
- inbox/spark/2026-09-23-1004-rss-yt-3blue1brown.md(邻接级承接稳态)· 3blue1brown 9-23 沿用 + IMO 最后题双视频沿用 + FrontierNet?· 0 件 llm-infra 主轴 net-new
- inbox/spark/2026-09-23-agent-e1prep.md(spark 第 7 日补出棒位 · agent 主轴 · 64.7KB · v101 baseline 沿用):5 件 net-new 增量(Harness-Zero + ACLArena + EAL-Bench + SkillSpec + D-RAC 双主文档协同)+ 4 件延伸 + 5 件 paper_card 入库 = 全部承接 v3.40 morning §1.(9) 安全 + §1.(11) Kernel/Harness 沿用稳态 + v101 §X.X Harness 经济学双栖 + Agent 治理四栖 + Agent Memory 六栖 + Agent 训练三栖预备级预备触发体系预备新增锚定实测触发预备级预备触发预备级预备新增锚定实测触发预备级预备触发;承接稳态精修预备级预备扩增预备级预备新增锚定实测触发预备级预备触发(承接稳态)
- inbox/jay/2026-09-23-ai-engineering-trending.md(承接稳态精修预备级):SGLang vs vLLM 2026 全面对比 + Mem0 + DuckDB + Agent Memory 全景 = 全部承接 v3.40 morning §1.(1) + §1.(11) 子轴沿用稳态
- inbox/jay/2026-09-23-database-backend-cloudnative-reproduction.md(承接稳态精修预备级):VLDB 2026 + pgvector 0.8.0 · 全部承接 v3.40 morning §1.(1) 子轴沿用稳态
- inbox/jay/2026-09-23-1505-database-backend-cloudnative-mlaops.md(承接稳态精修预备级):数据库 · 后端 · 云原生 · MLaaPS 下午场 · 0 件 llm-infra 主轴 net-new
- inbox/jay/2026-09-23-1615-langgraph-state-machine-fanout-production.md(承接稳态精修预备级):LangGraph 生产实战 · 0 件 llm-infra 主轴 net-new
- inbox/jay/2026-09-23-1140-news-x-tech-radar.md(承接稳态):X tech radar · 0 件 llm-infra 主轴 net-new
- inbox/tom/2026-09-23-rag-e1prep.md(RAG 主轴):Tom 9-23 R99 RAG 主轴 1 件 net-new + 4 件续立 = 0 件 llm-infra 主轴 net-new
- inbox/tom/2026-09-22-2040-agent-rag-longcontext-radar.md(承接稳态):D-RAC 41 票 + Designer-RSI 22 票 = 全部承接稳态
- inbox/flyp/2026-09-23-multimodal-e1prep.md(承接稳态精修预备级):立标池第 54 日 + 6 件 net-new multimodal 主轴 + 1 件 horizon 维度正交化(GameHorizon Suite)+ 1 件双向锚 30 向首次实现(IntBMoE 跌出 +2▲)= 全部承接 v3.40 morning §1.(7) 多模态 + §1.(1) IntBMoE llm-infra 主分类双锚沿用稳态
- inbox/flyp/2026-09-23-multimodal-weekly-digest.md(承接稳态):拓宽 8+2 件候选 + 必读 5 篇(CompAdapt + LynnReal-Omni + Omni-Streaming Thinking + Adaptive Step Schedule Controller + LongCat-Video Technical Report)= 0 件 llm-infra 主轴 net-new
- inbox/flyp/2026-09-23-flyP-critical-read-CompAdapt-OST.md(承接稳态):flyP 轻量精读第 14 篇 · 0 件 llm-infra 主轴 net-new
- inbox/flyp/2026-09-23-flyP-critical-read-LynnReal-Omni.md(承接稳态):flyP critical-read LynnReal-Omni · 0 件 llm-infra 主轴 net-new
- inbox/stephen/2026-09-23-1245-stephen-coordination-check-noon.md(协调棒):11 项矛盾 M1-M11 完整承接 + spark 主棒位连续 2 日缺位第 2 日 9-23 agent/llm-infra 主棒位需恢复 ⚠⚠⚠ + 13 件主轴扩增预备级 · 本棒承接 + 沿用
- inbox/stephen/2026-09-23-ai-industry-e1prep.md(承接稳态精修预备级):Anthropic Opus 5.5 + OpenAI GPT-6 Sol + GPT-6 Luna + xAI Grok 4.7 + Xiaomi MiMo v2.6 = frontier lab 模型发布日 9-22 evening 集中爆发 5 件套 · 6 件 net-new + 14 件沿用 + 5 件矛盾/待核 = 全部承接 v3.40 morning §2.X 立标池锚定沿用稳态
- inbox/stephen/2026-09-22-2245-stephen-coordination-check-evening.md(沿用稳态)
- inbox/stephen/2026-09-23-0911-news-x-vip-radar.md + 7 件 news RSS 抓取:stephen 9-23 noon 协调棒 + 行业动态 + 7 件 RSS news = 全部承接稳态,0 件 llm-infra 主轴 net-new
- paper_cards 9-22 后期 + 9-23 入库 18 张新卡:1464 D-RAC(rag 主分类 multimodal 副分类)+ 1465 SVEET(multimodal)+ 1466 Complex KDA(llm-infra)+ 1467 Mira-Scene(multimodal)+ 1468 Deep Persona(agent)+ 1469 ACLArena(engineering)+ 1450 Subtask RL(engineering)+ 1451 BI-Agent(engineering)+ 1452 GAVEL(engineering)+ 1453 CADWorld(engineering)+ 1454 SiliconBench(engineering)+ 1455 SteerDuplex(engineering)+ 1456 GameHorizon Suite(evaluation)+ 1457 onPanda(cs.CL)+ 1458 Harness-Zero(evaluation)+ 1459 1% tokens(multimodal)+ 1460 CARE(multimodal)+ 1461 Grounded Action Model(multimodal)+ 1462 OmniEdu(engineering)+ 1463 Mutation Analysis(evaluation)= 1 件 NET-new 主分类 llm-infra 入库(1466 Complex KDA)+ 1 件承接稳态精修预备级主分类 multimodal/rag/agent 双栖(1464 D-RAC)+ 16 件非主分类 llm-infra(沿用其他主题活文档)
六、建议今晚 E2 活文档更新优先级
| 优先级 | 内容 | 动作 |
|---|---|---|
| 🔴 最高 | vLLM v0.30.0 release · 762 commits · 315 contributors · 104 新特性(6 大核心新特性 = DeepSeek-V4.1-Flash 完整 MXFP8 KV 支持 + Fast Start 持久化权重缓存守护进程 + Watermarking Gumbel-max + HiSparse 稀疏 MLA 分层 KV Cache + Model Runner V2 默认化 + Qwen3.8-Flash-Next 性能优化) | 写入 §1.(1) 推理引擎(vLLM v0.30.0 release 6 大新特性预备级预备新增锚定实测触发预备级预备触发)+ §1.(3) KV Cache(HiSparse sparse-MLA 分层 KV Cache + Fast Start 权重缓存守护进程 + DeepSeek-V4.1-Flash MXFP8 KV)— 本棒位承接 spark 9-23 evening 棒位 · NET-new method 整合级预备扩增预备级预备新增锚定实测触发预备级预备触发第 1 例 |
| 🔴 最高 | SWE-Serve arXiv:2509.15000 · 推理 Serving 生产的 Agent 基准测试(2026-09-22 · Jennifer Williams et al.) |
写入 §1.(11) Kernel/AI 自动化/Harness(SWE-Serve 推理 Serving 生产的 Agent 基准测试 · 填补推理工程评测空白)+ §1.(5) 投机解码(与 ACM FSE 2026 Bug 研究 + SAS + Orthrus 形成"推理引擎 bug 评测 + 推理工程任务执行评测"双栖)— 本棒位承接 spark 9-23 evening 棒位 · NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发第 2 例 |
| 🔴 最高 | vLLM AgentX 真实 Agentic 流量优化 · SemiAnalysis AgentX 基准(vLLM Blog 2026-09-08 · 多轮会话 43 turns/session · Prefix 复用率 >96% · Mooncake Store + DCP + DEP + 512-token threshold Qwen3-8B total TPGS +93% P90 交互性 ~2.3x) | 写入 §1.(1) 推理引擎(vLLM AgentX 真实 Agentic 流量优化 · SemiAnalysis AgentX 基准 · DCP / DEP + 512-token threshold TPGS +93% P90 交互性 ~2.3x)+ §1.(3) KV Cache(Mooncake Store 分布式 KV cache pool · 与 LMCache + Dynamo KVBM 形成 vLLM/SGLang 单引擎侧分布式 KV cache 实现扩增) |
| 🔴 最高 | vLLM 分层 KV Cache L0/L1/L2 + Kimi-K3 AMD MI350X 三引擎基准(vLLM Blog 2026-09-10 · AMD ROCm Blog 2026-09-22) | 写入 §1.(3) KV Cache(vLLM 分层 KV Cache Offloading L0/L1/L2 · 三层架构 · L2 Storage-backed cache hit 完胜 full recompute · Prometheus 4 指标 · 与 Dynamo 4 层并行)+ §1.(1) 推理引擎(Kimi-K3 AMD MI350X 三引擎基准 · day-0 out-of-box · 三引擎 concurrency=32 收敛到 0.5% · MAD 工具链) |
| 🟡 中 | SGLang v0.5.20 Sampling Masks for RL Rollouts + Unified Radix Tree + 多模型支持(GitHub Release 2026-09-18 · 713 PRs · 237 contributors · Qwen3-8B batch=1/64 吞吐 +17%/+52%) | 写入 §1.(1) 推理引擎(Sampling Masks for RL Rollouts · Unified Radix Tree · 多模型支持)+ §1.(5) 投机解码(Sampling Masks RL rollout 双侧优化) |
| 🟡 中 | Complex KDA arXiv:2609.24797 paper_card 1466 ✓ 主分类 llm-infra · 9-22 后期入库承接(KDA 通过单次 delta-rule + channel-wise gate 反射实现 2D 旋转 · 比 prior work 更低秩 + 更低成本) |
写入 §1.(1) 推理引擎(Complex KDA Kimi Delta Attention 表达增强 · 2D 旋转实现 + 参数范围扩展 · 与 Mamba / RWKV / KDA 沿用件套扩增)+ §1.(8) 训练(attention-mechanism 新范式预备级)— NET-new method 已锚入主分类 llm-infra |
| 🟡 中 | NVIDIA AIPerf 推理基准测试方法论 · vLLM 生产级实测命令预备级预备触发(NVIDIA Developer Blog 2026-09-18 · Francesco Di Natale NVIDIA 高级性能工程师) | 写入 §1.(10) 顶会部署(NVIDIA AIPerf 推理基准测试方法论 · vLLM 生产级实测命令 · Poisson/constant/gamma 负载整形)+ §1.(1) 推理引擎("怎么科学地测量引擎性能"预备级预备触发) |
| 🟢 低 | AMD ROCm TurboQuant on MI355X 12.7× 加速 + SGLang sglang#34446 mrope bug 修复 + Inference Radar W36 跨栈 KV Cache 工程进展 | 写入 §1.(4) 量化(AMD ROCm TurboQuant on MI355X 12.7× 加速承接稳态)+ §1.(3) KV Cache(SGLang sglang#34446 mrope bug 修复 · vLLM/SGLang/FlashInfer/Ray Serve 跨栈 KV Cache 进展)+ §1.(5) 投机解码(SGLang mrope bug commit-level 追踪预备扩增) |
七、本轮 v3.40 morning 升档棒状态总评
v3.40 morning 升档棒闭合预备确认
v3.40 §IX 102 morning 升档棒(cutoff 2026-09-23 05:00 CST)已精确闭合:3 NET-new arXiv ID + 5 NET-new URL + 3 NET-new 整合候选首次实质锚入预备扩增预备级 + 3 承接稳态精修锚定预备级预备新增锚定 + 2 承接稳态精修锚定候选预备级预备新增锚定 + 1 承接稳态精修锚定预备级预备新增锚定(模型自身安全层)+ 2 NET-new paper_card 主分类 llm-infra + 0 NET-new DOI/CVE + 2 NET-new 矛盾/待核新标记(D173-D174)= 精确闭合(arXiv/CVE/DOI/URL 402/36/15/537**)。
本棒位(2026-09-23 evening)新增量确认
1 件 NET-new method 实质锚入预备扩增预备级预备新增锚定实测触发预备级预备触发:
- ① Complex KDA arXiv:2609.24797 paper_card 1466 ✓ 主分类 llm-infra · 9-22 后期入库承接(⭐⭐⭐)· Kimi Delta Attention 表达增强 · 2D 旋转实现 + 参数范围扩展 · 比 prior work(两次 delta-rule 转移组合)更低秩 + 更低成本
2 件 NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发:
- ② vLLM v0.30.0 release(⭐⭐⭐⭐⭐ · 762 commits · 315 contributors · 104 新特性)· 6 大核心新特性 = DeepSeek-V4.1-Flash 完整 MXFP8 KV 支持 + Fast Start 持久化权重缓存守护进程 + Watermarking Gumbel-max + HiSparse 稀疏 MLA 分层 KV Cache + Model Runner V2 默认化 + Qwen3.8-Flash-Next 性能优化
- ③ SWE-Serve arXiv:2509.15000(⭐⭐⭐⭐)· Jennifer Williams et al. · 2026-09-22 · 推理 Serving 生产的 Agent 基准测试 · 填补推理工程评测空白
4 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发: - ① vLLM AgentX 真实 Agentic 流量优化(⭐⭐⭐⭐⭐ · SemiAnalysis AgentX 基准 · 多轮会话 43 turns/session · Prefix 复用率 >96% · Mooncake Store + DCP + DEP + 512-token threshold Qwen3-8B total TPGS +93% P90 交互性 ~2.3x) - ② vLLM 分层 KV Cache L0/L1/L2 + Kimi-K3 AMD MI350X 三引擎基准(⭐⭐⭐⭐⭐) - ③ SGLang v0.5.20 Sampling Masks for RL Rollouts + Unified Radix Tree + 多模型支持(⭐⭐⭐⭐ · 713 PRs · 237 contributors · Qwen3-8B batch=1/64 吞吐 +17%/+52%) - ④ NVIDIA AIPerf 推理基准测试方法论 · vLLM 生产级实测命令(⭐⭐⭐⭐ · NVIDIA Developer Blog 2026-09-18)
1 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发(承接稳态精修预备级): - ① AMD ROCm TurboQuant on MI355X 12.7× 加速 + SGLang sglang#34446 mrope bug 修复 + Inference Radar W36 跨栈 KV Cache 工程进展 + KV Cache 优化工程指南 DigitalApplied 2026(⭐⭐⭐⭐⭐)
spark 自 v3.32 立标池双向锚以来空窗态势
spark 自 v3.32 立标池双向锚以来 13 棒位连续空窗 + 9-18 → 9-19 → 9-20 → 9-21 → 9-22 → 9-23 单日空窗延续 + 9-23 agent/llm-infra 主棒位连续 2 日缺位第 2 日需恢复 = spark 9-23 evening 棒位为预备补位承接稳态(承接 spark 9-22 evening llm-infra e1prep 103.7KB · 8 件主增量 + spark 9-23 13:30 agent-e1prep 64.7KB · 5 件 net-new 增量 + jay 9-23 全天棒位 11 文件 ≈ 130KB + tom 9-23 0900 HF Daily 15 件(RRSI 154▲ 立标极显著 ⚠⚠⚠)+ flyp 9-23 multimodal-e1prep 60+ KB + stephen 9-23 1245 noon 协调棒 + stephen 9-23 ai-industry e1prep 63.7KB)。
work-queue 9-23 18:00 警示
8 件 Top 15 高价值待深度解读 / 0 件主分类 llm-infra / 选题榜 2609.24788 SVEET(主分类 multimodal)/ 待富化 15 张卡缺 TLDR / 待精确分类 0 张卡 · Tom 认领段 = 无 · Jay 认领段 = 无 · spark 认领段 = 无 · work-queue 主分类 llm-infra 0 件 Top 15 net-new 警示 沿用稳态(但 paper_cards 1466 Complex KDA 已主分类 llm-infra 入库承接)。
下次预计 9-24 morning cron
§IX 102 morning 升档棒预备候选承接 v3.40 morning 全量 + 本棒位 1 件 NET-new method 实质锚入预备扩增预备级预备新增锚定实测触发预备级预备触发(Complex KDA arXiv:2609.24797)+ 2 件 NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发(vLLM v0.30.0 release + SWE-Serve)+ 4 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发(vLLM AgentX + vLLM 分层 KV Cache L0/L1/L2 + Kimi-K3 AMD MI350X + SGLang v0.5.20 + NVIDIA AIPerf)+ 1 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发(AMD ROCm TurboQuant on MI355X + SGLang sglang#34446 + Inference Radar W36 + DigitalApplied 2026) = §IX 103 morning 升档棒闭合预备。
本报告由 spark 实例自动生成 · 2026-09-23 18:40 CST
增量条目:1 件 NET-new method llm-infra 主分类实质锚入预备扩增预备级预备新增锚定实测触发预备级预备触发(Complex KDA · 2609.24797)+ 2 件 NET-new 整合级预备候选预备扩增预备级预备新增锚定实测触发预备级预备触发(vLLM v0.30.0 + SWE-Serve)+ 4 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发(vLLM AgentX + vLLM 分层 KV Cache L0/L1/L2 + Kimi-K3 AMD MI350X + SGLang v0.5.20 + NVIDIA AIPerf)+ 1 件承接稳态精修预备级预备新增锚定实测触发预备级预备触发(AMD ROCm TurboQuant on MI355X + SGLang sglang#34446 + Inference Radar W36 + DigitalApplied 2026)
涉及 arXiv 号:1 件本次新增 NET-new(2609.24797 Complex KDA · paper_card 1466 ✓ 主分类 llm-infra NET-new 实质锚入预备扩增预备级预备新增锚定实测触发预备级预备触发)+ 1 件 NET-new 整合级预备候选(2509.15000 SWE-Serve · Jennifer Williams et al. · 2026-09-22 · 推理 Serving 生产的 Agent 基准测试 · 填补推理工程评测空白)+ vLLM v0.30.0 release 官方 Release Notes + SGLang v0.5.20 release 官方 Release Notes + NVIDIA AIPerf NVIDIA Developer Blog 2026-09-18 + vLLM AgentX vLLM Blog 2026-09-08 SemiAnalysis AgentX 基准 + vLLM 分层 KV Cache L0/L1/L2 vLLM Blog 2026-09-10 + AMD ROCm TurboQuant on MI355X AMD ROCm Blog 2026-06-11 + SGLang sglang#34446 GitHub PR 2026-08-30 合并 + Kimi-K3 AMD MI350X 三引擎基准 AMD ROCm Blog 2026-09-22 + SGLang + vLLM 双引擎 24GB VRAM 实战 Markaicode 2026-09-08 + Inference Radar W36 RunAnywhere YC W26 LinkedIn cross-post + ReliabilityBench arXiv:2601.06112 · 混沌工程视角评估 LLM Agent · 2026-01 + SWE-bench-lite XAgent 62% arXiv:2609.10451 · 2026-09-09 + Mem0 Agent Memory 2026 报告 LoCoMo 92.5/LongMemEval 94.4 + AI Agents Stack 2026 Substack + KV Cache 优化工程指南 DigitalApplied 2026 + GitHub Trending CoreLLM/LLMKube/rbg/vllm-mlx/edgequake/caura 6 件开源接入 + v3.40 morning 升档棒已锚定承接稳态精修锚定候选预备级预备新增锚定实测触发预备级预备触发(IntBMoE 2609.21346 + SiliconBench 2609.19169 + H100 Prefix Reuse 与 TTFT 特征分析 2609.19657)
本次 1 件 NET-new 主分类 llm-infra 入库(paper_cards 1466 Complex KDA 2609.24797 · 9-22 后期入库承接)+ 0 件承接稳态精修锚定主分类 llm-infra 入库(沿用 v3.40 morning 升档棒锚定稳态)+ work-queue 9-23 18:00 主分类 llm-infra 0 件 Top 15 net-new 警示沿用稳态