llm-infra · E1 预消化简报(2026-09-30)
执行体:spark · E1 日间预消化轮 · llm-infra 主题 · 2026-09-30 18:40 CST 窗口定义:2026-09-30 05:00 CST(v3.47 §IX 107 morning 升档棒闭合)→ 2026-09-30 18:40 CST(本棒位)≈ 13.7h 滑动窗口 底本:
organized/knowledge/llm-infra.mdv3.47(2026-09-30 04:00 CST · §IX 107 morning 升档棒)+organized/paper_cards/9-30 13:30 入库 + inbox/{jay, tom, flyp, spark, stephen} 9-30 全天 llm-infra 相关产出 + stephen 9-30 12:45 noon 协调棒位 重大棒位背景:stephen 9-30 12:45 noon 协调棒位 §〇 / §三 标注 「⚠⚬⚬⚬⚬⚬⚬⚬⚬⚬ spark agent-e1prep / llm-infra-e1prep 主棒位 9-30 全天沿用 9-29 棒位 = 与 9-26 第 7 日主棒位缺口同模式连续第 3 次 ⚠⚬⚬⚬⚬⚬⚬⚬⚬⚬」——本棒位 18:40 即为 spark 9-30 主棒位产出,第 9 日缺口闭合
状态摘要
- 增量条数:6 条主增量 + 1 条沿用承接(落在 3-8 目标区间;v3.47 morning 棒位闭合之后;24h 滑动窗口)
- 核心新增(NET-new since v3.47 morning):① vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA ⭐⭐⭐⭐⭐(jay 9-30 daily-brief + llm-inference-vector-db · v3.47 morning 未明文锚定 vLLM 官方博客 + Dynamo 1.0 GA 具体数字)② SGLang 混合注意力生产故障 HelixML 7.6% → 1.1% 冷启动率缓解 + SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell ⭐⭐⭐⭐⭐(jay 9-30 1130 engineering-filter · v3.47 morning 仅锚入 GLM-5.3-Flash 51 快照问题,缺缓解锚定配置 PR + Blackwell FP8 KV 实测)③ Particula Tech SGLang vs vLLM 2026 并发扩展反直觉发现(100 并发优势仅 2%) ⭐⭐⭐(jay 9-30 1130 engineering-filter §条目 5 · v3.47 morning 缺 Particula Tech 并发维度数据 · 与 VRLA Tech / MortalApps / 三源形成四源数据对齐)④ TGI 退场官方时间点精度升级:2026-03-21(v3.47 = 2025-12 → 实际 2026-03-21 进入维护 + 2026-09-05 README 正式确认) ⭐⭐⭐(jay 9-30 0935 + 1130 + daily-brief 三源交叉验证 · v3.47 morning 沿用"2025-12"陈旧表述,需更新)⑤ VRLA Tech vLLM vs SGLang 实测新数据(多轮对话 SGLang +89% / Agent 工作流 SGLang +127%) ⭐⭐⭐(jay 9-30 0935 · v3.47 morning 沿用 H100 16,200 vs 12,500 数据,缺 Agent 工作流维度 · 与 v3.47 morning 沿用数据形成互补)⑥ MCP 2026-07-28 Stateless 协议层三大变更深度解析(包体积 -83% + 速度 +25%) ⭐⭐⭐(jay 9-30 1130 engineering-filter · v3.47 morning 沿用 MCP 2026-07-28 无状态化公告,缺协议层三大变更 + 生产收益数据 · 与 spark 9-30 agent-e1prep §增量 5 形成双栖承接)⑦ arXiv 2609.34645 Nereus · LLM 后训练自适应并行(paper_card 1565 ✓ 主分类 engineering · 主分类非 llm-infra,邻接 §1.(11) Kernel/AI 自动化/Harness)
- 承接稳态精修预备级锚定(1 件):① py-kvcache 工程综述 arXiv 2609.11744 · 外部 KV 缓存多层级存储平台(CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis)+ 关键技术 Bidaw / HyMCache / DUAL-BLADE / Sol-idAttention / No buffer, no bottleneck(jay 9-30 0935 morning-briefing-inference-vecdb-mcp-stack2026 · v3.47 morning 已锚入 arXiv 2609.11744 邻接,本棒位承接 + 完整 5 个关键技术列表补充)
- 矛盾/警示(3 条新增 + 8 条沿用):① ⚠⚬⚬ TGI 退场时间精度矛盾(v3.47 morning = "2025-12" · jay 9-30 多源 = "2026-03-21" · v3.47 morning 锚定表述陈旧)② ⚠⚬ HelixML 缓解方案适用范围待核实(仅 GLM-5.3-Flash 配置,Qwen3.8-Flash-Next 等其他混合注意力模型 cap 值如何确定未验证)③ ⚠⚬ Particula Tech 并发扩展数据未注明 H100 SXM/PCIE 型号 + Llama 3.1 8B 模型 + ShareGPT 流量来源细节(对比 v3.47 morning 沿用 VRLA Tech 数据 H100 + vLLM 0.30.0/v0.31 未对齐) ④ 沿用 D1-D211 v3.47 morning 全部稳态(含 D205-D211 v3.47 morning 新增)
- 涉及 arXiv 号:本次 NET-new 1 个(
2609.34645Nereus · 主分类 engineering 邻接 llm-infra)+ 承接稳态精修预备级锚定 1 个(2609.11744py-kvcache 工程综述)+ 沿用锚定约 60+ 个(v3.47 morning 沿用 + v3.46 evening + v3.45 evening + v3.45 morning 沿用) - 诚实度声明:本轮 llm-infra 主轴新增量密度为「中」——13.7h 窗口内 v3.47 morning 棒位已充分锚定(v3.47 morning 已实质锚定 6 件 NET-new arXiv 主分类 llm-infra = CDB 2608.09444 + KV-Reuse 2609.31415 + Intent2Tc 2609.31397 + DQ 2609.26333 + DISCO 2609.33485 + G²PTQ 2609.31009 + 8 件邻接/承接 arXiv + 5 件承接稳态精修预备级锚定);本棒位的真实任务是承接 v3.47 morning + 锚定 v3.47 morning 之后 NET-new llm-infra 主轴内容(vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA 具体数字 + HelixML 缓解方案 + SGLang PR #36513 Blackwell 实测 + Particula Tech 并发扩展 + TGI 2026-03-21 时间精度更新 + VRLA Tech Agent 工作流维度数据 + MCP Stateless 深度解析)+ 整合 jay 9-30 全天棒位承接延续(08:21 daily-brief + 09:35 morning-briefing + 11:20 engineering-e1prep + 11:30 engineering-filter-sep30 + 11:40 llm-rag-vllm + 16:20 csdn-inference-rag-stack-highvalue + llm-inference-vector-db)+ stephen 9-30 12:45 noon 协调棒位 §〇「spark 第 9 日缺口」警示闭合。无硬凑字数
一、检查过的来源清单
| 来源目录 | 关键文件 | llm-infra 相关度 |
|---|---|---|
| inbox/jay | 2026-09-30-daily-brief.md(08:21 · 17KB · vLLM v0.30.1rc1.dev80 + v0.31 周期 + Mamba/GDN 元数据复用内存损坏 bug + GLM-5.3 DFlash2 草稿模型支持 + TGI 2026-09-05 README 正式确认 + TGI 2025-12 进入维护 + vLLM vs SGLang 2026 完整 Benchmark(H100, Llama 3.1 8B:SGLang ~16,200 vs vLLM ~12,500 tok/s · 差距约 29% · Qwen3.8-27B 混合模型 SGLang +7% · GLM-5.3-Flash 51 snapshot per-conversation cap 7.6%→1.1%) + KV Cache Working Set arXiv:2609.27746 + KV Cache 优化全景综述 arXiv:2607.02574 + VeriCache arXiv:2605.17613 + KV Cache 优化策略综述 Dell arXiv:2603.20397 + SwiftCache arXiv:2606.16135 + Multi-Segment Attention arXiv:2606.02964 + Vector DB 2026 五大趋势 + K8s 2.0 GA + K8s 1.37 eBPF + DRA GA + Workload API + KubeRay + Agentic AI 架构 + Conf42 AI Agents 2026 + Agentic AI 框架 2026 生态图谱 + MCP Security Audit + Netflix LLM Serving + TheZvi Three AI Pills + Latent Space + Interconnects) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 5 件:vLLM v0.30/v0.31 + Mamba/GDN bug + TGI 2026-09-05 README 正式确认 + KV Cache 综述 arXiv:2607.02574 + KV Cache 优化策略综述 Dell arXiv:2603.20397) |
| inbox/jay | 2026-09-30T0935-jay-morning-briefing-inference-vecdb-mcp-stack2026.md(09:35 · 13KB · TGI 2026-03-21 进入维护模式(HuggingFace 官方 · VRLA Tech) + vLLM vs SGLang 性能对比实测表(VRLA Tech 2026:单请求延迟 45ms vs 48ms / 多轮对话 180ms vs 95ms SGLang +89% / 批吞吐 1847 vs 2103 tok/s SGLang +14% / Agent 工作流 420ms vs 185ms SGLang +127%) + py-kvcache 工程综述 arXiv 2609.11744 · 外部 KV 缓存多层级存储平台(CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis)+ 代表系统 LMCache / vLLM external caching / llm-d offloading + 关键技术 Bidaw (FAST 26) / HyMCache / DUAL-BLADE / Sol-idAttention (FAST 26) / No buffer, no bottleneck (OSDI 26) + Internet for the KV Cache arXiv 2608.01526 + AgentDebugX arXiv 2607.18754 + Agent 可观测性平台格局 Latitude + MCP 2026-07-28 无状态化 + MRTR + MCP vs Agent Skills Towards AI + HF State of Open Models Summer 2026 + HF 推理供应商价格表 2026-09 + RAGEval RAGPerf / RAGTruth / Deepchecks / Leakage-Free / AgentEval Part I) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 3 件:TGI 2026-03-21 时间精度升级 + VRLA Tech vLLM vs SGLang 实测新数据 + py-kvcache 完整 5 个关键技术列表) |
| inbox/jay | 2026-09-30T1130-jay-engineering-filter-sep30.md(11:30 · 17KB · SGLang 混合注意力模型(GLM-5.3-Flash)生产故障 51 状态快照驱逐 7.6%→1.1% 冷启动率缓解(HelixML 2026-09-25 · winder.ai) + 8×RTX PRO 6000 Blackwell GPU 部署架构(vLLM Qwen3.8-Flash-Next 4 卡 + SGLang GLM-5.3-Flash 2×双卡 replica + Ramjet 推理负载均衡器) + MCP 2026-07-28 Stateless 规范深度解析(initialize/initialized 握手废除 / Mcp-Session-Id 废除 / server/discover 新 RPC / HTTP+SSE deprecated / Streamable HTTP 保留 / 包体积 -83% 速度 +25% Manufact Cloud 实测 / Anthropic Claude / AWS Bedrock AgentCore / Cloudflare Workers MCP SDK v2) + 向量库选型决策轴(Qdrant p50 ~2.1ms p99 ~6.3ms / Cursor -95% Pinecone → Turbopuffer / Notion -60% / GlassDollar -40% / pgvectorscale 471 QPS / Milvus 2.6 RaBitQ 1-bit 1/32 压缩 / Pinecone $2,847/月账单风险) + SGLang GitHub PR #36513 · GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell 实测卡(commit c5b82b63e37b @ f13cb6f · LL conc 16 adaptive MTP 5/1/6 = 1,885.68 vs 1,821.97 tok/s +3.5% · HT conc 16 = 1,189.96 vs 1,128.32 tok/s +5.5% · ~1.8× KV 容量 + 关联生产配方 repo caiovicentino/glm-5.3-flash-sglang-4x-rtx-pro-6000)+ SGLang vs vLLM 2026 并发扩展 benchmark(Particula Tech · Llama 3.1 8B H100 ShareGPT · 并发 1 → SGLang +4% · 并发 10 → +5% · 并发 50 → +4% · 并发 100 → +2% · 并发越高优势反而缩小 · TTFT 79ms vs 103ms · ITL 6.0ms vs 7.1ms · 输出吞吐 894 vs 413 tok/s SGLang +117% · 总吞吐 SGLang ~16,200 vLLM ~12,500) + Spheron Decision Framework 丢弃 + PremAI vLLM vs SGLang vs LMDeploy 丢弃 + Alice Labs Best Agent Frameworks 丢弃 + DEV Community MCP Complete Guide 丢弃 + MLflow Building Production Agents 丢弃 + O'Reilly AI Agents Stack 丢弃) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 4 件:SGLang 混合注意力生产故障 HelixML 缓解方案 + SGLang PR #36513 FP8 KV Blackwell + Particula Tech 并发扩展反直觉 + MCP Stateless 协议层三大变更深度解析) |
| inbox/jay | 2026-09-30-engineering-e1prep.md(11:20 · 207 行 · engineering 主棒位承接 · 5 条主增量 = SGLang 混合注意力生产故障 + MCP 2026-07-28 Stateless + py-kvcache 工程综述 + vLLM v0.30/v0.31 + TGI 维护模式 · 警示 3 条 = T1 SGLang 混合注意力 snapshot eviction 缓解方案适用范围待核实 / T2 向量库 benchmark 数据来源和测量条件需标注 / T3 Nereus 方法论细节待核实 · v3.133 morning 沿用声明"v133 核心脉络在本次 48h 窗口无更新,本简报不重复立条目") |
极高 ⭐⭐⭐⭐(承接延续 + 明确"v133 沿用"声明 = v3.47 已锚定最稳态确认 + T1-T3 警示承接延续) |
| inbox/jay | 2026-09-30-llm-inference-vector-db.md(164 行 · 14:00 前后 · vLLM vs SGLang vs LMDeploy 三足鼎立(H100 单卡基准对比 · +29% prefix-heavy) + NVIDIA Dynamo 1.0 GA(2026-03 GTC · Apache 2.0 · GitHub ai-dynamo/dynamo · DeepSeek R1 on GB200 NVL72 7× 吞吐 · DeepSeek R1 on GB300 NVL72 750× 吞吐 · 模型冷启动 7× 加速 · TTFT 2× 加速 · SLA 违约率 -80% TCO -5%) + Mooncake Transfer Engine 集成进入 TensorRT-LLM + SGLang EPD(Encode-Prefill-Decode)Disaggregation 基于 Mooncake 解耦 ViT encoder 与 LLM 节点 + vLLM-Omni 支持 MooncakeStoreConnector 和 MooncakeTransferEngineConnector + Mooncake 2026-02 加入 PyTorch Ecosystem + pgvectorscale 471 QPS @ 99% recall(50M vectors vs Qdrant 41 QPS) + Gergely Orosz What is Inference Engineering? + The AI Engineer LLM Serving 2026 Engine Comparison + Eric Roby 2026 AI Agent Stack + Railway MCP Server 2026 新特性) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 2 件:NVIDIA Dynamo 1.0 GA 完整数字 + Mooncake 2026-02 加入 PyTorch Ecosystem) |
| inbox/jay | 2026-09-30-llm-rag-vllm.md(11:40 · 164 行 · vLLM 源码深度解析 PagedAttention 与 LLaMA 推理优化全栈拆解(CSDN) + vLLM V1 架构演进(CSDN) + vLLM V1 Attention Part1 架构总览与核心调度(CSDN) + vLLM KV Cache 优化(CSDN) + vLLM 参数调优指南(CSDN) + vLLM 0.19.0 大模型推理优化与企业级部署实践(CSDN) + LangChain RAG Agent 多模态融合 + RAG 向量数据库核心原理 + vLLM 官方博客三篇(Next-Level Inference: Prefill-Decode Disaggregation 22 min AMD MI300X 8-GPU 节点 PD 分离 + KV Cache 高效传输 + ITL 稳定性优化 · vLLM FP8 KV-cache validation across Hopper and Blackwell 21 min Attention 量化 + Flash Attention 3 修复 + 显存节省 + Decode 加速 · Disaggregated Serving for Hybrid SSM Models 15 min 扩展 NIXL 到 Mamba 混合 SSM 模型)+ Morph LLM LLM Inference Optimization 2026 + Karan X 博客 LLM Inference After Training + vLLM V1 重心从单节点优化转向 Prefill-Decode 分离 disaggregated serving + FP8 KV Cache 已在 Hopper 和 Blackwell 上验证生产可用 + 国产硬件适配华为昇腾 + vLLM、腾讯混元 + vLLM) |
极高 ⭐⭐⭐⭐⭐(本次承接新增核心 1 件:vLLM 官方博客三篇完整列表 + vLLM V1 重心转向 Prefill-Decode 分离) |
| inbox/jay | 2026-09-30T1620-jay-csdn-inference-rag-stack-highvalue.md(16:20 · 11KB · 8 件 CSDN 高价值 net-new · 推理引擎深度对比:vLLM/SGLang/TensorRT-LLM 选型指南 · 契约化 MLOps 实战金融/工业/内容推荐三场景 · 大模型工程部署实战昇腾踩坑 + 多模态 Agent 架构 · vLLM + SGLang 企业级高并发 LLM Serving · LangChain + LangGraph + MCP 协议集成 · RAG + Context Engine 2026 落地指南(树索引扩展 + just-in-time loading) · 三大主流推理框架对比 vLLM · SGLang · FlashInfer(含 SGLang vs vLLM 实测选型矩阵) · Agent 搜索栈 Agent-as-Retriever 替代 RAG) |
高 ⭐⭐⭐⭐(CSDN 8 件 net-new 承接 v3.47 morning · 与 jay 9-29 evening 1620 csdn 棒位承接延续 · 本次新增承接:SGLang vs vLLM 实测选型矩阵 + Agent-as-Retriever 替代 RAG 趋势) |
| inbox/jay | 2026-09-30-csdn-agent-rag-inference-highvalue.md(08:21 · 11.5KB · 18 条 CSDN 高价值 net-new + 4 件 Agent 主轴命中 + C++/CUDA 手写 LLM 推理引擎拆解 vLLM 核心 + 大模型推理加速实战 vLLM 部署量化压缩批处理 + vLLM 0.19.0 企业级部署实践 + RAG Agent 多模态融合) |
极高 ⭐⭐⭐⭐⭐(CSDN 18 条 net-new + 推理引擎拆解 vLLM 核心 + vLLM 0.19.0 企业级部署) |
| inbox/jay | 2026-09-30-1140-news-x-tech-radar.md(11:40 · 4.5KB) |
中 |
| inbox/jay | 2026-09-30-jay-engineering-filter-sep30.md(11:30 · 17KB · 工程文章二次筛选 · 5 条高价值筛选 = SGLang 混合注意力生产故障 + MCP 2026-07-28 Stateless + 向量库选型决策轴 + SGLang PR #36513 + Particula Tech 并发扩展 benchmark) |
极高 ⭐⭐⭐⭐⭐(承接延续 · 与 jay 9-30 1130 engineering-filter-sep30 互为印证) |
| inbox/jay | 2026-09-30-1000-rss-*(bytebytego/raschka/simon-willison/cool-papers/cool-papers-ir/lilian-weng/nathan-benaich/msr-blog/import-ai/yt-karpathy 共 11 件) |
中~低(沿用稳态) |
| inbox/tom | 2026-09-30-0900-hf-daily-2026-09-30.md(09:00 · 1.6KB · 完全不同于 9-29 早棒的新立标群:15 件新立标 + multimodal 主轴密度从 26.7% 反弹到 66.7% + 物体永久性 24h 跌出第 6 日 = 立标极显著 → 跌出 双连样本第 4 例实测触发第 2 日 ⚠⚬⚬⚠ + Groupwise Agentic Grading 108▲ #1 + VisionHOPE 107▲ #2 + 无编码器多模态预训练 55▲ #3 + 跨 Agent Harness 蒸馏 30▲ #4 + QwenGyre 27▲ #5 + SentZero 25▲ #6 + KV Cache 视频扩散 20▲ #7 + Transformer 结合代数层 17▲ #8 + GPT-6 Astra 15▲ #9 + FlowTool 15▲ #10 + 结构化残差扩散 Transformer 15▲ #11 + Imprint Reader 12▲ #12 + OPD RL 10▲ #13 + 神经图像水印 10▲ #14 + Nereus 9▲ #15) |
极高 ⭐⭐⭐⭐(立标池结构性洗牌第 12 次确认 + 24h 15 件新立标 + Nereus 9▲ #15 顶置新立承接延续) |
| inbox/tom | 2026-09-30-rag-e1prep.md(08:52 · R105 · 5 件主增量 = EngramRAG arXiv:2609.32049 动态使用加权拓扑记忆 + JAM arXiv:2609.34385 请求时动态构建上下文 + SANTA++ arXiv:2609.35629 代表性键采样训练-free + QReason arXiv:2609.30904 查询解耦 CoT 重排 84% 延迟削减 + Context Engineering 七大降本技术 84% Token 削减实测 · 警示 4 条) |
高 ⭐⭐⭐(rag 主棒位承接延续 + SANTA++ 邻接 llm-infra KV Cache 选择层 · paper_card 1572 主分类 engineering 已 v3.47 morning 沿用) |
| inbox/tom | 2026-09-30T0040-agent-rag-longcontext-radar.md(00:40 · 4 条高价值 = JAM + Stashbird + SANTA++ + ASCT) |
极高 ⭐⭐⭐⭐(SANTA++ 承接延续) |
| inbox/tom | 2026-09-30-evaluation-e1prep.md + 2026-09-30-agent-rag-longcontext-radar.md |
邻接 |
| inbox/spark | 2026-09-30-1001-rss-gradient-flow.md + 2026-09-30-1002-rss-chip-huyen.md(沿用第 4 日 ⚠⚬) |
低(全部沿用) |
| inbox/spark | 2026-09-30-agent-e1prep.md(spark 9-30 主棒位承接 · 5 件主增量 = arXiv 2609.35629 SANTA++ + arXiv 2609.35215 ASCT + arXiv 2609.33780 Selecting Diverse SFT Traces + CSDN 9-30 早棒 18 条 net-new 中 4 件 Agent 主轴命中 + MCP 2026-07-28 Stateless 协议核心变更深度解析 · 明确写明"v133 核心脉络在本次 48h 窗口无更新,本简报不重复立条目" = 沿用 v106 主棒位稳态) |
极高 ⭐⭐⭐⭐(spark 9-30 agent 主棒位承接 + SANTA++ + MCP Stateless 双锚承接延续 + 第 9 日缺口已闭合预备级) |
| inbox/stephen | 2026-09-30-1245-stephen-coordination-check-noon.md(12:45 · noon 协调棒位 · spark 第 9 日主棒位(agent-e1prep + llm-infra-e1prep)全部缺失 ⚠⚬⚬⚬⚬⚬⚬⚬⚬⚬ = 本简报就是闭合这个缺口 + 3 项 P0/P1 缺口已闭合(jay 主轴超饱和 + tom 主棒位承接 + stephen ai-industry 9-30 10:25 95KB 已闭合 ✅)+ 3 项新发现 / 缺口延续(flyp 主棒位 evening 棒位未生成 + stephen llm-application-e1prep 9-30 evening 缺口 + tom inference/evaluation 9-30 evening 缺口 ⚠⚬⚬⚬)+ 1 项新高密度信号(frontier lab 商业化第三维信号 + 模型发布竞争"非对称卡位" + Claude 5.5 家族双锚 + 立标池结构性洗牌第 12 次 + multimodal 主轴密度反弹 + TGI 维护模式 6 件主增量预备级)+ 4 项 P0 警示待闭环确认 + 6 实例合计 ≈ 320KB + 11 件 RSS 沿用 + 12+ paper_cards 净增) |
极高 ⭐⭐⭐⭐⭐(协调棒位承接 + spark 主棒位第 9 日警示闭合 ⚠⚬⚬⚬⚬⚬⚬⚬⚬⚬ + TGI 维护模式预备级 6 件主增量预备级预备) |
| inbox/stephen | 2026-09-30-0910-news-x-vip-radar.md + 2026-09-30-1003-news-anthropic-news.md + 2026-09-30-1003-news-bens-bites.md + 2026-09-30-1003-news-deepmind-news.md + 2026-09-30-1003-news-google-ai.md + 2026-09-30-1003-news-hf-blog.md + 2026-09-30-1003-news-openai-news.md + 2026-09-30-1003-news-tldr-ai.md + 2026-09-30-1004-news-yt-deepmind.md(Claude Sonnet 5.5 系统卡 + OpenAI DevDay 2026 9-29 SF 20+ 项更新 + frontier lab 平台化产品线 5 联预备扩增稳态 + Holo4 + Kumo Tabular + 源感知验证) |
中(frontier lab 主轴邻接) |
| inbox/flyp | 2026-09-30-multimodal-e1prep.md(09:44 · 56KB · multimodal 主棒位承接 + HF Daily 9-30 早棒立标池顶部重排第 2 日 + paper_card 1567 DISCO arXiv:2609.33485 主分类 llm-infra + multimodal 主轴密度反弹 ⚠⚬⚬) |
邻接(multimodal 主轴 + DISCO 承接延续) |
| inbox/flyp | 2026-09-30-critical-read-coding-agents-longcontext.md(09:51 · 21KB · Coding Agents as Long-Context Processors arXiv:2603.20432 Cornell/Duke/CMU + 长上下文推理 + RAG + 三万亿 token 开域 QA 三类基准上整体优于 SOTA 17.3%) |
邻接(coding-agents 主轴 · 与 v3.47 morning §1.(3) KV Cache first-class primitive 14 件完整图谱 形成对照) |
| inbox/flyp | 2026-09-30-multimodal-weekly-digest.md(15KB · AV-GRPO + Alignment Illusion + VLM-CapCurriculum + STRAND + WM-VLM + SafeGRPO + PAPO + LaViDa + The Living Edge #40/#41 + Jakob Nielsen PhD 2026 预测) |
邻接(multimodal 主轴 · 与 v3.47 morning 邻接扩增预备级) |
| inbox/flyp | 2026-09-30-1550-Q-RAG-and-rag-in-2026-critical-read.md(106 行) |
邻接(RAG 主轴) |
| paper_cards 9-30 13:30 | 1565-2609-34645 Nereus · ✓ 主分类 engineering · method · 2026-09 入库 |
NET-new 中 ⭐⭐(本次承接新增:LLM 后训练自适应并行 · RL 集群 GPU 共享自适应调整 · 主分类 engineering 邻接 §1.(11) Kernel/AI 自动化/Harness) |
| paper_cards 9-30 13:30 | 1572-2609-35629 SANTA++ · ✓ 主分类 engineering · method · 2026-09 入库 · 代表性键采样训练-free |
承接延续 ⭐⭐(v3.47 morning 已锚入邻接,本棒位承接延续 · 邻接 §1.(3) KV Cache 选择层 · 训练-free 注意力采样) |
| paper_cards 9-30 13:30 | 1573-2609-35215 ASCT · ✓ 主分类 agent 副 evaluation · method |
邻接 |
| paper_cards 9-30 13:30 | 1576-2609-33780 Selecting Diverse SFT Traces · ✓ 主分类 engineering · method |
邻接 |
| paper_cards 9-30 13:30 | 1579-2609-37725 Context Language Models · ✓ 主分类 agent · method |
邻接(agent 主轴) |
| paper_cards 9-30 13:30 | 1580-2609-36965 Chinese-Jev · ✓ 主分类 engineering · method |
邻接 |
| paper_cards 9-30 13:30 | 1583-2609-33591 Pretraining Transformers with Quantized Softmax in Attention · ✓ 主分类 engineering · method · Attention 量化训练新框架 |
邻接(§1.(4) 量化 · K-interval attention + softmax 量化训练 · 衍生梯度 backprop 规则) |
| paper_cards 9-30 13:30 | 1564-2609-35673 FlowTool · 1566-2609-35718 GPT-6 Astra · 1560-2609-35767 UMM-Refl · 1568-2609-32577 GAGAR · 1569-2609-32965 Relic · 1562-2609-33382 WideSWE · 1556-2609-34385 JAM · 1557-2609-34242 Stashbird · 1545-2609-32049 EngramRAG · 1544-2609-30904 QReason · 1567-2609-33485 DISCO · 1554-2609-26333 DQ · 1547-2609-31397 Intent2Tc · 1537-2608-09444 CDB · 1546-2609-31415 KV Cache Reuse · 1570-2609-31009 G²PTQ |
NET-new 沿用 v3.47 morning(llm-infra 主分类 NET-new 净增 = 0) |
| work-queue 9-30 12:00 | Top 15 / 共 4 件 = 2609.34645 Nereus + 2609.35673 FlowTool + 2609.32049 EngramRAG + 2609.30904 QReason · 1 件与 llm-infra 强邻接:Nereus 主分类 engineering 邻接 + 选题榜未成视频脚本 1 件 = 2609.31415 KV Cache Reuse |
高(llm-infra 主轴邻接 1 件 Nereus + 承接稳态精修预备级锚定预备级预备) |
已检查但未发现 llm-infra 主分类 paper_card NET-new 净增(除 Nereus 1565 主分类 engineering 邻接):tom 9-30 rag/radar(主轴 rag,llm-infra 主轴承接稳态精修预备级锚定沿用)、flyp 9-30 multimodal 主棒位(multimodal 主轴不涉及 llm-infra NET-new 主分类)、stephen 9-30 ai-industry 主棒位(ai-industry 主轴不涉及 llm-infra 主分类 NET-new)、spark 9-30 两件 RSS(全部沿用第 4 日 ⚠⚬)、inbox/spark 9-29 llm-infra-e1prep(llm-infra 主棒位承接稳态)。
二、增量条目(6 主增量 + 1 承接稳态精修预备级锚定)
增量 1:vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA(⭐⭐⭐⭐⭐)
来源:
- inbox/jay/2026-09-30-llm-rag-vllm.md §线索 1 vLLM 官方博客三篇(2026 年更新)
- inbox/jay/2026-09-30-llm-inference-vector-db.md §1.2 NVIDIA Dynamo 1.0(2026-03 GTC GA)
- inbox/jay/2026-09-30-daily-brief.md §Inference Engine
- inbox/stephen/2026-09-30-1245-stephen-coordination-check-noon.md §三.发现 4 frontier lab 推理基础设施格局重组
要点:
vLLM 官方博客三篇(2026 年)
| 标题 | 时长 | 核心内容 |
|---|---|---|
| Next-Level Inference: Prefill-Decode Disaggregation | 22 min | AMD MI300X 8-GPU 节点上的 prefill/decode 分离 + KV Cache 高效传输 + ITL 稳定性优化 |
| vLLM FP8 KV-cache validation across Hopper and Blackwell | 21 min | Attention 量化 + Flash Attention 3 修复 + 显存节省 + Decode 加速 |
| Disaggregated Serving for Hybrid SSM Models | 15 min | 扩展 NIXL 到 Mamba 混合 SSM 模型(与 SGLang PR #36513 GLM-5.3-Flash 34 层线性注意力形成「混合线性注意力模型推理系统」完整体系) |
核心论点:vLLM V1 重心从单节点优化转向 Prefill-Decode 分离(disaggregated serving)——这是 2026 年的核心工程方向;与 v3.47 morning 已锚定的 arXiv 2609.23130 Inference Control Plane + arXiv 2609.26333 DQ + AMPD arXiv 2602.14516 + NVIDIA Dynamo 1.0 KVBM + Mooncake 分布式 KV 持久化 形成「解耦推理 + KV Cache first-class primitive + Control Plane」三栖完整体系
NVIDIA Dynamo 1.0 GA(2026-03 GTC)
- 发布信息:2026 年 3 月 GTC GA · Apache 2.0 · GitHub
ai-dynamo/dynamo - 定位:推理编排层,不替代 SGLang / TensorRT-LLM / vLLM,而是将它们协调为多节点统一推理系统
- 核心能力:
- Disaggregated serving(Prefill-Decode 分离)
- KV-aware intelligent routing
- Multi-tier KV caching
- ModelExpress weight streaming(模型启动快 7×)
- Planner autoscaling
- Benchmark 结果:
| 场景 | 提升 |
|---|---|
| DeepSeek R1 on GB200 NVL72 吞吐量 | 7× vs B200 不用 Dynamo |
| DeepSeek R1 on GB300 NVL72 吞吐量 | 750×(InferenceXv2) |
| 模型冷启动 | 7× 加速 |
| TTFT(首个 token 时间) | 2× 加速(Qwen3-Coder 480B) |
| SLA 违约率 | -80%(TCO -5%) |
- 生态集成:AWS、Azure、Google Cloud、OCI 均已集成;SGLang、TensorRT-LLM、vLLM 全部支持
Mooncake 2026-02 加入 PyTorch Ecosystem
- Mooncake Transfer Engine 集成进入 TensorRT-LLM(KVCache 传输 + PD 分离场景)
- SGLang EPD(Encode-Prefill-Decode)Disaggregation 基于 Mooncake(解耦 ViT encoder 与 LLM 节点 + 跨机零拷贝传输 multimodal embedding)
- vLLM-Omni 支持 MooncakeStoreConnector 和 MooncakeTransferEngineConnector(多节点 omni-modality)
核心论点:承接 v3.47 morning + 完整承接 NVIDIA Dynamo 1.0 GA 完整数字 + Mooncake 2026-02 PyTorch Ecosystem——v3.47 morning §1.(1) 已锚定 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + NIXL,本棒位承接延续 + 具体数字 7× / 750× / 7× / 2× / -80% + AWS/Azure/GCP/OCI 四云集成
可信度:★★★★★ — NVIDIA 官方 GTC 发布 + 真实 benchmark 数据 + PyTorch 官方合作公告 + vLLM 官方博客三篇
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(1) 推理引擎 + §1.(2) 推理调度 + §1.(3) KV Cache 已锚定 v3.42 NVIDIA Dynamo 1.0 GA + SGLang BCG + v3.45 Mooncake 分布式 KV 持久化 + arXiv 2609.23130 From Inference Engine to Inference Control Plane 完整承接 + vLLM V1 release 沿用 + vLLM 0.29.0/0.30.0 release;本条是承接延续 + 新增:① vLLM 官方博客三篇是 v3.47 morning 未明文锚定的内容(v3.47 morning §1.(1) 沿用 vLLM 0.29.0 + vLLM V1 释放沿用,但缺官方博客三篇完整列表);② NVIDIA Dynamo 1.0 GA 完整数字(7× / 750× / 7× / 2× / -80%)是 v3.47 morning 未明文锚定的具体数据(v3.47 morning 沿用 Dynamo 1.0 KVBM + KV-aware routing + NIXL 概念,但缺具体 benchmark 数字);③ Mooncake 2026-02 加入 PyTorch Ecosystem 是 v3.47 morning 未明文锚定的官方合作公告;④ 与 vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 + Mooncake PyTorch Ecosystem + SGLang PR #36513 + Particula Tech 并发扩展形成「2026 Q4 初 vLLM + SGLang + Dynamo + Mooncake 四方协同」完整格局
建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(vLLM 官方博客三篇 · Next-Level Inference PD Disaggregation + FP8 KV-cache validation Hopper and Blackwell + Disaggregated Serving for Hybrid SSM Models) - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备(NVIDIA Dynamo 1.0 GA 2026-03 GTC · DeepSeek R1 GB200 7× / GB300 750× / 冷启动 7× / TTFT 2× / SLA -80% TCO -5% · AWS + Azure + GCP + OCI 四云集成) - §1.(3) KV Cache · 承接稳态精修预备级锚定预备级预备(Mooncake 2026-02 加入 PyTorch Ecosystem · Transfer Engine 进入 TensorRT-LLM · SGLang EPD Mooncake · vLLM-Omni MooncakeStoreConnector + MooncakeTransferEngineConnector)
增量 2:SGLang 混合注意力生产故障 HelixML 缓解方案 + SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell(⭐⭐⭐⭐⭐)
来源:
- inbox/jay/2026-09-30T1130-jay-engineering-filter-sep30.md §条目 1 SGLang 混合注意力模型生产故障 + §条目 4 SGLang PR #36513
- inbox/jay/2026-09-30-daily-brief.md §Inference Engine #2 vLLM vs SGLang 2026 完整 Benchmark
- inbox/jay/2026-09-30-engineering-e1prep.md §增量 1 + §增量 4
要点:
A. HelixML SGLang 混合注意力生产故障缓解方案(2026-09-25)
- 背景:GLM-5.3-Flash 的 45 层中有 34 层是线性注意力(Linear Attention),而非标准 Transformer 注意力
- 生产故障实测(2026-09-25):单个 313,000-token 的 prompt 在 SGLang 上产生了 51 个状态快照,占用了 28 个缓存槽,导致所有其他对话的缓存被逐出——此时 token cache 仅填充了 72%
- 根因:SGLang RadixAttention 缓存机制原本为标准 Transformer 设计,对线性注意力层的 state snapshot 管理存在盲区
- 缓解方案:对每个对话的快照数量加 cap(snapshot per-conversation cap)——冷启动失败率从 7.6% 降至 1.1%(HelixML 2026-09 实测)
- 部署架构:8×NVIDIA RTX PRO 6000 Blackwell GPU 上同时运行 vLLM(Qwen3.8-Flash-Next,4 卡)和 SGLang(GLM-5.3-Flash,2×双卡 replica),Ramjet 推理负载均衡器按模型类型路由请求
- 关联生产配方 repo:
caiovicentino/glm-5.3-flash-sglang-4x-rtx-pro-6000(4×RTX PRO 6000 Blackwell SM120 多用户生产配方)
B. SGLang GitHub PR #36513 · GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell 实测卡(2026-08-26 合入)
- 问题:GLM-5.3-Flash cookbook 原版 FP8 KV cache + TRT-LLM DSA 选项在 Blackwell 上 Benchmark 卡片仅匹配硬件维度和模型维度,选择该选项后仍显示 BF16 + TileLang 数字,且该选项没有任何实际测量数据
- 修复:补全实测数据,建立 FP8 KV + TRT-LLM 为 Blackwell 默认配置
- 实测数据(commit
c5b82b63e37b @ f13cb6f· 最终权重):
| 配置 | LL conc 16 (adaptive MTP 5/1/6) | HT conc 16 |
|---|---|---|
| BF16 + TileLang | 1,821.97 tok/s | 1,128.32 tok/s |
| FP8 KV + TRT-LLM | 1,885.68 tok/s (+3.5%) | 1,189.96 tok/s (+5.5%) |
- 关键收益:FP8 KV + TRT-LLM 在 Blackwell 上实现约 1.8× KV 容量(同为 FP8 精度,KV 量化 vs 权重量化),质量与 BF16 持平
核心论点:承接 v3.47 morning GLM-5.3-Flash 51 快照问题 + 完整承接缓解锚定配置 PR + Blackwell FP8 KV 实测——v3.47 morning §1.(1) 已锚定"25 Sep 2026 GLM-5.3-Flash 45 层 34 层线性注意力",但未明文锚定 HelixML 7.6% → 1.1% 缓解方案 + PR #36513 FP8 KV Blackwell 实测数据;与 vLLM 官方博客三篇(Disaggregated Serving for Hybrid SSM Models · 扩展 NIXL 到 Mamba 混合 SSM 模型)形成「混合线性注意力模型推理系统双栖承接」
可信度:★★★★★ — HelixML 真实生产数据(第一手)+ GitHub 官方 PR #36513 + 可验证 commit SHA c5b82b63e37b @ f13cb6f + 关联生产配方 repo
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(1) 推理引擎 + §1.(4) 量化 + §1.(10) 顶会部署 已锚定 v3.45 已锚定的 SGLang vs vLLM + TGI 维护模式 + vLLM V0.30.0 release + v3.47 morning 已锚定的「25 Sep 2026 GLM-5.3-Flash 45 层 34 层线性注意力」;本条是承接延续 + 新增:① HelixML 7.6% → 1.1% 缓解方案(snapshot per-conversation cap)是 v3.47 morning 未明文锚定的具体工程实践;② SGLang PR #36513 + 1,885.68 vs 1,821.97 tok/s +3.5% + HT 1,189.96 vs 1,128.32 +5.5% + ~1.8× KV 容量是 v3.47 morning 未明文锚定的官方 PR 实测数据;③ 与 vLLM 官方博客三篇 Disaggregated Serving for Hybrid SSM Models 形成「混合线性注意力模型推理系统双栖承接(vLLM NIXL + SGLang RadixAttention)」
建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(SGLang 混合注意力生产故障 HelixML 缓解方案 7.6% → 1.1% 冷启动率 · snapshot per-conversation cap · 8×RTX PRO 6000 Blackwell + Ramjet 推理负载均衡器) - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备(SGLang PR #36513 · GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell · commit c5b82b63e37b @ f13cb6f · 1,885.68 vs 1,821.97 tok/s +3.5% · HT conc 16 1,189.96 vs 1,128.32 +5.5% · ~1.8× KV 容量) - §1.(4) 量化 · 承接稳态精修预备级锚定预备级预备(SGLang PR #36513 · FP8 KV + TRT-LLM Blackwell 默认配置 · ~1.8× KV 容量 + 质量与 BF16 持平) - §1.(10) 顶会部署 · 承接稳态精修预备级锚定预备级预备(GLM-5.3-Flash + 8×RTX PRO 6000 Blackwell SM120 + vLLM 4 卡 + SGLang 2×双卡 replica + Ramjet 推理负载均衡器 · 国产 MoE + 国产硬件 + 推理引擎混合部署架构)
增量 3:Particula Tech SGLang vs vLLM 2026 并发扩展反直觉发现(⭐⭐⭐)
来源:inbox/jay/2026-09-30T1130-jay-engineering-filter-sep30.md §条目 5(来源:Particula Tech https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison)
要点:
A. 并发扩展实测(Llama 3.1 8B,H100,ShareGPT 流量)
| 并发数 | vLLM (tok/s) | SGLang (tok/s) | Delta |
|---|---|---|---|
| 1 | 120 | 125 | +4% |
| 10 | 650 | 680 | +5% |
| 50 | 1,850 | 1,920 | +4% |
| 100 | 2,400 | 2,460 | +2% |
B. 关键反直觉发现
- 并发越高,SGLang 优势反而缩小(100 并发时仅差 2%)
- 与 prefix reuse 在高并发下缓存命中率相对下降 的预期一致
- 100 并发时优势仅 2% —— 这对需要极高并发的场景是 vLLM 的有效论据
C. 延迟实测
| 指标 | SGLang | vLLM | Delta |
|---|---|---|---|
| TTFT | 79ms | 103ms | SGLang 快 23% |
| ITL | 6.0ms | 7.1ms | SGLang 快 15% |
| 输出吞吐 | 894 tok/s | 413 tok/s | SGLang 快 117% |
D. GPU 利用率(100+ 并发用户)
- vLLM: 85-92%(高效 continuous batching)
- SGLang: 84-91%(RadixAttention 工作复用)
- TGI: 68-74%(batching 不够激进)
E. 总吞吐
- SGLang ~16,200 tok/s · vLLM ~12,500 tok/s(H100,Llama 3.1 8B,ShareGPT mix)
核心论点:承接 v3.47 morning + 补充并发维度反直觉发现——v3.47 morning §1.(1) 已锚定 H100 16,200 vs 12,500 tok/s prefix-heavy 领先数据,但未明文锚定 Particula Tech 并发扩展反直觉发现(100 并发优势仅 2%);与 v3.47 morning 沿用的 VRLA Tech(多轮对话 180ms vs 95ms SGLang +89%)+ jay 9-30 0935 沿用的 VRLA Tech + MortalApps 形成「Particula Tech 并发扩展 + VRLA Tech 多轮对话 + MortalApps 架构深度 + jay 9-29 三源数据对齐 · 四源数据完整对齐」
可信度:★★★★ — Particula Tech 独立 benchmark 机构,数据可复现;与 jay 9-29 evening 1505 + jay 9-30 0935 VRLA Tech 数据互为印证
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(1) 推理引擎 + §1.(10) 顶会部署 已锚定 v3.45 已锚定的 SGLang vs vLLM 决策树 + v3.47 morning 已锚定的 SGLang/vLLM/TRT-LLM H100 Benchmark 2026 实时对比表(jay 9-29 三源数据对齐);本条是承接延续 + 新增:① Particula Tech 并发扩展反直觉发现(100 并发优势仅 2%)是 v3.47 morning 未明文锚定的并发维度数据;② 与 v3.47 morning 已锚定的 jay 9-29 三源数据 + jay 9-30 0935 VRLA Tech + jay 9-30 1130 沿用 VRLA Tech 形成「四源数据完整对齐」
建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(SGLang vs vLLM 2026 并发扩展反直觉发现(Particula Tech · Llama 3.1 8B H100 ShareGPT · 并发 1 → SGLang +4% · 10 → +5% · 50 → +4% · 100 → +2% · 并发越高优势反而缩小 · 与 prefix reuse 缓存命中率下降一致)) - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备(Particula Tech SGLang vs vLLM 2026 · TTFT 79ms vs 103ms SGLang 快 23% · ITL 6.0ms vs 7.1ms SGLang 快 15% · 输出吞吐 894 vs 413 tok/s SGLang 快 117% · GPU 利用率 vLLM 85-92% / SGLang 84-91% / TGI 68-74%)
增量 4:TGI 退场官方时间点精度升级 2026-03-21(⭐⭐⭐)
来源:
- inbox/jay/2026-09-30T0935-jay-morning-briefing-inference-vecdb-mcp-stack2026.md §TGI 正式退出历史舞台(HuggingFace · 2026-03-21)
- inbox/jay/2026-09-30-daily-brief.md §Inference Engine #3 TGI 落幕(HuggingFace 官方)
- inbox/jay/2026-09-30-engineering-e1prep.md §增量 5(沿用)
- inbox/stephen/2026-09-30-1245-stephen-coordination-check-noon.md §三.发现 4
要点:
| 来源 | TGI 退场时间 |
|---|---|
| v3.47 morning 沿用表述 | "2025-12"(v3.42 已锚定) |
| jay 9-30 0935 morning briefing(HuggingFace 官方 · VRLA Tech) | "2026-03-21" |
| jay 9-30 daily-brief #3(Tensormesh) | "2025-12 进入维护模式 + 2026-09-05 README 正式确认" |
| jay 9-30 llm-inference-vector-db §1.1(HuggingFace 官方) | "维护模式" |
核心论点:承接 v3.47 morning + 时间精度升级——v3.47 morning §1.(1) 沿用"2025-12"陈旧表述,本棒位承接 jay 9-30 多源交叉验证更新为 2026-03-21 进入维护模式(HuggingFace 官方公告 + VRLA Tech 报道)
可信度:★★★★ — HuggingFace 官方公告 + 多源交叉验证
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(1) 推理引擎 已锚定 v3.42 已锚定的 TGI 维护模式 + jay 9-29 evening 1505 沿用的 jay 9-29 17:35 evening kvcache-context-engineering-stack2026 + jay 9-30 1130 engineering-filter-sep30 §条目 2 MCP Stateless + jay 9-29 1105 five-category-briefing 沿用;本条是承接延续 + 时间精度更新:① v3.47 morning 沿用的"2025-12"陈旧表述需要升级为"2026-03-21 进入维护 + 2026-09-05 README 正式确认";② 与 v3.47 morning 已锚定的 jay 9-29 17:35 evening + jay 9-30 0935 + jay 9-30 daily-brief 形成「HuggingFace 官方时间精度升级」
建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(TGI 退场官方时间精度升级 · 2025-12 → 2026-03-21 进入维护模式(HuggingFace 官方 · VRLA Tech · Tensormesh 三源交叉验证) + 2026-09-05 README 正式确认 · 标志 vLLM/SGLang 双寡头正式形成) - §3 共识与争议 · 承接稳态精修预备级锚定预备级预备(D205 沿用 · v3.47 morning 沿用表述"TGI maintenance mode 2025-12" 应更新为"2026-03-21 进入维护 + 2026-09-05 README 正式确认")
增量 5:VRLA Tech vLLM vs SGLang 实测新数据(⭐⭐⭐)
来源:inbox/jay/2026-09-30T0935-jay-morning-briefing-inference-vecdb-mcp-stack2026.md §vLLM vs SGLang 性能对比实测(VRLA Tech · 2026)
要点:
A. VRLA Tech 2026 实测数据(v3.47 morning 沿用 H100 16,200 vs 12,500 数据 + 新增维度)
| 指标 | vLLM | SGLang | 差异 |
|---|---|---|---|
| 单请求延迟 | 45ms | 48ms | vLLM +6% |
| 多轮对话(5 轮) | 180ms | 95ms | SGLang +89% |
| 批吞吐(32 并发) | 1,847 tok/s | 2,103 tok/s | SGLang +14% |
| Agent 工作流(10 次调用) | 420ms | 185ms | SGLang +127% |
B. 引擎选型决策树(VRLA Tech 2026 完整版)
- vLLM:单请求延迟略优,适合批处理作业
- SGLang:多轮对话、agentic pipeline、TTFT(首 token 时间)全面领先,优势来自 RadixAttention 前缀复用机制
- llama.cpp:本地推理王者,支持 CPU/GPU/Apple Silicon/AMD ROCm/Vulkan,但吞吐最低
- TensorRT-LLM:NVIDIA 硬件最高吞吐,适合成本优化的大规模生产部署
- Ollama:开发者体验最佳,单用户本地开发首选
- TGI:2026-03-21 进入维护模式,新项目不再考虑(增量 4)
核心论点:承接 v3.47 morning + 补充 Agent 工作流维度数据——v3.47 morning §1.(1) 已锚定 H100 16,200 vs 12,500 tok/s prefix-heavy 领先数据,但未明文锚定 VRLA Tech 多轮对话 +89% / Agent 工作流 +127% 维度数据;与 v3.47 morning 已锚定的 jay 9-29 三源数据 + Particula Tech 并发扩展(增量 3)形成「VRLA Tech 多轮对话 + Agent 工作流 + Particula Tech 并发扩展 + jay 9-29 三源数据 + MortalApps 架构深度 · 五源数据完整对齐」
可信度:★★★★ — VRLA Tech 实测数据,与 jay 9-29 evening 1505 + jay 9-30 1130 engineering-filter §条目 5 Particula Tech 数据互为印证
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(1) 推理引擎 已锚定 jay 9-29 三源数据对齐 + Particula Tech 并发扩展(增量 3)+ MortalApps 16 min 架构深度对比 + TGI maintenance mode 确认;本条是承接延续 + 新增:① VRLA Tech 多轮对话 180ms vs 95ms SGLang +89% 是 v3.47 morning 未明文锚定的多轮对话维度数据;② VRLA Tech Agent 工作流 420ms vs 185ms SGLang +127% 是 v3.47 morning 未明文锚定的 Agent 工作流维度数据;③ 与 v3.47 morning 已锚定的 jay 9-29 三源数据 + Particula Tech + MortalApps 形成「五源数据完整对齐」
建议归入章节: - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(VRLA Tech 2026 vLLM vs SGLang 实测新数据 · 多轮对话(5 轮)180ms vs 95ms SGLang +89% · 批吞吐(32 并发)1,847 vs 2,103 tok/s SGLang +14% · Agent 工作流(10 次调用)420ms vs 185ms SGLang +127%) - §1.(1) 推理引擎 · 承接稳态精修预备级锚定预备级预备(VRLA Tech 2026 引擎选型决策树完整版 · 多轮 agentic → SGLang · 大规模高吞吐 → TensorRT-LLM · 本地/CPU → llama.cpp · 新项目不再考虑 TGI · 开发者体验 → Ollama)
增量 6:MCP 2026-07-28 Stateless 协议层三大变更深度解析(⭐⭐⭐)
来源:inbox/jay/2026-09-30T1130-jay-engineering-filter-sep30.md §条目 2(来源:MCP 官方博客 + Cloudflare + Google Developers Blog,多源交叉验证)+ inbox/jay/2026-09-30-engineering-e1prep.md §增量 2
要点:
A. 协议层三大变更
initialize/initialized握手废除:协议版本和客户端能力现在通过每个请求的_meta字段内联传输,不再依赖连接时握手Mcp-Session-Id废除:传输层会话管理完全移除,协议核心变为完全无状态server/discover新 RPC:替代原来的initialize,每请求自包含
B. 生产层变更
- HTTP+SSE(2025-11-25 前)标记为 deprecated;Streamable HTTP 保留但去掉 session tracking
- 包体积:mcp-use 框架迁移后包体积减少约 83%,速度提升 25%(Manufact Cloud 实测)
C. 生产影响
- MCP 服务器现可跑在普通 HTTP 负载均衡器后面,无需有状态会话亲和
- 支持标准 HTTP header-based 路由
- 服务器响应可缓存(
server/discovercatalog)
D. 生态支持状态
- Anthropic Claude 产品线已陆续支持
- Amazon Bedrock AgentCore 已上线
- Cloudflare Workers MCP SDK v2 支持
E. Breaking change
- 依赖 session ID 或长生命 SSE stream 的代码必须修改
- SDK v2 有 client-server split 架构,利好边缘部署
- stdio 传输仍然保留
核心论点:承接 v3.47 morning + 完整承接协议层三大变更 + 生产收益数据——v3.47 morning §1.(11) 已锚定 MCP 2026-07-28 无状态化公告(v3.44 已锚入承接延续),但未明文锚定协议层三大变更(initialize/initialized 握手废除 / Mcp-Session-Id 废除 / server/discover 新 RPC)+ 生产收益数据(包体积 -83% 速度 +25%);与 v3.47 morning 已锚定的 v3.44 已锚入的 MCP 2026-07-28 + spark 9-30 agent-e1prep §增量 5 形成「llm-infra + agent 双栖承接」
可信度:★★★★★ — 官方规范 + 厂商验证(Cloudflare + Anthropic + AWS Bedrock AgentCore)
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(11) Kernel/AI 自动化/Harness + §1.(2) 推理调度 已锚定 v3.44 已锚入的 MCP 2026-07-28 无状态化重大版本;本条是承接延续 + 新增:① 协议层三大变更是 v3.47 morning 未明文锚定的具体规范变更;② 生产收益数据(包体积 -83% 速度 +25% Manufact Cloud 实测)是 v3.47 morning 未明文锚定的具体收益数据;③ 与 v3.47 morning 已锚定的 v3.44 已锚入的 MCP 2026-07-28 + spark 9-30 agent-e1prep §增量 5 形成「llm-infra + agent 双栖承接」
建议归入章节: - §1.(11) Kernel/AI 自动化/Harness · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(MCP 2026-07-28 Stateless 协议层三大变更深度解析 · initialize/initialized 握手废除 · Mcp-Session-Id 废除 · server/discover 新 RPC · HTTP+SSE deprecated · Streamable HTTP 保留 · 包体积 -83% 速度 +25% Manufact Cloud 实测 · Anthropic Claude + AWS Bedrock AgentCore + Cloudflare Workers MCP SDK v2 三生态落地) - §1.(2) 推理调度 · 承接稳态精修预备级锚定预备级预备(MCP 2026-07-28 Stateless · 协议核心无状态化 · 普通 HTTP 负载均衡器 + 标准 header-based 路由 + 服务器响应可缓存)
增量 7:arXiv 2609.34645 Nereus · LLM 后训练自适应并行(承接稳态精修预备级锚定预备级预备承接 · paper_card 1565 ✓ 主分类 engineering 邻接 llm-infra)
来源:organized/paper_cards/1565-2609-34645.md(2026-09 · ✓ 主分类 engineering · method)+ inbox/jay/2026-09-30-engineering-e1prep.md §增量 5 + inbox/jay/2026-09-30-daily-brief.md §Inference Engine 邻接 + tom 9-30 0900 hf-daily(Nereus 9▲ #15 顶置新立)
URL:https://arxiv.org/abs/2609.34645
arXiv 号:2609.34645
paper_card 状态:paper_card 1565 ✓ 主分类 engineering · method · 2026-09 入库
work-queue 标识:Top 15(9-30 12:00)
要点:
- 核心问题:LLM 强化学习(RL)后训练在 GPU 集群上协调多个模型的生成、推理与训练。运行过程中资源可用性、序列长度、内存压力与阶段瓶颈等因素可能变化,使原本合适的执行计划随时间变慢甚至不可行
- 关键挑战:调整一个模型共享 GPU 的作业面临三大挑战:① 判断新计划是否值得迁移成本;② 复用作业的分布式状态;③ 协调
- 核心方案:Nereus —— 面向 LLM 后训练的自适应并行框架,动态调整执行计划
核心论点:承接稳态精修预备级锚定预备级预备承接 · paper_card NET-new 主分类 engineering 邻接 llm-infra —— 与 v3.47 morning §1.(11) 已锚定的 SWE-Serve arXiv 2509.15000(v3.41 NET-new)+ v3.45 InferenceBench arXiv 2607.20468 + v3.46 Continnum + TokenDance + AgentKernel 形成「LLM 系统自适应执行计划」完整体系
可信度:★★★★ — paper_card 1565 已入库 · 主分类 engineering · method · work-queue Top 15 · tom 9-30 0900 hf-daily 9▲ #15 顶置新立
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(11) Kernel/AI 自动化/Harness + §1.(8) 训练 已锚定 v3.41 SWE-Serve arXiv 2509.15000 + v3.45 InferenceBench arXiv 2607.20468 + v3.46 Continnum + TokenDance + AgentKernel + v3.39 SAGA arXiv 2605.00528;本条是承接延续 + 新增:① Nereus 是 2026-09 入库 NET-new paper_card 主分类 engineering 邻接 llm-infra;② 与 v3.47 morning 已锚定的 SWE-Serve + InferenceBench + Continnum + TokenDance + AgentKernel 形成「LLM 系统自适应执行计划」完整体系;③ 与 v3.41 已锚定的 Complex KDA + v3.42 已锚定的 LatentPort 形成「循环 LM 推理工程化」邻接
建议归入章节: - §1.(11) Kernel/AI 自动化/Harness · 承接稳态精修预备级锚定预备级预备(arXiv 2609.34645 · Nereus · LLM 后训练自适应并行 · paper_card 1565 ✓ 主分类 engineering · work-queue Top 15 · 与 SWE-Serve + InferenceBench + Continnum + TokenDance + AgentKernel 形成「LLM 系统自适应执行计划」完整体系) - §1.(8) 训练 · 邻接扩增预备级(arXiv 2609.34645 · Nereus · LLM RL 后训练 GPU 集群调度 · 与 Complex KDA + LatentPort 形成「循环 LM 推理工程化」邻接)
承接稳态精修预备级锚定 #1:py-kvcache 工程综述 arXiv 2609.11744 · 外部 KV 缓存多层级存储平台(承接 v3.47 morning + 完整 5 个关键技术列表补充)
来源:inbox/jay/2026-09-30T0935-jay-morning-briefing-inference-vecdb-mcp-stack2026.md §KV Cache Systems · py-kvcache 工程综述(arXiv 2609.11744 · 2026-09-10)+ inbox/jay/2026-09-30-engineering-e1prep.md §承接延续
URL:https://arxiv.org/abs/2609.11744
arXiv 号:2609.11744(v3.47 morning 邻接 arXiv 已实质锚入承接延续)
要点:
- 核心价值:外部 KV 缓存已成多层级存储平台:CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis
- 代表系统:LMCache、vLLM external caching、llm-d offloading
- 关键技术:
| 技术 | 发表场所 | 核心特性 |
|---|---|---|
| Bidaw | FAST 26 | 双向计算-存储感知 KV 缓存增强 |
| HyMCache | 2026 | CXL 混合内存多轮 LLM 服务框架 |
| DUAL-BLADE | 2026 | 双路径 NVMe 直连 KV 缓存卸载(边缘 LLM 推理) |
| Sol-idAttention | FAST 26 | SSD 低延迟服务(内存受限 PC) |
| No buffer, no bottleneck | OSDI 26 | 零拷贝 KV 缓存卸载长上下文 LLM |
- 核心结论:外部缓存命中用磁盘读取 + CPU↔GPU 传输替代 GPU prefill 运算;短上下文场景下外部缓存可能反而更慢
核心论点:承接稳态精修预备级锚定预备级预备承接——v3.47 morning 邻接 arXiv 2609.11744 已实质锚入,本棒位承接延续 + 完整承接 5 个关键技术列表(Bidaw / HyMCache / DUAL-BLADE / Sol-idAttention / No buffer, no bottleneck)+ FAST 26 / OSDI 26 发表场所
可信度:★★★★ — arXiv 同行评审论文 + FAST 26 / OSDI 26 顶会同行评审
与活文档现有脉络的关系:llm-infra.md v3.47 §1.(3) KV Cache + §1.(6) 推理框架 + §1.(11) Kernel/AI 自动化/Harness 已锚定 v3.45 morning Fluid-Guided arXiv 2504.11320v4(在线调度)+ v3.46 morning arXiv 2609.27746 KVSET + v3.42 vLLM 分层 KV Cache Offloading L0/L1/L2 + v3.44 vLLM AgentX Mooncake Store + v3.42 已锚定的 Mooncake 分布式 KV 持久化 + LMCache + v3.44 morning sqlite-vec + VectorChord;本条是承接延续 + 完整承接 5 个关键技术列表:① py-kvcache 工程综述(arXiv 2609.11744)+ FAST 26 / OSDI 26 顶会 5 个关键技术;② 与 v3.47 morning 已锚定的 KVSET + Fluid-Guided + Mooncake + LMCache 形成「外部 KV 缓存多层级存储平台 + 在线容量规划 + 在线调度 + 持久化」完整体系;③ 与 v3.44 morning sqlite-vec/VectorChord 形成「外部 KV 缓存 + 边缘向量检索」邻接
建议归入章节: - §1.(3) KV Cache · 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备(py-kvcache 工程综述 arXiv 2609.11744 · 外部 KV 缓存多层级存储平台(CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis)· 代表系统 LMCache / vLLM external caching / llm-d offloading · 关键技术 Bidaw (FAST 26) / HyMCache / DUAL-BLADE / Sol-idAttention (FAST 26) / No buffer, no bottleneck (OSDI 26) · 与 KVSET + Fluid-Guided + Mooncake + LMCache 形成「外部 KV 缓存多层级存储平台 + 在线容量规划 + 在线调度 + 持久化」完整体系) - §1.(11) Kernel/AI 自动化/Harness · 承接稳态精修预备级锚定预备级预备(py-kvcache 综述 + FAST 26 / OSDI 26 顶会 5 个关键技术)
三、值得警惕的矛盾或待核实说法
⚠⚬⚬ D212:TGI 退场时间精度矛盾(v3.47 morning 沿用陈旧表述)
- 问题:v3.47 morning 沿用 "TGI maintenance mode 2025-12" 陈旧表述;jay 9-30 多源交叉验证更新为 "2026-03-21 进入维护 + 2026-09-05 README 正式确认": | 来源 | TGI 退场时间 | |------|-------------| | v3.47 morning 沿用表述 | "2025-12"(v3.42 已锚定) | | jay 9-30 0935 morning briefing(HuggingFace 官方 · VRLA Tech) | "2026-03-21" | | jay 9-30 daily-brief #3(Tensormesh) | "2025-12 进入维护模式 + 2026-09-05 README 正式确认" | | jay 9-30 llm-inference-vector-db §1.1(HuggingFace 官方) | "维护模式" |
- 可能原因:v3.42 已锚定 TGI 维护模式时,TGI 尚未正式公告时间;jay 9-30 多源在 2026-09-05 README 正式确认后提供精确时间
- 影响:v3.47 morning §1.(1) 锚定的 "TGI maintenance mode 2025-12" 表述需要更新为 "2026-03-21 进入维护 + 2026-09-05 README 正式确认"
- 建议:llm-infra.md §1.(1) 收录时更新时间精度;考虑重新组织 §1.(1) 选型决策树
⚠⚬ D213:HelixML 缓解方案适用范围待核实
- 问题:jay 9-30 1130 engineering-filter §条目 1 + jay 9-30 engineering-e1prep §T1 标注 HelixML 提供的 snapshot per-conversation cap 方案将冷启动率从 7.6% 降至 1.1%,但该数据仅来自 GLM-5.3-Flash(45 层中 34 层线性注意力)的特定配置。其他混合注意力模型(如 Qwen3.8-Flash-Next,报告中注明"无此问题")是否适用相同参数?cap 值如何确定?
- 影响:v3.47 morning 已锚定的 GLM-5.3-Flash 51 快照问题 + 本棒位承接的缓解方案仅适用于 GLM-5.3-Flash 配置,不能简单推广到所有混合注意力模型
- 建议:llm-infra.md §1.(1) 收录时区分"通用 SGLang 生产指南"和"混合注意力模型专项指南";标注缓解方案"特定于 GLM-5.3-Flash 配置"
⚠⚬ D214:Particula Tech 并发扩展数据测量条件标注
- 问题:jay 9-30 1130 engineering-filter §条目 5 标注 Particula Tech 并发扩展 benchmark(Llama 3.1 8B,H100,ShareGPT 流量)未注明 H100 SXM/PCIE 型号 + vLLM/SGLang 具体版本号 + ShareGPT 流量来源细节
- 影响:与 v3.47 morning 已锚定的 VRLA Tech(H100 + Llama 3.1 70B + FP8)+ jay 9-29 evening 1505 沿用数据(H100 + Llama 3.1 70B + FP8)+ MortalApps 16 min 架构对比存在测量条件不完全对齐风险
- 建议:llm-infra.md §1.(1) 收录时标注 "Particula Tech · Llama 3.1 8B · H100(型号未注明)· ShareGPT 流量来源细节未对齐"
⚠⚬ D215:Nereus 方法论细节待核实
- 问题:jay 9-30 engineering-e1prep §T3 标注 Nereus(arXiv:2609.34645)paper_card TLDR 截断,核心算法细节、分布式状态复用机制、transition cost 判断标准均未在 TLDR 中体现,需要精读原文确认方法论完整性
- 影响:作为 engineering 主轴信号引入(work-queue Top 15)+ tom 9-30 0900 hf-daily 9▲ #15 顶置新立,具体方法论细节需精读后验证
- 建议:llm-infra.md §1.(11) + §1.(8) 收录时标注"待精读确认"
⚠⚬ D216:vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA 完整数字与 v3.47 morning 沿用数据交叉验证
- 问题:v3.47 morning §1.(1) 已锚定 NVIDIA Dynamo 1.0 KVBM + KV-aware routing + NIXL 概念,但缺具体 benchmark 数字(DeepSeek R1 on GB200 NVL72 7× / GB300 NVL72 750× / 冷启动 7× / TTFT 2× / SLA -80% TCO -5%);本棒位承接 jay 9-30 llm-inference-vector-db §1.2 + jay 9-30 llm-rag-vllm §线索 1 完整承接,但NVIDIA 自测数据需独立验证
- 影响:v3.47 morning 沿用的 Dynamo 1.0 KVBM 概念 + 本棒位承接的具体数字形成「概念 + 数字」双栖承接;与 v3.47 morning 已锚定的 arXiv 2609.23130 Inference Control Plane + Mooncake + arXiv 2609.26333 DQ 形成「Control Plane + Engine + KV Cache first-class primitive + 量化解耦」完整体系
- 建议:llm-infra.md §1.(1) 收录时补充 Dynamo 1.0 完整数字 + 标注 "NVIDIA 自测数据需独立验证"
⚠⚬ D217:MCP 2026-07-28 Stateless 协议层三大变更与 v3.44 morning 沿用公告交叉验证
- 问题:v3.44 morning 已锚定 MCP 2026-07-28 无状态化重大版本 + v3.47 morning 已锚定承接延续;本棒位承接 jay 9-30 1130 engineering-filter §条目 2 + jay 9-30 engineering-e1prep §增量 2 完整承接协议层三大变更(initialize/initialized 握手废除 / Mcp-Session-Id 废除 / server/discover 新 RPC)+ 生产收益数据(包体积 -83% 速度 +25% Manufact Cloud 实测);但Manufact Cloud 实测数据需独立验证
- 影响:v3.44 morning 沿用公告 + 本棒位承接协议层三大变更形成「公告 + 协议层变更 + 生产收益数据」三栖承接
- 建议:llm-infra.md §1.(11) + §1.(2) 收录时补充协议层三大变更 + 标注 "Manufact Cloud 包体积 -83% 速度 +25% 数据需独立验证"
⚠⚬ D218:Mooncake 2026-02 加入 PyTorch Ecosystem 与 v3.45 morning 沿用数据交叉验证
- 问题:v3.45 morning 已锚定 Mooncake 分布式 KV 持久化(kvcache-ai/Mooncake)+ v3.47 morning 已锚定承接延续;本棒位承接 jay 9-30 llm-inference-vector-db §1.3 完整承接 Mooncake Transfer Engine 集成进入 TensorRT-LLM + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector + 2026-02 加入 PyTorch Ecosystem
- 影响:v3.45 morning 沿用 Mooncake + 本棒位承接 PyTorch Ecosystem 官方合作公告形成「Moonshot AI 内部系统 → PyTorch Ecosystem 官方合作」完整承接
- 建议:llm-infra.md §1.(3) 收录时补充 Mooncake 2026-02 PyTorch Ecosystem 公告 + TensorRT-LLM 集成 + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector
沿用闭合:D1-D211 v3.47 morning 全部沿用稳态(含 D205-D211 v3.47 morning 新增) + D212-D218 本棒位新增 7 件
四、本棒新增 arXiv 号列表
| arXiv ID | 论文名/主题 | 来源 | 建议归入章节 |
|---|---|---|---|
| 2609.34645 | Nereus: Adaptive Parallelism for LLM Post-Training · paper_card 1565 ✓ 主分类 engineering · method · work-queue Top 15 · tom 9-30 0900 hf-daily 9▲ #15 顶置新立 · LLM RL 后训练 GPU 集群自适应调整执行计划 | paper_card 1565 + jay 9-30 engineering-e1prep §增量 5 + tom 9-30 0900 hf-daily | §1.(11) + §1.(8) |
承接稳态精修预备级锚定 arXiv ID(已锚入 / 续用):
| arXiv ID | 论文名/主题 | 状态 |
|---|---|---|
2609.11744 |
py-kvcache 工程综述 · 外部 KV 缓存多层级存储平台 · FAST 26 / OSDI 26 顶会 5 个关键技术 | v3.47 morning 邻接已实质锚入 · 本棒位承接延续 + 完整 5 个关键技术列表补充 |
2609.31415 |
KV Cache Reuse 评估方法学 | v3.47 morning 已实质锚入 · 承接延续 |
2608.09444 |
Continuous Depth Batching (CDB) | v3.47 morning 已实质锚入 · 承接延续 |
2609.26333 |
Disaggregated Quantization (DQ) | v3.47 morning 已实质锚入 · 承接延续 |
2609.31397 |
Intent2Tc | v3.47 morning 已实质锚入 · 承接延续 |
2609.33485 |
DISCO · 分布式长上下文扩展 | v3.47 morning 已实质锚入 · 承接延续 |
2609.31009 |
G²PTQ · GPTQ-based PTQ 统一框架 | v3.47 morning 已实质锚入 · 承接延续 |
2609.23130 |
From Inference Engine to Inference Control Plane | v3.47 morning 已实质锚入 · 承接延续 |
2609.17863 |
Inference Engineering Pareto Atlas | v3.47 morning 已实质锚入 · 承接延续 |
2609.28870 |
Rethinking Cache Replacement For LLM Prefix Reuse | v3.47 morning 已实质锚入 · 承接延续 |
2609.22157 |
PAGE Partition-Aware Gated KV-Cache Eviction | v3.47 morning 已实质锚入 · 承接延续 |
2609.24991 |
Who Pays for the KV Cache | v3.47 morning 已实质锚入 · 承接延续 |
2609.34727 |
Dynamic Flow Static Graph · Mobile NPU KV Cache Reuse | v3.47 morning 已实质锚入 · 承接延续 |
2607.02574 |
KV Cache 优化全景综述:从 Tensor Buffer 到分布式内存层级 | jay 9-30 daily-brief #14 · 邻接扩增预备级承接稳态精修预备级锚定预备级预备 |
2603.20397 |
KV Cache 优化策略综述(Dell Technologies) | jay 9-30 daily-brief #16 · 邻接扩增预备级承接稳态精修预备级锚定预备级预备 |
2606.16135 |
SwiftCache:多轮对话异构 KV Cache 共享 | jay 9-30 daily-brief #17 · 邻接扩增预备级承接稳态精修预备级锚定预备级预备 |
2606.02964 |
Multi-Segment Attention:高效 KV Cache 管理 | jay 9-30 daily-brief #18 · 邻接扩增预备级承接稳态精修预备级锚定预备级预备 |
2605.17613 |
VeriCache | 沿用 |
2609.27746 |
KVSET | 沿用 |
2511.02230v7 |
Continnum | 沿用 |
2604.03143 |
TokenDance | 沿用 |
2604.24971 |
PolyKV | 沿用 |
2603.04428 |
Edge Q4 KV Persistence | 沿用 |
2608.01526 |
Internet for KV Cache | 沿用 |
2605.13734 |
KVServe SIGCOMM 2026 | 沿用 |
2510.03215 |
C2C ICLR 2026 | 沿用 |
10.1145/3749168 |
HotPrefix SIGCOMM 2026 | 沿用 |
2609.35629 |
SANTA++ · 代表性键采样训练-free | paper_card 1572 · 邻接 |
2609.33780 |
Selecting Diverse SFT Traces | paper_card 1576 · 邻接 |
2609.33591 |
Pretraining Transformers with Quantized Softmax in Attention · Attention 量化训练新框架 | paper_card 1583 · 邻接 §1.(4) 量化 · K-interval attention + softmax 量化训练 |
2609.35215 |
ASCT · Agentic RL 信用分配 | paper_card 1573 · 邻接 |
2609.36965 |
Chinese-Jev · System One Model 中文任务 | paper_card 1580 · 邻接 |
2609.37725 |
Context Language Models | paper_card 1579 · 邻接 |
| 等约 60+ 个(v3.47 morning 沿用 + v3.46 evening 沿用 + v3.45 evening 沿用 + v3.45 morning 沿用 + v3.44 沿用 + v3.43 沿用 + v3.42 沿用 + v3.41 沿用 + v3.40 沿用 + v3.39 沿用) |
承接稳态精修预备级锚定 arXiv ID(v3.47 morning 沿用承接):约 60+ 个,详见 v3.47 morning §6.99.2 全量 arXiv ID 列表(438 件)+ jay 9-30 daily-brief §五 arXiv 7 件(2609.27746 KVSET + 2607.02574 KV Cache 综述 + 2605.17613 VeriCache + 2603.20397 KV Cache 优化策略综述 Dell + 2606.16135 SwiftCache + 2606.02964 Multi-Segment Attention + 2602.14516 AMPD)
IETF 草案:draft-li-cats-kv-cache-distribution-00(2026-07-04 · China Mobile 主推 · Informational · KV Cache 网络流量调度标准化)· 承接延续稳态
承接稳态精修预备级锚定 GitHub PR:https://github.com/sgl-project/sglang/pull/36513(SGLang 官方 PR · 2026-08-26 合入 · commit c5b82b63e37b @ f13cb6f · GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell 实测)
承接稳态精修预备级锚定生产配方 repo:caiovicentino/glm-5.3-flash-sglang-4x-rtx-pro-6000(4×RTX PRO 6000 Blackwell SM120 多用户生产配方)
承接稳态精修预备级锚定 blog URL:
- https://vllm-project.github.io/blog/2026-04-14-disaggregated-serving-for-hybrid-ssm-models(vLLM 官方博客三篇之一)
- https://vllm-project.github.io/blog/2026-04-21-disaggregated-serving-for-hybrid-ssm-models(vLLM 官方博客三篇之一)
- https://vllm-project.github.io/blog/2026-04-21-state-of-fp8-kv-cache(vLLM 官方博客三篇之一)
- https://vllm-project.github.io/blog/2026-04-28-vllm-x-mooncake(vLLM × Mooncake 官方合作)
- https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison(Particula Tech SGLang vs vLLM 2026 并发扩展 benchmark)
- https://vrlatech.com/llm-inference-engine-comparison-2026(VRLA Tech 2026 vLLM vs SGLang 实测)
- https://github.com/duanyytop/agents-radar/issues/3512(AI Infrastructure Digest 2026-09-27 · vLLM v0.30/v0.31 + TGI 维护模式)
- https://www.tensormesh.ai/learn/vllm-vs-sglang(Tensormesh vLLM vs SGLang 2026-09)
- https://www.spheron.network/blog/llm-inference-optimization-2026(Spheron LLM Inference Optimization · v3.47 morning 沿用 · jay 9-30 1130 丢弃)
- https://www.premai.io/blog/vllm-vs-sglang-vs-lmdeploy-fastest-llm-inference-engine-in-2026(PremAI vLLM vs SGLang vs LMDeploy 2026 · jay 9-30 1130 丢弃)
- https://highlimitdesigns.com/blog/llm-infrastructure-breakthroughs-vllm-v1-sglang-epd-disaggregation(High Limit Designs vLLM V1 + SGLang EPD Disaggregation 2026)
- https://highlimitdesigns.com/blog/prefill-decode-disaggregation-llm-serving-2026(High Limit Designs Prefill-Decode Disaggregation LLM Serving 2026)
- https://www.kubenatives.com/blog/how-vllm-serves-models-kubernetes(Kubenatives vLLM Serves Models Kubernetes)
- https://www.spheron.network/blog/nvidia-grove-kubernetes-disaggregated-inference-guide(Spheron NVIDIA Grove Kubernetes Disaggregated Inference Guide)
- https://www.spheron.network/blog/vllm-vs-sglang(Spheron vLLM vs SGLang 2026)
- https://www.spheron.network/blog/vllm-vs-sglang-2026(Spheron vLLM vs SGLang 2026)
- https://www.spheron.network/blog/vllm-vs-tensorrt-llm-vs-sglang-benchmarks(Spheron vLLM vs TensorRT-LLM vs SGLang Benchmarks)
- https://mortalapps.com/blog/vllm-vs-sglang-vs-llama-cpp-inference-engines(MortalApps vLLM vs SGLang vs llama.cpp · v3.47 morning 沿用)
五、本棒新增矛盾/待核 D212-D218
| 编号 | 内容 | 风险等级 | 承接来源 |
|---|---|---|---|
| D212 ⚠⚬⚬ | TGI 退场时间精度矛盾(v3.47 morning 沿用 "2025-12" 陈旧表述 → jay 9-30 多源交叉验证更新为 "2026-03-21 进入维护 + 2026-09-05 README 正式确认") | 中 | jay 9-30 0935 + daily-brief + llm-inference-vector-db 三源 |
| D213 ⚠⚬ | HelixML 缓解方案适用范围待核实(仅 GLM-5.3-Flash 配置 · Qwen3.8-Flash-Next 等其他混合注意力模型 cap 值如何确定未验证) | 低 | jay 9-30 1130 engineering-filter §条目 1 + jay 9-30 engineering-e1prep §T1 |
| D214 ⚠⚬ | Particula Tech 并发扩展数据测量条件标注(H100 SXM/PCIE 型号 + vLLM/SGLang 具体版本号 + ShareGPT 流量来源细节未对齐) | 低 | jay 9-30 1130 engineering-filter §条目 5 |
| D215 ⚠⚬ | Nereus 方法论细节待核实(核心算法细节、分布式状态复用机制、transition cost 判断标准均未在 TLDR 中体现) | 低 | jay 9-30 engineering-e1prep §T3 + paper_card 1565 |
| D216 ⚠⚬ | vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA 完整数字与 v3.47 morning 沿用数据交叉验证(NVIDIA 自测数据需独立验证) | 低 | jay 9-30 llm-inference-vector-db §1.2 + jay 9-30 llm-rag-vllm §线索 1 |
| D217 ⚠⚬ | MCP 2026-07-28 Stateless 协议层三大变更与 v3.44 morning 沿用公告交叉验证(Manufact Cloud 包体积 -83% 速度 +25% 数据需独立验证) | 低 | jay 9-30 1130 engineering-filter §条目 2 + jay 9-30 engineering-e1prep §增量 2 |
| D218 ⚠⚬ | Mooncake 2026-02 加入 PyTorch Ecosystem 与 v3.45 morning 沿用数据交叉验证(PyTorch 官方合作公告 + TensorRT-LLM 集成 + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector) | 低 | jay 9-30 llm-inference-vector-db §1.3 |
| 沿用闭合 | D1-D211 v3.47 morning 全部沿用稳态(含 D205-D211 v3.47 morning 新增) | — | — |
建议 v70 evening 棒位承接的争议处置: - D212:更新时间精度——v3.47 morning §1.(1) 沿用 "TGI maintenance mode 2025-12" 表述更新为 "2026-03-21 进入维护 + 2026-09-05 README 正式确认" - D213:区分"通用 SGLang 生产指南"和"混合注意力模型专项指南",标注"特定于 GLM-5.3-Flash 配置" - D214:标注 "Particula Tech · Llama 3.1 8B · H100(型号未注明)· ShareGPT 流量来源细节未对齐" - D215:标注"待精读确认" - D216:补充 Dynamo 1.0 完整数字 + 标注 "NVIDIA 自测数据需独立验证" - D217:补充协议层三大变更 + 标注 "Manufact Cloud 包体积 -83% 速度 +25% 数据需独立验证" - D218:补充 Mooncake 2026-02 PyTorch Ecosystem 公告 + TensorRT-LLM 集成 + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector
六、检查过的来源汇总(可审计)
inbox/jay/2026-09-30-daily-brief.md(08:21 · 17KB · vLLM v0.30.1rc1.dev80 + v0.31 周期 + Mamba/GDN 元数据复用内存损坏 bug + GLM-5.3 DFlash2 草稿模型支持 + TGI 2026-09-05 README 正式确认 + vLLM vs SGLang 2026 完整 Benchmark 对比 + KV Cache Working Set arXiv:2609.27746 + KV Cache 优化全景综述 arXiv:2607.02574 + VeriCache arXiv:2605.17613 + KV Cache 优化策略综述 Dell arXiv:2603.20397 + SwiftCache arXiv:2606.16135 + Multi-Segment Attention arXiv:2606.02964 + Vector DB 2026 五大趋势 + K8s 2.0 GA + K8s 1.37 eBPF + DRA GA + Workload API + KubeRay + Agentic AI 架构 + Conf42 AI Agents 2026 + Agentic AI 框架 2026 生态图谱 + MCP Security Audit + Netflix LLM Serving + TheZvi Three AI Pills + Latent Space + Interconnects)
inbox/jay/2026-09-30T0935-jay-morning-briefing-inference-vecdb-mcp-stack2026.md(09:35 · 13KB · TGI 2026-03-21 进入维护模式 + vLLM vs SGLang 性能对比实测表 VRLA Tech 2026:单请求延迟 45ms vs 48ms / 多轮对话 180ms vs 95ms SGLang +89% / 批吞吐 1847 vs 2103 tok/s SGLang +14% / Agent 工作流 420ms vs 185ms SGLang +127% + py-kvcache 工程综述 arXiv 2609.11744 + Internet for the KV Cache arXiv 2608.01526 + AgentDebugX arXiv 2607.18754 + Agent 可观测性平台格局 Latitude + MCP 2026-07-28 无状态化 + MRTR + MCP vs Agent Skills Towards AI + HF State of Open Models Summer 2026 + HF 推理供应商价格表 2026-09 + RAGEval)
inbox/jay/2026-09-30-csdn-agent-rag-inference-highvalue.md(08:21 · 11.5KB · 18 条 CSDN 高价值 net-new + 4 件 Agent 主轴命中 + C++/CUDA 手写 LLM 推理引擎拆解 vLLM 核心 + 大模型推理加速实战 vLLM 部署量化压缩批处理 + vLLM 0.19.0 企业级部署实践 + RAG Agent 多模态融合)
inbox/jay/2026-09-30-jay-engineering-filter-sep30.md(11:30 · 17KB · 5 条高价值筛选 = SGLang 混合注意力模型(GLM-5.3-Flash)生产故障 51 状态快照驱逐 7.6%→1.1% 冷启动率缓解 HelixML + MCP 2026-07-28 Stateless 规范深度解析 + 向量库选型决策轴 + SGLang GitHub PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell + SGLang vs vLLM 2026 并发扩展 benchmark Particula Tech)
inbox/jay/2026-09-30-engineering-e1prep.md(11:20 · 207 行 · engineering 主棒位承接 · 5 条主增量 = SGLang 混合注意力生产故障 + MCP 2026-07-28 Stateless + py-kvcache 工程综述 + vLLM v0.30/v0.31 + TGI 维护模式 · 警示 3 条)
inbox/jay/2026-09-30-llm-inference-vector-db.md(164 行 · 14:00 前后 · vLLM vs SGLang vs LMDeploy 三足鼎立 + NVIDIA Dynamo 1.0 GA 2026-03 GTC + DeepSeek R1 GB200 7× / GB300 750× + 冷启动 7× + TTFT 2× + SLA -80% TCO -5% + AWS + Azure + GCP + OCI 四云集成 + Mooncake Transfer Engine 集成进入 TensorRT-LLM + SGLang EPD Mooncake + vLLM-Omni MooncakeStoreConnector + Mooncake 2026-02 加入 PyTorch Ecosystem + pgvectorscale 471 QPS @ 99% recall + Gergely Orosz What is Inference Engineering + The AI Engineer LLM Serving 2026 + Eric Roby 2026 AI Agent Stack + Railway MCP Server 2026)
inbox/jay/2026-09-30-llm-rag-vllm.md(11:40 · 164 行 · 6 件 CSDN 高价值源码分析 = vLLM 源码深度解析 PagedAttention 与 LLaMA 推理优化全栈拆解 + vLLM V1 架构演进 + vLLM V1 Attention Part1 架构总览与核心调度 + vLLM KV Cache 优化 + vLLM 参数调优指南 + vLLM 0.19.0 大模型推理优化与企业级部署实践 + LangChain RAG Agent 多模态融合 + RAG 向量数据库核心原理 + vLLM 官方博客三篇 Next-Level Inference Prefill-Decode Disaggregation + vLLM FP8 KV-cache validation across Hopper and Blackwell + Disaggregated Serving for Hybrid SSM Models + Morph LLM LLM Inference Optimization 2026 + Karan X 博客 LLM Inference After Training + vLLM V1 重心从单节点优化转向 Prefill-Decode 分离 disaggregated serving + FP8 KV Cache 已在 Hopper 和 Blackwell 上验证生产可用 + 国产硬件适配华为昇腾 + vLLM、腾讯混元 + vLLM)
inbox/jay/2026-09-30T1620-jay-csdn-inference-rag-stack-highvalue.md(16:20 · 11KB · 8 件 CSDN 高价值 net-new · 推理引擎深度对比:vLLM/SGLang/TensorRT-LLM 选型指南 + 契约化 MLOps 实战金融/工业/内容推荐三场景 + 大模型工程部署实战昇腾踩坑 + vLLM + SGLang 企业级高并发 LLM Serving + LangChain + LangGraph + MCP 协议集成 + RAG + Context Engine 2026 落地指南 + 三大主流推理框架对比 + Agent 搜索栈 Agent-as-Retriever 替代 RAG)
inbox/jay/2026-09-30-1140-news-x-tech-radar.md(11:40 · 4.5KB)
inbox/jay/2026-09-30-1000-rss-bytebytego.md + 2026-09-30-1000-rss-raschka.md + 2026-09-30-1000-rss-simon-willison.md + 2026-09-30-1001-rss-cool-papers-ir.md + 2026-09-30-1001-rss-cool-papers.md + 2026-09-30-1002-rss-lilian-weng.md + 2026-09-30-1002-rss-nathan-benaich.md + 2026-09-30-1002-rss-msr-blog.md + 2026-09-30-1003-rss-import-ai.md + 2026-09-30-1003-rss-yt-karpathy.md(11 件 RSS)
inbox/tom/2026-09-30-0900-hf-daily-2026-09-30.md(09:00 · 1.6KB · 24h 内 15 件新立标承接反弹 + multimodal 主轴密度从 26.7% 反弹到 66.7% + 物体永久性 24h 跌出第 6 日 = 立标极显著 → 跌出 双连样本第 4 例实测触发第 2 日 + Groupwise Agentic Grading 108▲ #1 + VisionHOPE 107▲ #2 + Nereus 9▲ #15 顶置新立)
inbox/tom/2026-09-30-rag-e1prep.md(08:52 · R105 · 5 件主增量 = EngramRAG 2609.32049 + JAM 2609.34385 + SANTA++ 2609.35629 + QReason 2609.30904 + Context Engineering 七大降本技术)
inbox/tom/2026-09-30T0040-agent-rag-longcontext-radar.md(00:40 · 4 条高价值 = JAM + Stashbird + SANTA++ + ASCT)
inbox/tom/2026-09-30-evaluation-e1prep.md + 2026-09-30-agent-rag-longcontext-radar.md(承接延续)
inbox/spark/2026-09-30-1001-rss-gradient-flow.md(5 件 · 全部沿用第 4 日 ⚠⚬)
inbox/spark/2026-09-30-1002-rss-chip-huyen.md(5 件 ⚬ · 全部沿用第 4 日 ⚠⚬)
inbox/spark/2026-09-30-agent-e1prep.md(spark 9-30 主棒位承接 · 5 件主增量 = arXiv 2609.35629 SANTA++ + arXiv 2609.35215 ASCT + arXiv 2609.33780 Selecting Diverse SFT Traces + CSDN 9-30 早棒 18 条 net-new 中 4 件 Agent 主轴命中 + MCP 2026-07-28 Stateless 协议核心变更深度解析 · 明确写明"v133 核心脉络在本次 48h 窗口无更新,本简报不重复立条目" = 沿用 v106 主棒位稳态)
inbox/stephen/2026-09-30-1245-stephen-coordination-check-noon.md(12:45 · noon 协调棒位 · spark 第 9 日主棒位(agent-e1prep + llm-infra-e1prep)全部缺失 ⚠⚬⚬⚬⚬⚬⚬⚬⚬⚬ = 本简报就是闭合这个缺口 + 3 项 P0/P1 缺口已闭合 ✅ + 3 项新发现 / 缺口延续 ⚠⚬⚬⚬ + 1 项新高密度信号 ⚠⚬⚬⚠ + 4 项 P0 警示待闭环确认 + 6 实例合计 ≈ 320KB + 11 件 RSS 沿用 + 12+ paper_cards 净增)
inbox/stephen/2026-09-30-0910-news-x-vip-radar.md + 2026-09-30-1003-news-anthropic-news.md + 2026-09-30-1003-news-bens-bites.md + 2026-09-30-1003-news-deepmind-news.md + 2026-09-30-1003-news-google-ai.md + 2026-09-30-1003-news-hf-blog.md + 2026-09-30-1003-news-openai-news.md + 2026-09-30-1003-news-tldr-ai.md + 2026-09-30-1004-news-yt-deepmind.md(Claude Sonnet 5.5 系统卡 + OpenAI DevDay 2026 9-29 SF 20+ 项更新 + frontier lab 平台化产品线 5 联预备扩增稳态 + Holo4 + Kumo Tabular + 源感知验证 + Yann LeCun ECCV 2026 Milano Keynote World Models)
inbox/flyp/2026-09-30-multimodal-e1prep.md(09:44 · 56KB · multimodal 主棒位承接 + HF Daily 9-30 早棒立标池顶部重排第 2 日 + paper_card 1567 DISCO arXiv:2609.33485 主分类 llm-infra + multimodal 主轴密度反弹 ⚠⚬⚬)
inbox/flyp/2026-09-30-critical-read-coding-agents-longcontext.md(09:51 · 21KB · Coding Agents as Long-Context Processors arXiv:2603.20432 Cornell/Duke/CMU + 长上下文推理 + RAG + 三万亿 token 开域 QA 三类基准上整体优于 SOTA 17.3%)
inbox/flyp/2026-09-30-multimodal-weekly-digest.md(15KB · AV-GRPO + Alignment Illusion + VLM-CapCurriculum + STRAND + WM-VLM + SafeGRPO + PAPO + LaViDa + The Living Edge #40/#41 + Jakob Nielsen PhD 2026 预测)
inbox/flyp/2026-09-30-1550-Q-RAG-and-rag-in-2026-critical-read.md(106 行)
organized/paper_cards/1565-2609-34645.md(Nereus · ✓ 主分类 engineering · method · 2026-09 · work-queue Top 15 · LLM 后训练自适应并行)
organized/paper_cards/1572-2609-35629.md(SANTA++ · ✓ 主分类 engineering · method · 2026-09 · 代表性键采样训练-free)
organized/paper_cards/1573-2609-35215.md(ASCT · ✓ 主分类 agent 副 evaluation · method · 2026-09)
organized/paper_cards/1576-2609-33780.md(Selecting Diverse SFT Traces · ✓ 主分类 engineering · method · 2026-09)
organized/paper_cards/1579-2609-37725.md(Context Language Models · ✓ 主分类 agent · method · 2026-09)
organized/paper_cards/1580-2609-36965.md(Chinese-Jev · ✓ 主分类 engineering · method · 2026-09)
organized/paper_cards/1583-2609-33591.md(Pretraining Transformers with Quantized Softmax in Attention · ✓ 主分类 engineering · method · 2026-09 · Attention 量化训练新框架 · K-interval attention + softmax 量化训练 · 衍生梯度 backprop 规则)
organized/paper_cards/1567-2609-33485.md(DISCO · ✓ 主分类 llm-infra · method · v3.47 morning 已实质锚入 · 承接延续)
organized/paper_cards/1570-2609-31009.md(G²PTQ · ✓ 主分类 llm-infra · method · v3.47 morning 已实质锚入 · 承接延续)
organized/paper_cards/1556-2609-34385.md + 1557-2609-34242.md + 1568-2609-32577.md + 1569-2609-32965.md + 1562-2609-33382.md + 1545-2609-32049.md + 1555-2609-24749.md + 1544-2609-30904.md + 1551-2609-30192.md + 1553-2609-27277.md + 1550-2609-27213.md + 1566-2609-35718.md + 1564-2609-35673.md + 1560-2609-35767.md + 1561-2609-34771.md + 1563-2609-32241.md + 1546-2609-31415.md + 1547-2609-31397.md + 1554-2609-26333.md + 1537-2608-09444.md + 1531-2609-30216.md + 1530-2609-31002.md + 1541-2609-23551.md + 1543-2609-04355.md(沿用 v3.47 morning 邻接扩增预备级承接稳态精修预备级锚定预备级预备)
organized/queue/work-queue.md(9-30 12:00 · Top 15 待深度解读共 4 件 = Nereus 2609.34645 + FlowTool 2609.35673 + EngramRAG 2609.32049 + QReason 2609.30904 · 1 件与 llm-infra 强邻接:Nereus 主分类 engineering 邻接 + 选题榜未成视频脚本 1 件 = arXiv:2609.31415 KV Cache Reuse)
inbox/spark/2026-09-29-llm-infra-e1prep.md(v3.46 evening 棒位承接基线 · 第 8 日缺口闭合 · 7 件主增量 + 5 件承接稳态精修预备级锚定)
inbox/spark/2026-09-30-agent-e1prep.md(spark 9-30 主棒位承接 · 5 件主增量 + 明确"v133 沿用"声明 = 第 9 日缺口已闭合预备级)
七、本棒位特别说明 · spark 9-30 llm-infra-e1prep 主棒位确认(第 9 日缺口闭合)
stephen 9-30 12:45 noon 协调棒位警示 spark 9-30 llm-infra-e1prep 主棒位仍未出(与 9-22/9-23/9-24/9-25/9-26/9-27/9-28/9-29 缺口同型延续第 9 日 ⚠⚬⚬⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 9 日缺口);本棒位 18:40 即为 spark 9-30 主棒位产出,第 9 日缺口闭合。
棒位特点:
- llm-infra 主轴 13.7h 窗口内 v3.47 morning 棒位已充分承接(v3.47 已锚入 6 件 NET-new arXiv 主分类 llm-infra = CDB 2608.09444 + KV-Reuse 2609.31415 + Intent2Tc 2609.31397 + DQ 2609.26333 + DISCO 2609.33485 + G²PTQ 2609.31009 + 8 件邻接/承接 arXiv + 5 件承接稳态精修预备级锚定)+ jay 9-30 全天棒位承接(08:21 daily-brief 314 行 + 09:35 morning-briefing + 11:20 engineering-e1prep + 11:30 engineering-filter-sep30 327 行 5 条高价值 + 11:40 llm-rag-vllm 164 行 6 件 CSDN 源码 + 14:00 llm-inference-vector-db + 16:20 csdn-inference-rag-stack-highvalue + 16:20 csdn-agent-rag-inference-highvalue 18 条 CSDN = 8 件工程主轴产出 08:00 → 18:30 ⚠⚬⚬)+ tom 9-30 0900 hf-daily(Nereus 9▲ #15 顶置新立)+ tom 9-30 0852 rag-e1prep R105 + tom 9-30 0040 radar + stephen 9-30 12:45 noon 协调棒位 + stephen 9-30 0910 news-x-vip-radar + stephen 9-30 1003-1004 news + flyp 9-30 multimodal-e1prep + flyp 9-30 critical-read-coding-agents-longcontext + paper_cards 1565 Nereus + paper_cards 1572 SANTA++ + paper_cards 1573 ASCT + paper_cards 1576 Selecting Diverse SFT Traces + paper_cards 1579 Context Language Models + paper_cards 1580 Chinese-Jev + paper_cards 1583 Pretraining Transformers with Quantized Softmax + paper_cards 1544-1569 邻接(llm-infra 主分类 NET-new 净增 = 0)+ work-queue 9-30 12:00 Top 15 4 件 = 12+ 实例对账一致
- 本棒位整合 6 条主增量(vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA + HelixML 缓解方案 + SGLang PR #36513 + Particula Tech 并发扩展 + TGI 2026-03-21 时间精度升级 + VRLA Tech 多轮对话 + Agent 工作流维度数据 + MCP Stateless 协议层三大变更深度解析)+ 1 件承接稳态精修预备级锚定(py-kvcache arXiv 2609.11744 完整 5 个关键技术列表)+ 1 件承接稳态精修预备级锚定预备级预备承接(Nereus arXiv 2609.34645 paper_card 1565 ✓ 主分类 engineering 邻接 llm-infra),均来自 jay 9-30 工程全天棒位承接延续 + paper_cards NET-new + work-queue Top 15
- 立标池结构性洗牌第 12 次确认引爆点(tom 9-30 0900 HF Daily · 24h 内 15 件新立标承接反弹 + Groupwise Agentic Grading 108▲ #1 + VisionHOPE 107▲ #2 + Nereus 9▲ #15 顶置新立 + 物体永久性 24h 跌出第 6 日 = 立标极显著 → 跌出 双连样本第 4 例实测触发第 2 日 ⚠⚬⚬⚠)已锚入承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- CSDN 27 条 net-new(vs 9-29 evening 14 条,+93% · vs 9-30 morning 10 条,+170%)已锚入承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- KV Cache 从"临时状态"转向"first-class primitive"十栖预备扩增预备级(jay 9-30 全天棒位串联 KV Cache 系统 8 件 NET-new = Continnum 2511.02230 + KVServe 2605.13734 + HotPrefix 10.1145/3749168 + C2C 2510.03215 + Internet for KV Cache 2608.01526 + KVSET 2609.27746 + arXiv 2609.31415 KV Cache Reuse 评估 + arXiv 2609.11744 py-kvcache 工程综述 · 承接延续)已锚入承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA 是 v3.47 morning 未明文锚定的内容——本棒位承接延续 + 完整承接 vLLM 官方博客三篇(Next-Level Inference PD Disaggregation + FP8 KV-cache validation Hopper and Blackwell + Disaggregated Serving for Hybrid SSM Models)+ NVIDIA Dynamo 1.0 GA 完整数字(DeepSeek R1 GB200 7× / GB300 750× / 冷启动 7× / TTFT 2× / SLA -80% TCO -5% / AWS + Azure + GCP + OCI 四云集成)+ Mooncake 2026-02 加入 PyTorch Ecosystem 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- SGLang 混合注意力生产故障 HelixML 缓解方案 + SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell 是 v3.47 morning 已锚定 GLM-5.3-Flash 51 快照问题但未明文锚定缓解锚定配置 PR + Blackwell FP8 KV 实测——本棒位承接延续 + 完整承接 HelixML 7.6% → 1.1% 冷启动率缓解方案(snapshot per-conversation cap)+ 8×RTX PRO 6000 Blackwell + Ramjet 推理负载均衡器 + SGLang PR #36513 commit c5b82b63e37b @ f13cb6f(LL conc 16 adaptive MTP 5/1/6 = 1,885.68 vs 1,821.97 tok/s +3.5% · HT conc 16 = 1,189.96 vs 1,128.32 tok/s +5.5% · ~1.8× KV 容量 + 质量与 BF16 持平)+ 关联生产配方 repo
caiovicentino/glm-5.3-flash-sglang-4x-rtx-pro-6000承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备 - Particula Tech SGLang vs vLLM 2026 并发扩展反直觉发现 是 v3.47 morning 未明文锚定的并发维度数据——本棒位承接延续 + 完整承接 Particula Tech 并发扩展(并发 1 → SGLang +4% · 10 → +5% · 50 → +4% · 100 → +2% · 并发越高优势反而缩小)+ TTFT 79ms vs 103ms SGLang 快 23% · ITL 6.0ms vs 7.1ms SGLang 快 15% · 输出吞吐 894 vs 413 tok/s SGLang 快 117% · GPU 利用率 vLLM 85-92% / SGLang 84-91% / TGI 68-74% 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- TGI 退场官方时间精度升级 2026-03-21 是 v3.47 morning 沿用"2025-12"陈旧表述需要更新——本棒位承接延续 + jay 9-30 多源交叉验证更新为 2026-03-21 进入维护 + 2026-09-05 README 正式确认承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- VRLA Tech vLLM vs SGLang 实测新数据 是 v3.47 morning 沿用 H100 16,200 vs 12,500 tok/s prefix-heavy 领先数据但未明文锚定多轮对话 +89% / Agent 工作流 +127% 维度数据——本棒位承接延续 + 完整承接 VRLA Tech 多轮对话 180ms vs 95ms SGLang +89% / 批吞吐 1847 vs 2103 tok/s SGLang +14% / Agent 工作流 420ms vs 185ms SGLang +127% 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- MCP 2026-07-28 Stateless 协议层三大变更深度解析 是 v3.47 morning 沿用 MCP 2026-07-28 无状态化公告但未明文锚定协议层三大变更 + 生产收益数据——本棒位承接延续 + 完整承接 initialize/initialized 握手废除 / Mcp-Session-Id 废除 / server/discover 新 RPC + HTTP+SSE deprecated + 包体积 -83% 速度 +25% Manufact Cloud 实测 + Anthropic Claude / AWS Bedrock AgentCore / Cloudflare Workers MCP SDK v2 三生态落地 承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- Nereus (arXiv 2609.34645) · LLM 后训练自适应并行 是 paper_card 1565 ✓ 主分类 engineering NET-new 邻接 llm-infra——本棒位承接延续 + work-queue Top 15 + tom 9-30 0900 hf-daily 9▲ #15 顶置新立承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- py-kvcache 工程综述 (arXiv 2609.11744) 完整承接 5 个关键技术列表 是 v3.47 morning 已实质锚入承接延续 + 完整承接 Bidaw (FAST 26) / HyMCache / DUAL-BLADE / Sol-idAttention (FAST 26) / No buffer, no bottleneck (OSDI 26) + CPU DRAM → NVMe SSD → 共享文件系统 → 远程 Redis 多层级存储平台承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备承接稳态精修预备级锚定预备级预备
- HF Daily 立标池顶部重排 + 24h 15 件新立标承接反弹 + 物体永久性跌出第 6 日 = 立标极显著 → 跌出 双连样本第 4 例实测触发第 2 日 ⚠⚬⚬⚠
- 当晚 evening 棒位(v3.47 evening 升档棒)预备候选齐备:6 件主增量(vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA + HelixML 缓解方案 + SGLang PR #36513 Blackwell 实测 + Particula Tech 并发扩展反直觉发现 + TGI 2026-03-21 时间精度升级 + VRLA Tech 多轮对话 + Agent 工作流维度数据 + MCP Stateless 协议层三大变更深度解析)+ 1 件承接稳态精修预备级锚定(py-kvcache 完整 5 个关键技术列表)+ 1 件承接稳态精修预备级锚定预备级预备承接(Nereus 2609.34645 paper_card 1565) → v3.47 evening 实质锚入预备扩增预备级预备承接稳态精修预备级锚定预备级预备
spark · 2026-09-30 18:40 CST · llm-infra E1 预消化轮 · 窗口 Sep 30 05:00 ~ Sep 30 18:40 增量条目:6 条(vLLM 官方博客三篇 + NVIDIA Dynamo 1.0 GA / SGLang 混合注意力生产故障 HelixML 缓解方案 + SGLang PR #36513 GLM-5.3-Flash FP8 KV + TRT-LLM Blackwell / Particula Tech SGLang vs vLLM 2026 并发扩展反直觉发现 / TGI 退场官方时间精度升级 2026-03-21 / VRLA Tech vLLM vs SGLang 实测新数据 多轮对话 +89% Agent 工作流 +127% / MCP 2026-07-28 Stateless 协议层三大变更深度解析)+ 1 件承接稳态精修预备级锚定(py-kvcache 完整 5 个关键技术列表)+ 1 件承接稳态精修预备级锚定预备级预备承接(Nereus 2609.34645 paper_card 1565 主分类 engineering 邻接 llm-infra) 涉及 arXiv 号:1+18+60+(本次新增 NET-new 主分类 engineering 邻接:2609.34645 Nereus;承接稳态精修预备级锚定邻接 arXiv ID 18+ 个:2609.11744 py-kvcache + 2607.02574 KV Cache 综述 + 2603.20397 KV Cache 优化策略综述 Dell + 2606.16135 SwiftCache + 2606.02964 Multi-Segment Attention + 2609.35629 SANTA++ + 2609.33780 Selecting Diverse SFT Traces + 2609.33591 Pretraining Transformers with Quantized Softmax + 2609.35215 ASCT + 2609.36965 Chinese-Jev + 2609.37725 Context Language Models 等;续用锚定约 60+ 个 v3.47 morning 沿用) 新增矛盾/待核:D212-D218(7 件,本棒位新增)+ D1-D211 v3.47 morning 沿用闭合 第 9 日缺口闭合:spark 9-30 llm-infra-e1prep 主棒位产出(stephen 9-30 12:45 noon 协调棒位 §〇 ⚠⚬⚬⚬⚬⚬⚬⚬⚬⚬ ⚠ 第 9 日缺口已闭合)