llm-infra · E1 预消化简报(2026-07-29)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 10 棒 · 7-29 晚间活文档接力备料) 覆盖时段:2026-07-28 18:40 → 2026-07-29 18:40(约 24 小时增量) 基线:
organized/knowledge/llm-infra.mdWave3 §V 32 轮抢修完成版(2026-07-29 05:00 收官 · 11+1 维全景 + C1-C66 共 66 条共识 + D1-D32 共 32 条争议 + O1-O140 共 140 条开放问题 + T1-T27 共 27 条趋势 + 7-28 evening 本棒(spark E1 第 9 棒)7 主线增量已并入活文档) ——work-queue.md(2026-07-29 自动检测:llm-infra 已脱离 9 天未更新状态 · 待建卡 0 · 待富化 64 · llm-infra 与 evaluation 同列待富化) 覆盖来源:inbox/jay/7-28 evening → 7-29 上午/午间/下午/晚间 共 17 件(7-29 engineering-e1prep-v39 准备棒 9 件 P0/P1 + 7-29 five-category-briefing #11 Database D1-D4 + Backend B1-B2 + Cloud-Native C1 + CSDN + Reproduction + 7-29 1055 engineering-filter-rss-round v3 A 级 3 条 Lilian Weng/MSR Memora/uv 0.12.0 + 7-29 1105 five-category-briefing Backend B1-B2 Kimi K3 + Colibri + OmniRoute + FlashInfer + 7-29 1140 news-x-tech-radar + 7-29 1455 engineering-filter A 级 4 条 vLLM vs Ollama vs TensorRT-LLM + RAG 7 failure points + Addy Osmani AI-augmented + ColPali 多模态 RAG + 7-29 1505 inference-rag-agent-multimodal-stack + 7-29 1506 five-category-briefing-p2 cncf-llm-d + SGLang vs vLLM benchmark + ICML 2026 TwELL + NVIDIA Dynamo + Kthena + LogicalRAG/TechRAG/MC-Search + HF Agent 入侵 + HotInfra PIM KV + 7-29 1620 engineering-filter-rss-fresh ByteByteGo DoorDash/Instacart/Uber Eats + Raschka 控制推理强度/本地 Coding Agent + 7-29 1735 evening-hn-trending OpenAI Codex Security 496 分 + Raschka Kimi K3 Architecture 419 分 + SQLite WAL production + Hubble)+inbox/tom/7-28 evening → 7-29 共 7 件(rag-e1prep-v48 6 件 + 0900 hf-daily-2026-07-29 + 0853 rag-e1prep + 1008 yt-lex-fridman + 1008 yt-yannic-kilcher + 0840/1441 agent-rag-longcontext-radar · ⚠️ tom 7-29 仍未发布独立 inference E1 · 继 7-27/7-28 双日缺失后延续第三日低密度状态)+inbox/flyp/7-28 → 7-29 共 8 件(2250 SPA + Multimodal ASV dual critical-read + multimodal-e1prep-v34 + risk-e1prep + long-context-multimodal-rag-dual-review 0952 + multimodal-e1prep-v34 第二棒 E1 + 1000 rss-cameron-wolfe + 1005 interconnects · ⚠️ flyp 7-29 无独立 inference/llm-infra 产出 · multimodal + risk 双轨主导)+inbox/spark/7-28 evening → 7-29 上午/午间 共 6 件(1004 gradient-flow 三款前沿级模型 + 1005 chip-huyen + 1008 yt-3blue1brown + 1337 agent-e1prep-v35 接力 + 1004 RSS · 本场 llm-infra 棒 · spark E1 节奏连续 4 日回落窗口第 5 棒 · 7-29 evening 本棒 = 节奏反转第 5 棒)+inbox/stephen/7-28 evening → 7-29 上午/午间 共 14 件(0910 news-x-vip-radar Anthropic Dario 周末博客澄清 + 1006/1007 news-anthropic/deepmind/openai/tldr-ai/hf-blog 通稿 + 1025 ai-industry-e1prep-v31 准备棒 6 件 P0 立标 + 1245 coordination-check-noon 5 实例全岗饱和 + 0910/1006 news 沿用 + stephen 7-29 1245 协调棒已识别 Kimi K3 arXiv:2607.24653 立基础 · HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% = 6 实例同步承接主权开源 2.0 立标级 arXiv 编号正式披露触发)+paper_cards/近 3 天(2026-07-26~29)新卡 IDs 602-642 共 41 张,主分类 llm-infra/pure inference-systems 新增 0 张 · 副分类 llm-infra 2 张 = 620 arXiv:2607.24475 KG Historical Doc Retrieval(agentic retrieval + KG 用于档案问责) + 629 arXiv:2607.23242 IndicTalk(印度语系混合代码对话 13,28,604 语料) + 工程邻接 1 张 = 616 arXiv:2607.18314 Interactive Training 2(在线训练可审计控制平面)+ inference-efficient 邻接 4 张 = 626 arXiv:2607.24027 Sol-Attn(diffusion transformers 注意力稀疏化 video) + 628 arXiv:2607.23402 Characterizing Warp Divergence(Pascal 到 Blackwell)+ 632 arXiv:2607.23909 WorldDiT(unified diffusion VLA 4 LIBERO)+ 633 arXiv:2607.23373 UltraViT(端侧延迟优化 vision encoder)= 4 件 inference-efficient 邻接 + 0 件 pure inference-systems 新卡 结论:中密度(7 主线 + 3 旁证 + 2 警示),核心动作 = (1) Kimi K3 arXiv:2607.24653 立基础 · 首个 arXiv 编号正式披露 · HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% · 主权开源 2.0 立标级续立升级;(2) Raschka Kimi K3 Architecture Notes 419 分 HN Trending · 四大新组件完整披露(LatentMoE/NoPE/KDA/AttnRes) · NoPE everywhere 首个前沿级全 NoPE 模型;(3) FlashInfer→SGLang/vLLM 集成数据(arXiv:2606.20295v2 · inter-token latency -29-69% · long context -28-30%) · 与 PagedAttention 2.0 互补构成 KV cache 全栈体系;(4) vLLM Conference 2026 Roadmap(Ray Summit · Disaggregated serving + multi-tier KV offloading · Speculative decoding 1000+ TPS · Quantized KV cache production);(5) SGLang vs vLLM 2026 深度对比(Spheron + LeetLLM · 持平 + SGLang 结构化输出优势 + HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层);(6) CNHF llm-d CNCF Sandbox v0.7 + 16×16 B200 prefill/decode ~3.1k tok/s per B200 decode GPU · TTFT 一数量级降低 + Kthena Volcano 互补编排层;(7) Colibri 纯 C 25GB RAM 744B MoE + OmniRoute 268+ 提供商统一 API 网关 · GitHub Trending 7 月汇总边缘推理里程碑 + Agent 平台工具链成熟 + 3 旁证:Sol-Attn arXiv:2607.24027 diffusion transformers 注意力稀疏化 25▲ + arXiv:2607.24475 KG Historical Doc Retrieval agentic retrieval 问责 + arXiv:2607.23242 IndicTalk 印度语系混合代码对话 13,28,604 语料 benchmark 主分类 llm-infra 2 件 + arXiv:2607.18314 Interactive Training 2 在线训练可审计控制平面 engineering 邻接 + ICML 2026 TwELL sparse Transformer + NVIDIA Custom CUDA Kernels + Characterizing Warp Divergence + UltraViT 端侧延迟 vision encoder = 4 件 inference-efficient 邻接 + 2 警示:Tom inference E1 7-29 第三日缺失 + arXiv:2607.22529 Skill Self-Play 与 arXiv:2607.21503 Agentic Context Management HF Daily 35▲/21▲ 续立候选在 llm-infra.md §2.5 v9 沿用,但与 v33 evening 7-26 §2.5 v34 候选链路需复核
一、核心增量(7 主线 + 3 旁证 + 2 警示,按活文档归位顺序)
增量 1【推理引擎 §2.1 / 模型发布 / 量化经济学 §2.9】Kimi K3 arXiv:2607.24653 立基础 · 首个 arXiv 编号正式披露 · 263▲ 单日暴增 85%(★★ 必补)
- 来源:
inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md第 1 条 Kimi K3 263▲(https://arxiv.org/abs/2607.24653) +inbox/jay/2026-07-29-1055-jay-engineering-filter-rss-round.md(沿用) +inbox/jay/2026-07-29-1105-jay-five-category-briefing.mdBackend B2 Kimi K3 MoE +inbox/jay/2026-07-29-engineering-e1prep-v39增量 5 Kimi K3 MoE +inbox/stephen/2026-07-29-1025-ai-industry-e1prep-v31增量 1 +inbox/stephen/2026-07-29-1245-stephen-coordination-check-noon+inbox/spark/2026-07-29-1004-rss-gradient-flow.md(沿用) +inbox/spark/2026-07-29-1337-agent-e1prep.md增量 1 Kimi K3 沿用 +organized/knowledge/llm-infra.md§2.1 Kimi K3 2.8T MoE 主权开源 2.0 立标 已立标(2026-07-27 HF 1.56TB 完整开源一行)
Kimi K3 arXiv:2607.24653 完整展开: - 首个 arXiv 编号正式披露:arXiv:2607.24653(HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% · 7-28 142 → 7-29 263) - 模型规格确认: - 参数量:2.8T 总参 / 104B 激活 / 896 experts / 16 selected / 93 层(1 dense + 69 KDA + 24 Gated MLA)/ Attention Hidden 7168 / 96 heads / Latent MoE Dim 3584 / MoE Hidden per Expert 3072 / 2 shared experts - 量化:MXFP4 权重(MoE 稀疏激活定制) + MXFP8 激活(匹配权重低精度) - 上下文窗口:1M tokens(Kimi K2.6 256K → Kimi K3 1M) - HF 模型大小:约 1.56TB - 四项架构创新(沿用):KDA(Kimi Delta Attention) + AttnRes(Attention Residuals) + Stable LatentMoE + Gated MLA(24 层) - Benchmark(官方宣传,第三方核实中):General Intelligence / Coding / Agentic 三项 SOTA - 主权开源 2.0 立标级续立升级证据(7-29 vs 7-28 evening): - 6 实例同步承接升级:stephen ai-industry-v31 P0 + stephen noon 协调棒 + jay B1 + jay B2 + spark gradient-flow + spark agent-e1prep-v35 + tom rag-v48 + flyp multimodal-v34 + simon willison 7-27/28 沿用 = 12 实例 vs 7-28 evening 6 实例同步承接升级(2 倍) - 首个 arXiv 编号正式披露:从 HF 1.56TB 权重(HF 模型页面 huggingface.co/moonshotai/Kimi-K3)升级到 arXiv:2607.24653 正式论文 = 立基础触发 - HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85%:Kimi K3 立标级候选正式立基础栖候选(栖候选升档触发点) - 6 件候选新增细节(arXiv:2607.24653 论文完整披露): - 主权开源维度:首个 3T 参数级别开源模型(2.8T · DeepSeek-V4 直接竞争) - 量化路线图第 5 分叉:MXFP4 + MXFP8 作为 MoE 量化定制格式 · 内存受限部署场景 - 主权开源 vs 闭源 frontier lab 公开对峙:Anthropic Dario Amodei 7-27~28 周末博客澄清「从未、也不会主张全面禁止开源权重模型」+ Anthropic 7-29 立场文档 = frontier lab 开源权重立场 vs 监管打压指控公开对峙
-
与活文档关系:§2.1 Kimi K3 2.8T MoE 已立标(7-27 HF 1.56TB 完整开源一行)· §2.9 量化路线图 5 分叉已收 MXFP4/MXFP8 第 5 分叉;但 arXiv:2607.24653 首个 arXiv 编号正式披露 + HF Daily 7-29 263▲ 暴增 + 12 实例同步承接升级未单独作为「Kimi K3 立基础栖候选升档触发点」入位
-
建议归入:§2.1 推理引擎 6 寡头(升级现有 Kimi K3 一行,新增「arXiv:2607.24653 立基础 · 首个 arXiv 编号正式披露 · 7-28 142 → 7-29 263 单日 +121 暴增 85% · 12 实例同步承接升级主权开源 2.0 立标级 · 6 件候选新增细节」小节) + §2.9 量化经济学(沿用 MXFP4/MXFP8 第 5 分叉);新增 C71 共识候选:"主权开源 2.0 立标级续立升级 = Kimi K3 arXiv:2607.24653 立基础 · 2026-07-29 HF Daily 263▲ 单日 +121 暴增 85% · 12 实例同步承接 · Anthropic Dario 周末博客澄清 + Anthropic 7-29 立场文档 = frontier lab 开源权重立场 vs 监管打压指控公开对峙";新增 O143 试金石:"Kimi K3 arXiv:2607.24653 与 DeepSeek-V4 架构差异(MoE 设计 + 量化 + KDA 实现)对照分析;MXFP4 在 H100/H200/B200 精度损失实测;3T MoE 在 H100 8 卡/16 卡/GB200/GB300 部署 TTFT/TPOT 实测;KDA vLLM 实现 Day-N 支持时间线"
增量 2【推理引擎 §2.1 / 架构解析】Raschka Kimi K3 Architecture Notes 419 分 HN Trending · 四大新组件完整披露(★★ 必补)
- 来源:
inbox/jay/2026-07-29-1735-jay-evening-hn-trending-raschka-codex-sqlite.md第 2 条 Kimi K3 Architecture Notes(419 分)+ Raschka 官方博客https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html(2026-07-28)+inbox/jay/2026-07-29-engineering-e1prep-v39增量 5 沿用 +inbox/jay/2026-07-29-1620-jay-engineering-filter-rss-fresh.mdB1 Raschka LLM 架构最新进展(KV Sharing/mHC/压缩注意力)+organized/knowledge/llm-infra.md§2.1 Kimi K3 2.8T MoE 已立标(7-27 HF 1.56TB 完整开源一行)· 沿用 Kimi Linear 27 层 → K3 93 层
Raschka Kimi K3 Architecture Notes 完整展开:
- HN Trending 419 分:https://news.ycombinator.com/item?id=49089755 · 7-29 当日高热
- Kimi K3 定位:
- 2.8T 总参数,16/896 experts 激活(LatentMoE)
- 基于 Kimi Linear(48B → 2.8T)的规模化生产版本
- 当前最大 open-weight 模型(超过 DeepSeek-V4、Qwen 3.6 等)
- 四大新组件解析:
| 组件 | 类型 | 功能 | 工程意义 |
|---|---|---|---|
| LatentMoE | 新效率块 | 将大 dense 层压缩(down-project),类似 MLA 的压缩思路 | 在 2.8T 规模保持可服务性,核心效率创新 |
| NoPE everywhere | 位置编码替代 | 移除所有 RoPE 层(首个前沿级全 NoPE 模型) | 训练/推理简化,RoPE 在局部注意力的局限性被绕过 |
| Kimi Delta Attention(KDA) | 注意力改进 | Delta Attention 替代常规注意力 | 效率提升,与 multi-head latent attention 协同 |
| Attention Residuals | 残差改进 | 跨层残差连接,用注意力分数作为重要性权重 | 改善验证损失和下游性能;训练成本 +4%,推理成本 +2% |
- 与 Kimi Linear 的关系:
- 架构上继承自 Kimi Linear(2025),是同一设计理念的规模化版本
- 层数:Kimi Linear 27 层 → K3 93 层
- 主要差异:LatentMoE 替代部分 dense 层
- 与同期模型趋势的横向对比:
- Nemotron 3 Ultra、DeepSeek V4 都采用类似效率优化路径(MoE → LatentMoE,常规注意力 → 多头潜在注意力)
- 注意力残差(attention residuals)与 DeepSeek V4 的 mHC(manifold-constrained Hyper-Connections)功能相似但实现不同
- mHC:让残差路径更宽;Attention residuals:跨层连接用注意力分数加权
- 原生多模态支持:K3 新增原生图像/视频/音频编码器接入
-
Raschka LLM Architecture Gallery:Kimi K3 完整架构卡片含 benchmark 对比、层数、KV cache 大小、上下文长度(
https://sebastianraschka.com/llm-architecture-gallery/) -
与活文档关系:§2.1 Kimi K3 2.8T MoE 已立标(7-27 HF 1.56TB 完整开源一行);但 Raschka 419 分 HN Trending 四大新组件完整披露(LatentMoE 压缩 + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA 替代常规注意力 + Attention Residuals 跨层残差)+ Kimi Linear 27 层 → K3 93 层 + KV cache 大小 + 原生多模态编码器接入 + 与 Nemotron 3 Ultra/DeepSeek V4 横向对比 + Raschka LLM Architecture Gallery 立标级未单独作为「Kimi K3 架构细节完整性」节点入位
-
建议归入:§2.1 推理引擎 6 寡头(新增「Raschka Kimi K3 Architecture Notes 完整披露(419 分 HN Trending · LatentMoE 压缩 + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA 替代常规注意力 + Attention Residuals 跨层残差 + Kimi Linear 27 → K3 93 层 + 原生多模态 + 与 Nemotron 3 Ultra/DeepSeek V4 横向对比 · Raschka LLM Architecture Gallery 立标)」小节);新增 C72 共识候选:"Raschka Kimi K3 架构解析 = LatentMoE + NoPE everywhere + KDA + Attention Residuals 四大新组件 · 首个前沿级全 NoPE 模型 · Kimi Linear 27 → K3 93 层 · 与 Nemotron 3 Ultra/DeepSeek V4 效率优化路径趋同";新增 O144 试金石:"NoPE 替代 RoPE 在长上下文(1M)外推性能实测;Attention Residuals 训练成本 +4% 推理成本 +2% 量化收益;LatentMoE 压缩路径与 MLA 兼容性问题"
增量 3【推理引擎 §2.1 / KV cache 三层算力栈 §2.3】FlashInfer→SGLang/vLLM 集成数据(arXiv:2606.20295v2)· inter-token latency -29-69% · long context -28-30%(★ 必补)
- 来源:
inbox/jay/2026-07-29-1105-jay-five-category-briefing.mdBackend B6 arXiv:2606.20295v2 Token-Operations-Oriented Inference Optimization(⭐⭐⭐⭐)+inbox/jay/2026-07-29-engineering-e1prep-v39增量 4 FlashInfer +organized/knowledge/llm-infra.md§2.1 vLLM v0.19.0 (2026-04-03) FP8 KV validation across Hopper-Blackwell + §2.3 KV cache 14 件套 + §1.10 系统栈 + §2.11 FlashInfer-Bench + arXiv:2601.00227 + Attention Kernel Energy/Performance/Accuracy arXiv:2607.09172 + FlashAttn-3;arXiv:2606.20295v2 完整集成数据 + inter-token latency -29-69% + long context -28-30% + block-sparse + composable KV cache + JIT 模板适配 + load-balancing 调度未单独作为「FlashInfer→SGLang/vLLM 集成里程碑」入位
FlashInfer→SGLang/vLLM 集成数据完整展开: - 核心数据:FlashInfer 集成到 SGLang 和 vLLM 实现 inter-token latency 降低 29%-69%,长上下文推理延迟降低 28%-30% - 核心技术细节: - block-sparse + composable KV cache 格式:FlashInfer 设计的 KV cache 布局优化 - JIT 模板适配不同 Attention 变体:运行时编译,支持多种 attention 变体(MHA/GQA/MQA/MLA) - load-balancing 调度算法:在 attention 计算阶段动态负载均衡 - 与 PagedAttention 2.0 互补构成 KV cache 全栈体系: - PagedAttention 2.0(vLLM 引擎内 GPU 显存管理):20% → 90%+ 显存利用率 · 单卡并发 5-23× · OS 虚拟内存式 KV 分页 - FlashInfer(attention 计算本身的高效实现):inter-token latency -29-69% · long context -28-30% · block-sparse + JIT - LMCache(跨引擎 KV 缓存共享):cost -90% / speed 14× / startup 3min → 30s · crash-safe - 三者互补:PagedAttention = 显存管理 · FlashInfer = 计算引擎 · LMCache = 跨引擎共享
-
与活文档关系:§2.1 vLLM v0.19.0 已收 FP8 KV validation · §2.3 已收 14 件套 + LMCache · §1.10 已收 FlashInfer-Bench arXiv:2601.00227 + Attention Kernel arXiv:2607.09172;但 arXiv:2606.20295v2 完整集成数据(inter-token -29-69% / long context -28-30%)+ block-sparse + composable KV cache + JIT 模板 + load-balancing 调度 + 与 PagedAttention 2.0 互补关系未单独作为「FlashInfer→SGLang/vLLM 集成里程碑」入位
-
建议归入:§2.3 KV cache 三层算力栈(沿用 LMCache 一行,新增「FlashInfer arXiv:2606.20295v2 → SGLang/vLLM 集成(inter-token latency -29-69% · long context -28-30%)· block-sparse + composable KV cache + JIT 模板 + load-balancing 调度 · 与 PagedAttention 2.0(显存管理)互补构成 KV cache 全栈体系」小节);新增 C73 共识候选:"KV cache 全栈体系三件套 = PagedAttention 2.0(显存管理 · 20% → 90%+) + FlashInfer arXiv:2606.20295v2(attention 计算 · inter-token -29-69%)+ LMCache(跨引擎共享 · cost -90%)";新增 O145 试金石:"FlashInfer 在 vLLM v0.20+ 默认集成状态;JIT 模板适配 MLA/KDA 等新 attention 变体的性能;block-sparse 在 MoE 模型部署的实际收益"
增量 4【推理引擎 §2.1 / 调度 §2.2 / 选型决策树 §2.13】vLLM Conference 2026 Roadmap(Ray Summit)· Disaggregated serving + multi-tier KV offloading(★ 必补)
- 来源:
inbox/jay/2026-07-29-1105-jay-five-category-briefing.mdBackend B6 vLLM Conference 2026 Roadmap 沿用 +inbox/jay/2026-07-29-1505-jay-briefing-inference-rag-agent-mutlimodal-stack.md§1.2 vLLM Conference 2026 Roadmap + vLLM AI 官方https://vllm.ai/events/vllm-conference/2026+organized/knowledge/llm-infra.md§2.1 vLLM v0.19.0 (2026-04-03) + §2.2 调度 9 学派 + MathOpt + Disagg 5 节点 + §2.13 推理引擎可复现性危机;vLLM Conference 2026 Roadmap 4 主线(Flat Model + Model Runner V2 + disaggregated serving + multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production)未单独作为「vLLM 2026 H2 路线图」入位
vLLM Conference 2026 Roadmap 完整展开: - 重点 roadmap 内容: 1. Flat Model 和 Model Runner V2 迁移:vLLM 内部架构迁移,简化部署流程 2. Disaggregated serving + multi-tier KV offloading:PD 分离部署 + 多层 KV 卸载(GPU HBM → CXL DRAM → SSD) 3. Speculative decoding 目标:1000+ TPS:投机解码目标突破 1000 tokens/s(vLLM 0.5.x 已实现 FlashInfer kernel 融合 + EAGLE3 头预测) 4. Quantized KV cache compression(production 级):生产级量化 KV cache 压缩 - vLLM 0.5.x 已实现 FlashInfer kernel 融合,EAGLE3 头预测:为 vLLM 0.6+ roadmap 奠定基础 - 预测影响: - Disaggregated serving = 与 CNCF llm-d K8s PD 分离对齐(沿用 7-29 CNCF llm-d v0.7) - Multi-tier KV offloading = 与 LMCache(跨引擎) + HyMCache(CXL 三层)对齐 - Speculative decoding 1000+ TPS = 与 arXiv:2607.24027 Sol-Attn 注意力稀疏化 + EAGLE-3 投机解码对齐 - Quantized KV cache production = 与 TurboQuant 6× + MXFP4/MXFP8 第 5 量化分叉对齐
-
与活文档关系:§2.1 vLLM 已收 v0.19.0 + V1 connector + MRV2 + Hybrid SSM disagg;§2.2 调度 9 学派 + Disagg 5 节点已收;HaoaiLab DistServe 18 个月复盘 + Nexus intra-GPU 主动分离 + PPD Append-Prefill + SPAD + Rubin CPX + Fluid-Guided WAIT;但 vLLM Conference 2026 官方 roadmap(Flat Model + Model Runner V2 + disaggregated serving + multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production)未单独作为「vLLM 2026 H2 路线图」入位
-
建议归入:§2.1 vLLM(新增「vLLM Conference 2026 Roadmap(Ray Summit · Flat Model + Model Runner V2 + disaggregated serving + multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production)」小节)+ §2.2 调度(沿用 Disagg 5 节点 + vLLM roadmap disaggregated serving 验证);新增 C74 共识候选:"vLLM 2026 H2 路线图 = Disaggregated serving + Multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production · 与 CNCF llm-d K8s PD 分离 + LMCache/HyMCache 多层 KV + TurboQuant/MXFP4 量化路线图形成完整对齐";新增 O146 试金石:"vLLM 0.6+ 实际发布时间线;Speculative decoding 1000+ TPS 实测对照 EAGLE-3 / Medusa / Self-Speculative;Multi-tier KV offloading 在 H100 8 卡 / GB200 实际吞吐"
增量 5【推理引擎 §2.1 / 选型决策树 §2.13 / Cloud-Native §2.6】SGLang vs vLLM 2026 深度对比 + NVIDIA Dynamo 跨节点编排层 + HF TGI 维护模式(★ 必补)
- 来源:
inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.mdBackend B1 SGLang vs vLLM 2026 深度对比(Spheron + LeetLLM · ⭐⭐⭐⭐)+inbox/jay/2026-07-29-1105-jay-five-category-briefing.mdBackend B4 tekBlueprint Production LLM Inference Frameworks 对比 +inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.mdBackend B2 ICML 2026 TwELL + Backend B3 NVIDIA Dynamo +inbox/jay/2026-07-29-1455-jay-engineering-filter.mdA1 vLLM vs Ollama vs TensorRT-LLM 推理基准对比 +organized/knowledge/llm-infra.md§2.1 推理引擎 6 寡头 + §2.13 推理引擎可复现性危机(含 Turion.ai 7-27 evening 已立)均收 SGLang/vLLM 一行
SGLang vs vLLM 2026 深度对比完整展开: - Benchmark 数据(L40,不同并发):
| 并发数 | vLLM tok/s | SGLang tok/s | 差距 |
|---|---|---|---|
| 1 | 312 | 318 | SGLang +2% |
| 10 | 890 | 902 | SGLang +1% |
| 50 | 1,850 | 1,920 | SGLang +4% |
| 100 | 2,010 | 2,050 | SGLang +2% |
- 关键结论:
- 无前缀复用时两者性能基本持平,差异在 run-to-run 波动范围内
- SGLang 在结构化输出/函数调用场景有优势:grammar-cache 行为更激进,重复 schema 场景编译 grammar automaton 复用更好
- SGLang 默认 RadixAttention 做 prefix caching;vLLM 默认 xgrammar 做 guided decoding(2026)
- Fish Audio 实测:SGLang 比 vLLM 吞吐快 16%,p99 TTFT 13.1ms vs 23.6ms
- 2026 引擎格局变化:
- HuggingFace TGI 已进入维护模式(接受 minor bug fix,不再推荐新部署)
- HF 官方推荐迁移目标:vLLM / SGLang / llama.cpp / MLX(Apple)
- TensorRT-LLM 高并发场景(100+ 并发)优势扩大,但配置复杂度高
- Nvidia Dynamo:跨节点协调层(非单节点引擎),可调度 TensorRT-LLM / vLLM / SGLang
- 选型建议:
- 面向客户的生产 chat API → SGLang(结构化输出 + prefix caching 优势)
- 内部批推理 pipeline → vLLM(生态成熟,bug 少,社区活跃)
- 极致单节点吞吐(H100+) → TensorRT-LLM
Ollama vs vLLM(单流 vs 高并发): - 单流:Ollama Q4_K_M Llama 3.1 8B ≈ 62 tok/s · vLLM FP16 ≈ 71 tok/s · vLLM AWQ ≈ 68 tok/s - 50 并发:vLLM ≈ 6× Ollama · vLLM p99 < 3s vs Ollama p99 = 24.7s - Ollama 适用:开发/边缘/CPU 资源受限 - vLLM 适用:5+ 并发生产 API
TensorRT-LLM H100 FP8 实测: - 峰值 > 10,000 output tokens/s - TTFT sub-100ms - 生产部署 vs PyTorch 原生 ≈ 4× 提升 - 适用:H100+ 极致吞吐
ICML 2026 TwELL(Tile-wise ELLPACK): - NVIDIA ICML 2026 论文(来源:Modular AI LinkedIn 公告) - 问题:传统稀疏格式引入不规则内存访问,开销抵消了 GEMM 的理论节省 - TwELL 解决方案:新稀疏打包格式,直接集成进优化的 tiled matmul kernel - 自定义 CUDA kernels:融合多个稀疏 matmul,最大化吞吐 - 意义:稀疏化是 2026 重要方向(MoE + sparse attention 组合),需要硬件级 kernel 支持才能落地
NVIDIA Dynamo 跨节点编排层: - 不是单节点推理引擎,而是多节点推理编排层 - 调度 TensorRT-LLM、vLLM、SGLang 跨节点协作 - 支持 PD disaggregation(prefill/decode 分离) - 目标场景:超大规模多节点推理集群 - 2026 市场格局:vLLM/SGLang 双寡头 + TensorRT-LLM 高端 + llama.cpp 轻量 三级格局,Dynamo 在编排层统一
-
与活文档关系:§2.1 推理引擎 6 寡头已收 vLLM/SGLang/TRT-LLM/Ollama/Colibri/LMDeploy 六框架 + §2.13 推理引擎可复现性危机;但 SGLang vs vLLM 2026 深度对比(L40 1-100 并发数据 + 结构化输出优势 + Fish Audio 16% 吞吐)+ HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层 + ICML 2026 TwELL 稀疏打包格式未单独作为「推理引擎选型决策树 v3.0」入位
-
建议归入:§2.1 推理引擎 6 寡头(新增「SGLang vs vLLM 2026 深度对比(L40 1-100 并发持平 + 结构化输出优势 + Fish Audio 16%) + HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层 + ICML 2026 TwELL 稀疏」小节)+ §2.13 推理引擎可复现性危机(沿用 + 强化 NVIDIA Dynamo 编排层 + TGI 迁移指南);新增 C75 共识候选:"2026 H2 推理引擎 6 寡头收敛 = vLLM(生态成熟)/ SGLang(结构化输出 + RadixAttention) / TRT-LLM(H100 极致)/ Ollama(边缘)/ Colibri(纯 C 25GB 744B)/ LMDeploy(极致低延迟)+ HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层统一 · SGLang vs vLLM 性能持平 + 结构化输出/函数调用 SGLang 优势";新增 O147 试金石:"NVIDIA Dynamo 在 100+ 节点规模的实际调度延迟;ICML 2026 TwELL 在 MoE sparse attention 模型的 kernel-level 收益量化;vLLM vs SGLang 在 1M context 长上下文实测差异"
增量 6【Cloud-Native §2.6 / 推理调度 §2.2】CNCF llm-d v0.7 + Kthena Volcano 互补编排层 + B200 wide-EP 3.1k tok/s per GPU(★ 必补)
- 来源:
inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.mdCloud-Native C1 CNCF llm-d + C2 Kthena(⭐⭐⭐⭐⭐ CNCF Sandbox + Linux Foundation)+inbox/jay/2026-07-29-1105-jay-five-category-briefing.mdCloud-Native C1(沿用)+organized/knowledge/llm-infra.md§2.6 Cloud-Native 部分(vLLM K8s OOM runbook 7-26 已立)· §2.2 调度 9 学派 + Disagg 5 节点;CNCF llm-d 2026-03-24 捐赠 + v0.7 May 2026 + v0.5 Feb 2026 + B200 wide-EP 实测数据 + Kthena Volcano 互补编排层未单独作为「K8s 推理部署事实标准方向盘」入位
CNCF llm-d v0.7 完整展开: - 2026-03-24:llm-d 正式捐赠给 CNCF 并进入 Sandbox 阶段(Backed by IBM/Red Hat/Google/CoreWeave/NVIDIA) - 核心架构:分离 prefill 和 decode 阶段到独立 GPU 池 - 路由:使用 Kubernetes Gateway API Inference Extension 做 cache-aware 请求路由 - v0.7(May 2026)新特性: - 优化 baseline 重命名并稳定化 - kustomize-first 迁移指南 - 扩展夜间 CI(OpenShift/GKE/CoreWeave) - predicted-latency 调度 GA - batch gateway(实验性) - 全面文档重构 - v0.5(Feb 2026)新增: - 可重现 benchmark 工作流 - 分层 KV offloading - cache-aware LoRA 路由 - active-active HA - UCCL 传输弹性 - scale-to-zero 自动扩缩容 - 验证数据: - ~3.1k tok/s per B200 decode GPU(wide-EP) - 16×16 B200 prefill/decode 拓扑下达 50k output tok/s - TTFT 比 round-robin 基线降低一个数量级 - CNCF 博客(July 16, 2026):发布 K8s 内自托管 vLLM 完整指南(PVC + Secret + Deployment + Service),来源为 LINBIT(DRBD/Heketi 存储团队)
Kthena Volcano 互补编排层: - Linux Foundation 旗下项目 - 定位:与 llm-d 互补,不替换 vLLM/SGLang,而在其上增加智能编排层 - 核心组件: - ModelServing → ServingGroup → Role 分层架构 - 拓扑感知调度(GPU 拓扑-aware) - KV Cache-aware 路由 - PD disaggregation(Prefill-Decode 分离) - 与 llm-d 区别: - llm-d:底层引擎抽象 + disaggregation - Kthena:上层编排调度 + 拓扑感知
-
与活文档关系:§2.6 Cloud-Native 已收 vLLM K8s OOM runbook 7-26 evening 已立 · §2.2 调度 9 学派 + Disagg 5 节点已收;但 CNCF llm-d 2026-03-24 捐赠 + v0.7 May 2026 + v0.5 Feb 2026 完整特性清单 + B200 wide-EP 3.1k tok/s per GPU 验证数据 + Kthena Volcano 互补编排层未单独作为「K8s 推理部署事实标准方向盘」入位
-
建议归入:§2.6 Cloud-Native(沿用 vLLM K8s OOM runbook + 新增「CNCF llm-d v0.7 + Kthena Volcano 互补编排层(2026-03-24 捐赠 + IBM/Red Hat/Google/CoreWeave/NVIDIA 支持 + B200 wide-EP 3.1k tok/s per GPU + 16×16 B200 prefill/decode 50k output tok/s + TTFT 一数量级降低)」小节) + §2.2 调度(沿用 Disagg 5 节点 + 新增 CNCF llm-d K8s 标准化 PD 分离);新增 C76 共识候选:"CNCF llm-d v0.7 = K8s 推理部署事实标准方向盘(2026-03-24 Sandbox + B200 wide-EP 3.1k tok/s/GPU + 16×16 B200 50k output tok/s + TTFT -10×) + Kthena Volcano 互补编排层(拓扑感知 + KV-cache 路由 + PD 分离)";新增 O148 试金石:"CNCF llm-d v1.0 GA 时间线;Kthena 在 1000+ GPU 大集群的拓扑感知延迟;CNCF llm-d 与 Modular MAX(vLLM 商业化)+ RadixArk(SGLang 商业化)的标准收敛"
增量 7【边缘推理 §2.1 / Agent 平台工具链 §1.13】JustVugg/colibri 14.7k★ + OmniRoute 268+ 提供商统一 API 网关(★ 必补)
- 来源:
inbox/jay/2026-07-29-1105-jay-five-category-briefing.mdBackend B1 JustVugg/colibri GitHub 14.7k⭐ + Backend B3 OmniRoute(341⭐)+inbox/jay/2026-07-29-1455-jay-engineering-filter.mdA1 Ollama 边缘对比 +inbox/jay/2026-07-29-1140-news-x-tech-radar.md(沿用)+organized/knowledge/llm-infra.md§2.1 推理引擎 6 寡头已收 Colibri / Ollama / LMDeploy / llama.cpp;Colibri 14.7k★ 边缘推理里程碑 + OmniRoute 268+ 提供商 + 50+ 免费 + MCP/A2A 协议 + RTK+Caveman 压缩 15-95% token 节省未单独作为「Agent 平台工具链成熟」入位
Colibri 纯 C 25GB RAM 744B MoE 完整展开:
- GitHub 14.7k⭐:https://github.com/JustVugg/colibri · 7-29 GitHub Trending 7 月汇总
- 核心技术:磁盘按需流式加载 MoE experts,实现极致内存压缩;零外部依赖
- 意义:边缘推理工程化里程碑;消费级硬件即可运行前沿规模模型
- 适合场景:嵌入式、边缘部署、无云端的本地 LLM 推理
OmniRoute 268+ 提供商统一 API 网关完整展开: - GitHub 341⭐(Trending):单端点接入 268+ 提供商(50+ 免费) - 核心功能: - Quota-aware 自动 fallback:跨提供商配额感知自动降级 - RTK + Caveman 压缩节省 15-95% token:提示词压缩 - MCP / A2A 协议支持 - 桌面端 + PWA - MIT 许可 - 工程价值:多模型路由成熟方案,适合 Agent 平台构建者
与 Ollama 关系: - Ollama 适合开发/边缘/CPU - Colibri 适合 25GB RAM 极致内存压缩 + 744B MoE - OmniRoute 适合多模型路由统一 API
-
与活文档关系:§2.1 推理引擎 6 寡头已收 Colibri + Ollama + LMDeploy + llama.cpp;§1.13 Agent 平台工具链已收 LiteLLM + MCP 2026-07-28 RC 6 件;但 Colibri 14.7k★ + OmniRoute 268+ 提供商 + Quota-aware fallback + RTK+Caveman 压缩 15-95% token 未单独作为「边缘推理里程碑 + Agent 平台工具链成熟」入位
-
建议归入:§2.1 推理引擎 6 寡头(沿用 Colibri 一行 + 新增「JustVugg/colibri 14.7k★ GitHub Trending 边缘推理里程碑 + OmniRoute 268+ 提供商统一 API 网关(Quota-aware fallback + RTK+Caveman 15-95% token 压缩 + MCP/A2A 协议 + MIT)」小节) + §1.13 Agent 平台工具链(沿用 LiteLLM + 新增 OmniRoute);新增 C77 共识候选:"边缘推理成熟 = Colibri 14.7k★(纯 C 25GB RAM 744B MoE 磁盘流式加载)+ Ollama(开发边缘) + Agent 平台路由成熟 = OmniRoute 268+ 提供商(Quota-aware fallback + RTK+Caveman 15-95% token 压缩 + MCP/A2A)";新增 O149 试金石:"Colibri 纯 C 实现与 llama.cpp GGUF 性能对照;OmniRoute Quota-aware fallback 在生产环境的实际可用性;RTK+Caveman 压缩对推理质量影响量化"
二、旁证(3 条)
旁证 1【稀疏注意力 §2.5 / 视频生成推理】Sol-Attn arXiv:2607.24027 diffusion transformers 注意力稀疏化(★★★)
- 来源:
inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md第 11 条 Sol-Attn 25▲ 新立(https://arxiv.org/abs/2607.24027)+organized/knowledge/llm-infra.md§2.5 稀疏注意力 7+3+1 + Hierarchical Landmark + Linear Attention + Mamba-3 + Hybrid SSM - 核心贡献:
- 问题:Diffusion transformers 高保真视频生成,长 token 序列使 attention 成为推理瓶颈
- 方案:Training-free 动态稀疏 attention,仅计算选定的 key-value blocks
- 两个挑战:
- (1) Rigid, unpredictable, costly routing:固定 top-ranked blocks proxy score 强制固定预算;按累计 proxy 概率质量动态但不平衡
- (2) Sol-Attn 解决方案
- 意义:video diffusion 模型推理加速 · 与 NSA/HCA/CSA 7 路线 + Hierarchical Landmark 第 7 路线 90%@64× + Simplified Sparse Attention arXiv:2604.20920 Gist Token 32× 互补
- HF Daily 25▲ = 新立标候选 4/5 · inference-efficient 七联之一
- 建议归入:§2.5 稀疏注意力(新增「Sol-Attn arXiv:2607.24027 diffusion transformers 注意力稀疏化 25▲ 新立标候选 · training-free dynamic sparse attention + 视频生成推理加速」小节);新增 C78 共识候选:"稀疏注意力 = NSA/HCA/CSA + Hierarchical Landmark + Linear Attention Survey + Simplified Sparse Attention + Mamba-3 + Hybrid SSM + Sol-Attn 视频生成推理 · 2026 H2 视频 LLM 推理瓶颈突破"
旁证 2【推理数据集 / 检索基础】arXiv:2607.24475 KG Historical Doc Retrieval(llm-infra 主分类)+ arXiv:2607.23242 IndicTalk(llm-infra 主分类 benchmark)(★★)
- 来源:
paper_cards/620-2607-24475.mdRobust Interpretation of Historical Documents in Knowledge Graphs Through Query Inference and Execution(主分类 llm-infra · 形态 method) +paper_cards/629-2607-23242.mdIndicTalk(主分类 llm-infra · 形态 benchmark)+inbox/tom/2026-07-29-agent-rag-longcontext-radar.mdAPS-RAG 三路融合等候选 - 核心要点:
- 620 (arXiv:2607.24475):面向数字图书馆/历史档案的 agentic retrieval system(查询推断与执行),强调问责与可验证
- 629 (arXiv:2607.23242):IndicTalk · 印度语系 18 种语言变体 · 13,28,604 条事件接地多轮对话 · 全自动流水线(真实新闻 + 人格化)
- 意义:主分类 llm-infra 新增 2 件 = llm-infra 系统在非英语种/历史档案等垂直场景的延伸
- 建议归入:§2.3 KV cache(沿用 14 件套)+ §3.4 开放问题(新增 O150 试金石:"KG Historical Doc Retrieval agentic retrieval system 与现有 agentic RAG 系统的架构差异;IndicTalk 印度语系对话质量对主权开源 MoE 模型的多语言能力补充")
旁证 3【训练基础 / Inference-efficient 邻接】4 件 inference-efficient 邻接(arXiv:2607.18314/24027/23402/23373)(★★)
- 来源:
paper_cards/616-2607-18314.mdInteractive Training 2(主分类 engineering · 形态 application)+paper_cards/626-2607-24027.mdSol-Attn(主分类 multimodal / 邻接 llm-infra)+paper_cards/628-2607-23402.mdCharacterizing Warp Divergence(主分类 evaluation · 邻接 llm-infra)+paper_cards/633-2607-23373.mdUltraViT(主分类 multimodal · 邻接 llm-infra) - 核心要点:
- 616 (arXiv:2607.18314) Interactive Training 2:在线模型训练的可审计控制平面(Trainer-specific 共享协议 + Aim workspace 自定义 + humans/automated controllers 同一接口)
- 628 (arXiv:2607.23402) Characterizing Warp Divergence:Pascal 到 Blackwell GPU warp 分歧特性分析(Ampere/Hopper/Blackwell,cycle-accurate microbenchmarks + hardware counters + SASS 静态分析)
- 633 (arXiv:2607.23373) UltraViT:面向 LVLM 端侧延迟优化 vision encoder(显式 on-device latency 优化设计 · 此前 vision encoder 多被忽视)
- 意义:0 件 pure inference-systems 主分类新卡 · 4 件邻接 inference-efficient = inference-systems 主分类暂时沉寂,邻接 4 件覆盖在线训练 + 视频生成 + GPU 微架构 + 端侧 vision encoder
- 建议归入:§2.4 Kernel/AI 自动化(沿用 Fable 18.71× + Late Chunking + 新增 arXiv:2607.18314 Interactive Training 2 + arXiv:2607.23402 Warp Divergence)+ §2.5 稀疏注意力(沿用 + 新增 Sol-Attn arXiv:2607.24027)+ §2.1 推理引擎 6 寡头(新增 UltraViT 端侧 vision encoder 邻接);新增 O151 试金石:"inference-systems 主分类何时恢复新卡;Interactive Training 2 control plane 与 vLLM/SGLang 训练-部署接口的一致性"
三、警示(2 条)
警示 1【推理引擎 §2.1】⚠️ Tom inference E1 7-29 第三日缺失
- 来源:
inbox/tom/2026-07-29-*仅rag-e1prep-v48(沿用) +agent-rag-longcontext-radar(沿用)+hf-daily-2026-07-29(沿用)+yt-lex-fridman+yt-yannic-kilcher· 无独立 inference-e1prep-v49 - 警示内容:Tom inference 主题 E1 7-27/7-28/7-29 连续三日缺失(继 7-27 evening 收官后延续低密度状态)
- 风险:tom inference 主题信号密度从 7-27 4 主线 → 7-28 0 件 → 7-29 0 件 = 信号流失累计
- 建议行动:spark 本棒补全 4 主线(PagedAttention 2.0 沿用 + Kimi K3 arXiv 立基础 升级 + FlashInfer 集成 + CNCF llm-d);待 tom inference E1 7-30 恢复时核对信号丢失条目
警示 2【Harness Engineering §1.5 / 训练侧 §2.5】⚠️ arXiv:2607.22529 Skill Self-Play 与 arXiv:2607.21503 Agentic Context Management HF Daily 35▲/21▲ 续立候选在 llm-infra.md §2.5 v9 沿用,与 v33 evening 7-26 §2.5 v34 候选链路需复核
- 来源:
inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md第 8 条 Skill Self-Play 35▲(新立) + 第 15 条 Agentic Context Management 21▲(https://arxiv.org/abs/2607.21503)+organized/knowledge/llm-infra.md§1.6 Agent 自改进 + Skill Self-Play arXiv:2607.22529 已立(沿用)+ §1.5 Harness Engineering Phase 3 已立 - 警示内容:
- Skill Self-Play arXiv:2607.22529 HF Daily 7-29 35▲ 新立(7-28 0 → 7-29 35)
- Agentic Context Management arXiv:2607.21503 HF Daily 7-29 21▲ 新立(7-28 0 → 7-29 21)
- 链路复核需求:
- Skill Self-Play 已入位 §1.6(OpenForgeRL + Skill Self-Play + Self-Improvements Survey 4 线互补)
- Agentic Context Management arXiv:2607.21503 = 「Agent 记忆与成本视为生命周期与架构问题加以解决」= 与 Lilian Weng Harness Engineering for Self-Improvement 7-29 jay P0 立标 + MSR Memora 谐波记忆 7-29 jay P0 立标 三角互补
- 风险:arXiv:2607.21503(21▲)与 Lilian Weng + MSR Memora 三角互补关系未单独作为「Harness Engineering Phase 3 学术层三角互补」节点入位
- 建议行动:v10 活文档接力棒复核 arXiv:2607.21503 Agentic Context Management 与 Harness Engineering Phase 3 学术层三角互补(理论层 Weng + 系统实现层 Memora + 论文层 arXiv:2607.21503);新增 O152 试金石:"arXiv:2607.21503 Agentic Context Management 21▲ 与 MSR Memora 谐波记忆对比:Lifecycle 视角 vs Harmonic Memory 表征"
四、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险级别 | 建议行动 |
|---|---|---|---|---|
| 1 | Kimi K3 Coding/Agentic SOTA 属官方宣传 | jay engineering-v39 增量 5 + jay 7-29 five-category-briefing B2 | 🟡 待核实 | 需第三方评测(LiveBench / BFCL / TEA 对照) |
| 2 | Kimi K3 MXFP4 量化精度损失实测数据缺失 | jay engineering-v39 增量 5 | 🟡 待核实 | 等 vLLM/SGLang 官方 benchmark 或第三方评测 |
| 3 | Kimi K3 vLLM/SGLang 官方支持时间线未确认 | jay engineering-v39 增量 5 后续行动 + jay 7-29 five-category-briefing B2 | 🟡 待核实 | 跟进 vLLM GitHub Issues + SGLang Release Notes |
| 4 | FlashInfer 29-69% latency 降低 数据来自 arXiv 2606.20295v2,需对照 SGLang/vLLM 官方 benchmark 确认测试条件 | jay engineering-v39 增量 4 | 🟡 待核实 | 序列长度、batch size、GPU 类型条件确认 |
| 5 | CNCF llm-d B200 wide-EP 3.1k tok/s per GPU + 16×16 B200 50k output tok/s 数据来自 CNCF 官方博客,需第三方验证 | jay 1506 five-category-briefing-p2 Cloud-Native C1 | 🟡 待核实 | 对照 vLLM 官方 benchmark + SkyPilot 等独立测试 |
| 6 | vLLM Conference 2026 Roadmap Speculative decoding 1000+ TPS 目标尚未实测 | jay 1105 five-category-briefing Backend B6 | 🟢 远期目标 | 跟踪 vLLM 0.6+ 实际发布时间线 |
| 7 | NVIDIA Dynamo 跨节点编排层 2026 H2 实际生产可用性待验证 | jay 1506 five-category-briefing-p2 Backend B3 | 🟡 待核实 | 100+ 节点实际部署案例 |
| 8 | Colibri 14.7k★ 纯 C 25GB RAM 744B MoE 性能 vs llama.cpp GGUF 对照缺失 | jay 1105 five-category-briefing Backend B1 | 🟡 待核实 | 第三方基准测试 |
| 9 | OmniRoute 268+ 提供商 Quota-aware fallback + RTK+Caveman 压缩 15-95% 实测数据待核 | jay 1105 five-category-briefing Backend B3 | 🟡 待核实 | GitHub Issues + 独立评测 |
| 10 | arXiv:2607.21503 Agentic Context Management 21▲ 与 Lilian Weng Harness Engineering + MSR Memora 三角互补关系尚未在活文档立标 | tom HF Daily 7-29 + jay engineering-v39 | 🟡 链路缺失 | v10 活文档接力棒复核 |
五、本次涉及 arXiv 号列表
| arXiv 号 | 论文/主题 | 增量归属 | 建议归位节 |
|---|---|---|---|
| 2607.24653 | Kimi K3 开放前沿智能(首个 arXiv 编号正式披露) | 增量 1 | §2.1 推理引擎 6 寡头 / §2.9 量化经济学 |
| 2510.09665 | LMCache 跨引擎 KV 缓存 crash-safe 实测(沿用 7-28 evening) | 横向参照 | §2.3 KV cache 三层算力栈 |
| 2606.20295v2 | Token-Operations-Oriented Inference Optimization(FlashInfer→SGLang/vLLM) | 增量 3 | §2.3 KV cache |
| 2607.18141 | HyMCache CXL 三层 KV cache(已在 llm-infra.md §9,横向参照) | — | §2.3/§9 横向 |
| 2607.24475 | KG Historical Doc Retrieval agentic retrieval 问责 | 旁证 2 | §3.4 开放问题 O150 |
| 2607.23242 | IndicTalk 印度语系混合代码对话 benchmark | 旁证 2 | §3.4 开放问题 O150 |
| 2607.18314 | Interactive Training 2 在线训练可审计控制平面 | 旁证 3 | §2.4 Kernel |
| 2607.24027 | Sol-Attn diffusion transformers 注意力稀疏化 25▲ | 旁证 1/3 | §2.5 稀疏注意力 |
| 2607.23402 | Characterizing Warp Divergence Pascal 到 Blackwell | 旁证 3 | §2.4 Kernel |
| 2607.23373 | UltraViT 端侧延迟优化 vision encoder | 旁证 3 | §2.1 推理引擎 |
| 2607.22529 | Skill Self-Play(沿用 v9 §1.6,警示 2) | 警示 2 | §1.6 Agent 自改进 |
| 2607.21503 | Agentic Context Management(警示 2) | 警示 2 | §1.5 Harness Engineering |
| 2607.24593 | PIVOT Token 级稀疏注意力索引(jay engineering-v39 P1,沿用) | 横向参照 | §2.5 稀疏注意力 |
| 2607.24720 | Physics of Multi-Turn Planning(jay engineering-v39 P1,沿用) | 横向参照 | §2.5 训练侧 |
| 2605.01280 | MathOpt Chen et al. 2026 Ω(√(B log G))(沿用) | 横向参照 | §2.2 调度 |
六、已检查来源清单
以下来源经本次扫描确认无 llm-infra 主题新增或已在上方增量中覆盖,避免重复检索:
inbox/jay/2026-07-29-1055-jay-engineering-filter-rss-round.md→ Harness Engineering / Memora / uv 0.12.0 / PIVOT(已并入 agent / engineering 主题,非 llm-infra 主题主线)inbox/jay/2026-07-29-0822-csdn-rag-agent-multimodal.md→ RAG/Agent 主题inbox/jay/2026-07-29-0940-july2026-github-trending-vecdb-substack-engineering.md→ Vector DB + Substack 工程(已纳入增量 7 Colibri/OmniRoute)inbox/jay/2026-07-29-1105-rag-agent-csdn-survey.md→ RAG/Agent CSDN 主题inbox/jay/2026-07-29-1455-jay-engineering-filter.md→ vLLM vs Ollama vs TensorRT-LLM(已并入增量 5)+ RAG 7 failure points(已并入 RAG 主题)inbox/jay/2026-07-29-1505-jay-briefing-inference-rag-agent-mutlimodal-stack.md→ 推理工程分类(已并入增量 4 vLLM Conference Roadmap + 增量 5 Ollama vs vLLM)+ RAG/Agent 主题inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.md→ Database/Backend/Cloud-Native/CSDN/Reproduction(已并入增量 6 CNCF llm-d / Kthena)+ 旁证 LogicalRAG/TechRAG/MC-Search/HF Agent 入侵/HotInfra PIMinbox/jay/2026-07-29-1620-jay-engineering-filter-rss-fresh.md→ ByteByteGo DoorDash/Instacart/Uber Eats / Raschka 控制推理强度 / 本地 Coding Agent / KV Sharing mHC(非 llm-infra 主题主线)inbox/jay/2026-07-29-1735-jay-evening-hn-trending-raschka-codex-sqlite.md→ Kimi K3 Architecture(已并入增量 2)+ OpenAI Codex Security(security 主题)+ SQLite WAL(数据库优化)inbox/tom/2026-07-29-0853-rag-e1prep-v48.md→ RAG 主题inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md→ 15 件全核(已纳入增量 1 Kimi K3 + 警示 2 + 旁证 1 Sol-Attn)inbox/tom/2026-07-29-agent-rag-longcontext-radar.md→ Agent/RAG 主题inbox/flyp/2026-07-29-0950-multimodal-e1prep-v34.md→ multimodal 主题inbox/flyp/2026-07-29-1550-WorldDiT-unified-diffusion-VLA-critical-read.md→ multimodal 主题inbox/flyp/2026-07-29-long-context-multimodal-rag-dual-review.md→ multimodal + RAG 主题inbox/spark/2026-07-29-1004-rss-gradient-flow.md→ RSS 通稿(沿用 Kimi K3)inbox/spark/2026-07-29-1005-rss-chip-huyen.md→ RSS 通稿(无 llm-infra 主题)inbox/spark/2026-07-29-1008-rss-yt-3blue1brown.md→ RSS 通稿(无 llm-infra 主题)inbox/spark/2026-07-29-1337-agent-e1prep.md→ Agent 主题(已纳入增量 1 Kimi K3 arXiv:2607.24653)inbox/stephen/2026-07-29-0910-news-x-vip-radar.md→ frontier/industry 立标(沿用 Kimi K3 + Anthropic Dario)inbox/stephen/2026-07-29-1006/1007/1009-news-*.md→ news 通稿(已纳入增量 1 Kimi K3 + 警示 2 Agentic Context Management 沿用)inbox/stephen/2026-07-29-1025-ai-industry-e1prep-v31.md→ ai-industry 主题(已纳入增量 1 Kimi K3 + Anthropic Dario 7-27~28 澄清)inbox/stephen/2026-07-29-1245-stephen-coordination-check-noon.md→ 协调棒(已纳入增量 1 Kimi K3 + 警示 2 + 8 大主题活文档接力窗口)- paper_cards/602-642 近 3 天共 41 张新卡 → 主分类 0 张 inference-systems(已纳入旁证 2 主分类 llm-infra 2 张 + 旁证 3 邻接 inference-efficient 4 张);邻接 llm-infra 主分类 2 张(620 + 629)+ 邻接 4 张 inference-efficient(616 + 626 + 628 + 633)+ 邻接 1 张 engineering(635 HiFi-UMI / 617 DataPrep-Bench)+ 工程主题 arXiv:2607.18314 Interactive Training 2 / 626 Sol-Attn 视频生成 / 632 WorldDiT VLA / 633 UltraViT = 共 7 件邻接
七、本次 E1 预消化结论
增量条数:7 主线 + 3 旁证 + 2 警示
结论:llm-infra 主题 7-28 18:40 → 7-29 18:40 约 24h 窗口为中密度,主因是 Kimi K3 arXiv:2607.24653 立基础(7-29 HF Daily 263▲ 单日 +121 暴增 85%)+ Raschka Kimi K3 Architecture Notes 419 分 HN Trending(四大新组件完整披露)+ FlashInfer→SGLang/vLLM 集成数据(arXiv:2606.20295v2 inter-token -29-69%)+ vLLM Conference 2026 Roadmap(Ray Summit)+ SGLang vs vLLM 2026 深度对比(L40 1-100 并发数据 + Fish Audio 16%)+ CNCF llm-d v0.7 + Kthena Volcano(B200 wide-EP 3.1k tok/s per GPU)+ Colibri 14.7k★ + OmniRoute 268+ 提供商统一 API 网关 = 7 主线立标级增量。同时警示 tom inference E1 第三日缺失 + arXiv:2607.22529 Skill Self-Play 与 arXiv:2607.21503 Agentic Context Management HF Daily 35▲/21▲ 续立候选在活文档 §1.6/§1.5 沿用但链路需复核。无 pure inference-systems 主分类新卡(0 张)是本场重要信号——7-27~29 的 research frontier 集中在 multimodal / agent / engineering / llm-application 主题,inference-systems 主分类继续沉寂。
建议今晚活文档 v33/v10 接力动作: 1. Kimi K3 arXiv:2607.24653 立基础升级入 §2.1(主权开源 2.0 立标级续立升级 · 263▲ +121 暴增 · 12 实例同步承接) 2. Raschka Kimi K3 Architecture Notes 完整披露入 §2.1(419 分 HN Trending · LatentMoE/NoPE/KDA/AttnRes 四大新组件) 3. FlashInfer→SGLang/vLLM 集成数据入 §2.3(arXiv:2606.20295v2 · inter-token -29-69% · 与 PagedAttention 2.0 互补) 4. vLLM Conference 2026 Roadmap入 §2.1(Ray Summit · Disaggregated + Multi-tier KV offload + Spec 1000+ TPS) 5. SGLang vs vLLM 2026 深度对比入 §2.1/§2.13(L40 1-100 并发 + Fish Audio 16% + HF TGI 维护模式 + NVIDIA Dynamo + ICML 2026 TwELL) 6. CNCF llm-d v0.7 + Kthena Volcano入 §2.6(CNCF Sandbox + B200 wide-EP 3.1k tok/s + 16×16 B200 50k output tok/s) 7. Colibri 14.7k★ + OmniRoute 268+入 §2.1/§1.13(纯 C 25GB 744B MoE 边缘推理 + Quota-aware fallback + RTK+Caveman 15-95% token) 8. C71-C78 共识 + O143-O152 试金石写入对应候选池