llm-infra · E1 预消化简报(2026-07-29)

作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 10 棒 · 7-29 晚间活文档接力备料) 覆盖时段:2026-07-28 18:40 → 2026-07-29 18:40(约 24 小时增量) 基线:organized/knowledge/llm-infra.md Wave3 §V 32 轮抢修完成版(2026-07-29 05:00 收官 · 11+1 维全景 + C1-C66 共 66 条共识 + D1-D32 共 32 条争议 + O1-O140 共 140 条开放问题 + T1-T27 共 27 条趋势 + 7-28 evening 本棒(spark E1 第 9 棒)7 主线增量已并入活文档) —— work-queue.md(2026-07-29 自动检测:llm-infra 已脱离 9 天未更新状态 · 待建卡 0 · 待富化 64 · llm-infra 与 evaluation 同列待富化) 覆盖来源:inbox/jay/ 7-28 evening → 7-29 上午/午间/下午/晚间 共 17 件(7-29 engineering-e1prep-v39 准备棒 9 件 P0/P1 + 7-29 five-category-briefing #11 Database D1-D4 + Backend B1-B2 + Cloud-Native C1 + CSDN + Reproduction + 7-29 1055 engineering-filter-rss-round v3 A 级 3 条 Lilian Weng/MSR Memora/uv 0.12.0 + 7-29 1105 five-category-briefing Backend B1-B2 Kimi K3 + Colibri + OmniRoute + FlashInfer + 7-29 1140 news-x-tech-radar + 7-29 1455 engineering-filter A 级 4 条 vLLM vs Ollama vs TensorRT-LLM + RAG 7 failure points + Addy Osmani AI-augmented + ColPali 多模态 RAG + 7-29 1505 inference-rag-agent-multimodal-stack + 7-29 1506 five-category-briefing-p2 cncf-llm-d + SGLang vs vLLM benchmark + ICML 2026 TwELL + NVIDIA Dynamo + Kthena + LogicalRAG/TechRAG/MC-Search + HF Agent 入侵 + HotInfra PIM KV + 7-29 1620 engineering-filter-rss-fresh ByteByteGo DoorDash/Instacart/Uber Eats + Raschka 控制推理强度/本地 Coding Agent + 7-29 1735 evening-hn-trending OpenAI Codex Security 496 分 + Raschka Kimi K3 Architecture 419 分 + SQLite WAL production + Hubble)+ inbox/tom/ 7-28 evening → 7-29 共 7 件(rag-e1prep-v48 6 件 + 0900 hf-daily-2026-07-29 + 0853 rag-e1prep + 1008 yt-lex-fridman + 1008 yt-yannic-kilcher + 0840/1441 agent-rag-longcontext-radar · ⚠️ tom 7-29 仍未发布独立 inference E1 · 继 7-27/7-28 双日缺失后延续第三日低密度状态)+ inbox/flyp/ 7-28 → 7-29 共 8 件(2250 SPA + Multimodal ASV dual critical-read + multimodal-e1prep-v34 + risk-e1prep + long-context-multimodal-rag-dual-review 0952 + multimodal-e1prep-v34 第二棒 E1 + 1000 rss-cameron-wolfe + 1005 interconnects · ⚠️ flyp 7-29 无独立 inference/llm-infra 产出 · multimodal + risk 双轨主导)+ inbox/spark/ 7-28 evening → 7-29 上午/午间 共 6 件(1004 gradient-flow 三款前沿级模型 + 1005 chip-huyen + 1008 yt-3blue1brown + 1337 agent-e1prep-v35 接力 + 1004 RSS · 本场 llm-infra 棒 · spark E1 节奏连续 4 日回落窗口第 5 棒 · 7-29 evening 本棒 = 节奏反转第 5 棒)+ inbox/stephen/ 7-28 evening → 7-29 上午/午间 共 14 件(0910 news-x-vip-radar Anthropic Dario 周末博客澄清 + 1006/1007 news-anthropic/deepmind/openai/tldr-ai/hf-blog 通稿 + 1025 ai-industry-e1prep-v31 准备棒 6 件 P0 立标 + 1245 coordination-check-noon 5 实例全岗饱和 + 0910/1006 news 沿用 + stephen 7-29 1245 协调棒已识别 Kimi K3 arXiv:2607.24653 立基础 · HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% = 6 实例同步承接主权开源 2.0 立标级 arXiv 编号正式披露触发)+ paper_cards/ 近 3 天(2026-07-26~29)新卡 IDs 602-642 共 41 张,主分类 llm-infra/pure inference-systems 新增 0 张 · 副分类 llm-infra 2 张 = 620 arXiv:2607.24475 KG Historical Doc Retrieval(agentic retrieval + KG 用于档案问责) + 629 arXiv:2607.23242 IndicTalk(印度语系混合代码对话 13,28,604 语料) + 工程邻接 1 张 = 616 arXiv:2607.18314 Interactive Training 2(在线训练可审计控制平面)+ inference-efficient 邻接 4 张 = 626 arXiv:2607.24027 Sol-Attn(diffusion transformers 注意力稀疏化 video) + 628 arXiv:2607.23402 Characterizing Warp Divergence(Pascal 到 Blackwell)+ 632 arXiv:2607.23909 WorldDiT(unified diffusion VLA 4 LIBERO)+ 633 arXiv:2607.23373 UltraViT(端侧延迟优化 vision encoder)= 4 件 inference-efficient 邻接 + 0 件 pure inference-systems 新卡 结论:中密度(7 主线 + 3 旁证 + 2 警示),核心动作 = (1) Kimi K3 arXiv:2607.24653 立基础 · 首个 arXiv 编号正式披露 · HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% · 主权开源 2.0 立标级续立升级;(2) Raschka Kimi K3 Architecture Notes 419 分 HN Trending · 四大新组件完整披露(LatentMoE/NoPE/KDA/AttnRes) · NoPE everywhere 首个前沿级全 NoPE 模型;(3) FlashInfer→SGLang/vLLM 集成数据(arXiv:2606.20295v2 · inter-token latency -29-69% · long context -28-30%) · 与 PagedAttention 2.0 互补构成 KV cache 全栈体系;(4) vLLM Conference 2026 Roadmap(Ray Summit · Disaggregated serving + multi-tier KV offloading · Speculative decoding 1000+ TPS · Quantized KV cache production);(5) SGLang vs vLLM 2026 深度对比(Spheron + LeetLLM · 持平 + SGLang 结构化输出优势 + HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层);(6) CNHF llm-d CNCF Sandbox v0.7 + 16×16 B200 prefill/decode ~3.1k tok/s per B200 decode GPU · TTFT 一数量级降低 + Kthena Volcano 互补编排层;(7) Colibri 纯 C 25GB RAM 744B MoE + OmniRoute 268+ 提供商统一 API 网关 · GitHub Trending 7 月汇总边缘推理里程碑 + Agent 平台工具链成熟 + 3 旁证:Sol-Attn arXiv:2607.24027 diffusion transformers 注意力稀疏化 25▲ + arXiv:2607.24475 KG Historical Doc Retrieval agentic retrieval 问责 + arXiv:2607.23242 IndicTalk 印度语系混合代码对话 13,28,604 语料 benchmark 主分类 llm-infra 2 件 + arXiv:2607.18314 Interactive Training 2 在线训练可审计控制平面 engineering 邻接 + ICML 2026 TwELL sparse Transformer + NVIDIA Custom CUDA Kernels + Characterizing Warp Divergence + UltraViT 端侧延迟 vision encoder = 4 件 inference-efficient 邻接 + 2 警示:Tom inference E1 7-29 第三日缺失 + arXiv:2607.22529 Skill Self-Play 与 arXiv:2607.21503 Agentic Context Management HF Daily 35▲/21▲ 续立候选在 llm-infra.md §2.5 v9 沿用,但与 v33 evening 7-26 §2.5 v34 候选链路需复核


一、核心增量(7 主线 + 3 旁证 + 2 警示,按活文档归位顺序)

增量 1【推理引擎 §2.1 / 模型发布 / 量化经济学 §2.9】Kimi K3 arXiv:2607.24653 立基础 · 首个 arXiv 编号正式披露 · 263▲ 单日暴增 85%(★★ 必补)

  • 来源:inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md 第 1 条 Kimi K3 263▲(https://arxiv.org/abs/2607.24653) + inbox/jay/2026-07-29-1055-jay-engineering-filter-rss-round.md(沿用) + inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Backend B2 Kimi K3 MoE + inbox/jay/2026-07-29-engineering-e1prep-v39 增量 5 Kimi K3 MoE + inbox/stephen/2026-07-29-1025-ai-industry-e1prep-v31 增量 1 + inbox/stephen/2026-07-29-1245-stephen-coordination-check-noon + inbox/spark/2026-07-29-1004-rss-gradient-flow.md(沿用) + inbox/spark/2026-07-29-1337-agent-e1prep.md 增量 1 Kimi K3 沿用 + organized/knowledge/llm-infra.md §2.1 Kimi K3 2.8T MoE 主权开源 2.0 立标 已立标(2026-07-27 HF 1.56TB 完整开源一行)

Kimi K3 arXiv:2607.24653 完整展开: - 首个 arXiv 编号正式披露:arXiv:2607.24653(HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85% · 7-28 142 → 7-29 263) - 模型规格确认: - 参数量:2.8T 总参 / 104B 激活 / 896 experts / 16 selected / 93 层(1 dense + 69 KDA + 24 Gated MLA)/ Attention Hidden 7168 / 96 heads / Latent MoE Dim 3584 / MoE Hidden per Expert 3072 / 2 shared experts - 量化:MXFP4 权重(MoE 稀疏激活定制) + MXFP8 激活(匹配权重低精度) - 上下文窗口:1M tokens(Kimi K2.6 256K → Kimi K3 1M) - HF 模型大小:约 1.56TB - 四项架构创新(沿用):KDA(Kimi Delta Attention) + AttnRes(Attention Residuals) + Stable LatentMoE + Gated MLA(24 层) - Benchmark(官方宣传,第三方核实中):General Intelligence / Coding / Agentic 三项 SOTA - 主权开源 2.0 立标级续立升级证据(7-29 vs 7-28 evening): - 6 实例同步承接升级:stephen ai-industry-v31 P0 + stephen noon 协调棒 + jay B1 + jay B2 + spark gradient-flow + spark agent-e1prep-v35 + tom rag-v48 + flyp multimodal-v34 + simon willison 7-27/28 沿用 = 12 实例 vs 7-28 evening 6 实例同步承接升级(2 倍) - 首个 arXiv 编号正式披露:从 HF 1.56TB 权重(HF 模型页面 huggingface.co/moonshotai/Kimi-K3)升级到 arXiv:2607.24653 正式论文 = 立基础触发 - HF Daily 7-29 票榜 263▲ 单日 +121 暴增 85%:Kimi K3 立标级候选正式立基础栖候选(栖候选升档触发点) - 6 件候选新增细节(arXiv:2607.24653 论文完整披露): - 主权开源维度:首个 3T 参数级别开源模型(2.8T · DeepSeek-V4 直接竞争) - 量化路线图第 5 分叉:MXFP4 + MXFP8 作为 MoE 量化定制格式 · 内存受限部署场景 - 主权开源 vs 闭源 frontier lab 公开对峙:Anthropic Dario Amodei 7-27~28 周末博客澄清「从未、也不会主张全面禁止开源权重模型」+ Anthropic 7-29 立场文档 = frontier lab 开源权重立场 vs 监管打压指控公开对峙

  • 与活文档关系:§2.1 Kimi K3 2.8T MoE 已立标(7-27 HF 1.56TB 完整开源一行)· §2.9 量化路线图 5 分叉已收 MXFP4/MXFP8 第 5 分叉;但 arXiv:2607.24653 首个 arXiv 编号正式披露 + HF Daily 7-29 263▲ 暴增 + 12 实例同步承接升级未单独作为「Kimi K3 立基础栖候选升档触发点」入位

  • 建议归入:§2.1 推理引擎 6 寡头(升级现有 Kimi K3 一行,新增「arXiv:2607.24653 立基础 · 首个 arXiv 编号正式披露 · 7-28 142 → 7-29 263 单日 +121 暴增 85% · 12 实例同步承接升级主权开源 2.0 立标级 · 6 件候选新增细节」小节) + §2.9 量化经济学(沿用 MXFP4/MXFP8 第 5 分叉);新增 C71 共识候选:"主权开源 2.0 立标级续立升级 = Kimi K3 arXiv:2607.24653 立基础 · 2026-07-29 HF Daily 263▲ 单日 +121 暴增 85% · 12 实例同步承接 · Anthropic Dario 周末博客澄清 + Anthropic 7-29 立场文档 = frontier lab 开源权重立场 vs 监管打压指控公开对峙";新增 O143 试金石:"Kimi K3 arXiv:2607.24653 与 DeepSeek-V4 架构差异(MoE 设计 + 量化 + KDA 实现)对照分析;MXFP4 在 H100/H200/B200 精度损失实测;3T MoE 在 H100 8 卡/16 卡/GB200/GB300 部署 TTFT/TPOT 实测;KDA vLLM 实现 Day-N 支持时间线"

  • 来源:inbox/jay/2026-07-29-1735-jay-evening-hn-trending-raschka-codex-sqlite.md 第 2 条 Kimi K3 Architecture Notes(419 分)+ Raschka 官方博客 https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html(2026-07-28)+ inbox/jay/2026-07-29-engineering-e1prep-v39 增量 5 沿用 + inbox/jay/2026-07-29-1620-jay-engineering-filter-rss-fresh.md B1 Raschka LLM 架构最新进展(KV Sharing/mHC/压缩注意力)+ organized/knowledge/llm-infra.md §2.1 Kimi K3 2.8T MoE 已立标(7-27 HF 1.56TB 完整开源一行)· 沿用 Kimi Linear 27 层 → K3 93 层

Raschka Kimi K3 Architecture Notes 完整展开: - HN Trending 419 分:https://news.ycombinator.com/item?id=49089755 · 7-29 当日高热 - Kimi K3 定位: - 2.8T 总参数,16/896 experts 激活(LatentMoE) - 基于 Kimi Linear(48B → 2.8T)的规模化生产版本 - 当前最大 open-weight 模型(超过 DeepSeek-V4、Qwen 3.6 等) - 四大新组件解析:

组件 类型 功能 工程意义
LatentMoE 新效率块 将大 dense 层压缩(down-project),类似 MLA 的压缩思路 在 2.8T 规模保持可服务性,核心效率创新
NoPE everywhere 位置编码替代 移除所有 RoPE 层(首个前沿级全 NoPE 模型) 训练/推理简化,RoPE 在局部注意力的局限性被绕过
Kimi Delta Attention(KDA) 注意力改进 Delta Attention 替代常规注意力 效率提升,与 multi-head latent attention 协同
Attention Residuals 残差改进 跨层残差连接,用注意力分数作为重要性权重 改善验证损失和下游性能;训练成本 +4%,推理成本 +2%
  • 与 Kimi Linear 的关系:
  • 架构上继承自 Kimi Linear(2025),是同一设计理念的规模化版本
  • 层数:Kimi Linear 27 层 → K3 93 层
  • 主要差异:LatentMoE 替代部分 dense 层
  • 与同期模型趋势的横向对比:
  • Nemotron 3 Ultra、DeepSeek V4 都采用类似效率优化路径(MoE → LatentMoE,常规注意力 → 多头潜在注意力)
  • 注意力残差(attention residuals)与 DeepSeek V4 的 mHC(manifold-constrained Hyper-Connections)功能相似但实现不同
  • mHC:让残差路径更宽;Attention residuals:跨层连接用注意力分数加权
  • 原生多模态支持:K3 新增原生图像/视频/音频编码器接入
  • Raschka LLM Architecture Gallery:Kimi K3 完整架构卡片含 benchmark 对比、层数、KV cache 大小、上下文长度(https://sebastianraschka.com/llm-architecture-gallery/)

  • 与活文档关系:§2.1 Kimi K3 2.8T MoE 已立标(7-27 HF 1.56TB 完整开源一行);但 Raschka 419 分 HN Trending 四大新组件完整披露(LatentMoE 压缩 + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA 替代常规注意力 + Attention Residuals 跨层残差)+ Kimi Linear 27 层 → K3 93 层 + KV cache 大小 + 原生多模态编码器接入 + 与 Nemotron 3 Ultra/DeepSeek V4 横向对比 + Raschka LLM Architecture Gallery 立标级未单独作为「Kimi K3 架构细节完整性」节点入位

  • 建议归入:§2.1 推理引擎 6 寡头(新增「Raschka Kimi K3 Architecture Notes 完整披露(419 分 HN Trending · LatentMoE 压缩 + NoPE everywhere 首个前沿级全 NoPE 模型 + KDA 替代常规注意力 + Attention Residuals 跨层残差 + Kimi Linear 27 → K3 93 层 + 原生多模态 + 与 Nemotron 3 Ultra/DeepSeek V4 横向对比 · Raschka LLM Architecture Gallery 立标)」小节);新增 C72 共识候选:"Raschka Kimi K3 架构解析 = LatentMoE + NoPE everywhere + KDA + Attention Residuals 四大新组件 · 首个前沿级全 NoPE 模型 · Kimi Linear 27 → K3 93 层 · 与 Nemotron 3 Ultra/DeepSeek V4 效率优化路径趋同";新增 O144 试金石:"NoPE 替代 RoPE 在长上下文(1M)外推性能实测;Attention Residuals 训练成本 +4% 推理成本 +2% 量化收益;LatentMoE 压缩路径与 MLA 兼容性问题"

增量 3【推理引擎 §2.1 / KV cache 三层算力栈 §2.3】FlashInfer→SGLang/vLLM 集成数据(arXiv:2606.20295v2)· inter-token latency -29-69% · long context -28-30%(★ 必补)

  • 来源:inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Backend B6 arXiv:2606.20295v2 Token-Operations-Oriented Inference Optimization(⭐⭐⭐⭐)+ inbox/jay/2026-07-29-engineering-e1prep-v39 增量 4 FlashInfer + organized/knowledge/llm-infra.md §2.1 vLLM v0.19.0 (2026-04-03) FP8 KV validation across Hopper-Blackwell + §2.3 KV cache 14 件套 + §1.10 系统栈 + §2.11 FlashInfer-Bench + arXiv:2601.00227 + Attention Kernel Energy/Performance/Accuracy arXiv:2607.09172 + FlashAttn-3;arXiv:2606.20295v2 完整集成数据 + inter-token latency -29-69% + long context -28-30% + block-sparse + composable KV cache + JIT 模板适配 + load-balancing 调度未单独作为「FlashInfer→SGLang/vLLM 集成里程碑」入位

FlashInfer→SGLang/vLLM 集成数据完整展开: - 核心数据:FlashInfer 集成到 SGLang 和 vLLM 实现 inter-token latency 降低 29%-69%,长上下文推理延迟降低 28%-30% - 核心技术细节: - block-sparse + composable KV cache 格式:FlashInfer 设计的 KV cache 布局优化 - JIT 模板适配不同 Attention 变体:运行时编译,支持多种 attention 变体(MHA/GQA/MQA/MLA) - load-balancing 调度算法:在 attention 计算阶段动态负载均衡 - 与 PagedAttention 2.0 互补构成 KV cache 全栈体系: - PagedAttention 2.0(vLLM 引擎内 GPU 显存管理):20% → 90%+ 显存利用率 · 单卡并发 5-23× · OS 虚拟内存式 KV 分页 - FlashInfer(attention 计算本身的高效实现):inter-token latency -29-69% · long context -28-30% · block-sparse + JIT - LMCache(跨引擎 KV 缓存共享):cost -90% / speed 14× / startup 3min → 30s · crash-safe - 三者互补:PagedAttention = 显存管理 · FlashInfer = 计算引擎 · LMCache = 跨引擎共享

  • 与活文档关系:§2.1 vLLM v0.19.0 已收 FP8 KV validation · §2.3 已收 14 件套 + LMCache · §1.10 已收 FlashInfer-Bench arXiv:2601.00227 + Attention Kernel arXiv:2607.09172;但 arXiv:2606.20295v2 完整集成数据(inter-token -29-69% / long context -28-30%)+ block-sparse + composable KV cache + JIT 模板 + load-balancing 调度 + 与 PagedAttention 2.0 互补关系未单独作为「FlashInfer→SGLang/vLLM 集成里程碑」入位

  • 建议归入:§2.3 KV cache 三层算力栈(沿用 LMCache 一行,新增「FlashInfer arXiv:2606.20295v2 → SGLang/vLLM 集成(inter-token latency -29-69% · long context -28-30%)· block-sparse + composable KV cache + JIT 模板 + load-balancing 调度 · 与 PagedAttention 2.0(显存管理)互补构成 KV cache 全栈体系」小节);新增 C73 共识候选:"KV cache 全栈体系三件套 = PagedAttention 2.0(显存管理 · 20% → 90%+) + FlashInfer arXiv:2606.20295v2(attention 计算 · inter-token -29-69%)+ LMCache(跨引擎共享 · cost -90%)";新增 O145 试金石:"FlashInfer 在 vLLM v0.20+ 默认集成状态;JIT 模板适配 MLA/KDA 等新 attention 变体的性能;block-sparse 在 MoE 模型部署的实际收益"

增量 4【推理引擎 §2.1 / 调度 §2.2 / 选型决策树 §2.13】vLLM Conference 2026 Roadmap(Ray Summit)· Disaggregated serving + multi-tier KV offloading(★ 必补)

  • 来源:inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Backend B6 vLLM Conference 2026 Roadmap 沿用 + inbox/jay/2026-07-29-1505-jay-briefing-inference-rag-agent-mutlimodal-stack.md §1.2 vLLM Conference 2026 Roadmap + vLLM AI 官方 https://vllm.ai/events/vllm-conference/2026 + organized/knowledge/llm-infra.md §2.1 vLLM v0.19.0 (2026-04-03) + §2.2 调度 9 学派 + MathOpt + Disagg 5 节点 + §2.13 推理引擎可复现性危机;vLLM Conference 2026 Roadmap 4 主线(Flat Model + Model Runner V2 + disaggregated serving + multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production)未单独作为「vLLM 2026 H2 路线图」入位

vLLM Conference 2026 Roadmap 完整展开: - 重点 roadmap 内容: 1. Flat Model 和 Model Runner V2 迁移:vLLM 内部架构迁移,简化部署流程 2. Disaggregated serving + multi-tier KV offloading:PD 分离部署 + 多层 KV 卸载(GPU HBM → CXL DRAM → SSD) 3. Speculative decoding 目标:1000+ TPS:投机解码目标突破 1000 tokens/s(vLLM 0.5.x 已实现 FlashInfer kernel 融合 + EAGLE3 头预测) 4. Quantized KV cache compression(production 级):生产级量化 KV cache 压缩 - vLLM 0.5.x 已实现 FlashInfer kernel 融合,EAGLE3 头预测:为 vLLM 0.6+ roadmap 奠定基础 - 预测影响: - Disaggregated serving = 与 CNCF llm-d K8s PD 分离对齐(沿用 7-29 CNCF llm-d v0.7) - Multi-tier KV offloading = 与 LMCache(跨引擎) + HyMCache(CXL 三层)对齐 - Speculative decoding 1000+ TPS = 与 arXiv:2607.24027 Sol-Attn 注意力稀疏化 + EAGLE-3 投机解码对齐 - Quantized KV cache production = 与 TurboQuant 6× + MXFP4/MXFP8 第 5 量化分叉对齐

  • 与活文档关系:§2.1 vLLM 已收 v0.19.0 + V1 connector + MRV2 + Hybrid SSM disagg;§2.2 调度 9 学派 + Disagg 5 节点已收;HaoaiLab DistServe 18 个月复盘 + Nexus intra-GPU 主动分离 + PPD Append-Prefill + SPAD + Rubin CPX + Fluid-Guided WAIT;但 vLLM Conference 2026 官方 roadmap(Flat Model + Model Runner V2 + disaggregated serving + multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production)未单独作为「vLLM 2026 H2 路线图」入位

  • 建议归入:§2.1 vLLM(新增「vLLM Conference 2026 Roadmap(Ray Summit · Flat Model + Model Runner V2 + disaggregated serving + multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production)」小节)+ §2.2 调度(沿用 Disagg 5 节点 + vLLM roadmap disaggregated serving 验证);新增 C74 共识候选:"vLLM 2026 H2 路线图 = Disaggregated serving + Multi-tier KV offloading + Speculative decoding 1000+ TPS + Quantized KV cache production · 与 CNCF llm-d K8s PD 分离 + LMCache/HyMCache 多层 KV + TurboQuant/MXFP4 量化路线图形成完整对齐";新增 O146 试金石:"vLLM 0.6+ 实际发布时间线;Speculative decoding 1000+ TPS 实测对照 EAGLE-3 / Medusa / Self-Speculative;Multi-tier KV offloading 在 H100 8 卡 / GB200 实际吞吐"

增量 5【推理引擎 §2.1 / 选型决策树 §2.13 / Cloud-Native §2.6】SGLang vs vLLM 2026 深度对比 + NVIDIA Dynamo 跨节点编排层 + HF TGI 维护模式(★ 必补)

  • 来源:inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.md Backend B1 SGLang vs vLLM 2026 深度对比(Spheron + LeetLLM · ⭐⭐⭐⭐)+ inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Backend B4 tekBlueprint Production LLM Inference Frameworks 对比 + inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.md Backend B2 ICML 2026 TwELL + Backend B3 NVIDIA Dynamo + inbox/jay/2026-07-29-1455-jay-engineering-filter.md A1 vLLM vs Ollama vs TensorRT-LLM 推理基准对比 + organized/knowledge/llm-infra.md §2.1 推理引擎 6 寡头 + §2.13 推理引擎可复现性危机(含 Turion.ai 7-27 evening 已立)均收 SGLang/vLLM 一行

SGLang vs vLLM 2026 深度对比完整展开: - Benchmark 数据(L40,不同并发):

并发数 vLLM tok/s SGLang tok/s 差距
1 312 318 SGLang +2%
10 890 902 SGLang +1%
50 1,850 1,920 SGLang +4%
100 2,010 2,050 SGLang +2%
  • 关键结论:
  • 无前缀复用时两者性能基本持平,差异在 run-to-run 波动范围内
  • SGLang 在结构化输出/函数调用场景有优势:grammar-cache 行为更激进,重复 schema 场景编译 grammar automaton 复用更好
  • SGLang 默认 RadixAttention 做 prefix caching;vLLM 默认 xgrammar 做 guided decoding(2026)
  • Fish Audio 实测:SGLang 比 vLLM 吞吐快 16%,p99 TTFT 13.1ms vs 23.6ms
  • 2026 引擎格局变化:
  • HuggingFace TGI 已进入维护模式(接受 minor bug fix,不再推荐新部署)
  • HF 官方推荐迁移目标:vLLM / SGLang / llama.cpp / MLX(Apple)
  • TensorRT-LLM 高并发场景(100+ 并发)优势扩大,但配置复杂度高
  • Nvidia Dynamo:跨节点协调层(非单节点引擎),可调度 TensorRT-LLM / vLLM / SGLang
  • 选型建议:
  • 面向客户的生产 chat API → SGLang(结构化输出 + prefix caching 优势)
  • 内部批推理 pipeline → vLLM(生态成熟,bug 少,社区活跃)
  • 极致单节点吞吐(H100+) → TensorRT-LLM

Ollama vs vLLM(单流 vs 高并发): - 单流:Ollama Q4_K_M Llama 3.1 8B ≈ 62 tok/s · vLLM FP16 ≈ 71 tok/s · vLLM AWQ ≈ 68 tok/s - 50 并发:vLLM ≈ 6× Ollama · vLLM p99 < 3s vs Ollama p99 = 24.7s - Ollama 适用:开发/边缘/CPU 资源受限 - vLLM 适用:5+ 并发生产 API

TensorRT-LLM H100 FP8 实测: - 峰值 > 10,000 output tokens/s - TTFT sub-100ms - 生产部署 vs PyTorch 原生 ≈ 4× 提升 - 适用:H100+ 极致吞吐

ICML 2026 TwELL(Tile-wise ELLPACK): - NVIDIA ICML 2026 论文(来源:Modular AI LinkedIn 公告) - 问题:传统稀疏格式引入不规则内存访问,开销抵消了 GEMM 的理论节省 - TwELL 解决方案:新稀疏打包格式,直接集成进优化的 tiled matmul kernel - 自定义 CUDA kernels:融合多个稀疏 matmul,最大化吞吐 - 意义:稀疏化是 2026 重要方向(MoE + sparse attention 组合),需要硬件级 kernel 支持才能落地

NVIDIA Dynamo 跨节点编排层: - 不是单节点推理引擎,而是多节点推理编排层 - 调度 TensorRT-LLM、vLLM、SGLang 跨节点协作 - 支持 PD disaggregation(prefill/decode 分离) - 目标场景:超大规模多节点推理集群 - 2026 市场格局:vLLM/SGLang 双寡头 + TensorRT-LLM 高端 + llama.cpp 轻量 三级格局,Dynamo 在编排层统一

  • 与活文档关系:§2.1 推理引擎 6 寡头已收 vLLM/SGLang/TRT-LLM/Ollama/Colibri/LMDeploy 六框架 + §2.13 推理引擎可复现性危机;但 SGLang vs vLLM 2026 深度对比(L40 1-100 并发数据 + 结构化输出优势 + Fish Audio 16% 吞吐)+ HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层 + ICML 2026 TwELL 稀疏打包格式未单独作为「推理引擎选型决策树 v3.0」入位

  • 建议归入:§2.1 推理引擎 6 寡头(新增「SGLang vs vLLM 2026 深度对比(L40 1-100 并发持平 + 结构化输出优势 + Fish Audio 16%) + HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层 + ICML 2026 TwELL 稀疏」小节)+ §2.13 推理引擎可复现性危机(沿用 + 强化 NVIDIA Dynamo 编排层 + TGI 迁移指南);新增 C75 共识候选:"2026 H2 推理引擎 6 寡头收敛 = vLLM(生态成熟)/ SGLang(结构化输出 + RadixAttention) / TRT-LLM(H100 极致)/ Ollama(边缘)/ Colibri(纯 C 25GB 744B)/ LMDeploy(极致低延迟)+ HF TGI 维护模式 + NVIDIA Dynamo 跨节点编排层统一 · SGLang vs vLLM 性能持平 + 结构化输出/函数调用 SGLang 优势";新增 O147 试金石:"NVIDIA Dynamo 在 100+ 节点规模的实际调度延迟;ICML 2026 TwELL 在 MoE sparse attention 模型的 kernel-level 收益量化;vLLM vs SGLang 在 1M context 长上下文实测差异"

增量 6【Cloud-Native §2.6 / 推理调度 §2.2】CNCF llm-d v0.7 + Kthena Volcano 互补编排层 + B200 wide-EP 3.1k tok/s per GPU(★ 必补)

  • 来源:inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.md Cloud-Native C1 CNCF llm-d + C2 Kthena(⭐⭐⭐⭐⭐ CNCF Sandbox + Linux Foundation)+ inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Cloud-Native C1(沿用)+ organized/knowledge/llm-infra.md §2.6 Cloud-Native 部分(vLLM K8s OOM runbook 7-26 已立)· §2.2 调度 9 学派 + Disagg 5 节点;CNCF llm-d 2026-03-24 捐赠 + v0.7 May 2026 + v0.5 Feb 2026 + B200 wide-EP 实测数据 + Kthena Volcano 互补编排层未单独作为「K8s 推理部署事实标准方向盘」入位

CNCF llm-d v0.7 完整展开: - 2026-03-24:llm-d 正式捐赠给 CNCF 并进入 Sandbox 阶段(Backed by IBM/Red Hat/Google/CoreWeave/NVIDIA) - 核心架构:分离 prefill 和 decode 阶段到独立 GPU 池 - 路由:使用 Kubernetes Gateway API Inference Extension 做 cache-aware 请求路由 - v0.7(May 2026)新特性: - 优化 baseline 重命名并稳定化 - kustomize-first 迁移指南 - 扩展夜间 CI(OpenShift/GKE/CoreWeave) - predicted-latency 调度 GA - batch gateway(实验性) - 全面文档重构 - v0.5(Feb 2026)新增: - 可重现 benchmark 工作流 - 分层 KV offloading - cache-aware LoRA 路由 - active-active HA - UCCL 传输弹性 - scale-to-zero 自动扩缩容 - 验证数据: - ~3.1k tok/s per B200 decode GPU(wide-EP) - 16×16 B200 prefill/decode 拓扑下达 50k output tok/s - TTFT 比 round-robin 基线降低一个数量级 - CNCF 博客(July 16, 2026):发布 K8s 内自托管 vLLM 完整指南(PVC + Secret + Deployment + Service),来源为 LINBIT(DRBD/Heketi 存储团队)

Kthena Volcano 互补编排层: - Linux Foundation 旗下项目 - 定位:与 llm-d 互补,不替换 vLLM/SGLang,而在其上增加智能编排层 - 核心组件: - ModelServing → ServingGroup → Role 分层架构 - 拓扑感知调度(GPU 拓扑-aware) - KV Cache-aware 路由 - PD disaggregation(Prefill-Decode 分离) - 与 llm-d 区别: - llm-d:底层引擎抽象 + disaggregation - Kthena:上层编排调度 + 拓扑感知

  • 与活文档关系:§2.6 Cloud-Native 已收 vLLM K8s OOM runbook 7-26 evening 已立 · §2.2 调度 9 学派 + Disagg 5 节点已收;但 CNCF llm-d 2026-03-24 捐赠 + v0.7 May 2026 + v0.5 Feb 2026 完整特性清单 + B200 wide-EP 3.1k tok/s per GPU 验证数据 + Kthena Volcano 互补编排层未单独作为「K8s 推理部署事实标准方向盘」入位

  • 建议归入:§2.6 Cloud-Native(沿用 vLLM K8s OOM runbook + 新增「CNCF llm-d v0.7 + Kthena Volcano 互补编排层(2026-03-24 捐赠 + IBM/Red Hat/Google/CoreWeave/NVIDIA 支持 + B200 wide-EP 3.1k tok/s per GPU + 16×16 B200 prefill/decode 50k output tok/s + TTFT 一数量级降低)」小节) + §2.2 调度(沿用 Disagg 5 节点 + 新增 CNCF llm-d K8s 标准化 PD 分离);新增 C76 共识候选:"CNCF llm-d v0.7 = K8s 推理部署事实标准方向盘(2026-03-24 Sandbox + B200 wide-EP 3.1k tok/s/GPU + 16×16 B200 50k output tok/s + TTFT -10×) + Kthena Volcano 互补编排层(拓扑感知 + KV-cache 路由 + PD 分离)";新增 O148 试金石:"CNCF llm-d v1.0 GA 时间线;Kthena 在 1000+ GPU 大集群的拓扑感知延迟;CNCF llm-d 与 Modular MAX(vLLM 商业化)+ RadixArk(SGLang 商业化)的标准收敛"

增量 7【边缘推理 §2.1 / Agent 平台工具链 §1.13】JustVugg/colibri 14.7k★ + OmniRoute 268+ 提供商统一 API 网关(★ 必补)

  • 来源:inbox/jay/2026-07-29-1105-jay-five-category-briefing.md Backend B1 JustVugg/colibri GitHub 14.7k⭐ + Backend B3 OmniRoute(341⭐)+ inbox/jay/2026-07-29-1455-jay-engineering-filter.md A1 Ollama 边缘对比 + inbox/jay/2026-07-29-1140-news-x-tech-radar.md(沿用)+ organized/knowledge/llm-infra.md §2.1 推理引擎 6 寡头已收 Colibri / Ollama / LMDeploy / llama.cpp;Colibri 14.7k★ 边缘推理里程碑 + OmniRoute 268+ 提供商 + 50+ 免费 + MCP/A2A 协议 + RTK+Caveman 压缩 15-95% token 节省未单独作为「Agent 平台工具链成熟」入位

Colibri 纯 C 25GB RAM 744B MoE 完整展开: - GitHub 14.7k⭐:https://github.com/JustVugg/colibri · 7-29 GitHub Trending 7 月汇总 - 核心技术:磁盘按需流式加载 MoE experts,实现极致内存压缩;零外部依赖 - 意义:边缘推理工程化里程碑;消费级硬件即可运行前沿规模模型 - 适合场景:嵌入式、边缘部署、无云端的本地 LLM 推理

OmniRoute 268+ 提供商统一 API 网关完整展开: - GitHub 341⭐(Trending):单端点接入 268+ 提供商(50+ 免费) - 核心功能: - Quota-aware 自动 fallback:跨提供商配额感知自动降级 - RTK + Caveman 压缩节省 15-95% token:提示词压缩 - MCP / A2A 协议支持 - 桌面端 + PWA - MIT 许可 - 工程价值:多模型路由成熟方案,适合 Agent 平台构建者

与 Ollama 关系: - Ollama 适合开发/边缘/CPU - Colibri 适合 25GB RAM 极致内存压缩 + 744B MoE - OmniRoute 适合多模型路由统一 API

  • 与活文档关系:§2.1 推理引擎 6 寡头已收 Colibri + Ollama + LMDeploy + llama.cpp;§1.13 Agent 平台工具链已收 LiteLLM + MCP 2026-07-28 RC 6 件;但 Colibri 14.7k★ + OmniRoute 268+ 提供商 + Quota-aware fallback + RTK+Caveman 压缩 15-95% token 未单独作为「边缘推理里程碑 + Agent 平台工具链成熟」入位

  • 建议归入:§2.1 推理引擎 6 寡头(沿用 Colibri 一行 + 新增「JustVugg/colibri 14.7k★ GitHub Trending 边缘推理里程碑 + OmniRoute 268+ 提供商统一 API 网关(Quota-aware fallback + RTK+Caveman 15-95% token 压缩 + MCP/A2A 协议 + MIT)」小节) + §1.13 Agent 平台工具链(沿用 LiteLLM + 新增 OmniRoute);新增 C77 共识候选:"边缘推理成熟 = Colibri 14.7k★(纯 C 25GB RAM 744B MoE 磁盘流式加载)+ Ollama(开发边缘) + Agent 平台路由成熟 = OmniRoute 268+ 提供商(Quota-aware fallback + RTK+Caveman 15-95% token 压缩 + MCP/A2A)";新增 O149 试金石:"Colibri 纯 C 实现与 llama.cpp GGUF 性能对照;OmniRoute Quota-aware fallback 在生产环境的实际可用性;RTK+Caveman 压缩对推理质量影响量化"


二、旁证(3 条)

旁证 1【稀疏注意力 §2.5 / 视频生成推理】Sol-Attn arXiv:2607.24027 diffusion transformers 注意力稀疏化(★★★)

  • 来源:inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md 第 11 条 Sol-Attn 25▲ 新立(https://arxiv.org/abs/2607.24027)+ organized/knowledge/llm-infra.md §2.5 稀疏注意力 7+3+1 + Hierarchical Landmark + Linear Attention + Mamba-3 + Hybrid SSM
  • 核心贡献:
  • 问题:Diffusion transformers 高保真视频生成,长 token 序列使 attention 成为推理瓶颈
  • 方案:Training-free 动态稀疏 attention,仅计算选定的 key-value blocks
  • 两个挑战:
    • (1) Rigid, unpredictable, costly routing:固定 top-ranked blocks proxy score 强制固定预算;按累计 proxy 概率质量动态但不平衡
    • (2) Sol-Attn 解决方案
  • 意义:video diffusion 模型推理加速 · 与 NSA/HCA/CSA 7 路线 + Hierarchical Landmark 第 7 路线 90%@64× + Simplified Sparse Attention arXiv:2604.20920 Gist Token 32× 互补
  • HF Daily 25▲ = 新立标候选 4/5 · inference-efficient 七联之一
  • 建议归入:§2.5 稀疏注意力(新增「Sol-Attn arXiv:2607.24027 diffusion transformers 注意力稀疏化 25▲ 新立标候选 · training-free dynamic sparse attention + 视频生成推理加速」小节);新增 C78 共识候选:"稀疏注意力 = NSA/HCA/CSA + Hierarchical Landmark + Linear Attention Survey + Simplified Sparse Attention + Mamba-3 + Hybrid SSM + Sol-Attn 视频生成推理 · 2026 H2 视频 LLM 推理瓶颈突破"

旁证 2【推理数据集 / 检索基础】arXiv:2607.24475 KG Historical Doc Retrieval(llm-infra 主分类)+ arXiv:2607.23242 IndicTalk(llm-infra 主分类 benchmark)(★★)

  • 来源:paper_cards/620-2607-24475.md Robust Interpretation of Historical Documents in Knowledge Graphs Through Query Inference and Execution(主分类 llm-infra · 形态 method) + paper_cards/629-2607-23242.md IndicTalk(主分类 llm-infra · 形态 benchmark)+ inbox/tom/2026-07-29-agent-rag-longcontext-radar.md APS-RAG 三路融合等候选
  • 核心要点:
  • 620 (arXiv:2607.24475):面向数字图书馆/历史档案的 agentic retrieval system(查询推断与执行),强调问责与可验证
  • 629 (arXiv:2607.23242):IndicTalk · 印度语系 18 种语言变体 · 13,28,604 条事件接地多轮对话 · 全自动流水线(真实新闻 + 人格化)
  • 意义:主分类 llm-infra 新增 2 件 = llm-infra 系统在非英语种/历史档案等垂直场景的延伸
  • 建议归入:§2.3 KV cache(沿用 14 件套)+ §3.4 开放问题(新增 O150 试金石:"KG Historical Doc Retrieval agentic retrieval system 与现有 agentic RAG 系统的架构差异;IndicTalk 印度语系对话质量对主权开源 MoE 模型的多语言能力补充")

旁证 3【训练基础 / Inference-efficient 邻接】4 件 inference-efficient 邻接(arXiv:2607.18314/24027/23402/23373)(★★)

  • 来源:paper_cards/616-2607-18314.md Interactive Training 2(主分类 engineering · 形态 application)+ paper_cards/626-2607-24027.md Sol-Attn(主分类 multimodal / 邻接 llm-infra)+ paper_cards/628-2607-23402.md Characterizing Warp Divergence(主分类 evaluation · 邻接 llm-infra)+ paper_cards/633-2607-23373.md UltraViT(主分类 multimodal · 邻接 llm-infra)
  • 核心要点:
  • 616 (arXiv:2607.18314) Interactive Training 2:在线模型训练的可审计控制平面(Trainer-specific 共享协议 + Aim workspace 自定义 + humans/automated controllers 同一接口)
  • 628 (arXiv:2607.23402) Characterizing Warp Divergence:Pascal 到 Blackwell GPU warp 分歧特性分析(Ampere/Hopper/Blackwell,cycle-accurate microbenchmarks + hardware counters + SASS 静态分析)
  • 633 (arXiv:2607.23373) UltraViT:面向 LVLM 端侧延迟优化 vision encoder(显式 on-device latency 优化设计 · 此前 vision encoder 多被忽视)
  • 意义:0 件 pure inference-systems 主分类新卡 · 4 件邻接 inference-efficient = inference-systems 主分类暂时沉寂,邻接 4 件覆盖在线训练 + 视频生成 + GPU 微架构 + 端侧 vision encoder
  • 建议归入:§2.4 Kernel/AI 自动化(沿用 Fable 18.71× + Late Chunking + 新增 arXiv:2607.18314 Interactive Training 2 + arXiv:2607.23402 Warp Divergence)+ §2.5 稀疏注意力(沿用 + 新增 Sol-Attn arXiv:2607.24027)+ §2.1 推理引擎 6 寡头(新增 UltraViT 端侧 vision encoder 邻接);新增 O151 试金石:"inference-systems 主分类何时恢复新卡;Interactive Training 2 control plane 与 vLLM/SGLang 训练-部署接口的一致性"

三、警示(2 条)

警示 1【推理引擎 §2.1】⚠️ Tom inference E1 7-29 第三日缺失

  • 来源:inbox/tom/2026-07-29-*rag-e1prep-v48(沿用) + agent-rag-longcontext-radar(沿用)+ hf-daily-2026-07-29(沿用)+ yt-lex-fridman + yt-yannic-kilcher · 无独立 inference-e1prep-v49
  • 警示内容:Tom inference 主题 E1 7-27/7-28/7-29 连续三日缺失(继 7-27 evening 收官后延续低密度状态)
  • 风险:tom inference 主题信号密度从 7-27 4 主线 → 7-28 0 件 → 7-29 0 件 = 信号流失累计
  • 建议行动:spark 本棒补全 4 主线(PagedAttention 2.0 沿用 + Kimi K3 arXiv 立基础 升级 + FlashInfer 集成 + CNCF llm-d);待 tom inference E1 7-30 恢复时核对信号丢失条目

警示 2【Harness Engineering §1.5 / 训练侧 §2.5】⚠️ arXiv:2607.22529 Skill Self-Play 与 arXiv:2607.21503 Agentic Context Management HF Daily 35▲/21▲ 续立候选在 llm-infra.md §2.5 v9 沿用,与 v33 evening 7-26 §2.5 v34 候选链路需复核

  • 来源:inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md 第 8 条 Skill Self-Play 35▲(新立) + 第 15 条 Agentic Context Management 21▲(https://arxiv.org/abs/2607.21503)+ organized/knowledge/llm-infra.md §1.6 Agent 自改进 + Skill Self-Play arXiv:2607.22529 已立(沿用)+ §1.5 Harness Engineering Phase 3 已立
  • 警示内容:
  • Skill Self-Play arXiv:2607.22529 HF Daily 7-29 35▲ 新立(7-28 0 → 7-29 35)
  • Agentic Context Management arXiv:2607.21503 HF Daily 7-29 21▲ 新立(7-28 0 → 7-29 21)
  • 链路复核需求:
  • Skill Self-Play 已入位 §1.6(OpenForgeRL + Skill Self-Play + Self-Improvements Survey 4 线互补)
  • Agentic Context Management arXiv:2607.21503 = 「Agent 记忆与成本视为生命周期与架构问题加以解决」= 与 Lilian Weng Harness Engineering for Self-Improvement 7-29 jay P0 立标 + MSR Memora 谐波记忆 7-29 jay P0 立标 三角互补
  • 风险:arXiv:2607.21503(21▲)与 Lilian Weng + MSR Memora 三角互补关系未单独作为「Harness Engineering Phase 3 学术层三角互补」节点入位
  • 建议行动:v10 活文档接力棒复核 arXiv:2607.21503 Agentic Context Management 与 Harness Engineering Phase 3 学术层三角互补(理论层 Weng + 系统实现层 Memora + 论文层 arXiv:2607.21503);新增 O152 试金石:"arXiv:2607.21503 Agentic Context Management 21▲ 与 MSR Memora 谐波记忆对比:Lifecycle 视角 vs Harmonic Memory 表征"

四、值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险级别 建议行动
1 Kimi K3 Coding/Agentic SOTA 属官方宣传 jay engineering-v39 增量 5 + jay 7-29 five-category-briefing B2 🟡 待核实 需第三方评测(LiveBench / BFCL / TEA 对照)
2 Kimi K3 MXFP4 量化精度损失实测数据缺失 jay engineering-v39 增量 5 🟡 待核实 等 vLLM/SGLang 官方 benchmark 或第三方评测
3 Kimi K3 vLLM/SGLang 官方支持时间线未确认 jay engineering-v39 增量 5 后续行动 + jay 7-29 five-category-briefing B2 🟡 待核实 跟进 vLLM GitHub Issues + SGLang Release Notes
4 FlashInfer 29-69% latency 降低 数据来自 arXiv 2606.20295v2,需对照 SGLang/vLLM 官方 benchmark 确认测试条件 jay engineering-v39 增量 4 🟡 待核实 序列长度、batch size、GPU 类型条件确认
5 CNCF llm-d B200 wide-EP 3.1k tok/s per GPU + 16×16 B200 50k output tok/s 数据来自 CNCF 官方博客,需第三方验证 jay 1506 five-category-briefing-p2 Cloud-Native C1 🟡 待核实 对照 vLLM 官方 benchmark + SkyPilot 等独立测试
6 vLLM Conference 2026 Roadmap Speculative decoding 1000+ TPS 目标尚未实测 jay 1105 five-category-briefing Backend B6 🟢 远期目标 跟踪 vLLM 0.6+ 实际发布时间线
7 NVIDIA Dynamo 跨节点编排层 2026 H2 实际生产可用性待验证 jay 1506 five-category-briefing-p2 Backend B3 🟡 待核实 100+ 节点实际部署案例
8 Colibri 14.7k★ 纯 C 25GB RAM 744B MoE 性能 vs llama.cpp GGUF 对照缺失 jay 1105 five-category-briefing Backend B1 🟡 待核实 第三方基准测试
9 OmniRoute 268+ 提供商 Quota-aware fallback + RTK+Caveman 压缩 15-95% 实测数据待核 jay 1105 five-category-briefing Backend B3 🟡 待核实 GitHub Issues + 独立评测
10 arXiv:2607.21503 Agentic Context Management 21▲ 与 Lilian Weng Harness Engineering + MSR Memora 三角互补关系尚未在活文档立标 tom HF Daily 7-29 + jay engineering-v39 🟡 链路缺失 v10 活文档接力棒复核

五、本次涉及 arXiv 号列表

arXiv 号 论文/主题 增量归属 建议归位节
2607.24653 Kimi K3 开放前沿智能(首个 arXiv 编号正式披露) 增量 1 §2.1 推理引擎 6 寡头 / §2.9 量化经济学
2510.09665 LMCache 跨引擎 KV 缓存 crash-safe 实测(沿用 7-28 evening) 横向参照 §2.3 KV cache 三层算力栈
2606.20295v2 Token-Operations-Oriented Inference Optimization(FlashInfer→SGLang/vLLM) 增量 3 §2.3 KV cache
2607.18141 HyMCache CXL 三层 KV cache(已在 llm-infra.md §9,横向参照) §2.3/§9 横向
2607.24475 KG Historical Doc Retrieval agentic retrieval 问责 旁证 2 §3.4 开放问题 O150
2607.23242 IndicTalk 印度语系混合代码对话 benchmark 旁证 2 §3.4 开放问题 O150
2607.18314 Interactive Training 2 在线训练可审计控制平面 旁证 3 §2.4 Kernel
2607.24027 Sol-Attn diffusion transformers 注意力稀疏化 25▲ 旁证 1/3 §2.5 稀疏注意力
2607.23402 Characterizing Warp Divergence Pascal 到 Blackwell 旁证 3 §2.4 Kernel
2607.23373 UltraViT 端侧延迟优化 vision encoder 旁证 3 §2.1 推理引擎
2607.22529 Skill Self-Play(沿用 v9 §1.6,警示 2) 警示 2 §1.6 Agent 自改进
2607.21503 Agentic Context Management(警示 2) 警示 2 §1.5 Harness Engineering
2607.24593 PIVOT Token 级稀疏注意力索引(jay engineering-v39 P1,沿用) 横向参照 §2.5 稀疏注意力
2607.24720 Physics of Multi-Turn Planning(jay engineering-v39 P1,沿用) 横向参照 §2.5 训练侧
2605.01280 MathOpt Chen et al. 2026 Ω(√(B log G))(沿用) 横向参照 §2.2 调度

六、已检查来源清单

以下来源经本次扫描确认无 llm-infra 主题新增或已在上方增量中覆盖,避免重复检索:

  • inbox/jay/2026-07-29-1055-jay-engineering-filter-rss-round.md → Harness Engineering / Memora / uv 0.12.0 / PIVOT(已并入 agent / engineering 主题,非 llm-infra 主题主线)
  • inbox/jay/2026-07-29-0822-csdn-rag-agent-multimodal.md → RAG/Agent 主题
  • inbox/jay/2026-07-29-0940-july2026-github-trending-vecdb-substack-engineering.md → Vector DB + Substack 工程(已纳入增量 7 Colibri/OmniRoute)
  • inbox/jay/2026-07-29-1105-rag-agent-csdn-survey.md → RAG/Agent CSDN 主题
  • inbox/jay/2026-07-29-1455-jay-engineering-filter.md → vLLM vs Ollama vs TensorRT-LLM(已并入增量 5)+ RAG 7 failure points(已并入 RAG 主题)
  • inbox/jay/2026-07-29-1505-jay-briefing-inference-rag-agent-mutlimodal-stack.md → 推理工程分类(已并入增量 4 vLLM Conference Roadmap + 增量 5 Ollama vs vLLM)+ RAG/Agent 主题
  • inbox/jay/2026-07-29-1506-jay-five-category-briefing-p2.md → Database/Backend/Cloud-Native/CSDN/Reproduction(已并入增量 6 CNCF llm-d / Kthena)+ 旁证 LogicalRAG/TechRAG/MC-Search/HF Agent 入侵/HotInfra PIM
  • inbox/jay/2026-07-29-1620-jay-engineering-filter-rss-fresh.md → ByteByteGo DoorDash/Instacart/Uber Eats / Raschka 控制推理强度 / 本地 Coding Agent / KV Sharing mHC(非 llm-infra 主题主线)
  • inbox/jay/2026-07-29-1735-jay-evening-hn-trending-raschka-codex-sqlite.md → Kimi K3 Architecture(已并入增量 2)+ OpenAI Codex Security(security 主题)+ SQLite WAL(数据库优化)
  • inbox/tom/2026-07-29-0853-rag-e1prep-v48.md → RAG 主题
  • inbox/tom/2026-07-29-0900-hf-daily-2026-07-29.md → 15 件全核(已纳入增量 1 Kimi K3 + 警示 2 + 旁证 1 Sol-Attn)
  • inbox/tom/2026-07-29-agent-rag-longcontext-radar.md → Agent/RAG 主题
  • inbox/flyp/2026-07-29-0950-multimodal-e1prep-v34.md → multimodal 主题
  • inbox/flyp/2026-07-29-1550-WorldDiT-unified-diffusion-VLA-critical-read.md → multimodal 主题
  • inbox/flyp/2026-07-29-long-context-multimodal-rag-dual-review.md → multimodal + RAG 主题
  • inbox/spark/2026-07-29-1004-rss-gradient-flow.md → RSS 通稿(沿用 Kimi K3)
  • inbox/spark/2026-07-29-1005-rss-chip-huyen.md → RSS 通稿(无 llm-infra 主题)
  • inbox/spark/2026-07-29-1008-rss-yt-3blue1brown.md → RSS 通稿(无 llm-infra 主题)
  • inbox/spark/2026-07-29-1337-agent-e1prep.md → Agent 主题(已纳入增量 1 Kimi K3 arXiv:2607.24653)
  • inbox/stephen/2026-07-29-0910-news-x-vip-radar.md → frontier/industry 立标(沿用 Kimi K3 + Anthropic Dario)
  • inbox/stephen/2026-07-29-1006/1007/1009-news-*.md → news 通稿(已纳入增量 1 Kimi K3 + 警示 2 Agentic Context Management 沿用)
  • inbox/stephen/2026-07-29-1025-ai-industry-e1prep-v31.md → ai-industry 主题(已纳入增量 1 Kimi K3 + Anthropic Dario 7-27~28 澄清)
  • inbox/stephen/2026-07-29-1245-stephen-coordination-check-noon.md → 协调棒(已纳入增量 1 Kimi K3 + 警示 2 + 8 大主题活文档接力窗口)
  • paper_cards/602-642 近 3 天共 41 张新卡 → 主分类 0 张 inference-systems(已纳入旁证 2 主分类 llm-infra 2 张 + 旁证 3 邻接 inference-efficient 4 张);邻接 llm-infra 主分类 2 张(620 + 629)+ 邻接 4 张 inference-efficient(616 + 626 + 628 + 633)+ 邻接 1 张 engineering(635 HiFi-UMI / 617 DataPrep-Bench)+ 工程主题 arXiv:2607.18314 Interactive Training 2 / 626 Sol-Attn 视频生成 / 632 WorldDiT VLA / 633 UltraViT = 共 7 件邻接

七、本次 E1 预消化结论

增量条数:7 主线 + 3 旁证 + 2 警示

结论:llm-infra 主题 7-28 18:40 → 7-29 18:40 约 24h 窗口为中密度,主因是 Kimi K3 arXiv:2607.24653 立基础(7-29 HF Daily 263▲ 单日 +121 暴增 85%)+ Raschka Kimi K3 Architecture Notes 419 分 HN Trending(四大新组件完整披露)+ FlashInfer→SGLang/vLLM 集成数据(arXiv:2606.20295v2 inter-token -29-69%)+ vLLM Conference 2026 Roadmap(Ray Summit)+ SGLang vs vLLM 2026 深度对比(L40 1-100 并发数据 + Fish Audio 16%)+ CNCF llm-d v0.7 + Kthena Volcano(B200 wide-EP 3.1k tok/s per GPU)+ Colibri 14.7k★ + OmniRoute 268+ 提供商统一 API 网关 = 7 主线立标级增量。同时警示 tom inference E1 第三日缺失 + arXiv:2607.22529 Skill Self-Play 与 arXiv:2607.21503 Agentic Context Management HF Daily 35▲/21▲ 续立候选在活文档 §1.6/§1.5 沿用但链路需复核。无 pure inference-systems 主分类新卡(0 张)是本场重要信号——7-27~29 的 research frontier 集中在 multimodal / agent / engineering / llm-application 主题,inference-systems 主分类继续沉寂。

建议今晚活文档 v33/v10 接力动作: 1. Kimi K3 arXiv:2607.24653 立基础升级入 §2.1(主权开源 2.0 立标级续立升级 · 263▲ +121 暴增 · 12 实例同步承接) 2. Raschka Kimi K3 Architecture Notes 完整披露入 §2.1(419 分 HN Trending · LatentMoE/NoPE/KDA/AttnRes 四大新组件) 3. FlashInfer→SGLang/vLLM 集成数据入 §2.3(arXiv:2606.20295v2 · inter-token -29-69% · 与 PagedAttention 2.0 互补) 4. vLLM Conference 2026 Roadmap入 §2.1(Ray Summit · Disaggregated + Multi-tier KV offload + Spec 1000+ TPS) 5. SGLang vs vLLM 2026 深度对比入 §2.1/§2.13(L40 1-100 并发 + Fish Audio 16% + HF TGI 维护模式 + NVIDIA Dynamo + ICML 2026 TwELL) 6. CNCF llm-d v0.7 + Kthena Volcano入 §2.6(CNCF Sandbox + B200 wide-EP 3.1k tok/s + 16×16 B200 50k output tok/s) 7. Colibri 14.7k★ + OmniRoute 268+入 §2.1/§1.13(纯 C 25GB 744B MoE 边缘推理 + Quota-aware fallback + RTK+Caveman 15-95% token) 8. C71-C78 共识 + O143-O152 试金石写入对应候选池