llm-infra · E1 预消化简报(2026-07-30)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 11 棒 · 7-30 晚间活文档接力备料) 覆盖时段:2026-07-29 18:40 → 2026-07-30 18:40(约 24 小时增量) 基线:
organized/knowledge/llm-infra.mdWave3 §VII 32 轮抢修完成版(2026-07-29 05:00 收官 · 11+1 维全景 + C1-C66 共 66 条共识 + D1-D32 共 32 条争议 + O1-O140 共 140 条开放问题 + T1-T27 共 27 条趋势)—— 7-29 evening spark E1 第 10 棒(7 主线 + 3 旁证 + 2 警示)已并入活文档 v33 接力基线 · 7-30 morning spark 仅 3 RSS 通稿无独立 E1 产出 = 节奏反转第 6 棒静默期(本棒恢复) 覆盖来源: - inbox/jay 7-29 evening → 7-30 18:40 共 16 件(0822 llm-inference-optimization-stack-csdn-deploybase 13.1KB · 0936 ai-engineering-trending · 1000 RSS bytebytego/nathan-benaich/raschka/simon-willison × 4 · 1003 RSS cool-papers/cool-papers-ir/lilian-weng × 3 · 1004 rss-msr-blog · 1005 rss-import-ai · 1007 RSS yt-fireship/yt-karpathy × 2 · 1105 five-category-briefing #3 14KB · 1124 engineering-e1prep-v40 33.2KB · 1140 news-x-tech-radar · 1221 csdn-inference-rag-moe-highvalue 9.1KB · 1508 five-category-briefing #15 下午档 · llm-infra 主线专属 2 件:1508 briefing #15 + 0822 csdn-deploybase + 1221 csdn-inference-rag-moe = jay 三棒 23.2KB 推理引擎/CSDN 主战场) - inbox/tom 7-29 evening → 7-30 共 6 件(7-29 evening inference-e1prep 5.1KB · 继 7-27/7-28 双日缺失 + 7-29 单日恢复后 7-30 noon radar + RAG E1 + HF Daily 7-30 票榜 · ⚠️ tom 7-30 inference E1 连续 4 日缺失信号延续第 5 日) - inbox/flyp 7-29 evening → 7-30 共 8 件(multimodal-v34 + ReMemR1 v5 ICLR 2026 精读 + M3Exam 轻评 + 4 RSS · 0 件 llm-infra 主线) - inbox/spark 7-29 evening → 7-30 共 5 件(1004 gradient-flow · 1005 chip-huyen · 1008 yt-3blue1brown + 1337 agent-e1prep + 本棒 llm-infra-e1prep-v11) - inbox/stephen 7-29 evening → 7-30 共 11 件(0910 news-x-vip-radar · 1005 news-anthropic/openai · 1006 news-google/deepmind/hf-blog/tldr-ai/bens-bites · 1007 news-yt-openai · 1008 news-yt-anthropic/deepmind · 1026 ai-industry-e1prep-v32 · 1245 coordination-check-noon) - paper_cards 7-29 evening → 7-30 18:40 新卡 IDs 644-665 共 22 张,主分类 llm-infra 新增 1 张 = 657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎(副分类 llm-infra 0 张 · 邻接 inference-efficient 0 张新卡 · 主分类 engineering 645+646+647 + 656 Agent Retrieval Bench 主分类 agent 邻接 llm-infra) 结论:中密度(6 主线 + 3 旁证 + 1 警示),核心动作 = (1) jay 1508 briefing #15 下午档 llm-infra 主线 6 件立标级增量(SIGMOD 2026 OmniServe 异构 CPU-GPU 推理 + SLO + Blink CPU-Free + SmartNIC/RDMA/GPU-resident + SIGCOMM 2026 KVServe/SpectrumKV disagg 通信优化 + Flow-Controlled 调度 arXiv:2604.11001 可证稳定性 + FlashInfer NVIDIA 官方 B200 默认架构 + SGLang vs vLLM 2026 场景化决策树 SGLang 29% + DeepSeek 3.1× MLA);(2) llm-d 7-30 持续活跃(官方博客 KV cache offloading 跨 vLLM 实例 + v0.7 scale-to-zero + active-active HA + cache-aware LoRA 路由)+ NVIDIA Dynamo RDMA/NVMe-oF 跨实例 KV cache + Kthena Volcano 互补编排层;(3) GitHub Trending 7-30 工程化亮点(MoonshotAI/FlashKDA 990★ Kimi Delta Attention 高性能 CUDA kernel + Colibri 纯 C 推理引擎 744B MoE 25GB RAM + OpenWork 17.9k★ Claude Cowork 开源替代 + AIRI 45k★ 自托管 AI companion);(4) DeepSeek V4 完整架构披露(CSDN · mHC + Engram + DSA 三联 · 1.6T 总参 / 49B 激活 / 1M context · 国产算力大规模训练首次全面适配昇腾);(5) CSDN HIXL + Mooncake + vLLM V1 Connector 联创实测 TTFT +40%(昇腾 CANN 池化传输 · Mooncake Transfer Engine 集成);(6) vLLM/SGLang 推理引擎实战 2026 选型决策树升级(PremAI / Spheron / LeetLLM / Particula 多源 · SGLang RadixAttention H100 29% 优势 + DeepSeek MLA 3.1× + 边缘 28min TRT-LLM 编译代价 + Ollama 本地定位 + vLLM 通用生产首选) + 3 旁证:paper_cards/657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎(主分类 llm-infra 7-29 evening 立基础) + NVIDIA Dynamo RDMA/NVMe-oF/S3 KV cache 跨 GPU 传输 与 llm-d 跨硬件抽象互补 + CSDN 昇腾 SGLang + 昇腾 NPU 完整运行流程(torch_npu-2.6.0 + CANN 对齐 + SGLang vs vLLM-Ascend Qwen3-8B 高并发 1.2-1.35× · TTFT 更低 · KV cache 复用更激进) + 1 警示:tom 7-30 inference E1 连续 4 日缺失延续第 5 日 + spark 7-30 morning 节奏反转后第 6 棒静默期(本棒恢复 · 但 7-30 morning 0 件独立 E1 · 7-29 evening 双 E1 完整恢复判断修正为「节奏反转第 5 棒后第 6 棒静默」)
一、核心增量(6 主线 + 3 旁证 + 1 警示,按活文档归位顺序)
增量 1【推理引擎 §2.1 / 调度 §2.2 / 选型决策树 §2.13】jay 1508 briefing #15 llm-infra 主线 6 件立标级(SIGMOD/SIGCOMM 2026 顶级会议 + FlashInfer NVIDIA 官方 + SGLang vs vLLM 2026 决策树 v2)(★★ 必补)
- 来源:
inbox/jay/2026-07-30-1508-jay-five-category-briefing.mdBackend B1 OmniServe + B2 Blink + B3 KVServe/SpectrumKV + B4 Flow-Controlled + B5 Fish Audio + B6 SGLang vs vLLM(完整展开)+ Cloud-Native C1 llm-d + C2 NVIDIA Dynamo(7 月活跃)· 沿用inbox/jay/2026-07-30-1105-jay-five-category-briefing.md#3 早间档 Cloud-Native C1 llm-d · Backend B7 vLLM K8s 自动扩缩容· 沿用inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md第 1 框架横评 + 第 6-7 行业基准·organized/knowledge/llm-infra.md§2.1 vLLM v0.19.0/0.25.1/MRV2 + V1 connector + §2.2 调度 9 学派 + Disagg 5 节点 + §2.13 选型决策树 2026 中期 + §2.7 vLLM K8s OOM runbook 已收
jay 1508 briefing 6 件 llm-infra 主线增量完整展开:
B1 OmniServe · SIGMOD 2026 · 异构 CPU-GPU 混合 LLM 推理 + SLO 保证(⭐⭐⭐⭐⭐)
- 核心问题:数据中心同时服务 Latency-Sensitive (LS) 和 Best-Effort (BE) 两种 LLM 负载,如何在 CPU-GPU 异构环境下保证 SLO
- 创新点:
- Attention Piggybacking:将 CPU Attention 计算与 GPU 推理解耦,CPU 不再是旁观者而是并行参与者
- 异步流水线设计:CPU 和 GPU 同时处理 BE 服务,通过等待队列协调
- BE 服务利用 CPU 执行 attention,LS 服务独占 GPU,SLO 保障延迟敏感型请求
- 动态 batching 控制策略,根据 SLO deadline 优先级调度
- 与 llm-d 关系:OmniServe 解决单节点 CPU-GPU 异构的混合负载调度;llm-d 解决跨 vLLM 实例的 KV cache 共享;两者互补构成完整 disaggregated inference 解决方案
- arXiv:https://arxiv.org/pdf/2603.12831
B2 Blink · arXiv:2604.07601 · CPU-Free LLM Inference(将 serving stack 完全委托给 GPU + SmartNIC)(⭐⭐⭐⭐)
- 核心贡献:识别现代 LLM serving 系统依赖 host-CPU 驱动的细粒度控制为关键瓶颈,提出 Blink——将 host CPU 从稳态推理关键路径中移除
- 四大创新:
1. SmartNIC 驻留 ingress:网卡处理请求接入,无需 CPU 参与
2. 零拷贝 RDMA 直接写入 GPU 内存:绕过 CPU DRAM
3. GPU 驻留持久化调度器:continuous batching、KV-cache 管理、token 生成全在 GPU 侧
4. 消除 CPU 干扰:稳态推理全程无需 host CPU
- 核心洞察:"控制路径依赖"(control-path dependence)是 CPU 成为瓶颈的根本原因
- 适用场景:超低延迟高吞吐场景
- arXiv:https://arxiv.org/html/2604.07609v1
B3 KVServe + SpectrumKV · SIGCOMM 2026 · disaggregated LLM serving 通信优化(⭐⭐⭐⭐⭐)
- KVServe(https://arxiv.org/abs/2606.29708):通信感知的 KV cache 压缩,实现 disaggregated LLM serving 高效传输
- SpectrumKV(https://arxiv.org/abs/2606.08635):per-token 混合精度 KV cache 传输,专门优化 prefill-decode 分离架构的传输开销
- 两篇均针对 disaggregated 架构(PD 分离)中的 KV cache 网络传输瓶颈,是 llm-d、Mooncake 等系统面临的共性问题
B4 Flow-Controlled Scheduling for LLM Inference · arXiv:2604.11001 · 可证稳定性(⭐⭐⭐⭐)
- 核心贡献:建立任何稳定系统必须满足的必要条件:当期望工作负载超过 KV cache 容量时,任何调度算法都无法防止延迟无限增长
- 提出 Flow-Controlled 调度算法,平滑激活新请求,在特定负载条件下可证稳定
- 刻画系统不稳定的充分条件(延迟无界增长)
- 工程意义:为生产系统提供调度策略的理论下界,不能靠经验参数规避根本性的资源约束问题
- arXiv:https://arxiv.org/html/2604.11001v1
B5/B6 FlashInfer 架构深度解析 · NVIDIA 官方 + SGLang vs vLLM 2026 场景化决策树(⭐⭐⭐⭐⭐)
- FlashInfer NVIDIA 官方定位(jay 1508 briefing B7 沿用):
- vLLM Blackwell (B200/B300):FlashInfer 为默认 attention backend
- vLLM Hopper (H100/H200):FlashAttention 默认;VLLM_ATTENTION_BACKEND=FLASHINFER 可选开启
- SGLang Hopper + Blackwell:FlashInfer 均为默认,且有 DeepSeek MLA 专用 kernel 路径
- FlashInfer 四大 Operator 家族:
1. Attention:batch decode(32K shared prefix @ batch 256 → 31× speedup over PagedAttention)
2. GEMM:矩阵乘法 kernel
3. Communication:分布式推理集合通信
4. Sampling:token 采样和采样参数生成
- FlashInfer + CUDAGraph 调度:两阶段 pattern——plan() 阶段检查请求形状并计算均衡调度元数据,run() 阶段执行;解决 CUDAGraph 静态配置 vs LLM 请求序列长度动态变化矛盾
- SGLang vs vLLM 2026 场景化决策树(Particula Tech 实测多源交叉):
- SGLang 在 H100 上吞吐量比 vLLM 高 29%(标准工作负载)
- 但差距在 unique-prompt batch 上趋近于零
- 在前缀密集型 RAG pipeline 上扩大到 6×
- DeepSeek MLA 专用 kernel:SGLang 比 vLLM 快 3.1×(MLA kernel 优化)
- SGLang Fish Audio 实测:吞吐快 16%,TTFT p99 13.1ms vs 23.6ms
- 关键结论:正确选择取决于工作负载形状,而非泛化比较
- NVIDIA 官方引用:https://developer.nvidia.com/blog/run-high-performance-llm-inference-kernels-from-nvidia-using-flashinfer
- Particula Tech:https://particula.tech/blog/sglang-vs-vllm-inference-engine-comparison
与活文档关系:§2.1 vLLM v0.19.0/v0.25.1/MRV2/V1 connector 已收 + §2.2 调度 9 学派 + Disagg 5 节点已收 + §2.13 选型决策树 2026 中期已收 + §2.7 vLLM K8s OOM runbook 已收;但 SIGMOD 2026 OmniServe(异构 CPU-GPU + Attention Piggybacking)+ Blink arXiv:2604.07601(CPU-Free SmartNIC + GPU-resident 调度器 + 零拷贝 RDMA)+ SIGCOMM 2026 KVServe + SpectrumKV(per-token 混合精度 KV cache 传输)+ Flow-Controlled arXiv:2604.11001(可证稳定性下界)+ FlashInfer NVIDIA 官方 B200 默认 + SGLang vs vLLM 2026 场景化决策树 v2(SGLang 29% + DeepSeek 3.1× + 6× 前缀密集)+ SGLang Fish Audio 16% 未单独作为「2026 顶级会议推理优化 6 件套」入位
- 建议归入:§2.1 推理引擎(新增「SIGMOD/SIGCOMM 2026 顶级会议推理优化 6 件套(OmniServe 异构 CPU-GPU + Blink CPU-Free SmartNIC + KVServe/SpectrumKV disagg 通信 + Flow-Controlled 可证稳定性下界 + FlashInfer NVIDIA 官方 B200 默认 + SGLang 29%/DeepSeek 3.1×/Fish Audio 16% 场景化决策树 v2)」小节)+ §2.2 调度(沿用 Disagg 5 节点 + 新增 Flow-Controlled 可证稳定性下界 + SGLang 断路器)+ §2.13 选型决策树(升级为 v2.0「工作负载形状驱动 + 六维方法论 + 顶级会议基准」);新增 C78 共识候选:"2026 顶级会议推理优化 6 件套 = OmniServe(SIGMOD 异构 CPU-GPU)+ Blink arXiv:2604.07601(CPU-Free SmartNIC)+ KVServe/SpectrumKV(SIGCOMM disagg 通信)+ Flow-Controlled arXiv:2604.11001(可证稳定性下界)+ FlashInfer NVIDIA 官方 B200 默认 + SGLang vs vLLM 场景化决策树 v2(SGLang 29%/DeepSeek 3.1×/Fish Audio 16%/6× 前缀密集)";新增 O153 试金石:"OmniServe Attention Piggybacking 在 H100/H200/B200 实测 CPU 解放度;Blink GPU-resident 调度器在 1M context 长上下文实测;Flow-Controlled 平滑激活 vs vLLM 实际 SLO 违例率对照;SGLang vs vLLM 在 1M context Kimi K3 实测差异"
增量 2【Cloud-Native §2.6 / 推理调度 §2.2】llm-d 7-30 持续活跃 + NVIDIA Dynamo RDMA/NVMe-oF KV cache 跨 GPU 传输 + Kthena Volcano 互补编排层(★ 必补)
- 来源:
inbox/jay/2026-07-30-1508-jay-five-category-briefing.mdCloud-Native C1 llm-d + C2 NVIDIA Dynamo(7 月活跃)+inbox/jay/2026-07-30-1105-jay-five-category-briefing.mdCloud-Native C1 llm-d 早间档(沿用)+inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md沿用inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md沿用 +organized/knowledge/llm-infra.md§2.6 Cloud-Native llm-d K8s OOM runbook 已收(7-26 evening) + Kthena Volcano 互补编排层已收(7-29 evening 增量 6);7-30 llm-d 官方博客「Serving Hybrid Models at Scale」+ 跨 vLLM 实例 KV cache offloading 完整展开 + v0.7 完整特性(scale-to-zero + active-active HA + cache-aware LoRA 路由)+ Dynamo 7 月持续更新 RDMA/NVMe-oF/S3 跨 GPU 传输 + NIXL library 标准化未单独作为「K8s 推理部署事实标准方向盘 7-30 升级」入位
llm-d 7-30 持续活跃完整展开:
- 2026-07 情报:llm-d 持续活跃(2026-03 入 CNCF Sandbox),2026-07 新进展:
- 官方博客「Serving Hybrid Models at Scale」+ KV cache offloading 系列详细阐述跨 vLLM 实例 KV cache 共享的工程挑战:
- 问题:每个 vLLM 实例的 KV cache 是本地的,跨节点无法共享;本地 cache 容量有限
- 解决:KV cache offload 到存储层(任意文件系统) + 同时实现跨实例共享
- 关键设计:KVConnector 接口 + 任意文件系统后端(S3 / Redis / 本地 SSD)
- 与 vLLM + LMCache 的关系:llm-d 在更高层抽象做全局 cache 协调,LMCache 做单实例 offloading
- v0.7(2026-05)关键特性(沿用 + 强化):
- 可复现 benchmark workflow
- 层级 KV offloading
- cache-aware LoRA 路由
- active-active HA
- scale-to-zero 自动扩缩容(待核实冷启动 SLA)
- 关键数字(B200 拓扑):单 decode GPU ~3.1k tok/s · 16×16 B200 prefill/decode 拓扑最高 50k output tok/s · TTFT 降低一个数量级
- 引用:https://llm-d.ai/blog/tags/kv-cache · https://github.com/llm-d/llm-d
NVIDIA Dynamo 7 月活跃完整展开:
- Dynamo 7 月持续更新:
- disaggregated prefill/decode:PD 分离架构,KV cache 通过 RDMA / NVMe-oF / S3 跨 GPU 传输
- NIXL library:标准化跨加速器栈的集合通信
- KV cache 跨实例共享 + 层级 offloading
- 与 llm-d 关系:两者功能高度重叠但定位不同——Dynamo 偏 NVIDIA 自有硬件生态优化,llm-d 偏跨硬件平台抽象
- 引用:https://www.backend.ai/blog/2026-04-how-to-save-gpu-memory-in-llm-serving-kv-cache-offloading
与活文档关系:§2.6 Cloud-Native llm-d 已收 + §2.2 Kthena Volcano 互补编排层已收(7-29 evening 增量 6);但 7-30 llm-d 持续活跃(官方博客「Serving Hybrid Models at Scale」+ KV cache offloading 系列 + KVConnector 接口 + 任意文件系统后端)+ NVIDIA Dynamo RDMA/NVMe-oF/S3 跨 GPU 传输 + NIXL library 标准化未单独作为「K8s 推理部署事实标准方向盘 7-30 升级」入位
- 建议归入:§2.6 Cloud-Native(沿用 + 强化 llm-d 7-30 持续活跃 + Dynamo RDMA/NVMe-oF 跨 GPU 传输) + §2.2 调度(沿用 Disagg 5 节点 + 强化 Kthena Volcano 编排层);新增 C79 共识候选:"K8s 推理部署事实标准方向盘 7-30 升级 = llm-d 官方博客 KV cache offloading(KVConnector + 任意文件系统后端 + LMCache 单实例 offloading 互补)+ NVIDIA Dynamo RDMA/NVMe-oF 跨 GPU 传输(NIXL library 标准化 · NVIDIA 硬件优化 vs llm-d 跨硬件抽象);新增 O154 试金石:"llm-d v0.7 scale-to-zero 冷启动 SLA 在交互式应用场景的实际可用性;Dynamo 与 llm-d 在 NVIDIA H100/B200 混合集群的标准化收敛"
增量 3【推理引擎 §2.1 / Kernel §2.4】GitHub Trending 7-30 工程化亮点 MoonshotAI/FlashKDA 990★ + Colibri 纯 C 744B MoE 25GB RAM + AIRI/OpenWork 边缘(★ 必补)
- 来源:
inbox/jay/2026-07-30-0936-ai-engineering-trending.mdGitHub Trending 7-30 日榜(沿用 jay engineering-e1prep-v40 增量 3)+inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md沿用 +inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.mdColibri 沿用 +organized/knowledge/llm-infra.md§2.1 推理引擎 6 寡头已收 Colibri/Ollama/LMDeploy/llama.cpp(7-29 evening 增量 7);FlashKDA MoonshotAI Kimi Delta Attention CUDA kernel 990★ + AIRI 45k★ + OpenWork 17.9k★ + VibeVoice Microsoft 未单独作为「Moonshot AI 推理优化外显 + 边缘 AI companion 开源生态成熟」入位
GitHub Trending 7-30 llm-infra 邻接 4 件亮点完整展开: - FlashKDA(MoonshotAI · 990⭐):Kimi Delta Attention 高性能 CUDA kernel · FP8 MoE 优化;工程意义:Moonshot AI 推理优化能力外显 · 国产 CUDA kernel 开源 = Kimi K3 主权开源 2.0 立标后 MoonshotAI 工程化实施层二次立基础 - Colibri(Analytics Vidhya Top 10 · 纯 C 推理引擎 · 零依赖):744B MoE 模型可流式调度专家模块从磁盘加载 · 25GB RAM 消费级硬件运行;工程意义:极致轻量推理引擎,边缘部署潜力巨大(7-29 evening 已立标 · 本棒 7-30 GitHub Trending July 2026 续立) - AIRI(moeru-ai · 45,391⭐):自托管 AI companion,支持实时语音/Minecraft/Factorio,类似 Neuro-sama;工程意义:自托管 AI companion 开源替代方案 · 实时交互工程化 - OpenWork(different-ai · 17,934⭐):Claude Cowork 开源替代;工程意义:企业协作 Agent 竞品 · 17.9k⭐ 说明市场需求强烈
额外亮点(Analytics Vidhya GitHub Trending July 2026 Top 10): - Strix(#1):AI 渗透测试 Agent,自动发现和验证漏洞 - Grok Build(#2):xAI 开源 Coding Agent CLI,完整 MCP 支持 - VibeVoice:Microsoft 前沿开源语音 AI - Codebase Memory MCP(#4):Agent 记忆层,持久化整个代码库上下文 - OmniRoute(#8):AI 网关,单 API 路由 200+ AI 提供商(7-29 evening 已立标)
-
与活文档关系:§2.1 推理引擎 6 寡头已收 Colibri/Ollama/LMDeploy/llama.cpp(7-29 evening 增量 7);§2.1 Kimi K3 2.8T MoE 主权开源 2.0 立标已收(7-27 增量 1);§1.13 Agent 平台工具链已收 OmniRoute;但 FlashKDA MoonshotAI 990★ Kimi Delta Attention CUDA kernel + AIRI 45k★ 自托管 AI companion + OpenWork 17.9k★ Claude Cowork 开源替代 + VibeVoice Microsoft 未单独作为「Moonshot AI 推理优化外显 + 边缘 AI companion 开源生态成熟」入位
-
建议归入:§2.1 推理引擎(新增「GitHub Trending 7-30 MoonshotAI/FlashKDA 990★ Kimi Delta Attention CUDA kernel + Colibri 纯 C 744B MoE 25GB RAM + AIRI 45k★ + OpenWork 17.9k★ + VibeVoice Microsoft」小节)+ §2.4 Kernel/AI 自动化(沿用 + 新增 FlashKDA 作为 MoonshotAI Kimi Delta Attention 工程化实施层二次立基础);新增 C80 共识候选:"推理引擎开源生态 = MoonshotAI/FlashKDA 990★(Kimi Delta Attention CUDA kernel · 主权开源 2.0 工程化实施层)+ Colibri 纯 C 744B MoE 25GB RAM(Analytics Vidhya Top 10 · 极致轻量)+ AIRI 45k★ 自托管 AI companion + OpenWork 17.9k★ Claude Cowork 开源替代 + VibeVoice Microsoft 语音";新增 O155 试金石:"FlashKDA 与 Triton Attention kernel arXiv:2511.11581 性能对照;Colibri 纯 C vs llama.cpp GGUF 在 25GB RAM 极限场景的实际吞吐;AIRI 实时语音/Minecraft 交互延迟"
增量 4【推理引擎 §2.1 / 模型发布 / 架构解析 §2.5】DeepSeek V4 完整架构披露 CSDN · mHC + Engram + DSA 三联 · 1.6T 总参 / 49B 激活 / 1M context(★ 必补)
- 来源:
inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md第 7 条「DeepSeek V4 深度解析(DeepSeek CSDN 技术社区)」· 2026 年 4 月发布 V4 预览版 +organized/knowledge/llm-infra.md§2.1 DeepSeek-V4 沿用 + §2.5 稀疏注意力 7+3+1 沿用
DeepSeek V4 完整架构披露展开: - 总参数:1.6T(v3 671B → v4 1.6T = 2.4× 扩张) - 激活参数:49B(v3 37B → v4 49B = 1.3× 扩张) - 上下文:1M tokens(v3 128K → v4 1M = 8× 扩张) - 发布时间:V4 预览版 2026-04 · V3 2024-12 - 三大核心架构创新: 1. mHC(multi-head Centralized attention):新注意力机制 2. Engram(记忆架构):新型记忆机制 3. DSA(稀疏注意力):稀疏注意力优化 - 国产算力适配:首次大规模训练全面适配华为昇腾
与 Kimi K3 主权开源 2.0 立标对位: - Kimi K3 = 2.8T 总参 / 104B 激活 / 1M context / MoonshotAI - DeepSeek V4 = 1.6T 总参 / 49B 激活 / 1M context / DeepSeek - 主权开源 2.0 立标级续立 = Kimi K3 + DeepSeek V4 双主线对立(参数规模 / 激活比例 / 上下文 / 国产算力适配) - DSA 稀疏注意力与 Kimi K3 KDA + AttnRes 路径趋同(都是注意力效率优化)
-
与活文档关系:§2.1 推理引擎 6 寡头 Kimi K3 2.8T MoE 主权开源 2.0 立标已收(7-27 增量 1)+ §2.5 稀疏注意力 7+3+1 已收;但 DeepSeek V4 完整架构披露(1.6T 总参 / 49B 激活 / 1M context / mHC + Engram + DSA 三联 / 国产算力首次大规模训练全面适配昇腾)未单独作为「DeepSeek V4 与 Kimi K3 主权开源 2.0 立标级双主线对立 + DSA 与 KDA 路径趋同」入位
-
建议归入:§2.1 推理引擎(新增「DeepSeek V4 完整架构披露 · 1.6T/49B/1M context · mHC + Engram + DSA 三联 · 国产算力首次大规模训练全面适配昇腾」小节)+ §2.5 稀疏注意力(沿用 + 新增 DSA 作为 DeepSeek V4 路径);新增 C81 共识候选:"主权开源 2.0 立标级双主线对立 = Kimi K3 2.8T MoE(2026-07-27 HF 1.56TB · 104B 激活 / 1M context · KDA + AttnRes) + DeepSeek V4 1.6T(2026-04 预览 · 49B 激活 / 1M context · mHC + Engram + DSA) · 国产算力首次大规模训练全面适配昇腾 · DSA 与 KDA 注意力效率优化路径趋同";新增 O156 试金石:"DeepSeek V4 与 Kimi K3 部署 TTFT/TPOT 实测对照(1.6T vs 2.8T · 49B vs 104B 激活);DSA 与 KDA 在 H100/H200/B200 实测精度对照;mHC vs Attention Residuals 量化收益对照"
增量 5【Cloud-Native §2.6 / 推理调度 §2.2】CSDN HIXL + Mooncake + vLLM V1 Connector 联创实测 TTFT +40% · 昇腾 CANN 池化传输(★ 必补)
- 来源:
inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md第 2 条「SGLang + 昇腾 NPU 完整运行流程」+ 第 4 条「基于 HIXL + Mooncake + vLLM 的 KV Cache 池化与高性能传输联创实践」· 2026-07 +organized/knowledge/llm-infra.md§2.3 KV cache 14 件套 Mooncake Store 已收 + §2.1 vLLM V1 connector 已收
HIXL + Mooncake + vLLM V1 Connector 联创实践完整展开:
- HIXL(华为 Xfer Library):昇腾 CANN 点对点传输组件,对接 Mooncake Transfer Engine
- vLLM V1 Engine 新增两种 Connector 原生接入 Mooncake:打通昇腾 × vLLM × Mooncake 立体工程化
- Mooncake Store 批量接口优化:batch_put_from_multi_buffers / batch_get_into_multi_buffers
- 联创实测:TTFT 提升 40%
- 端到端 NPU 部署链路:SGLang 主体 + vLLM(作 Ascend Attention Backend) + torch-npu + triton-ascend
- 关键依赖版本:torch_npu-2.6.0,CANN 版本对齐是常见报错根源
- 常见排障:P2P 失败(tp=8) / OutOfResources(triton 配置) / custom allreduce 缺失
SGLang + 昇腾 NPU SGLang vs vLLM-Ascend Qwen3-8B 对比: | 指标 | vLLM-Ascend | SGLang(Ascend) | 差异 | |---|---|---|---| | 高并发吞吐 | 1.0× baseline | 1.2-1.35× | SGLang +20-35% | | 长文本生成 | 中等 | 更高(1.1-1.3×) | SRT pipeline 优势 | | TTFT 首 token 延迟 | 较高 | 更低 | executor 更轻量 | | KV Cache 复用效率 | 普通 | 更高 | 复用策略更激进 |
与活文档关系:§2.3 KV cache 14 件套 Mooncake Store 已收(7-27 evening 收官)+ §2.1 vLLM V1 connector 已收;但 HIXL + Mooncake + vLLM V1 Connector 联创实测 TTFT +40% · 昇腾 CANN 池化传输 · vLLM V1 Engine 新增两种 Connector 原生接入 Mooncake · SGLang vs vLLM-Ascend Qwen3-8B 高并发 1.2-1.35× · 国产算力首次大规模推理池化联创未单独作为「昇腾 CANN 推理池化联创里程碑」入位
- 建议归入:§2.3 KV cache 14 件套(沿用 Mooncake Store + 新增 HIXL 昇腾 CANN 池化传输)+ §2.6 Cloud-Native(沿用 + 新增昇腾 CANN + vLLM V1 Connector 联创);新增 C82 共识候选:"国产算力推理池化联创里程碑 = HIXL(华为 Xfer Library)+ Mooncake Transfer Engine + vLLM V1 Connector 三件套 · 昇腾 CANN 池化传输 · 实测 TTFT +40% · 国产算力首次大规模推理池化";新增 O157 试金石:"HIXL 在 H100/H200/B200 与昇腾 NPU 集群混合调度实测;Mooncake Store 批量接口在 MoE 大模型(Kimi K3 2.8T / DeepSeek V4 1.6T)的池化收益"
增量 6【推理引擎 §2.1 / 选型决策树 §2.13】vLLM/SGLang 推理引擎实战 2026 选型决策树升级(PremAI/Spheron/LeetLLM/Particula 多源交叉)(★ 必补)
- 来源:
inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md第 1 条「2026 年 LLM 推理框架全解析」+ 第 6 条 DeployBase AI + 第 7 条 Spheron + 第 8 条 MorphLLM +inbox/jay/2026-07-30-1105-jay-five-category-briefing.mdB5/B6 Fish Audio + SGLang vs vLLM 2026 +inbox/jay/2026-07-30-1508-jay-five-category-briefing.mdB6 SGLang vs vLLM 2026 场景化决策树 +organized/knowledge/llm-infra.md§2.1 推理引擎 6 寡头 + §2.13 选型决策树 2026 中期已收
vLLM/SGLang 推理引擎实战 2026 选型决策树升级展开:
多源交叉验证(DeployBase AI / Spheron / LeetLLM / PremAI / Particula Tech):
- PremAI H100 Llama 3.1 8B Throughput 对比:
- vLLM ~12,500 tok/s · SGLang ~16,200 tok/s · LMDeploy ~16,100 tok/s
- DeployBase AI H100 80GB × 1, Llama 3.3 70B Instruct FP8 ShareGPT_Vicuna:
- SGLang:TTFT 80-120ms,Throughput 高(共享前缀场景)
- vLLM:TTFT 中等,Throughput 最高(通用负载)
- TGI:TTFT 较慢,Throughput 中等(HF 原生集成)
- SGLang RadixAttention 前缀共享优化:多轮对话吞吐量 +15-25% · 共享前缀场景 TTFT 领先 30-40%
- TGI v3 对话缓存:200K token 上下文支持
- SGLang 调度优化:backend.init_batch_state = True 启用批次状态缓存
- Spheron vLLM vs TRT-LLM vs SGLang:TensorRT-LLM 28 分钟编译 · 模型稳定延迟敏感首选;vLLM 快速启动 + 模型灵活性默认首选;SGLang 共享前缀/多阶段工作流优势
- MLPerf Inference v6.0 新增 GPT-OSS 120B 标准化基准
CSDN InfraTech 专栏源码级拆解(jay 0822 csdn-deploybase 第 1 条): - RadixAttention 源码解读 + vLLM V1 Scheduler 调度逻辑 & 优先级(v0.5.4 Scheduler 架构图 + 源码路径) - DeepSeekV3/V3.2 推理的 Ulysses 并行优化实践:实测 3× 提速(PD 分离 + Ulysses) - vLLM PD 分离方案入门 · RL 训推共卡 SGLang/vLLM 无缝切换 - 混合注意力 KV cache 设计(线性注意力 + 混合 KV) - ChunkedPrefill + FlashDecoding 原理详解 - vLLM 性能密码 prefix cache「零开销」加速 · 深入 vLLM V1 内核 KV cache 管理机制详细剖析(BlockManager V1/V2 对比)
CSDN DeepSeek V3.2-Exp 三大框架对比(版本较旧,需核实): | 框架 | Decoding speed(tokens/s) | Prefill speed(tokens/s) | 每百万 Token 成本($) | |---|---|---|---| | HuggingFace | 1,200 | 850 | 0.22 | | SGLang | 2,800 | 850 | 0.18 | | vLLM | 3,200 | 920 | 0.15 |
成本工程指标(PixelWander CSDN 第 2 条 · vLLM 生产部署 2.8× 成本差距): - Top 10 隐性开销:批处理不足 / KV Cache 内存碎片化 / Checkpoint 未开启 FlashAttention / 冷启动 GPU 分配 - 双维度 OKR:(新成本/旧成本) ≤ 0.77 且 GPU 利用率提升 ≥8% - 分层计费契约:基础层 Token 计费 / 增强层推理时长 ms 计费(区分 prefill/decode 计算密度差异 3.2×) - 实测收益:P99 从 1420ms → ≤1249ms(-12%),单位请求成本 $0.087 → ≤$0.067(-23%)
-
与活文档关系:§2.1 推理引擎 6 寡头已收 + §2.13 选型决策树 2026 中期已收 + §2.7 vLLM K8s OOM runbook 已收(7-26 evening);但 2026 多源交叉验证(PremAI H100 12,500/16,200/16,100 tok/s + DeployBase SGLang TTFT 80-120ms + Spheron TRT-LLM 28min 编译 + CSDN InfraTech RadixAttention/vLLM V1 Scheduler/BlockManager V1-V2/Ulysses 3×/ChunkedPrefill/FlashDecoding 源码级 + DeepSeek V3.2 三框架 + PixelWander 成本工程 OKR + SGLang RadixAttention 多轮 +15-25% / 共享前缀 TTFT 领先 30-40%)未单独作为「2026 推理引擎选型决策树 v2.0 多源交叉升级」入位
-
建议归入:§2.1 推理引擎 6 寡头(沿用 + 强化 vLLM/SGLang/TRT-LLM/Ollama/Colibri/LMDeploy 完整对比)+ §2.13 选型决策树(升级为 v2.0 多源交叉);新增 C83 共识候选:"2026 推理引擎实战 6 框架选型决策树 v2.0 多源交叉 = vLLM(通用生产首选 · PremAI 12,500 tok/s · 成本 0.15/百万 token)/ SGLang(共享前缀 + Agentic + DeepSeek 3.1× MLA · PremAI 16,200 tok/s · RadixAttention 多轮 +15-25%)/ TRT-LLM(H100 极致 · 28min 编译代价)/ Ollama(开发边缘 CPU)/ Colibri(纯 C 25GB 744B MoE 边缘)/ LMDeploy(极致低延迟 · PremAI 16,100 tok/s)";新增 O158 试金石:"PixelWander 成本工程 7 天 A/B 实测在 vLLM 0.25.x 是否复现;SGLang RadixAttention 多轮 +15-25% 在 Kimi K3 1M context 实测;TRT-LLM 28min 编译代价在生产模型迭代场景的隐性成本"
二、旁证(3 条)
旁证 1【推理引擎 §2.1 / 训练推理一体化】paper_cards/657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎(主分类 llm-infra 7-29 evening 立基础)(★★)
- 来源:
paper_cards/657-2607-19712.md「How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF」(https://arxiv.org/abs/2607.19712)· 主分类 llm-infra · 形态 method · 7-29 evening 立基础(tom 7-30 radar 候选来源)+organized/knowledge/llm-infra.md§2.1 推理引擎 6 寡头沿用 + §1.6 Harness Engineering 沿用 - 核心要点:
- 问题:在 RLHF 流程中,奖励评分阻塞策略更新;评分缓慢瓶颈整个循环,因为每条 rollout 都获得分数前都不会有更新
- 核心洞察:评分与生成争夺相同的 CPU 与 GPU 资源,因此更快的评分引擎本身并不能缩短步骤时间,主要是释放生成可用的算力
- 方案:基于 ONNX Runtime 构建原生 C++ 推理引擎,对比 PyTorch eager 模式 / torch.compile
- 评分本身计算量很小,但 rollout 生成通常占据 RLHF 步骤的更大比例
- 意义:主分类 llm-infra 7-29 evening 立基础 = 0 张 inference-systems 主分类新卡信号打破(7-27~28 连续 0 张);RLHF 推理引擎 = RL 训练-推理一体化第二维(与 vLLM/SGLang 推理分离并行)
- 建议归入:§2.1 推理引擎(沿用 + 新增 RLHF 奖励模型 C++/ONNX Runtime 路径);新增 O159 试金石:"ONNX Runtime C++ 在 Kimi K3 2.8T / DeepSeek V4 1.6T RLHF 步骤的实际 throughput 改善;PyTorch eager vs torch.compile vs ONNX Runtime C++ 在 GPU 利用率竞争中的 trade-off 量化"
旁证 2【推理引擎 §2.1 / NVIDIA Dynamo 跨硬件】NVIDIA Dynamo RDMA/NVMe-oF/S3 KV cache 跨 GPU 传输 + NIXL library 标准化(★★)
- 来源:
inbox/jay/2026-07-30-1508-jay-five-category-briefing.mdCloud-Native C2 NVIDIA Dynamo(沿用增量 2 已收)+organized/knowledge/llm-infra.md§2.1 NVIDIA Dynamo 跨节点编排层已收(7-29 evening 增量 5) - Dynamo 7 月持续更新核心要点:
- disaggregated prefill/decode:PD 分离架构,KV cache 通过 RDMA / NVMe-oF / S3 跨 GPU 传输
- NIXL library:标准化跨加速器栈的集合通信
- KV cache 跨实例共享 + 层级 offloading
- Dynamo vs llm-d 关系:功能高度重叠但定位不同:Dynamo 偏 NVIDIA 自有硬件生态优化(NVIDIA H100/H200/B200/GB200),llm-d 偏跨硬件平台抽象(NVIDIA + AMD + Intel + TPU + 昇腾)
- 意义:Dynamo + llm-d 双引擎标准化收敛 = K8s 推理部署事实标准方向盘 7-30 升级;与 Modular MAX(vLLM 商业化)+ RadixArk(SGLang 商业化)三轴并行
- 建议归入:§2.1 NVIDIA Dynamo 跨节点编排层(沿用 + 强化 7 月 RDMA/NVMe-oF/S3 + NIXL library 标准化);新增 O160 试金石:"Dynamo 与 llm-d 在 100+ 节点 NVIDIA H100/H200 集群的标准化收敛路径;Dynamo NVMe-oF vs Mooncake Transfer Engine 在 PD 分离实测对比"
旁证 3【国产算力推理 §2.6 / SGLang + 昇腾 NPU 完整运行流程】CSDN 昇腾 NPU SGLang vs vLLM-Ascend Qwen3-8B + CANN 报错排障(★★)
- 来源:
inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md第 2 条「SGLang + 昇腾 NPU 完整运行流程」+ 第 8 条「cursor/vscode 单步调试 vllm/sglang 源码」·organized/knowledge/llm-infra.md§2.6 Cloud-Native 沿用 - 核心要点:
- 依赖版本:torch_npu-2.6.0,CANN 版本对齐是常见报错根源
- 常见排障:P2P 失败(tp=8) / OutOfResources(triton 配置) / custom allreduce 缺失
- SGLang vs vLLM-Ascend Qwen3-8B 性能对比:高并发吞吐 +20-35% · 长文本 +10-30% · TTFT 更低 · KV Cache 复用更激进
- 源码调试:vLLM
.vscode/launch.json配置示例 + SGLang server/demo 请求分离模式 - 意义:国产算力推理端到端 NPU 部署链路首次完整披露 · SGLang 在昇腾生态优势超过 vLLM-Ascend
- 建议归入:§2.6 Cloud-Native(沿用 + 强化国产算力推理路径);新增 O161 试金石:"SGLang + 昇腾 NPU 在 Kimi K3 2.8T 主权开源 2.0 模型实测部署;torch_npu + triton-ascend 与 PyTorch native CUDA 在国产算力侧的延迟/吞吐对照"
三、警示(1 条)
警示 1【推理引擎 §2.1】⚠️ Tom inference E1 连续 4 日缺失延续第 5 日 + spark 7-30 morning 节奏反转后第 6 棒静默期(本棒恢复)
- 来源:
inbox/tom/2026-07-30-*仅2026-07-30-rag-e1prep.md(沿用) +2026-07-30-agent-rag-longcontext-radar.md+2026-07-30-0900-hf-daily-2026-07-30.md+2026-07-30-evaluation-e1prep.md+ 2 RSS · 无独立 inference-e1prep ·inbox/tom/2026-07-29-inference-e1prep.md7-29 evening 恢复单棒 +inbox/spark/2026-07-30-*仅 3 RSS 通稿(无独立 engineering/llm-infra E1)+ 本棒 llm-infra-e1prep-v11 恢复 spark E1 产出 - 警示内容:
- Tom inference 主题 E1 7-27/7-28/7-29/7-30 连续四日缺失(继 7-29 evening 单棒恢复后 7-30 再次缺失第 5 日)
- Spark 7-30 morning 节奏反转后第 6 棒静默期(继 7-29 evening 双 E1 完整恢复 · 节奏反转第 5 棒 后 7-30 morning 仅 RSS 通稿 3 件)
- Stability of sopken 接力:
stepwise 1245 coordination-check-noon强提醒 spark 7-30 evening 棒必须确认恢复 / 延续静默期判断 - 风险:
- tom inference 主题信号密度连续 5 日衰减:7-27 4 主线 → 7-28 0 件 → 7-29 单棒恢复 → 7-30 0 件 = 信号流失累计
- spark llm-infra 主题:7-27 evening → 7-28 evening → 7-29 evening(双 E1)→ 7-30 morning 静默 → 7-30 evening 本棒恢复 = 节奏反转第 5 棒后第 6 棒静默期判断
- 建议行动:
- 本棒 llm-infra-e1prep-v11 补全 6 主线(SIGMOD OmniServe + Blink + KVServe/SpectrumKV + Flow-Controlled + FlashInfer 官方 + SGLang vs vLLM 2026 决策树 v2 + llm-d 7-30 + GitHub Trending 4 件 + DeepSeek V4 + HIXL + vLLM 选型决策树升级)= spark E1 节奏回归
- 待 tom inference E1 7-31 morning 恢复时核对信号丢失条目;spark 7-30 evening 棒继续稳定产出 llm-infra E1 第 12 棒
四、值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险级别 | 建议行动 |
|---|---|---|---|---|
| 1 | Kimi K3 Coding/Agentic SOTA 属官方宣传 | jay engineering-v40 沿用 | 🟡 待核实 | 需第三方评测(LiveBench / BFCL / TEA 对照) |
| 2 | Kimi K3 MXFP4 量化精度损失实测数据缺失 | jay engineering-v40 沿用 | 🟡 待核实 | 等 vLLM/SGLang 官方 benchmark 或第三方评测 |
| 3 | DeepSeek V4 完整规格(1.6T/49B/1M context · mHC + Engram + DSA 三联)来自 CSDN DeepSeek 官方技术社区(2026-04 预览版),需对照 DeepSeek 官方 arXiv 论文 | jay 1221 csdn-inference-rag-moe 第 7 条 | 🟡 待核实 | 等待 DeepSeek 官方 arXiv:2607.XXXXX 披露(可能 7-31~8-5) |
| 4 | DeepSeek V4 国产算力首次大规模训练全面适配昇腾 | jay 1221 csdn-inference-rag-moe 第 7 条 | 🟡 待核实 | 等待 DeepSeek 官方技术报告 + 昇腾官方联合披露 |
| 5 | FlashKDA MoonshotAI 990★ 性能 vs Triton Attention kernel arXiv:2511.11581 对照 | jay 0936 ai-engineering-trending | 🟡 待核实 | 等待 MoonshotAI 官方 benchmark + FlashKDA 仓库 README |
| 6 | PixelWander CSDN vLLM 生产部署 2.8× 成本差距(P99 -12% / 单位成本 -23%)实测数据 | jay 0822 csdn-deploybase 第 2 条 | 🟡 待核实 | 7 天 A/B 测试条件 + GPU 型号 + 模型规格需对齐 |
| 7 | CSDN DeepSeek V3.2-Exp 三大框架对比(HF 1,200 / SGLang 2,800 / vLLM 3,200 tok/s)数据来自 2026-02-22,版本较旧 | jay 1221 csdn-inference-rag-moe 第 5 条 | 🟡 待核实 | 对照最新 MLPerf Inference v6.0 GPT-OSS 120B 标准化基准 |
| 8 | llm-d v0.7 scale-to-zero 冷启动 SLA | jay 1508 briefing Cloud-Native C1 + jay engineering-v40 增量 2 | 🟡 待核实 | llm-d GitHub benchmark / production case studies |
| 9 | OmniServe SIGMOD 2026 Attention Piggybacking 在 H100/H200/B200 实测 CPU 解放度 | jay 1508 briefing Backend B1 | 🟡 待核实 | 第三方实测 + 与 vLLM-P/D 对照 |
| 10 | Blink arXiv:2604.07601 CPU-Free 实测控制路径消除收益 | jay 1508 briefing Backend B2 | 🟡 待核实 | 第三方实测 + 与 vLLM V1 connector 对照 |
| 11 | Flow-Controlled arXiv:2604.11001 平滑激活 vs vLLM 实际 SLO 违例率 | jay 1508 briefing Backend B4 | 🟡 待核实 | vLLM/SGLang 实际生产 SLO 数据交叉验证 |
| 12 | arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 在 Kimi K3 2.8T / DeepSeek V4 1.6T RLHF 步骤的实际 throughput 改善 | paper_cards/657 | 🟡 待核实 | 对照 MoonshotAI / DeepSeek 官方 RLHF 流水线 |
| 13 | Colibri 纯 C 推理引擎 744B MoE 25GB RAM 实测 vs llama.cpp GGUF | jay 0822 csdn-deploybase 第 1 条 + jay engineering-v40 增量 3 | 🟡 待核实 | 第三方基准测试 + 与 LMDeploy 极致低延迟路径对照 |
五、本次涉及 arXiv 号列表
| arXiv 号 | 论文/主题 | 增量归属 | 建议归位节 |
|---|---|---|---|
| 2603.12831 | OmniServe SIGMOD 2026 异构 CPU-GPU 推理 + Attention Piggybacking | 增量 1 | §2.1 推理引擎 / §2.2 调度 |
| 2604.07609v1 | Blink CPU-Free LLM Inference · SmartNIC + 零拷贝 RDMA + GPU-resident 调度 | 增量 1 | §2.1 推理引擎 / §2.10 系统栈 |
| 2606.29708 | KVServe SIGCOMM 2026 通信感知 KV cache 压缩 · disagg LLM serving | 增量 1 | §2.3 KV cache / §2.6 Cloud-Native |
| 2606.08635 | SpectrumKV SIGCOMM 2026 per-token 混合精度 KV cache 传输 | 增量 1 | §2.3 KV cache / §2.6 Cloud-Native |
| 2604.11001v1 | Flow-Controlled Scheduling for LLM Inference · 可证稳定性下界 | 增量 1 | §2.2 调度 |
| 2607.19712 | RLHF 奖励模型 C++/ONNX Runtime 推理引擎(主分类 llm-infra 7-29 evening 立基础) | 旁证 1 | §2.1 推理引擎 / §1.6 Harness Engineering |
| 2607.24653 | Kimi K3 开放前沿智能(沿用 7-29 evening 增量 1 / 7-27 增量 1) | 横向参照 | §2.1 推理引擎 / §2.9 量化经济学 |
| 2606.20295v2 | FlashInfer Token-Operations Oriented Inference(沿用 7-29 evening 增量 3) | 横向参照 | §2.3 KV cache |
| 2510.09665 | LMCache 跨引擎 KV 缓存 crash-safe(沿用 §2.3) | 横向参照 | §2.3 KV cache |
| 2607.18141 | HyMCache CXL 三层 KV cache(沿用 §9) | 横向参照 | §2.3 KV cache |
| 2605.01280 | MathOpt Chen et al. 2026 Ω(√(B log G))(沿用) | 横向参照 | §2.2 调度 |
| 2511.11581 | Triton Attention Kernel · NVIDIA + AMD Triton-only SOTA paged attention(沿用) | 横向参照 | §2.4 Kernel |
| 2607.22529 | Skill Self-Play(沿用 §1.6) | 横向参照 | §1.6 Agent 自改进 |
| 2607.21557 | OpenForgeRL Harness(沿用 §1.5) | 横向参照 | §1.5 Harness Engineering |
六、已检查来源清单
以下来源经本次扫描确认无 llm-infra 主题新增或已在上方增量中覆盖,避免重复检索:
inbox/jay(7-29 evening → 7-30 共 16 件,全部已读):
- ✅ 2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md → 框架横评 + 行业基准 + 成本工程(已纳入增量 6 vLLM 选型决策树升级)
- ✅ 2026-07-30-0936-ai-engineering-trending.md → GitHub Trending 7-30 日榜(已纳入增量 3 FlashKDA/Colibri/AIRI/OpenWork)
- ✅ 2026-07-30-1000-rss-bytebytego/nathan-benaich/raschka/simon-willison → 4 RSS 通稿(无 llm-infra 主增)
- ✅ 2026-07-30-1003-rss-cool-papers/cool-papers-ir/lilian-weng → 3 RSS 通稿(已纳入 ai-industry/RAG 主题)
- ✅ 2026-07-30-1004-rss-msr-blog → MSR 4 项(已纳入 ai-industry 主题)
- ✅ 2026-07-30-1005-rss-import-ai → RSS 通稿(无 llm-infra 主增)
- ✅ 2026-07-30-1007-rss-yt-fireship/yt-karpathy → 2 RSS 通稿(无 llm-infra 主增)
- ✅ 2026-07-30-1105-jay-five-category-briefing.md → Database D1-D4 + Cloud-Native C1 llm-d + Reproduction(已纳入增量 2 llm-d 7-30 持续活跃)
- ✅ 2026-07-30-1124-engineering-e1prep.md → engineering-v40 准备棒 33.2KB(已纳入增量 1-3 llm-infra 邻接)
- ✅ 2026-07-30-1140-news-x-tech-radar.md → X 硬核干货雷达(无 llm-infra 主增)
- ✅ 2026-07-30-1221-csdn-inference-rag-moe-highvalue.md → CSDN 推理/RAG/MoE 8 件(已纳入增量 4 DeepSeek V4 + 增量 5 HIXL/Mooncake + 旁证 3 昇腾 NPU)
- ✅ 2026-07-30-1508-jay-five-category-briefing.md → #15 下午档五大分类(已纳入增量 1 OmniServe/Blink/KVServe/SpectrumKV/Flow-Controlled/FlashInfer + 增量 2 llm-d/Dynamo + 增量 6 vLLM 选型决策树升级)
inbox/tom(7-29 evening → 7-30 共 6 件,全部已读):
- ✅ 2026-07-29-inference-e1prep.md → 7-29 evening 恢复单棒(沿用 7-29 evening E1)
- ✅ 2026-07-30-0840-agent-rag-longcontext-radar.md → 4 件 P0(已纳入 ai-industry/RAG 主题)
- ✅ 2026-07-30-0852-rag-e1prep.md → RAG E1(已纳入 RAG 主题)
- ✅ 2026-07-30-0900-hf-daily-2026-07-30.md → HF Daily 票榜(已纳入 ai-industry/multimodal 主题)
- ✅ 2026-07-30-1007-rss-yt-lex-fridman/yannic-kilcher → 2 RSS 通稿(无 llm-infra 主增)
- ✅ 2026-07-30-evaluation-e1prep.md → evaluation E1(已纳入 evaluation 主题)
- ⚠️ tom 7-30 inference E1 连续 4 日缺失延续第 5 日(警示 1)
inbox/flyp(7-29 evening → 7-30 共 8 件,全部已读):
- ✅ 2026-07-29-2250-LOCA-bench-long-context-agent-critical-read.md → multimodal 主题
- ✅ 2026-07-29-coding-agents-e1prep.md → coding-agents 主题
- ✅ 2026-07-29-risk-e1prep.md → risk 主题
- ✅ 2026-07-30-multimodal-e1prep.md → multimodal-v34 第三棒 32 件(已纳入 multimodal 主题)
- ✅ 2026-07-30-ReMemR1-v5-ICLR2026-deep-read.md → multimodal 主题
- ✅ 2026-07-30-M3Exam-m3proctor-light-review.md → multimodal 主题
- ✅ 2026-07-30-risk-e1prep.md → risk 主题
- ✅ 2026-07-30-1000/1003/1007-rss-cameron-wolfe/interconnects/yt-ai-explained/yt-two-minute-papers → 4 RSS 通稿(无 llm-infra 主增)
- flyp 7-29 evening → 7-30 0 件 llm-infra 主线产出(multimodal + risk 双轨主导)
inbox/spark(7-29 evening → 7-30 共 5 件,全部已读):
- ✅ 2026-07-29-1337-agent-e1prep.md → Agent E1
- ✅ 2026-07-29-llm-infra-e1prep.md → 7-29 evening E1 v10(已纳入 7-29 evening 增量 1-7 + 3 旁证 + 2 警示)
- ✅ 2026-07-30-1000-rss-gradient-flow.md → RSS 通稿(无 llm-infra 主增)
- ✅ 2026-07-30-1004-rss-chip-huyen.md → RSS 通稿(无 llm-infra 主增)
- ✅ 2026-07-30-1007-rss-yt-3blue1brown.md → RSS 通稿(无 llm-infra 主增)
- ⚠️ spark 7-30 morning 节奏反转后第 6 棒静默期(本棒恢复 llm-infra-e1prep-v11)
inbox/stephen(7-29 evening → 7-30 共 11 件,全部已读):
- ✅ 2026-07-29-2245-stephen-coordination-check-evening.md → 协调棒(已纳入 ai-industry 主题)
- ✅ 2026-07-29-llm-application-e1prep.md → llm-application 主题
- ✅ 2026-07-30-0910-news-x-vip-radar.md → X VIP radar(已纳入 ai-industry 主题)
- ✅ 2026-07-30-1005/1006/1007/1008-news-*.md → 9 frontier lab news 通稿(已纳入 ai-industry 主题)
- ✅ 2026-07-30-1026-ai-industry-e1prep.md → v32 准备棒(已纳入 ai-industry 主题)
- ✅ 2026-07-30-1245-stephen-coordination-check-noon.md → 协调棒(已纳入 llm-infra 警示 1)
paper_cards(7-29 evening → 7-30 18:40 新卡 IDs 644-665 共 22 张,全部已读): - ✅ 主分类 llm-infra 新增 1 张 = 657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎(旁证 1) - ✅ 主分类 engineering 0 张 inference-systems 新卡(jay engineering-e1prep-v40 警示 8 已立) - ✅ 主分类 llm-infra 0 张 pure inference 新卡 · 主分类 llm-infra 沿用 620(arXiv:2607.24475 KG Historical Doc Retrieval)+ 629(arXiv:2607.23242 IndicTalk) - ✅ 副分类 llm-infra 0 张新卡 - ✅ 邻接 inference-efficient 0 张新卡 · 沿用 626 Sol-Attn / 628 Warp Divergence / 632 WorldDiT / 633 UltraViT - ✅ 主分类 engineering 645(BeyondUncertainty)+ 646(RepoReasoner)+ 647(CodeNib)3 张 · 已纳入 engineering 主题 - ✅ 主分类 agent 656(Agent Retrieval Bench) · 已纳入 agent 主题 - ✅ 主分类 rag 644(Kontrast) · 已纳入 RAG 主题 - ✅ 主分类 multimodal 655(HSI Mine Detection) · 已纳入 multimodal 主题
七、本次 E1 预消化结论
增量条数:6 主线 + 3 旁证 + 1 警示
结论:llm-infra 主题 7-29 18:40 → 7-30 18:40 约 24h 窗口为中密度,主因是 jay 1508 briefing #15 下午档 + 0822 csdn-deploybase 早间 + 1221 csdn-inference-rag-moe 中午 三棒 23.2KB llm-infra 主战场饱和(SIGMOD 2026 OmniServe 异构 CPU-GPU 推理 + SLO + Blink arXiv:2604.07601 CPU-Free SmartNIC + SIGCOMM 2026 KVServe/SpectrumKV disagg 通信优化 + Flow-Controlled arXiv:2604.11001 可证稳定性下界 + FlashInfer NVIDIA 官方 B200 默认架构 + SGLang vs vLLM 2026 场景化决策树 v2 SGLang 29%/DeepSeek 3.1×/Fish Audio 16%/6× 前缀密集 + llm-d 7-30 持续活跃 KV cache offloading + NVIDIA Dynamo RDMA/NVMe-oF/S3 KV cache 跨 GPU 传输 + GitHub Trending 7-30 工程化亮点 MoonshotAI/FlashKDA 990★ Kimi Delta Attention CUDA kernel + Colibri 纯 C 744B MoE 25GB RAM + AIRI 45k★ 自托管 AI companion + OpenWork 17.9k★ Claude Cowork 开源替代 + DeepSeek V4 完整架构披露 CSDN 1.6T 总参/49B 激活/1M context/mHC + Engram + DSA 三联 + 国产算力首次大规模训练全面适配昇腾 + CSDN HIXL + Mooncake + vLLM V1 Connector 联创实测 TTFT +40% 昇腾 CANN 池化传输 + vLLM/SGLang 推理引擎实战 2026 选型决策树升级 PremAI/Spheron/LeetLLM/Particula 多源交叉)= 6 主线立标级增量。同时 paper_cards 主分类 llm-infra 新增 1 张 = 657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎(打破 7-27~28 连续 0 张 inference-systems 主分类新卡信号 + RLHF 推理引擎 RL 训练-推理一体化第二维)· 副分类 llm-infra 0 张 + 邻接 inference-efficient 0 张新卡 = 主分类 inference-systems 新卡 1 张信号恢复。同时警示 tom inference E1 连续 4 日缺失延续第 5 日 + spark 7-30 morning 节奏反转后第 6 棒静默期(本棒恢复)。
建议今晚活文档 v33/v11 接力动作: 1. jay 1508 briefing 6 件 llm-infra 主线 6 件套入 §2.1/§2.2/§2.13(OmniServe SIGMOD + Blink arXiv:2604.07601 + KVServe/SpectrumKV SIGCOMM + Flow-Controlled arXiv:2604.11001 + FlashInfer NVIDIA 官方 B200 默认 + SGLang vs vLLM 2026 场景化决策树 v2) 2. llm-d 7-30 持续活跃 + NVIDIA Dynamo RDMA/NVMe-oF入 §2.6 Cloud-Native(沿用 + 强化 K8s 推理部署事实标准方向盘 7-30 升级) 3. GitHub Trending 7-30 MoonshotAI/FlashKDA + Colibri + AIRI/OpenWork入 §2.1 推理引擎(MoonshotAI 推理优化外显 + 边缘 AI companion 开源生态成熟) 4. DeepSeek V4 完整架构披露入 §2.1/§2.5(主权开源 2.0 立标级双主线对立 + DSA 与 KDA 路径趋同) 5. CSDN HIXL + Mooncake + vLLM V1 Connector 联创入 §2.3 KV cache(国产算力推理池化联创里程碑 · 昇腾 CANN 池化传输) 6. vLLM/SGLang 选型决策树 v2.0 多源交叉入 §2.13(升级工作负载形状驱动 + 六维方法论 + 顶级会议基准) 7. C78-C83 共识 + O153-O161 试金石写入对应候选池 8. 新增 paper_cards/657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎入 §2.1(主分类 llm-infra 7-29 evening 立基础 · RL 训练-推理一体化第二维)
本文件由 spark E1 自动生成 · 2026-07-30 18:40 (Asia/Shanghai)
仅供今晚活文档接力参考,不作为知识库最终内容
基线:organized/knowledge/llm-infra.md Wave3 §VII 32 轮抢修完成版(2026-07-29 05:00 收官)
下一步:今晚活文档接力棒按上述 8 项动作归位 → 7-31 morning spark E1 第 12 棒