inference · E1 预消化简报(2026-07-30)

执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 2026-07-29 22:00 → 2026-07-30 22:00(约 24 小时) 基线: organized/knowledge/inference.md(2026-07-30 更新 · vLLM 0.26.0 + SGLang v0.6 · 十节 · 引用→100) 基线快照(昨日 E1 收官状态): inference.md §1 已收 vLLM 0.26.0(Spark + DeepSeek-V4 + Inkling) + SGLang v0.6(DSpark/GLM-5.2 DSA/ReplaySSM 6.4×/Inkling/FlashInfer 强制/NVFP4 强制 FlashInfer);§2.1 已收 Kimi K3 2.8T MoE(Raschka 419 HN + LatentMoE/NoPE/KDA/AttnRes 四大组件 + MXFP4/MXFP8);§2.3 KV cache 全栈三件套已收 PagedAttention 2.0 + FlashInfer arXiv:2606.20295(inter-token -29-69%) + LMCache;§2.2 调度已收 Disagg 5 节点;§9 新趋势已收 HyMCache CXL 三层;§5 已收 Skill Self-Play arXiv:2607.22529 检查来源: work-queue.md + inbox/jay/(2026-07-30 1105 五分类简报 Backend B1-B6 + 1221 csdn-inference-rag-moe 8件 + 0822 llm-inference-optimization-stack-csdn-deploybase 13.1KB + 1508 five-category-briefing #15 下午档) + inbox/tom/(2026-07-30 0900 hf-daily 15件票榜 + rag-e1prep + evaluation-e1prep + agent-rag-longcontext-radar) + inbox/spark/(2026-07-30 llm-infra-e1prep-v11 6主线+3旁证+1警示) + inbox/flyp/(2026-07-30 multimodal-e1prep + risk-e1prep + M3Exam + ReMemR1-v5) + inbox/stephen/(2026-07-30 ai-industry-e1prep + llm-application-e1prep + coordination-check-noon) + paper_cards/644-665 近3天共22张新卡(主分类 inference-systems 新增 1 张 = 657 arXiv:2607.19712 RLHF奖励模型C++/ONNX;副分类邻接 0 张 inference-efficient新卡) 性质: 预消化简报 · 不重写活文档 · 供今晚活文档接力参考


0. 综述判断

本场 inference 主题 24h 窗口增量性质:中密度(5 主线 + 1 旁证 + 1 警示)。

本场 inference 主题新增 1 张主分类 paper_card(657 RLHF奖励模型C++/ONNX),打破 7-27~29 连续三日 0 张 inference-systems 新卡的沉寂。本场核心增量集中在跨主题迁移——spark llm-infra E1 v11 识别的 6 条顶级会议/工程增量(SIGMOD OmniServe 异构CPU-GPU + Blink CPU-Free SmartNIC + SIGCOMM KVServe/SpectrumKV + Flow-Controlled 可证稳定性 + FlashInfer NVIDIA B200默认 + SGLang 29%/3.1×MLA 场景化选型)经 jay 7-30 三棒战场(1105/1221/1508)饱和产出,构成 inference.md §2.1/§2.2/§2.13 的立标级新增。本场核心动作:将顶级会议论文群(SIGMOD 2026 OmniServe + SIGCOMM 2026 KVServe/SpectrumKV)作为推理引擎/调度邻接节点入位,补全 inference.md 学术层与工程层的完整闭环。


1. 核心增量(5 主线 + 1 旁证 + 1 警示,按活文档归位顺序)

增量 1【调度 §2.2 / 推理引擎 §2.1】SIGMOD 2026 OmniServe 异构 CPU-GPU 混合 LLM 推理 + Attention Piggybacking + SLO 保证(★★ 必补)

来源inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B1(⭐⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1

OmniServe SIGMOD 2026 核心展开: - 核心问题:数据中心同时服务 Latency-Sensitive(LS)和 Best-Effort(BE)两种 LLM 负载,如何在 CPU-GPU 异构环境下保证 SLO - 四大创新: 1. Attention Piggybacking:将 CPU Attention 计算与 GPU 推理解耦,CPU 不再是旁观者而是并行参与者——BE 服务利用 CPU 执行 attention,LS 服务独占 GPU 2. 异步流水线设计:CPU 和 GPU 同时处理 BE 服务,通过等待队列协调 3. 动态 batching 控制策略:根据 SLO deadline 优先级调度 4. SLO 保障:延迟敏感型请求的 SLO 可证保障 - 与 llm-d 互补关系:OmniServe 解决单节点 CPU-GPU 异构的混合负载调度;CNCF llm-d 解决跨 vLLM 实例的 KV cache 共享——两者互补构成完整 disaggregated inference 解决方案 - arXivhttps://arxiv.org/pdf/2603.12831

与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点 + 9 学派;但 OmniServe SIGMOD 2026(异构 CPU-GPU + Attention Piggybacking + SLO 保证 + 与 llm-d 互补关系)未作为独立节点入位

建议归入:§2.2 调度(新增「OmniServe SIGMOD 2026 arXiv:2603.12831:异构 CPU-GPU 混合 LLM 推理 + Attention Piggybacking + 动态 SLO 调度 · 与 CNCF llm-d 互补构成完整 disaggregated 解决方案」小节)+ §2.1 推理引擎(邻接,作为异构部署场景补充);新增 C73 共识候选:"异构 CPU-GPU 推理标准解法 = OmniServe SIGMOD 2026(单节点 Attention Piggybacking + SLO 保证)+ CNCF llm-d(跨实例 KV cache 共享)互补";新增 O162 试金石:"OmniServe Attention Piggybacking 在 H100/H200/B200 实测 CPU 解放度;BE 服务利用 CPU attention 对 LS 服务延迟的影响"


增量 2【推理引擎 §2.1 / 系统栈 §2.10】SIGCOMM 2026 KVServe + SpectrumKV:disaggregated LLM serving 通信优化 + per-token 混合精度 KV cache 传输(★★ 必补)

来源inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B3(⭐⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1

SIGCOMM 2026 KVServe + SpectrumKV 核心展开: - KVServehttps://arxiv.org/abs/2606.29708):通信感知的 KV cache 压缩,实现 disaggregated LLM serving 高效传输——针对 PD(Prefill-Decode)分离架构中 KV cache 网络传输瓶颈 - SpectrumKVhttps://arxiv.org/abs/2606.08635):per-token 混合精度 KV cache 传输,专门优化 prefill-decode 分离架构的传输开销——将不同 token 的 KV 分配不同精度,热点 token 高精度,冷 token 低精度 - 两者关系:KVServe = 通信压缩策略;SpectrumKV = 精度分配策略,均针对 disaggregated 架构中 KV cache 网络传输瓶颈这一共性问题 - 与现有组件的关系: - vs. LMCache(crash-safe 跨引擎):LMCache 解决故障恢复;KVServe/SpectrumKV 解决传输效率 - vs. Mooncake(Transfer Engine):Mooncake 是传输引擎层;KVServe/SpectrumKV 是传输策略/格式层 - vs. llm-d(PD 分离 K8s 协调):llm-d 是 K8s 协调层;KVServe/SpectrumKV 是 PD 分离的通信优化层

与活文档关系:inference.md §2.3 KV cache 14 件套已收 LMCache + Mooncake Store;§2.2 调度已收 Disagg 5 节点;但 SIGCOMM 2026 KVServe + SpectrumKV(通信感知 KV cache 压缩 + per-token 混合精度传输)未作为独立节点入位

建议归入:§2.3 KV cache(新增「SIGCOMM 2026 KVServe arXiv:2606.29708 + SpectrumKV arXiv:2606.08635:disaggregated serving 通信优化 · 通信感知压缩 + per-token 混合精度 · 与 LMCache(故障恢复)/Mooncake(传输引擎)/llm-d(K8s协调)形成完整 PD 分离传输栈」小节)+ §2.2 调度(邻接,作为 Disagg 通信层支撑);新增 C74 共识候选:"PD 分离传输完整栈 = llm-d(K8s协调) + KVServe/SpectrumKV(通信策略) + Mooncake(传输引擎) + LMCache(故障恢复)";新增 O163 试金石:"SpectrumKV per-token 混合精度在 1M context 实测精度损失;KVServe 在 100ms P99 网络延迟下的压缩收益"


增量 3【调度 §2.2 / 推理引擎 §2.1】Flow-Controlled Scheduling for LLM Inference arXiv:2604.11001:可证稳定性下界 + 平滑激活新请求(★ 建议补)

来源inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B4(⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1

Flow-Controlled Scheduling 核心展开: - 核心贡献:建立任何稳定 LLM serving 系统必须满足的必要条件——当期望工作负载超过 KV cache 容量时,任何调度算法都无法防止延迟无限增长。同时刻画系统不稳定的充分条件 - Flow-Controlled 算法:平滑激活新请求,在特定负载条件下可证稳定——不突然注入大批请求,而是平滑地逐步加入 - 工程意义:为生产系统提供调度策略的理论下界——不能靠经验参数规避根本性的资源约束问题;是 vLLM/SGLang 经验调度的重要理论补充 - arXivhttps://arxiv.org/html/2604.11001v1

与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点 + 9 学派(MathOpt / FCFS / Priority / SLO-aware / Energy-aware / Joint prefetch-decode / Selective RECOMPUTE / speculative);但 Flow-Controlled arXiv:2604.11001(可证稳定性下界 + 平滑激活)未作为独立节点入位

建议归入:§2.2 调度(新增「Flow-Controlled Scheduling arXiv:2604.11001:可证稳定性必要条件 + 平滑激活算法 · 为经验调度提供理论下界」小节);新增 O164 试金石:"Flow-Controlled 平滑激活 vs vLLM continuous batching 在真实生产 SLO 违例率对照;理论下界在 H100 8卡集群的实际参考价值"


来源inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B2(⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1

Blink CPU-Free 核心展开: - 核心问题:现代 LLM serving 系统的 host-CPU 驱动细粒度控制成为关键瓶颈——"控制路径依赖"是 CPU 成为瓶颈的根本原因 - 四大创新: 1. SmartNIC 驻留 ingress:网卡处理请求接入,无需 CPU 参与 2. 零拷贝 RDMA 直接写入 GPU 内存:绕过 CPU DRAM,数据直接进 GPU 3. GPU 驻留持久化调度器:continuous batching、KV-cache 管理、token 生成全在 GPU 侧 4. 消除 CPU 干扰:稳态推理全程无需 host CPU 介入 - 适用场景:超低延迟高吞吐场景(与 OmniServe 异构场景互补:OmniServe 用 CPU 参与计算,Blink 彻底移除 CPU) - arXivhttps://arxiv.org/html/2604.07609v1

与活文档关系:inference.md §2.1 推理引擎 6 寡头已收 vLLM/SGLang/TRT-LLM/Ollama/Colibri/LMDeploy;§2.10 系统栈(硬件/网络/存储)已收;但 Blink arXiv:2604.07609(CPU-Free SmartNIC + GPU-resident 调度器)未作为独立节点入位

建议归入:§2.1 推理引擎(新增「Blink arXiv:2604.07609 CPU-Free LLM Inference:SmartNIC 驻留 ingress + 零拷贝 RDMA 直接写入 GPU + GPU 驻留调度器 · 彻底移除 CPU 控制路径依赖 · 与 OmniServe(CPU参与异构)互补构成完整异构推理方案」小节);新增 O165 试金石:"Blink GPU-resident 调度器在 1M context 长上下文实测延迟;SmartNIC 方案在非 NVIDIA 生态的可行性"


增量 5【推理引擎 §2.1 / 选型决策树 §2.13 / KV cache §2.3】FlashInfer NVIDIA 官方 B200 默认架构 + 场景化选型决策树 v2(SGLang 29% / DeepSeek MLA 3.1× / Fish Audio 16%)(★★ 必补)

来源inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B5/B6(⭐⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1 + inbox/jay/2026-07-30-1105-jay-five-category-briefing.md Backend B5/B6 + inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md 第 5/6/7 条

FlashInfer NVIDIA 官方架构定位 + SGLang vs vLLM 2026 场景化选型 v2 核心展开

FlashInfer NVIDIA 官方定位(NVIDIA 官方博客): - Blackwell(B200/B300):FlashInfer 为默认 attention backend - Hopper(H100/H200):FlashAttention 默认;VLLM_ATTENTION_BACKEND=FLASHINFER 可选开启 - SGLang Hopper + Blackwell:FlashInfer 均默认,且有 DeepSeek MLA 专用 kernel 路径 - FlashInfer 四大 Operator 家族: 1. Attention:batch decode(32K shared prefix @ batch 256 → 31× speedup over PagedAttention) 2. GEMM:矩阵乘法 kernel 3. Communication:分布式推理集合通信 4. Sampling:token 采样和采样参数生成 - FlashInfer + CUDAGraph 两阶段调度plan() 阶段检查请求形状并计算均衡调度元数据,run() 阶段执行——解决 CUDAGraph 静态配置 vs LLM 请求序列长度动态变化的矛盾

SGLang vs vLLM 2026 场景化选型决策树 v2(Particula Tech + PremAI + DeployBase + Spheron 多源交叉):

指标 vLLM SGLang 备注
H100 标准吞吐(PremAI) ~12,500 tok/s ~16,200 tok/s SGLang +29%
H100 Llama 3.3 70B(DeployBase) 中等 TTFT TTFT 80-120ms SGLang 共享前缀场景优势
DeepSeek MLA kernel(Particula) 基准 3.1× faster SGLang MLA 专用 kernel
Fish Audio 实测 p99 TTFT 23.6ms p99 TTFT 13.1ms,吞吐 +16% SGLang 极致低延迟
前缀密集型 RAG(Particula) 基准 6× higher RadixAttention 前缀复用
结构化输出/函数调用 xgrammar guided decoding grammar-cache 更激进 SGLang schema 复用更好
通用负载(无前缀复用) 基本持平 基本持平 差距在 run-to-run 波动范围
  • 关键结论(LeetLLM 六维方法论):正确选择取决于工作负载形状(prompt length / output length / shared-prefix hit rate / burst shape / model churn / hardware target),而非泛化比较
  • PremAI H100 Llama 3.1 8B 综合:SGLang ~16,200 tok/s > LMDeploy ~16,100 tok/s > vLLM ~12,500 tok/s
  • Spheron 实测:TensorRT-LLM 编译 ~28 分钟,但吞吐量最优;vLLM 快速启动 + 模型灵活性;SGLang 共享前缀/多阶段工作流最优
  • CSDN InfraTech 源码级(jay 0822 csdn-deploybase):RadixAttention 源码解读 + vLLM V1 Scheduler 架构图 + BlockManager V1/V2 对比 + Ulysses 并行 PD 分离实测 3× 提速 + ChunkedPrefill + FlashDecoding 原理

与活文档关系:inference.md §2.1 已收 FlashInfer 强制(NVFP4 强制)+ SGLang v0.6 FlashInfer 强制;§2.13 选型决策树 2026 中期已收;但 FlashInfer NVIDIA B200 默认架构(31× PagedAttention)+ 场景化选型决策树 v2(SGLang 29%/3.1×MLA/6×前缀/Fish Audio 16%)+ LeetLLM 六维方法论未作为完整选型体系入位

建议归入:§2.1 推理引擎(扩展 FlashInfer 节点,新增「NVIDIA B200 默认架构 + 31× PagedAttention batch decode + 四大 Operator 家族 + CUDAGraph 两阶段调度」)+ §2.13 选型决策树(升级为 v2.0「工作负载形状驱动 + LeetLLM 六维方法论 + PremAI/DeployBase/Spheron/Particula 多源交叉」);新增 C75 共识候选:"2026 推理引擎场景化选型 v2.0 = SGLang(共享前缀/MLA/结构化输出 RadixAttention)/ vLLM(通用负载/生态成熟)/ TRT-LLM(H100极致/28min编译)/ Ollama(边缘CPU)/ Colibri(纯C 25GB MoE)/ LMDeploy(极致低延迟)+ FlashInfer B200默认(31× PagedAttention)";新增 O166 试金石:"LeetLLM 六维方法论在真实生产流量分类的准确率;SGLang vs vLLM 在 Kimi K3 1M context 实测对照"


增量 6【推理引擎 §2.1 / 训练 §5】paper_cards/657 arXiv:2607.19712:RLHF 奖励模型 C++/ONNX Runtime 推理引擎(打破连续三日 0 张主分类新卡信号)(★ 建议补)

来源inbox/spark/2026-07-30-llm-infra-e1prep.md 旁证 1 + inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md 第 2 条 Albireo + paper_cards/657-2607-19712.md

RLHF 奖励模型推理引擎核心展开: - 核心问题:RLHF 流程中,奖励评分阻塞策略更新——每条 rollout 获得分数前不会有更新,评分缓慢则瓶颈整个循环 - 核心洞察:评分与生成争夺相同的 CPU 与 GPU 资源,因此更快的评分引擎本身并不能缩短步骤时间,主要是释放生成可用的算力 - 方案:基于 ONNX Runtime 构建原生 C++ 推理引擎,对比 PyTorch eager 模式 / torch.compile - 关键发现:评分本身计算量很小,但 rollout 生成通常占据 RLHF 步骤的更大比例——因此 C++/ONNX 优化主要价值在于释放 GPU 算力给生成,而非加速评分本身 - arXivhttps://arxiv.org/abs/2607.19712

与活文档关系:inference.md §5 训练与部署协同已收 Skill Self-Play;但 RLHF 奖励模型 C++/ONNX 推理引擎(arXiv:2607.19712)未入位;本卡同时打破 7-27~29 连续三日 0 张 inference-systems 主分类新卡的沉寂

建议归入:§5 训练与部署协同(新增「arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎:评分引擎主要价值 = 释放 GPU 算力给生成,而非加速评分本身」小节);新增 O167 试金石:"ONNX Runtime C++ 在 Kimi K3 2.8T / DeepSeek V4 1.6T RLHF 步骤的实际 throughput 改善;RLHF 训练-推理一体化的最佳实践"


2. 旁证(1 条)

旁证 1【推理引擎 §2.1 / 调度 §2.2】DeepSeek V4 完整架构披露 CSDN + llm-d / NVIDIA Dynamo 7月活跃(★★)

来源inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md 第 7 条 + inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 2/4

DeepSeek V4 完整架构披露: - 总参数:1.6T(V3 671B → V4 1.6T = 2.4× 扩张) - 激活参数:49B(V3 37B → V4 49B = 1.3× 扩张) - 上下文1M tokens(V3 128K → V4 1M = 8× 扩张) - 发布时间:V4 预览版 2026-04 - 三大核心架构创新:mHC(multi-head Centralized attention)+ Engram(记忆架构)+ DSA(稀疏注意力) - 国产算力:首次大规模训练全面适配华为昇腾

主权开源 2.0 立标级双主线对位: - Kimi K3 = 2.8T 总参 / 104B 激活 / 1M context / MoonshotAI / KDA + AttnRes - DeepSeek V4 = 1.6T 总参 / 49B 激活 / 1M context / DeepSeek / mHC + Engram + DSA - DSA 稀疏注意力与 Kimi K3 KDA 路径趋同(都是注意力效率优化)

llm-d 7月持续活跃: - 官方博客 KV cache offloading 系列:KVConnector 接口 + 任意文件系统后端(S3/Redis/本地 SSD);llm-d 在更高层抽象做全局 cache 协调,LMCache 做单实例 offloading - v0.7 关键特性:scale-to-zero + active-active HA + cache-aware LoRA 路由 - NVIDIA Dynamo:RDMA/NVMe-oF/S3 KV cache 跨 GPU 传输;NIXL library 标准化集合通信

建议归入:§2.1 推理引擎(新增 DeepSeek V4 与 Kimi K3 主权开源 2.0 双主线对立)+ §2.3 KV cache(新增 llm-d KVConnector 接口与 LMCache 互补关系);新增 O168 试金石:"DeepSeek V4 与 Kimi K3 部署 TTFT/TPOT 实测对照;llm-d v0.7 scale-to-zero 冷启动 SLA"


3. 值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险级别 建议行动
1 DeepSeek V4 完整规格(1.6T/49B/1M context · mHC + Engram + DSA 三联)来自 CSDN DeepSeek 官方技术社区(2026-04 预览版),需对照 DeepSeek 官方 arXiv 论文 jay 1221 csdn-inference 第 7 条 🟡 待核实 等待 DeepSeek 官方 arXiv:2607.XXXXX 披露
2 Kimi K3 Coding/Agentic SOTA 属官方宣传 持续待核实 🟡 待核实 需第三方评测(LiveBench / BFCL / TEA 对照)
3 Kimi K3 MXFP4 量化精度损失实测数据缺失 持续待核实 🟡 待核实 等 vLLM/SGLang 官方 benchmark 或第三方评测
4 FlashInfer 31× speedup over PagedAttention 数据基于 batch 256 / 32K shared prefix 条件,需确认实际生产条件下的收益边界 NVIDIA 官方博客 🟡 待核实 对照 vLLM 0.26+ 官方 benchmark
5 OmniServe Attention Piggybacking 在 H100/H200/B200 实测 CPU 解放度 arXiv:2603.12831 🟡 待核实 第三方实测 + 与 vLLM-P/D 对照
6 Blink arXiv:2604.07609 CPU-Free SmartNIC 方案 依赖特定硬件配置,NVIDIA 生态以外可用性待验证 arXiv:2604.07609 🟡 待核实 确认 SmartNIC 型号和驱动要求
7 Flow-Controlled arXiv:2604.11001 平滑激活 在真实生产 SLO 违例率改善数据缺失 arXiv:2604.11001 🟡 待核实 vLLM/SGLang 实际生产 SLO 数据交叉验证
8 llm-d v0.7 scale-to-zero 冷启动 SLA spark llm-infra-e1prep 警示 🟡 待核实 llm-d GitHub benchmark / production case studies

4. 本次涉及 arXiv 号列表

arXiv 号 论文/主题 增量归属 建议归位节
2603.12831 OmniServe SIGMOD 2026 异构 CPU-GPU 推理 + Attention Piggybacking 增量 1 §2.2 调度 / §2.1 推理引擎
2606.29708 KVServe SIGCOMM 2026 通信感知 KV cache 压缩 增量 2 §2.3 KV cache / §2.2 调度
2606.08635 SpectrumKV SIGCOMM 2026 per-token 混合精度 KV cache 传输 增量 2 §2.3 KV cache / §2.2 调度
2604.11001v1 Flow-Controlled Scheduling for LLM Inference 可证稳定性下界 增量 3 §2.2 调度
2604.07609v1 Blink CPU-Free LLM Inference SmartNIC + GPU-resident 调度器 增量 4 §2.1 推理引擎 / §2.10 系统栈
2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎 增量 6 §5 训练与部署协同
2607.24653 Kimi K3 开放前沿智能(沿用昨日 E1) 横向参照 §2.1 推理引擎 / §2.9 量化经济学
2606.20295v2 FlashInfer Token-Operations Oriented Inference(沿用昨日 E1) 横向参照 §2.3 KV cache
2604.07609 Blink CPU-Free LLM Inference(与增量4同一篇,仅重列) §2.1
2603.12831 OmniServe(与增量1同一篇,仅重列) §2.2
2510.09665 LMCache 跨引擎 KV 缓存 crash-safe(已在 inference.md §2.3) §2.3 横向
2607.18141 HyMCache CXL 三层 KV cache(已在 inference.md §9) §2.3/§9 横向
2607.24027 Sol-Attn diffusion transformers 注意力稀疏化(HF Daily 32▲) 旁证 §2.5 稀疏注意力
2607.22529 Skill Self-Play(已在 inference.md §5) §5 横向

5. 已检查来源清单

以下来源经本次扫描确认无 inference 主题新增或已在上方增量中覆盖,避免重复检索:

  • inbox/jay/2026-07-30-1105-jay-five-category-briefing.md → Database/Cloud-Native 部分(已提取 Backend B1-B6 inference 相关;llm-d 归入旁证 1;余归档)
  • inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md → DeepSeek V4(归入旁证 1)+ HIXL/Mooncake/vLLM V1 Connector(归入旁证 1)+ SGLang vs vLLM-Ascend(归入增量 5)+ InfraTech 源码级(归入增量 5)
  • inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md → Albireo(1.9× throughput/-48% latency/+28% GPU)归入旁证1;ISO-Bench(coding agent优化推理引擎)为engineering主题;vLLM成本工程(PixelWander)为工程主题;余归档
  • inbox/jay/2026-07-30-1508-jay-five-category-briefing.md → 下午档五大分类(已提取 Backend B1-B6 inference主线;Cloud-Native C1 llm-d/C2 Dynamo归入旁证1)
  • inbox/tom/2026-07-30-0900-hf-daily-2026-07-30.md → HF Daily 15件票榜(Sol-Attn 32▲ 归入旁证;余为agent/multimodal/video主题)
  • inbox/tom/2026-07-30-rag-e1prep.md → RAG 主题
  • inbox/tom/2026-07-30-evaluation-e1prep.md → evaluation 主题
  • inbox/tom/2026-07-30-agent-rag-longcontext-radar.md → Agent/RAG/Long-Context 主题
  • inbox/spark/2026-07-30-llm-infra-e1prep.md主要来源:已提取增量 1-6 + 旁证 1;余为 llm-infra 专属(非 inference 主线)
  • inbox/spark/2026-07-30-agent-e1prep.md → Agent 主题
  • inbox/flyp/2026-07-30-multimodal-e1prep.md → multimodal 主题
  • inbox/flyp/2026-07-30-risk-e1prep.md → risk 主题
  • inbox/flyp/2026-07-30-M3Exam-m3proctor-light-review.md → multimodal 主题
  • inbox/flyp/2026-07-30-ReMemR1-v5-ICLR2026-deep-read.md → multimodal 主题
  • inbox/stephen/2026-07-30-ai-industry-e1prep.md → AI industry 主题
  • inbox/stephen/2026-07-30-llm-application-e1prep.md → llm-application 主题
  • inbox/stephen/2026-07-30-1245-stephen-coordination-check-noon.md → 协调棒
  • paper_cards/644-665 共 22 张新卡 → 主分类 inference-systems 1 张 = 657(RLHF 奖励模型 C++/ONNX);主分类 llm-infra 0 张;主分类 engineering 3 张(645+646+647);主分类 agent 1 张(656);主分类 multimodal 1 张(655);主分类 rag 1 张(644);0 张 inference-efficient 邻接

6. 本次 E1 预消化结论

增量条数:5 主线 + 1 旁证 + 1 警示

结论:inference 主题 7-29 22:00 → 7-30 22:00 约 24h 窗口为中密度,主因是 spark llm-infra E1 v11 产出 6 条立标级增量经 jay 三棒战场(1105/1221/1508)饱和覆盖。本场最重要信号是 paper_cards 主分类 inference-systems 打破 7-27~29 连续三日 0 张新卡的沉寂——新增 657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎(训练-推理一体化第二维)。本场核心新增为 SIGMOD/SIGCOMM 2026 顶级会议推理优化 4 件套(OmniServe 异构 CPU-GPU + Blink CPU-Free SmartNIC + KVServe/SpectrumKV disagg 通信 + Flow-Controlled 可证稳定性下界)构成 inference.md 学术层完整闭环,以及 FlashInfer NVIDIA B200 默认架构(31× PagedAttention)+ 场景化选型决策树 v2(SGLang 29%/3.1× MLA/6× 前缀密集)构成 §2.1/§2.13 工程层更新。无结构化 inference-systems 新 arXiv 批量涌入,但顶级会议论文群的系统性引入是本场质量补偿。

建议今晚活文档接力动作: 1. SIGMOD 2026 OmniServe arXiv:2603.12831 入 §2.2(异构 CPU-GPU + Attention Piggybacking + SLO 保证 + 与 llm-d 互补) 2. SIGCOMM 2026 KVServe arXiv:2606.29708 + SpectrumKV arXiv:2606.08635 入 §2.3(PD 分离传输完整栈) 3. Flow-Controlled arXiv:2604.11001 入 §2.2(可证稳定性下界 + 平滑激活) 4. Blink arXiv:2604.07609 入 §2.1(CPU-Free SmartNIC + GPU-resident 调度器) 5. FlashInfer NVIDIA B200 默认 + 选型决策树 v2 入 §2.1/§2.13(SGLang 29%/3.1×MLA/6×前缀密集 + LeetLLM 六维方法论) 6. arXiv:2607.19712 RLHF 奖励模型 C++/ONNX 入 §5(打破 0 张 inference-systems 新卡沉寂) 7. DeepSeek V4 + llm-d/Dynamo 7月活跃 入 §2.1/§2.3(主权开源 2.0 双主线 + KVConnector 接口) 8. C73-C75 共识 + O162-O168 试金石 写入对应候选池