inference · E1 预消化简报(2026-07-30)
执行人: Tom · E1 日间预消化轮(inference 主题) 覆盖时段: 2026-07-29 22:00 → 2026-07-30 22:00(约 24 小时) 基线:
organized/knowledge/inference.md(2026-07-30 更新 · vLLM 0.26.0 + SGLang v0.6 · 十节 · 引用→100) 基线快照(昨日 E1 收官状态): inference.md §1 已收 vLLM 0.26.0(Spark + DeepSeek-V4 + Inkling) + SGLang v0.6(DSpark/GLM-5.2 DSA/ReplaySSM 6.4×/Inkling/FlashInfer 强制/NVFP4 强制 FlashInfer);§2.1 已收 Kimi K3 2.8T MoE(Raschka 419 HN + LatentMoE/NoPE/KDA/AttnRes 四大组件 + MXFP4/MXFP8);§2.3 KV cache 全栈三件套已收 PagedAttention 2.0 + FlashInfer arXiv:2606.20295(inter-token -29-69%) + LMCache;§2.2 调度已收 Disagg 5 节点;§9 新趋势已收 HyMCache CXL 三层;§5 已收 Skill Self-Play arXiv:2607.22529 检查来源: work-queue.md + inbox/jay/(2026-07-30 1105 五分类简报 Backend B1-B6 + 1221 csdn-inference-rag-moe 8件 + 0822 llm-inference-optimization-stack-csdn-deploybase 13.1KB + 1508 five-category-briefing #15 下午档) + inbox/tom/(2026-07-30 0900 hf-daily 15件票榜 + rag-e1prep + evaluation-e1prep + agent-rag-longcontext-radar) + inbox/spark/(2026-07-30 llm-infra-e1prep-v11 6主线+3旁证+1警示) + inbox/flyp/(2026-07-30 multimodal-e1prep + risk-e1prep + M3Exam + ReMemR1-v5) + inbox/stephen/(2026-07-30 ai-industry-e1prep + llm-application-e1prep + coordination-check-noon) + paper_cards/644-665 近3天共22张新卡(主分类 inference-systems 新增 1 张 = 657 arXiv:2607.19712 RLHF奖励模型C++/ONNX;副分类邻接 0 张 inference-efficient新卡) 性质: 预消化简报 · 不重写活文档 · 供今晚活文档接力参考
0. 综述判断
本场 inference 主题 24h 窗口增量性质:中密度(5 主线 + 1 旁证 + 1 警示)。
本场 inference 主题新增 1 张主分类 paper_card(657 RLHF奖励模型C++/ONNX),打破 7-27~29 连续三日 0 张 inference-systems 新卡的沉寂。本场核心增量集中在跨主题迁移——spark llm-infra E1 v11 识别的 6 条顶级会议/工程增量(SIGMOD OmniServe 异构CPU-GPU + Blink CPU-Free SmartNIC + SIGCOMM KVServe/SpectrumKV + Flow-Controlled 可证稳定性 + FlashInfer NVIDIA B200默认 + SGLang 29%/3.1×MLA 场景化选型)经 jay 7-30 三棒战场(1105/1221/1508)饱和产出,构成 inference.md §2.1/§2.2/§2.13 的立标级新增。本场核心动作:将顶级会议论文群(SIGMOD 2026 OmniServe + SIGCOMM 2026 KVServe/SpectrumKV)作为推理引擎/调度邻接节点入位,补全 inference.md 学术层与工程层的完整闭环。
1. 核心增量(5 主线 + 1 旁证 + 1 警示,按活文档归位顺序)
增量 1【调度 §2.2 / 推理引擎 §2.1】SIGMOD 2026 OmniServe 异构 CPU-GPU 混合 LLM 推理 + Attention Piggybacking + SLO 保证(★★ 必补)
来源:inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B1(⭐⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1
OmniServe SIGMOD 2026 核心展开:
- 核心问题:数据中心同时服务 Latency-Sensitive(LS)和 Best-Effort(BE)两种 LLM 负载,如何在 CPU-GPU 异构环境下保证 SLO
- 四大创新:
1. Attention Piggybacking:将 CPU Attention 计算与 GPU 推理解耦,CPU 不再是旁观者而是并行参与者——BE 服务利用 CPU 执行 attention,LS 服务独占 GPU
2. 异步流水线设计:CPU 和 GPU 同时处理 BE 服务,通过等待队列协调
3. 动态 batching 控制策略:根据 SLO deadline 优先级调度
4. SLO 保障:延迟敏感型请求的 SLO 可证保障
- 与 llm-d 互补关系:OmniServe 解决单节点 CPU-GPU 异构的混合负载调度;CNCF llm-d 解决跨 vLLM 实例的 KV cache 共享——两者互补构成完整 disaggregated inference 解决方案
- arXiv:https://arxiv.org/pdf/2603.12831
与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点 + 9 学派;但 OmniServe SIGMOD 2026(异构 CPU-GPU + Attention Piggybacking + SLO 保证 + 与 llm-d 互补关系)未作为独立节点入位
建议归入:§2.2 调度(新增「OmniServe SIGMOD 2026 arXiv:2603.12831:异构 CPU-GPU 混合 LLM 推理 + Attention Piggybacking + 动态 SLO 调度 · 与 CNCF llm-d 互补构成完整 disaggregated 解决方案」小节)+ §2.1 推理引擎(邻接,作为异构部署场景补充);新增 C73 共识候选:"异构 CPU-GPU 推理标准解法 = OmniServe SIGMOD 2026(单节点 Attention Piggybacking + SLO 保证)+ CNCF llm-d(跨实例 KV cache 共享)互补";新增 O162 试金石:"OmniServe Attention Piggybacking 在 H100/H200/B200 实测 CPU 解放度;BE 服务利用 CPU attention 对 LS 服务延迟的影响"
增量 2【推理引擎 §2.1 / 系统栈 §2.10】SIGCOMM 2026 KVServe + SpectrumKV:disaggregated LLM serving 通信优化 + per-token 混合精度 KV cache 传输(★★ 必补)
来源:inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B3(⭐⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1
SIGCOMM 2026 KVServe + SpectrumKV 核心展开:
- KVServe(https://arxiv.org/abs/2606.29708):通信感知的 KV cache 压缩,实现 disaggregated LLM serving 高效传输——针对 PD(Prefill-Decode)分离架构中 KV cache 网络传输瓶颈
- SpectrumKV(https://arxiv.org/abs/2606.08635):per-token 混合精度 KV cache 传输,专门优化 prefill-decode 分离架构的传输开销——将不同 token 的 KV 分配不同精度,热点 token 高精度,冷 token 低精度
- 两者关系:KVServe = 通信压缩策略;SpectrumKV = 精度分配策略,均针对 disaggregated 架构中 KV cache 网络传输瓶颈这一共性问题
- 与现有组件的关系:
- vs. LMCache(crash-safe 跨引擎):LMCache 解决故障恢复;KVServe/SpectrumKV 解决传输效率
- vs. Mooncake(Transfer Engine):Mooncake 是传输引擎层;KVServe/SpectrumKV 是传输策略/格式层
- vs. llm-d(PD 分离 K8s 协调):llm-d 是 K8s 协调层;KVServe/SpectrumKV 是 PD 分离的通信优化层
与活文档关系:inference.md §2.3 KV cache 14 件套已收 LMCache + Mooncake Store;§2.2 调度已收 Disagg 5 节点;但 SIGCOMM 2026 KVServe + SpectrumKV(通信感知 KV cache 压缩 + per-token 混合精度传输)未作为独立节点入位
建议归入:§2.3 KV cache(新增「SIGCOMM 2026 KVServe arXiv:2606.29708 + SpectrumKV arXiv:2606.08635:disaggregated serving 通信优化 · 通信感知压缩 + per-token 混合精度 · 与 LMCache(故障恢复)/Mooncake(传输引擎)/llm-d(K8s协调)形成完整 PD 分离传输栈」小节)+ §2.2 调度(邻接,作为 Disagg 通信层支撑);新增 C74 共识候选:"PD 分离传输完整栈 = llm-d(K8s协调) + KVServe/SpectrumKV(通信策略) + Mooncake(传输引擎) + LMCache(故障恢复)";新增 O163 试金石:"SpectrumKV per-token 混合精度在 1M context 实测精度损失;KVServe 在 100ms P99 网络延迟下的压缩收益"
增量 3【调度 §2.2 / 推理引擎 §2.1】Flow-Controlled Scheduling for LLM Inference arXiv:2604.11001:可证稳定性下界 + 平滑激活新请求(★ 建议补)
来源:inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B4(⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1
Flow-Controlled Scheduling 核心展开:
- 核心贡献:建立任何稳定 LLM serving 系统必须满足的必要条件——当期望工作负载超过 KV cache 容量时,任何调度算法都无法防止延迟无限增长。同时刻画系统不稳定的充分条件
- Flow-Controlled 算法:平滑激活新请求,在特定负载条件下可证稳定——不突然注入大批请求,而是平滑地逐步加入
- 工程意义:为生产系统提供调度策略的理论下界——不能靠经验参数规避根本性的资源约束问题;是 vLLM/SGLang 经验调度的重要理论补充
- arXiv:https://arxiv.org/html/2604.11001v1
与活文档关系:inference.md §2.2 调度已收 Disagg 5 节点 + 9 学派(MathOpt / FCFS / Priority / SLO-aware / Energy-aware / Joint prefetch-decode / Selective RECOMPUTE / speculative);但 Flow-Controlled arXiv:2604.11001(可证稳定性下界 + 平滑激活)未作为独立节点入位
建议归入:§2.2 调度(新增「Flow-Controlled Scheduling arXiv:2604.11001:可证稳定性必要条件 + 平滑激活算法 · 为经验调度提供理论下界」小节);新增 O164 试金石:"Flow-Controlled 平滑激活 vs vLLM continuous batching 在真实生产 SLO 违例率对照;理论下界在 H100 8卡集群的实际参考价值"
增量 4【推理引擎 §2.1 / KV cache §2.3】Blink arXiv:2604.07609:CPU-Free LLM Inference — SmartNIC + 零拷贝 RDMA + GPU-resident 调度器(★ 建议补)
来源:inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B2(⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1
Blink CPU-Free 核心展开:
- 核心问题:现代 LLM serving 系统的 host-CPU 驱动细粒度控制成为关键瓶颈——"控制路径依赖"是 CPU 成为瓶颈的根本原因
- 四大创新:
1. SmartNIC 驻留 ingress:网卡处理请求接入,无需 CPU 参与
2. 零拷贝 RDMA 直接写入 GPU 内存:绕过 CPU DRAM,数据直接进 GPU
3. GPU 驻留持久化调度器:continuous batching、KV-cache 管理、token 生成全在 GPU 侧
4. 消除 CPU 干扰:稳态推理全程无需 host CPU 介入
- 适用场景:超低延迟高吞吐场景(与 OmniServe 异构场景互补:OmniServe 用 CPU 参与计算,Blink 彻底移除 CPU)
- arXiv:https://arxiv.org/html/2604.07609v1
与活文档关系:inference.md §2.1 推理引擎 6 寡头已收 vLLM/SGLang/TRT-LLM/Ollama/Colibri/LMDeploy;§2.10 系统栈(硬件/网络/存储)已收;但 Blink arXiv:2604.07609(CPU-Free SmartNIC + GPU-resident 调度器)未作为独立节点入位
建议归入:§2.1 推理引擎(新增「Blink arXiv:2604.07609 CPU-Free LLM Inference:SmartNIC 驻留 ingress + 零拷贝 RDMA 直接写入 GPU + GPU 驻留调度器 · 彻底移除 CPU 控制路径依赖 · 与 OmniServe(CPU参与异构)互补构成完整异构推理方案」小节);新增 O165 试金石:"Blink GPU-resident 调度器在 1M context 长上下文实测延迟;SmartNIC 方案在非 NVIDIA 生态的可行性"
增量 5【推理引擎 §2.1 / 选型决策树 §2.13 / KV cache §2.3】FlashInfer NVIDIA 官方 B200 默认架构 + 场景化选型决策树 v2(SGLang 29% / DeepSeek MLA 3.1× / Fish Audio 16%)(★★ 必补)
来源:inbox/jay/2026-07-30-1508-jay-five-category-briefing.md Backend B5/B6(⭐⭐⭐⭐⭐)+ inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 1 + inbox/jay/2026-07-30-1105-jay-five-category-briefing.md Backend B5/B6 + inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md 第 5/6/7 条
FlashInfer NVIDIA 官方架构定位 + SGLang vs vLLM 2026 场景化选型 v2 核心展开:
FlashInfer NVIDIA 官方定位(NVIDIA 官方博客):
- Blackwell(B200/B300):FlashInfer 为默认 attention backend
- Hopper(H100/H200):FlashAttention 默认;VLLM_ATTENTION_BACKEND=FLASHINFER 可选开启
- SGLang Hopper + Blackwell:FlashInfer 均默认,且有 DeepSeek MLA 专用 kernel 路径
- FlashInfer 四大 Operator 家族:
1. Attention:batch decode(32K shared prefix @ batch 256 → 31× speedup over PagedAttention)
2. GEMM:矩阵乘法 kernel
3. Communication:分布式推理集合通信
4. Sampling:token 采样和采样参数生成
- FlashInfer + CUDAGraph 两阶段调度:plan() 阶段检查请求形状并计算均衡调度元数据,run() 阶段执行——解决 CUDAGraph 静态配置 vs LLM 请求序列长度动态变化的矛盾
SGLang vs vLLM 2026 场景化选型决策树 v2(Particula Tech + PremAI + DeployBase + Spheron 多源交叉):
| 指标 | vLLM | SGLang | 备注 |
|---|---|---|---|
| H100 标准吞吐(PremAI) | ~12,500 tok/s | ~16,200 tok/s | SGLang +29% |
| H100 Llama 3.3 70B(DeployBase) | 中等 TTFT | TTFT 80-120ms | SGLang 共享前缀场景优势 |
| DeepSeek MLA kernel(Particula) | 基准 | 3.1× faster | SGLang MLA 专用 kernel |
| Fish Audio 实测 | p99 TTFT 23.6ms | p99 TTFT 13.1ms,吞吐 +16% | SGLang 极致低延迟 |
| 前缀密集型 RAG(Particula) | 基准 | 6× higher | RadixAttention 前缀复用 |
| 结构化输出/函数调用 | xgrammar guided decoding | grammar-cache 更激进 | SGLang schema 复用更好 |
| 通用负载(无前缀复用) | 基本持平 | 基本持平 | 差距在 run-to-run 波动范围 |
- 关键结论(LeetLLM 六维方法论):正确选择取决于工作负载形状(prompt length / output length / shared-prefix hit rate / burst shape / model churn / hardware target),而非泛化比较
- PremAI H100 Llama 3.1 8B 综合:SGLang ~16,200 tok/s > LMDeploy ~16,100 tok/s > vLLM ~12,500 tok/s
- Spheron 实测:TensorRT-LLM 编译 ~28 分钟,但吞吐量最优;vLLM 快速启动 + 模型灵活性;SGLang 共享前缀/多阶段工作流最优
- CSDN InfraTech 源码级(jay 0822 csdn-deploybase):RadixAttention 源码解读 + vLLM V1 Scheduler 架构图 + BlockManager V1/V2 对比 + Ulysses 并行 PD 分离实测 3× 提速 + ChunkedPrefill + FlashDecoding 原理
与活文档关系:inference.md §2.1 已收 FlashInfer 强制(NVFP4 强制)+ SGLang v0.6 FlashInfer 强制;§2.13 选型决策树 2026 中期已收;但 FlashInfer NVIDIA B200 默认架构(31× PagedAttention)+ 场景化选型决策树 v2(SGLang 29%/3.1×MLA/6×前缀/Fish Audio 16%)+ LeetLLM 六维方法论未作为完整选型体系入位
建议归入:§2.1 推理引擎(扩展 FlashInfer 节点,新增「NVIDIA B200 默认架构 + 31× PagedAttention batch decode + 四大 Operator 家族 + CUDAGraph 两阶段调度」)+ §2.13 选型决策树(升级为 v2.0「工作负载形状驱动 + LeetLLM 六维方法论 + PremAI/DeployBase/Spheron/Particula 多源交叉」);新增 C75 共识候选:"2026 推理引擎场景化选型 v2.0 = SGLang(共享前缀/MLA/结构化输出 RadixAttention)/ vLLM(通用负载/生态成熟)/ TRT-LLM(H100极致/28min编译)/ Ollama(边缘CPU)/ Colibri(纯C 25GB MoE)/ LMDeploy(极致低延迟)+ FlashInfer B200默认(31× PagedAttention)";新增 O166 试金石:"LeetLLM 六维方法论在真实生产流量分类的准确率;SGLang vs vLLM 在 Kimi K3 1M context 实测对照"
增量 6【推理引擎 §2.1 / 训练 §5】paper_cards/657 arXiv:2607.19712:RLHF 奖励模型 C++/ONNX Runtime 推理引擎(打破连续三日 0 张主分类新卡信号)(★ 建议补)
来源:inbox/spark/2026-07-30-llm-infra-e1prep.md 旁证 1 + inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md 第 2 条 Albireo + paper_cards/657-2607-19712.md
RLHF 奖励模型推理引擎核心展开:
- 核心问题:RLHF 流程中,奖励评分阻塞策略更新——每条 rollout 获得分数前不会有更新,评分缓慢则瓶颈整个循环
- 核心洞察:评分与生成争夺相同的 CPU 与 GPU 资源,因此更快的评分引擎本身并不能缩短步骤时间,主要是释放生成可用的算力
- 方案:基于 ONNX Runtime 构建原生 C++ 推理引擎,对比 PyTorch eager 模式 / torch.compile
- 关键发现:评分本身计算量很小,但 rollout 生成通常占据 RLHF 步骤的更大比例——因此 C++/ONNX 优化主要价值在于释放 GPU 算力给生成,而非加速评分本身
- arXiv:https://arxiv.org/abs/2607.19712
与活文档关系:inference.md §5 训练与部署协同已收 Skill Self-Play;但 RLHF 奖励模型 C++/ONNX 推理引擎(arXiv:2607.19712)未入位;本卡同时打破 7-27~29 连续三日 0 张 inference-systems 主分类新卡的沉寂
建议归入:§5 训练与部署协同(新增「arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎:评分引擎主要价值 = 释放 GPU 算力给生成,而非加速评分本身」小节);新增 O167 试金石:"ONNX Runtime C++ 在 Kimi K3 2.8T / DeepSeek V4 1.6T RLHF 步骤的实际 throughput 改善;RLHF 训练-推理一体化的最佳实践"
2. 旁证(1 条)
旁证 1【推理引擎 §2.1 / 调度 §2.2】DeepSeek V4 完整架构披露 CSDN + llm-d / NVIDIA Dynamo 7月活跃(★★)
来源:inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md 第 7 条 + inbox/spark/2026-07-30-llm-infra-e1prep.md 增量 2/4
DeepSeek V4 完整架构披露: - 总参数:1.6T(V3 671B → V4 1.6T = 2.4× 扩张) - 激活参数:49B(V3 37B → V4 49B = 1.3× 扩张) - 上下文:1M tokens(V3 128K → V4 1M = 8× 扩张) - 发布时间:V4 预览版 2026-04 - 三大核心架构创新:mHC(multi-head Centralized attention)+ Engram(记忆架构)+ DSA(稀疏注意力) - 国产算力:首次大规模训练全面适配华为昇腾
主权开源 2.0 立标级双主线对位: - Kimi K3 = 2.8T 总参 / 104B 激活 / 1M context / MoonshotAI / KDA + AttnRes - DeepSeek V4 = 1.6T 总参 / 49B 激活 / 1M context / DeepSeek / mHC + Engram + DSA - DSA 稀疏注意力与 Kimi K3 KDA 路径趋同(都是注意力效率优化)
llm-d 7月持续活跃: - 官方博客 KV cache offloading 系列:KVConnector 接口 + 任意文件系统后端(S3/Redis/本地 SSD);llm-d 在更高层抽象做全局 cache 协调,LMCache 做单实例 offloading - v0.7 关键特性:scale-to-zero + active-active HA + cache-aware LoRA 路由 - NVIDIA Dynamo:RDMA/NVMe-oF/S3 KV cache 跨 GPU 传输;NIXL library 标准化集合通信
建议归入:§2.1 推理引擎(新增 DeepSeek V4 与 Kimi K3 主权开源 2.0 双主线对立)+ §2.3 KV cache(新增 llm-d KVConnector 接口与 LMCache 互补关系);新增 O168 试金石:"DeepSeek V4 与 Kimi K3 部署 TTFT/TPOT 实测对照;llm-d v0.7 scale-to-zero 冷启动 SLA"
3. 值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险级别 | 建议行动 |
|---|---|---|---|---|
| 1 | DeepSeek V4 完整规格(1.6T/49B/1M context · mHC + Engram + DSA 三联)来自 CSDN DeepSeek 官方技术社区(2026-04 预览版),需对照 DeepSeek 官方 arXiv 论文 | jay 1221 csdn-inference 第 7 条 | 🟡 待核实 | 等待 DeepSeek 官方 arXiv:2607.XXXXX 披露 |
| 2 | Kimi K3 Coding/Agentic SOTA 属官方宣传 | 持续待核实 | 🟡 待核实 | 需第三方评测(LiveBench / BFCL / TEA 对照) |
| 3 | Kimi K3 MXFP4 量化精度损失实测数据缺失 | 持续待核实 | 🟡 待核实 | 等 vLLM/SGLang 官方 benchmark 或第三方评测 |
| 4 | FlashInfer 31× speedup over PagedAttention 数据基于 batch 256 / 32K shared prefix 条件,需确认实际生产条件下的收益边界 | NVIDIA 官方博客 | 🟡 待核实 | 对照 vLLM 0.26+ 官方 benchmark |
| 5 | OmniServe Attention Piggybacking 在 H100/H200/B200 实测 CPU 解放度 | arXiv:2603.12831 | 🟡 待核实 | 第三方实测 + 与 vLLM-P/D 对照 |
| 6 | Blink arXiv:2604.07609 CPU-Free SmartNIC 方案 依赖特定硬件配置,NVIDIA 生态以外可用性待验证 | arXiv:2604.07609 | 🟡 待核实 | 确认 SmartNIC 型号和驱动要求 |
| 7 | Flow-Controlled arXiv:2604.11001 平滑激活 在真实生产 SLO 违例率改善数据缺失 | arXiv:2604.11001 | 🟡 待核实 | vLLM/SGLang 实际生产 SLO 数据交叉验证 |
| 8 | llm-d v0.7 scale-to-zero 冷启动 SLA | spark llm-infra-e1prep 警示 | 🟡 待核实 | llm-d GitHub benchmark / production case studies |
4. 本次涉及 arXiv 号列表
| arXiv 号 | 论文/主题 | 增量归属 | 建议归位节 |
|---|---|---|---|
| 2603.12831 | OmniServe SIGMOD 2026 异构 CPU-GPU 推理 + Attention Piggybacking | 增量 1 | §2.2 调度 / §2.1 推理引擎 |
| 2606.29708 | KVServe SIGCOMM 2026 通信感知 KV cache 压缩 | 增量 2 | §2.3 KV cache / §2.2 调度 |
| 2606.08635 | SpectrumKV SIGCOMM 2026 per-token 混合精度 KV cache 传输 | 增量 2 | §2.3 KV cache / §2.2 调度 |
| 2604.11001v1 | Flow-Controlled Scheduling for LLM Inference 可证稳定性下界 | 增量 3 | §2.2 调度 |
| 2604.07609v1 | Blink CPU-Free LLM Inference SmartNIC + GPU-resident 调度器 | 增量 4 | §2.1 推理引擎 / §2.10 系统栈 |
| 2607.19712 | RLHF 奖励模型 C++/ONNX Runtime 推理引擎 | 增量 6 | §5 训练与部署协同 |
| 2607.24653 | Kimi K3 开放前沿智能(沿用昨日 E1) | 横向参照 | §2.1 推理引擎 / §2.9 量化经济学 |
| 2606.20295v2 | FlashInfer Token-Operations Oriented Inference(沿用昨日 E1) | 横向参照 | §2.3 KV cache |
| 2604.07609 | Blink CPU-Free LLM Inference(与增量4同一篇,仅重列) | — | §2.1 |
| 2603.12831 | OmniServe(与增量1同一篇,仅重列) | — | §2.2 |
| 2510.09665 | LMCache 跨引擎 KV 缓存 crash-safe(已在 inference.md §2.3) | — | §2.3 横向 |
| 2607.18141 | HyMCache CXL 三层 KV cache(已在 inference.md §9) | — | §2.3/§9 横向 |
| 2607.24027 | Sol-Attn diffusion transformers 注意力稀疏化(HF Daily 32▲) | 旁证 | §2.5 稀疏注意力 |
| 2607.22529 | Skill Self-Play(已在 inference.md §5) | — | §5 横向 |
5. 已检查来源清单
以下来源经本次扫描确认无 inference 主题新增或已在上方增量中覆盖,避免重复检索:
inbox/jay/2026-07-30-1105-jay-five-category-briefing.md→ Database/Cloud-Native 部分(已提取 Backend B1-B6 inference 相关;llm-d 归入旁证 1;余归档)inbox/jay/2026-07-30-1221-csdn-inference-rag-moe-highvalue.md→ DeepSeek V4(归入旁证 1)+ HIXL/Mooncake/vLLM V1 Connector(归入旁证 1)+ SGLang vs vLLM-Ascend(归入增量 5)+ InfraTech 源码级(归入增量 5)inbox/jay/2026-07-30-0822-llm-inference-optimization-stack-csdn-deploybase.md→ Albireo(1.9× throughput/-48% latency/+28% GPU)归入旁证1;ISO-Bench(coding agent优化推理引擎)为engineering主题;vLLM成本工程(PixelWander)为工程主题;余归档inbox/jay/2026-07-30-1508-jay-five-category-briefing.md→ 下午档五大分类(已提取 Backend B1-B6 inference主线;Cloud-Native C1 llm-d/C2 Dynamo归入旁证1)inbox/tom/2026-07-30-0900-hf-daily-2026-07-30.md→ HF Daily 15件票榜(Sol-Attn 32▲ 归入旁证;余为agent/multimodal/video主题)inbox/tom/2026-07-30-rag-e1prep.md→ RAG 主题inbox/tom/2026-07-30-evaluation-e1prep.md→ evaluation 主题inbox/tom/2026-07-30-agent-rag-longcontext-radar.md→ Agent/RAG/Long-Context 主题inbox/spark/2026-07-30-llm-infra-e1prep.md→ 主要来源:已提取增量 1-6 + 旁证 1;余为 llm-infra 专属(非 inference 主线)inbox/spark/2026-07-30-agent-e1prep.md→ Agent 主题inbox/flyp/2026-07-30-multimodal-e1prep.md→ multimodal 主题inbox/flyp/2026-07-30-risk-e1prep.md→ risk 主题inbox/flyp/2026-07-30-M3Exam-m3proctor-light-review.md→ multimodal 主题inbox/flyp/2026-07-30-ReMemR1-v5-ICLR2026-deep-read.md→ multimodal 主题inbox/stephen/2026-07-30-ai-industry-e1prep.md→ AI industry 主题inbox/stephen/2026-07-30-llm-application-e1prep.md→ llm-application 主题inbox/stephen/2026-07-30-1245-stephen-coordination-check-noon.md→ 协调棒- paper_cards/644-665 共 22 张新卡 → 主分类 inference-systems 1 张 = 657(RLHF 奖励模型 C++/ONNX);主分类 llm-infra 0 张;主分类 engineering 3 张(645+646+647);主分类 agent 1 张(656);主分类 multimodal 1 张(655);主分类 rag 1 张(644);0 张 inference-efficient 邻接
6. 本次 E1 预消化结论
增量条数:5 主线 + 1 旁证 + 1 警示
结论:inference 主题 7-29 22:00 → 7-30 22:00 约 24h 窗口为中密度,主因是 spark llm-infra E1 v11 产出 6 条立标级增量经 jay 三棒战场(1105/1221/1508)饱和覆盖。本场最重要信号是 paper_cards 主分类 inference-systems 打破 7-27~29 连续三日 0 张新卡的沉寂——新增 657 arXiv:2607.19712 RLHF 奖励模型 C++/ONNX Runtime 推理引擎(训练-推理一体化第二维)。本场核心新增为 SIGMOD/SIGCOMM 2026 顶级会议推理优化 4 件套(OmniServe 异构 CPU-GPU + Blink CPU-Free SmartNIC + KVServe/SpectrumKV disagg 通信 + Flow-Controlled 可证稳定性下界)构成 inference.md 学术层完整闭环,以及 FlashInfer NVIDIA B200 默认架构(31× PagedAttention)+ 场景化选型决策树 v2(SGLang 29%/3.1× MLA/6× 前缀密集)构成 §2.1/§2.13 工程层更新。无结构化 inference-systems 新 arXiv 批量涌入,但顶级会议论文群的系统性引入是本场质量补偿。
建议今晚活文档接力动作: 1. SIGMOD 2026 OmniServe arXiv:2603.12831 入 §2.2(异构 CPU-GPU + Attention Piggybacking + SLO 保证 + 与 llm-d 互补) 2. SIGCOMM 2026 KVServe arXiv:2606.29708 + SpectrumKV arXiv:2606.08635 入 §2.3(PD 分离传输完整栈) 3. Flow-Controlled arXiv:2604.11001 入 §2.2(可证稳定性下界 + 平滑激活) 4. Blink arXiv:2604.07609 入 §2.1(CPU-Free SmartNIC + GPU-resident 调度器) 5. FlashInfer NVIDIA B200 默认 + 选型决策树 v2 入 §2.1/§2.13(SGLang 29%/3.1×MLA/6×前缀密集 + LeetLLM 六维方法论) 6. arXiv:2607.19712 RLHF 奖励模型 C++/ONNX 入 §5(打破 0 张 inference-systems 新卡沉寂) 7. DeepSeek V4 + llm-d/Dynamo 7月活跃 入 §2.1/§2.3(主权开源 2.0 双主线 + KVConnector 接口) 8. C73-C75 共识 + O162-O168 试金石 写入对应候选池