inference · E1 预消化简报(2026-09-03)
实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683
生成时间:2026-09-03 22:20 CST(Asia/Shanghai)
窗口期:2026-09-02 22:20 → 2026-09-03 22:20(约 24h)
基线活文档:organized/knowledge/inference.md(2026-09-03 更新标注:TokenWeave/Stream2LLM/FlexLLM;llm-d v0.7 CNCF;SuperInfer;BOute/SHIP;EALBench;引→约430条 arXiv)
状态
- 增量条数:5 条主增量(3 条 NET-new + 2 条 paper_card 邻接入库)+ 6 条邻接预备供今晚活文档接力参考
- 本棒性质:"SSR 自投机解码 + RetroInfer VLDB 2026 + Meta/阿里巴巴生产数据 + HF WebGPU 本地推理 + Cascade/OpScale SLO 调度四核驱动 + DFlash2 A800 警示 + P/D 分离量化新数据"型棒 —— jay 9-3 全天简报(inference stack + five-category + RetroInfer)涌现大量 inference 系统级新料;flyp SSR critical-read 提供自投机解码新栖坐标;MLSys 2026 会议论文第二波(Meta 部署 + RTP-LLM)+ VLDB 2026 新系统(RetroInfer);HF 9-1 WebGPU 发布重塑本地推理格局
- 涉及 arXiv 号:净增 6 件(arXiv:2608.20359 SSR + arXiv:2505.02922 RetroInfer + arXiv:2605.29639 RTP-LLM + arXiv:2608.06557 Cascade + arXiv:2608.13499 OpScale + arXiv:2609.01925 CRISP)
一、本棒检查过的来源清单
1.1 work-queue.md(2026-09-03 22:00 自动生成)
- 待建卡 8(无 inference 主轴)· 待更新活文档 0(全部最新)· 选题榜 12 件,均为 non-inference 主题
- inference 主轴未触发"高价值待深度解读"或"攻略待写"信号;高价值候选 arXiv:2609.02812 VibeVoice-ASR-Streaming 属 multimodal 主轴
1.2 inbox/tom 今日 radar(09-03 08:40 / 14:40 / 20:40)
- 08:40:inference 主轴 0 件(AgentJudgeBench / EAL / Token-Efficient 均为 agent/RAG 主题)
- 14:40:inference 主轴 0 件(HarnessDev / S³Gym / CRISP 均为 evaluation/agent 主题);CRISP arXiv:2609.01925 邻接 inference(长上下文稀疏 attention)
- 20:40:inference 主轴 0 件(KBMR / LLAMIA-Bench / ViSAR 均为 agent/RAG 主题)
1.3 inbox/jay 9-3 全天简报(高密度源)
2026-09-03-llm-inference-rag-engineering.md— 本棒最关键源之一:Meta MLSys 2026 部署优化 + RTP-LLM + Cascade + OpScale + Red Hat EAGLE-3/EAGLE 3.1 分布式推理决策规则 + RAG 工程实践(B1/B2)2026-09-03T0820-jay-csdn-inference-stack-highfreq-round2.md— Ollama vs vLLM 128并发 3.23× + SGLang RadixAttention + FlexAttention DFlash2 A800 接受率崩塌问题2026-09-03T1050-jay-inference-agent-engineering-filter.md— vLLM vs SGLang vs TRT-LLM H100 benchmark + HERA / OGX / AI Agents Stack 2026 + DeerFlow 2.02026-09-03T1735-jay-evening-briefing-hf-webgpu-aiagents-stack-2026-sep03.md— HF @huggingface/kernels WebGPU 207 kernels 2.57× + llama.cpp DeepSeek-V4-Flash 284B + Kimi-K3 2.8T 本地推理 + Ken Huang 10-Part Series 预告2026-09-03T1835-jay-retroinfer-agentic-db-ponytail-trending-sep03.md— 本棒最关键源之二:RetroInfer VLDB 2026 wave index + Agentic DB + ponytail + chrome-devtools-mcp2026-09-03T2105-jay-evening-briefing-five-category-digest.md— 本棒最关键源之三:RetroInfer + Agentic DB + Agent Native Memory + Meta MLSys + RTP-LLM + Cascade + OpScale + Harness-of-Harness
1.4 inbox/flyp 9-3 SSR critical-read(2026-09-03 15:50 重写版)
2026-09-03-1550-SSR-self-speculation-reasoning-critical-read.md— 本棒最关键源之四:SSR self-speculation for reasoning models 完整批判性分析;ClassEval -24.1% / -18.5%;α 指标缺失;Qwen3.5 MoE 兼容性未验证;单作无代码
1.5 inbox/spark 9-3 llm-infra e1prep(2026-09-03 18:40)
- 0 件 llm-infra 主轴 NET-new + 1 件 paper_card NET-new 入库(arXiv:2608.30795 Aardvark Weather,不进入主轴)
- inference 主轴邻接:无
1.6 inbox/stephen 9-3 llm-application e1prep(2026-09-03 21:10)
- 6 件邻接备料候选(KBMR / LLAMIA-Bench / ViSAR / Agentic DB / Agent Native Memory / To GPU or Not to GPU);均为 agent/RAG/database 主题,无 inference 主轴
1.7 paper_cards 库近 3 日新卡(2026-08-31 → 2026-09-03)
- 9-3 批次:paper_card 1195-1202(8 张新卡,均为 2026-09-03 入库)
- 1195-2609-02812 VibeVoice-ASR-Streaming(主分类 multimodal)
- 1196-2609-01437 HarnessDev(主分类 evaluation)
- 1197-2609-01925 CRISP(主分类 llm-infra · 邻接 inference)
- 1198-2609-00591 SimLoss(主分类 rag)
- 1199-2609-01925(同号重)
- 1200-2609-01532(同上批次)
- 1201-2608-29607 SnapBench(主分类 multimodal)
- 1202-2608-18972 Institutional Newspapers Pipeline
- inference 主分类新卡:0 件
- 邻接入库 1 件:paper_card 1197-2609-01925 CRISP(主分类 llm-infra · 2026-09-03 16:30 入库 · inference 邻接)
1.8 organized/knowledge/inference.md
- 2026-09-03 更新标注:TokenWeave/Stream2LLM/FlexLLM;llm-d v0.7 CNCF;SuperInfer;BOute/SHIP;EALBench;引→约430条 arXiv
- FlashAttention-4 / ReplaySSM / Silent Hyperparameter / SwiftCache / Albireo — 均在 9-1/9-2 e1prep 标注为 NET-new 待锚入,本棒确认仍未锚入
二、最重要的 5 条主增量
增量 1【§1.(1) 推理引擎内核 · 2026-09-03】🟢 SSR:自投机解码——partial-CoT 作 draft + 同模型完整预算作 verifier,训练完全免费(arXiv:2608.20359)
- 来源:
inbox/flyp/2026-09-03-1550-SSR-self-speculation-reasoning-critical-read.md(重写版)§flyP critical-read - 来源链接:
https://arxiv.org/abs/2608.20359(v1 2026-06-17,cs.CL) - 作者:Ravisri Valluri(单作,无机构标注)
- 可信度:🟡 中-低(单作者 preprint,无 GitHub 代码,α 指标未报告)
要点:
- 核心方法:同模型不同
max_thinking_tokens预算跑两次——低预算生成 partial-CoT 作 draft,满预算生成 full-CoT 作 verify;接受 draft 与 verify 的最长公共前缀;额外用 suffix cache 回收重叠 span - 关键数字:ClassEval Gemma-4 -24.1% / Qwen3.5 -18.5% 端到端延迟下降;HumanEval -2.9% ~ -14.6%;LongProc 2K -7.1% ~ -9.1%
- 训练完全免费:只改推理参数,不训练额外 head(与 Eagle3/MTP/SparseSpec 的本质区别)
- 核心缺陷(flyP critical-read 识别):
1. α 指标(acceptance rate × draft_length − 1)未单独报告——无法诊断加速来源,与 SSD/Eagle3/SparseSpec 横向不可比
2. 任务覆盖极窄:仅 4B 级 dense 模型(Qwen3.5-4B / Gemma-4-E4B),无 MoE、无开放式 QA、无数学竞赛
3. Qwen3.5 MoE 兼容性未验证:Qwen3.5-27B-A3B 的 hybrid linear attention
conv_states/recurrent_states无法选择性回滚,SSR 可能完全失效 4. 无 GitHub 代码:复现需自行工程化 5. 单作 + 无机构:可信度起点低于同期 SSD(Yandex/Meta 联合)/ Eagle3
与活文档现有脉络的关系: - §1.(1) 推理引擎 Speculative Decoding 节:SSR 是第 9 种 speculative decoding 范式(同源自投机,完全免训练) - 与 EAGLE-3 / EAGLE 3.1 / Medusa / MTP / DFlash2 构成"投机动机 × 训练成本"二维图谱 - 本文尚未锚入 inference.md — 本棒 NET-new(低可信度)
建议归入节:§1.(1) 推理引擎 · Speculative Decoding(SSR · 自投机解码 · partial-CoT 作 draft · arXiv:2608.20359) 状态:NET-new(尚未锚入 inference.md;低可信度,仅适合作为对照锚)
增量 2【§1.(3) KV Cache · 2026-09-03】🟢 RetroInfer:KV Cache 即向量存储引擎——wave index 驱动的 GPU-CPU 协同长上下文推理(VLDB 2026 · arXiv:2505.02922)
- 来源:
inbox/jay/2026-09-03T1835-jay-retroinfer-agentic-db-ponytail-trending-sep03.md+inbox/jay/2026-09-03T2105-jay-evening-briefing-five-category-digest.md§database - 来源链接:
https://arxiv.org/abs/2505.02922;GitHub:https://github.com/microsoft/retrievalattention - 会议:VLDB 2026(PVLDB Vol.19 Issue 5, Pages 1016-1031)
- 作者:微软研究院 + 中国科技大学 + 清华大学 + 上海交通大学
- 可信度:极高(VLDB 2026 同行评审;微软研究院署名;代码已公开)
要点:
- 核心范式转变:将 KV Cache 重新建模为可索引、可检索的向量集合——不再是"缓存"而是"向量存储引擎"
- wave index(Attention-aWare VEctor index):利用 attention 的稀疏性,支持在 GPU-CPU 协同环境下精准检索关键 KV 向量
- wave buffer:协调 KV Cache 在 GPU HBM / 本地 CPU / 远程 CPU RDMA / 分布式存储 3FS 四层的放置策略,计算与数据传输 overlap
- 与 PagedAttention 的关系:与 vLLM/SGLang 的 PagedAttention 形成直接工程竞争——PagedAttention 优化内存管理,RetroInfer 优化检索效率,两者可互补
- 与 RetrievalAttention 的关系:是 NeurIPS 25 RetrievalAttention 的工业级扩展(RetrievalAttention = NeurIPS 25 学术原型,RetroInfer = VLDB 2026 生产级系统)
与活文档现有脉络的关系: - §1.(3) KV Cache:开辟 KV Cache 优化第六路线——向量存储引擎化(在 Eviction / Compression / Hybrid Memory / Novel Attention / Combination 五大路线之外) - 与 LMCache v2(arXiv:2510.09665,9-2 e1prep 邻接预备)、KV Cache Internet(arXiv:2608.01526)同属 KV Cache 系统工程方向 - 本文尚未锚入 inference.md — 本棒 NET-new(高可信度)
建议归入节:§1.(3) KV Cache(NET-new · RetroInfer · wave index · VLDB 2026 · arXiv:2505.02922) 状态:NET-new(尚未锚入 inference.md;建议优先锚入,VLDB 2026 正式论文)
增量 3【§1.(1) 推理引擎 + §1.(2) 推理调度 · 2026-09-03】🟢 Meta Llama Inference 部署优化 + RTP-LLM 阿里巴巴推理引擎——生产数据双重确认 P/D 分离量化收益(MLSys 2026 · arXiv:2605.29639)
- 来源:
inbox/jay/2026-09-03-llm-inference-rag-engineering.md§A1 + §A2 - Meta 链接:
https://proceedings.mlsys.org/paper_files/paper/2026/file/97dc07f1253ab33ee514f395a82fa7cc-Paper-Conference.pdf - RTP-LLM 链接:
https://arxiv.org/html/2605.29639 - 可信度:极高(Meta = 近 10 亿月活用户生产数据,MLSys 2026;RTP-LLM = 阿里 1 亿用户生产验证,开源代码已发布)
要点(Meta MLSys 2026):
- 异构硬件策略:Prefill 用计算型 GPU(H100),Decode 用带宽型 GPU(H200),成本效率提升 15-25%
- Disaggregation 迁移后在线服务节省约 30% 算力容量
- TP4PP2 vs TP2PP4:前者延迟更低但 QPS 低 20%(通信开销权衡)
- 吞吐量提升最高 ~2.5×
要点(RTP-LLM):
- 模型加载速度比 vLLM 和 SGLang 快 4.7-6.3×(文件顺序驱动 I/O + 并行 I/O-通信重叠)
- TTFT P95 延迟降低 35-37%;缓存复用提升 215%
- 四层层级 KV 缓存访问:GPU HBM → 本地 CPU → 远程 CPU via RDMA → 分布式存储 3FS
- 支持 PD-Fusion(同节点)和 PD-Disaggregation(分离节点)两种部署模式
与活文档现有脉络的关系: - §1.(1) 推理引擎:与 vLLM 配置权衡(arXiv:2607.09172)构成"生产数据 + 工业系统"双验证 - §1.(2) 推理调度:P/D 分离量化数据(30% 算力节省 + 15-25% 成本效率)是对 llm-d CNCF Sandbox 的生产级数据补充 - 本文尚未锚入 inference.md — 本棒 NET-new
建议归入节:§1.(1) 推理引擎(Meta 生产数据 · MLSys 2026)+ §1.(2) 推理调度(RTP-LLM · PD-Fusion/Disaggregation) 状态:NET-new(尚未锚入 inference.md;两篇均为高可信度生产数据,建议优先锚入)
增量 4【§1.(2) 推理调度 · 2026-09-03】🟢 Cascade + OpScale:SLO 感知调度与算子级弹性伸缩——延迟预算统一协调(arXiv:2608.06557 + arXiv:2608.13499)
- 来源:
inbox/jay/2026-09-03-llm-inference-rag-engineering.md§A4 + §A5 - Cascade 链接:
https://arxiv.org/abs/2608.06557v1;OpScale 链接:https://arxiv.org/html/2608.13499v1 - 可信度:高(Cascade = arXiv 预印本,基于生产轨迹验证,2026-08;OpScale = 40×A100 + 24×GB200 集群生产轨迹验证,2026-08)
要点(Cascade):
- 将"延迟预算(SLO - 预测剩余服务时间)"作为调度和 KV Cache 管理的统一协调量
- 好吞吐提升最高 2.4×;SLO 违规率降低 40%
- TTFT 延迟估算器:结合上下文长度、前缀 KV 缓存命中率、系统当前负载
- 基于 vLLM + LMCache 实现,不修改模型权重
要点(OpScale):
- 扩缩容单位从"整模型"细化到单个算子,实现亚秒级弹性
- 满足 SLO 前提下减少 36.3% GPU、28% 电力
- 固定成本预算下吞吐提升 44%;Greedy 启发式算法与理论最优差距 < 8%
与活文档现有脉络的关系: - §1.(2) 推理调度:与 FlexLLM(token 级 co-serving,9-2 e1prep)同属"延迟/SLO 感知调度"方向,但 Cascade 聚焦批处理调度,OpScale 聚焦弹性伸缩 - 与 Stream2LLM(append/update 模式,9-2 e1prep)构成"调度策略 × SLO 保障"双层体系 - Cascade 尚未锚入 inference.md;OpScale 尚未锚入
建议归入节:§1.(2) 推理调度(Cascade · 延迟预算统一协调 · arXiv:2608.06557)+ §1.(2) 推理调度(OpScale · 算子级弹性 · arXiv:2608.13499) 状态:NET-new(均未锚入 inference.md)
增量 5【§1.(1) 推理引擎内核 + §1.(3) KV Cache · 2026-09-03】🟡 CRISP:结构化质量层级驱动的自适应稀疏 Prefill 路由——长上下文推理成本优化(arXiv:2609.01925 · paper_card 1197 入库)
- 来源:
inbox/jay/2026-09-03-llm-inference-rag-engineering.md§增量 2 邻接 + paper_card 1197-2609-01925 - 来源链接:
https://arxiv.org/abs/2609.01925 - 会议:MLSys 2026
- 作者:Dell Technologies(推测,基于 Dell Technologies arXiv:2603.20397 KV Cache 五大优化方向同源)
- 可信度:高(paper_card 1197 已入库;长上下文稀疏 attention 方向;MLSys 2026)
要点:
- 两个结构性问题:post-softmax 质量层级被忽略(路由到低质量 head 导致稀释);固定模式无法适应输入相关注意力结构
- CRISP(Cliff-awaRe Input-adaptive Sparse Prefilling):输入自适应路由,动态分配稀疏模式给不同 head
- 关键工程意义:直接针对长上下文推理的成本瓶颈;稀疏注意力从固定模式向动态路由演进
- paper_card 入库:1197-2609-01925(✅ 2026-09-03 16:30 入库 · llm-infra 主分类)
与活文档现有脉络的关系: - §1.(3) KV Cache 长上下文稀疏 attention 节:与 CRISP(长上下文自适应稀疏 prefill)与 Stream2LLM(append/update 检索-推理 overlap)形成互补——CRISP 解决 prefill 成本,Stream2LLM 解决 retrieval-decode 重叠 - 与 9-2 e1prep 中的 TokenWeave(kernel 级优化)、TokenFlow(FCFS + prefill 优先)构成"kernel → 调度 → 稀疏路由"三层长上下文优化体系 - 本文尚未锚入 inference.md — 本棒 NET-new(paper_card 已入库确认)
建议归入节:§1.(3) KV Cache(CRISP · 长上下文自适应稀疏 Prefill 路由 · arXiv:2609.01925)+ §1.(1) 推理引擎内核(邻接) 状态:NET-new(paper_card 1197 已入库;尚未锚入 inference.md)
三、6 条邻接预备供今晚活文档接力参考
| # | 条目 | arXiv | 来源 | 状态 |
|---|---|---|---|---|
| A | HF @huggingface/kernels WebGPU:207 个 WebGPU kernels,Apache-2.0,M4 GPU 比 ONNX Runtime Web 快 2.57×(几何平均),单 Bilinear Einsum >10,000× | 无(HF 官方博客) | jay 9-3 1735 | 邻接(Apple Silicon + 边缘推理;与 llama.cpp 本地推理路线互补) |
| B | llama.cpp + HF ggml 团队:ggml 加入 HF(Feb 2026);支持 DeepSeek-V4-Flash 284B + Kimi-K3 2.8T GGUF 本地推理 | 无(State of Open Models Summer 2026) | jay 9-3 1735 | 邻接(本地推理里程碑) |
| C | DFlash2 A800 接受率崩塌:FlexAttention DFlash2 在 NVIDIA A800(800 GB/s HBM2e)上接受率异常偏低,需静态源码 + GPU 双重验证 | 无(CSDN 2026-09-03) | jay 9-3 0820 | 邻接(生产警示;H100/H200 数字不可直接推广到 A800) |
| D | EAGLE-3 / EAGLE 3.1:Dense 模型加速最高 6×;EAGLE 3.1(2026-05)长上下文工作负载 TTAL 比 EAGLE-3 翻倍;Medusa 接受率通常 0.55-0.70 | 无(Red Hat Developers) | jay 9-3 0820 | 邻接(speculative decoding 调优参考) |
| E | SGLang vs vLLM DeepSeek V3 MLA 优化:SGLang 对 DeepSeek V3 专用加速 MLA 优化达 3.1× vs vLLM | 无(Jay benchmark 2026-09-01) | jay 9-3 0820 | 邻接(MoE 模型引擎选型重要数据点) |
| F | NVIDIA $12.9B 收购 HF(待核实):The Information 8/26 首发,Business Insider 同日称尚"未签约" | 无 | stephen 9-3 noon coord | 邻接(P0 待核实;如完成将对 HF 开源生态有深远影响) |
四、值得警惕的矛盾或待核实说法
-
SSR 2.9%-24.1% 延迟下降的适用范围严重受限: - 仅测 4B 级 dense 模型(Qwen3.5-4B / Gemma-4-E4B);13B/70B/MoE 效果完全未知 - Qwen3.5 MoE(27B-A3B)的 hybrid linear attention 兼容性是 open question——标准 spec dec 在该架构上常失效 - α 指标(acceptance rate × draft_length − 1)未报告,无法横向对比 Eagle3/SSD/SparseSpec
-
RetroInfer wave buffer 的工程成熟度: - VLDB 2026 论文阶段,具体与 vLLM/SGLang 集成的工程路径未详细说明 - 与 PagedAttention 的互补/竞争关系需实测验证
-
RTP-LLM 开源代码质量待核实: - jay 9-3 简报提到"已开源",但具体 GitHub 仓库名未注明 - 需核实与 vLLM/SGLang 的 API 兼容性
-
Cascade / OpScale 的生产部署可行性: - 两篇均为 arXiv 预印本(2026-08),具体集成到 vLLM 的工程复杂度未评估 - OpScale 的 Greedy 启发式算法在异构 GPU 集群上的泛化性待验证
-
HF $12.9B 收购 HF 的真实状态: - The Information 称已签约,Business Insider 称未签约——矛盾未消解 - 如完成,NVIDIA 体系内的 HF 定位、与 OpenAI/Anthropic 的关系需重新评估
五、可引用的 arXiv 号列表(6 件 · 本棒 NET-new)
- arXiv:2608.20359 — SSR: Self-Speculation for Faster Reasoning Models(自投机解码 · ClassEval -24.1% · 2026-08)
- arXiv:2505.02922 — RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference(VLDB 2026 · wave index · 微软+中科大+清华+交大 · 2025-05)
- arXiv:2605.29639 — RTP-LLM: High-Performance Alibaba LLM Inference Engine(阿里 1 亿用户生产验证 · 模型加载 4.7-6.3× · TTFT -35-37% · 2026-05)
- arXiv:2608.06557 — Cascade: Exploiting SLO-Aware Latency Budget for Fair and High Goodput LLM Inference Serving(SLO 调度 · 好吞吐 2.4× · 2026-08)
- arXiv:2608.13499 — OpScale: Operator-level Provisioning and Autoscaling for LLM Serving(算子级弹性 · GPU -36.3% · 电力 -28% · 2026-08)
- arXiv:2609.01925 — CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling with Structural-Mass-Motivated Routing(长上下文自适应稀疏 Prefill · paper_card 1197 已入库 · 2026-09)
沿用件(已在 inference.md 或预备级)
- FlashAttention-4 MLSys 2026 Best HM(已锚入 inference.md 头部)
- ReplaySSM(9-1 候选 · 待锚入)
- The Silent Hyperparameter arXiv:2605.19537(9-1 候选 · 待锚入)
- SwiftCache arXiv:2606.16135(9-1 候选 · 待锚入)
- Albireo arXiv:2606.01927(9-1 候选 · 待锚入)
- TokenWeave arXiv:2505.11329(9-2 NET-new · 待锚入)
- Stream2LLM MLSys 2026(9-2 NET-new · 待锚入)
- FlexLLM NSDI 2026(9-2 NET-new · 待锚入)
- TokenFlow arXiv:2510.02758(9-1 候选)
- NeuroPrefetcher arXiv:2608.22643(9-1 候选 · ICPP 2026)
- Oneiros arXiv:2507.11507(9-1 候选)
- MLCommons MLPerf RAG Benchmark 2026-08-26(已锚入)
六、本棒小结
inference 主题 9-2 22:20 → 9-3 22:20 净增量 = 5 条主增量(3 条 NET-new + 2 条邻接入库)+ 6 条邻接预备供今晚活文档接力参考
| # | 条目 | 分类 | 价值 | 状态 |
|---|---|---|---|---|
| 1 | SSR(自投机解码 · partial-CoT 作 draft · arXiv:2608.20359) | §1.(1) Speculative Decoding | ⭐⭐⭐ | NET-new;低可信度;仅作对照锚 |
| 2 | RetroInfer(wave index · VLDB 2026 · arXiv:2505.02922) | §1.(3) KV Cache | ⭐⭐⭐⭐⭐ | NET-new;高可信度;建议优先锚入 |
| 3 | Meta MLSys + RTP-LLM(P/D 分离量化数据) | §1.(1) + §1.(2) | ⭐⭐⭐⭐⭐ | NET-new;生产数据;建议优先锚入 |
| 4 | Cascade + OpScale(SLO 调度 + 算子级弹性) | §1.(2) 推理调度 | ⭐⭐⭐⭐ | NET-new;待锚入 |
| 5 | CRISP(长上下文自适应稀疏 Prefill · paper_card 1197 入库) | §1.(3) KV Cache | ⭐⭐⭐⭐ | NET-new;paper_card 已入库;待锚入 |
| A | HF @huggingface/kernels WebGPU(2.57× M4) | §1.(1) 边缘/Apple Silicon | ⭐⭐⭐⭐ | 邻接预备 |
| B | llama.cpp DeepSeek-V4-Flash 284B + Kimi-K3 2.8T | §1.(1) 本地推理 | ⭐⭐⭐ | 邻接预备 |
| C | DFlash2 A800 接受率崩塌(生产警示) | §1.(1) 推理引擎配置 | ⭐⭐⭐⭐ | 邻接预备(⚠️生产警示) |
| D | EAGLE-3 / EAGLE 3.1(speculative decoding 调优) | §1.(1) Speculative Decoding | ⭐⭐⭐ | 邻接预备 |
| E | SGLang DeepSeek V3 MLA 3.1× vs vLLM | §1.(1) 推理引擎选型 | ⭐⭐⭐⭐ | 邻接预备 |
| F | NVIDIA $12.9B 收购 HF(待核实) | 行业事件 | ⭐⭐⭐⭐ | P0 待核实 |
与 9-2 evening inference e1prep(3 条主增量 + 6 条邻接预备)对照: - 9-2 增量:TokenWeave / Stream2LLM / FlexLLM(MLSys 2026 第二波 + NSDI 2026 新范式) - 9-3 增量:SSR 自投机解码(低可信度新栖)+ RetroInfer VLDB 2026(KV Cache 向量存储引擎化)+ Meta/RTP-LLM 生产双重确认 + Cascade/OpScale SLO 调度 + CRISP 长上下文稀疏路由 - 本棒特征:生产数据密度提升(Meta 10 亿用户 + RTP-LLM 1 亿用户)+ VLDB 2026 新系统(RetroInfer)+ 警示信号(DFlash2 A800)+ 行业事件(NVIDIA/HF 收购待核实)
七、检查过的来源汇总
已检查 / 已纳入本棒
- ✅
organized/knowledge/inference.md(2026-09-03 更新标注 · 约430条 arXiv 基线) - ✅
work-queue.md(2026-09-03 22:00) - ✅
inbox/tom/2026-09-03T0840-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/tom/2026-09-03T1440-agent-rag-longcontext-radar.md(inference 0 件 · CRISP 邻接) - ✅
inbox/tom/2026-09-03T2040-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/jay/2026-09-03-llm-inference-rag-engineering.md(Meta MLSys + RTP-LLM + Cascade + OpScale + Red Hat) - ✅
inbox/jay/2026-09-03T0820-jay-csdn-inference-stack-highfreq-round2.md(Ollama vs vLLM + SGLang RadixAttention + DFlash2 A800) - ✅
inbox/jay/2026-09-03T1050-jay-inference-agent-engineering-filter.md(vLLM vs SGLang vs TRT-LLM benchmark) - ✅
inbox/jay/2026-09-03T1735-jay-evening-briefing-hf-webgpu-aiagents-stack-2026-sep03.md(HF WebGPU Kernels + llama.cpp 里程碑) - ✅
inbox/jay/2026-09-03T1835-jay-retroinfer-agentic-db-ponytail-trending-sep03.md(RetroInfer · 本棒最关键源之二) - ✅
inbox/jay/2026-09-03T2105-jay-evening-briefing-five-category-digest.md(Meta + RTP-LLM + RetroInfer + Cascade + OpScale) - ✅
inbox/flyp/2026-09-03-1550-SSR-self-speculation-reasoning-critical-read.md(SSR 完整批判性分析 · 本棒最关键源之四) - ✅
inbox/spark/2026-09-03-llm-infra-e1prep.md(0 件 inference NET-new) - ✅
inbox/stephen/2026-09-03-llm-application-e1prep.md(6 件邻接备料 · 均为 agent/RAG 主题) - ✅
paper_cards/1197-2609-01925.md(CRISP · llm-infra 主分类 · 2026-09-03 入库) - ✅
inbox/tom/2026-09-02-inference-e1prep.md(9-2 参照基线) - ✅
inbox/tom/2026-09-01-inference-e1prep.md(9-1 参照基线)
已检查 / 未纳入(无 inference 净新增)
inbox/jay/2026-09-03T2105-jay-evening-briefing-five-category-digest.md(database 主轴 6 件,均为 database/agent 主题)inbox/spark/2026-09-03-agent-e1prep.md(agent 主轴 · inference 0 件)inbox/stephen/2026-09-03-ai-industry-e1prep.md(ai-industry 主轴)inbox/tom/2026-09-03-rag-e1prep.md(RAG 主轴 · 0 件 inference NET-new)inbox/tom/2026-09-03-evaluation-e1prep.md(evaluation 主轴)inbox/flyp/2026-09-03-risk-e1prep.md(risk 主轴 · Safin-1 + EAL 相关)
Tom · 2026-09-03 22:20 CST · 本棒检查 20+ 来源(tom radar 3 件 + jay 简报 6 件 + flyp SSR critical-read 1 件 + spark/stephen llm-infra/llm-application e1prep 2 件 + paper_cards 1 件 + inference.md 1 件 + work-queue 1 件) · inference 主题 NET-new 3 条 + 邻接入库 2 条 + 邻接预备 6 条 · 涉及 arXiv 号 6 件(净增)