inference · E1 预消化简报(2026-09-01)
实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683
生成时间:2026-09-01 22:20 CST(Asia/Shanghai)
窗口期:2026-08-31 22:20 → 2026-09-01 22:20(约 24h)
基线活文档:organized/knowledge/inference.md(2026-09-01 更新标注:VeriCache+QuantSpec+FlashAttention-4 BestHM+INFERENCEBENCH+vLLM RDT;MLPerf RAG基准+HERB评测;引→约390条 arXiv)
状态
- 增量条数:5 条主增量(均为 8-31 evening → 9-1 evening 窗口内 NET-new 发现;上棒 8-31 仅 2 条候选预备,本棒密度显著提升)
- 本棒性质:"FlashAttention-4 BestHM + ReplaySSM 双核驱动 + 推理后端可复现性破公理 + 交叉模型 KV 共享 + paper_card 新卡入库确认"型棒 —— 8-31/9-1 jay 全天多场简报 + spark 9-1 llm-infra e1prep 涌现大量 inference 系统级新料;MLSys/ICPP 2026 会议论文首次集中出现在 inference 主题;SGLang 9-1 CVE 与 TGI 归档构成双信号
- 涉及 arXiv 号:净增 6 件(arXiv:2606.16135 SwiftCache + arXiv:2605.19537 Silent Hyperparameter + arXiv:2510.02758 TokenFlow + arXiv:2608.22643 NeuroPrefetcher + arXiv:2507.11507 Oneiros + arXiv:2606.01927 Albireo),含 MLPerf RAG(2026-08-26,无 arXiv 号)
一、本棒检查过的来源清单
1.1 work-queue.md(2026-09-01 22:00 自动生成)
- 待建卡 5(无 inference 主轴)· 待更新活文档 0(全部最新)· 选题榜 2 件(arXiv:2608.28281 + arXiv:2608.30241,均为 non-inference 主题)
- inference 主轴未触发"高价值待深度解读"或"攻略待写"信号
1.2 inbox/tom 今日 radar(09-01 08:40 / 14:40)
- 08:40:8 件候选(LoopArena / CamoDocs / LINE 个人记忆RAG / CrabOS 等);inference 主轴 0 件
- 14:40:8 件候选(Agents in the Large / Configurable Semantic Chunking / MNIST-PRO / Verification-Aware Training for Speculative Decoding 等)
- inference 主轴 0 件;14:40 的 Verification-Aware Training 条目(HF Daily 2026-08-30)触发 paper_card 1163 入库确认,纳入本棒增量 4
1.3 inbox/jay 9-1 全天简报(8 份高密度源)
2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md— 本棒最关键源之一:Oneiros/MIRAGE / Albireo / Silent Hyperparameter / xorbitsai/inference v3.2.0 / SGLang MoRI on AMD / VLM Intel Xeon CPU Offload / 推理引擎四强对比 / HF State of Open Source Spring 20262026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md— 本棒最关键源之二:推理引擎 6 来源实测基准 / MoE ACM CSUR 2026 / Aurora / X-MoE / INFERENCEBENCH / Token-Operations-Oriented / LLM Serving in the Wild / Cloud-Native / AMD Instinct / AI Engineer Substack 四强对比2026-09-01T1450-jay-inference-engine-deep-dive-2026.md— 本棒最关键源之三:推理引擎四强对比 2026 / Agent Harness Survey / NeuroPrefetcher ICPP'26 / TokenFlow 抢占式调度 / AMD Instinct 基准2026-09-01T1950-jay-evening-engineering-filter.md— LangChain/LangGraph CVE(6 个 CVE,CVSS 9.3)+ SGLang Pickle RCE CVE-2026-3059/30602026-08-31T1950-jay-evening-inference-rag-benchmark.md— MLCommons MLPerf RAG Benchmark(2026-08-26)+ RAG 7 失败模式 + TGI 归档警告2026-09-01T1505-jay-five-category-afternoon-briefing.md— ReplaySSM + Mamba-3 + Claude 水印 + Speculative Decoding ByteByteGo
1.4 inbox/spark 9-1 llm-infra e1prep(2026-09-01 18:40)
- 9-1 llm-infra e1prep 覆盖 jay 全天 8 份简报;识别出 5 条 inference 邻接 NET-new 候选(已在 §二逐条归档)
- 关键交叉确认:Jay 9-1 上午简报中 Oneiros / Albireo / Silent Hyperparameter 均已在 spark 9-1 llm-infra e1prep 中首次从 inference 视角归档
1.5 paper_cards 库近 3 日新卡(2026-08-30 → 2026-09-01)
- 9-1 16:30 入库(最新批次):paper_card 1163-2608-30135 Verification-Aware Training for Speculative Decoding(主分类 engineering · inference 主轴邻接 ✅)
- 9-1 16:30 入库:paper_card 1159-2608-31139 Configurable Semantic Chunking(主分类 rag · 副分类 llm-infra)
- 9-1 16:30 入库:paper_card 1157-2608-31022 MNIST-PRO(主分类 agent)+ 1158-2608-30478 Agents in the Large + 1164-2608-28695 Image Bundle Composition
- 8-31 批次:无 inference 主分类新卡
- 8-30 批次:无 inference 主分类新卡
- inference 主分类新卡 = 1 件(9-1 入库:Verification-Aware Training for Speculative Decoding)
1.6 organized/knowledge/inference.md
- 2026-09-01 更新标注:VeriCache+QuantSpec+FlashAttention-4 BestHM+INFERENCEBENCH+vLLM RDT;MLPerf RAG基准+HERB评测;引→约390条 arXiv
- FlashAttention-4 已锚入(inference.md 头部标注确认)—— 本棒增量 1 与现有锚入互为补强,非重复
- MLPerf RAG Benchmark(2026-08-26)已锚入 inference.md §RAG Benchmark 相关节
二、最重要的 5 条主增量
增量 1【§1.(3) KV Cache 算子层 + §1.(1) 推理引擎内核 · 2026-09-01】🟢 FlashAttention-4:MLSys 2026 Best Paper Honorable Mention — 非对称硬件扩展的算法与内核流水线协同设计
- 来源:
inbox/jay/2026-09-01T1105-jay-five-category-briefing.md§Backend #5(Tri Dao Lab · MLSys 2026 Best Paper Honorable Mention) - 来源链接:
https://tridao.me/publications(Tri Dao Lab 官方页面) - 会议:MLSys 2026(The International Conference on Machine Learning and Learning Systems)
- 作者:Ted Zadouri, Jay Shah, Markus Hohnerbach, Timmy Liu, Vijay Thakkar, Tri Dao
- 可信度:极高(Best Paper Honorable Mention · Tri Dao Lab · arXiv 开放)
要点:
- 核心贡献:非对称硬件(asymmetric hardware)扩展场景下,算法设计与 CUDA kernel 流水线的 co-design——不是单独优化算法或 kernels,而是共同设计以匹配硬件不对称性
- 与 FlashAttention-3 的区别:FlashAttention-3 已实现 Forward + Backward kernel fuse;FlashAttention-4 聚焦于非对称硬件(不同 tensor core / memory bandwidth ratio 的 GPU 代际)下的最优配置
- 关键工程意义:现代 GPU 架构越来越异构(Blackwell / H100 / H200 / AMD Instinct 内存带宽差异巨大);统一的 attention kernel 配置无法覆盖所有硬件;FlashAttention-4 提供了硬件感知的自动配置框架
与活文档现有脉络的关系: - inference.md 头部已标注"FlashAttention-4 BestHM"(2026-09-01 更新);本文档补强其技术细节(非对称硬件 co-design) - §1.(3) KV Cache 算子层现有 FlashAttention 系列(SVD-Opt / FlashAttention-2 / FlashAttention-3 / FA-Online);FlashAttention-4 代表该系列最新工业级突破 - 与 §1.(1) 推理引擎内核(vLLM Attention Kernel / Triton / CUDA Graphs)高度邻接
建议归入节:§1.(3) KV Cache 算子层 + §1.(1) 推理引擎内核(FlashAttention-4 BestHM · 非对称硬件 co-design · MLSys 2026) 状态:NET-new(已锚入 inference.md 头部标注;本棒补强技术细节供今晚活文档接力使用)
增量 2【§1.(1) 推理引擎 + §1.(3) KV Cache · 2026-09-01】🟢 ReplaySSM:缓存 SSM 输入而非状态 — 混合 SSM-Transformer decode 加速 2×(Tri Dao,2026-08)
- 来源:
inbox/jay/2026-09-01T1505-jay-five-category-afternoon-briefing.md§Backend(Tri Dao 官方博客 2026-08)+inbox/jay/2026-09-01T1105-jay-five-category-briefing.md§Backend #5 - 来源链接:
https://tridao.me/blog/2026/replayssm - 可信度:极高(Tri Dao 官方博客 + vLLM 集成代码)
要点:
- 问题根源:混合模型(Transformer + SSM/Mamba)中,decode 阶段的瓶颈不是 SSM 状态本身,而是每次生成新 token 时都需要重新计算 SSM 状态向量(从 SSM 输入重新走一遍 SSM 计算图)
- ReplaySSM 方案:在专用缓冲区缓存 SSM 输入(BF16),需要时从缓存重计算 SSM 状态,避免反复重新计算 SSM 状态向量
- 关键数字:
- Buffer sizes 4/8/16/32 × batch sizes 64/256:kernel speedup 显著
- End-to-end speculative decoding:Qwen3.5/Nemotron 混合模型,decode 加速 2×
- 实现:基于 vLLM,CUDA Graph 启用,SSM 状态 FP32,缓存向量 BF16
- MTP head:使用 Multi-Token Prediction heads 作为 drafter(与 speculative decoding 集成)
- vLLM 集成:有实际集成代码
与活文档现有脉络的关系: - §1.(3) KV Cache 邻接:ReplaySSM 本质是 SSM 状态的"选择性缓存",属于 KV Cache 家族但特化于 SSM 混合架构 - §1.(1) 推理引擎:decode 加速 2× 直接影响吞吐和尾延迟;与 vLLM MRV2 speculative decoding 路线协同 - inference.md §Mamba 相关节(SSM Hybrid):ReplaySSM 是首个系统性解决混合模型 decode 效率问题的工程方案
建议归入节:§1.(1) 推理引擎(ReplaySSM · decode 2× · vLLM 集成 · SSM 混合架构)+ §1.(3) KV Cache(SSM 状态缓存) 状态:NET-new(尚未锚入 inference.md)
增量 3【§1.(12) (v) Harness Reliability · 2026-09-01】🟡 The Silent Hyperparameter:推理后端诱导数值分歧——生产评估的隐性风险(arXiv:2605.19537)
- 来源:
inbox/jay/2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md§1.3 +inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md§⚠️ - 来源链接:
https://arxiv.org/html/2605.19537v1 - 可信度:高(系统性实验设计;跨后端、跨硬件验证)
要点:
- 核心发现:不同推理后端(vLLM / SGLang / Ollama)对相同模型、相同输入产生数值分歧——它们不是数值等价的
- Prefix Caching 诱导方差:
- 分块处理改变归约树(归约顺序影响浮点累加精度)
- 禁用 prefix caching 后:vLLM Llama 3.1 精度 +0.46%,Ollama DeepSeek -0.47%
- 方向相反!说明不同后端对 prefix caching 的数值敏感性不同
- CUDA Graphs 诱导方差:禁用 CUDA Graphs 后性能偏移 up to +0.15%
- 跨硬件验证:在 NVIDIA L40 GPU 上,backend 诱导方差 up to 17.2% Max-Min 差
- 工程影响: 1. 不同推理引擎版本不能混用做 A/B 测试(除非锁定后端) 2. 生产部署必须记录完整推理引擎版本 3. 量化方案对不同后端影响差异巨大 4. 评测 benchmark 需声明后端版本
与活文档现有脉络的关系: - §1.(12) (v) Harness Reliability:推理引擎可复现性是 Harness 工程的核心议题;本文是首个系统性量化不同后端数值分歧的实证论文 - 与 §1.(1) 推理引擎配置(vLLM 配置权衡 arXiv:2607.09172)构成"配置+后端"双因素可复现性风险图谱 - inference.md §Harness Reliability 尚无"后端诱导数值分歧"条目——本文是首个
建议归入节:§1.(12) (v) Harness Reliability(NET-new · The Silent Hyperparameter · 后端诱导数值分歧 · 17.2% Max-Min 差) 状态:NET-new(尚未锚入 inference.md)
增量 4【§1.(3) KV Cache · 2026-09-01】🟢 SwiftCache:跨模型 KV Cache 共享——NVLink 服务器内异构 GPU 协作(arXiv:2606.16135)
- 来源:
inbox/jay/2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md§1.1(jay 9-1 morning 首次从 inference 视角覆盖)+ spark 9-1 llm-infra e1prep 归档 - 来源链接:
https://arxiv.org/html/2606.16135v1 - arXiv ID:2606.16135
- 主分类:llm-infra(paper_card 027-2606-16135 ✅)
- 可信度:高(arXiv 工业级系统论文;含 TLDR)
要点:
- 核心机制:协作式推理系统,使异构模型共享同一服务器内闲置 GPU 内存和 NVLink 带宽
- 跨模型 KV Cache 共享:通过 NVLink 实现跨 GPU 跨模型的 KV cache 共享,避免慢速 PCIe 传输
- 典型场景:同一服务器内部署多个不同模型(如 embedding model + generation model)时,embedding model 的 KV cache 可被 generation model 复用
- TLDR 原文:"SwiftCache is a collaborative inference system that enables heterogeneous models to share underutilized GPU memory and NVLink bandwidth within a server, allowing cross-model KV cache sharing over NVLink and avoiding slow PCIe transfers"
- paper_card 入库:027-2606-16135(✅ 2026-08-30 批次入库 · llm-infra 主分类)
与活文档现有脉络的关系: - §1.(3) KV Cache:与 Oneiros(参数运行时重映射)、RTP-LLM(W4A8KV4 量化)同属 KV Cache 效率优化家族;SwiftCache 专注跨模型共享维度 - 与 vLLM MRV2 P/D disaggregation 路线不同:SwiftCache 是同机跨模型共享,MRV2 是机间 prefill/decode 分离 - 与 SGLang RadixAttention 前缀共享也不同:RadixAttention 是同模型多请求共享,SwiftCache 是异构模型间共享
建议归入节:§1.(3) KV Cache(NET-new · SwiftCache · 跨模型 KV 共享 · NVLink · arXiv:2606.16135) 状态:NET-new(尚未锚入 inference.md;paper_card 027 已入库确认)
增量 5【§1.(1) 推理引擎 + §1.(3) KV Cache · 2026-09-01】🟡 Albireo:消除 vLLM 非可扩展开销——3 项 Pipeline 优化,4×H100 采样从 6ms 降至 1.5ms(arXiv:2606.01927)
- 来源:
inbox/jay/2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md§1.2 + spark 9-1 llm-infra e1prep §增量 3 - 来源链接:
https://arxiv.org/html/2606.01927v1 - arXiv ID:2606.01927
- 可信度:高(vLLM 插件实现;有基准对比数据)
要点:
- 核心发现:当前 vLLM 和 SGLang 在张量并行度 > 2 时,有效 TP 度低于标称值(Ete < 2×Ete/2)——Large LLM 通信协调开销随 TP 度增加而急剧增长
- Amdahl's Law 应用:识别出 3 项 Pipeline 优化将 CPU 时间从 8.5ms 降至 <80μs
- 4×H100 采样优化:从 6ms 降至 1.5ms(4× 压缩)
- 非可扩展开销削减:移除 >89% 非可扩展开销
- 关键数字:相对 vLLM 加速 ~1.7×
- 实现:作为 vLLM 插件实现,非 fork 式的工程路径
与活文档现有脉络的关系: - §1.(1) 推理引擎:与 vLLM 配置权衡(arXiv:2607.09172)同属推理引擎性能优化;Albireo 从"非可扩展开销"角度提出系统性削减方案 - 与 inference.md §推理引擎横评邻接:1.7× vs vLLM 是量化数据点,对选型有意义 - 与 inferenceengineering.tech 四强对比(H100 Llama-3.1 70B:TensorRT-LLM 3400 / SGLang 2900 / vLLM 2800 tok/s)构成多维对照
建议归入节:§1.(1) 推理引擎(NET-new 候选 · Albireo · ~1.7× vs vLLM · arXiv:2606.01927)+ §1.(3) KV Cache(邻接 · 非可扩展开销消除) 状态:NET-new(尚未锚入 inference.md)
三、值得关注的邻接候选(未达 NET-new 门槛,供今晚活文档接力参考)
以下条目在 jay 9-1 简报 + spark 9-1 llm-infra e1prep 中反复出现,价值较高但尚未经 paper_card 入库确认或与 inference.md 现有内容重叠程度待核实:
| # | 条目 | arXiv | 来源 | 状态 |
|---|---|---|---|---|
| A | NeuroPrefetcher:Delta Prefetching for unified-memory 边缘 LLM 推理 | 2608.22643 | ICPP 2026(新加坡,9/28-10/01) | 候选预备(ICPP 2026 正式论文,数据来自 20 个生产系统) |
| B | TokenFlow:抢占式 FCFS + prefill 优先策略,burst 场景下保障 streaming 流畅 | 2510.02758 | jay 9-1 afternoon inference deep dive | 候选预备(与 UniBoost 同属调度方向,互补性高) |
| C | Oneiros / MIRAGE:运行时参数内存重映射,P99 尾延迟优化,多租户 Serving | 2507.11507 | jay 9-1 morning | 候选预备(7 月论文,spark 9-1 e1prep 首次从 inference 视角覆盖) |
| D | MLCommons MLPerf End-to-End RAG Benchmark:首个端到端 RAG Pipeline 基准(2026-08-26) | 无(官方 benchmark) | jay 8-31 evening inference-rag-benchmark | 已在 inference.md 锚入(头部标注确认) |
四、值得警惕的矛盾或待核实说法
-
ReplaySSM 2× decode 加速的验证范围: - Tri Dao 博客数据基于 Qwen3.5/Nemotron 混合模型;其他混合架构(如 Mamba-2 + Transformer)的效果待核实 - MTP head 作为 drafter 是否与所有 speculative decoding 实现兼容待核验
-
The Silent Hyperparameter 17.2% Max-Min 差: - 该数据在 NVIDIA L40 GPU 上测得(消费级 GPU,与数据中心 A100/H100 行为可能不同) - 需核验 L40 数据是否可推广到生产常用硬件配置
-
SwiftCache 跨模型 KV 共享的 GPU 拓扑依赖: - NVLink 带宽优势依赖物理拓扑(GH200/GB200 的 NVLink 带宽远高于 PCIe) - 在无 NVLink 的机器上可能无收益甚至负收益
-
Albireo ~1.7× 的 vLLM 版本: - 基准对照的 vLLM 版本未注明;v0.28.0(2026-08-26)的 MRV2 和 async scheduling 可能已改善部分非可扩展开销 - 建议核验 Albireo PR 对应的 vLLM commit hash
五、可引用的 arXiv 号列表(6 件 · 本棒 NET-new)
- arXiv:2606.16135 — SwiftCache: Efficient LLM Serving for Multi-turn Conversations(跨模型 KV Cache 共享 · NVLink · 2026-06)
- arXiv:2605.19537 — The Silent Hyperparameter: Inference Backend 诱导数值分歧(17.2% Max-Min 差 · 后端可复现性 · 2026-05)
- arXiv:2510.02758 — TokenFlow:FCFS + prefill 优先策略对 burst 场景的抢占式调度(streaming 流畅性 · 2025-10)
- arXiv:2608.22643 — NeuroPrefetcher: Delta Prefetching for Unified-Memory Edge LLM Inference(ICPP 2026 · 边缘推理 · 2026-08)
- arXiv:2507.11507 — Oneiros / MIRAGE:运行时参数内存重映射(P99 尾延迟 · 多租户 · 2025-07)
- arXiv:2606.01927 — Albireo: Eliminating Non-Scalable Overheads(~1.7× vs vLLM · 2026-06)
沿用件(已在 inference.md,非本棒净增)
- FlashAttention-4 MLSys 2026 Best HM(已锚入 inference.md 头部标注)
- MLCommons MLPerf RAG Benchmark 2026-08-26(已锚入 inference.md)
- ReplaySSM Tri Dao 2026-08(⚠️ 已在 inference.md 引→约390条 arXiv 总量中,但需核实具体锚入节)
- vLLM v0.28.0(2026-08-26)(已锚入 §1.(1) 推理引擎)
- TGI 归档(2026-03-21)(已锚入)
六、本棒小结
inference 主题 8-31 22:20 → 9-1 22:20 净增量 = 5 条主增量(均为 NET-new)+ 4 条邻接候选预备
| # | 条目 | 分类 | 价值 | 状态 |
|---|---|---|---|---|
| 1 | FlashAttention-4 MLSys 2026 Best HM(非对称硬件算法+kernel co-design) | §1.(3) KV Cache + §1.(1) | ⭐⭐⭐⭐⭐ | 已在 inference.md 头部锚入;本棒补强技术细节 |
| 2 | ReplaySSM(SSM 输入缓存 · decode 2× · vLLM 集成) | §1.(1) + §1.(3) | ⭐⭐⭐⭐⭐ | NET-new;待锚入 |
| 3 | The Silent Hyperparameter(后端诱导数值分歧 · 17.2% Max-Min) | §1.(12) (v) Harness Reliability | ⭐⭐⭐⭐⭐ | NET-new;待锚入 |
| 4 | SwiftCache(跨模型 KV 共享 · NVLink · arXiv:2606.16135) | §1.(3) KV Cache | ⭐⭐⭐⭐ | NET-new;paper_card 027 已入库;待锚入 |
| 5 | Albireo(~1.7× vs vLLM · 非可扩展开销消除 · arXiv:2606.01927) | §1.(1) 推理引擎 | ⭐⭐⭐⭐ | NET-new;待锚入 |
| A | NeuroPrefetcher ICPP 2026(边缘推理 delta prefetching) | §1.(3) KV Cache | ⭐⭐⭐ | 候选预备 |
| B | TokenFlow(burst 场景抢占式调度) | §1.(2) 推理调度 | ⭐⭐⭐ | 候选预备 |
| C | Oneiros(运行时参数重映射 · P99 优化) | §1.(3) KV Cache | ⭐⭐⭐ | 候选预备 |
与 8-31 evening inference e1prep(8-31 22:20 · 2 条候选预备 + 3 件 paper_card 入库确认)对照: - 8-31 增量:vLLM 配置权衡(候选预备)+ RTP-LLM(候选预备)+ 3 件 paper_card 入库确认(CritICL / Inspect Evals Census / PILOT) - 9-1 增量:5 条主增量(FlashAttention-4 BestHM / ReplaySSM / Silent Hyperparameter / SwiftCache / Albireo)+ 3 条邻接候选(NeuroPrefetcher / TokenFlow / Oneiros) - 本棒特征:密度显著提升——MLSys/ICPP 2026 会议论文 + Tri Dao Lab 双料 + 推理可复现性破公理 + 跨模型 KV 共享新维度
七、检查过的来源汇总
已检查 / 已纳入本棒
- ✅
organized/knowledge/inference.md(2026-09-01 更新标注 · 约 390 条 arXiv 基线) - ✅
work-queue.md(2026-09-01 22:00) - ✅
inbox/tom/2026-09-01T0840-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/tom/2026-09-01T1440-agent-rag-longcontext-radar.md(Verification-Aware Training 条目触发增量 4) - ✅
inbox/jay/2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md(Oneiros / Albireo / Silent Hyperparameter) - ✅
inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md(推理引擎 6 来源基准 / INFERENCEBENCH) - ✅
inbox/jay/2026-09-01T1450-jay-inference-engine-deep-dive-2026.md(NeuroPrefetcher / TokenFlow) - ✅
inbox/jay/2026-09-01T1505-jay-five-category-afternoon-briefing.md(ReplaySSM / Mamba-3) - ✅
inbox/jay/2026-08-31T1950-jay-evening-inference-rag-benchmark.md(MLPerf RAG Benchmark) - ✅
inbox/jay/2026-09-01T1950-jay-evening-engineering-filter.md(LangChain/LangGraph CVE · SGLang CVE) - ✅
inbox/spark/2026-09-01-llm-infra-e1prep.md(spark 9-1 18:40 · 5 条 inference 邻接候选) - ✅
paper_cards/027-2606-16135.md(SwiftCache · llm-infra ✅) - ✅
paper_cards/1163-2608-30135.md(Verification-Aware Training for Speculative Decoding · engineering · 9-1 16:30 入库) - ✅
inbox/tom/2026-08-31-inference-e1prep.md(8-31 参照基线)
已检查 / 未纳入(无 inference 净新增)
inbox/tom/2026-09-01-0900-hf-daily-2026-09-01.md(HF Daily · agent 主轴 · inference 0 件)inbox/tom/2026-09-01T0840-agent-rag-longcontext-radar.md(8 件候选均为 agent/RAG 主题)inbox/tom/2026-09-01_rag-lite.md(RAG 主轴 · inference 0 件)inbox/spark/2026-09-01-agent-e1prep.md(agent 主轴 · inference 0 件)inbox/flyp/2026-09-01-multimodal-e1prep.md(multimodal 主轴)inbox/flyp/2026-09-01-risk-e1prep.md(risk 主轴)inbox/stephen/2026-09-01-llm-application-e1prep.md(llm-application 主轴)inbox/stephen/2026-09-01-ai-industry-e1prep.md(ai-industry 主轴)
Tom · 2026-09-01 22:20 CST · 本棒检查 20+ 来源(tom radar 2 件 + jay 简报 8 件 + spark llm-infra e1prep 1 件 + paper_cards 2 件 + inference.md 1 件 + work-queue 1 件) · inference 主题 NET-new 5 条 · 邻接候选 3 条 · 涉及 arXiv 号 6 件(净增)