inference · E1 预消化简报(2026-09-06)
实例:Tom · inference 主题 E1 日间预消化轮 · cron e627b203-77c1-4f5a-a634-26925ef1b683
生成时间:2026-09-06 22:20 CST(Asia/Shanghai)
窗口期:2026-09-05 22:20 → 2026-09-06 22:20(约 24h)
基线活文档:organized/knowledge/inference.md(2026-09-06 更新标注:SSR/SpecPV/Cascade/OpScale/RTP-LLM;MDPI benchmark;TGI落幕;CVE-3059/60;三向基准;OOM Runbook;引→约465条 arXiv)
状态
- 增量条数:0 条主增量(0 条 NET-new paper_card 入库 + 0 条邻接入库 inference NET-new arXiv 锚入;4 条预备级邻接候选)
- 本棒性质:"极稀疏 · 无 inference 主轴 NET-new 窗口 · §IX 92 morning v3.21 升档棒 + spark 9-6 晚场 llm-infra e1prep 接力候选均为 llm-infra 主轴,本棒无 inference 主轴纯增量"型极稀疏棒 — 9-5 晚场 e1prep 已锚入 Locked at the Entrance paper_card 1235 + MDPI benchmark + TGI 生态;§IX 92 morning v3.21(16:45 CST)已将 9-6 早盘全部高价值 llm-infra/inference 增量闭合;spark 9-6 18:40 llm-infra e1prep 候选(FreeToken / CacheBridge / HeadWiseKV / VestigeKV / NeuroPrefetcher / Almost Free State / vLLM RDT)均为 llm-infra 主分类,inference 主题零纯增量
- 涉及 arXiv 号:净增 0 件(FreeToken arXiv:2608.16157 已在 §6.99.2 预备级;本棒只标注预备级候选,不计净增)
一、本棒检查过的来源清单
1.1 work-queue.md(2026-09-06 22:00 自动生成)
- 待建卡 0 · 待更新活文档 0(全部最新,含 §IX 92 morning v3.21 16:45 CST 升档闭合)· 选题榜 1 件(2609.04201 Scal3R,llm-infra 工程邻接)
- inference 主轴未触发"高价值待深度解读"或"攻略待写"信号
1.2 inbox/tom 今日 radar(09-06 08:40 / 14:40 / 20:40)
- 08:40:inference 主轴 0 件(8 条候选:DRACO(agent)、RoboTok(rag/multimodal)、Select/Compress/Reinvest(multimodal)、Terminal-Universe(agent/systems)、Last Translation Benchmark(evaluation)、VeriPhy(agent)、QCell(multimodal)、Speech BCIs(systems))
- 14:40:inference 主轴 0 件(8 条候选同 08:40,排列顺序略有变化)
- 20:40:inference 主轴 0 件(8 条候选同前两棒;RLVR 解空间收缩分析 paper_card 1235 在列,但已在 9-5 e1prep 入库并标注)
1.3 inbox/spark 9-6 llm-infra e1prep(2026-09-06 18:40 · §IX 92 evening 棒位候选)
- 0 件 llm-infra 主轴 NET-new arXiv 锚入 + 0 件 llm-infra 主分类 paper_card NET-new 入库
- 9 条主增量均为 llm-infra 预备级候选(FreeToken Edge MoE / CacheBridge / HeadWiseKV / VestigeKV / NeuroPrefetcher / Almost Free State / vLLM RDT / vLLM Inside 深度长文 / NVIDIA 收购 HF 矛盾验证),inference 主轴 0 件
- 关键发现:FreeToken(arXiv:2608.16157,paper_card 987)被 spark 标注为"§1.(1) Edge MoE 升档预备候选",是本棒最具 inference 相关性的条目——但主分类仍为 llm-infra,非纯 inference
1.4 inbox/jay 9-6 全天简报(高密度源 · llm-infra 主轴邻接)
2026-09-06-1105-jay-five-category-briefing.md(11:05)— CacheBridge(arXiv:2609.00891,跨模型 KV cache transfer)/ HeadWiseKV(arXiv:2609.02029,per-head cache budgeting)/ VestigeKV(arXiv:2609.03949,NoPE-MLA eviction)/ NeuroPrefetcher(arXiv:2608.22643,NVMe 感知稀疏推理)/ Almost Free State Prediction(arXiv:2609.03807,双 stream)/ Yandex KV Cache as Agent Runtime(KV cache = agent 运行时新范式)——均为 llm-infra 主分类,inference 邻接2026-09-06-1505-jay-afternoon-supplement.md(15:05)— vLLM RDT 7.53 秒 RL weight sync + vLLM Inside "Anatomy of a High-Throughput LLM Inference System" 41 分钟深度长文2026-09-06-1735-jay-evening-report.md(17:35)— NVIDIA $12.93B 收购 HF 多源强验证 + FreeToken Edge-Native MoE + Inference Cost Attacks for RAG(arXiv:2606.02643,WWW 2026)复证
1.5 inbox/flyp 9-6 全天棒位(inference 主轴邻接)
2026-09-06-multimodal-e1prep.md(09:45)— NeoMME / RoboTok 票数三跃升(22→40→79)——多模态主分类2026-09-06-1550-Compile-by-Training-24h-renewal-critical-read.md(15:50)— Compile by Training 310▲ +54 票(24h),工程主分类,inference 邻接2026-09-06-silent-failures-multimodal-agentic-search-review.md(09:51)— multimodal agent 检索静默失败,inference 邻接
1.6 inbox/stephen 9-6 noon 协调棒(12:45)
- NVIDIA $12.93B 收购 HF 多源验证——5 源独立证据已闭环;Stephen frontier lab 框架性误导矛盾 #1 仍待核
1.7 paper_cards 库近 3 日新卡(2026-09-04 → 2026-09-06 · inference 主分类)
- 9-6 批次:paper_card 1064/1128/1117/1114/1096/1088/1074/505(08:00-14:10 批量更新,8 张卡)
- 1064-2608-20574 — FlavourBench(evaluation 主分类)
- 1128-2001-08361 — Scaling Laws(经典论文)
- 1117-2608-26070 — Prefix Sliding(systems 主分类,inference 邻接)
- 1114-2608-25204 — LibriBrain100(multimodal 主分类)
- 1096-2608-24569 — Constraint Weakening(agent 主分类)
- 1088-2608-24053 — WeMM-Embedding(multimodal 主分类)
- 1074-2608-19567 — Block3D(multimodal 主分类)
- 505-1505-00468 — VQA 经典
- inference 主分类新卡:0 件
- llm-infra 主分类邻接入库:0 件(本批次无)
1.8 organized/knowledge/inference.md
- 2026-09-06 更新标注:SSR/SpecPV/Cascade/OpScale/RTP-LLM;MDPI benchmark;TGI落幕;CVE-3059/60;三向基准;OOM Runbook;引→约465条 arXiv
- Locked at the Entrance(arXiv:2608.29188,paper_card 1235) — 9-5 e1prep 已入库,9-6 inference.md §1.(11)+§1.(12)(v)+§1.(8) 锚入确认(已出现在 inference.md 第147行)
- CORD(arXiv:2609.01072,paper_card 1224) — 9-4 e1prep 已锚入 §1.(12)(v)
- SSR/RetroInfer/RTP-LLM/Cascade/OpScale/CRISP/TokenWeave/Stream2LLM/FlexLLM/FlashAttention-4/ReplaySSM/SwiftCache/Albireo — 9-3/9-4/9-5 e1prep 已标注为 NET-new 待锚入;本棒确认 inference.md 内仍未正式锚入(仅 SSR 在 9-6 inference.md 更新标注中被提及,但正文锚入待核)
二、最重要的 4 条预备级邻接候选(无 inference 主轴 NET-new)
预备候选 1【§1.(1) 推理引擎 · Edge MoE · 2026-09-06】🟡 FreeToken:Edge-Native MoE Serving 系统(arXiv:2608.16157 · paper_card 987 · llm-infra 主分类)
- 来源:
inbox/spark/2026-09-06-llm-infra-e1prep.md§二增量 1 + jay 9-6 1735 evening report - 来源链接:
https://arxiv.org/abs/2608.16157 - 作者/机构:UC Berkeley
- 可信度:高(UC Berkeley 系统论文;HF Trending Papers;Semantic Scholar 2 引用;paper_card 987 已入库 2026-08-30)
- 入库时间:paper_card 987,2026-08-30 入库
要点: - 核心创新:FreeToken 是边缘原生 MoE(Mixture-of-Experts)serving 系统,将个人机器视为"统一、弹性的推理平台"而非"小型 GPU" - 解决的核心矛盾:模型参数量大 vs 设备硬件异构 - 核心技术:带宽自适应执行(bandwidth-adaptive execution),动态将计算和模型状态映射到异构本地硬件 - 与 llm-infra.md 现有脉络的关系(spark 9-6 llm-infra e1prep 标注):v3.21 §6.99.2 全量 arXiv ID 列表中已包含 arXiv:2608.16157(预备级);v3.21 §6.99.5 URL 列表中已包含(预备级);但 §0.5 SOTA 综述 + §1 关键工作脉络均未锚入 - 与 inference.md 现有脉络的关系:§1.(1) 推理引擎已有 Ollama/llama.cpp/AMD Strix Halo/WebGPU 等 Edge 维度锚入;但未覆盖 MoE 边缘推理系统这一关键架构路径。§1.(1) MoE 维度已有 DeepSeek-V3.2-Exp/SGLang Hybrid SSM 等云端 MoE;边缘 MoE serving 维度为空白 - 建议归入节:§1.(1) 推理引擎 → 新增子节点「Edge MoE Serving:FreeToken 类系统」优先级 P1 - 状态:llm-infra 主分类;inference 邻接预备级候选(非 NET-new inference paper)
预备候选 2【§1.(8) 训练 / §1.(2) 推理调度 · RL sync · 2026-09-06】🟡 vLLM RDT:Kimi K2 48 节点 7.53 秒全量权重同步(vLLM Blog 2026-08-22 · 工业级 RL sync 突破)
- 来源:
inbox/spark/2026-09-06-llm-infra-e1prep.md§二增量 6 + jay 9-6 1505 afternoon supplement - 来源链接:
https://vllm.ai/blog/2026-08-22-rdt-weight-transfer - 可信度:高(vLLM 官方工程博客;SkyRL 开源)
要点: - 核心数据:Kimi K2 BF16,48 节点 × 8×H100(32 节点 trainer + 16 节点 inference),使用 Ray Direct Transport(RDT)实现 GPU-GPU 直传,7.53 秒完成全量权重同步 - RDT 原理:Ray actor method 返回 GPU tensor 而不经过 CPU 拷贝;支持 NCCL/GLOO/NIXL pluggable backend - 工程意义:Online RL(verl / SkyRL / Slime / NeMoRL)场景的核心突破——RL 训练循环的 weight sync 不再是瓶颈
与 inference.md 现有脉络的关系: - §1.(8) 训练已有 Compile by Training / Locked at the Entrance RLVR 解空间动力学 / Albireo / Silent Hyperparameter;未涵盖 vLLM RDT 这一分布式 RL sync 维度 - §1.(2) 推理调度已有 NIXL / AMPD / EAGLE-3 / LMCache PD / Dynamo;未涵盖 vLLM RDT - 建议归入节:§1.(8) 训练 → 新增子节点「vLLM RDT:工业级 RL weight sync」,优先级 P2 - 状态:工业级突破;inference 工程邻接;无独立 arXiv 号
预备候选 3【§1.(1) 推理引擎 · 2026-09-06】🟡 vLLM 官方 41 分钟深度技术长文:"Inside vLLM: Anatomy of a High-Throughput LLM Inference System"(vLLM 官方 Blog 2026-08/09)
- 来源:
inbox/spark/2026-09-06-llm-infra-e1prep.md§二增量 7 + jay 9-6 1505 afternoon supplement - 来源链接:
https://blog.vllm.ai/blog - 可信度:极高(vLLM 官方工程团队撰写)
要点: - 覆盖内容:PagedAttention 原理(block-level 内存管理,减少 fragmentation)+ Continuous Batching(iteration-level 调度)+ Prefix Caching(共同前缀复用的工程实现)+ Speculative Decoding(EAGLE / Medusa / n-gram 各路径对比)+ Multi-GPU Serving(TP + PP)+ Scheduling(请求队列 + 优先级 + 抢占策略)+ Benchmarking 方法论 - 目前最完整的 vLLM 内部原理中文可读材料
与 inference.md 现有脉络的关系: - §1.(1) 推理引擎已涵盖 PagedAttention / Continuous Batching / Prefix Caching / Speculative Decoding / Multi-GPU Serving / Scheduling / Benchmarking 全部组件;本文是官方权威来源,可作为预备级引用锚入 - 建议归入节:§1.(1) 推理引擎 → 预备级引用(无需新锚入,作为已有组件的权威佐证) - 状态:预备级引用候选;无独立 arXiv 号
预备候选 4【§1.(1) 推理引擎 · 2026-09-06】🟡 SGLang CVE-2026-3059/3060:Pickle RCE 漏洞,CVSS 9.3(已在 inference.md 锚入,本棒确认并强化标注)
- 来源:spark 9-6 llm-infra e1prep 引述 + inference.md §1.1(已锚入)
- 可信度:极高(SGLang 官方安全公告;CVSS 9.3)
要点: - SGLang Pickle RCE 漏洞,CVSS 9.3 - 影响 SGLang 特定版本 - 生产紧急行动:立即核查运行版本,评估网络暴露面,按 SGLang 官方安全公告执行补丁
与 inference.md 现有脉络的关系: - 已在 inference.md §1.1 框架格局节中锚入(2026-09-06 更新已含) - 本棒作为强化标注:推理引擎安全是生产部署不可忽视的维度 - 状态:已在 inference.md 锚入;本棒只作确认标注
三、值得警惕的矛盾或待核实说法
-
§1.(1) Edge MoE 预备候选 FreeToken 与 llm-infra vs inference 分类争议: - spark 9-6 llm-infra e1prep 将 FreeToken 标注为 §1.(1) Edge MoE 升档预备候选 - 但 FreeToken(arXiv:2608.16157,paper_card 987)主分类为 llm-infra,非 inference - FreeToken 属于 inference serving 基础设施(Edge MoE serving 系统),与 inference.md §1.(1) 推理引擎的 Edge 维度邻接 - 建议:inference.md §1.(1) 可引用 FreeToken 作为"Edge MoE Serving"维度的邻接参考,但归类为 llm-infra 而非纯 inference
-
NVIDIA $12.93B 收购 HF 工程影响仍待评估: - Jensen Huang 官方博客(2026-09-03)+ FT + Reuters + Wired 多方独立验证,真实性已基本闭环 - Stephen frontier lab 框架性误导矛盾 #1 仍待核(截止 9-15 前) - 对 vLLM/SGLang 等推理引擎 NVIDIA 优化路线的影响2027 年前无实质变化,长期需持续跟踪
-
CORD / SSR / RetroInfer / RTP-LLM / Cascade / OpScale / CRISP / TokenWeave / Stream2LLM / FlexLLM / FlashAttention-4 / ReplaySSM / SwiftCache / Albireo 共 14 件 NET-new 仍未锚入 inference.md: - 这些条目在 9-3/9-4/9-5 e1prep 中已标注为 NET-new 待锚入 - inference.md 2026-09-06 更新标注中提及 SSR/SpecPV/Cascade/OpScale/RTP-LLM,但正文锚入状态未完全确认 - 建议:后续 inference 主题深化轮(E2/S2)优先消化这 14 件待锚入条目
四、可引用的 arXiv 号列表(0 件净增 · 本棒预备级候选 3 件)
预备级候选(已在库但未锚入 inference.md §1 主轴)
- arXiv:2608.16157 — FreeToken: Edge-Native MoE Serving(UC Berkeley · paper_card 987 · llm-infra 主分类 · Edge MoE Serving · 预备级候选)
- arXiv:2606.02643 — Inference Cost Attacks for RAG(WWW 2026 · 已在 §6.99.2 预备级;inference 邻接 · 建议锚入 §1.(9) 安全)
- arXiv:2609.00891 — CacheBridge: Cross-Model KV Cache Transfer(llm-infra 主分类 · KV cache 精细化 · 预备级候选)
沿用件(已在 inference.md 或预备级)
- arXiv:2608.29188 — Locked at the Entrance(9-5 已入库 · inference.md §1.(11)+§1.(12)(v)+§1.(8) 锚入确认)
- arXiv:2609.01072 — CORD(9-4 已锚入 §1.(12)(v))
- arXiv:2608.20359 — SSR(9-3 NET-new · 待锚入)
- arXiv:2505.02922 — RetroInfer(9-3 NET-new · 待锚入)
- arXiv:2605.29639 — RTP-LLM(9-3 NET-new · 待锚入)
- arXiv:2608.06557 — Cascade(9-3 NET-new · 待锚入)
- arXiv:2608.13499 — OpScale(9-3 NET-new · 待锚入)
- arXiv:2609.01925 — CRISP(9-3 NET-new · paper_card 1197 已入库 · 待锚入)
- arXiv:2505.11329 — TokenWeave(9-2 NET-new · 待锚入)
- Stream2LLM — MLSys 2026(9-2 NET-new · 待锚入)
- FlexLLM — NSDI 2026(9-2 NET-new · 待锚入)
- FlashAttention-4 — MLSys 2026 Best HM(已锚入)
- ReplaySSM / Silent Hyperparameter / SwiftCache / Albireo(9-1 NET-new · 待锚入)
五、本棒小结
inference 主题 9-5 22:20 → 9-6 22:20 净增量 = 0 条主增量 + 4 条预备级邻接候选
| # | 条目 | 分类 | 价值 | 状态 |
|---|---|---|---|---|
| 1 | FreeToken Edge-Native MoE Serving(arXiv:2608.16157 · llm-infra 主分类) | §1.(1) Edge MoE 预备候选 | ⭐⭐⭐ | llm-infra 主分类;inference 邻接 |
| 2 | vLLM RDT 7.53s RL weight sync(vLLM Blog) | §1.(8) 训练 / §1.(2) 调度 | ⭐⭐⭐ | 工业级突破;无独立 arXiv |
| 3 | vLLM Inside 41分钟深度长文(vLLM Blog) | §1.(1) 推理引擎预备引用 | ⭐⭐⭐ | 预备级引用;已有组件权威来源 |
| 4 | SGLang CVE-2026-3059/3060(CVSS 9.3) | §1.(1) 安全标注 | ⭐⭐⭐⭐ | 已在 inference.md §1.1 锚入 |
与 9-5 evening inference e1prep(1 条主增量 Locked at the Entrance)对照: - 9-5 增量密度:低(Locked at the Entrance paper_card 1235 入库 + 2 条工程层候选预备) - 9-6 增量密度:极低(0 条 inference 主轴 NET-new;§IX 92 morning v3.21 17:45 CST 已将 9-6 早盘 llm-infra/inference 全部增量闭合;spark 9-6 晚场 llm-infra e1prep 候选均为 llm-infra 主轴) - 本棒特征:无 inference 主轴纯增量;预备级邻接候选 4 条(均为 llm-infra 分类);CVE 安全已在 doc 锚入
六、检查过的来源汇总
已检查 / 已纳入本棒
- ✅
organized/knowledge/inference.md(2026-09-06 更新标注 · ~465条 arXiv 基线 · Locked at the Entrance 锚入确认) - ✅
work-queue.md(2026-09-06 22:00) - ✅
inbox/tom/2026-09-06T0840-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/tom/2026-09-06T1440-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/tom/2026-09-06T2040-agent-rag-longcontext-radar.md(inference 0 件) - ✅
inbox/spark/2026-09-06-llm-infra-e1prep.md(0 件 llm-infra NET-new · 9 条 llm-infra 预备级候选) - ✅
inbox/jay/2026-09-06-1105-jay-five-category-briefing.md(KV cache 候选邻接) - ✅
inbox/jay/2026-09-06-1505-jay-afternoon-supplement.md(vLLM RDT + Inside 长文) - ✅
inbox/jay/2026-09-06-1735-jay-evening-report.md(FreeToken + NVIDIA 收购 HF) - ✅
inbox/flyp/2026-09-06-multimodal-e1prep.md(multimodal 主分类) - ✅
inbox/flyp/2026-09-06-1550-Compile-by-Training-24h-renewal-critical-read.md(Compile by Training 310▲) - ✅
inbox/flyp/2026-09-06-silent-failures-multimodal-agentic-search-review.md(静默失败) - ✅
inbox/stephen/2026-09-06-1245-coord-check-noon.md(NVIDIA 收购 HF 多源验证) - ✅
inbox/tom/2026-09-05-inference-e1prep.md(9-5 参照基线) - ✅
inbox/tom/2026-09-04-inference-e1prep.md(9-4 参照基线)
已检查 / 未纳入(无 inference 净新增)
inbox/tom/2026-09-06-0900-hf-daily-2026-09-06.md(HF Daily · Compile by Training 310▲ · 无 inference 主轴)inbox/tom/2026-09-06-evaluation-e1prep.md(evaluation 主轴)inbox/tom/2026-09-06-rag-e1prep.md(rag 主轴)inbox/spark/2026-09-06-agent-e1prep.md(agent 主轴)inbox/spark/2026-09-06-1002-rss-gradient-flow.md+2026-09-06-1003-rss-chip-huyen.md+2026-09-06-1006-rss-yt-3blue1brown.md(RSS · 无 inference 净新增)inbox/flyp/2026-09-06-1001-rss-cameron-wolfe.md+2026-09-06-1003-rss-interconnects.md+2026-09-06-1006-rss-yt-ai-explained.md+2026-09-06-1006-rss-yt-two-minute-papers.md(RSS · 无 inference 净新增)- paper_cards 9-6 批次(1064/1128/1117/1114/1096/1088/1074/505)— 均为 llm-infra/evaluation/multimodal 主分类,无 inference 主分类新卡
七、优先待锚入的 14 件 NET-new 条目(历史 backlog,本棒确认仍待锚入)
以下条目已在 9-3/9-4/9-5 e1prep 中标注为 NET-new 待锚入 inference.md,本棒确认 inference.md 正文仍缺失,建议后续 E2/S2 深化轮优先处理:
| # | 条目 | arXiv | 首次标注日期 | 建议锚入节 |
|---|---|---|---|---|
| 1 | SSR(Self-Speculation) | 2608.20359 | 9-3 | §1.(5) 投机解码 |
| 2 | RetroInfer | 2505.02922 | 9-3 | §1.(3) KV Cache |
| 3 | RTP-LLM | 2605.29639 | 9-3 | §1.(1) 推理引擎 |
| 4 | Cascade | 2608.06557 | 9-3 | §1.(2) 推理调度 |
| 5 | OpScale | 2608.13499 | 9-3 | §1.(2) 推理调度 |
| 6 | CRISP | 2609.01925 | 9-3 | §1.(1) 推理引擎 |
| 7 | TokenWeave | 2505.11329 | 9-2 | §1.2 Kernel |
| 8 | Stream2LLM | —(MLSys 2026) | 9-2 | §1.(3) KV Cache |
| 9 | FlexLLM | —(NSDI 2026) | 9-2 | §1.(1) 推理引擎 |
| 10 | FlashAttention-4 | —(MLSys 2026) | 9-1 | §1.2 Kernel |
| 11 | ReplaySSM | — | 9-1 | §1.(3) KV Cache |
| 12 | Silent Hyperparameter | 2605.19537 | 9-1 | §4.1 推理经济学 |
| 13 | SwiftCache | 2606.16135 | 9-1 | §1.(3) KV Cache |
| 14 | Albireo | 2606.01927 | 9-1 | §1.2 Kernel |
Tom · 2026-09-06 22:20 CST · 本棒检查 15+ 来源(tom radar 3 件 + spark llm-infra e1prep 1 件 + jay 3 份简报 + flyp 4 份棒位 + stephen coord-check 1 件 + paper_cards 8 件 + inference.md 1 件 + work-queue 1 件)· inference 主题 NET-new 0 条(0 条 paper_card 入库 + 0 条邻接入库)+ 4 条预备级邻接候选(均为 llm-infra 主分类)· 涉及 arXiv 号 0 件净增 · 确认 14 件历史 backlog NET-new 仍待锚入 inference.md · §IX 92 morning v3.21 17:45 CST 已覆盖 9-6 全部 inference 主轴增量