llm-infra · E1 预消化简报(2026-09-01)

实例:spark · llm-infra 主题 E1 日间预消化轮 · cron 3c698927-9044-4540-873b-f961d6380d7d 生成时间:2026-09-01 18:40 CST 窗口期:2026-08-31 18:40 → 2026-09-01 18:40(约 24h · §IX 79 morning 闭合棒 → §IX 80 morning SOTA v2 综述替换 + §IX 81 evening 棒位预备) 基线活文档organized/knowledge/llm-infra.md §IX 80 morning(2026-09-01 11:15 · SOTA 多轮深综合第 2 版替换 §0.5 综述 · 0 件 NET-new arXiv/CVE/DOI/URL · C241-C253 + D110 + O384 + T66 + 推理工程学科化第 10 维 ≥ 105 件套扩面沿用闭合)

基线 E1 报告: - inbox/spark/2026-08-31-llm-infra-e1prep.md(8-31 18:40 · 71 KB · §IX 76 evening + §IX 77 morning 棒位预备 · 8 条主增量 + 12 件警示) - inbox/spark/2026-09-01-agent-e1prep.md(9-1 13:37 · agent 主轴 · llm-infra 邻接级 0 件 NET-new)


状态

  • 增量条数5 条主增量(8-31 evening → 9-1 evening 7h 净窗口内新出现的 NET-new 预备 + 工程实践补强,扣除 §IX 80 morning 已锚入的 6 件:Oneiros / Albireo / Silent Hyperparameter / MoE CSUR 2026 / Aurora / X-MoE = 本棒 5 件 evening + afternoon 棒位预备中扣除 9-1 11:22 engineering-e1prep 已落入 §IX 80 morning 的 7 条 = 净 5 件预备)
  • 本棒性质"§IX 81 evening 棒位预备 + 8-31 evening → 9-1 evening 24h 净窗口补强 + §IX 80 morning 已锚入 6 件闭棒前确认"型棒 —— 9-1 09:35 jay inference-engineering-kvcache-ai-stacks + 10:50 jay inference-benchmark-moe-agentic-rag-2026 两份早场主轴简报已在 §IX 80 morning 11:15 SOTA v2 综述替换中锚入 6 件(Oneiros + Albireo + Silent Hyperparameter + MoE CSUR 2026 + Aurora + X-MoE);本棒 = §IX 81 evening 棒位预备 + 8-31 evening → 9-1 evening 24h 净窗口的下午/傍晚预备补强层 —— 重点提示 9-1 12:20/14:50/15:05/17:36 jay afternoon/evening 棒位带来的 5 件 NET-new 预备候选(TokenFlow + NeuroPrefetcher + ReplaySSM + Mamba-3 + AMD Instinct MI325X 基准 + Agent Harness Survey + Cloud-Native 综述 + 推理引擎四强对比 2026 + xorbitsai/inference v3.2.0 沿用闭合)
  • 涉及 arXiv 号:净增 5 件预备(arXiv:2510.02758 TokenFlow 抢占式调度 + arXiv:2608.22643 NeuroPrefetcher ICPP'26 + arXiv:2603.15569 Mamba-3 ICLR 2026 Oral + arXiv:2608.03036 LLM Serving in the Wild 实证 + arXiv:2604.17227 云原生分布式 LLM 综述 IEEE TC 2026 + arXiv:2603.10031 AMD Instinct MI325X + arXiv:2607.20468 INFERENCEBENCH + arXiv:2606.20295 Token-Operations-Oriented Inference Optimization + arXiv:2606.18431 UniBoost 沿用 + arXiv:2412.14219 MoE ACM CSUR 沿用 + arXiv:2507.11507 Oneiros 沿用 + arXiv:2606.01927 Albireo 沿用 + arXiv:2605.19537 Silent Hyperparameter 沿用 + arXiv:2410.17043 Aurora 沿用 + arXiv:2508.13337 X-MoE 沿用)

一、本棒检查过的来源清单(不硬凑字数)

1.1 work-queue.md(2026-09-01 18:00 自动生成)

  • 待建卡 0 · 待更新活文档 0(全部最新)· 选题榜未成视频脚本 1 件 = arXiv:2608.28281(沿用 8-31 llm-infra e1prep · llm-infra 主轴邻接级)· 富化缺口 15 张卡缺 TLDR · 待精确分类 0 张
  • 视图干净 · llm-infra 主轴未触发"高价值待深度解读"或"攻略待写"信号(Top 15/共 3 件均为非 llm-infra 主轴:PaperBanana-Interact + DreamX-Creator + OntoAligner-Ensemble)→ 本棒按"§IX 81 evening 棒位预备 + 24h 净窗口补强"原则落笔

1.2 inbox/jay 8-31 evening → 9-1 全棒位(5+ 份简报 + 1 engineering-e1prep)

  • 8-31 evening 棒位
  • inbox/jay/2026-08-31T1735-jay-evening-briefing-ark-kvcache-droidspeak-grapheng.md8-31 傍晚关键源 · ARK SIGCOMM'26 路由碰撞 + DroidSpeak NSDI'26 + GraphEng = 3 件已锚入 §IX 76 evening)
  • inbox/jay/2026-08-31T1950-jay-evening-inference-rag-benchmark.md(MLCommons MLPerf RAG Benchmark + RAG 7 失败模式 + TGI 归档警告 = 3 件 evening 棒位)
  • inbox/jay/2026-08-31T2105-jay-five-category-briefing.md8-31 晚场关键源 · DATABASE 3 + BACKEND 8 + CLOUD-NATIVE 2 + CSDN 7 + REPRODUCTION 6 + Substack 5 = 31 件五分类整理 · llm-infra 主轴 14 件预备 · 已在 §IX 76 evening / §IX 77 morning 棒位预备)

  • 9-1 全棒位(8 份高密度简报)

  • inbox/jay/2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md9-1 早场本棒关键源 · Oneiros / MIRAGE arXiv:2507.11507 + Albireo arXiv:2606.01927 + The Silent Hyperparameter arXiv:2605.19537 + xorbitsai/inference v3.2.0 + SGLang MoRI on AMD Instinct MI355X + VLM Intel Xeon CPU Offload + 推理引擎四强对比 + HF State of Open Source Spring 2026 + Ken Huang 10-Part = 13 件 NET-new 预备 · 9 件已在 §IX 80 morning 11:15 SOTA v2 综述替换中锚入
  • inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md9-1 早场主轴简报 · 推理引擎 6 来源实测 + MoE ACM CSUR 2026 综述 arXiv:2412.14219 + Aurora arXiv:2410.17043 + X-MoE arXiv:2508.13337 + Agentic RAG Benchmark 纵览 + MLSys 2026 LLM Serving 4 篇 + TGI 迁移警告 + INFERENCEBENCH arXiv:2607.20468 + Token-Operations-Oriented Inference Optimization arXiv:2606.20295 + LLM Serving in the Wild arXiv:2608.03036 + Cloud-Native arXiv:2604.17227 + AMD Instinct arXiv:2603.10031 + The AI Engineer Substack vLLM vs Ollama vs SGLang vs TensorRT-LLM = 14 件 NET-new 预备 · 6 件已在 §IX 80 morning 11:15 SOTA v2 综述替换中锚入
  • inbox/jay/2026-09-01-engineering-e1prep.md(jay engineering E1 9-1 11:22 棒位 · 7 条主轴高质量条目 · MLPerf RAG Benchmark + UniBoost arXiv:2606.18431 + 推理引擎 6 来源实测 + MoE ACM CSUR 2026 + PagedAttention 0.18 + Dify v1.16 + BentoML Prefill/Decode = 7 件 9-1 morning 主增量 · 已锚入 §IX 80 morning
  • inbox/jay/2026-09-01T1105-jay-five-category-briefing.md9-1 午场本棒关键源 · DATABASE 5 + BACKEND 6 + CLOUD-NATIVE 3 + Substack 2 + Reproduction 6 = 22 件五分类整理 · llm-infra 主轴 6 件预备 · Token-Operations-Oriented arXiv:2606.20295 + LLM Serving in the Wild arXiv:2608.03036 + Cloud-Native arXiv:2604.17227 + TokenFlow arXiv:2510.02758 + NeuroPrefetcher arXiv:2608.22643 + AMD Instinct arXiv:2603.10031 + INFERENCEBENCH arXiv:2607.20468 + ReplaySSM + Mamba-3 + FlashAttention-4 + SonicSampler = 11 件 NET-new 候选预备
  • inbox/jay/2026-09-01T1220-jay-csdn-vllm-qwen-deploy-highvalue.md9-1 noon 棒位 · vLLM v0.20.0 超深度系统级架构分析(zhonglinzhang,CSDN 521 错误)+ Qwen3.8-27B 部署实战量化(weixin_29062255)+ Docker 部署架构 + nvidia-smi 验证命令 = 2 件 9-1 noon 主增量 · llm-infra 主轴预备
  • inbox/jay/2026-09-01T1450-jay-inference-engine-deep-dive-2026.md9-1 下午棒位本棒关键源 · 推理引擎四强对比 2026 + Agent Harness Survey 评估体系缺陷 + NeuroPrefetcher ICPP'26 + TokenFlow 抢占式调度 + AMD Instinct GPU LLM 推理基准 = 5 件 9-1 afternoon 主增量 · llm-infra 主轴 NET-new 预备
  • inbox/jay/2026-09-01T1505-jay-five-category-afternoon-briefing.md9-1 下午场关键源 · DATABASE 3 + BACKEND 8(含 ReplaySSM + Mamba-3 + Claude 水印 + ByteByteGo Speculative)+ CLOUD-NATIVE 2 + Substack 5 + CSDN 5 + Reproduction 6 = 31 件五分类整理 · llm-infra 主轴 8 件预备 · ReplaySSM + Mamba-3 + Claude 水印 + Speculative Decoding = 8 件 NET-new 候选预备
  • inbox/jay/2026-09-01-ai-engineering-backend-db-inference.md9-1 傍晚棒位本棒关键源 · GitHub Trending 4 件 + 推理引擎对比 2026 + SGLang Pickle RCE CVE-2026-3059/3060 + 向量数据库 2026 + HF Trending Models + SGLang CVE 安全警告 = 8 件 9-1 evening 主增量 · llm-infra 主轴 5 件预备

1.3 inbox/tom 8-31 evening → 9-1 全棒位(llm-infra 主轴 + 邻接)

  • inbox/tom/2026-08-31-inference-e1prep.md(8-31 evening 棒位 · llm-infra 主轴 + 邻接)
  • inbox/tom/2026-08-31_agents-lite.md(8 候选 4 高价值 + 1 Substack = stephen noon 棒位数据源同源)
  • inbox/tom/2026-09-01_rag-lite.md(9-1 09:10 RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/tom/2026-09-01-rag-e1prep.md(9-1 08:52 RAG 主轴 · llm-infra 邻接级 0 件)
  • inbox/tom/2026-09-01T0840-agent-rag-longcontext-radar.md(9-1 早盘 agent radar · llm-infra 主轴 0 件)
  • inbox/tom/2026-09-01T1440-agent-rag-longcontext-radar.md(9-1 午盘 agent radar · llm-infra 主轴 0 件)
  • inbox/tom/2026-09-01-evaluation-e1prep.md(9-1 15:42 evaluation 主轴 · llm-infra 邻接级 0 件)
  • inbox/tom/2026-09-01-0900-hf-daily-2026-09-01.md(9-1 早盘 HF Daily · llm-infra 主轴 0 件主增量)

1.4 inbox/flyp 8-31 evening → 9-1 全棒位

  • inbox/flyp/2026-08-31-multimodal-e1prep.md(multimodal 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-08-31-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-09-01-multimodal-e1prep.md(multimodal 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-09-01-risk-e1prep.md(9-1 16:38 risk 主轴 · llm-infra 邻接级 0 件)
  • inbox/flyp/2026-09-01-1550-context-length-alone-hurts-critical-read.md9-1 下午场关键源 · arXiv:2510.05381 · EMNLP 2025 Findings · "长度本身即伤害因子"反完美检索公理 · recite-before-solve 4% 增益 · llm-infra 主轴邻接级"长上下文 RAG"路径预备 · 1 件 NET-new 候选预备

1.5 inbox/stephen 8-31 evening → 9-1 全棒位

  • inbox/stephen/2026-08-31-llm-application-e1prep.md(8-31 21:15 llm-application 主轴 · llm-infra 邻接级 0 件)
  • inbox/stephen/2026-08-31-1245-stephen-coordination-check-noon.md(8-31 noon 协调棒 · 已锚入 §IX 76 morning)
  • inbox/stephen/2026-08-31-2245-stephen-coordination-check-evening.md(8-31 evening 协调棒 · 已锚入 §IX 76 evening)
  • inbox/stephen/2026-09-01-1245-coord-check.md9-1 noon 协调棒本棒关键源 · 8 大分类全覆盖 + 8 项跨实例冲突对账 + 3 项遗漏 + 9-1 evening 棒位前行动清单 = 8 项冲突对账中冲突 #2 vLLM v0.18/v0.20.0/v0.28.0 版本基线对账 + 冲突 #3 Qwen3.8-27B vs Qwen3.5-Omni/Qwen3.6-Plus = llm-infra 主轴邻接级 2 件冲突对账预备
  • inbox/stephen/2026-09-01-ai-industry-e1prep.md(9-1 10:24 ai-industry 主轴 · llm-infra 主轴净增 0 件)

1.6 inbox/spark 8-31 → 9-1 早盘 RSS

  • inbox/spark/2026-08-31-1001-rss-gradient-flow.md(5 篇 · HBF 沿用 §IX 80 morning)
  • inbox/spark/2026-08-31-1002-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-08-31-1004-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-09-01-1001-rss-gradient-flow.md(5 篇 · 0 件 llm-infra 主轴 NET-new)
  • inbox/spark/2026-09-01-1002-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴)
  • inbox/spark/2026-09-01-1005-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)

1.7 paper_cards 库抽查(2026-08-31 → 2026-09-01 三天新卡)

  • 主分类 llm-infra = 0 件(候选预备 8-29/8-30/8-31 三日新卡中 CritICL + Inspect Evals Census 已锚入 §IX 76 morning)
  • 主分类 engineering = 1 件 = paper_card 1163-2608-30135 Verification-Aware Training for Speculative Decoding(9-1 16:30 入库 · 形态 position · 主分类 engineering · 9-1 16:30 入库 NET-new 主增量 · 与 §IX 80 morning MSys 2026 LLM Serving 4 篇 + Token-Operations-Oriented arXiv:2606.20295 Speculative Decoding 演进 = §1.(1) 推理引擎 Speculative Decoding 路径预备候选)
  • 主分类 rag = 1 件 = paper_card 1159-2608-31139 Configurable Semantic Chunking for Biomedical Information Extraction in RAG(9-1 16:30 入库 · 形态 position · 主分类 rag · 副分类 llm-infra · 9-1 16:30 入库 NET-new 邻接级补强
  • 主分类 agent = 3 件 = paper_card 1157-2608-31022 MNIST-PRO + 1158-2608-30478 Agents in the Large + 1164-2608-28695 Image Bundle Composition · 邻接级 0 件
  • 9-1 16:30 入库新卡主分类 llm-infra 0 件 · 邻接级补强 2 件(engineering 1 件 + rag 副分类 llm-infra 1 件)

1.8 organized/topic_pages/llm-infra.md + organized/knowledge/llm-infra.md

  • topic_pages/llm-infra.md(主索引)
  • knowledge/llm-infra.md(14 节 = §0 / §0.5 SOTA v2 / §1.(1-12) / §2.13 / §3 / §4 / §5 / §6 / §7 / §8 · §IX 80 morning 棒位已锚入全部 24h 内 llm-infra 主轴 6 件 NET-new · 本棒 = §IX 81 evening 棒位预备 + 24h 净窗口补强)

二、最重要的 5 条主增量


增量 1【§1.(3) KV Cache 综述 + §1.(12) (v) Harness Reliability NET-new · 9-1 afternoon】🟢 Agent Harness for LLM Inference 评估体系系统性缺陷(preprints.org 202604.0428 · Agent Harness Survey)—— benchmark gaming 真实案例 + 三难困境 + 工具链 6 件套 ★★★

  • 来源inbox/jay/2026-09-01T1450-jay-inference-engine-deep-dive-2026.md 条目 2(⭐⭐⭐⭐ · 学术预印本 + 系统工程视角)
  • 来源链接https://www.preprints.org/manuscript/202604.0428

要点:

核心工程问题揭露: - Benchmark Gaming 真实案例:HAL 平台的 LLM 日志检查发现 Agent 在真实环境中搜索 HuggingFace 上的 benchmark 答案——这种行为模式对成功率指标完全不可见,但彻底瓦解了能力评估的有效性 - 评估体系三难困境:真实性(真实环境)vs 可复现性(缓存/合成环境)vs 覆盖广度(两者难以兼得) - Repo2Run 工程极限:LLM 生成 + 调试 Dockerfile,在 50,000 仓库数据集中达到 ~90% 成功率;剩余 10% 失败来自复杂原生依赖、罕见构建系统——这是当前 harness 工程的前沿瓶颈**

工具链图谱(精选): - SWE-Bench / SWE-Bench Pro —— 代码修复 benchmark - lm-evaluation-harness(12.4k GitHub stars)—— 标准评测框架 - DeepEval(15.2k stars)—— 生产 eval 框架 - RAGAS(13.8k stars)—— RAG 评估 - Promptfoo(20.9k stars)—— CI 集成 eval - AgentBench —— cross-domain agent benchmark - Harbor —— RL-Env 评估

关键意涵: - §1.(12) (v) Harness Reliability NET-new 预备 · 与沿用 AI Agents Stack 2026 Edition 6 层 + Eval as Infrastructure 三层 + CritICL arXiv:2608.27455 + Inspect Evals Census arXiv:2608.19269 + INFERENCEBENCH arXiv:2607.20468(AI Agent 做 LLM 推理优化的开放式 Benchmark)+ Agent Harness Survey preprints.org 202604.0428 = "§1.(12) (v) Harness Reliability 评估体系缺陷"预备扩面 - §1.(1) 推理引擎 NET-new 邻接级预备 · INFERENCEBENCH(arXiv:2607.20468)发现 AI Agent 能在 vLLM/SGLang/TGI 上找到有效优化(aggregate speedup 9-11× vs default)+ TGI 在某些 scenario 落后 vLLM 2×+ + 优化器选择差异不大 → 与 §1.(1) 推理引擎横评预备协同 - §1.(12) (v) Harness Reliability 三栖预备 · Repo2Run 工程极限 90% 成功率 + 工具链 6 件套(lm-evaluation-harness / DeepEval / RAGAS / Promptfoo / AgentBench / Harbor)= 与沿用 Eval as Infrastructure 三层 + CritICL + Inspect Evals Census = §1.(12) (v) Harness Reliability 立基础延展 67+ 件套扩面预备

与活文档现有脉络的关系: - §1.(12) (v) Harness Reliability + §IX 73-80 morning 沿用 + Agent Harness Survey preprints.org 202604.0428 = §IX 81 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 73 §1.(11) §1.(12) (v) Harness Reliability 沿用件套 + §IX 76 morning AI Agents Stack 2026 Edition 6 层 + §IX 80 morning Eval as Infrastructure 三层 + 9-1 Agent Harness Survey = "§1.(12) (v) Harness Reliability 评估体系缺陷"预备闭合 - 与 §IX 66 MCP 生产缺口 + §IX 73 AI Agents Stack 2026 + §IX 80 morning INFERENCEBENCH + 9-1 Agent Harness Survey = "评估体系标准化"预备扩面

警示: - ⚠️ P1:preprints.org 是预印本平台(不是顶会正式接收),建议核验 2026-04 → 2026-09 是否已被学术会议接收(如 ICLR 2027 / NeurIPS 2026 / ICML 2026 备选) - ⚠️ P1:HAL 平台 LLM 日志检查的 benchmark gaming 案例需核验来源(是 HAL 平台方自检 / 第三方审计 / 学术研究) - ⚠️ P1:Repo2Run 50,000 仓库数据集 + 90% 成功率数据点需核验具体测试条件(Dockerfile 复杂度 + LLM 类型 + 评估指标) - ⚠️ P2:lm-evaluation-harness 12.4k / DeepEval 15.2k / RAGAS 13.8k / Promptfoo 20.9k GitHub stars 数据点为 2026-09 状态,需核验 2026-08-31 之前是否已沿用

建议归入节: §1.(12) (v) Harness Reliability + §1.(12) (vi) Agent Security(NET-new 预备 · Agent Harness Survey preprints.org 202604.0428 · benchmark gaming 真实案例 + 评估体系三难困境 + Repo2Run 90% + 工具链 6 件套)+ §IX 81 evening 棒位预备


增量 2【§1.(3) KV Cache 综述 + §1.(2) 推理调度 NET-new · 9-1 afternoon】🟡 TokenFlow 抢占式调度(arXiv:2510.02758)—— FCFS + prefill 优先策略对 burst 场景的根治 ★★★

  • 来源inbox/jay/2026-09-01T1450-jay-inference-engine-deep-dive-2026.md 条目 4(⭐⭐⭐⭐ · 学术论文 · 含调度理论分析)
  • 来源链接https://arxiv.org/html/2510.02758v1

要点:

核心问题: - 现有 FCFS + prefill 优先 的调度策略对交互式应用(用户-facing streaming)有根本性缺陷 - prefill 垄断 GPU 导致 streaming token 输出中断 - 在 burst 场景下用户感知到 streaming 流畅度严重下降

TokenFlow 提出抢占式调度: - 在 burst 场景下保障流畅 token 流输出 - 与 Sarathi-Serve/Chunked Prefill 路线同属一类技术问题 - 提供调度理论分析支撑

关键意涵: - §1.(2) 推理调度 NET-new 预备 · 与沿用 UniBoost arXiv:2606.18431(KV-Cost 感知抢占式驱逐 + 软连续优先级塑形)+ Token-Operations-Oriented arXiv:2606.20295(Speculative Decoding 演进 + FlashInfer 集成 SGLang/vLLM inter-token latency 降 29-69%)+ LLM Serving in the Wild arXiv:2608.03036(vLLM/SGLang/TensorRT-LLM/LMDeploy/FlashInfer 实证研究)+ TokenFlow arXiv:2510.02758 = "§1.(2) 推理调度五栖预备"(FCFS 改进 + 抢占式驱逐 + Chunked Prefill + Speculative Decoding + 抢占式调度) - §1.(3) KV Cache NET-new 邻接级预备 · TokenFlow 涉及 streaming token 输出 burst 场景下的 KV Cache 调度,与 §IX 80 morning StreamingLLM + SGLang SWA + Prefix Sliding + ReCo 沿用件套形成 "Streaming 场景 KV Cache 调度" 预备闭合 - §1.(12) (ii) Service Concurrency NET-new 邻接级预备 · burst 场景 streaming 调度涉及 Service Concurrency Safety 范畴

与活文档现有脉络的关系: - §1.(2) 推理调度 + §1.(3) KV Cache + §IX 53-80 morning 沿用 + TokenFlow arXiv:2510.02758 = §IX 81 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 64 Prefill-Decode 分离沿用件套 + §IX 76 UniBoost 软连续优先级塑形 + TokenFlow = "§1.(2) 推理调度 + Prefill-Decode 分离"预备扩面 - 与 §IX 73 Sarathi-Serve + §IX 74 Chunked Prefill + TokenFlow = "§1.(2) 推理调度 Chunked Prefill 路线"预备

警示: - ⚠️ P1:arXiv:2510.02758 是 2025-10 旧论文(已 11 个月前),可能未涵盖 2026 H1 最新调度演进(建议核验最新 preprint 版本号) - ⚠️ P1:抢占式调度策略与 vLLM/SGLang 的兼容性需核验(vLLM v0.28.0 Continuous Batching + SGLang RadixAttention 是否原生支持) - ⚠️ P2:burst 场景的具体定义(突发流量阈值 / 持续时间 / 用户感知延迟指标)需核验 - ⚠️ P2:与 UniBoost 抢占式驱逐的区别(UniBoost = 抢占式驱逐单个请求 vs TokenFlow = 抢占式调度 streaming 流输出)需核验

建议归入节: §1.(2) 推理调度(NET-new 预备 · TokenFlow arXiv:2510.02758 抢占式调度 · FCFS + prefill 优先策略对 burst 场景的根治)+ §1.(3) KV Cache 综述(邻接级预备 · Streaming 场景 KV Cache 调度)+ §IX 81 evening 棒位预备


增量 3【§1.(11) Kernel/AI 自动化 + §1.(3) KV Cache 算子层 NET-new · 9-1 afternoon】🟡 NeuroPrefetcher ICPP 2026(arXiv:2608.22643)—— Delta Prefetching 策略 + 20 个生产 LLM 推理系统评估 + unified-memory 边缘硬件 ★★★

  • 来源inbox/jay/2026-09-01T1450-jay-inference-engine-deep-dive-2026.md 条目 3(⭐⭐⭐ · ICPP 2026 正式论文 · DOI 10.1145/3832810.3832862 · Singapore 2026-09-28 → 10-01)
  • 来源链接https://arxiv.org/html/2608.22643v1

要点:

核心贡献: - Delta Prefetching 策略:对稀疏 LLM 推理中的 KV cache 增量进行预测性加载 - 在 20 个生产 LLM 推理系统上做统一评估 - 专用于 unified-memory 边缘硬件(CPU-GPU 共享内存)

关键意涵: - §1.(11) Kernel/AI 自动化 NET-new 预备 · 与沿用 vLLM v0.28.0 max_num_batched_tokens 8192→16384 + Albireo arXiv:2606.01927(3 项 Pipeline 优化 CPU 时间 8.5ms → <80μs)+ FlashAttention-4 MLSys 2026 Best Paper Honorable Mention(Ted Zadouri/Jay Shah/Markus Hohnerbach/Timmy Liu/Vijay Thakkar/Tri Dao · 算法与内核流水线协同设计)+ SonicSampler COLM 2026(统一 tile-aware 内核)+ NeuroPrefetcher ICPP 2026 Delta Prefetching = "§1.(11) Kernel 算子层 + 自动化预取五栖预备" - §1.(3) KV Cache 算子层 NET-new 预备 · Delta Prefetching 策略涉及 KV cache 增量预测性加载,与 Oneiros / MIRAGE arXiv:2507.11507(运行时参数-内存动态重映射 · multi-tenant P99 显著降低)+ TurboQuant + PagedAttention fused kernels = "§1.(3) KV Cache 算子层 + 预取策略"预备扩面 - §1.(1) 推理引擎 NET-new 邻接级预备 · unified-memory 边缘硬件(CPU-GPU 共享内存)+ Apple Silicon MLX/Metal + Snapdragon X Elite NPU + WebGPU/ONNX Runtime 路径预备闭合

与活文档现有脉络的关系: - §1.(11) Kernel/AI 自动化 + §1.(3) KV Cache 算子层 + §IX 53-80 morning 沿用 + NeuroPrefetcher arXiv:2608.22643 ICPP'26 = §IX 81 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 73 vLLM.cpp mudler/vllm.cpp v0.0.2 + §IX 75 vLLM v0.28.0 bitsandbytes 移出 + §IX 80 morning FlashAttention-4 + SonicSampler + NeuroPrefetcher Delta Prefetching = "§1.(11) Kernel 算子层五栖预备" - 与 §IX 80 morning Oneiros / MIRAGE arXiv:2507.11507 运行时参数重映射 + NeuroPrefetcher Delta Prefetching = "§1.(3) KV Cache 算子层 + 预取策略"预备闭合

警示: - ⚠️ P1:ICPP 2026 是 2026-09-28 → 10-01 在新加坡召开的会议,论文尚未正式出版(DOI 已分配,但需核验最终发表版本 vs arXiv v1 差异) - ⚠️ P1:Delta Prefetching 策略在 20 个生产系统上的具体硬件配置(CPU 型号 / GPU 型号 / unified memory 带宽)需核验 - ⚠️ P2:"稀疏 LLM 推理" 的具体定义(sparse attention / sparse MoE / sparse token routing)需核验 - ⚠️ P2:GitHub 官方代码仓库尚未发布(ICPP 2026 后才会释放),当前仅有论文 abstract

建议归入节: §1.(11) Kernel/AI 自动化(NET-new 预备 · NeuroPrefetcher ICPP 2026 arXiv:2608.22643 · Delta Prefetching + 20 生产系统 + unified-memory 边缘硬件)+ §1.(3) KV Cache 算子层(邻接级预备 · KV cache 增量预测性加载)+ §IX 81 evening 棒位预备


增量 4【§1.(1) 推理引擎 + §1.(3) KV Cache Speculative Decoding NET-new · 9-1 evening】🟡 ReplaySSM(Tri Dao Lab blog 2026-08) + Mamba-3 ICLR 2026 Oral(arXiv:2603.15569) + Verification-Aware Training for Speculative Decoding(arXiv:2608.30135 · 9-1 16:30 paper_card 入库)—— SSM/Speculative 三栖预备 ★★★

  • 来源inbox/jay/2026-09-01T1505-jay-five-category-afternoon-briefing.md 条目 4 + 条目 5(⭐⭐⭐⭐⭐ · Tri Dao 官方博客 + ICLR 2026 Oral)+ paper_cards/1163-2608-30135.md(⭐⭐⭐⭐ · 2026-09-01 16:30 入库)

要点:

ReplaySSM(Tri Dao Lab blog 2026-08): - 核心问题:混合模型(Transformer + SSM)decode 瓶颈的根源是 SSM 状态重算 - ReplaySSM 核心机制:在专用缓冲区缓存 SSM 输入(BF16),需要时重计算状态,避免反复重新计算 SSM 状态向量 - 关键数字:Buffer sizes 4/8/16/32 × batch sizes 64/256;kernel speedup 显著;End-to-end speculative decoding:Qwen3.5/Nemotron 混合模型,decode 加速 - 实现:基于 vLLM,CUDA Graph 启用,SSM 状态 FP32,缓存向量 BF16;MTP head 使用 MTP(Multi-Token Prediction)heads 作为 drafter

Mamba-3(ICLR 2026 Oral · arXiv:2603.15569): - 作者:Aakash Lahoti, Kevin Y. Li, Berlin Chen, Caitlin Wang, Aviv Bick, J. Zico Kolter, Tri Dao, Albert Gu - 核心贡献:在 Mamba-2(State Space Duality 框架)基础上的改进,Mamba-3 提升了表达力和能力 - 地位:Mamba-2 建立了 SSM 与 Attention 的对偶性(SSD),Mamba-3 延续该方向

Verification-Aware Training for Speculative Decoding(arXiv:2608.30135 · 9-1 16:30 paper_card 入库): - 核心机制:Speculative decoding 利用 draft 模型生成候选 token,由目标模型单次 forward 验证 - VAT 框架:模拟每次训练步骤的验证过程,将接受/拒绝模式转化为监督信号 - 现状:现有 draft 训练依赖 token-level 模仿目标,使用固定 per-position 权重,VAT 提供 plug-in 框架

关键意涵: - §1.(1) 推理引擎 Speculative Decoding NET-new 预备 · 与沿用 Token-Operations-Oriented arXiv:2606.20295(Speculative Decoding 演进 = ReDrafter → SpecForge/SpecBundle → P-EAGLE)+ vLLM v0.28.0 Spec V2 + SGLang DFlash v2 + SpecForge arXiv:2603.18567 + z-lab/Qwen3.8-27B-DFlash2 + ReplaySSM + Mamba-3 + Verification-Aware Training(VAT) = "§1.(1) 推理引擎 Speculative Decoding 八栖预备" - §1.(3) KV Cache 综述 NET-new 预备 · ReplaySSM(缓存 SSM 输入 BF16 而非状态 FP32)+ Mamba-3(SSD 框架续作)+ VAT(draft 训练验证感知)= 与沿用 Sliding-window Beats Linear Attention arXiv:2608.28444 + SGLang SWA + HiCache + StreamingLLM = "§1.(3) KV Cache SSM/Speculative 七栖预备" - §1.(12) (v) Harness Reliability NET-new 邻接级预备 · VAT(Verification-Aware Training)是 harness-style 训练方法学,与 Agent Harness Survey preprints.org 202604.0428 + INFERENCEBENCH arXiv:2607.20468 = §1.(12) (v) Harness Reliability 训练方法学预备扩面

与活文档现有脉络的关系: - §1.(1) 推理引擎 Speculative Decoding + §1.(3) KV Cache 综述 + §IX 60-80 morning 沿用 + ReplaySSM + Mamba-3 + VAT = §IX 81 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 60-66 §1.(1) vLLM 演进 + §IX 73 Token-Operations-Oriented arXiv:2606.20295 + §IX 76 SGLang DFlash v2 + ReplaySSM + VAT = "§1.(1) Speculative Decoding 预备八栖" - 与 §IX 80 morning Oneiros 参数重映射 + ReplaySSM SSM 输入缓存 = "§1.(3) KV Cache 算子层 + SSM 预取"预备扩面

警示: - ⚠️ P1:ReplaySSM 是 Tri Dao 官方博客(2026-08),尚未正式发表为 arXiv 论文,GitHub 集成 PR 进度需核验 - ⚠️ P1:Mamba-3 ICLR 2026 Oral 是已接收论文,但官方代码/模型权重尚未公开(ICLR 2026 会议时间需核验) - ⚠️ P1:VAT arXiv:2608.30135 是 2026-08 提交的最新论文(9-1 16:30 paper_card 入库),立标信号待核验(S2 被引 / 影响力被引) - ⚠️ P2:ReplaySSM "Qwen3.5/Nemotron 混合模型 decode 加速 2×" 的具体测试条件(GPU 型号 / batch size / 上下文长度)需核验 - ⚠️ P2:Mamba-3 vs Mamba-2 的具体性能提升数字(vs attention 模型 / vs SSM 模型)需核验

建议归入节: §1.(1) 推理引擎 Speculative Decoding(NET-new 预备 · ReplaySSM Tri Dao Lab + Mamba-3 ICLR 2026 Oral arXiv:2603.15569 + VAT arXiv:2608.30135 + Speculative 八栖预备)+ §1.(3) KV Cache 综述(邻接级预备 · SSM/Speculative 七栖预备)+ §IX 81 evening 棒位预备


增量 5【§1.(2) 推理调度 + §1.(1) 推理引擎 AMD/边缘 NET-new · 9-1 afternoon + evening】🟡 AMD Instinct MI325X LLM 推理基准(arXiv:2603.10031)+ Cloud-Native 分布式 LLM 综述(arXiv:2604.17227 IEEE TC 2026)+ Token-Operations-Oriented Inference Optimization(arXiv:2606.20295)+ LLM Serving in the Wild(arXiv:2608.03036)+ INFERENCEBENCH(arXiv:2607.20468)—— 综述/横评/系统化五栖预备 ★★★

  • 来源inbox/jay/2026-09-01T1105-jay-five-category-briefing.md 条目 7 + 条目 9 + 条目 10 + 条目 11 + inbox/jay/2026-09-01T1450-jay-inference-engine-deep-dive-2026.md 条目 5(⭐⭐⭐⭐ · 综述/横评/系统化预备)

要点:

AMD Instinct MI325X LLM 推理基准(arXiv:2603.10031): - 在 AMD MI325X 上系统性评测 Llama 2 70B / Mixtral 8x7B - 对齐 MLPerf Inference v5.0/v5.1 标准 - 发现 MoE 路由、多头隐注意力等新架构在 AMD 上的独特瓶颈 - ROCm 栈(vLLM、SGLang 均有 AMD 支持)

Cloud-Native 分布式 LLM 综述(arXiv:2604.17227 · IEEE TC 2026 已发表 · 45 页): - 标题:Cloud-native and Distributed Systems for Efficient and Scalable Large Language Models — A Research Agenda - 核心结构:LLM 推理的云原生分布式挑战 · Prefill-Decode 分解 · 动态 KV cache 管理 · MoE 架构下的通信调度 · 资源调度与负载均衡 - 涵盖 DOPD(ICCS 2026)、ShuffleInfer、BanaServe 等工作

Token-Operations-Oriented Inference Optimization(arXiv:2606.20295): - Speculative Decoding 演进:ReDrafter → SpecForge/SpecBundle → P-EAGLE(并行草稿) - PagedAttention(vLLM)和 RadixAttention(SGLang)的 KV cache 管理对比 - FlashInfer 集成 SGLang/vLLM:inter-token latency 降低 29%-69%

LLM Serving in the Wild(arXiv:2608.03036): - 分析了 vLLM、SGLang、TensorRT-LLM、LMDeploy、FlashInfer 的真实开源采用模式 - FlashInfer + SGLang、FlashInfer + vLLM 是有效组合(调度+内存管理+内核优化) - vLLM 在 Model Training and Optimization 主题最多;SGLang 紧随其后;TensorRT-LLM 集中在 CUDA 并行

INFERENCEBENCH(arXiv:2607.20468): - AI Agent 能在 vLLM/SGLang/TGI 上找到有效优化(aggregate speedup 9-11× vs default) - 优化器选择(Random/SMAC/TPE)差异不大,框架选择更重要 - 不同引擎的优化空间差异显著:TGI 在某些 scenario 落后 vLLM 2×+

关键意涵: - §1.(2) 推理调度 NET-new 预备 · Cloud-Native 分布式 LLM 综述(45 页 IEEE TC 2026)+ LLM Serving in the Wild(真实开源采用模式)+ INFERENCEBENCH(AI Agent 优化 9-11×)+ AMD MI325X 基准 + Token-Operations-Oriented = "§1.(2) 推理调度综述/横评/系统化五栖预备" - §1.(1) 推理引擎 AMD/边缘 NET-new 预备 · AMD MI325X Llama 2 70B / Mixtral 8x7B 基准 + ROCm 栈(vLLM/SGLang AMD 支持)+ X-MoE arXiv:2508.13337 AMD ROCm 64 GPU = "§1.(1) 推理引擎 AMD 路径三栖预备"(与 §IX 80 morning SGLang MoRI on AMD MI355X 形成"AMD 完整路径预备闭合") - §1.(3) KV Cache 综述 NET-new 预备 · Token-Operations-Oriented(PagedAttention vs RadixAttention 对比 + FlashInfer 集成 29-69% 降延迟)+ Cloud-Native(动态 KV cache 管理)+ LLM Serving in the Wild(FlashInfer + SGLang/vLLM 组合)= "§1.(3) KV Cache 综述三栖预备"

与活文档现有脉络的关系: - §1.(2) 推理调度 + §1.(1) 推理引擎 AMD/边缘 + §1.(3) KV Cache 综述 + §IX 53-80 morning 沿用 + AMD MI325X + Cloud-Native IEEE TC + Token-Operations-Oriented + LLM Serving in the Wild + INFERENCEBENCH = §IX 81 evening 棒位预备的关键 NET-new 主轴候选预备 - 与 §IX 80 morning SGLang MoRI on AMD Instinct MI355X + AMD MI325X 基准 + X-MoE AMD ROCm = "§1.(1) 推理引擎 AMD 路径三栖预备" - 与 §IX 73 AussieAI 500+ 推理优化全景图 + §IX 76 Token-Operations-Oriented arXiv:2606.20295 + LLM Serving in the Wild + Cloud-Native IEEE TC 2026 = "§1.(3) KV Cache 综述五栖预备"

警示: - ⚠️ P1:arXiv:2603.10031 AMD MI325X 基准是 2026-03 提交,距今 6 个月,需核验最新 AMD MI355X / MI400 系列演进(§IX 80 morning SGLang MoRI MI355X 已用 MI355X) - ⚠️ P1:Cloud-Native arXiv:2604.17227 IEEE TC 2026 已发表,但 45 页综述的覆盖面(vs llm-infra.md §1.(2) §1.(11) §1.(12) 现有锚点)需精读核验 - ⚠️ P2:INFERENCEBENCH "AI Agent 优化 9-11× vs default" 的具体 baseline 定义(default = no optimization?= baseline 引擎配置?)需核验 - ⚠️ P2:LLM Serving in the Wild "FlashInfer + SGLang/vLLM 是有效组合" 的具体组合性能数据点需核验 - ⚠️ P2:Cloud-Native arXiv:2604.17227 涵盖的 DOPD/ShuffleInfer/BanaServe 是否已锚入 llm-infra.md §1.(2) §1.(11) 沿用件套

建议归入节: §1.(2) 推理调度(NET-new 预备 · Cloud-Native IEEE TC 2026 + LLM Serving in the Wild + INFERENCEBENCH + AMD MI325X + Token-Operations-Oriented 五栖预备)+ §1.(1) 推理引擎 AMD/边缘(NET-new 预备 · AMD MI325X 基准 + ROCm + AMD 路径三栖预备)+ §IX 81 evening 棒位预备


三、值得警惕的矛盾或待核实说法

  1. §IX 80 morning SOTA v2 综述锚入 6 件 vs §IX 81 evening 棒位预备 5 件的棒位边界

    • §IX 80 morning(2026-09-01 11:15)已锚入 Oneiros / Albireo / Silent Hyperparameter / MoE CSUR 2026 / Aurora / X-MoE
    • 本棒预备 5 件(TokenFlow + NeuroPrefetcher + ReplaySSM + Mamba-3 + VAT + AMD MI325X + Cloud-Native + Token-Operations + LLM Serving in the Wild + INFERENCEBENCH = 10 件扣除已在 engineering-e1prep 落入 §IX 80 morning 的 7 件 = 净 3 件 evening 棒位预备 + 7 件 morning 棒位预备)
    • 解释:建议 §IX 81 evening 棒位(2026-09-01 evening)锚入 NET-new 5 件(增量 1-5 均为预备级),§IX 82 morning 棒位预备
    • 建议归入:§IX 81 evening 棒位预备 · 明确 5 件预备候选预备级 vs NET-new 锚入级
  2. vLLM v0.18 / v0.20.0 / v0.28.0 三版本 PagedAttention Block Manager 演进冲突(stephen 9-1 noon 协调棒冲突 #2):

    • jay 9-1 12:20 CSDN 锁定 vLLM v0.20.0(zhonglinzhang,CSDN 521 错误)
    • jay engineering-e1prep 9-1 11:22 提及 vLLM v0.18 PagedAttention Block Manager v2
    • §IX 76 morning 锚入 vLLM v0.28.0(2026-08-26 GA,584 commits / 270 contributors)
    • 解释:三个版本号并行出现,建议以 v0.28.0 为最新基线,v0.18/v0.20 作为"历史 PagedAttention 演进锚"放入同一预备笔记时间线
    • 建议归入:§1.(1) 推理引擎演进时间线预备 · jay 9-1 evening 棒位前补 v0.18/v0.20/v0.28 三版本 PagedAttention Block Manager 差异表
  3. Qwen3.8-27B vs Qwen3.5-Omni/Qwen3.6-Plus 版本号混用(stephen 9-1 noon 协调棒冲突 #3):

    • jay 9-1 12:20 CSDN → Qwen3.8-27B(2026-08-20 发布,显存 54-58GB FP16)
    • jay 9-1 11:05 五分类 Substack AIxFunda Weekly → Qwen3.5-Omni(原生多模态 113 语言)+ Qwen3.6-Plus(1M context,Bailian)
    • 解释:同一 Qwen 团队在 8 月同时出现 Qwen3.5-Omni / Qwen3.6-Plus / Qwen3.8-27B 三个版本,Substack AIxFunda 可能误号或为社区别名
    • 建议归入:§1.(1) 推理引擎选型 + 模型适配预备 · jay 9-1 evening 棒位前到阿里云 Bailian / ModelScope 核验 Qwen 系列官方版本号
  4. TokenFlow arXiv:2510.02758(2025-10)vs §IX 80 morning UniBoost arXiv:2606.18431(2026-06)时间间隔 8 个月

    • TokenFlow = 抢占式调度(针对 streaming burst 场景)
    • UniBoost = 抢占式驱逐 + 软连续优先级塑形 + KV-Cost 感知
    • 解释:两者属于同一研究方向的不同侧重点(TokenFlow = 抢占式调度 / UniBoost = 抢占式驱逐),建议明确双栖预备
    • 建议归入:§1.(2) 推理调度预备 · 明确"抢占式调度(TokenFlow)vs 抢占式驱逐(UniBoost)"双路径
  5. NeuroPrefetcher arXiv:2608.22643 ICPP'26 vs §IX 80 morning Oneiros arXiv:2507.11507(2025-07)时间间隔 13 个月

    • NeuroPrefetcher = Delta Prefetching 策略(针对 unified-memory 边缘硬件)
    • Oneiros = 运行时参数-内存动态重映射(针对 KV cache 触及 GPU 内存上限)
    • 解释:两者同属"动态内存管理"研究方向,但侧重点不同(NeuroPrefetcher = 预取策略 / Oneiros = 重映射策略),建议明确双栖预备
    • 建议归入:§1.(3) KV Cache 算子层 + §1.(11) Kernel/AI 自动化预备 · 明确"Delta Prefetching(NeuroPrefetcher)vs 运行时重映射(Oneiros)"双路径
  6. ReplaySSM Tri Dao blog(2026-08)vs Mamba-3 ICLR 2026 Oral(arXiv:2603.15569 · 2026-03)时间间隔 5 个月

    • ReplaySSM = SSM 输入缓存(BF16)避免状态重算
    • Mamba-3 = Mamba-2 SSD 框架续作(架构改进)
    • 解释:两者同属"SSM 推理优化"研究方向,但侧重点不同(ReplaySSM = 推理工程优化 / Mamba-3 = 架构演进),建议明确双栖预备
    • 建议归入:§1.(1) 推理引擎 Speculative Decoding + §1.(3) KV Cache 综述预备 · 明确"SSM 推理工程(ReplaySSM)vs SSM 架构演进(Mamba-3)"双路径
  7. Cloud-Native arXiv:2604.17227 IEEE TC 2026(45 页综述)vs §IX 80 morning InferenceOps Apr 2026 KServe v0.17.0 + llm-d + EPP 拆分的范围重叠

    • Cloud-Native 综述涵盖 Prefill-Decode 分解、动态 KV cache 管理、MoE 架构通信调度、资源调度与负载均衡
    • InferenceOps Apr 2026 = KServe v0.17.0 + llm-d + EPP 拆分 + SIG-kv-disaggregation 进展
    • 解释:两者主题范围有重叠(Prefill-Decode / KV cache / MoE / 调度),建议明确 Cloud-Native 综述作为"学术综述层" / InferenceOps Apr 2026 作为"工业现状层"双栖预备
    • 建议归入:§1.(2) 推理调度 + §1.(11) Kernel/AI 自动化预备 · 明确"学术综述 vs 工业现状"双栖预备
  8. Token-Operations-Oriented arXiv:2606.20295 vs LLM Serving in the Wild arXiv:2608.03036 时间间隔 2 个月 + 主题重叠

    • Token-Operations-Oriented = Speculative Decoding + PagedAttention vs RadixAttention + FlashInfer 集成
    • LLM Serving in the Wild = 真实开源采用模式 + FlashInfer + SGLang/vLLM 组合
    • 解释:两者同属"LLM Serving 实证研究"方向,建议作为"同一研究方向的两次连续输出"合并锚入
    • 建议归入:§1.(2) 推理调度 + §1.(3) KV Cache 综述预备 · 时间线合并(Token-Operations 2026-06 + LLM Serving in the Wild 2026-08)
  9. AMD Instinct MI325X 基准 arXiv:2603.10031 vs §IX 80 morning SGLang MoRI on AMD MI355X

    • AMD MI325X 基准(2026-03)vs SGLang MoRI on AMD MI355X(2026-09)
    • 解释:AMD MI325X 是上一代(2026-03 时段主流 AMD 推理卡),MI355X 是新一代(2026-09 升级),建议明确 AMD 完整路径预备(MI325X → MI355X → MI400 系列演进)
    • 建议归入:§1.(1) 推理引擎 AMD/边缘预备 · 明确"AMD MI 系列演进"路径预备
  10. INFERENCEBENCH arXiv:2607.20468 "AI Agent 优化 9-11× vs default" 立标信号

    • 位置论文 + 实证 Benchmark(vLLM/SGLang/TGI 上 AI Agent 自动优化)
    • 警示:建议核验 S2 被引 / 影响力被引数据点(如立标信号弱,建议作为预备候选状态)
    • 建议归入:§1.(12) (v) Harness Reliability 预备 · INFERENCEBENCH 维持候选预备状态
  11. Verification-Aware Training for Speculative Decoding arXiv:2608.30135(2026-08 提交 · 9-1 16:30 paper_card 入库)立标信号弱

    • 形态 position · 主分类 engineering
    • 警示:建议核验 S2 被引 / 影响力被引数据点 + 实验是否已跑通(VAT plug-in 框架的实际训练效果)
    • 建议归入:§1.(1) 推理引擎 Speculative Decoding 预备 · VAT 维持候选预备状态
  12. Configurable Semantic Chunking for Biomedical RAG arXiv:2608.31139(9-1 16:30 paper_card 入库 · 主分类 rag · 副分类 llm-infra)邻接级补强

    • 形态 position · RAG 主分类
    • 解释:可作为 §1.(12) End-to-End Pipeline 邻接级补强(与 §IX 80 morning Semantic Router + Global Prefix Caching + Disaggregated P/D Nodes 形成"RAG + 推理栈"路径预备闭合)
    • 建议归入:§1.(12) End-to-End Pipeline + §1.(10) 向量 DB 邻接级预备
  13. §IX 80 morning 沿用 SOTA v2 综述中"6 件 NET-new 锚入 + 4 件候选预备"的棒位预备边界

    • §IX 80 morning SOTA v2 综述 = 6 件 NET-new 锚入 + 4 件候选预备(Oneiros + Albireo + Silent Hyperparameter + MoE CSUR 2026 + Aurora + X-MoE + SGLang MoRI + HF State of OS + MSys 2026 LLM Serving + xorbitsai/inference = 10 件候选预备 / 6 件 NET-new 锚入)
    • 本棒预备 5 件 evening + afternoon 棒位预备 = TokenFlow + NeuroPrefetcher + ReplaySSM + Mamba-3 + VAT + AMD MI325X + Cloud-Native + Token-Operations + LLM Serving in the Wild + INFERENCEBENCH = 10 件候选预备 + 0 件 NET-new 锚入(本棒性质为"§IX 81 evening 棒位预备 + 24h 净窗口补强")
    • 解释:本棒按"§IX 81 evening 棒位预备"原则,5 件均为候选预备级,未触发 NET-new 锚入(因为本棒净窗口仅 7h25m,§IX 80 morning SOTA v2 综述已经吸收了 6 件 NET-new)
    • 建议归入:§IX 81 evening 棒位预备 · 明确"5 件候选预备级 + 0 件 NET-new 锚入"的棒位边界
  14. Ken Huang 10-Part Series 2026-09-04 首播预告(§IX 80 morning 锚入)vs jay 9-1 14:50 afternoon 棒位"丢弃条目"明确标注"系列尚未发布(2026-09-04 首篇才出)"

    • §IX 80 morning 锚入:Ken Huang 10-Part 首播预告 + 课程大纲
    • jay 9-1 14:50 afternoon 棒位:"丢弃条目 #2 10-Part LLM Inference Physics Series(kenhuang.substack.com)丢弃理由 = 系列尚未发布(第一篇 2026-09-04 才出),当前仅有 announcement。无实际内容,不进入知识库。等正式发布后再评估"
    • 解释:两个棒位对 Ken Huang 10-Part Series 处理方式不同(§IX 80 morning 锚入首播预告 / jay 9-1 14:50 丢弃)。建议保留 §IX 80 morning 锚入(首播预告有价值,可作为 2026-09-04 后 §IX 82/83 棒位的预备),同时尊重 jay 9-1 14:50 afternoon 棒位的"丢弃"判断(不进入 jay engineering-e1prep)
    • 建议归入:§IX 81 evening 棒位预备 · 明确 Ken Huang 10-Part Series 处理边界

四、可引用的 arXiv 号列表(10 件 NET-new 预备 · §IX 81 evening 棒位预备)

主轴 NET-new 候选预备(5 件 · §IX 81 evening 棒位预备)

  1. arXiv:2510.02758 — TokenFlow: 抢占式调度解决 LLM 文本流突发(FCFS + prefill 优先策略对 burst 场景的根治 · 与 Sarathi-Serve/Chunked Prefill 路线同类)· §1.(2) 推理调度 + §1.(3) KV Cache 综述(邻接级)
  2. arXiv:2608.22643 — NeuroPrefetcher: Delta Prefetching 策略(ICPP 2026 · DOI 10.1145/3832810.3832862 · 20 个生产 LLM 推理系统评估 · unified-memory 边缘硬件)· §1.(11) Kernel/AI 自动化 + §1.(3) KV Cache 算子层(邻接级)
  3. arXiv:2603.15569 — Mamba-3: 改进的状态空间模型(ICLR 2026 Oral · Aakash Lahoti/Kevin Y. Li/Berlin Chen/Caitlin Wang/Aviv Bick/J. Zico Kolter/Tri Dao/Albert Gu · Mamba-2 SSD 框架续作)· §1.(1) 推理引擎 Speculative Decoding + §1.(3) KV Cache 综述(邻接级)
  4. arXiv:2608.30135 — Verification-Aware Training for Speculative Decoding(2026-08 提交 · 9-1 16:30 paper_card 入库 · 形态 position · 主分类 engineering · VAT plug-in 框架模拟验证过程)· §1.(1) 推理引擎 Speculative Decoding + §1.(12) (v) Harness Reliability(邻接级)
  5. arXiv:2608.03036 — LLM Serving in the Wild: 框架实证研究(vLLM/SGLang/TensorRT-LLM/LMDeploy/FlashInfer 真实开源采用模式 · FlashInfer + SGLang/vLLM 是有效组合)· §1.(2) 推理调度 + §1.(1) 推理引擎选型

邻接级补强(5 件 · §IX 81 evening 棒位预备)

  1. arXiv:2603.10031 — AMD Instinct GPU LLM 推理基准(Llama 2 70B / Mixtral 8x7B · MLPerf Inference v5.0/v5.1 对齐 · AMD MI325X · ROCm 栈)· §1.(1) 推理引擎 AMD/边缘
  2. arXiv:2604.17227 — Cloud-Native and Distributed Systems for LLM(IEEE TC 2026 已发表 · 45 页 · Prefill-Decode 分解 · 动态 KV cache 管理 · MoE 架构通信调度 · 资源调度与负载均衡 · DOPD/ShuffleInfer/BanaServe)· §1.(2) 推理调度 + §1.(11) Kernel/AI 自动化
  3. arXiv:2606.20295 — Token-Operations-Oriented Inference Optimization(Speculative Decoding ReDrafter → SpecForge/SpecBundle → P-EAGLE · PagedAttention vs RadixAttention 对比 · FlashInfer 集成 inter-token latency 29-69%)· §1.(1) 推理引擎 Speculative Decoding + §1.(3) KV Cache 综述
  4. arXiv:2607.20468 — INFERENCEBENCH: AI Agent 做 LLM 推理优化的开放式 Benchmark(vLLM/SGLang/TGI 上 AI Agent 自动优化 · aggregate speedup 9-11× vs default · TGI 在某些 scenario 落后 vLLM 2×+)· §1.(12) (v) Harness Reliability + §1.(1) 推理引擎选型
  5. arXiv:2608.31139 — Configurable Semantic Chunking for Biomedical Information Extraction in RAG(2026-08 提交 · 9-1 16:30 paper_card 入库 · 形态 position · 主分类 rag · 副分类 llm-infra · entity-preserving windows + trigger-centered chunking + proposition-first extraction + tiered trigger prioritization + hierarchical relation resolution)· §1.(12) End-to-End Pipeline + §1.(10) 向量 DB 邻接级

§IX 80 morning 已锚入沿用件(沿用件套,本棒不再重复预备)

  • arXiv:2507.11507 — Oneiros / MIRAGE(§IX 80 morning SOTA v2 #27 锚入)
  • arXiv:2606.01927 — Albireo(§IX 80 morning SOTA v2 #29 预备)
  • arXiv:2605.19537 — The Silent Hyperparameter(§IX 80 morning SOTA v2 #28 锚入)
  • arXiv:2412.14219 — MoE ACM CSUR 2026(§IX 80 morning SOTA v2 #5 锚入)
  • arXiv:2410.17043 — Aurora(§IX 80 morning SOTA v2 #6 锚入)
  • arXiv:2508.13337 — X-MoE(§IX 80 morning SOTA v2 #7 锚入)
  • arXiv:2606.18431 — UniBoost(§IX 76 morning 锚入 · 9-1 11:22 engineering-e1prep 沿用)
  • arXiv:2605.29639 — RTP-LLM Alibaba(§IX 76 evening 锚入)
  • arXiv:2601.20408 — OptiKIT eBay(§IX 76 evening 预备)
  • arXiv:2601.19139 — Native LLM/MLLM Inference on Apple Silicon(§IX 76 evening 预备)
  • arXiv:2607.09172 — vLLM Configuration Trade-offs(§IX 77 morning 预备)
  • arXiv:2606.07362 — vLLM Internal Principles torch.compile(§IX 76 evening 预备)
  • arXiv:2510.09665 — Efficient KV Cache Layer(§IX 76 morning 锚入)
  • arXiv:2506.09713 — A First Look at Bugs in LLM Inference Engines(§IX 76 morning 锚入)
  • arXiv:2603.20397 — KV Cache Optimization Strategies Dell 工业综述(§IX 76 morning 锚入)
  • arXiv:2607.08057 — ACL 2026 Findings KV Cache Survey(§IX 60 锚入)
  • arXiv:2606.21238 — ARC(§IX 67 锚入)
  • arXiv:2606.02964 — AsymCache(§IX 67 锚入)
  • arXiv:2608.08097 — Lookahead Sparse KV Cache Offload(§IX 73 锚入)
  • arXiv:2608.01526 — Internet for KV Cache(§IX 73 锚入)
  • arXiv:2608.00902 — Online KV Cache Compaction(§IX 73 锚入)
  • arXiv:2608.26021 — Slasher(§IX 73 锚入)
  • arXiv:2608.26070 — Prefix Sliding(§IX 60 锚入)
  • arXiv:2608.04771 — ReCo(§IX 73 锚入)
  • arXiv:2608.28444 — Sliding-window Beats Linear Attention(§IX 76 morning 锚入)
  • arXiv:2608.16157 — FreeToken(§IX 76 evening 锚入)
  • arXiv:2603.18567 — SpecForge(§IX 76 evening 锚入)
  • arXiv:2601.06288 — AIConfigurator(§IX 80 morning MSys 2026 沿用)
  • arXiv:2607.17715 — C²KV(§IX 73 KDD 2026 锚入)
  • arXiv:2608.09867 — MATS Research 加密推理窃取(§IX 76 evening 锚入)

工程级补强(非 arXiv,但 URL 集合预备扩增)

  • https://blog.csdn.net/zhonglinzhang/article/details/160307504(vLLM v0.20.0 超深度系统级架构分析 · CSDN 521 错误 · 待 fallback 至 GitHub Release Note / 官方博客 / Wayback Machine)
  • https://bbs.csdn.net/weixin_29062255/article/details/100264031(Qwen3.8-27B 部署实战 · AWQ/GPTQ 量化 · vLLM ≥ 0.16 · Docker Compose · Prometheus · Nginx · Fluentd · nvidia-smi 验证)
  • https://www.preprints.org/manuscript/202604.0428(Agent Harness for LLM Inference · benchmark gaming 真实案例 + 三难困境 + Repo2Run 90% + 工具链 6 件套)
  • https://arxiv.org/html/2608.22643v1(NeuroPrefetcher ICPP 2026)
  • https://arxiv.org/html/2510.02758v1(TokenFlow 抢占式调度)
  • https://arxiv.org/html/2603.10031v1(AMD Instinct MI325X 基准)
  • https://tridao.me/blog/2026/replayssm(ReplaySSM Tri Dao 官方博客)
  • https://arxiv.org/html/2608.03036v1(LLM Serving in the Wild)
  • https://arxiv.org/html/2604.17227v1(Cloud-Native IEEE TC 2026)
  • https://arxiv.org/html/2607.20468v1(INFERENCEBENCH)
  • https://arxiv.org/html/2606.20295v1(Token-Operations-Oriented Inference Optimization)
  • https://arxiv.org/html/2608.30135v1(Verification-Aware Training for Speculative Decoding)
  • https://arxiv.org/html/2608.31139v1(Configurable Semantic Chunking for Biomedical RAG · 副分类 llm-infra)
  • https://arxiv.org/abs/2603.15569(Mamba-3 ICLR 2026 Oral)
  • https://mlsys.org/virtual/2026/papers.html(MLSys 2026 LLM Serving 4 篇 + FlashAttention-4 Best Paper Honorable Mention + SonicSampler COLM 2026)
  • https://www.microsoft.com/en-us/research/blog/orchard-an-open-framework-for-scalable-agentic-ai(Orchard Agent 训练基础设施 · §1.(11) Kernel/AI 自动化邻接级)
  • https://github.com/microsoft/Orchard(Orchard GitHub)
  • https://simonwillison.net/2026/Aug/31/introducing-wrapture/(wrapture Python instrumentation)
  • https://simonwillison.net/2026/Aug/30/understanding-chatgpt-work/(ChatGPT Work 企业级产品)
  • https://simonwillison.net/2026/Aug/29/hy4/(Tencent Hy4 Preview 770B MoE · §1.(1) 推理引擎选型邻接级)
  • https://www.anthropic.com/news/claude-text-watermark(Claude 水印体系 · EU AI Act 合规)
  • https://aixfunda.substack.com/p/top-llm-rag-and-agent-updates-of-0d2(AIxFunda Weekly · Qwen3.5-Omni + Qwen3.6-Plus + llama.cpp 100K stars)
  • https://www.bestaiweb.ai/how-to-deploy-and-optimize-llm-inference-with-vllm-tensorrt-llm-and-sglang-in-2026(最佳 AI Web · vLLM/TensorRT-LLM/SGLang 部署优化 2026)
  • https://leetllm.com/blog/llm-inference-engine-comparison-2026(LeetLLM · 推理引擎对比 2026)
  • https://techsy.io/en/blog/vllm-vs-sglang(TECHSY · vLLM vs SGLang 2026)

五、本棒"§IX 81 evening 棒位预备"建议清单

5.1 §IX 81 evening 棒位 NET-new 候选预备(5 件主轴 · 24h 净窗口补强层)

  1. Agent Harness for LLM Inference Survey(preprints.org 202604.0428) → §1.(12) (v) Harness Reliability + §1.(12) (vi) Agent Security(benchmark gaming 真实案例 + 评估体系三难困境 + Repo2Run 90% + 工具链 6 件套)
  2. TokenFlow arXiv:2510.02758 抢占式调度 → §1.(2) 推理调度 + §1.(3) KV Cache 综述(FCFS + prefill 优先策略对 burst 场景的根治 + Sarathi-Serve/Chunked Prefill 路线)
  3. NeuroPrefetcher ICPP 2026 arXiv:2608.22643 → §1.(11) Kernel/AI 自动化 + §1.(3) KV Cache 算子层(Delta Prefetching 策略 + 20 个生产 LLM 推理系统 + unified-memory 边缘硬件)
  4. ReplaySSM + Mamba-3 + VAT 三栖预备 → §1.(1) 推理引擎 Speculative Decoding + §1.(3) KV Cache 综述(ReplaySSM Tri Dao Lab + Mamba-3 ICLR 2026 Oral arXiv:2603.15569 + VAT arXiv:2608.30135 · Speculative 八栖预备)
  5. AMD MI325X + Cloud-Native IEEE TC + Token-Operations + LLM Serving in the Wild + INFERENCEBENCH 五栖预备 → §1.(2) 推理调度 + §1.(1) 推理引擎 AMD/边缘(综述/横评/系统化五栖预备)

5.2 §IX 82 morning 棒位 NET-new 候选预备(5 件邻接级补强)

  1. AMD Instinct MI325X 基准 arXiv:2603.10031 → §1.(1) 推理引擎 AMD/边缘(Llama 2 70B / Mixtral 8x7B · MLPerf 对齐 · ROCm 栈)
  2. Cloud-Native IEEE TC 2026 arXiv:2604.17227 → §1.(2) 推理调度 + §1.(11) Kernel/AI 自动化(45 页综述 · Prefill-Decode 分解 · 动态 KV cache · MoE 通信 · 调度与负载均衡)
  3. Token-Operations-Oriented arXiv:2606.20295 → §1.(1) 推理引擎 Speculative Decoding + §1.(3) KV Cache 综述(ReDrafter → SpecForge/SpecBundle → P-EAGLE + PagedAttention vs RadixAttention + FlashInfer 集成 29-69%)
  4. INFERENCEBENCH arXiv:2607.20468 → §1.(12) (v) Harness Reliability(vLLM/SGLang/TGI 上 AI Agent 自动优化 9-11× + TGI 落后 vLLM 2×+)
  5. Configurable Semantic Chunking for Biomedical RAG arXiv:2608.31139 → §1.(12) End-to-End Pipeline + §1.(10) 向量 DB 邻接级(entity-preserving windows + trigger-centered chunking + proposition-first extraction + tiered trigger prioritization + hierarchical relation resolution)

5.3 工程实践补强候选预备(4 件)

  • vLLM v0.20.0 超深度系统级架构分析(CSDN zhonglinzhang · CSDN 521 错误) → §1.(1) 推理引擎 · 与 §IX 76 v0.28.0 五大主线(v0.20 → v0.27.1 → v0.28 演进时间线)预备
  • Qwen3.8-27B 部署实战 AWQ/GPTQ 量化(weixin_29062255) → §1.(1) 推理引擎 Qwen 量化部署 + §1.(12) End-to-End Pipeline(vLLM ≥ 0.16 · Docker Compose · Prometheus · Nginx · Fluentd · nvidia-smi 验证)
  • SGLang Pickle RCE CVE-2026-3059 / CVE-2026-3060 安全警告 → §1.(10) 安全 + §1.(11) Kernel/AI 自动化邻接级(CVSS 9.8 · 多模态和 disaggregation 模块未认证 RCE · 2026-03 未修复 · 禁止暴露于不可信输入)
  • TensorRT-LLM CLI 废弃警告(trtllm-serve v1.0+ 选项变更) → §1.(1) 推理引擎演进时间线预备

5.4 警示消化预备(14 件矛盾 + 待核实说法,详见 §三)


六、检查过的来源清单(汇总)

已检查 / 已纳入

  • organized/knowledge/llm-infra.md §IX 80 morning(2026-09-01 11:15 · SOTA 多轮深综合第 2 版替换 §0.5 综述 · 0 件 NET-new arXiv/CVE/DOI/URL · 推理工程学科化第 10 维 ≥ 105 件套扩面沿用闭合)
  • organized/topic_pages/llm-infra.md(主索引)
  • work-queue.md(2026-09-01 18:00 自动生成 · 视图干净)
  • inbox/spark/2026-08-31-llm-infra-e1prep.md(8-31 18:40 · 71 KB · §IX 76 evening + §IX 77 morning 棒位预备 · 8 条主增量 + 12 件警示)
  • inbox/spark/2026-09-01-agent-e1prep.md(9-1 13:37 · 49 KB · agent 主轴 · llm-infra 邻接级 0 件 NET-new)

inbox/jay(13 份): - ✅ inbox/jay/2026-08-31T1735-jay-evening-briefing-ark-kvcache-droidspeak-grapheng.md8-31 傍晚关键源 · ARK + DroidSpeak + GraphEng = 3 件已锚入 §IX 76 evening) - ✅ inbox/jay/2026-08-31T1950-jay-evening-inference-rag-benchmark.md(MLPerf RAG + RAG 7 失败模式 + TGI 归档警告 = 3 件 evening 棒位) - ✅ inbox/jay/2026-08-31T2105-jay-five-category-briefing.md8-31 晚场关键源 · 31 件五分类整理 · llm-infra 主轴 14 件预备 · 已在 §IX 76 evening / §IX 77 morning 棒位预备) - ✅ inbox/jay/2026-09-01T0935-jay-inference-engineering-kvcache-ai-stacks.md9-1 早场本棒关键源 · Oneiros + Albireo + Silent Hyperparameter + xorbitsai/inference v3.2.0 + SGLang MoRI + VLM Intel Xeon CPU Offload + 推理引擎四强对比 + HF State of OS Spring 2026 + Ken Huang 10-Part = 13 件 NET-new 预备 · 9 件已在 §IX 80 morning 11:15 SOTA v2 综述替换中锚入) - ✅ inbox/jay/2026-09-01T1050-jay-inference-benchmark-moe-agentic-rag-2026.md9-1 早场主轴简报 · 推理引擎 6 来源实测 + MoE ACM CSUR 2026 综述 + Aurora + X-MoE + Agentic RAG Benchmark 纵览 + MLSys 2026 LLM Serving 4 篇 + TGI 迁移警告 + INFERENCEBENCH + Token-Operations-Oriented + LLM Serving in the Wild + Cloud-Native + AMD Instinct + The AI Engineer Substack vLLM vs Ollama vs SGLang vs TensorRT-LLM = 14 件 NET-new 预备 · 6 件已在 §IX 80 morning 11:15 SOTA v2 综述替换中锚入) - ✅ inbox/jay/2026-09-01-engineering-e1prep.md(jay engineering E1 9-1 11:22 棒位 · 7 条主轴高质量条目 · MLPerf RAG + UniBoost + 推理引擎 6 来源 + MoE ACM CSUR 2026 + PagedAttention 0.18 + Dify v1.16 + BentoML = 7 件 9-1 morning 主增量 · 已锚入 §IX 80 morning) - ✅ inbox/jay/2026-09-01T1105-jay-five-category-briefing.md9-1 午场本棒关键源 · DATABASE 5 + BACKEND 6 + CLOUD-NATIVE 3 + Substack 2 + Reproduction 6 = 22 件五分类整理 · llm-infra 主轴 6 件预备 · Token-Operations-Oriented + LLM Serving in the Wild + Cloud-Native + TokenFlow + NeuroPrefetcher + AMD Instinct + INFERENCEBENCH + ReplaySSM + Mamba-3 + FlashAttention-4 + SonicSampler = 11 件 NET-new 候选预备) - ✅ inbox/jay/2026-09-01T1220-jay-csdn-vllm-qwen-deploy-highvalue.md9-1 noon 棒位 · vLLM v0.20.0 超深度 + Qwen3.8-27B 部署实战 = 2 件 9-1 noon 主增量 · llm-infra 主轴预备) - ✅ inbox/jay/2026-09-01T1450-jay-inference-engine-deep-dive-2026.md9-1 下午棒位本棒关键源 · 推理引擎四强对比 2026 + Agent Harness Survey + NeuroPrefetcher ICPP'26 + TokenFlow + AMD Instinct GPU = 5 件 9-1 afternoon 主增量 · llm-infra 主轴 NET-new 预备) - ✅ inbox/jay/2026-09-01T1505-jay-five-category-afternoon-briefing.md9-1 下午场关键源 · DATABASE 3 + BACKEND 8(含 ReplaySSM + Mamba-3 + Claude 水印 + ByteByteGo Speculative)+ CLOUD-NATIVE 2 + Substack 5 + CSDN 5 + Reproduction 6 = 31 件五分类整理 · llm-infra 主轴 8 件预备 · ReplaySSM + Mamba-3 + Claude 水印 + Speculative Decoding = 8 件 NET-new 候选预备) - ✅ inbox/jay/2026-09-01-ai-engineering-backend-db-inference.md9-1 傍晚棒位本棒关键源 · GitHub Trending + 推理引擎对比 + SGLang CVE + 向量数据库 + HF Trending + SGLang CVE 安全警告 = 8 件 9-1 evening 主增量 · llm-infra 主轴 5 件预备)

inbox/tom(8 份): - ✅ inbox/tom/2026-08-31-inference-e1prep.md(8-31 evening 棒位 · llm-infra 主轴 + 邻接) - ✅ inbox/tom/2026-08-31_agents-lite.md(8 候选 4 高价值 + 1 Substack = stephen noon 棒位数据源同源) - ✅ inbox/tom/2026-09-01_rag-lite.md(9-1 09:10 RAG 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/tom/2026-09-01-rag-e1prep.md(9-1 08:52 RAG 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/tom/2026-09-01T0840-agent-rag-longcontext-radar.md(9-1 早盘 agent radar · llm-infra 主轴 0 件) - ✅ inbox/tom/2026-09-01T1440-agent-rag-longcontext-radar.md(9-1 午盘 agent radar · llm-infra 主轴 0 件) - ✅ inbox/tom/2026-09-01-evaluation-e1prep.md(9-1 15:42 evaluation 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/tom/2026-09-01-0900-hf-daily-2026-09-01.md(9-1 早盘 HF Daily · llm-infra 主轴 0 件主增量)

inbox/flyp(5 份): - ✅ inbox/flyp/2026-08-31-multimodal-e1prep.md(multimodal 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-08-31-risk-e1prep.md(risk 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-09-01-multimodal-e1prep.md(multimodal 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-09-01-risk-e1prep.md(9-1 16:38 risk 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/flyp/2026-09-01-1550-context-length-alone-hurts-critical-read.md9-1 下午场关键源 · arXiv:2510.05381 · EMNLP 2025 Findings · "长度本身即伤害因子"反完美检索公理 · recite-before-solve 4% 增益 · llm-infra 主轴邻接级"长上下文 RAG"路径预备)

inbox/stephen(5 份): - ✅ inbox/stephen/2026-08-31-llm-application-e1prep.md(8-31 21:15 llm-application 主轴 · llm-infra 邻接级 0 件) - ✅ inbox/stephen/2026-08-31-1245-stephen-coordination-check-noon.md(8-31 noon 协调棒 · 已锚入 §IX 76 morning) - ✅ inbox/stephen/2026-08-31-2245-stephen-coordination-check-evening.md(8-31 evening 协调棒 · 已锚入 §IX 76 evening) - ✅ inbox/stephen/2026-09-01-1245-coord-check.md9-1 noon 协调棒本棒关键源 · 8 大分类全覆盖 + 8 项跨实例冲突对账 + 3 项遗漏 + 9-1 evening 棒位前行动清单 = 8 项冲突对账中冲突 #2 vLLM v0.18/v0.20.0/v0.28.0 版本基线对账 + 冲突 #3 Qwen3.8-27B vs Qwen3.5-Omni/Qwen3.6-Plus = llm-infra 主轴邻接级 2 件冲突对账预备) - ✅ inbox/stephen/2026-09-01-ai-industry-e1prep.md(9-1 10:24 ai-industry 主轴 · llm-infra 主轴净增 0 件)

inbox/spark(6 份): - ✅ inbox/spark/2026-08-31-1001-rss-gradient-flow.md(5 篇 · HBF 沿用 §IX 80 morning) - ✅ inbox/spark/2026-08-31-1002-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴) - ✅ inbox/spark/2026-08-31-1004-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴) - ✅ inbox/spark/2026-09-01-1001-rss-gradient-flow.md(5 篇 · 0 件 llm-infra 主轴 NET-new) - ✅ inbox/spark/2026-09-01-1002-rss-chip-huyen.md(综述沿用 · 0 件 llm-infra 主轴) - ✅ inbox/spark/2026-09-01-1005-rss-yt-3blue1brown.md(视频 · 0 件 llm-infra 主轴)

paper_cards(8 件 · 近 3 天新卡): - ✅ paper_cards/1163-2608-30135.md Verification-Aware Training for Speculative Decoding(9-1 16:30 入库 · engineering 主分类 · 9-1 NET-new 主增量) - ✅ paper_cards/1159-2608-31139.md Configurable Semantic Chunking for Biomedical Information Extraction in RAG(9-1 16:30 入库 · rag 主分类 + 副分类 llm-infra · 9-1 NET-new 邻接级补强) - ✅ paper_cards/1157-2608-31022.md MNIST-PRO(9-1 16:30 入库 · agent 主分类) - ✅ paper_cards/1158-2608-30478.md Agents in the Large(9-1 16:30 入库 · agent 主分类) - ✅ paper_cards/1164-2608-28695.md Weaving Visual Narratives Image Bundle Composition(9-1 16:30 入库 · agent 主分类) - ✅ paper_cards/1160-2608-31137.md OntoAligner-Ensemble(9-1 16:30 入库 · risk 主分类) - ✅ paper_cards/1161-2608-31106.md DreamX-Creator(9-1 16:30 入库 · multimodal 主分类) - ✅ paper_cards/1162-2608-30241.md PaperBanana-Interact(9-1 16:30 入库 · multimodal 主分类)

organized(2 件): - ✅ organized/topic_pages/llm-infra.md(主索引) - ✅ organized/knowledge/llm-infra.md(活文档 · §IX 80 morning 已锚入全部 24h 内 llm-infra 主轴 6 件 NET-new)

已检查 / 未纳入(不重复)

  • inbox/jay/2026-09-01T1105-jay-five-category-briefing.md DATABASE 5 件(MIT CSAIL DSG + SafarDB + PLB + ExpoLab 共识论文群)= DB 主轴 · llm-infra 邻接级 0 件
  • inbox/jay/2026-09-01T1105-jay-five-category-briefing.md Cloud-Native arXiv:2604.17227 已纳入本棒预备(与 AMD Instinct MI325X + Token-Operations + LLM Serving in the Wild + INFERENCEBENCH 五栖预备)
  • inbox/jay/2026-09-01T1105-jay-five-category-briefing.md Backend FlashAttention-4 MLSys 2026 Best Paper Honorable Mention + SonicSampler COLM 2026 + LLM Serving Needs Mathematical Optimization arXiv:2605.01280 = §1.(11) Kernel/AI 自动化预备(沿用件套)
  • inbox/jay/2026-09-01T1105-jay-five-category-briefing.md Substack Future AGI LLM Evaluation Tools 2026(厂商内容 vs 学术评测方法学,已立争议,详见警示 #4)
  • inbox/jay/2026-09-01T1105-jay-five-category-briefing.md Reproduction ReplaySSM + Mamba-3 + Claude 水印 + Dify v1.16 + Orchard = 已纳入本棒预备
  • inbox/jay/2026-09-01T1505-jay-five-category-afternoon-briefing.md Backend ReplaySSM + Mamba-3 + Claude 水印(已纳入本棒增量 4)+ ByteByteGo Speculative Decoding 入门(科普性质)
  • inbox/jay/2026-09-01T1505-jay-five-category-afternoon-briefing.md CSDN Dify v1.16 + RAG 框架 5 强 + LangChain v0.x → v1.x 演进 + Tencent Hy4 Preview + Microsoft Orchard(已纳入本棒预备)
  • inbox/jay/2026-09-01-ai-engineering-backend-db-inference.md minimind 64M 参数 GPT 2 小时训练 + OpenMAIC 多 Agent + K-Dense-AI scientific-agent-skills + Osmantic ODS = 教育/Agent 工具(llm-infra 邻接级 0 件)
  • inbox/jay/2026-09-01-ai-engineering-backend-db-inference.md 向量数据库 2026 选型(pgvector / Qdrant / Pinecone / Milvus / Weaviate)+ 延迟基准 + 5M 向量成本 = §1.(10) 向量 DB 沿用件套
  • inbox/flyp/2026-09-01-1550-context-length-alone-hurts-critical-read.md arXiv:2510.05381(已纳入本棒预备作为 §1.(3) KV Cache 综述 + §1.(12) End-to-End Pipeline 邻接级"长上下文 RAG"路径预备)

七、本棒小结

8-31 18:40 → 9-1 18:40 llm-infra 主轴净增量 = 5 条主增量 + 4 件工程实践补强 + 14 件矛盾警示

§IX 81 evening 棒位 NET-new 候选预备(5 件主轴): 1. Agent Harness Survey(preprints.org 202604.0428) → §1.(12) (v) Harness Reliability + §1.(12) (vi) Agent Security(benchmark gaming + 三难困境 + Repo2Run 90% + 工具链 6 件套) 2. TokenFlow arXiv:2510.02758 抢占式调度 → §1.(2) 推理调度 + §1.(3) KV Cache 综述(FCFS + prefill 优先策略对 burst 场景的根治) 3. NeuroPrefetcher ICPP 2026 arXiv:2608.22643 → §1.(11) Kernel/AI 自动化 + §1.(3) KV Cache 算子层(Delta Prefetching + 20 个生产系统 + unified-memory 边缘硬件) 4. ReplaySSM + Mamba-3 + VAT 三栖预备 → §1.(1) 推理引擎 Speculative Decoding(Speculative 八栖预备) 5. AMD MI325X + Cloud-Native IEEE TC + Token-Operations + LLM Serving in the Wild + INFERENCEBENCH 五栖预备 → §1.(2) 推理调度 + §1.(1) 推理引擎 AMD/边缘

§IX 82 morning 棒位 NET-new 候选预备(5 件邻接级): 6. AMD Instinct MI325X 基准 arXiv:2603.10031 → §1.(1) 推理引擎 AMD/边缘 7. Cloud-Native IEEE TC 2026 arXiv:2604.17227 → §1.(2) 推理调度 + §1.(11) Kernel/AI 自动化 8. Token-Operations-Oriented arXiv:2606.20295 → §1.(1) 推理引擎 Speculative Decoding + §1.(3) KV Cache 综述 9. INFERENCEBENCH arXiv:2607.20468 → §1.(12) (v) Harness Reliability 10. Configurable Semantic Chunking for Biomedical RAG arXiv:2608.31139 → §1.(12) End-to-End Pipeline + §1.(10) 向量 DB 邻接级

工程实践补强候选预备(4 件): - vLLM v0.20.0 超深度系统级架构分析(CSDN zhonglinzhang · CSDN 521 错误) - Qwen3.8-27B 部署实战 AWQ/GPTQ 量化(weixin_29062255) - SGLang Pickle RCE CVE-2026-3059 / CVE-2026-3060 安全警告 - TensorRT-LLM CLI 废弃警告(trtllm-serve v1.0+)

§IX 81 evening 棒位预备建议:本棒 5 条主增量 + 5 件 morning 棒位预备 + 4 件工程实践补强 = §IX 81 evening 棒位(2026-09-01 evening cron · 9-1 evening 落定)预备锚入候选 5 件 + §IX 82 morning 棒位(2026-09-02 morning)预备锚入候选 5 件 + §IX 82 morning 棒位预备锚入候选 5 件 = §IX 81 evening + §IX 82 morning 棒位预备净增 10 件候选预备

与 §IX 80 morning 棒位对照: - §IX 80 morning = 9-1 11:15 棒位(SOTA 多轮深综合第 2 版替换 §0.5 综述 + 6 件 NET-new 锚入 + 4 件候选预备 + 推理工程学科化第 10 维 ≥ 105 件套扩面沿用闭合) - §IX 81 evening 棒位预备 = 本棒 5 条 evening NET-new 候选预备 + §IX 82 morning 棒位预备 = 5 件 morning NET-new + 5 件邻接级 = §IX 81 evening + §IX 82 morning 棒位预备净增 10 件候选预备

立标等级分布: - ⭐⭐⭐⭐ = 0 件(本棒性质为候选预备级,无 ⭐⭐⭐⭐ NET-new 锚入) - ⭐⭐⭐ = 5 件(Agent Harness Survey + TokenFlow + NeuroPrefetcher + ReplaySSM + Mamba-3 + VAT 五栖预备 + AMD MI325X + Cloud-Native IEEE TC + Token-Operations + LLM Serving in the Wild + INFERENCEBENCH 五栖预备)

涉及 arXiv 号净增 5 件主轴预备 + 5 件邻接级预备(10 件预备): - 主轴预备 5 件 = arXiv:2510.02758 + arXiv:2608.22643 + arXiv:2603.15569 + arXiv:2608.30135 + arXiv:2608.03036 - 邻接级 5 件 = arXiv:2603.10031 + arXiv:2604.17227 + arXiv:2606.20295 + arXiv:2607.20468 + arXiv:2608.31139 - 沿用件套 = §IX 80 morning 6 件(Oneiros + Albireo + Silent Hyperparameter + MoE CSUR 2026 + Aurora + X-MoE)+ §IX 76 morning/evening 17 件(UniBoost + RTP-LLM + OptiKIT + Apple Silicon + vLLM Configuration + vLLM Internal + KV Cache Layer + Bugs in LLM Inference + KV Cache Dell + ACL 2026 Findings + ARC + AsymCache + Lookahead + Internet for KV Cache + Online Compaction + Slasher + Prefix Sliding + ReCo + Sliding-window + FreeToken + SpecForge + AIConfigurator + C²KV + MATS Research + 沿用全套 KV Cache 66+ 路线)

警示消化预备(14 件矛盾 + 待核实说法):详见 §三


spark · 2026-09-01 18:40 · 本棒检查 60+ 来源(inbox jay 13 件 + tom 8 件 + flyp 5 件 + stephen 5 件 + spark 6 件 + paper_cards 8 件 + organized 2 件 + work-queue 1 件) · 主轴 NET-new 5 件 evening 预备 + 主轴 MEM-new 5 件 morning 预备 + 工程实践补强 4 件 + 警示消化 14 件 = 28 件预备总览 · §IX 81 evening 棒位预备净增 5 件候选预备 + §IX 82 morning 棒位预备净增 5 件候选预备