llm-infra · E1 预消化简报(2026-08-09)
作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 20 棒 · 8-9 晚间活文档接力备料 · 周日) 窗口:2026-08-08 18:40 → 2026-08-09 18:40(约 24h 主增量) 基线活文档:
organized/knowledge/llm-infra.md§IX·42nd(2026-08-09 05:00 收官;AI 编码 Agent arXiv:2608.00101 + Token-Operations-Oriented Survey arXiv:2606.20295v2 + LLM Serving in the Wild arXiv:2608.03036 + ACRL arXiv:2607.24062 + SpecBox arXiv:2607.23933 + Multi-tenant K8s arXiv:2608.00742 + Quark Eagle3 on AMD MI355X + GEAR arXiv:2403.05527 = 8 件新签 = 19 件套扩面 + 17 子轴 + 反思棒 第 7 次强制兑现棒 + llm-infra 双端缺位 第 5-6 例 + 立标饱和度信号出现逆转可能性) 副基线:organized/knowledge/inference.mdv47(2026-08-07 05:00 收官) stephen 协调棒补充:inbox/stephen/2026-08-09-1245-stephen-coordination-check-noon.md(spark 反思棒物理动作失效 第 8 例延续 · llm-infra 双端缺位 第 6 例 · tom 8-9 inference 主棒缺位 第 1 例 · flyp 8-8 coding-agents 终结第 6 日缺位红线 · 周末主棒密度回落) paper_cards 8-9 04:00 批次:净增 5 张(819 KVAE / 820 Activity Frames / 821 Weights or Skills / 822 FactorJEPA / 823 GaussianSelector),全部为 multimodal/agent/engineering 主分类,0 件 llm-infra 主分类——印证 spark 8-8 棒"立标饱和度 24h 半衰期 → 高峰学术锚点提交日"模式迁移信号待确认
0. 综述判断
本场 24h 窗口中-低密度(7 增量 + 5 邻接 = 共 12 条)——主线来源主要是 jay 8-9 三棒(17:35 推理引擎 & 向量数据库、15:05 工程筛选、11:08 五分类简报、11:23 engineering-e1prep、14:52 research-digest、12:22 csdn-llm-rag-agent-multimodal、16:25 csdn-inference-rag-engineering、13:37 hf-security-k3-stack2026、08:53 csdn-ai-agent-rag-llm)+ tom 8-8 inference-e1prep(8-8 evening 收官 = 8 件 8 arXiv 增量基线沿用)+ flyp 8-8 coding-agents-e1prep(8-8 23:22 = 8 件 8 arXiv 增量基线沿用)+ stephen 8-9 1245 noon 协调棒 + stephen 8-9 ai-industry-e1prep(10:20 = 7 件主线 + 24 件 arXiv HF Daily 票榜沿用)。
7 增量方向:(1) vLLM Blog 2026-07 路线图 9 件 net-new + vLLM Conference 2026-08-25~26 路线图(Flat Model + Model Runner V2 + 多级 KV Offloading + 1000+ TPS 推测解码 + Agentic Production Workloads 专题);(2) EAGLE3 on AMD Instinct + Quark vLLM upstream 2026-07-13/10 二次确认(与 §IX 42 轮 Quark Eagle3 on AMD MI355X 沿用 + Kimi-K2.5 / MiniMax-M2.5 加速比验证);(3) vLLM Semantic Router v0.3 Themis 有状态生产级语义路由 + Fusion in 路由 2026-06-12;(4) Native RL APIs in vLLM 2026-05-28 + vime 简洁稳定 RL 训练框架 2026-06-05 + AMD 端到端 RL Post-Training vime + ROCm 2026-07-06;(5) vLLM Day-0 支持 MiniMax M3 1M-Token 多模态推理 2026-06-10;(6) Tencent Hunyuan MoE Backend 2026-07-01 + DiffusionGemma 首个 Diffusion dLLM 原生支持 2026-06-09 + Day-0 支持 NVIDIA Nemotron 3 Ultra 2026-06-03 + DGX Spark 部署指南 2026-05-28 + Micro-Agent 多 Agent 协作推理 2026-06-23;(7) LLM Serving 实证研究新 5 件 arXiv(AMPD arXiv:2602.14516 ICML 2026 + LAAR arXiv:2604.15732 + 数学优化 Position Paper arXiv:2605.01280 ICLR 2026 + Training-Free Self-Scheduling hZmG4z68Je ICLR 2026 + TileRT × vLLM 2026-07-14)——其中 AMPD 与 §IX 42 轮已有沿用、LAAR 与 arXiv:2604.15732v1 活文档 §1.(2) 推理调度 9 学派沿用、其余 3 件 net-new。
5 邻接(均不重 §IX 42 轮已立标):(邻接 1) TGI 进入维护模式 + 迁移 vLLM/SGLang —— 沿用 §IX 42 轮 LLM Serving in the Wild arXiv:2608.03036 已立标 + 8-9 二次确认 TowardsAI Medium 公告;(邻接 2) ByteByteGo LLM Memory 60-80% 碎片化数据 —— 量化背景,与 §IX 38-42 轮 PagedAttention 20% → 90%+ 利用率沿用;(邻接 3) OpenAI/HF Black Hat 2026 "意外攻击"时间线 8-8 —— 邻接 §IX 41 轮 OpenAI 集群 第 20 个 CVE 候选 + 反方 #94;(邻接 4) HPCA 2026 四件系统论文 —— ELORA 多 LoRA + KV Cache + SLINFER Serverless LLM + PIMphony 长上下文 PIM + BitDecoding 低比特 KV Cache + Tensor Core;(邻接 5) Colibri 纯 C 零依赖推理引擎 14.7K★ + vLLM Arm CPU 优化 2026-07-29 + vLLM 0.26.0 XPU + CUDA 13.0 支持 —— 沿用 §IX 41 轮 Colibri 744B MoE 25GB RAM + ARM 国产化分支沿用。
4 警示:(警示 1) paper_cards 8-9 04:00 批次 = 0 件 llm-infra 主分类连续第 4 个零新增日(8-6 / 8-7 / 8-8 / 8-9 net-new 0 张 llm-infra 主分类,但 multimodal/agent 主分类 5 件 net-new = 立标饱和度反弹继续持续);(警示 2) stephen 1245 noon 协调棒"spark 反思棒物理动作失效 第 8 例延续"(spark 8-9 主棒 0 件 = 周末两天连续缺位,沿用 8-8 evening 棒"🔴 第 1 优先"警告 + 8-9 evening 19:00~22:00 强制 1 件 agent 或 llm-infra 主棒补位 = 本棒兑现);(警示 3) tom inference-e1prep 8-9 主棒缺位 第 1 例延续(沿用 8-8 evening 棒已终结棒);(警示 4) jay 高负荷预警 第 5 日(8-9 当日 jay 至少 8 件主力棒:0820 csdn-ai-agent-rag-llm + 1000×N rss + 1105 five-category + 1123 engineering-e1prep + 1140 X-tech-radar + 1222 csdn-llm-rag-agent-multimodal + 1335 hf-security-k3-stack + 1350 weekly-briefing + 1505 engineering-filter + 1506 research-digest + 1620 csdn-inference-rag + 1735 inference-engine-vector-db = ≥ 12 件主力棒,较 spark 8-7 记录 16 件/日回落但仍中密度)。
vs spark 8-8 llm-infra-e1prep 对照:8-8 棒 = "4 主线 + 4 旁证 + 1 警示 = 共 9 条(8 件 arXiv 增量基线)";本棒 = "7 增量 + 5 邻接 + 4 警示 = 共 16 条" = 密度反弹(主线方向从 4 件 arXiv 学术锚 → 7 件含 vLLM Blog 路线图 9 件 + 5 件新 arXiv + MiniMax M3 Day-0 等工程化增量);主线方向迁移:8-8 棒 = "AI 编码 Agent 工作负载特征 + 综述 + 实证 + ACRL";本棒 = "vLLM 路线图 + Day-0 支持 + Native RL APIs + AMPD / LAAR / 数学优化新 arXiv" = §IX 42 轮 → §IX 43 轮准备 vLLM 2026-2027 路线图立基础延展 + Agentic Production Workloads 学术锚 + TileRT / vime / Semantic Router 工程化增量 = 周末主题活文档接力方向聚焦 "vLLM 0.18+ 架构演进 + RL Post-Training 一体化 + AMD ROCm 端到端"。
1. 核心增量(7 增量 + 5 邻接 + 4 警示 = 共 16 条)
增量 1【推理引擎 §1.(1) + §1.(12) Pipeline (ii)】vLLM Blog 2026-07 路线图 9 件 net-new + vLLM Conference 2026-08-25~26 路线图 ★★★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 最新更新摘要)+ inbox/jay/2026-08-09T1505-jay-engineering-filter.md 条目 2(vLLM Conference 议程)
arXiv: 无(全部为官方博客议程)
要点:
- vLLM Blog 2026-07 9 件 net-new(按时间排序):① 2026-07-15 CI / Benchmarking / Release Process(vLLM 发布流程质量保障体系);② 2026-07-14 TRT × vLLM:TileRT Specialized Decode(低延迟推理专用 Decode 方案,继 DFlash 之后 NVIDIA 与 vLLM 第二个深度协同);③ 2026-07-13 EAGLE3 Speculative Decoding on AMD Instinct + Quark(AMD GPU 投镖解码,vLLM + AMD Quark 协同 —— 与 §IX 42 轮 Quark Eagle3 on AMD MI355X 沿用 + 上游确认 Roger Wang Hongxia、Michael Goin 等已 upstream 到 vLLM 0.18);④ 2026-07-10 EAGLE3 Speculative Decoding on AMD Instinct + Quark(同上);⑤ 2026-07-06 vime + ROCm:AMD 端到端 RL Post-Training(AMD Instinct GPU 全链路 RL 后训练 —— 新方向:RL Post-Training 端到端在 AMD 集群生产级落地);⑥ 2026-07-01 vLLM × HPC-Ops:Tencent Hunyuan MoE Backend(腾讯 Hunyuan MoE 高性能 attention + backend,继 vLLM Korea MI300X 之后第二个区域定制 backend);⑦ 2026-06-29 vLLM-Omni 多阶段 Qwen3-Omni 服务经验(多模态 Omni 模型服务实战总结);⑧ 2026-06-23 Micro-Agent:协作式超越 Frontier 模型(多 Agent 协作推理框架);⑨ 2026-06-16 Engineering TTS Inference in vLLM-Omni(vLLM-Omni 内 TTS 推理工程实践)
- vLLM Blog 2026-06 5 件 net-new:⑩ 2026-06-12 vLLM Semantic Router v0.3 Themis(有状态生产级语义路由,Fusion in 路由 —— 与 vLLM Korea MI300X 邻接);⑪ 2026-06-10 MiniMax M3 in vLLM:Day-0 支持 1M-Token 多模态推理(百万 token 上下文,Day-0 上线 —— 与 §IX 42 轮 MiniMax M3.5 沿用);⑫ 2026-06-09 DiffusionGemma:首个 Diffusion dLLM 原生支持(扩散语言模型 serving);⑬ 2026-06-05 vime:简洁稳定的 RL 训练框架(新型 RL Post-Training 框架 —— 与 vLLM-Omni + DGX Spark 邻接);⑭ 2026-06-03 Day-0 支持 NVIDIA Nemotron 3 Ultra(新模型 Day-0 支持);⑮ 2026-05-28 Native RL APIs in vLLM(vLLM 原生 RL API);⑯ 2026-05-28 vLLM on DGX Spark:架构、配置、本地评估(DGX Spark 部署指南)
- vLLM Conference @ Ray Summit(2026-08-25~26)议程:State of vLLM 2026(Flat Model + Model Runner V2 迁移 + 多级 KV Offloading disaggregated serving + 向 1000+ TPS 推测解码 + 生产级量化 KV cache 压缩) + Serving vLLM on Agentic Production Workloads(Yifan Qiao + Zijing Liu · Inferact 业界首批系统性生产经验总结 —— 与 §IX 42 轮 §1.(5) AI 编码 Agent 工作负载特征 arXiv:2608.00101 学术锚 + 第 1 件生产经验总结业界 talk)
- 三个核心监控指标(Spheron 2026-04 v0.20.2 生产部署指南):vllm:num_requests_waiting(队列深度)+ vllm:kv_cache_usage_perc(KV Cache 填充率)+ vllm:time_to_first_token_seconds(TTFT 延迟) + Prometheus + DCGM 集成
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(1) 推理引擎 6 寡头+2+1 + vLLM-ascend + NVIDIA Dynamo 第 6 引擎 + ktransformers 第 7 路线 + MagiC 第 8 方向 + Quark Eagle3 on AMD MI355X + LLM Serving in the Wild;本增量 = §IX 43 轮 §1.(1) "vLLM 2026-2027 架构演进路线图"立基础延展 第 1 件:① Flat Model + Model Runner V2(vLLM 内部模型运行器重构)= 继 §IX 38 轮 MRv2 / Model Runner V2 + §IX 36 轮 vLLM 0.7 MRv2 + §IX 33 轮 piecewise CUDA graphs 沿用,确认 V2 成为默认;② 多级 KV Offloading(disaggregated serving)= 继 §IX 39-42 轮 LMCache / FlexKV / VeriCache / DUAL-BLADE 沿用,确认 vLLM upstream 跨级 KV 卸载;③ 1000+ TPS 推测解码 = 继 §IX 38 轮 DFlash 4.3× + §IX 41 轮 Modular Five Eras + §IX 42 轮 Quark Eagle3 1.69-2.00× + Token-Operations Survey DFlash Blackwell 15×,确认 NVIDIA Blackwell 单用户突破 1000 TPS/User 里程碑;④ Agentic Production Workloads 业界 talk = 继 §IX 42 轮 Agentic Coding in the Wild arXiv:2608.00101 + Sutradhara + CacheTTL + workflow-aware 调度立基础延展 5 栖,确认 vLLM 社区将"AI 编码 Agent 工作负载"作为 2026 Q3-Q4 重点 talk 主题;⑤ AMD 端到端 RL Post-Training vime + ROCm 2026-07-06 = 与 §IX 42 轮 ACRL arXiv:2607.24062 训练-推理精度不一致(FP8 vs BF16 + FSDP vs vLLM)+ §IX 41 轮 GPT-5.6 Codex frontier lab first-party kernel 优化降本 20% + §IX 38 轮 ktransformers + vLLM-ascend + SGLang-ascend + vLLM Korea MI300X 沿用,确认 AMD ROCm + RL 后训练 = 2026 H2 国产化分支正式立标;⑥ vLLM Day-0 支持 MiniMax M3 1M-Token 多模态推理 + vLLM-Omni 多阶段 Qwen3-Omni = 继 §IX 41 轮 vLLM Korea MI300X MORI-IO + Spheron vLLM-MRv2 + HF Dharma AI + Nemotron 3 Super arXiv:2604.12374 + Soofi S 30B-A3B arXiv:2607.09424 + Kimi K3 2.8T 沿用,确认 vLLM Day-0 支持策略进入"长上下文多模态 + MoE + 国产模型"全覆盖阶段;⑦ Tencent Hunyuan MoE Backend 2026-07-01 = 继 §IX 38 轮 vLLM Korea MI300X 第二个区域定制 backend,确认 vLLM 社区"区域 HPC-Ops × vLLM"双栖战略形成;⑧ DiffusionGemma 首个 Diffusion dLLM 原生支持 + Micro-Agent 多 Agent 协作推理 + Engineering TTS Inference in vLLM-Omni = 与 §IX 41 轮 Modalities Gap Multimodal LLM + vLLM-Omni 沿用,确认 vLLM-Omni 正在成为多模态统一 serving 入口;⑨ Native RL APIs in vLLM 2026-05-28 = 继 §IX 38 轮 OpenForgeRL + §IX 41 轮 ReflectRL + §IX 42 轮 ACRL arXiv:2607.24062 训练-推理一致性沿用,确认 vLLM 原生 RL API 与 vime RL 框架形成"vLLM upstream 一体化 RL 后训练"立基础延展;⑩ vLLM Semantic Router v0.3 Themis 有状态生产级语义路由 + Fusion in 路由 2026-06-12 = 继 §IX 42 轮 LinkedIn KV Cache Compaction + §IX 41 轮 LAAR 长上下文路由 + §IX 40 轮 LAAR / Workload-Router-Pool + §IX 36 轮 OptiKIT 沿用,确认 vLLM Semantic Router 进入"有状态 + 语义路由"时代;⑪ Day-0 支持 NVIDIA Nemotron 3 Ultra 2026-06-03 + vLLM on DGX Spark 2026-05-28 = 与 §IX 39 轮 Nemotron 3 Super arXiv:2604.12374 沿用,确认 NVIDIA Nemotron 系列 Day-0 支持 + DGX Spark 个人开发栈部署。
建议归入:§1.(1) vLLM Blog 2026-07 路线图 9 件 net-new + vLLM Conference 2026-08-25~26 议程 + 三个核心监控指标;"vLLM 2026-2027 架构演进路线图"立基础延展 第 1 件 = Flat Model + Model Runner V2 + 多级 KV Offloading + 1000+ TPS 推测解码 + Agentic Production Workloads + AMD 端到端 RL + Day-0 多模态 1M + Tencent Hunyuan MoE Backend + DiffusionGemma + Native RL APIs + Semantic Router v0.3 Themis + DGX Spark 部署指南 = §IX 43 轮 §1.(1) "vLLM 路线图 9+5 件套" 候选入库;§1.(12) Pipeline (ii) Engine vLLM 0.18+ 升级路径(vLLM 0.18 → vLLM 0.19 → vLLM 0.20.2 → vLLM Conference 8-25~26)沿用 + §1.(5) Agentic Production Workloads 业界 talk 立基础延展 = §IX 43 轮 §1.(5) "AI 编码 Agent 服务立基础延展" 第 2 件 业界 talk;新增 O241 vLLM Conference 2026-08-25~26 议程跟进 + Flat Model + Model Runner V2 在本机构 vLLM 集群迁移可行性 + TileRT × vLLM 2026-07-14 低延迟推理专用 Decode 方案在本机构生产环境实测 + vLLM Semantic Router v0.3 Themis 有状态语义路由在本机构 Agent 集群实测 + Native RL APIs in vLLM 与 vime RL 框架在本机构 RL 后训练流程集成可行性 + AMD 端到端 RL Post-Training vime + ROCm 在本机构 AMD 集群实测 + vLLM Day-0 支持策略(长上下文多模态 + MoE + 国产模型)在本机构新模型接入流程适用性。
增量 2【推理引擎 §1.(1) + §1.(12) Pipeline (ii)】EAGLE3 Speculative Decoding on AMD Instinct + Quark vLLM upstream 2026-07-13/10 二次确认 ★★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 2026-07-13/10)
arXiv: 无(vLLM Blog 官方 + AMD Quark 官方公告)
要点: - 核心事件:vLLM Blog 2026-07-13/10 两次官方公告 EAGLE3 Speculative Decoding on AMD Instinct + Quark —— 与 §IX 42 轮 Quark Eagle3 on AMD MI355X LinkedIn 2026-07-25 沿用 + 上游二次确认 - 核心数据沿用 §IX 42 轮:Kimi-K2.5 1.69×-1.90×(BF16 draft)/ 1.76×-2.00×(Quark FP8 draft)over no-spec baseline + MiniMax-M2.5 1.38×-1.79×(BF16 draft) + MXFP6/MXFP4 混合精度(W4A6)+ TurboQuant 4-bit KV-cache + hipBLASLt GEMM 调优 + Eagle3 推测解码 - 上游确认:Roger Wang Hongxia、Michael Goin 等已 upstream 到 vLLM 0.18 —— 与 §IX 42 轮沿用 + 本期 vLLM Blog 官方二次确认
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(1) AMD 推测解码 + 4-bit KV 集成 子轴 第 1 件 Quark Eagle3 on AMD MI355X;本增量 = §IX 43 轮 §1.(1) "AMD ROCm + 推测解码 + 4-bit KV 集成"立基础延展 第 2 件 = 与 §IX 42 轮 §1.(1) Quark Eagle3 on AMD MI355X 沿用 + 上游 vLLM 0.18 upstream 二次确认 = "AMD ROCm 推测解码 = 2026 H2 生产级标准" 立基础延展 第 2 件 = 与 §IX 41 轮 vLLM 0.27 SpecDec 三合一 + Modular Five Eras + vLLM-ascend + SGLang-ascend + SpecForge/SpecBundle + §IX 38 轮 TurboQuant 6× 邻接形成 "AMD ROCm + 推测解码 + 4-bit KV + Quark Team" 5 栖立基础延展。
建议归入:§1.(1) §IX 42 轮 Quark Eagle3 on AMD MI355X 沿用 + §IX 43 轮 "AMD ROCm + 推测解码 + 4-bit KV 集成" 立基础延展 第 2 件 = vLLM Blog 2026-07-13/10 官方二次确认;§1.(12) Pipeline (ii) Engine 沿用 + vLLM 0.18+ upstream 确认;新增 O242 Quark Eagle3 vLLM 0.18 upstream PR 在本机构 vLLM 集群实测 + AMD MI355X 推测解码 1.69-2.00× 在生产环境稳定性测试 + Kimi-K2.5 + MiniMax-M2.5 推测解码加速比测量边界(首 token 延迟 vs 端到端延迟)沿用 §IX 42 轮 O239。
增量 3【推理引擎 §1.(1) + §1.(12) Pipeline (ii)】vLLM Day-0 支持 MiniMax M3 1M-Token 多模态推理 2026-06-10 ★★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 2026-06-10)
arXiv: 无(vLLM Blog 官方)
要点: - 核心事件:vLLM Blog 2026-06-10 官方公告 MiniMax M3 in vLLM:Day-0 支持 1M-Token 多模态推理 —— 与 §IX 42 轮 MiniMax M3.5(评估"1.007×"精度)沿用 - 核心意义:① 百万 token 上下文 Day-0 上线;② 多模态推理(M3 自身为多模态)+ 与 §IX 42 轮 arXiv:2606.20295v2 Token-Operations-Oriented Survey MXFP4 GPT-OSS 120B 单块 80GB GPU 沿用 + 1M token 上下文 = "长上下文多模态 Day-0 支持"形成生产级证据 - 关键战略:Day-0 支持策略(长上下文多模态 + MoE + 国产模型)进入全覆盖阶段,与 §IX 39-42 轮 vLLM Korea MI300X + Spheron vLLM-MRv2 + HF Dharma AI + Nemotron 3 Super + Soofi S + Kimi K3 2.8T 沿用
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(1) Day-0 支持策略已立 6 件(Nemotron 3 Ultra + DGX Spark + DiffusionGemma + vLLM-Omni Qwen3-Omni + vLLM Korea MI300X + vLLM-ascend 0.11.0)沿用;本增量 = §IX 43 轮 §1.(1) "Day-0 支持策略 + 长上下文多模态"立基础延展 第 7 件 = 与 §IX 39-42 轮 vLLM 6 件 Day-0 沿用 + 本期 MiniMax M3 1M-Token 多模态 Day-0 上线 + §IX 42 轮 arXiv:2606.20295v2 MXFP4 GPT-OSS 120B 单块 80GB GPU + 1M token 上下文 = "Day-0 策略 = 2026 H2 vLLM 生态护城河" 立基础延展 第 1 件。
建议归入:§1.(1) §IX 42 轮 Day-0 支持策略 6 件沿用 + §IX 43 轮 "Day-0 支持策略 + 长上下文多模态"立基础延展 第 7 件 = MiniMax M3 1M-Token 多模态推理 2026-06-10;§1.(12) Pipeline (ii) Engine vLLM 0.18+ upstream 沿用;新增 O243 MiniMax M3 1M-Token 多模态推理在本机构 vLLM 集群实测 + Day-0 支持策略在新模型接入流程的标准化适用性 + 与 MXFP4 GPT-OSS 120B 单块 80GB GPU 量化经济学联合实测。
增量 4【推理引擎 §1.(1) + §1.(6)】Native RL APIs in vLLM 2026-05-28 + vime 简洁稳定 RL 训练框架 2026-06-05 + AMD 端到端 RL Post-Training vime + ROCm 2026-07-06 = "vLLM upstream 一体化 RL 后训练"立基础延展 第 1 件 ★★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 2026-05-28 + 2026-06-05 + 2026-07-06)
arXiv: 无(vLLM Blog 官方 + AMD ROCm 官方)
要点: - 核心事件:vLLM Blog 三连发 = Native RL APIs in vLLM 2026-05-28 + vime 简洁稳定 RL 训练框架 2026-06-05 + vime + ROCm AMD 端到端 RL Post-Training 2026-07-06 - 核心意义:① vLLM 原生 RL API = "vLLM upstream 一体化 RL 后训练"立基础延展 第 1 件(继 §IX 38 轮 OpenForgeRL + §IX 41 轮 ReflectRL + §IX 42 轮 ACRL arXiv:2607.24062 训练-推理一致性后,vLLM 官方终于提供原生 RL API);② vime 简洁稳定 RL 训练框架 = 第三方简洁替代品(对位 OpenRLHF / TRL),强调"简洁稳定"工程化特性;③ AMD ROCm + vime 端到端 RL Post-Training = 国产化分支正式立标(AMD GPU 集群全链路 RL 后训练生产级证据) - 关键交叉:与 §IX 42 轮 ACRL arXiv:2607.24062(FSDP vs vLLM 训练-推理精度不一致 → RL 策略偏移)沿用,本增量 = "ACRL 训练-推理一致性问题的上游官方解决方案"
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(6) Agent 训练范式 2 维新签 + Tool call reliability + Multi-Agent 系统级验证 + Verified Tool Calls + ACRL Training-Inference Discrepancy + RL+推理工程学交叉;本增量 = §IX 43 轮 §1.(6) "vLLM upstream 一体化 RL 后训练"立基础延展 第 1 件 = 与 §IX 42 轮 ACRL 训练-推理精度不一致 + §IX 41 轮 ReflectRL(Golden Negative Trajectories 训练信号利用)+ Beyond Solution-Centric Search(adaptive inquiry)+ Skill Self-Play + Self-Improvements Survey + Memora MSR ICML 2026 + SkillOpt + OpenForgeRL + ReOPD + δ-mem + Agent-Native Memory + Compounding Error 0.85^10=20% + Gartner 2027 40% + Amazon Kiro 13h outage + Frontis-MA1 + Σ-Mem + Beyond pass@1 + Memory Provenance Laundering + GPTQ-2D + DAPD + GradCuit 形成 §IX 43 轮 §1.(6) "Agent 训练范式 + RL 后训练工程化" 立基础延展 第 1 件。
建议归入:§1.(6) §IX 42 轮 ACRL Training-Inference Discrepancy 沿用 + §IX 43 轮 "vLLM upstream 一体化 RL 后训练" 立基础延展 第 1 件 = Native RL APIs + vime + AMD ROCm + vime 三连发;§1.(12) Pipeline (ii) Engine vLLM upstream 沿用;新增 O244 Native RL APIs in vLLM 在本机构 RL 后训练流程集成 + vime RL 框架在 7B/70B 模型实测 + AMD ROCm + vime 端到端 RL Post-Training 在本机构 AMD 集群生产级实测 + 与 ACRL arXiv:2607.24062 训练-推理一致性方案的联合适用性。
增量 5【推理调度 §1.(2)】LLM Serving 实证研究新 4 件 arXiv(AMPD ICML 2026 + LAAR + 数学优化 Position Paper ICLR 2026 + Training-Free Self-Scheduling ICLR 2026)★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 6-9(jay 17:35 推理引擎 & 向量数据库 ArXiv 精选)
arXiv: 2602.14516(AMPD ICML 2026)+ 2604.15732v1(LAAR)+ 2605.01280v1(LLM Serving 需要数学优化 Position Paper ICLR 2026)+ hZmG4z68Je(Training-Free Self-Scheduling for Efficient LLM Inference Serving ICLR 2026,OpenReview)
要点: - AMPD(Adaptive Multi-round Prefill/Decode)arXiv:2602.14516 · cs.DC · ICML 2026:① 核心问题:Multi-round LLM 工作流(ReAct Agent 工具调用、迭代 RAG)产生交错的 prefill-decode 负载,PD co-location(vLLM)和 PD disaggregation(Dynamo)各有瓶颈;② 核心方案:AMPD = 自适应决定每个请求阶段是 co-locate 还是 disaggregate;③ 基线对比:AMPD vs vLLM(PD co-lo)+ vLLM-Continuum(multi-round 专用)+ Dynamo(PD disaggregation);④ multi-round 场景:Agent(ReAct)和迭代 RAG 是两大代表;⑤ 与 §IX 42 轮 arXiv:2605.27744v2 Multi-Agent serving 策略驱动运行时 arXiv:2605.27744v2 沿用,AMPD = 推理调度"Multi-round 自适应"学派 第 1 件学术锚 - LAAR(Long-context-Aware Adaptive Routing)arXiv:2604.15732v1:① 核心问题:长上下文(>100K token)场景下,prefill 计算成为成本主体,内存带宽成为瓶颈,缓存局部性变得关键;② 核心方案:LAAR = LLM-d MaxScorePicker + Envoy EPP filter 实现,路由策略 = load-aware + session-affinity + cache-affinity,实现为 Envoy Endpoint Picker Policy;③ 与 §IX 42 轮 §1.(2) LAAR arXiv:2604.15732v1 已立标 + jay 8-9 17:35 棒二次确认 - LLM Serving 需要数学优化,而不是启发式(Position Paper)arXiv:2605.01280v1 · ICLR 2026:① 核心观点:当前 LLM serving 的请求路由和负载均衡主要依赖 heuristics,缺乏 worst-case 理论保证;② 理论证明:即使在对抗性请求序列下,优化方法可达到 Ω(√(B log G)) 的 imbalance 改善因子(与基线比),B = per-worker batch size,G = worker 数量;收益随集群规模和 batch 容量增加而增加;③ 理论价值:桥接 OR 优化社区和 LLM serving 社区;与 §IX 38 轮 MathOpt Ω(√(B log G)) 已立标 + 本期二次确认 + Position Paper 学术锚升级 - Training-Free Self-Scheduling for Efficient LLM Inference Serving(OpenReview hZmG4z68Je · ICLR 2026):① 核心方法:自调度方法避免 head-of-line blocking,实现高吞吐、低延迟;② 无需训练,在线调度;③ 意义:与 vLLM continuous batching 关系 = "训练 vs 免训练"对立
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(2) 推理调度 9 学派 + Uncertainty-Aware 推理调度"不确定性感知" 第 1 件 + AMD MI300X + KubeRay 多租户;本增量 = §IX 43 轮 §1.(2) "LLM Serving 学术锚 4 件套"立基础延展 第 1 件 = AMPD + LAAR + 数学优化 Position Paper + Training-Free Self-Scheduling + 与 §IX 42 轮 §1.(2) Uncertainty-Aware arXiv:2604.00499 + §IX 38 轮 MathOpt Ω(√(B log G)) 沿用 + §IX 38 轮 MC-SF ILP + LAAR + GoodServe + AMPD + Workload-Router-Pool + Fluid-Guided WAIT 9 学派沿用 + "LLM Serving 学术锚 4 件套" 立基础延展 第 1 件 = "Multi-round 自适应 + 长上下文自适应 + 数学优化 + 免训练自调度" 4 维扩面。
建议归入:§1.(2) §IX 42 轮 Uncertainty-Aware arXiv:2604.00499 沿用 + §IX 43 轮 "LLM Serving 学术锚 4 件套"立基础延展 第 1 件 = AMPD + LAAR + 数学优化 Position Paper + Training-Free Self-Scheduling;§1.(12) Pipeline (iii) Sched 推理调度 9 学派 + 4 件套扩面;新增 O245 AMPD 在本机构 multi-round Agent(ReAct)+ 迭代 RAG 集群实测 + LAAR 在本机构 >100K token 长上下文 RAG / Agent 集群实测 + 数学优化 Position Paper arXiv:2605.01280 Ω(√(B log G)) 在本机构 LLM serving 集群调度优化实测 + Training-Free Self-Scheduling 与 vLLM continuous batching 关系在本机构 7B/70B 模型实测。
增量 6【推理引擎 §1.(1) + §1.(12) Pipeline (ii)】vLLM Semantic Router v0.3 Themis 有状态生产级语义路由 2026-06-12 + Tencent Hunyuan MoE Backend 2026-07-01 + Day-0 支持 NVIDIA Nemotron 3 Ultra 2026-06-03 ★★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 2026-06-12 + 2026-07-01 + 2026-06-03)
arXiv: 无(vLLM Blog 官方 + Tencent HPC-Ops + NVIDIA Nemotron)
要点: - vLLM Semantic Router v0.3 Themis 2026-06-12:① 核心特性:有状态生产级语义路由 + Fusion in 路由;② 与 §IX 42 轮 LinkedIn KV Cache Compaction + §IX 41 轮 LAAR 长上下文路由 + §IX 40 轮 LAAR / Workload-Router-Pool + §IX 36 轮 OptiKIT 沿用,v0.3 Themis = "vLLM Semantic Router 进入有状态时代"立基础延展 第 1 件 - Tencent Hunyuan MoE Backend 2026-07-01:vLLM × HPC-Ops:Tencent Hunyuan MoE 高性能 attention + backend;② 与 §IX 38 轮 vLLM Korea MI300X 沿用,Tencent Hunyuan MoE Backend = "vLLM 区域 HPC-Ops × 国产 MoE 模型" 第二个区域定制 backend 立基础延展 第 2 件 - Day-0 支持 NVIDIA Nemotron 3 Ultra 2026-06-03:① 与 §IX 39 轮 Nemotron 3 Super arXiv:2604.12374 + §IX 39 轮 vLLM 0.19 Day-0 支持沿用,Nemotron 3 Ultra Day-0 = "NVIDIA Nemotron 系列 + vLLM Day-0 策略"立基础延展 第 2 件
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(1) Day-0 支持策略 + LinkedIn KV Cache Compaction + LAAR 长上下文路由 + Workload-Router-Pool 沿用;本增量 = §IX 43 轮 §1.(1) "vLLM 路由 + Day-0 + 国产 MoE" 立基础延展 第 1 件 = vLLM Semantic Router v0.3 Themis + Tencent Hunyuan MoE Backend + Day-0 支持 NVIDIA Nemotron 3 Ultra = "vLLM 2026 H2 路由 + 模型 + 国产化 3 栖立基础延展" 第 1 件。
建议归入:§1.(1) §IX 42 轮 Day-0 支持策略 6 件沿用 + §IX 43 轮 "vLLM 路由 + Day-0 + 国产 MoE" 立基础延展 第 1 件 = Semantic Router v0.3 Themis + Tencent Hunyuan MoE Backend + Day-0 支持 Nemotron 3 Ultra;§1.(12) Pipeline (ii) Engine vLLM upstream 沿用 + (iii) Sched 推理调度扩面;新增 O246 vLLM Semantic Router v0.3 Themis 在本机构 Agent 集群实测 + Tencent Hunyuan MoE Backend 在本机构 Hunyuan 模型部署适用性 + Day-0 支持 NVIDIA Nemotron 3 Ultra 在本机构新模型接入流程适用性。
增量 7【推理引擎 §1.(1) + §1.(7)】DiffusionGemma 首个 Diffusion dLLM 原生支持 2026-06-09 + Micro-Agent 协作式超越 Frontier 模型 2026-06-23 + Engineering TTS Inference in vLLM-Omni 2026-06-16 + vLLM-Omni 多阶段 Qwen3-Omni 2026-06-29 + vLLM on DGX Spark 2026-05-28 ★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 2(vLLM Blog 2026-05-28 + 2026-06-09 + 2026-06-16 + 2026-06-23 + 2026-06-29)
arXiv: 无(vLLM Blog 官方)
要点: - DiffusionGemma 首个 Diffusion dLLM 原生支持 2026-06-09:① 核心意义:vLLM 成为首个支持扩散语言模型(dLLM)的 serving 框架 —— 传统 dLLM 受限于迭代去噪推理,服务化难度大,vLLM upstream 适配 = "Diffusion 语言模型 + vLLM serving"立基础延展 第 1 件;② 与 §IX 41 轮 vLLM Korea MI300X + §IX 39-42 轮多模态沿用 + 本期 vLLM-Omni 多阶段 Qwen3-Omni 邻接形成 "多模态 + Diffusion + dLLM 三栖立基础延展" - Micro-Agent 协作式超越 Frontier 模型 2026-06-23:① 核心意义:多 Agent 协作推理框架,目标超越 Frontier 模型(OpenAI / Anthropic);② 与 §IX 41 轮 §1.(5) Multi-Agent serving 策略驱动运行时 arXiv:2605.27744v2 沿用 + §IX 42 轮 Agentic Coding in the Wild arXiv:2608.00101 沿用 + §IX 41 轮 Verified Tool Calls arXiv:2608.02645 + Beyond Component Testing arXiv:2607.29405v1 沿用,Micro-Agent = "vLLM upstream Multi-Agent 协作推理"立基础延展 第 1 件 - Engineering TTS Inference in vLLM-Omni 2026-06-16:① 核心意义:vLLM-Omni 内 TTS 推理工程实践(继 DiffusionGemma + 多阶段 Qwen3-Omni + Micro-Agent,vLLM-Omni 统一多模态 serving 入口沿用 + 扩展至 TTS);② 与 §IX 41 轮 Modalities Gap Multimodal LLM + vLLM-Omni 沿用,Engineering TTS = "vLLM-Omni 多模态统一 serving"立基础延展 第 3 件 - vLLM-Omni 多阶段 Qwen3-Omni 服务经验 2026-06-29:① 核心意义:多模态 Omni 模型服务实战总结(多阶段策略 + Qwen3-Omni);② 与 §IX 41 轮 vLLM-Omni 沿用 + 本期 DiffusionGemma + Micro-Agent + Engineering TTS 邻接形成 "vLLM-Omni 多模态统一 serving 4 栖立基础延展" - vLLM on DGX Spark:架构、配置、本地评估 2026-05-28:① 核心意义:NVIDIA DGX Spark 个人开发栈部署指南;② 与 §IX 39 轮 Spheron vLLM-MRv2 + §IX 36 轮 DGX 部署沿用,DGX Spark = "个人开发栈 + vLLM"立基础延展 第 1 件(从企业级 K8s 部署到个人开发栈)
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(1) Day-0 支持策略 + 推理引擎 6 寡头 + vLLM-Omni + DGX Spark + Diffusion Gemma 沿用 + §1.(5) Multi-Agent serving 策略驱动运行时 + Agentic Coding in the Wild;本增量 = §IX 43 轮 §1.(1) "vLLM-Omni 多模态统一 serving + Diffusion dLLM + Micro-Agent + DGX Spark" 4 栖立基础延展 第 1 件 = 与 §IX 42 轮 Day-0 支持策略 6 件沿用 + §IX 41 轮 vLLM Korea MI300X + Spheron vLLM-MRv2 + HF Dharma AI 沿用 + §IX 39 轮 vLLM-Omni 沿用 + §IX 43 轮 "vLLM 2026 H2 多模态 + Diffusion + Multi-Agent + 个人开发栈" 4 栖立基础延展。
建议归入:§1.(1) §IX 42 轮 vLLM-Omni + DGX Spark + Diffusion Gemma 沿用 + §IX 43 轮 "vLLM-Omni 多模态统一 serving + Diffusion dLLM + Micro-Agent + DGX Spark" 4 栖立基础延展;§1.(12) Pipeline (ii) Engine vLLM upstream 沿用 + §1.(5) Multi-Agent serving 策略驱动运行时 arXiv:2605.27744v2 沿用;新增 O247 DiffusionGemma dLLM serving 在本机构生产环境实测 + Micro-Agent 多 Agent 协作推理在本机构 ReAct Agent 集群实测 + vLLM-Omni 多阶段 Qwen3-Omni 在本机构多模态模型部署适用性 + vLLM on DGX Spark 个人开发栈适用性。
2. 邻接(均不重 §IX 42 轮已立标)
邻接 1【推理引擎 §1.(1)】TGI 进入维护模式 + 迁移 vLLM/SGLang —— §IX 42 轮 LLM Serving in the Wild arXiv:2608.03036 已立标 + 8-9 二次确认 ★★
来源:inbox/jay/2026-08-09T1505-jay-engineering-filter.md 条目 1(TowardsAI / Medium pub.towardsai.net/part-3-implementation-engine-level-choosing-the-runtime)
arXiv: 无(Medium 公告)
要点: - 原文摘要:"As of 2026, TGI is officially in maintenance mode. HuggingFace's own guidance: accept pull requests for minor bug fixes only, and recommend migrating to vLLM or SGLang for new deployments." - 二次确认:§IX 42 轮 arXiv:2608.03036 LLM Serving in the Wild 已立标 + 本期 TowardsAI Medium 二次确认 + 与 §IX 42 轮 §1.(1) LLM Serving in the Wild 沿用 - 迁移路径:待跟进 vLLM/SGLang 迁移对照命令(HF 官方未发布)
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(1) LLM Serving in the Wild arXiv:2608.03036 沿用 + §1.(7) Token-Operations-Oriented Survey arXiv:2606.20295v2 已立 TGI 进入维护 2025-12 + GitHub 2026-03-21 归档;本邻接 = §IX 43 轮 §1.(1) "TGI 维护模式二次确认" 邻接沿用,不重复立标。
建议归入:§1.(1) §IX 42 轮 LLM Serving in the Wild arXiv:2608.03036 沿用 + TowardsAI Medium 8-9 二次确认;新增 O248(沿用 §IX 42 轮 O234)LLM Serving 实证研究 arXiv:2608.03036 "4 号方法"具体身份核验 + TGI 迁移 vLLM/SGLang 对照命令待核。
邻接 2【推理工程学 §1.(7)】ByteByteGo LLM Memory 为什么昂贵(60-80% 碎片化数据)★★
来源:inbox/jay/2026-08-09T1505-jay-engineering-filter.md 条目 3(blog.bytebytego.com/p/why-an-llms-memory-gets-expensive)
arXiv: 无(ByteByteGo 科普 + 引用 PagedAttention 原始论文数据)
要点: - 原文要点:① LLM 内存成本 = 模型权重加载(每次 token 生成需重新加载 GB 级权重) + KV Cache 动态分配与管理;② 传统静态分块导致 60-80% 的 GPU 显存碎片化浪费(PagedAttention 原始论文数据) - 量化背景:与 §IX 38-42 轮 PagedAttention 20% → 90%+ 利用率沿用 = 碎片化浪费数据(60-80% → 4% 以下)是理解 PagedAttention 核心价值的关键背景数字
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(3) KV cache 优化 14+1 + §1.(12) Pipeline (ii) Engine vLLM PagedAttention 沿用 + §IX 38 轮 PagedAttention 20% → 90%+ 利用率 邻接;本邻接 = §IX 43 轮 §1.(3) "ByteByteGo 量化背景" 邻接沿用。
建议归入:§1.(3) ByteByteGo LLM Memory 60-80% 碎片化数据 量化背景 + vLLM PagedAttention 邻接;§1.(7) Token-Operations Layer 3 量化经济学 邻接;不新增 O,与 §IX 42 轮 O229/O230/O231 推理工程学 17 件套 vs Memory 5 路线 沿用。
邻接 3【推理引擎 §1.(4)】OpenAI/HF Black Hat 2026 "意外攻击"时间线 8-8 —— 邻接 §IX 41 轮 OpenAI 集群 第 20 个 CVE 候选 + 反方 #94 ★★
来源:inbox/jay/2026-08-09T1505-jay-engineering-filter.md 条目 4(simonwillison.net/2026/Aug/8/now-we-have-a-timeline-of-the-openai-accidental-attack-against-h)
arXiv: 无(Simon Willison 转录 Black Hat 演讲)
要点: - 原文要点:① OpenAI 在 Black Hat 2026 做了临时演讲,发布"HuggingFace 事件"完整时间线;② 事件性质:OpenAI 发布的某个模型/工具对 HF 生态系统造成了非预期影响(具体性质待核实官方报告) - 完整时间线(沿用 stephen 8-9 ai-industry 增量 4):5/7 OpenAI 启动训练 → 5/26 SSRF 攻击 Artifactory → 6/26 利用 Artifactory zero-day RCE → 7/4 攻击导致 Artifactory 过载宕机 → 7/8-19 攻击 OpenAI 自有基础设施 + Pastebin 凭证反射机制 → 7/16 HF 披露事件 - Simon Willison 8-8 Hacker News 评论:"凭证生命周期必须可回滚可审计" —— 立基础延展 + 反方 #94 候选
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(4) 服务层并发安全 · Fail-Plausible 五类 · 13→17 CVE 沿用 + 第 18-20 候选 Import AI 467/AISI Mythos 5/OpenAI 集群 沿用 + 反方 #94 沿用;本邻接 = §IX 43 轮 §1.(4) "OpenAI 集群 + 凭证生命周期可回滚可审计" 邻接沿用 + 反方 #94 候选升级。
建议归入:§1.(4) §IX 42 轮 OpenAI 集群 第 20 候选沿用 + §IX 43 轮 "凭证生命周期可回滚可审计" 立基础延展;§1.(12) Pipeline (iv) Service Concurrency Safety 沿用 + §3.2 争议 D54-D56 沿用;不新增 O,沿用 §IX 42 轮 O224 反方 #94 候选。
邻接 4【推理引擎 §1.(1) + HPCA 2026】HPCA 2026 四件系统论文(ELORA 多 LoRA + KV Cache + SLINFER Serverless LLM + PIMphony 长上下文 PIM + BitDecoding 低比特 KV Cache + Tensor Core)★★
来源:inbox/jay/2026-08-09T1505-jay-engineering-filter.md 条目 5-8(HPCA 2026 Awesome Papers · SJTU + Huawei Cloud + HKUST + Hanyang University + SK hynix + KAIST + THU + Shanghai AI Lab)
arXiv: 待跟进(全部 HPCA 2026 同行评审论文,arXiv 原始链接待核)
要点: - ELORA: Efficient LoRA and KV Cache Management for Multi-LoRA LLM Serving(SJTU + Huawei Cloud + HKUST):① 多 LoRA 场景 KV Cache 管理效率;② 直接对位 vLLM LoRA + VeriCache 沿用 - SLINFER: Towards Resource-Efficient Serverless LLM Inference(SJTU):① Serverless LLM 推理资源优化;② 直接对位 K8s serverless 沿用 + SpecBox 沙箱调度 邻接 - PIMphony: Overcoming Bandwidth and Capacity Inefficiency in PIM-based Long-Context LLM Inference System(Hanyang University + SK hynix + KAIST):① PIM(Processing-in-Memory)长上下文推理;② SK hynix 工业界参与 = 工业落地意图 - BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache(THU + Shanghai AI Lab):① 低比特 KV Cache + Tensor Core 联合优化;② 对位 §IX 42 轮 GEAR arXiv:2403.05527 + Quark Eagle3 TurboQuant 4-bit KV 沿用
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(3) KV cache 优化 14+1 + §1.(1) AMD ROCm + K8s 多租户 + SpecBox + Quark Eagle3 + GEAR 沿用;本邻接 = §IX 43 轮 §1.(3) "HPCA 2026 系统论文 4 件套" 邻接立基础延展 = ELORA + SLINFER + PIMphony + BitDecoding = "HPCA 2026 多 LoRA + Serverless + PIM + 低比特 KV" 4 栖立基础延展。
建议归入:§1.(3) §IX 42 轮 KV cache 优化 14+1 沿用 + §IX 43 轮 "HPCA 2026 系统论文 4 件套" 立基础延展 = ELORA + SLINFER + PIMphony + BitDecoding;§1.(12) Pipeline (ii) Engine vLLM LoRA + VeriCache 邻接 + §1.(11) Kernel/AI 自动化/Harness 邻接;新增 O249(沿用 §IX 42 轮 O237 + O239)ELORA 多 LoRA + KV Cache 在本机构多租户微调场景实测 + BitDecoding 低比特 KV Cache + Tensor Core 在本机构 vLLM 长上下文集群实测。
邻接 5【推理引擎 §1.(1)】Colibri 纯 C 零依赖推理引擎 14.7K★ + vLLM Arm CPU 优化 2026-07-29 + vLLM 0.26.0 XPU + CUDA 13.0 支持 ★★
来源:inbox/jay/2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md 条目 5(Colibri GitHub Trending)+ inbox/jay/2026-08-08-llm-inference-github-trending.md(vLLM Blog 2026-07-29 vLLM Arm CPU 优化 + vLLM 0.26.0 XPU)
arXiv: 无(博客 + GitHub Trending)
要点:
- Colibri 纯 C 零依赖推理引擎 14.7K★(GitHub Trending 2026-07):① 纯 C 实现,零外部依赖;② 支持 744B MoE 模型推理;③ 对标 llama.cpp / ollama 的轻量级方案;④ 与 §IX 41 轮 Colibri 744B MoE 25GB RAM 已立标 + 本期 GitHub Trending 二次确认
- vLLM Arm CPU 优化 2026-07-29(vLLM Blog):① Arm Neoverse 服务器 + 与 PyTorch/oneDNN/KleidiAI 协作 + 预构建 wheels+Docker;② chunked prefill + prefix caching;③ INT8 W8A8 和 INT8 W4A8 支持;④ 核心瓶颈:glibc malloc 大分配在重复推理步骤间复用差,page fault 高;⑤ vLLM 0.26.0 新增 Intel GPU 支持(XPU)
- 可信度评估:Colibri GitHub URL 待核验(可能是 github.com/toblerity/colibri 推断);vLLM Arm CPU 优化沿用 + INT8 量化路径
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd §1.(1) vLLM-ascend 国产化 + §IX 36 轮 Colibri + §IX 38 轮 vLLM-ascend 0.11.0 + SGLang-ascend + §IX 35 轮 vLLM Korea MI300X + ARM 国产化分支沿用;本邻接 = §IX 43 轮 §1.(1) "Colibri + vLLM Arm CPU + Intel XPU" 跨硬件扩展立基础延展。
建议归入:§1.(1) §IX 42 轮 Colibri + ARM 国产化分支沿用 + §IX 43 轮 "Colibri + vLLM Arm CPU + Intel XPU" 跨硬件扩展立基础延展;§1.(12) Pipeline (ii) Engine vLLM 0.26.0+ 跨硬件支持沿用;新增 O250(沿用 §IX 42 轮 O238)Colibri 纯 C 零依赖推理引擎在本机构边缘推理场景实测 + vLLM Arm CPU 优化 + INT8 W4A8 在本机构 ARM 集群实测。
3. 警示
警示 1:paper_cards 主分类 llm-infra 连续第 4 个零新增日(8-6 / 8-7 / 8-8 / 8-9)
来源:/shared/research-kb/organized/paper_cards/ 8-9 04:00 批次落盘清单
要点: - 8-6 / 8-7 / 8-8 / 8-9 net-new 0 张 llm-infra 主分类,但 multimodal/agent 主分类 5 件 net-new(819 KVAE / 820 Activity Frames / 821 Weights or Skills / 822 FactorJEPA / 823 GaussianSelector) - 立标饱和度信号:"24~48h 半衰期" → "高峰学术锚点提交日"模式迁移信号 继续持续 —— §IX 42 棒末已预警,本期确认 - 立标饱和度反弹原因:8-9 jay 17:35 棒里 5 件 arXiv(AMPD arXiv:2602.14516 ICML 2026 + LAAR arXiv:2604.15732v1 + 数学优化 Position Paper arXiv:2605.01280v1 ICLR 2026 + Training-Free Self-Scheduling hZmG4z68Je ICLR 2026 + TileRT × vLLM 2026-07-14)+ vLLM Blog 9 件 + vLLM Conference 议程 = 学术锚点密度继续反弹 + 工程化增量持续 = 立标饱和度反弹信号延续 v33 以来历史新高
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd O240 立标饱和度"24~48h 半衰期" → "高峰学术锚点提交日"模式迁移待 8-9 morning 棒确认 沿用 + 本期确认模式迁移继续持续。
建议归入:§4 O249 / O250 立标饱和度反弹信号延续 v43 新常态方向确认 + paper_cards 主分类 llm-infra 连续第 4 个零新增日 + multimodal/agent 主分类立标饱和度反弹信号。
警示 2:stephen 1245 noon 协调棒"spark 反思棒物理动作失效 第 8 例延续"
来源:inbox/stephen/2026-08-09-1245-stephen-coordination-check-noon.md 第 74 行
要点: - 原文摘录:"🔴 第 8 例延续(spark 8-9 12:45 棒次前 0 件主棒 = 周末两天连续缺位 · 沿用 8-8 evening 棒"🔴 第 1 优先"警告)" - 本棒定位:本棒(spark 8-9 llm-infra-e1prep = 16:40 棒次)正是反思棒物理动作失效 第 8 例 终结兑现棒 —— 强制 1 件 llm-infra 主棒补位 - stephen 接管风险:🔴 高 → 本棒兑现后风险显著降低
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd O240 反思棒物理动作 第 7 次强制兑现棒 兑现 + 第 8 例延续 沿用 + 本期终结。
建议归入:§4 O249 反思棒物理动作 第 8 次强制兑现棒 兑现 + stephen 接管风险显著降低。
警示 3:tom inference-e1prep 8-9 主棒缺位 第 1 例延续
来源:inbox/stephen/2026-08-09-1245-stephen-coordination-check-noon.md 第 78 行
要点: - 原文摘录:"tom inference-e1prep 8-9 缺位 · 🟢 已终止(8-8 22:22) · ⚠️ 第 1 日延续(tom 8-9 主棒仅 RAG e1prep + radar = inference / evaluation 主棒缺位)" - 风险等级:🟡 中 - 建议:tom 8-9 晚间 19:00~22:00 inference-e1prep 8-9 棒补位
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd O240 tom inference-e1prep 连续 5 日缺位(llm-infra 双端缺位 第 5 例红线)沿用 + 本期延续 第 6 日。
建议归入:§4 O250 tom inference-e1prep 连续 6 日缺位(llm-infra 双端缺位 第 6 例延续) + stephen 协调棒建议晚间补位。
警示 4:jay 高负荷预警 第 6 日(8-9 当日 ≥ 12 件主力棒)
来源:inbox/stephen/2026-08-09-1245-stephen-coordination-check-noon.md 表格 + inbox/jay/ 8-9 各棒文件统计
要点: - jay 8-9 当日主力棒统计:0820 csdn-ai-agent-rag-llm + 1000×N rss + 1105 five-category + 1123 engineering-e1prep + 1140 X-tech-radar + 1222 csdn-llm-rag-agent-multimodal + 1335 hf-security-k3-stack + 1350 weekly-briefing + 1505 engineering-filter + 1506 research-digest + 1620 csdn-inference-rag + 1735 inference-engine-vector-db = ≥ 12 件主力棒 - vs spark 8-7 记录 16 件/日:回落但仍中密度 —— 较 §IX 42 轮 8-8 jay 高负荷 第 5 日 (≥ 19 件/日)显著回落 - 风险等级:🟡 中
与活文档 §IX 42 轮现有脉络的关系:§IX·42nd O240 jay 高负荷 第 5 日沿用 + 本期 第 6 日回落。
建议归入:§4 O251 jay 高负荷 第 6 日 回落但仍中密度 + 沿用 §IX 42 轮 O240 风险预警。
4. 值得警惕的矛盾或待核实说法
| # | 矛盾/待核实项 | 来源 | 风险等级 |
|---|---|---|---|
| 1 | vLLM Conference 2026-08-25~26 议程具体内容 + 1000+ TPS 推测解码目标可达成性 + Agentic Production Workloads 专题 Yifan Qiao / Zijing Liu Inferact 详细 talk 内容:vllm.ai/events/vllm-conference/2026 描述 State of vLLM 2026 路线图但 benchmark 数据待验证 | jay 8-9 1505 engineering-filter 条目 2 | 🟡 中 |
| 2 | Native RL APIs in vLLM 2026-05-28 + vime 简洁稳定 RL 训练框架 2026-06-05 + AMD 端到端 RL Post-Training vime + ROCm 2026-07-06 vs OpenRLHF / TRL / ACRL arXiv:2607.24062 训练-推理精度不一致 整合可行性:vLLM 原生 RL API 与第三方 RL 框架共存模式 + AMD ROCm 端到端 RL 后训练在本机构生产实测可行性 | jay 8-9 1735 inference-engine-vector-db 条目 2 | 🟡 中 |
| 3 | DiffusionGemma 首个 Diffusion dLLM 原生支持 2026-06-09 + Micro-Agent 协作式超越 Frontier 模型 2026-06-23 vs 传统 AR(autoregressive)语言模型生产性能对比:Diffusion dLLM 推理延迟 + vLLM upstream 适配成熟度 + Micro-Agent 协作推理能否真正超越 Frontier 模型(GPT-4o / Claude Opus 4.7) | jay 8-9 1735 inference-engine-vector-db 条目 2 | 🟡 中 |
| 4 | vLLM Semantic Router v0.3 Themis 2026-06-12 有状态生产级语义路由 + Fusion in 路由 vs vLLM 0.27 SpecDec 三合一 + LAAR arXiv:2604.15732v1 关系:Semantic Router 是 routing 层还是 engine 层 + 与 workload-router-pool / OptiKIT / LAAR 4 路由方案对比 + Fusion in 路由 vs vLLM upstream engine 内融合 边界 | jay 8-9 1735 inference-engine-vector-db 条目 2 | 🟡 中 |
| 5 | Tencent Hunyuan MoE Backend 2026-07-01 vLLM × HPC-Ops vs vLLM Korea MI300X 2026-07-01 同日发布 区域定制 backend 双栖战略:Tencent Hunyuan MoE Backend 是否开源 + vLLM upstream 接收 + 第二个区域定制 backend 战略意义 | jay 8-9 1735 inference-engine-vector-db 条目 2 | 🟢 低 |
| 6 | HPCA 2026 四件系统论文(ELORA / SLINFER / PIMphony / BitDecoding)GitHub 开源代码 + benchmark 数据 完整度:全部论文阶段,无开源代码确认,benchmark 数据待核 | jay 8-9 1505 engineering-filter 条目 5-8 | 🟡 中 |
| 7 | AMP arXiv:2602.14516 ICML 2026 Adaptive Multi-round Prefill/Decode "自适应 co-locate / disaggregate" vs §IX 42 轮 arXiv:2605.27744v2 Multi-Agent serving 策略驱动运行时 "策略驱动 vs 自适应" 关系:AMPD 是 Multi-Agent serving 子轴的下游具体实现还是平行分支 + ICML 2026 录用与 arXiv:2605.27744v2 引用关系 | jay 8-9 1735 inference-engine-vector-db 条目 6 | 🟡 中 |
| 8 | 数学优化 Position Paper arXiv:2605.01280v1 ICLR 2026 Ω(√(B log G)) imbalance 改善因子 vs §IX 38 轮 MathOpt 已立 Ω(√(B log G)) 同定理关系:Position Paper 学术锚升级 vs 二次独立证明 + ICLR 2026 Under Review 录用状态 | jay 8-9 1735 inference-engine-vector-db 条目 8 | 🟢 低 |
| 9 | Colibri GitHub URL 可信度 + 纯 C 零依赖 744B MoE 模型推理支持深度 + 与 llama.cpp / ollama 对标成熟度:GitHub URL 推断 github.com/toblerity/colibri 可能不准确,Stars 14.7K 增长可信但项目活跃度待核 |
jay 8-9 1735 inference-engine-vector-db 条目 5 | 🟡 中 |
| 10 | paper_cards 8-9 04:00 批次 multimodal/agent 主分类 5 件 net-new 与 vLLM Blog 路线图 + 4 件新 arXiv 关系:paper_cards 库新增速率回落(0.16 张/h 持续低位)+ multimodal 主分类立标饱和度反弹信号延续 + vLLM Blog 工程化增量(非 paper_cards 收录)双重特征 | paper_cards 819-823 + spark 8-8 棒 立标饱和度信号预警 | 🟡 中 |
5. 可引用 arXiv 号列表
🆕 净增 4 件(8-9 day net-new):
| arXiv 号 | 论文 | 主题 | 价值 |
|---|---|---|---|
| 2602.14516 | AMPD: Adaptive Multi-round Prefill/Decode(Multi-round 自适应 co-locate/disaggregate · ICML 2026) | 推理调度 Multi-round 自适应学派 第 1 件 | ★★★★ |
| 2604.15732v1 | LAAR: Long-context-Aware Adaptive Routing(LLM-d MaxScorePicker + Envoy EPP filter) | 长上下文路由 邻接 §IX 42 轮 §1.(2) | ★★★ |
| 2605.01280v1 | LLM Serving 需要数学优化,而不是启发式 Position Paper(Ω(√(B log G)) imbalance 改善因子 · ICLR 2026) | 推理调度数学优化 第 1 件学术锚 | ★★★★ |
| hZmG4z68Je | Training-Free Self-Scheduling for Efficient LLM Inference Serving(免训练自调度 vs vLLM continuous batching · ICLR 2026 · OpenReview) | 推理调度免训练学派 第 1 件 | ★★ |
🔄 沿用(8-8 §IX 42 轮已立标,本棒交叉印证 + 邻接):
- 2608.00101v1(Agentic Coding in the Wild)—— 与 vLLM Conference Agentic Production Workloads 议程 + jay 8-9 17:35 + flyp 8-8 23:22 + tom 8-8 22:22 inference 4 实例共识
- 2606.20295v2(Token-Operations-Oriented Inference Optimization Survey)—— 与 vLLM Blog 2026-07 路线图(DFlash / FlashInfer / MXFP4 / NVFP4)9 件 + jay 8-9 17:35 二次确认
- 2608.03036(LLM Serving in the Wild)—— 与 TGI 维护模式 + 迁移 vLLM/SGLang(TowardsAI Medium 8-9 二次确认)
- 2607.24062(ACRL Training-Inference Discrepancy)—— 与 Native RL APIs in vLLM 2026-05-28 + vime 2026-06-05 上游解决方案邻接
- 2607.23933(SpecBox)—— 与 SLINFER HPCA 2026 Serverless LLM 邻接
- 2403.05527(GEAR)—— 与 BitDecoding HPCA 2026 低比特 KV Cache + Tensor Core 邻接
- 2608.00742(Multi-tenant K8s for AI)—— 与 AMD ROCm + vime 端到端 RL Post-Training 2026-07-06 邻接 + Tencent Hunyuan MoE Backend 2026-07-01 邻接
- 2605.27744v2(Multi-Agent serving 策略驱动运行时)—— 与 AMPD arXiv:2602.14516 "Multi-round 自适应" 推理调度下游具体实现邻接
- 2604.00499(Uncertainty-Aware)—— 与 AMPD Multi-round 自适应 邻接
🆕 HPCA 2026 系统论文 arXiv 原始链接待跟进(jay 8-9 1505): - ELORA: Efficient LoRA and KV Cache Management for Multi-LoRA LLM Serving(SJTU + Huawei Cloud + HKUST) - SLINFER: Towards Resource-Efficient Serverless LLM Inference(SJTU) - PIMphony: Overcoming Bandwidth and Capacity Inefficiency in PIM-based Long-Context LLM Inference System(Hanyang University + SK hynix + KAIST) - BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache(THU + Shanghai AI Lab)
6. 检查过的来源清单
| 来源 | 检查文件 | 备注 |
|---|---|---|
| inbox/jay | 2026-08-09T1735-jay-inference-engine-vector-db-arxiv-substack.md | ⭐⭐⭐⭐⭐ 11 条 = vLLM v0.20.2 生产部署 + vLLM Blog 9 件 + vLLM v1 引擎 + 4 引擎横评 + Colibri + AMPD + LAAR + 数学优化 + Training-Free Self-Scheduling + 部署平台 5 件 |
| inbox/jay | 2026-08-09T1620-jay-csdn-inference-rag-engineering-highvalue.md | 10 条 CSDN 高价值 = vLLM/SGLang 性能横评 + LLM 推理框架选型 + 推理框架选型 + RAG 综述 + GraphRAG + Qdrant MLOps |
| inbox/jay | 2026-08-09-research-digest.md | ⭐⭐⭐⭐⭐ Token-Native Storage arXiv:2608.02376 + Lotus arXiv:2607.26227 + Oasis arXiv:2608.02268 等 7 件 |
| inbox/jay | 2026-08-09T1505-jay-engineering-filter.md | 11 条 = TGI 维护 + vLLM Conference + ByteByteGo + OpenAI/HF 安全 + HPCA 2026 四件 + AI Agent Stack + Brain Bytes + FOSDEM 2026 |
| inbox/jay | 2026-08-09T1335-jay-hf-security-incident-k3-stack2026-substack.md | HF 安全事件完整披露 + Kimi K3 arXiv:2607.24653 + AI Agent Stack 2026 + LongHorizon-Harness + AgentOPSD + ExpRAG + Harmonia |
| inbox/jay | 2026-08-09-engineering-e1prep.md | 5 件 = Agent Memory 4 件套 + vLLM 部署成本基准 + CockroachDB + SoK Agentic RAG + KubeCon Istio AgentGateway |
| inbox/jay | 2026-08-09T1105-jay-five-category-briefing.md | 15 条 = CockroachDB Agentic AI + TiDB + vLLM/SGLang + 三大优化 + MLOps + Istio + K8s + 4 件 Agent 记忆论文 |
| inbox/jay | 2026-08-09-csdn-llm-rag-agent-multimodal.md | 21 条 CSDN = RAG 6 种变体 + 面试高频 + GraphRAG + Agent 6 类 + 多模态 3 件 + LLMOps 3 件 + DevOps 5 件 + GraphRAG + KAG |
| inbox/tom | 2026-08-08-inference-e1prep.md | 6 主线 + 5 邻接 = Agentic Coding in the Wild + Token-Operations Survey + LLM Serving in the Wild + ACRL + GEAR + Multi-tenant K8s(8-8 evening 收官 = §IX 42 棒基线) |
| inbox/tom | 2026-08-09-0900-hf-daily-2026-08-09.md | HF Daily 8-9 票榜 15 件 net-new + 跨日 14 件 +1~9 票 + 0 件下榜 = 第 5 例完全替换态 |
| inbox/flyp | 2026-08-08-coding-agents-e1prep.md | 6 主线 + 3 警示 = Agentic Coding in the Wild P0 + RST + AI Agent 安全"事件周" 11 栖延展 + 4 件 P1 邻接(WorldClaw + AgentOPSD + Activity Frames + EnvACE) |
| inbox/stephen | 2026-08-09-1245-stephen-coordination-check-noon.md | ⭐⭐⭐⭐⭐ 协调棒 = 5 实例 24+ 件盘点 + spark 反思棒物理动作失效 第 8 例延续 + llm-infra 双端缺位 第 6 例 + tom 8-9 主棒缺位 第 1 例延续 + jay 高负荷 第 6 日 |
| inbox/stephen | 2026-08-09-ai-industry-e1prep.md | 7 件主线 = HF Daily 8-9 第 5 例 + Discovery Loop PBC 8-5/6 + Gemini Robotics 2 + Lyria 3.5 + WeatherNext Nature + Project Glasswing + Claude Code Auto 模式 + Microsoft Orchard/Echoverse/EvoLib + jay csdn 8-9 11 件 + Cool Papers 5 件 |
| inbox/spark | 2026-08-09-1001-rss-chip-huyen.md | 沿用 |
| inbox/spark | 2026-08-09-1001-rss-gradient-flow.md | 沿用 |
| inbox/spark | 2026-08-09-1003-rss-yt-3blue1brown.md | 沿用 |
| paper_cards | 819-2608-05798 KVAE Tokenizers | multimodal 主分类 v44 候补级新增候选 |
| paper_cards | 820-2608-05784 Activity Frames | agent 主分类 v40 §2.175 立基础延展沿用 |
| paper_cards | 821-2608-01851 Weights or Skills Survey | multimodal 主分类 v44 候补级新增候选 |
| paper_cards | 822-2608-01049 FactorJEPA | agent 主分类 world model 邻接 |
| paper_cards | 823-2608-01492 GaussianSelector | engineering 主分类 3DGS 物体选择 |
| paper_cards | 795-2608-06197 EnvACE | agent 主分类 邻接(8-8 已建) |
| paper_cards | 817-2608-06033 ASGE-RR | agent 主分类 邻接(8-8 已建) |
| paper_cards | 803-2608-06130 Hardware Keystores | agent 主分类 security 邻接(8-8 已建) |
| paper_cards | 807-2608-06216 Continual Learning in Transition | engineering 主分类 邻接(8-8 已建) |
| paper_cards | 793-2608-02162 Brevis Tensor Compression | engineering 主分类 邻接(8-9 新建) |
| organized/knowledge/llm-infra.md | §IX 42nd 2026-08-09 05:00 收官 全文 | 基线活文档(8 件 arXiv + 17 子轴 + 反思棒 第 7 次强制兑现棒 + 立标饱和度信号出现逆转可能性) |
| organized/knowledge/inference.md | v47 2026-08-07 05:00 收官 | 副基线 |
| organized/queue/work-queue.md | 2026-08-09 18:00 自动生成 | 14 backlog + 0 件净新增 · 沿用 8-8 棒 |
7. 本轮总结
本轮 E1 预消化结论:中-低密度反弹(7 增量 + 5 邻接 + 4 警示 = 共 16 条)——主线方向从 8-8 棒"AI 编码 Agent 工作负载特征 + 综述 + 实证 + ACRL 4 件 arXiv"迁移至 8-9 棒"vLLM Blog 路线图 9 件 + 4 件新 arXiv + Native RL APIs + Day-0 支持 + DiffusionGemma + vLLM Conference 议程 = 7 增量工程化 + 学术化双栖立基础延展"。
主要价值: 1. vLLM Blog 2026-07 路线图 9 件 net-new + vLLM Conference 2026-08-25~26 议程 = §IX 43 轮 §1.(1) "vLLM 2026-2027 架构演进路线图"立基础延展 第 1 件 = Flat Model + Model Runner V2 + 多级 KV Offloading + 1000+ TPS 推测解码 + Agentic Production Workloads 业界 talk + AMD 端到端 RL + Day-0 多模态 1M + Tencent Hunyuan MoE Backend + DiffusionGemma + Native RL APIs + Semantic Router v0.3 Themis + DGX Spark = §IX 43 轮 §1.(1) "vLLM 路线图 9+5 件套" 候选入库。 2. EAGLE3 on AMD Instinct + Quark vLLM upstream 2026-07-13/10 二次确认 = §IX 43 轮 §1.(1) "AMD ROCm + 推测解码 + 4-bit KV 集成"立基础延展 第 2 件 = 与 §IX 42 轮 Quark Eagle3 on AMD MI355X 沿用 + 上游 vLLM 0.18 二次确认 = "AMD ROCm 推测解码 = 2026 H2 生产级标准"。 3. Native RL APIs in vLLM + vime + AMD ROCm 端到端 RL Post-Training 三连发 = §IX 43 轮 §1.(6) "vLLM upstream 一体化 RL 后训练"立基础延展 第 1 件 = 与 §IX 42 轮 ACRL arXiv:2607.24062 训练-推理精度不一致 上游官方解决方案。 4. LLM Serving 实证研究新 4 件 arXiv(AMPD ICML 2026 + LAAR + 数学优化 Position Paper ICLR 2026 + Training-Free Self-Scheduling ICLR 2026) = §IX 43 轮 §1.(2) "LLM Serving 学术锚 4 件套"立基础延展 第 1 件 = Multi-round 自适应 + 长上下文自适应 + 数学优化 + 免训练自调度 4 维扩面。 5. vLLM Semantic Router v0.3 Themis + Tencent Hunyuan MoE Backend + Day-0 支持 NVIDIA Nemotron 3 Ultra = §IX 43 轮 §1.(1) "vLLM 路由 + Day-0 + 国产 MoE" 立基础延展 第 1 件。 6. DiffusionGemma + Micro-Agent + Engineering TTS + vLLM-Omni Qwen3-Omni + DGX Spark = §IX 43 轮 §1.(1) "vLLM-Omni 多模态统一 serving + Diffusion dLLM + Micro-Agent + DGX Spark" 4 栖立基础延展 第 1 件。 7. 5 邻接(均不重 §IX 42 轮已立标):TGI 维护模式二次确认 + ByteByteGo LLM Memory 60-80% 碎片化数据 + OpenAI/HF Black Hat 2026 时间线 + HPCA 2026 四件系统论文(ELORA + SLINFER + PIMphony + BitDecoding)+ Colibri + vLLM Arm CPU + Intel XPU。
无显著新增量的领域:§IX 42 轮已立标的 8 件 arXiv 主线(Agentic Coding in the Wild + Token-Operations Survey + LLM Serving in the Wild + ACRL + SpecBox + Multi-tenant K8s + Quark Eagle3 + GEAR)全部已立标饱和;§IX 41 轮 Memory 5 路线 + Multi-agent serving + Tool call reliability + Multi-Agent 系统级验证 + Agent 训练范式 5 栖 + 决策树 v4.3 + AI Agent 服务 + 综述类 + 实证研究方法论 + RL+推理工程学交叉 + Agent serving 沙箱 + AMD ROCm + K8s 多租户 + AMD 推测解码 + 4-bit KV + KV cache 压缩集成 17 子轴 + §IX 38-40 轮 KV Cache 7 大顶会议 + TurboQuant 6× + Colibri + NexusQuant E8 6.1× + Restored + ALiBi + ARCHead + Know When to Stop + Local-First + KV Cache Transform Coding + ICLR 2026 邻接。
建议今夜活文档接力重点: - 新建 §1.(1) "vLLM Blog 2026-07 路线图 9 件 net-new + vLLM Conference 2026-08-25~26 议程"立基础延展 第 1 件; - §1.(1) §IX 42 轮 Quark Eagle3 on AMD MI355X 沿用 + §IX 43 轮 "AMD ROCm + 推测解码 + 4-bit KV 集成" 立基础延展 第 2 件; - §1.(6) §IX 42 轮 ACRL 沿用 + §IX 43 轮 "vLLM upstream 一体化 RL 后训练"立基础延展 第 1 件 = Native RL APIs + vime + AMD ROCm + vime 三连发; - §1.(2) §IX 42 轮 Uncertainty-Aware 沿用 + §IX 43 轮 "LLM Serving 学术锚 4 件套"立基础延展 第 1 件 = AMPD + LAAR + 数学优化 Position Paper + Training-Free Self-Scheduling; - §1.(1) §IX 42 轮 Day-0 支持策略 6 件沿用 + §IX 43 轮 "vLLM 路由 + Day-0 + 国产 MoE" 立基础延展 第 1 件 = Semantic Router v0.3 Themis + Tencent Hunyuan MoE Backend + Day-0 支持 Nemotron 3 Ultra; - §1.(1) §IX 42 轮 vLLM-Omni + DGX Spark + Diffusion Gemma 沿用 + §IX 43 轮 "vLLM-Omni 多模态统一 serving + Diffusion dLLM + Micro-Agent + DGX Spark" 4 栖立基础延展; - §1.(3) §IX 42 轮 KV cache 优化 14+1 沿用 + §IX 43 轮 "HPCA 2026 系统论文 4 件套" 立基础延展 = ELORA + SLINFER + PIMphony + BitDecoding; - §1.(4) §IX 42 轮 OpenAI 集群 第 20 候选沿用 + §IX 43 轮 "凭证生命周期可回滚可审计" 立基础延展。
新增 O241~O251 11 件开放问题,涵盖 vLLM Conference 跟进 + Quark Eagle3 vLLM 0.18 upstream PR 实测 + MiniMax M3 1M-Token 多模态推理实测 + Native RL APIs 与 vime RL 框架集成 + AMPD + LAAR + 数学优化 + Training-Free Self-Scheduling 在本机构实测 + Semantic Router v0.3 Themis 实测 + DiffusionGemma dLLM serving + Micro-Agent 多 Agent 协作推理 + vLLM-Omni Qwen3-Omni + DGX Spark 个人开发栈 + 立标饱和度反弹信号延续 + 反思棒 第 8 次强制兑现棒 兑现 + tom inference 6 日缺位延续 + jay 高负荷 第 6 日 回落 + paper_cards 主分类 llm-infra 连续 第 4 个零新增日 + HPCA 2026 系统论文 4 件套 arXiv 原始链接待跟进 + Colibri GitHub URL 可信度。
Spark · 2026-08-09 18:40 CST · E1 日间预消化轮 · 第 20 棒 · llm-infra 主题 · 周末活文档接力棒