inference · E1 预消化简报(2026-10-10)

执行体:Tom · E1 日间预消化轮(inference) · 2026-10-10 22:20 CST 基线:inference.md v310 Oct09午更新(BP-KV+SSD+galahad-kv+Spheron Oct26+Cascadia+vLLM→llm-d→Dynamo演化综述+SpecScale;引→471) 诚实度声明:本轮增量密度为「低-中」——2 条 NET-new 具体工程数字(vLLM×Mooncake cache hit 1.7%→92.2% / 3.8×吞吐量 / 46× TTFT + Qwen3.8-27B混合架构配置陷阱)+ 3 条工程观察新增(TensorRT-LLM Qwen3.8 FP8 open bug / SGLang差异化转向编排层 / vLLM-SGLang功能收敛)+ 2 条邻接待核实(ThunderAgent ICML26 Spotlight / ModeSwitch-LLM相位感知控制器)。Oct 7-9 E1 已完成密集锚定(Cascadia/SpecScale/vLLM→llm-d演化/STEPQuant待核实/MORI-IO/NIXL/SlimWise);Oct 10 新归档无主分类 inference 论文,paper_cards Oct 10 新卡 ~20 张中无 inference 主分类增量。今日增量主要来自 Jay 晚间五类简报(Oct 10 T2105)中具体工程数字的新锚定。诚实报告,不硬凑条目。


一、检查过的来源清单

来源 内容摘要 可信度
inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md vLLM×Mooncake cache hit 92.2% 3.8×吞吐量 46× TTFT + Qwen3.8-27B配置陷阱 + TensorRT-LLM FP8 open bug + 推理引擎差异化转向编排层 ⭐⭐⭐⭐⭐
inbox/jay/2026-10-10-1050-engineering-filter-inference-agent-memory.md Spheron H100三引擎实测(SGLang~16200 tok/s / vLLM~12500 / LMDeploy~16100)+ SGLang 400K GPU规模验证 + 框架选型决策树 ⭐⭐⭐⭐⭐
inbox/jay/2026-10-10-1335-openmodels-vector-agents-infratech.md Colibri纯C推理引擎744B MoE 25GB RAM流式运行 + Gergely Orosz Inference Engineering学科化续立 + vllm.cpp AMD ROCm更新 ⭐⭐⭐⭐
inbox/jay/2026-10-09T1450-jay-inference-systems-deep-dive.md Oct 9 三篇NET-new arXiv(已在E1 Oct 9锚定:2609.23130 vLLM→llm-d演化 / 2610.07219 Cascadia / 2609.39334 SpecScale) 参考·锚定确认
inbox/jay/2026-10-10-csdn-inference-rag-multiagent-highfreq.md CSDN推理框架横评工程命令(gitcode)+ Qwen3-235B vLLM/SGLang动态批处理配置 ⭐⭐⭐⭐
inbox/tom/2026-10-09-inference-e1prep.md Oct 9 E1 基线:v310 Oct09午更新;3条NET-new + 2条待核实 基线
inbox/tom/2026-10-08-inference-e1prep.md Oct 8 E1 基线:MORI-IO/NIXL/SlimWise/DeepSeek V4.1反直觉/Inference Engineering定义 锚定确认
organized/paper_cards/ 近3日新卡 ~20张(Oct 8-10);主分类 inference 0件;邻接 inference:KV Cache优化全景综述2603.20397(llm-infra主分类) 参考
organized/queue/work-queue.md Oct 10 22:00:Top 15含 2610.12448 / 2610.12459;无主分类 inference 新增 参考
organized/knowledge/inference.md v310 Oct09午:BP-KV+SSD+galahad-kv+Spheron Oct26+Cascadia+vLLM→llm-d演化+SpecScale;引→471 基线

二、今日该主题最重要的增量(5 条)

增量 1 · 🟠 工程新增具体数字 · vLLM×Mooncake prefix caching: cache hit 1.7%→92.2%,吞吐量3.8×,P50 TTFT降低46×

来源:inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md §Backend arXiv Inference Control Plane 条目(引自 arXiv:2609.23130v1 vLLM×Mooncake研究)

要点: - 具体数字(来源:vLLM×Mooncake联合研究,arXiv:2609.23130 论文内嵌案例): - prefix cache hit rate: 1.7% → 92.2%(提升54倍) - 吞吐量提升:3.8× - P50 TTFT 降低:46× - 该数字与 Oct 9 E1 中"prefix-cache-aware routing比round-robin ~3×吞吐量"来自同一论文(arXiv:2609.23130),但 Oct 9 引用的是 Tesla/Red Hat/KServe 生产数据(生产报告,非受控实验),本数字来自 vLLM×Moonque 联合研究(受控实验变量更清晰) - 重要区分:46× TTFT 改善是在 prefix cache hit 从 1.7% 提升到 92.2% 的条件下测得;实际生产中 cache hit 率取决于 workload 特性(共享 system prompt 比例、RAG 文档复用率等)

与 knowledge/inference.md 现有脉络的关系: - 现有 §2.3 PD Disaggregation 已锚入 NIXL 三后端 Benchmark(UCCL/UCX/Mooncake)和 Mooncake EPD(Encode-Prefill-Decode);本条是 Mooncake prefix caching 在 vLLM 集成下的具体工程数字锚定 - 与 inference.md Oct 09午锚定的 Spheron Oct26 SGLang vs vLLM 量化对比形成互补:Spheron 数据是"框架间对比",本条是"同一框架内 Mooncake prefix caching 的效果"

建议归入:§2.3 Prefill-Decode Disaggregation(新增 vLLM×Mooncake prefix caching 具体工程数字锚定:cache hit 1.7%→92.2% / 3.8×吞吐量 / 46× TTFT)


增量 2 · 🟠 工程新增 · Qwen3.8-27B 混合架构生产配置陷阱(vLLM 0.30 OOM + SGLang 0.5.20 并发限制)

来源:inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md §Backend 条目1(SGLang vs vLLM 2026-10 综合)

要点: - vLLM 0.30 默认配置问题:Qwen3.8-27B(MoE,混合架构)默认 max-num-seqs 配置导致单 H100 OOM——需调低 sequence limit 才能在单卡运行 - SGLang 0.5.20 默认配置问题:默认将并发限制在 20(--mem-fraction-static 0.92 下 state cache 并发上限),需显式增大 state cache 才能支持更高并发 - TensorRT-LLM Qwen3.8 FP8 open bug:Qwen3.8(2026-08发布)截至2026-09,TensorRT-LLM v1.3.0rc28 仍无法加载 FP8 checkpoint——属于 open bug,Qwen3.8 生产部署 TensorRT-LLM 路径暂时不通 - Qwen3.8-27B 是 2026 年主流生产模型,上述配置陷阱直接影响线上部署工程师的选型决策

与 knowledge/inference.md 现有脉络的关系: - 现有 §1.1 框架格局中 SGLang 0.5.9(2025-02)已锚定,vLLM 0.29.0 是当前稳定版;本条是 2026-09 快照下的具体配置问题,属于"版本更新后的生产陷阱"补充 - 与 Oct 8 E1 中"DeepSeek V4.1 Prefill 瓶颈反直觉发现"同属"混合架构/超大模型的生产配置难题"——Qwen3.8-27B 是 Oct 10 的新案例

建议归入:§1.1 框架格局(新增 Qwen3.8-27B 混合架构生产配置陷阱 · vLLM 0.30 OOM / SGLang 0.5.20 并发限制 / TRT-LLM FP8 open bug)


增量 3 · 🟡 工程观察新增 · 推理引擎差异化从 feature parity 转向编排层效率(SGLang vs vLLM 同样 kernels 差距 29% 来自调度)

来源:inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md §Backend"推理引擎架构融合"条目(medium.com/@ant-oss 工程分析)

要点: - vLLM 和 SGLang 在 kernel 层已高度收敛(均支持 Continuous Batching、PagedAttention/RadixAttention、Chunked Prefill、Speculative Decoding、Disaggregated Serving、CUDA Graphs) - operator 库趋同:FlashInfer、FlashAttention、DeepGEMM - 关键洞察(medium/@ant-oss):SGLang vs vLLM 在相同 kernels 下性能差距的 29% 来自调度层(scheduler),而非 kernel 本身——这意味着编排效率(orchestration)已成为新的差异化维度 - 生产选型影响:SGLang 优势场景(多轮对话前缀复用、RAG 文档上下文复用、agentic workflow)本质上都是"调度层擅长处理共享前缀"的工程体现;vLLM 优势场景(通用生产、高并发、广泛模型支持)是"底层 engine 成熟度"的体现

与 knowledge/inference.md 现有脉络的关系: - 现有 §1.1 框架格局已锚 vLLM/SGLang 双雄;本条是"为何两者同样 kernels 却有差距"的系统性解释,填补了 inference.md 对"编排层差异化"缺乏量化描述的空白 - 与 Oct 10 Spheron H100 数据(SGLang ~16,200 tok/s vs vLLM ~12,500 tok/s)共同构成"性能差距的根因分析"

建议归入:§1.1 框架格局(新增"编排层效率"作为推理引擎差异化新维度 · SGLang vs vLLM 同样kernels差距29%来自调度)


增量 4 · 🟡 邻接待核实 · ThunderAgent: ICML 2026 Spotlight,program-aware scheduling + 异步tool环境准备

来源:inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md §Backend"推理引擎新论文"条目(paper.lingyunyang.com awesome papers 列表;ICML 2026 Spotlight)

要点: - ThunderAgent:GaTech & UIUC & CMU & Together AI,ICML 2026 Spotlight 论文 - 核心创新:将 workflow 表示为 LLM Programs(统一 KV-cache、state、tool-resource metadata),program-aware scheduling + 异步 tool 环境准备 - 与 inference.md §1.(13) AI for Systems 中 SEIS(Self-Evolving Inference Systems)形成不同角度:SEIS 用 AI 优化推理引擎本身,ThunderAgent 用 program-aware 调度优化 agent workflow 执行 - ⚠ 待核实:具体 arXiv ID;建议作为邻接条目暂存,待 arXiv 编号确认后决定是否升锚

与 knowledge/inference.md 现有脉络的关系: - 与 §1.1 框架格局中 SGLang(编排层优势)和 §1.(13) AI for Systems 中 SEIS 形成三角交叉:SEIS(AI优化引擎)/ ThunderAgent(program-aware调度优化workflow)/ 传统引擎(kernel优化) - ⚠ 暂归邻接,待 arXiv ID 确认

建议归入:§1.(13) AI for Systems(ThunderAgent ICML26 Spotlight邻接 · 待核实arXiv ID)


增量 5 · 🟡 邻接待核实 · ModeSwitch-LLM: 单GPU相位感知控制器,动态切换FP16/量化/投机/前缀缓存/批处理模式

来源:inbox/jay/2026-10-10T2105-jay-evening-five-category-briefing.md §Backend"KV Cache 2026新方向"条目(arXiv来源待确认)

要点: - ModeSwitch-LLM:单 GPU 相位感知控制器,动态切换 FP16 / 量化 / 投机解码 / 前缀缓存 / 批处理模式 - 与 inference.md §4.1 投机解码(SpecScale / SSD / EAGLE3 / Orthrus)和 §4.2 QATFactory(量化感知训练+蒸馏+NVFP4/MXFP4)形成互补:ModeSwitch-LLM 解决的是"同一GPU上何时切换何种模式"的调度问题,而非单一模式的优化 - ⚠ 待核实:具体 arXiv ID 和论文链接;建议作为邻接条目暂存

与 knowledge/inference.md 现有脉络的关系: - 与 §4.1 投机解码和 §4.2 量化形成"Modes/策略动态调度"交叉——现有章节描述的是各模式的独立优化,ModeSwitch-LLM 提供的是跨模式的统一调度框架 - ⚠ 暂归邻接,待 arXiv ID 确认

建议归入:§4.1 投机解码(ModeSwitch-LLM 相位感知控制器邻接 · 待核实arXiv ID)


三、值得警惕的矛盾或待核实说法(2 条)

⚠️ T1 待核实 · vLLM×Mooncake 92.2% cache hit 与 Oct 9 Tesla/Red Hat/KServe 生产数据的口径差异

现象:Oct 10 Jay 晚间简报引用 vLLM×Mooncake 研究中"cache hit 1.7%→92.2%,3.8×吞吐量,46× TTFT";Oct 9 E1 引用同一篇论文(arXiv:2609.23130)中 Tesla/Red Hat/KServe 生产报告"~3×吞吐量,2× TTFT"——两者来自同一论文但数字体系不同(受控实验 vs 生产报告),在同一语境下引用需区分来源条件

风险:若在活文档中混用两套数字,可能导致误导性比较

建议:inference.md 中引用时加注"受控实验条件(vLLM×Mooncake benchmark)" vs "生产报告条件(Tesla/Red Hat/KServe部署)"标注


⚠️ T2 待核实 · ThunderAgent / ModeSwitch-LLM 具体 arXiv ID

现象:Jay 晚间简报引用 ThunderAgent(ICML 2026 Spotlight)和 ModeSwitch-LLM("KV Cache 2026新方向"),但均未提供具体 arXiv ID

风险:无 arXiv ID 无法在活文档中引用,也无法精读原文验证

建议:下一棒位补充 arXiv ID;如无法确认,降级为"行业动向观察"而非学术锚点


四、可引用的 arXiv 号列表

arXiv 号 标题 关联节 备注
2609.23130 vLLM→llm-d→分布式推理控制平面演化综述(vLLM×Mooncake cache hit 92.2% / 3.8×吞吐量 / 46× TTFT 本轮新增数字锚定) §1.1 框架格局 + §2.3 PD Disaggregation 续锚;新增具体数字
2610.07219 Cascadia: 消费级 Eleven AI PC 上 975B MoE 推理(已在 Oct 09 E1 锚定) §1.3 llm-d/K8s编排 续锚
2609.39334 SpecScale: 投机解码在测试时计算扩展中的系统优化(已在 Oct 09 E1 锚定) §4.1 投机解码 续锚
2609.38169 STEPQuant: Delta 规则循环状态量化中何时何处出错(已在 Oct 09 E1 邻接登记) §4.2 蒸馏新范式 续锚·待核实
2610.12085 Is Memorization Context-Sensitive? 前缀提取攻击(已在 Oct 09 E1 邻接登记) §1.9 安全 续锚·待核实
2610.10845 galahad-kv 50M Token KV Cache NVMe 持久化(已在 Oct 09 午锚定) §3.3 KV Cache 续锚
2610.06479 BP-KV Behavior-Preserving KV Cache Compression(已在 Oct 09 午锚定) §3.2 KV Cache 续锚
2607.09701 SlimWise MoE 预分馏专家剪枝(已在 Oct 08 E1 锚定) §2.3 PD Disaggregation 续锚
2603.20397 KV Cache 优化全景综述(五大方向:eviction/compression/混合内存/新型attention/组合策略) §3.(X) KV Cache llm-infra主分类/参考

五、摘要

增量条数:5 条(2 条 NET-new 具体工程数字 + 3 条待核实邻接/工程观察) 涉及 arXiv 号:9 件(6 件续锚 + 3 件待核实:ThunderAgent/ModeSwitch-LLM arXiv ID未确认) 最高价值条目:vLLM×Mooncake cache hit 1.7%→92.2%,吞吐量 3.8×,P50 TTFT 降低 46×(具体工程数字;与 Oct 9 Tesla/Red Hat/KServe 生产数据互补,受控实验条件更清晰)

本轮新增主题节点:vLLM×Mooncake prefix caching 具体数字(92.2% cache hit) + Qwen3.8-27B 混合架构生产配置陷阱(vLLM 0.30 OOM / SGLang 0.5.20 并发限制 / TRT-LLM FP8 open bug) + 推理引擎差异化转向编排层(SGLang vs vLLM 同样kernels差距29%来自调度)

矛盾/待核实:vLLM×Mooncake受控实验数字 vs Tesla/Red Hat/KServe生产报告数字口径差异(T1);ThunderAgent/ModeSwitch-LLM arXiv ID未确认(T2)

下次跟进重点:vLLM×Mooncake 论文原文精读确认 92.2% cache hit 的具体 workload 条件;ThunderAgent/ModeSwitch-LLM arXiv ID追踪;Qwen3.8-27B 配置陷阱原厂文档交叉验证


六、检查过的来源完整清单(诚实度声明)

本轮 Oct 10 inference 主题检查了以下来源,确认净增量密度为「低-中」:

来源 inference 相关性 结论
Jay 晚间五类简报(T2105) vLLM×Mooncake 92.2% cache hit(新数字)+ Qwen3.8-27B配置陷阱(新)+ TRT-LLM FP8 bug(新)+ 编排层差异化(新)+ ThunderAgent/ModeSwitch-LLM(待核实) 3条NET-new工程数字+2条待核实
Jay 工程筛选(T1050) Spheron H100三引擎数据(SGLang~16K/vLLM~12.5K/LMDeploy~16K tok/s)+ 400K GPU规模验证(已在Oct8-9锚定Spheron Oct26;本轮新增具体tok/s数字) 确认性+数字补锚
Jay 下午开源模型/向量DB/Agent栈(T1335) Colibri纯C推理引擎(边缘邻接)+ Inference Engineering学科续立(已锚)+ vllm.cpp AMD ROCm(已锚) 确认性,无inference主轴新增
Jay CSDN 推理框架横评(T0820) 推理框架工程命令对照(vLLM/SGLang/TGI/TensorRT-LLM/LMDeploy)+ Qwen3-235B动态批处理配置代码 确认性,无新数字
Oct 9 E1 inference v310 Oct09午基线;3条NET-new+2条待核实 锚定确认
Oct 8 E1 inference MORI-IO/NIXL/SlimWise/DeepSeek V4.1反直觉/Inference Engineering定义 锚定确认
Paper Cards Oct 8-10 ~20张新卡;主分类inference 0件;2603.20397 KV Cache优化综述(llm-infra主分类) 无inference主分类新增
Work Queue Oct 10 22:00 Top 15含 2610.12448 / 2610.12459;无inference新增 参考

结论:Oct 10 inference 主轴增量低于 Oct 7-9(2条具体工程数字 + 3条待核实邻接 vs Oct 9的3条NET-new + 2条待核实 vs Oct 7-8的8条密集锚定)。主要原因是 Oct 7-9 已完成密集锚定,Oct 10 无新 inference 主分类论文归档。vLLM×Mooncake cache hit 92.2% 数字(3.8×吞吐量 / 46× TTFT)是本轮具体工程数字锚定,与 Oct 9 Tesla/Red Hat/KServe 生产数据形成受控实验 vs 生产报告的互补体系。诚实报告,不硬凑条目。


Tom · 2026-10-10 22:20 CST · inference · E1 预消化轮完成