inference · E1 预消化简报(2026-09-21)
状态摘要
- 增量条数:5 条主增量(在 3-8 目标区间内;2026-09-20 22:00 ~ 2026-09-21 22:00 滑动窗口)
- 核心新增:① colibri — 纯 C MoE 推理引擎,744B GLM-5.2 在 25GB RAM 笔记本运行(⭐⭐⭐⭐)② SGLang vs vLLM 2026 决策框架 + TGI 已死(⭐⭐⭐⭐)③ NVIDIA EPD Encode-Prefill-Decode Disaggregation 官方决策指南(⭐⭐⭐⭐)④ DeepSeek-V4.1-Flash 135▲ #2 续立 48h +78▲ 稳态锚定 ⑤ EOS Tokens arXiv:2609.20511 94▲ #4 续立
- 涉及 arXiv 号:本次新增 2 个(2609.20511 EOS Tokens / 2608.01526 Internet for the KV Cache);续用锚定 25+ 个
一、检查过的来源清单
| 来源目录 | 关键文件 | inference 相关度 |
|---|---|---|
| inbox/jay | 2026-09-21T1505-jay-five-category-afternoon-briefing.md(colibri · H100 GPU 利用率 arXiv:2609.19472 · LMDeploy 16,200 tok/s · SGLang 2026更新) | 高 |
| inbox/jay | 2026-09-21T2105-jay-evening-five-category-briefing.md(OSDI 2026 Zero-Copy KV Cache · llm-d · Internet for the KV Cache · SGLang vs vLLM 2026 决策矩阵) | 高 |
| inbox/jay | 2026-09-21-1735-jay-ai-engineering-github-hf-inference-vecdb-trending.md(五源独立验证 SGLang vs vLLM · TGI 已死 · LMDeploy 16,200 tok/s) | 高 |
| inbox/jay | 2026-09-21-ai-engineering-trending.md(SGLang RadixAttention · vLLM vs LMDeploy 决策矩阵) | 高 |
| inbox/jay | 2026-09-21-csdn-highvalue-edge-deepseek.md(DeepSeek-V4.1-Flash 续立 · 四卡 PCIe 端侧 27B) | 高 |
| inbox/spark | 2026-09-21-llm-infra-e1prep.md(colibri · WeVisDoc · H100 GPU 利用率 · EPD · DeepSeek-V4.1-Flash 续立 · EOS Tokens 续立) | 高 |
| inbox/tom | 2026-09-20-inference-e1prep(昨夜基线;7条锚定:Inferact/RadixArk治理分叉 · SGLang v0.5.19 · Spheron H100三方 · nvext Agent Hints · Plugin4Shell · JustFit · SAGA) | 基线 |
| inbox/tom | 2026-09-19-inference-e1prep(昨夜基线;5条锚定:TriAttention · OSDI'26零拷贝 · TensorRT-LLM DeepSeek-V4 · SGLang 2026+suffix decoding · When2Think) | 基线 |
| inbox/tom | 2026-09-21-0900-hf-daily-2026-09-21.md(DeepSeek-V4.1-Flash 135▲ #2 · EOS Tokens 94▲ #4) | 高 |
| inbox/spark | 2026-09-21-agent-e1prep.md(RetireOPD · OWASP ASI · RiskChainBench · Agent主题邻接) | 邻接 |
| paper_cards Sep 19-21 | 1432-1441 共10张;主分类 llm-infra 0 件净增(1419 WeVisDoc / 1425 EOS Tokens 均为 9-20 前入库锚定续立;1432 Sample Count Is Not Enough 9-19 入库锚定) | 参考 |
二、增量条目
增量 1:colibri — 纯 C MoE 推理引擎,744B GLM-5.2 在 25GB RAM 笔记本运行(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-21T1505-jay-five-category-afternoon-briefing.md §B1;github.com/JustVugg/colibri · GitHub Trending 2026-09-21 · 35.5k ★ +3.7k 单日新增 · HN 769 points(2026-07-09)· Apache 2.0
要点:
- 核心定位:纯 C MoE 推理引擎——无 GPU 依赖、无 Python 运行时、无 BLAS、无 Docker;单文件 c/glm.c(约 2,400 行),gcc + OpenMP 编译,AVX2 支持即可运行
- 核心机制:密集层保留在内存(~9.9 GB INT4),MoE 路由专家按需从磁盘流式加载(总共 ~370 GB)——与 llama.cpp 最大区别是 colibri 专为 MoE 的专家流式加载做了专门优化
- 支持模型:GLM-5.2(744B 总参,~40B 活跃参数)
- 性能数据:WSL2 25GB RAM 笔记本 = 0.05–0.1 tok/s(冷启动);Apple M5 Max = ~1.06 tok/s
- 工程意义:744B frontier MoE 首次可在消费级硬件(无 GPU)上运行;适用边界:极慢,不适合交互式使用,但可用于验证 MoE 模型在特定硬件上的可行性;可通过双 SSD 条带化或加 GPU tier 提速
- 许可证:Apache 2.0
可信度:中高(GitHub 仓库验证 + HN 769 points + 单日 +3.7k ★ 增势 + Apache 2.0 开源可查)
与活文档 inference.md 现有脉络的关系:inference.md §1.1 已有 vLLM / SGLang / LMDeploy / TensorRT-LLM 四主流引擎格局;本条是纯 C MoE 推理引擎新类别(区别于 Python-based vLLM/SGLang),与 JustFit(MLX 端侧,arXiv:2609.17475)共同构成"端侧推理"双轨——JustFit = Apple Silicon 内存约束、colibri = 磁盘流式 MoE 约束
建议归入章节:§1.1 框架格局(colibri 纯 C MoE 推理引擎 · 端侧新范式 · 与 JustFit 形成"内存压缩 vs 磁盘流式"双轨)
增量 2:SGLang vs vLLM 2026 决策框架 · TGI 已死 · SGLang RadixAttention 3–5× prefill 改善 · LMDeploy 16,200 tok/s(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-21-1735-jay-ai-engineering-github-hf-inference-vecdb-trending.md §一;Spheron + Prem AI + Turion.ai + Yotta Labs + Atomic Chat(五源独立交叉验证)
要点: - TGI 已死(2025-12 进入维护模式),HF 官方推荐 vLLM 或 SGLang 新部署 - vLLM:生产标准,PagedAttention,KV cache 内存浪费 <4%,冷启动约 62s(最快),模型覆盖最广(数百种架构),多厂商硬件支持 - SGLang:多轮对话专用,RadixAttention 缓存重复前缀,实测 prefix-reuse >60% 时 3–5× prefill 延迟改善;生产用户:xAI Grok 3 / Microsoft Azure / AMD / NVIDIA / LinkedIn / Cursor / Baseten / Nebius / Runpod;已正式加入 PyTorch 生态 - LMDeploy:H100 ~16,200 tok/s(吞吐最高),NVIDIA 专用,量化模型服务,最低 TTFT - TensorRT-LLM:延迟敏感场景(<100ms TTFT),慢启动(需编译),追求原始吞吐量上限 - 决策矩阵: - 选 vLLM:首产部署 / 多模型兼容 / 团队重视稳定性文档 / 单轮交互为主 - 选 SGLang:多轮对话为主 / 构建 Agent / 系统 prompt 工具定义重复性高 / 结构化输出(JSON/XML)关键 - 选 LMDeploy:量化模型服务 / 最低 TTFT / NVIDIA 专用 - 选 TensorRT-LLM:愿意维护编译管道 / 追求原始吞吐量上限
可信度:高(Spheron + Prem AI + Turion + Yotta Labs + Atomic Chat 五源独立交叉验证)
与活文档 inference.md 现有脉络的关系:inference.md §1.1 已有 vLLM vs SGLang 双雄 + SGLang v0.5.19 统一 RadixTree + 9月发布周期;本条是 TGI 正式废弃 + LMDeploy 16,200 tok/s 新数据 + 五源交叉验证的完整决策矩阵,是对 9-20 inference e1prep 增量 2(Spheron H100 三方 benchmark)的决策层补充
建议归入章节:§1.1 框架格局(TGI 已死 · SGLang vs vLLM 2026 决策矩阵 · LMDeploy 16,200 tok/s 新数据)
增量 3:NVIDIA EPD Encode-Prefill-Decode Disaggregation — multimodal 推理三阶段分离官方决策指南(⭐⭐⭐⭐)
来源:inbox/jay/2026-09-20-afternoon-nvidia-agent-stack-substack-edge-inference.md §一.4(引自 flyp 9-21 multimodal e1prep 续立);developer.nvidia.com/blog/when-to-use-encode-prefill-decode-disaggregation-to-accelerate-multimodal-model-serving · 2026-09-04
要点: - 核心动机:多模态模型(VLM)处理图像输入时,vision encoder / Prefill / Decode 三阶段计算特征不同,混合部署导致 GPU 利用率低和延迟不稳定;EPD disaggregation 允许分别优化各阶段资源配置和并行策略 - 三阶段特征:vision encoder 计算密集适合独立 GPU pool;Prefill 计算注意力权重适合批处理;Decode 内存带宽受限适合高带宽 GPU - 适合场景:高并发多模态推理、图像密集型推理任务 - 不适合场景:图像很少或纯文本推理(overhead 大于收益) - 决策指南:NVIDIA 官方给出了 Encode-Prefill-Decode disaggregation 的具体决策标准,是该领域的首个工程化决策指南
可信度:极高(NVIDIA 官方工程博客,含具体架构细节,2026-09-04,极新鲜)
与活文档 inference.md 现有脉络的关系:inference.md §1.3 KV Cache 已有 PD disaggregation 基础内容(vLLM / SGLang / AWS SageMaker Hyperpod);本条是 NVIDIA 官方 EPD 决策指南的具体标准,丰富 §1.3 的 multimodal 推理路由案例,与 nvext Agent Hints(9-20 inference e1prep 增量 4)共同构成"多模态 + Agentic"推理基础设施双补充
建议归入章节:§1.3 KV Cache(EPD Encode-Prefill-Decode Disaggregation · NVIDIA 官方决策指南 · multimodal 三阶段分离)
增量 4:DeepSeek-V4.1-Flash 135▲ #2 — 续立锚定 48h +78▲(⭐⭐⭐⭐⭐,续立锚定)
来源:inbox/tom/2026-09-21-0900-hf-daily-2026-09-21.md #2;HF Daily 9-19 57▲ #4 → 9-20 95▲ #2 → 9-21 135▲ #2 = 48h +78▲ 升档稳态;paper_card 1417 ✓ 主分类 llm-infra
要点: - 正式标题:DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression - arXiv 号:2609.19969(DeepSeek-AI) - 核心定位:KV cache 压缩为头号系统卖点的旗舰模型,552B MoE backbone + 百万 token 上下文 + KV cache 压缩新 SOTA - KV cache 压缩四层方法学(续立锚定):
| 层 | 论文 | 优化对象 |
|---|---|---|
| 模型层 | DeepSeek-V4.1-Flash 2609.19969 | 模型架构本身的 KV 压缩 |
| 读取层 | Fathom 2609.17652 | per-query read depth |
| 路由层 | Edge0 2609.18063 | MoE SSD 卸载预路由 |
| 多模态层 | HYBRIDKV 2604.05887 | multimodal KV 压缩 7.9× |
- 48h 稳态确认:9-19 57▲ → 9-20 95▲ +38▲ → 9-21 135▲ +40▲ = 升档稳态
可信度:高(arXiv abs + HF Daily 热度 + paper_card 1417 已入库 + 三源独立验证)
与活文档 inference.md 现有脉络的关系:inference.md §1.3 KV Cache 已有 DeepSeek-V4.1-Flash / Fathom / Edge0 / HYBRIDKV 锚定;本条是 48h 升档稳态确认,KV cache 压缩四层方法学框架续立
建议归入章节:§1.3 KV Cache(DeepSeek-V4.1-Flash 续立 135▲ #2 · 四层压缩方法学 48h +78▲ 稳态确认)
增量 5:EOS Tokens arXiv:2609.20511 — 94▲ #4 续立锚定(⭐⭐⭐,续立锚定)
来源:inbox/tom/2026-09-21-0900-hf-daily-2026-09-21.md #4;HF Daily 9-19 57▲ #4 → 9-20 76▲ #4 → 9-21 94▲ #4 = 24h +18▲ 续立;paper_card 1425 ✓ 主分类 llm-infra
要点: - 正式标题:When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation - arXiv 号:2609.20511 - 核心问题:在线策略蒸馏(OPD)中的长度膨胀现象——EOS token 出现分歧,导致生成超出预期长度 - 48h 热度:9-19 57▲ #4 → 9-20 76▲ #4 +19▲ → 9-21 94▲ #4 +18▲ = 48h +37▲ 续立 - paper_card 主分类:llm-infra ✓
可信度:高(arXiv abs + HF Daily 热度 + paper_card 1425 ✓ 主分类 llm-infra)
与活文档 inference.md 现有脉络的关系:inference.md §1.2 推理调度已有 When2Think(arXiv:2609.19671,IDAC 推理深度控制);本条是 On-Policy Distillation 长度控制问题的新案例,与 RetireOPD(arXiv:2609.20784)形成"蒸馏中的 token 级控制"互补叙事,丰富 §1.2 的推理调度子轴
建议归入章节:§1.2 推理调度(EOS Tokens 2609.20511 长度膨胀现象 · 续立 94▲ #4 · On-Policy Distillation token 级控制)
三、值得警惕的矛盾或待核实说法
矛盾/待核实 ①:colibri GitHub 仓库实际状况(低风险)
GitHub Trending 9-21 35.5k ★ +3.7k 单日新增,Apache 2.0,HN 769 points;但具体 GLM-5.2 支持列表、实际性能数字、与其他 MoE 推理引擎的对照需抓 GitHub 仓库核实。
建议:标注"colibri GLM-5.2 支持范围和实测性能待 GitHub 仓库核实"
矛盾/待核实 ②:NVIDIA H100 GPU 利用率研究 arXiv:2609.19472(低风险)
jay 9-21 1505 标注 arXiv:2609.19472 cs.PF 2026-09-14,但该 arXiv ID 未独立核实,实际可能为 2609.14972 / 2609.19427 等近邻号。
建议:标注"arXiv:2609.19472 H100 GPU 利用率研究需 arXiv 官方核实实际 ID"
矛盾/待核实 ③:WeVisDoc arXiv 号争议(低风险)
jay 9-21 engineering-e1prep 标注 WeVisDoc 为 arXiv:2609.19671,但 paper_card 1419 实际为 arXiv:2609.20423。两者描述内容一致,实际应为 2609.20423。
建议:标注"WeVisDoc 实际 arXiv 号为 2609.20423(paper_card 1419 核实)"
矛盾/待核实 ④:DeepSeek-V4.1-Flash KV cache 压缩核心方法(中等风险)
9-20 inference e1prep 矛盾 ① 已标注:4 条可能路线(稀疏化/量化融合 · MoE-aware KV routing · 层级 KV 共享 · 训练期 KV 预算约束)均为推断,具体方法名/公式/实验数据需读 arXiv 全文核实。
建议:标注"DeepSeek-V4.1-Flash 核心压缩方法待 arXiv 全文核实"
四、可引用 arXiv 号列表
| arXiv 号 | 标题 | 可信度 | 与 inference.md 关系 |
|---|---|---|---|
| 2609.20511 | EOS Tokens: Understanding Length Inflation in On-Policy Distillation · 94▲ #4 续立 | 高(arXiv + HF Daily 热度) | 本次新增锚定 → 建议归入 §1.2 推理调度(OPD 长度膨胀) |
| 2608.01526v1 | An Internet for the KV Cache: Rethinking Classical Networks for LLM Inference · KV Cache CDN 范式 | 高(arXiv 2026-08) | 本次新增 → 建议归入 §1.3 KV Cache(KV Cache 架构认知框架) |
| 2609.19969 | DeepSeek-V4.1-Flash: KV Cache Compression · 552B MoE · 135▲ #2 续立锚定 | 高 | 9-20锚定;续立确认 |
| 2609.17475 | JustFit: 200K-Token LLM Serving on 24 GiB Apple Silicon | 高 | 9-20锚定 |
| 2609.17391 | FlashVector: Agent for Hierarchical Model Serving Stack Optimization | 高 | 9-20锚定 |
| 2605.00528v1 | SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters · HPDC'26 | 高 | 9-20锚定 |
| 2609.12923 | Dissecting GPU Utilization for LLM Inference on Nvidia Hopper · KTH | 高 | 9-20锚定 |
| 2609.19499 | Sample Count Is Not Enough | 高 | 9-19锚定 |
| 2609.19671 | When2Think: IDAC 推理深度控制 | 中高 | 9-19锚定 |
| 2609.17652 | Fathom: KV Cache Bit-Plane | 中高 | 9-18锚定 |
| 2609.18063 | Edge0: MoE SSD 卸载预路由 | 高 | 9-18锚定 |
| 2606.01927 | Albireo: Scaling LLM Inference Beyond Amdahl's Limits | 高 | 9-18锚定 |
| 2605.29639 | RTP-LLM: Alibaba LLM Inference Engine | 高 | 9-18锚定 |
| 2605.29979 | Fingerprinting Inference Systems of LLMs | 高 | 9-18锚定 |
| 2609.05565 | Sustainable Distributed LLM Inference + llm-d | 高 | 9-17锚定 |
| 2604.05887 | HYBRIDKV: multimodal KV compression 7.9× | 高 | 9-17锚定 |
| 2510.09665 | LMCache 生产级 KV Cache 缓存层 | 高 | 9-16锚定 |
| 2602.07115 | Online Scheduling for LLM Inference with KV Cache | 高 | 9-15锚定 |
| 2604.24971 | PolyKV 多 Agent 共享 KV cache pool | 高 | 9-15锚定 |
| 2607.08057 | ACL 2026 Survey: System-Aware KV Cache Optimization | 高 | 9-19锚定 |
五、本次无显著新增量的来源说明
以下来源已检查,但无 inference 主轴净增量,或已被活文档覆盖:
- inbox/jay/2026-09-21T1505-jay-five-category-afternoon-briefing.md:H100 GPU 利用率 arXiv:2609.19472(需核实实际 arXiv ID)、NVIDIA 边缘 AI 功耗研究(cs.PF,邻接级);colibri 主体已纳入增量 1
- inbox/jay/2026-09-21T2105-jay-evening-five-category-briefing.md:OSDI 2026 Zero-Copy KV Cache Offloading(USENIX OSDI '26,完整 ID 待核实)、llm-d 架构(arXiv:2609.05565 已锚定),均属承接精修;Internet for the KV Cache(2608.01526)已纳入增量(KV Cache CDN 范式框架)
- inbox/spark/2026-09-21-llm-infra-e1prep.md:colibri / WeVisDoc / H100 GPU 利用率 / EPD 均已纳入本次 inference 增量;DeepSeek-V4.1-Flash / EOS Tokens 属续立锚定;整体属 llm-infra 专项,inference 不重复收录
- inbox/jay/2026-09-21-csdn-highvalue-edge-deepseek.md:四卡 PCIe 级联 27B 端侧(llama.cpp RPC 分支,邻接级);DeepSeek-V4.1-Flash 续立已锚定
- paper_cards 1432-1441:1419 WeVisDoc(llm-infra,承接锚定)、1425 EOS Tokens(llm-infra,续立锚定)、1432 Sample Count Is Not Enough(9-19 入库锚定);其余 7 张主分类 multimodal/evaluation/agent/rag,非 inference 主分类
- inbox/tom/2026-09-21-agent-rag-longcontext-radar.md:Self-Evolving Search Index / ActObs / Sample Count 等均属 RAG/Agent 邻接,非 inference 主轴
六、建议今晚 E2 活文档更新优先级
| 优先级 | 内容 | 动作 |
|---|---|---|
| 🔴 最高 | colibri 纯 C MoE 推理引擎(744B GLM-5.2 25GB RAM 笔记本) | 写入 §1.1 框架格局(端侧推理新类别 · 与 JustFit 形成"磁盘流式 vs 内存压缩"双轨) |
| 🔴 最高 | SGLang vs vLLM 2026 决策框架(TGI 已死 + LMDeploy 16,200 tok/s + 五源验证) | 写入 §1.1 框架格局(决策矩阵精修 + TGI 废弃说明) |
| 🟡 中 | NVIDIA EPD Encode-Prefill-Decode Disaggregation 官方决策指南 | 写入 §1.3 KV Cache(multimodal 三阶段分离决策标准) |
| 🟡 中 | DeepSeek-V4.1-Flash 135▲ #2 续立稳态(48h +78▲) | 写入 §1.3 KV Cache(四层压缩框架续立确认) |
| 🟡 中 | EOS Tokens arXiv:2609.20511 94▲ #4 续立(长度膨胀 On-Policy Distillation) | 写入 §1.2 推理调度(续立锚定) |
| 🟢 低 | Internet for the KV Cache arXiv:2608.01526(KV Cache CDN 范式框架) | 写入 §1.3 KV Cache(架构认知框架补充) |
本报告由 Tom 实例自动生成 · 2026-09-21 22:20 CST 增量条目:5 条(colibri 纯 C MoE · SGLang vs vLLM 2026 决策框架 + TGI 已死 · NVIDIA EPD Disaggregation · DeepSeek-V4.1-Flash 续立锚定 · EOS Tokens 续立锚定) 涉及 arXiv 号:2+25+(本次新增:2609.20511 / 2608.01526;续用锚定 25+ 个)