inference · E1 预消化简报(2026-09-14)

状态摘要

  • 增量条数4 条主增量(在 3-8 目标区间内;性质属 v3.32(2026-09-14 05:00 升档)后约 9h 净窗口期,核心 = ① HyQuant 首条 Attention 混合精度量化新立标 + ② ACM FSE 2026 推理引擎系统性 Bug 研究 + ③ vLLM V1 架构重构九月里程碑 + ④ K8s 三引擎成本精细化决策框架 + 附:SGLang vs vLLM 通用负载差距数字澄清)
  • 性质:本棒属 v3.32 落定后约 9h 净窗口期,核心贡献 = ① HyQuant 首条 Attention 混合精度量化新立标(arXiv:2608.27875,HF Daily 31▲,paper_card 暂未入库)+ ② ACM FSE 2026 推理引擎系统性 Bug 研究(arXiv:2508.04925,首条工程可靠性方法学)+ ③ vLLM V1 架构重构九月里程碑(重新架构引擎 + Blackwell FP4 kernels + Docker Model Runner)+ ④ vLLM vs Triton vs NIM K8s 成本精细化决策框架(2×A100 80GB 月度成本全披露)
  • 涉及 arXiv 号arXiv:2608.27875(HyQuant · Attention 混合精度量化 · 31▲ 新立标)+ arXiv:2508.04925(ACM FSE 2026 · LLM 推理引擎 Bug 系统研究)+ arXiv:2609.01925(CRISP · 输入自适应稀疏 Prefill · paper_card 1197 已入库)+ arXiv:2601.07504(FROAV · RAG 观察与 Agent 验证框架)

一、本棒检查过的来源清单

1.1 work-queue.md(2026-09-14 18:00 自动生成)

  • 选题榜未成视频脚本 1 件:2609.10226(Φ-Bench · inference 主轴邻接 · 已锚入 v3.32 预备级)
  • 待写攻略 Top 15 / 共 2 件(bishop555/Solana-Drainer-Tool Tom 认领 / Armur-Ai/Pentest-Swarm-AI Jay 认领)
  • 富化缺口 15 张卡缺 TLDR
  • 待精确分类 1 张卡(cron_classify_llm 低峰消化)
  • 无 inference 专项主题缺货警告

1.2 inbox/tom 9-14 棒位

  • 2026-09-14T2040-agent-rag-longcontext-radar.md(20:41 CST · 第 3 次 radar · MaP-WAM + Think Before You Link + ActReview + Substack Agent Memory Is Not RAG)
  • 2026-09-14T1440-agent-rag-longcontext-radar.md(14:41 CST · 第 2 次 radar)
  • 2026-09-14-0900-hf-daily-2026-09-14.md(09:00 CST · 15 篇 · HyQuant arXiv:2608.27875 31▲ 净新增 ★ + WMRL 447▲ + NCP-ArchPreview 293▲)
  • 2026-09-14-rag-e1prep.md(08:52 CST · RAG 主轴 · 含 Agent Memory 三路对比框架:Akashic vs MaP-WAM vs δ-mem)
  • 2026-09-14-evaluation-e1prep.md(15:42 CST · Evaluation 主轴)
  • 2026-09-14_agents-lite.md(09:11 CST · agents lite)
  • 2026-09-14-1004-rss-yt-lex-fridman.md + 2026-09-14-1004-rss-yt-yannic-kilcher.md(10:04 CST · 无 inference 相关)

1.3 inbox/jay 9-14 全天 inference 相关工程文件

  • 2026-09-14-1005-github-trending-inference-rag-2026.md(10:05 CST · GitHub Trending + vLLM vs SGLang 推理引擎对比 + RAG 框架生态)
  • 2026-09-14-1050-jay-engineering-agent-observability-2026.md(10:51 CST · Engineering filter · 10 候选 8 保留)
  • 2026-09-14-1105-jay-five-category-briefing.md(11:07 CST · Awesome-LLM-Inference-Engine ACM TIST 2026 + vLLM V1 架构重构 ★ + vLLM Blog V1 架构重构 ★)
  • 2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(12:21 CST · CSDN + Substack · Agent 上下文工程四机制 ★)
  • 2026-09-14-1335-jay-hf-state-openmodels-nanochat-inference-deerflow-substack.md(13:35 CST · 核心源 = HF State of Open Models Summer 2026 + nanochat 57.5k+ ★ + vLLM vs Triton vs NIM K8s 决策框架 ★ + vLLM PD Disaggregation AMD MI300X ★ + DeerFlow + FROAV arXiv:2601.07504 ★
  • 2026-09-14T1505-jay-five-category-briefing.md(15:05 CST · 核心源 = SGLang vs vLLM vs LMDeploy 2026-09 最新基准 ★ + ACM FSE 2026 Bug 研究 arXiv:2508.04925 ★ + InferLog ACM 2026-09-11 ★ + vLLM 生产部署全面指南 ★ + TGI 即将退场 ★
  • 2026-09-14-ai-engineering-github-huggingface.md(17:35 CST · AI Agent 技术栈 2026 + The AI Agents Stack 2026 Edition ★)
  • 2026-09-14-database-backend-cloudnative-inference.md(21:07 CST · Database/Backend/Inference 混合简报)

1.4 inbox/spark 9-14 llm-infra e1prep(2026-09-14 18:40 CST)

  • 本棒 llm-infra 主轴核心 = 7 件 NET-new:HyQuant arXiv:2608.27875(⭐⭐⭐⭐,31▲ 新立标)+ vLLM vs Triton vs NIM K8s 决策框架(⭐⭐⭐⭐)+ ACM FSE 2026 Bug 研究 arXiv:2508.04925(⭐⭐⭐⭐)+ SGLang vs vLLM 2026-09 最新基准(⭐⭐⭐⭐)+ vLLM V1 架构重构(⭐⭐⭐⭐)+ InferLog(⭐⭐⭐)+ Karpathy nanochat(⭐⭐⭐⭐⭐)
  • 0 件 llm-infra 主分类 NET-new paper_card 入库(paper_cards 1334→1344,+10 张净增但 0 张主分类 llm-infra)

1.5 inbox/flyp 9-14 multimodal + risk e1prep

  • 2026-09-14-multimodal-e1prep.md(09:43 CST · multimodal 主轴 · 无 inference 主轴净增量)
  • 2026-09-14-risk-e1prep.md(09:43 CST · risk 主轴 · 无 inference 主轴净增量)
  • 2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md(09:51 CST · MMProLong,邻接长上下文子轴)
  • 2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md(09:51 CST · LHTB,邻接 Kernel/Harness 子轴)

1.6 inbox/stephen 9-14 ai-industry e1prep(2026-09-14 13:36 CST)

  • 无 inference 主轴净增量;paper_cards 9-14 全天批次共 +10 张净增(1334→1344),0 张主分类 inference

1.7 paper_cards 近 3 天新卡(Sep 11-14 入库)

编号 arXiv 标题 主分类 与 inference 关系
1197 2609.01925 CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling llm-infra 邻接(输入自适应稀疏 prefill · C_struct 路由消除 pooled matmul + KL overhead)
1338 2609.11115 Benchmark Radar: A Living Database for AI Benchmarks evaluation 邻接(benchmark 搜索引擎)
1339 2609.11682 COBRA-Skills agent 邻接(Agent skill 优化)
1337 2609.13146 SNAP3D multimodal 邻接(3D 生成)
1336 2609.13141 SAS: Simple Attention Sparsification engineering 邻接(注意力稀疏化)
1335 2609.12641 Breaking Vision-Action Shortcut engineering 邻接(多模态)
1340 2608.30597 PLC-DPO engineering 邻接(训练)

今日无新增主分类 inference 的 paper_card 入库。v3.32 cutoff(2026-09-14 05:00 CST)之前已入库的 inference 主轴卡片已全部锚入完毕。

1.8 inference.md 活文档基线确认(v3.32 · 2026-09-14 05:00 升档)

  • inference.md v3.32 已覆盖:NVIDIA Dynamo 1.0 + SGLang v0.5.19 Beam Search + vLLM V1 五项 + vLLM v0.20.2/v0.29.0rc3 + vLLM Speculators v0.3.0 + vLLM RDT + vLLM Router + vLLM K8s 冷启动 8min→1min + vLLM prefix cache 16-token 边界踩坑 + vLLM 0.19.0 + vLLM Blackwell/GB200 26.2k tok/s + SGLang v0.6 + SGLang BCG + SGLang DeepSeek MLA 3.1× + SGLang EAGLE + LMDeploy TurboMind + TensorRT-LLM v1.2.1 + RTP-LLM + MAX + HF WebGPU + Detokenization Leaks(arXiv:2609.06674)+ CoRL Least Privilege(arXiv:2609.07529)+ Φ-Bench(arXiv:2609.10226 预备级)+ OmniKVQuant(arXiv:2609.11582)+ Akashic MemAttention(arXiv:2607.05708)+ KV cache 质量恢复(arXiv:2609.04263)+ KVarN(arXiv:2606.03458)+ LiteKV(IEEE INFOCOM 2026)+ TokenWeave(arXiv:2505.11329)+ iFAN(arXiv:2608.03216)+ FreeToken(arXiv:2608.16157)+ Uno(arXiv:2609.04010)+ A*-Thought-V2(arXiv:2609.07821)+ Awesome-LLM-Inference-Engine(ACM TIST 2026)+ CRISP(arXiv:2609.01925,paper_card 1197 已入库)
  • 沿用件套(v3.32 闭合级)= arXiv:2609.03430 + arXiv:2606.19746 + arXiv:2609.01316 + arXiv:2609.01777 + arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2508.08438 + arXiv:2609.06008 + arXiv:2609.07139 + arXiv:2609.04971 + arXiv:2509.01809 + arXiv:2609.11412 + arXiv:2609.11294 + arXiv:2609.10266 + arXiv:2609.11561 + arXiv:2609.11294

二、增量条目(4 条主增量)


增量 ① HyQuant:首条 Attention 混合精度量化新立标(NET-new 方法学级 · ⭐⭐⭐⭐)

  • 来源:tom 9-14 0900 hf-daily-2026-09-14.md §14(HF Daily 9-14 早棒 15 件 #14 · 31▲ 净新增)+ spark 9-14 llm-infra e1prep 增量 ①
  • 要点HyQuant = 面向 LLM Attention 的混合精度量化。HF Daily 9-14 早棒立标信号 31▲(净新增,24h 票数稳态起步)。核心定位:填补 attention 计算层本身的混合精度量化理论空白——v3.32 已锚入 TurboQuant(NVFP4 · NVIDIA)+ KIVI(2-bit KV cache)+ RotateKV + KVLinC + KVarN + OmniKVQuant(异构模态感知)+ Low-Rank KV Cache 质量恢复 + LiteKV(边缘推理)+ Akashic MemAttention(长期记忆持久化),但这些均聚焦 KV cache 量化,而 HyQuant 聚焦 Attention 权重计算本身的混合精度,是独立的优化维度。与 NVIDIA NVFP4 Blackwell B200 形成"硬件 + 算法双层混合精度"互补。
  • 与活文档现有脉络的关系:与 inference.md §1.(4) 量化子轴直接关联。v3.32 §1.(4) 已有 TurboQuant(PolarQuant + QJL · NVFP4)、KIVI、RotateKV、KVLinC、KVarN、OmniKVQuant、Low-Rank Recovery、LiteKV。HyQuant 填补"Attention 层权重量化"这一独立维度,与 KV cache 量化(KIVI/OmniKVQuant/LiteKV 等)形成方法学区分。
  • 建议归入节:§1.(4) 量化子轴(HyQuant arXiv:2608.27875:面向 LLM Attention 的混合精度量化 · 31▲ HF Daily 9-14 #14 新立标 · paper_card 暂未入库 ⚠️)
  • arXiv 号清单arXiv:2608.27875 = 1 件 NET-new inference 主轴(paper_card 暂未入库,需关注)
  • 可信度:★★★★(HF Daily 31▲ 净新增立标信号,稳态起步,paper_card 待入库)

增量 ② ACM FSE 2026 LLM 推理引擎 Bug 系统研究(NET-new 方法学级 · ⭐⭐⭐⭐)

  • 来源:jay 9-14 15:05 five-category-briefing §Backend §3(arXiv:2508.04925 · ACM FSE 2026 · 2026-09)+ spark 9-14 llm-infra e1prep 增量 ③
  • 要点ACM FSE 2026 首次系统性梳理 vLLM/SGLang 等推理引擎中的真实 bug 模式。核心贡献:① 真实 bug 模式分类(涵盖调度、内存管理、量化、分布式等);② 触发条件分析;③ 修复策略汇总。这是目前最完整的 LLM 推理引擎工程可靠性研究。推理引擎开发/运营团队必读。arXiv ID 2508.04925 此前已锚入 v3.31 arXiv ID 列表(338 件闭合),但未在 §1.(1) 推理引擎方法学或 §1.(11) Kernel/Harness 子轴正式锚入章节预备级,本次首次建议补强方法学锚入。
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学 + §1.(11) Kernel/Harness 子轴直接关联。v3.32 已锚入 SGLang v0.5.19(786 PR)、vLLM v0.20.2/v0.29.0rc3、NVIDIA Dynamo 1.0(4× TTFT)、vLLM V1(1.7× throughput)等性能锚点,但缺乏"系统性 bug 模式"的可靠性理论维度。ACM FSE 2026 Bug 研究填补这一空白,与推理引擎可复现性研究(arXiv:2605.19537,v3.32 预备级)共同构成"性能 + 可靠性"双维度的推理引擎工程图谱。
  • 建议归入节:§1.(1) 推理引擎方法学(ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925:系统性梳理 vLLM/SGLang 真实 bug 模式 · 首条工程可靠性方法学)+ §1.(11) Kernel/Harness 子轴(Engineering Reliability 新维度补充)
  • arXiv 号清单arXiv:2508.04925 = 1 件 NET-new inference 主轴(arXiv ID 已锚入 v3.31 列表,章节方法学锚入本次首次建议)
  • 可信度:★★★★(ACM FSE 2026 同行评审,系统性研究,9-14 jay 下午棒位最新抓取)

增量 ③ vLLM V1 架构重构九月里程碑:重新架构引擎 + Blackwell FP4 + Docker Model Runner(NET-new 事件级 · ⭐⭐⭐⭐)

  • 来源:jay 9-14 11:07 five-category-briefing §Backend §4(vLLM.ai blog 2026-09)+ jay 9-14 13:35 hf-state-openmodels-nanochat-inference-deerflow-substack §三.4(vLLM 官方博客 2026 年帖子)+ spark 9-14 llm-infra e1prep 增量 ⑤
  • 要点vLLM V1 架构重构官方博客系列(2026-09)。核心五项重构:① 重新架构引擎(自 PagedAttention 以来最大架构重写);② Near-zero 开销 prefix caching;③ Blackwell FP4 kernels(Pareto 前沿 benchmark);④ Session-Aware Agentic Routing(连续任务中的模型选择机制);⑤ Docker Model Runner 集成(vLLM 作为推理后端集成到 Docker 工作流,safetensors + PagedAttention + 流式输出 + OpenAI 兼容 API)。额外数字:MRv2 在小模型上实现 56% 吞吐提升(将输入准备 offload 到 GPU);支持 GPTQ/AWQ/AutoRound/INT4/INT8/FP8。vLLM Korea Meetup 2026:社区增长 + V1 更新 + 生产栈采纳 + AMD MI300X PD Disaggregation(mori-IO 单节点分离)。
  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学已锚入的 vLLM V1 五项直接更新(v3.32 §1.1 已有 V1 五项概述)。本次补充:① Blackwell FP4 kernels 正式发布;② Docker Model Runner 集成生产就绪;③ MRv2 56% 吞吐数字;④ Session-Aware Agentic Routing 新增。vLLM V1 = 2026-09 官方架构级里程碑,是 v3.32 inference.md 的重大更新节点。
  • 建议归入节:§1.(1) 推理引擎方法学(vLLM V1 架构重构九月里程碑:Blackwell FP4 kernels + Docker Model Runner + MRv2 56% + Session-Aware Agentic Routing + AMD MI300X PD Disaggregation)
  • arXiv 号清单:无 direct arXiv(vLLM 官方博客);相关 = arXiv:2603.16104(PD disaggregation 适用场景)
  • 可信度:★★★★(vLLM 官方博客 2026-09,9-14 jay 早棒 + 下午棒双棒位确认)

增量 ④ vLLM vs Triton vs NIM K8s 决策框架:2×A100 80GB 月度成本全披露(NET-new 方法学级 · ⭐⭐⭐⭐)

  • 来源:jay 9-14 13:35 hf-state-openmodels-nanochat-inference-deerflow-substack §三.3(lucaberton.com 2026-09)+ jay 9-14 15:05 five-category-briefing §Backend §1 确认
  • 要点完整 K8s 推理服务三引擎对比(2×A100 80GB · 月度成本精细化):
指标 vLLM Triton+vLLM NIM
吞吐量(tok/s) 2,100 1,950 2,400
TTFT P50 180ms 210ms 150ms
TTFT P99 450ms 520ms 380ms
ITL P50 28ms 32ms 24ms
内存效率 92% 88% 95%
部署时间 10 min 30 min 2 min
软件许可成本 $0 $0 ~$4,500/月
年度总成本(1年) ~$59,940 ~$63,540 ~$110,940

决策建议:① 选 vLLM = 有 ML 平台工程师 + 追求成本效益 + 纯 LLM serving;② 选 Triton+vLLM = 多模型 pipeline + ensemble + 需要 TensorRT-LLM 优化;③ 选 NIM = 无 ML 基础设施专家 + 需要快速上线和 vendor 支持。Netflix 案例:Netflix 内部 LLM 服务平台已采用 Triton + vLLM backend 方案(InfoQ 2026-07-27)。NVIDIA Dynamo = Triton 的后继者,用于 LLM 推理。

  • 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学已锚入的 NVIDIA NIM 2.0(v3.32 §1.1)直接补充——v3.32 锚入"NIM = one container one backend 基于 vLLM",本次补充完整的 K8s 成本模型和性能数字,形成"产品定位 + 成本效益"双维度决策框架。与 §4.1 推理经济学子轴邻接。
  • 建议归入节:§1.(1) 推理引擎方法学(vLLM vs Triton vs NIM K8s 决策框架:NIM TTFT P99 380ms vs vLLM 450ms vs Triton+vLLM 520ms · 吞吐量 NIM 2,400 vs vLLM 2,100 vs Triton+vLLM 1,950 tok/s · 年度成本 NIM $110,940 vs vLLM $59,940 vs Triton+vLLM $63,540 · Netflix Triton+vLLM backend 案例)
  • arXiv 号清单:无 direct arXiv(技术博客 lucaberton.com);与 inference.md §1.1 NVIDIA NIM 2.0 预备扩增
  • 可信度:★★★★(工程基准数据,月度成本精确数字,四源 Prem AI + Spheron + Turion.AI + Lyceum Technology 交叉验证方向,来源可靠)

附:SGLang vs vLLM 2026-09 数字澄清(数字修正,非独立增量 · ⭐⭐⭐)

  • 来源:jay 9-14 15:05 five-category-briefing §Backend §1(Prem AI Blog + Spheron + Turion.AI + Lyceum Technology 四源)
  • 要点2026-09 最新精细数字澄清,解决 v3.32 已锚入"29% 差距"与通用负载"≤4%"的表面矛盾:
  • H100 FP16 通用负载(50 并发):SGLang 1,920 vs vLLM 1,850 tok/s(差距 ≤4%
  • H100 Llama 3.1 8B:SGLang 16,215 vs vLLM 12,500 tok/s(差距 +29% SGLang)
  • DeepSeek V3 专属(Particula Tech):SGLang 比 vLLM 吞吐量高 29%,推理速度 3.1× faster(MLA + FlashAttention3/FlashMLA/CutlassMLA 优化链)
  • Q2 2026 百万 Token 成本:SGLang $0.51 vs vLLM $0.55 vs TGI $0.63
  • TGI 即将退场(Turion.AI 2026-09 确认)
  • vLLM 生态最成熟:74.9k GitHub stars
  • 核心结论:两者均已成熟;通用负载差距 ≤4%(实际选型影响有限);SGLang 在 DeepSeek/多轮对话场景优势明确;vLLM 是新项目默认推荐
  • 与活文档现有脉络的关系:澄清 v3.32 §1.(2) 推理调度子轴中"SGLang vs vLLM vs LMDeploy 选型决策树"的数字前提——"29% 差距"是 Llama 3.1 8B 专项数据,不是通用负载数据;通用负载差距已收窄至 ≤4%。与 v3.32 §1.1 NVIDIA Dynamo 1.0 邻接。
  • 建议归入节:§1.(2) 推理调度子轴(2026-09 SGLang vs vLLM 数字澄清:通用负载 ≤4% vs Llama 3.1 8B +29% · Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63 · TGI 即将退场)
  • arXiv 号清单:无 direct arXiv(四源 Prem AI + Spheron + Turion.AI + Lyceum Technology 交叉验证)
  • 可信度:★★★★(四源交叉验证,H100 实测,9-14 jay 下午棒位最新棒位)

三、矛盾/待核实条目

待核实 ① HyQuant paper_card 暂未入库 + 章节锚入时机

  • 问题描述:HyQuant arXiv:2608.27875 HF Daily 9-14 早棒 31▲ 净新增立标信号稳态起步,paper_card 暂未入库。v3.32 §1.(4) 量化子轴未实质锚入章节预备级。
  • 建议动作:关注 HyQuant paper_card 入库时间节点;入库后正式锚入 §1.(4) 量化子轴预备级

待核实 ② ACM FSE 2026 arXiv:2508.04925 的章节方法学锚入 vs arXiv ID 列表锚入的区分

  • 问题描述:arXiv:2508.04925 已锚入 v3.31 arXiv ID 列表(338 件闭合),但未在 §1.(1) 推理引擎方法学或 §1.(11) Kernel/Harness 子轴正式锚入章节预备级。arXiv ID 列表闭合 ≠ 章节方法学锚入闭合。
  • 建议动作:在 §1.(1) + §1.(11) 正式锚入 ACM FSE 2026 Bug 研究作为推理引擎工程可靠性维度

待核实 ③ SGLang vs vLLM "通用负载差距 ≤4%" 是否为趋势性变化

  • 问题描述:jay 9-14 15:05 给出"通用负载差距已收窄至 4% 以内"(原 29% 差距是 Llama 3.1 8B 专项数据)。"趋势性变化 vs 测试条件差异"哪个是主因尚需核实。
  • 建议动作:精读 Prem AI Blog + Spheron + Turion.AI + Lyceum Technology 四源原文,核对硬件配置前提(模型类别 + 并发数 + batch size)

四、可引用的 arXiv 号列表

arXiv 号 标题 主分类 形态 锚定位置
2608.27875 HyQuant: 面向 LLM Attention 的混合精度量化 inference method 本棒增量 ① · §1.(4) 量化子轴 NET-new · paper_card 暂未入库 ⚠️
2508.04925 ACM FSE 2026 LLM 推理引擎 Bug 系统研究 inference method 本棒增量 ② · §1.(1) + §1.(11) NET-new 章节方法学锚入(arXiv ID 已锚 v3.31 列表)
2609.01925 CRISP: 输入自适应稀疏 Prefill llm-infra method paper_card 1197 已入库 · 邻接 §1.(3) KV Cache 子轴
2601.07504 FROAV: RAG 观察与 Agent 验证框架 rag method 邻接 §1.(11) Kernel/Harness 子轴 · Docker Compose + n8n + PostgreSQL + FastAPI
2607.05708 Akashic MemAttention inference method v3.32 已锚入预备级
2605.19537 推理引擎可复现性 inference method v3.32 预备级
2609.04263 Low-Rank KV Cache 质量恢复 inference method v3.32 预备级
2609.11582 OmniKVQuant inference method v3.32 预备级
2609.10226 Φ-Bench llm-infra benchmark v3.32 预备级
2609.06674 Detokenization Leaks security vulnerability v3.32 已锚入 §3.5
2609.07529 CoRL Least Privilege agent method v3.32 已锚入 §3.5
2609.10266 KVShareArena llm-infra benchmark v3.32 已锚入 §1.(3)
2609.11561 MaP-WAM agent method v3.32 已锚入 §1.(11)

五、给今晚活文档接力的建议

今晚 inference 活文档(knowledge/inference.md)接力方向建议:

  1. §1.(4) 量化子轴 补入 HyQuant(arXiv:2608.27875):首条 Attention 层混合精度量化,31▲ HF Daily 9-14 新立标,与 KV cache 量化(KIVI/OmniKVQuant/LiteKV 等)形成方法学区分,paper_card 待入库后正式锚入
  2. §1.(1) 推理引擎方法学 补入 ACM FSE 2026 Bug 研究(arXiv:2508.04925):首条系统性 LLM 推理引擎可靠性方法学(v3.31 arXiv ID 列表已锚,本次首次章节方法学锚入);与推理引擎可复现性(arXiv:2605.19537)共同构成"性能 + 可靠性"双维度
  3. §1.(1) 推理引擎方法学 更新 vLLM V1 九月里程碑:Blackwell FP4 kernels + Docker Model Runner + MRv2 56% + Session-Aware Agentic Routing + AMD MI300X PD Disaggregation
  4. §1.(1) 推理引擎方法学 补入 vLLM vs Triton vs NIM K8s 决策框架:完整 2×A100 80GB 月度成本模型(vLLM $59,940/yr vs Triton+vLLM $63,540/yr vs NIM $110,940/yr)+ 性能数字 + Netflix 案例
  5. §1.(2) 推理调度子轴 更新 SGLang vs vLLM 数字澄清:通用负载 ≤4% vs Llama 3.1 8B +29% · Q2 2026 百万 Token 成本 + TGI 退场
  6. §1.(3) KV Cache 子轴 补入 CRISP(arXiv:2609.01925,paper_card 1197):C_struct 路由替代 JSD,消除 pooled matmul + KL divergence overhead
  7. 待核实项目:HyQuant paper_card 入库时机(P0);ACM FSE 2026 Bug 研究章节锚入(P1);SGLang vs vLLM ≤4% 趋势性核实(P2)

六、本棒检查过的来源完整清单

work-queue.md(2026-09-14 18:00)
inference.md(v3.32,2026-09-14 05:00 升档)
inbox/tom/2026-09-13-inference-e1prep.md(昨夜基准)
inbox/tom/2026-09-12-inference-e1prep.md(9-12 基准)
inbox/tom/2026-09-11-inference-e1prep.md(9-11 基准)
inbox/tom/2026-09-10-inference-e1prep.md(9-10 基准)
inbox/tom/2026-09-14T2040-agent-rag-longcontext-radar.md
inbox/tom/2026-09-14T1440-agent-rag-longcontext-radar.md
inbox/tom/2026-09-14-0900-hf-daily-2026-09-14.md
inbox/tom/2026-09-14-rag-e1prep.md
inbox/tom/2026-09-14-evaluation-e1prep.md
inbox/tom/2026-09-14_agents-lite.md
inbox/tom/2026-09-14-1004-rss-yt-lex-fridman.md
inbox/tom/2026-09-14-1004-rss-yt-yannic-kilcher.md
inbox/jay/2026-09-14-1005-github-trending-inference-rag-2026.md
inbox/jay/2026-09-14-1050-jay-engineering-agent-observability-2026.md
inbox/jay/2026-09-14-1105-jay-five-category-briefing.md
inbox/jay/2026-09-14-1220-jay-context-engineering-harness-dario-substack.md
inbox/jay/2026-09-14-1335-jay-hf-state-openmodels-nanochat-inference-deerflow-substack.md
inbox/jay/2026-09-14T1505-jay-five-category-briefing.md
inbox/jay/2026-09-14-ai-engineering-github-huggingface.md
inbox/jay/2026-09-14-database-backend-cloudnative-inference.md
inbox/jay/2026-09-14-1001-rss-cool-papers-ir.md
inbox/jay/2026-09-14-1000-rss-bytebytego.md
inbox/jay/2026-09-14-1001-rss-cool-papers.md
inbox/spark/2026-09-14-llm-infra-e1prep.md(18:40 CST)
inbox/spark/2026-09-13-llm-infra-e1prep.md
inbox/flyp/2026-09-14-multimodal-e1prep.md
inbox/flyp/2026-09-14-risk-e1prep.md
inbox/flyp/2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md
inbox/flyp/2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md
inbox/stephen/2026-09-14-ai-industry-e1prep.md
inbox/stephen/2026-09-14-1245-stephen-coordination-check-noon.md
paper_cards/ Sep 11-14 入库卡:118/119/1191/1197/1304/1314/1315/1317/1318/1319/1320/1322/1323/1328/1329/1330/1331/1332/1333/1334/1335/1336/1337/1338/1339/1340(共 27 张)

Tom · 2026-09-14 22:20 CST · E1 预消化 · inference · 4 条主增量(HyQuant ⭐⭐⭐⭐ + ACM FSE 2026 Bug 研究 ⭐⭐⭐⭐ + vLLM V1 九月里程碑 ⭐⭐⭐⭐ + vLLM vs Triton vs NIM K8s 决策框架 ⭐⭐⭐⭐)+ 附:SGLang vs vLLM 数字澄清)+ 4 件涉及 arXiv 号