inference · E1 预消化简报(2026-09-14)
状态摘要
- 增量条数:4 条主增量(在 3-8 目标区间内;性质属 v3.32(2026-09-14 05:00 升档)后约 9h 净窗口期,核心 = ① HyQuant 首条 Attention 混合精度量化新立标 + ② ACM FSE 2026 推理引擎系统性 Bug 研究 + ③ vLLM V1 架构重构九月里程碑 + ④ K8s 三引擎成本精细化决策框架 + 附:SGLang vs vLLM 通用负载差距数字澄清)
- 性质:本棒属 v3.32 落定后约 9h 净窗口期,核心贡献 = ① HyQuant 首条 Attention 混合精度量化新立标(arXiv:2608.27875,HF Daily 31▲,paper_card 暂未入库)+ ② ACM FSE 2026 推理引擎系统性 Bug 研究(arXiv:2508.04925,首条工程可靠性方法学)+ ③ vLLM V1 架构重构九月里程碑(重新架构引擎 + Blackwell FP4 kernels + Docker Model Runner)+ ④ vLLM vs Triton vs NIM K8s 成本精细化决策框架(2×A100 80GB 月度成本全披露)
- 涉及 arXiv 号:arXiv:2608.27875(HyQuant · Attention 混合精度量化 · 31▲ 新立标)+ arXiv:2508.04925(ACM FSE 2026 · LLM 推理引擎 Bug 系统研究)+ arXiv:2609.01925(CRISP · 输入自适应稀疏 Prefill · paper_card 1197 已入库)+ arXiv:2601.07504(FROAV · RAG 观察与 Agent 验证框架)
一、本棒检查过的来源清单
1.1 work-queue.md(2026-09-14 18:00 自动生成)
- 选题榜未成视频脚本 1 件:2609.10226(Φ-Bench · inference 主轴邻接 · 已锚入 v3.32 预备级)
- 待写攻略 Top 15 / 共 2 件(bishop555/Solana-Drainer-Tool Tom 认领 / Armur-Ai/Pentest-Swarm-AI Jay 认领)
- 富化缺口 15 张卡缺 TLDR
- 待精确分类 1 张卡(cron_classify_llm 低峰消化)
- 无 inference 专项主题缺货警告
1.2 inbox/tom 9-14 棒位
2026-09-14T2040-agent-rag-longcontext-radar.md(20:41 CST · 第 3 次 radar · MaP-WAM + Think Before You Link + ActReview + Substack Agent Memory Is Not RAG)2026-09-14T1440-agent-rag-longcontext-radar.md(14:41 CST · 第 2 次 radar)2026-09-14-0900-hf-daily-2026-09-14.md(09:00 CST · 15 篇 · HyQuant arXiv:2608.27875 31▲ 净新增 ★ + WMRL 447▲ + NCP-ArchPreview 293▲)2026-09-14-rag-e1prep.md(08:52 CST · RAG 主轴 · 含 Agent Memory 三路对比框架:Akashic vs MaP-WAM vs δ-mem)2026-09-14-evaluation-e1prep.md(15:42 CST · Evaluation 主轴)2026-09-14_agents-lite.md(09:11 CST · agents lite)2026-09-14-1004-rss-yt-lex-fridman.md+2026-09-14-1004-rss-yt-yannic-kilcher.md(10:04 CST · 无 inference 相关)
1.3 inbox/jay 9-14 全天 inference 相关工程文件
2026-09-14-1005-github-trending-inference-rag-2026.md(10:05 CST · GitHub Trending + vLLM vs SGLang 推理引擎对比 + RAG 框架生态)2026-09-14-1050-jay-engineering-agent-observability-2026.md(10:51 CST · Engineering filter · 10 候选 8 保留)2026-09-14-1105-jay-five-category-briefing.md(11:07 CST · Awesome-LLM-Inference-Engine ACM TIST 2026 + vLLM V1 架构重构 ★ + vLLM Blog V1 架构重构 ★)2026-09-14-1220-jay-context-engineering-harness-dario-substack.md(12:21 CST · CSDN + Substack · Agent 上下文工程四机制 ★)2026-09-14-1335-jay-hf-state-openmodels-nanochat-inference-deerflow-substack.md(13:35 CST · 核心源 = HF State of Open Models Summer 2026 + nanochat 57.5k+ ★ + vLLM vs Triton vs NIM K8s 决策框架 ★ + vLLM PD Disaggregation AMD MI300X ★ + DeerFlow + FROAV arXiv:2601.07504 ★)2026-09-14T1505-jay-five-category-briefing.md(15:05 CST · 核心源 = SGLang vs vLLM vs LMDeploy 2026-09 最新基准 ★ + ACM FSE 2026 Bug 研究 arXiv:2508.04925 ★ + InferLog ACM 2026-09-11 ★ + vLLM 生产部署全面指南 ★ + TGI 即将退场 ★)2026-09-14-ai-engineering-github-huggingface.md(17:35 CST · AI Agent 技术栈 2026 + The AI Agents Stack 2026 Edition ★)2026-09-14-database-backend-cloudnative-inference.md(21:07 CST · Database/Backend/Inference 混合简报)
1.4 inbox/spark 9-14 llm-infra e1prep(2026-09-14 18:40 CST)
- 本棒 llm-infra 主轴核心 = 7 件 NET-new:HyQuant arXiv:2608.27875(⭐⭐⭐⭐,31▲ 新立标)+ vLLM vs Triton vs NIM K8s 决策框架(⭐⭐⭐⭐)+ ACM FSE 2026 Bug 研究 arXiv:2508.04925(⭐⭐⭐⭐)+ SGLang vs vLLM 2026-09 最新基准(⭐⭐⭐⭐)+ vLLM V1 架构重构(⭐⭐⭐⭐)+ InferLog(⭐⭐⭐)+ Karpathy nanochat(⭐⭐⭐⭐⭐)
- 0 件 llm-infra 主分类 NET-new paper_card 入库(paper_cards 1334→1344,+10 张净增但 0 张主分类 llm-infra)
1.5 inbox/flyp 9-14 multimodal + risk e1prep
2026-09-14-multimodal-e1prep.md(09:43 CST · multimodal 主轴 · 无 inference 主轴净增量)2026-09-14-risk-e1prep.md(09:43 CST · risk 主轴 · 无 inference 主轴净增量)2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md(09:51 CST · MMProLong,邻接长上下文子轴)2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md(09:51 CST · LHTB,邻接 Kernel/Harness 子轴)
1.6 inbox/stephen 9-14 ai-industry e1prep(2026-09-14 13:36 CST)
- 无 inference 主轴净增量;paper_cards 9-14 全天批次共 +10 张净增(1334→1344),0 张主分类 inference
1.7 paper_cards 近 3 天新卡(Sep 11-14 入库)
| 编号 | arXiv | 标题 | 主分类 | 与 inference 关系 |
|---|---|---|---|---|
| 1197 | 2609.01925 | CRISP: Cliff-awaRe Input-adaptive Sparse Prefilling | llm-infra | 邻接(输入自适应稀疏 prefill · C_struct 路由消除 pooled matmul + KL overhead) |
| 1338 | 2609.11115 | Benchmark Radar: A Living Database for AI Benchmarks | evaluation | 邻接(benchmark 搜索引擎) |
| 1339 | 2609.11682 | COBRA-Skills | agent | 邻接(Agent skill 优化) |
| 1337 | 2609.13146 | SNAP3D | multimodal | 邻接(3D 生成) |
| 1336 | 2609.13141 | SAS: Simple Attention Sparsification | engineering | 邻接(注意力稀疏化) |
| 1335 | 2609.12641 | Breaking Vision-Action Shortcut | engineering | 邻接(多模态) |
| 1340 | 2608.30597 | PLC-DPO | engineering | 邻接(训练) |
今日无新增主分类 inference 的 paper_card 入库。v3.32 cutoff(2026-09-14 05:00 CST)之前已入库的 inference 主轴卡片已全部锚入完毕。
1.8 inference.md 活文档基线确认(v3.32 · 2026-09-14 05:00 升档)
- inference.md v3.32 已覆盖:NVIDIA Dynamo 1.0 + SGLang v0.5.19 Beam Search + vLLM V1 五项 + vLLM v0.20.2/v0.29.0rc3 + vLLM Speculators v0.3.0 + vLLM RDT + vLLM Router + vLLM K8s 冷启动 8min→1min + vLLM prefix cache 16-token 边界踩坑 + vLLM 0.19.0 + vLLM Blackwell/GB200 26.2k tok/s + SGLang v0.6 + SGLang BCG + SGLang DeepSeek MLA 3.1× + SGLang EAGLE + LMDeploy TurboMind + TensorRT-LLM v1.2.1 + RTP-LLM + MAX + HF WebGPU + Detokenization Leaks(arXiv:2609.06674)+ CoRL Least Privilege(arXiv:2609.07529)+ Φ-Bench(arXiv:2609.10226 预备级)+ OmniKVQuant(arXiv:2609.11582)+ Akashic MemAttention(arXiv:2607.05708)+ KV cache 质量恢复(arXiv:2609.04263)+ KVarN(arXiv:2606.03458)+ LiteKV(IEEE INFOCOM 2026)+ TokenWeave(arXiv:2505.11329)+ iFAN(arXiv:2608.03216)+ FreeToken(arXiv:2608.16157)+ Uno(arXiv:2609.04010)+ A*-Thought-V2(arXiv:2609.07821)+ Awesome-LLM-Inference-Engine(ACM TIST 2026)+ CRISP(arXiv:2609.01925,paper_card 1197 已入库)
- 沿用件套(v3.32 闭合级)= arXiv:2609.03430 + arXiv:2606.19746 + arXiv:2609.01316 + arXiv:2609.01777 + arXiv:2606.17104 + arXiv:2607.02574 + arXiv:2604.25724 + arXiv:2603.16104 + arXiv:2506.21901 + arXiv:2508.08438 + arXiv:2609.06008 + arXiv:2609.07139 + arXiv:2609.04971 + arXiv:2509.01809 + arXiv:2609.11412 + arXiv:2609.11294 + arXiv:2609.10266 + arXiv:2609.11561 + arXiv:2609.11294
二、增量条目(4 条主增量)
增量 ① HyQuant:首条 Attention 混合精度量化新立标(NET-new 方法学级 · ⭐⭐⭐⭐)
- 来源:tom 9-14 0900 hf-daily-2026-09-14.md §14(HF Daily 9-14 早棒 15 件 #14 · 31▲ 净新增)+ spark 9-14 llm-infra e1prep 增量 ①
- 要点:HyQuant = 面向 LLM Attention 的混合精度量化。HF Daily 9-14 早棒立标信号 31▲(净新增,24h 票数稳态起步)。核心定位:填补 attention 计算层本身的混合精度量化理论空白——v3.32 已锚入 TurboQuant(NVFP4 · NVIDIA)+ KIVI(2-bit KV cache)+ RotateKV + KVLinC + KVarN + OmniKVQuant(异构模态感知)+ Low-Rank KV Cache 质量恢复 + LiteKV(边缘推理)+ Akashic MemAttention(长期记忆持久化),但这些均聚焦 KV cache 量化,而 HyQuant 聚焦 Attention 权重计算本身的混合精度,是独立的优化维度。与 NVIDIA NVFP4 Blackwell B200 形成"硬件 + 算法双层混合精度"互补。
- 与活文档现有脉络的关系:与 inference.md §1.(4) 量化子轴直接关联。v3.32 §1.(4) 已有 TurboQuant(PolarQuant + QJL · NVFP4)、KIVI、RotateKV、KVLinC、KVarN、OmniKVQuant、Low-Rank Recovery、LiteKV。HyQuant 填补"Attention 层权重量化"这一独立维度,与 KV cache 量化(KIVI/OmniKVQuant/LiteKV 等)形成方法学区分。
- 建议归入节:§1.(4) 量化子轴(HyQuant arXiv:2608.27875:面向 LLM Attention 的混合精度量化 · 31▲ HF Daily 9-14 #14 新立标 · paper_card 暂未入库 ⚠️)
- arXiv 号清单:
arXiv:2608.27875= 1 件 NET-new inference 主轴(paper_card 暂未入库,需关注) - 可信度:★★★★(HF Daily 31▲ 净新增立标信号,稳态起步,paper_card 待入库)
增量 ② ACM FSE 2026 LLM 推理引擎 Bug 系统研究(NET-new 方法学级 · ⭐⭐⭐⭐)
- 来源:jay 9-14 15:05 five-category-briefing §Backend §3(arXiv:2508.04925 · ACM FSE 2026 · 2026-09)+ spark 9-14 llm-infra e1prep 增量 ③
- 要点:ACM FSE 2026 首次系统性梳理 vLLM/SGLang 等推理引擎中的真实 bug 模式。核心贡献:① 真实 bug 模式分类(涵盖调度、内存管理、量化、分布式等);② 触发条件分析;③ 修复策略汇总。这是目前最完整的 LLM 推理引擎工程可靠性研究。推理引擎开发/运营团队必读。arXiv ID 2508.04925 此前已锚入 v3.31 arXiv ID 列表(338 件闭合),但未在 §1.(1) 推理引擎方法学或 §1.(11) Kernel/Harness 子轴正式锚入章节预备级,本次首次建议补强方法学锚入。
- 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学 + §1.(11) Kernel/Harness 子轴直接关联。v3.32 已锚入 SGLang v0.5.19(786 PR)、vLLM v0.20.2/v0.29.0rc3、NVIDIA Dynamo 1.0(4× TTFT)、vLLM V1(1.7× throughput)等性能锚点,但缺乏"系统性 bug 模式"的可靠性理论维度。ACM FSE 2026 Bug 研究填补这一空白,与推理引擎可复现性研究(arXiv:2605.19537,v3.32 预备级)共同构成"性能 + 可靠性"双维度的推理引擎工程图谱。
- 建议归入节:§1.(1) 推理引擎方法学(ACM FSE 2026 LLM 推理引擎 Bug 系统研究 arXiv:2508.04925:系统性梳理 vLLM/SGLang 真实 bug 模式 · 首条工程可靠性方法学)+ §1.(11) Kernel/Harness 子轴(Engineering Reliability 新维度补充)
- arXiv 号清单:
arXiv:2508.04925= 1 件 NET-new inference 主轴(arXiv ID 已锚入 v3.31 列表,章节方法学锚入本次首次建议) - 可信度:★★★★(ACM FSE 2026 同行评审,系统性研究,9-14 jay 下午棒位最新抓取)
增量 ③ vLLM V1 架构重构九月里程碑:重新架构引擎 + Blackwell FP4 + Docker Model Runner(NET-new 事件级 · ⭐⭐⭐⭐)
- 来源:jay 9-14 11:07 five-category-briefing §Backend §4(vLLM.ai blog 2026-09)+ jay 9-14 13:35 hf-state-openmodels-nanochat-inference-deerflow-substack §三.4(vLLM 官方博客 2026 年帖子)+ spark 9-14 llm-infra e1prep 增量 ⑤
- 要点:vLLM V1 架构重构官方博客系列(2026-09)。核心五项重构:① 重新架构引擎(自 PagedAttention 以来最大架构重写);② Near-zero 开销 prefix caching;③ Blackwell FP4 kernels(Pareto 前沿 benchmark);④ Session-Aware Agentic Routing(连续任务中的模型选择机制);⑤ Docker Model Runner 集成(vLLM 作为推理后端集成到 Docker 工作流,safetensors + PagedAttention + 流式输出 + OpenAI 兼容 API)。额外数字:MRv2 在小模型上实现 56% 吞吐提升(将输入准备 offload 到 GPU);支持 GPTQ/AWQ/AutoRound/INT4/INT8/FP8。vLLM Korea Meetup 2026:社区增长 + V1 更新 + 生产栈采纳 + AMD MI300X PD Disaggregation(mori-IO 单节点分离)。
- 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学已锚入的 vLLM V1 五项直接更新(v3.32 §1.1 已有 V1 五项概述)。本次补充:① Blackwell FP4 kernels 正式发布;② Docker Model Runner 集成生产就绪;③ MRv2 56% 吞吐数字;④ Session-Aware Agentic Routing 新增。vLLM V1 = 2026-09 官方架构级里程碑,是 v3.32 inference.md 的重大更新节点。
- 建议归入节:§1.(1) 推理引擎方法学(vLLM V1 架构重构九月里程碑:Blackwell FP4 kernels + Docker Model Runner + MRv2 56% + Session-Aware Agentic Routing + AMD MI300X PD Disaggregation)
- arXiv 号清单:无 direct arXiv(vLLM 官方博客);相关 = arXiv:2603.16104(PD disaggregation 适用场景)
- 可信度:★★★★(vLLM 官方博客 2026-09,9-14 jay 早棒 + 下午棒双棒位确认)
增量 ④ vLLM vs Triton vs NIM K8s 决策框架:2×A100 80GB 月度成本全披露(NET-new 方法学级 · ⭐⭐⭐⭐)
- 来源:jay 9-14 13:35 hf-state-openmodels-nanochat-inference-deerflow-substack §三.3(lucaberton.com 2026-09)+ jay 9-14 15:05 five-category-briefing §Backend §1 确认
- 要点:完整 K8s 推理服务三引擎对比(2×A100 80GB · 月度成本精细化):
| 指标 | vLLM | Triton+vLLM | NIM |
|---|---|---|---|
| 吞吐量(tok/s) | 2,100 | 1,950 | 2,400 |
| TTFT P50 | 180ms | 210ms | 150ms |
| TTFT P99 | 450ms | 520ms | 380ms |
| ITL P50 | 28ms | 32ms | 24ms |
| 内存效率 | 92% | 88% | 95% |
| 部署时间 | 10 min | 30 min | 2 min |
| 软件许可成本 | $0 | $0 | ~$4,500/月 |
| 年度总成本(1年) | ~$59,940 | ~$63,540 | ~$110,940 |
决策建议:① 选 vLLM = 有 ML 平台工程师 + 追求成本效益 + 纯 LLM serving;② 选 Triton+vLLM = 多模型 pipeline + ensemble + 需要 TensorRT-LLM 优化;③ 选 NIM = 无 ML 基础设施专家 + 需要快速上线和 vendor 支持。Netflix 案例:Netflix 内部 LLM 服务平台已采用 Triton + vLLM backend 方案(InfoQ 2026-07-27)。NVIDIA Dynamo = Triton 的后继者,用于 LLM 推理。
- 与活文档现有脉络的关系:与 inference.md §1.(1) 推理引擎方法学已锚入的 NVIDIA NIM 2.0(v3.32 §1.1)直接补充——v3.32 锚入"NIM = one container one backend 基于 vLLM",本次补充完整的 K8s 成本模型和性能数字,形成"产品定位 + 成本效益"双维度决策框架。与 §4.1 推理经济学子轴邻接。
- 建议归入节:§1.(1) 推理引擎方法学(vLLM vs Triton vs NIM K8s 决策框架:NIM TTFT P99 380ms vs vLLM 450ms vs Triton+vLLM 520ms · 吞吐量 NIM 2,400 vs vLLM 2,100 vs Triton+vLLM 1,950 tok/s · 年度成本 NIM $110,940 vs vLLM $59,940 vs Triton+vLLM $63,540 · Netflix Triton+vLLM backend 案例)
- arXiv 号清单:无 direct arXiv(技术博客 lucaberton.com);与 inference.md §1.1 NVIDIA NIM 2.0 预备扩增
- 可信度:★★★★(工程基准数据,月度成本精确数字,四源 Prem AI + Spheron + Turion.AI + Lyceum Technology 交叉验证方向,来源可靠)
附:SGLang vs vLLM 2026-09 数字澄清(数字修正,非独立增量 · ⭐⭐⭐)
- 来源:jay 9-14 15:05 five-category-briefing §Backend §1(Prem AI Blog + Spheron + Turion.AI + Lyceum Technology 四源)
- 要点:2026-09 最新精细数字澄清,解决 v3.32 已锚入"29% 差距"与通用负载"≤4%"的表面矛盾:
- H100 FP16 通用负载(50 并发):SGLang 1,920 vs vLLM 1,850 tok/s(差距 ≤4%)
- H100 Llama 3.1 8B:SGLang 16,215 vs vLLM 12,500 tok/s(差距 +29% SGLang)
- DeepSeek V3 专属(Particula Tech):SGLang 比 vLLM 吞吐量高 29%,推理速度 3.1× faster(MLA + FlashAttention3/FlashMLA/CutlassMLA 优化链)
- Q2 2026 百万 Token 成本:SGLang $0.51 vs vLLM $0.55 vs TGI $0.63
- TGI 即将退场(Turion.AI 2026-09 确认)
- vLLM 生态最成熟:74.9k GitHub stars
- 核心结论:两者均已成熟;通用负载差距 ≤4%(实际选型影响有限);SGLang 在 DeepSeek/多轮对话场景优势明确;vLLM 是新项目默认推荐
- 与活文档现有脉络的关系:澄清 v3.32 §1.(2) 推理调度子轴中"SGLang vs vLLM vs LMDeploy 选型决策树"的数字前提——"29% 差距"是 Llama 3.1 8B 专项数据,不是通用负载数据;通用负载差距已收窄至 ≤4%。与 v3.32 §1.1 NVIDIA Dynamo 1.0 邻接。
- 建议归入节:§1.(2) 推理调度子轴(2026-09 SGLang vs vLLM 数字澄清:通用负载 ≤4% vs Llama 3.1 8B +29% · Q2 2026 百万 Token 成本 SGLang $0.51 vs vLLM $0.55 vs TGI $0.63 · TGI 即将退场)
- arXiv 号清单:无 direct arXiv(四源 Prem AI + Spheron + Turion.AI + Lyceum Technology 交叉验证)
- 可信度:★★★★(四源交叉验证,H100 实测,9-14 jay 下午棒位最新棒位)
三、矛盾/待核实条目
待核实 ① HyQuant paper_card 暂未入库 + 章节锚入时机
- 问题描述:HyQuant arXiv:2608.27875 HF Daily 9-14 早棒 31▲ 净新增立标信号稳态起步,paper_card 暂未入库。v3.32 §1.(4) 量化子轴未实质锚入章节预备级。
- 建议动作:关注 HyQuant paper_card 入库时间节点;入库后正式锚入 §1.(4) 量化子轴预备级
待核实 ② ACM FSE 2026 arXiv:2508.04925 的章节方法学锚入 vs arXiv ID 列表锚入的区分
- 问题描述:arXiv:2508.04925 已锚入 v3.31 arXiv ID 列表(338 件闭合),但未在 §1.(1) 推理引擎方法学或 §1.(11) Kernel/Harness 子轴正式锚入章节预备级。arXiv ID 列表闭合 ≠ 章节方法学锚入闭合。
- 建议动作:在 §1.(1) + §1.(11) 正式锚入 ACM FSE 2026 Bug 研究作为推理引擎工程可靠性维度
待核实 ③ SGLang vs vLLM "通用负载差距 ≤4%" 是否为趋势性变化
- 问题描述:jay 9-14 15:05 给出"通用负载差距已收窄至 4% 以内"(原 29% 差距是 Llama 3.1 8B 专项数据)。"趋势性变化 vs 测试条件差异"哪个是主因尚需核实。
- 建议动作:精读 Prem AI Blog + Spheron + Turion.AI + Lyceum Technology 四源原文,核对硬件配置前提(模型类别 + 并发数 + batch size)
四、可引用的 arXiv 号列表
| arXiv 号 | 标题 | 主分类 | 形态 | 锚定位置 |
|---|---|---|---|---|
| 2608.27875 | HyQuant: 面向 LLM Attention 的混合精度量化 | inference | method | 本棒增量 ① · §1.(4) 量化子轴 NET-new · paper_card 暂未入库 ⚠️ |
| 2508.04925 | ACM FSE 2026 LLM 推理引擎 Bug 系统研究 | inference | method | 本棒增量 ② · §1.(1) + §1.(11) NET-new 章节方法学锚入(arXiv ID 已锚 v3.31 列表) |
| 2609.01925 | CRISP: 输入自适应稀疏 Prefill | llm-infra | method | paper_card 1197 已入库 · 邻接 §1.(3) KV Cache 子轴 |
| 2601.07504 | FROAV: RAG 观察与 Agent 验证框架 | rag | method | 邻接 §1.(11) Kernel/Harness 子轴 · Docker Compose + n8n + PostgreSQL + FastAPI |
| 2607.05708 | Akashic MemAttention | inference | method | v3.32 已锚入预备级 |
| 2605.19537 | 推理引擎可复现性 | inference | method | v3.32 预备级 |
| 2609.04263 | Low-Rank KV Cache 质量恢复 | inference | method | v3.32 预备级 |
| 2609.11582 | OmniKVQuant | inference | method | v3.32 预备级 |
| 2609.10226 | Φ-Bench | llm-infra | benchmark | v3.32 预备级 |
| 2609.06674 | Detokenization Leaks | security | vulnerability | v3.32 已锚入 §3.5 |
| 2609.07529 | CoRL Least Privilege | agent | method | v3.32 已锚入 §3.5 |
| 2609.10266 | KVShareArena | llm-infra | benchmark | v3.32 已锚入 §1.(3) |
| 2609.11561 | MaP-WAM | agent | method | v3.32 已锚入 §1.(11) |
五、给今晚活文档接力的建议
今晚 inference 活文档(knowledge/inference.md)接力方向建议:
- §1.(4) 量化子轴 补入 HyQuant(arXiv:2608.27875):首条 Attention 层混合精度量化,31▲ HF Daily 9-14 新立标,与 KV cache 量化(KIVI/OmniKVQuant/LiteKV 等)形成方法学区分,paper_card 待入库后正式锚入
- §1.(1) 推理引擎方法学 补入 ACM FSE 2026 Bug 研究(arXiv:2508.04925):首条系统性 LLM 推理引擎可靠性方法学(v3.31 arXiv ID 列表已锚,本次首次章节方法学锚入);与推理引擎可复现性(arXiv:2605.19537)共同构成"性能 + 可靠性"双维度
- §1.(1) 推理引擎方法学 更新 vLLM V1 九月里程碑:Blackwell FP4 kernels + Docker Model Runner + MRv2 56% + Session-Aware Agentic Routing + AMD MI300X PD Disaggregation
- §1.(1) 推理引擎方法学 补入 vLLM vs Triton vs NIM K8s 决策框架:完整 2×A100 80GB 月度成本模型(vLLM $59,940/yr vs Triton+vLLM $63,540/yr vs NIM $110,940/yr)+ 性能数字 + Netflix 案例
- §1.(2) 推理调度子轴 更新 SGLang vs vLLM 数字澄清:通用负载 ≤4% vs Llama 3.1 8B +29% · Q2 2026 百万 Token 成本 + TGI 退场
- §1.(3) KV Cache 子轴 补入 CRISP(arXiv:2609.01925,paper_card 1197):C_struct 路由替代 JSD,消除 pooled matmul + KL divergence overhead
- 待核实项目:HyQuant paper_card 入库时机(P0);ACM FSE 2026 Bug 研究章节锚入(P1);SGLang vs vLLM ≤4% 趋势性核实(P2)
六、本棒检查过的来源完整清单
work-queue.md(2026-09-14 18:00)
inference.md(v3.32,2026-09-14 05:00 升档)
inbox/tom/2026-09-13-inference-e1prep.md(昨夜基准)
inbox/tom/2026-09-12-inference-e1prep.md(9-12 基准)
inbox/tom/2026-09-11-inference-e1prep.md(9-11 基准)
inbox/tom/2026-09-10-inference-e1prep.md(9-10 基准)
inbox/tom/2026-09-14T2040-agent-rag-longcontext-radar.md
inbox/tom/2026-09-14T1440-agent-rag-longcontext-radar.md
inbox/tom/2026-09-14-0900-hf-daily-2026-09-14.md
inbox/tom/2026-09-14-rag-e1prep.md
inbox/tom/2026-09-14-evaluation-e1prep.md
inbox/tom/2026-09-14_agents-lite.md
inbox/tom/2026-09-14-1004-rss-yt-lex-fridman.md
inbox/tom/2026-09-14-1004-rss-yt-yannic-kilcher.md
inbox/jay/2026-09-14-1005-github-trending-inference-rag-2026.md
inbox/jay/2026-09-14-1050-jay-engineering-agent-observability-2026.md
inbox/jay/2026-09-14-1105-jay-five-category-briefing.md
inbox/jay/2026-09-14-1220-jay-context-engineering-harness-dario-substack.md
inbox/jay/2026-09-14-1335-jay-hf-state-openmodels-nanochat-inference-deerflow-substack.md
inbox/jay/2026-09-14T1505-jay-five-category-briefing.md
inbox/jay/2026-09-14-ai-engineering-github-huggingface.md
inbox/jay/2026-09-14-database-backend-cloudnative-inference.md
inbox/jay/2026-09-14-1001-rss-cool-papers-ir.md
inbox/jay/2026-09-14-1000-rss-bytebytego.md
inbox/jay/2026-09-14-1001-rss-cool-papers.md
inbox/spark/2026-09-14-llm-infra-e1prep.md(18:40 CST)
inbox/spark/2026-09-13-llm-infra-e1prep.md
inbox/flyp/2026-09-14-multimodal-e1prep.md
inbox/flyp/2026-09-14-risk-e1prep.md
inbox/flyp/2026-09-14-0950-MMProLong-long-context-VLM-critical-read.md
inbox/flyp/2026-09-14-0950-Long-Horizon-Terminal-Bench-agent-eval-critical-read.md
inbox/stephen/2026-09-14-ai-industry-e1prep.md
inbox/stephen/2026-09-14-1245-stephen-coordination-check-noon.md
paper_cards/ Sep 11-14 入库卡:118/119/1191/1197/1304/1314/1315/1317/1318/1319/1320/1322/1323/1328/1329/1330/1331/1332/1333/1334/1335/1336/1337/1338/1339/1340(共 27 张)
Tom · 2026-09-14 22:20 CST · E1 预消化 · inference · 4 条主增量(HyQuant ⭐⭐⭐⭐ + ACM FSE 2026 Bug 研究 ⭐⭐⭐⭐ + vLLM V1 九月里程碑 ⭐⭐⭐⭐ + vLLM vs Triton vs NIM K8s 决策框架 ⭐⭐⭐⭐)+ 附:SGLang vs vLLM 数字澄清)+ 4 件涉及 arXiv 号