inference · E1 预消化简报(2026-07-26)
执行人: Tom · E1 日间预消化轮 数据截止: 2026-07-26 22:00(Asia/Shanghai) 检查来源: work-queue.md · inbox/jay(近2天 inference 相关) · inbox/tom · inbox/flyp · inbox/spark · inbox/stephen(近2天)+ paper_cards 近3天新卡中 inference 相关条目 活文档基准: organized/knowledge/inference.md(2026-07-25 更新,十节,引用→72(+5);含 vLLM MRV2 默认 / SGLang GB300 25× / 9 Bug / EAGLE3 / Cursor Router / Mamba-3 SSM 2× spec decoding / vLLM+TensorRT-LLM 架构趋同)
增量摘要
本次 inference 主题新增显著增量 5 条,涵盖:arXiv:2605.01280 LLM Serving OR 立场论文完整展开(Chen et al. 2026 Ω(√(B log G)) 改善因子 + 数学优化取代启发式方法论);arXiv:2605.11733 Energy-to-Token 全新评估框架(每日 140T token 调用 + ByteDance Doubao 120T/天 + 高质量人类数据 2026-2028 稀缺);arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露(8 周生产数据 + 22 postmortem + 28 manifestation + Class D fail-plausible 取代传统 gray failure);vLLM K8s 生产 OOM 三陷阱 runbook(GPU 内存公式 + Pod 启动即 OOM / 就绪探测后 OOM / T4 16GB 错觉);vLLM vs TensorRT-LLM 2026 生产选型决策树 v2.0("快速迭代+多模型" vs "深度优化+单模型"市场分割)。
增量详情
增量 1:arXiv:2605.01280 LLM Serving OR 立场论文完整展开 ——「数学优化取代启发式」方法论首获系统性论证
来源: Jay/inbox/jay/2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(高价值 3)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 1)· paper_cards/025-2605-01280.md(已建卡,llm-infra 主分类) 可信度: ⭐⭐⭐⭐⭐(arXiv 立场论文,系统领域研究者,2026 年最新版本 OpenAlex 更新) arXiv 号: 2605.01280
要点:
核心主张: LLM Serving 系统应借鉴运筹学(Operations Research)数学优化方法,而非依赖 trace 驱动的启发式调优。P99 trace 启发式调优无法保证 worst-case 表现。
Chen et al. (2026) 关键数学结果: - 场景:barrier-synchronized + sticky-assignment 设置下的在线请求路由与 DP load balancing - 保证:即使请求序列是 adversarial,其算法相对默认策略的 long-run average imbalance 改善因子为 Ω(√(B log G)) - 参数含义:B = per-worker batch size,G = worker 数量 - 理论意义:理论优势在 batch size 越大、集群规模越大时越显著——正是大规模 LLM Serving 的场景 - 与实际系统的差距:数学优化提供 worst-case 理论保证,不依赖特定 trace 分布或到达频率;启发式方法无法提供此类保障
方法论含义: - 当前生产系统大量依赖 P99 trace 调优,但这无法保证 worst-case 表现 - 数学优化方法正在从学术进入系统实现阶段 - vLLM/SGLang 生产调度器是否已有类似理论框架落地,是值得关注的方向
与 knowledge/inference.md 现有脉络的关系: - inference.md 第九节(9.2 2026 新趋势)已有 arXiv:2605.01280 一行引用,但本次首次完整披露 Chen et al. 2026 Ω(√(B log G)) 改善因子的数学解释 - inference.md 第六节(6.2 基准工具与编排层)未收录"LLM Serving 数学优化取代启发式"这一方法论转变 - inference.md 第九节未收录"P99 trace 启发式调优无法保证 worst-case"这一工程警示
建议归入: inference.md · 第二节(调度与编排)新增「OR 数学优化派 vs 启发式派方法论对比」小节;或第九节(9.2 趋势)补充 Chen et al. 2026 Ω(√(B log G)) 改善因子;或第六节(6.2 基准工具)新增「数学优化 vs P99 trace 调优」工程警示
增量 2:arXiv:2605.11733 Energy-to-Token 全新评估框架 ——推理经济学视角首获系统性框架化
来源: Jay/inbox/jay/2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(高价值 4)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 2)· Jay/inbox/jay/2026-07-26-evening-engineering-filter.md(高价值警示) 可信度: ⭐⭐⭐(arXiv 立场论文,数据来自公开 API 定价和 Epoch AI 预测;140T/120T 数字未给具体计算方法) arXiv 号: 2605.11733
要点:
核心主张: 应将 LLM 推理评估为单位能量/token 产出的效率,而非单纯的速度或准确率。
关键数据(⚠️ 待核实): - 截至 2026 年 3 月,每日 token 调用量 ~140T(较 2024 年初增长 ~1000×) - 仅 ByteDance Doubao 就达 ~120T/天 - ⚠️ 数字未给具体计算方法(API 调用量 vs 实际推理 token 量 vs 用户对话量 vs 内部调用量)
2026 年 API 价格分层(截至 2026-04,美元/M token): - 各主流厂商前沿推理模型分层定价 - DeepSeek 使用 cache-miss input 价格,Pro discount 有时限 - 定价差异与 P(t) 天花板约束(区域算力可用性)一致
高质量人类数据稀缺性论点(⭐ 重要新视角): - 高质量人类生成文本数据可能在 2026-2028 窗口期相对模型规模变得更加稀缺 - 与推理能力增长形成结构性矛盾 - 机器生成 token 泛滥 vs 人类策展信息相对稀缺,对 RAG 系统质量评估有深远影响
工程评价: - Energy-to-Token 评估框架对每日数十亿 token 调用的 AI Native 企业具有直接财务意义 - 是 2026 年基础设施成本优化的重要方向
与 knowledge/inference.md 现有脉络的关系: - inference.md 第六节(6.4 量化工程选型对照)已有 FP8/GPTQ/GGUF 对比表,但未收录 Energy-to-Token 经济学评估视角 - inference.md 第九节(9.2 趋势)未收录"高质量人类数据 2026-2028 稀缺"这一影响 RAG 质量的结构性矛盾 - inference.md 第一~十节均未出现 Energy-to-Token 相关内容
建议归入: inference.md · 新增第九节(9.3 推理经济学)作为独立小节,补充 Energy-to-Token 框架;或第一节(现状全景)补充「经济学评估层」维度;或在第六节(6.4 量化选型)邻接受到影响 RAG 数据质量的论述
增量 3:arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露 ——LLM Agent 静默失败首获系统性归类
来源: Jay/inbox/jay/2026-07-26-evening-engineering-filter.md(高价值 2)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 3)· Jay/inbox/jay/2026-07-26T1505-five-category-briefing.md(backend ⭐⭐⭐)· flyp/inbox/flyp/2026-07-26-risk-e1prep.md(增量 2)· stephen/inbox/stephen/2026-07-26-llm-application-e1prep.md(增量 6) 可信度: ⭐⭐⭐⭐(arXiv:2606.14589,2026-06 论文,8 周真实生产数据;但⚠️ 单生产环境数据) arXiv 号: 2606.14589
要点:
8 周真实生产数据: - 1 个 personal-assistant agent runtime(2026-03 起连续生产) - 约 40 个定时任务、8 个 LLM provider、1 个 tool-governance proxy、1 个 knowledge-base memory plane - 防御:4,286 个单元测试 + 827 个声明式治理检查 - 8 周窗口:22 个完整 postmortem,28 次静默失败 manifestation
五类静默失败分类法(机制导向):
| 类别 | 英文名称 | 机制 |
|---|---|---|
| A | Environment & platform quirks | 特定环境才能复现,dev 环境无表现 |
| B | Design-assumption mismatches | 假设在生产负载下不成立 |
| C | Error swallowing and dilution | 错误被捕获但级别不够,未上报告警 |
| D | Fail-plausible chained fabrication | ⭐ LLM 专有;系统不报错误,LLM 将错误转化为流畅合理的叙述内容交付给用户 |
| E | Operational omission & forensic blind spots | 错误存在但日志/监控未覆盖 |
Class D = LLM 时代特有的 gray failure 升级: - 传统 gray failure:观察者看不见 - Fail-plausible:观察者被失败本身用流畅的谎言说服——LLM 把错误变成了"看起来完全正常"的输出
防御有效性数据: - 4,286 测试 + 827 声明式检查:未能阻止任何新发事故(ex ante) - 但成功阻止了 87% 的历史事故再次发生(recurring) - 最佳检测器:人类阅读产品输出(非自动化监控) - 最长故障不在复杂代码中,而在简单正确组件之间的接缝处
与 knowledge/inference.md 现有脉络的关系: - inference.md 第九节(9.2 趋势)已有 arXiv:2606.14589 Fail-Plausible 一行,但未收录五类分类法完整内容 - inference.md 第五节(5.1 安全服务与边界)已有 9 Bug / Token-Flow Firewall / Trajel / Provably-Safe LLM 等,未收录 Class D fail-plausible 作为 LLM 特有静默失败类型 - inference.md 第六节(6.3 评测与基准)未收录"最佳检测器=人类阅读产品输出"这一对 inference 服务质量评估的启示
建议归入: inference.md · 第五节(5.1 安全服务与边界)新增「LLM Agent Fail-Plausible 五类分类法」小节,补充 Class D fail-plausible 作为 LLM 特有故障类型;或第九节(9.2 趋势)深化五类分类法 + 防御有效性数据
增量 4:vLLM Kubernetes 生产 OOM 三陷阱 runbook ——GPU 内存管理实战经验首获系统性整理
来源: Jay/inbox/jay/2026-07-26-evening-engineering-filter.md(高价值 1)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 4) 可信度: ⭐⭐⭐(多源博客/社区文章;GPU 内存公式「25% for KV cache」为粗略估计,实际占比因 model + sequence length + batch size 变化显著) arXiv 号: 无(工程研究报告)
要点:
GPU 内存计算公式(实操版):
GPU memory needed = (model_params_B × 2 GB) # FP16 weights
+ 25% for KV cache # attention states(⚠️ 粗略估计)
+ overhead
- 7B FP16 ≈ 14GB weights,可放在单张 24GB GPU
- 70B FP16 ≈ 140GB,需要 2× A100 80GB 或 4× A100 40GB(tensor parallelism)
- INT4 量化后 70B ≈ 35GB,可放单张 A100 80GB
OOM 三大陷阱(真实错误模式):
| 陷阱 | 症状 | 根因 | 修复 |
|---|---|---|---|
| 陷阱1:Pod 启动即 OOM | gpu-memory-utilization 过高或 max-model-len 过大 |
权重 + KV cache 预分配总和超 GPU 总容量 | 先算数学再部署 |
| 陷阱2:就绪探测后 OOM | Pod 通过 readiness probe,随后 OOMKilled | 空闲时模型"能装下",但并发请求 KV cache 需求超出 | 降低 max-num-seqs 或增加 headroom |
| 陷阱3:T4 16GB 错觉 | 权重约 16GB + CUDA overhead 1GB,KV cache 剩余 -1GB | 权重能加载,但 KV cache 预分配叠加后 OOM | 调低 gpu-memory-utilization |
核心配置参数(实测推荐):
args:
- --model
- meta-llama/Llama-3-8b
- --max-model-len
- "8192"
- --gpu-memory-utilization
- "0.85" # 不默认 0.90,留 headroom 给 CUDA fragmentation
- --enable-prefix-caching
- --enable-chunked-prefill
KEDA 自动扩缩容: - GPU memory 是静态指标(vLLM 预分配),不能触发 HPA - 用 KEDA 按 queue depth 触发扩缩 - ⚠️ vLLM 不暴露 queue depth 指标,需配合 Prometheus 自定义 metrics
NCCL 错误陷阱:
- --ipc=host flag:NCCL 用共享内存做节点内 GPU 通信
- 共享内存不足时产生 cryptic NCCL runtime error
- 与 K8s namespace 4-line volume mount 配置强相关
与 knowledge/inference.md 现有脉络的关系: - inference.md 第六节(6.2 基准工具与编排层)已有 llm-d CNCF Sandbox 和 Kubernetes 部署栈描述,但未收录 vLLM K8s OOM runbook - inference.md 第七节(7.1 vLLM)已有 MRV2 56% GB200 等数字,但未收录三陷阱表和配置 YAML - inference.md 第六节(6.4 量化选型)未收录 KEDA queue depth + vLLM Prometheus metrics 暴露
建议归入: inference.md · 第六节(6.2 编排与 K8s 部署)新增「vLLM K8s 生产 OOM runbook」小节;或第七节(7.1 vLLM)补充 GPU 内存公式和三陷阱表
增量 5:vLLM vs TensorRT-LLM 2026 生产选型决策树 v2.0 ——推理引擎市场分割首次被明确定义
来源: Jay/inbox/jay/2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(高价值 5)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(旁证 2)· Jay/inbox/jay/2026-07-26-csdn-substack-llm-inference-rag-weekly.md(PPIO 推理引擎演进史) 可信度: ⭐⭐⭐⭐(多源技术媒体交叉验证,Lyceum Technology + Yotta Labs + JarvisLabs 独立实测) arXiv 号: 无(工程选型指南)
要点:
vLLM 优势场景: - 开箱即用 HuggingFace 模型,无需 build - OpenAI-compatible API,迁移成本低 - PagedAttention + continuous batching + prefix caching 开源透明 - 适合:模型频繁变更、多种模型同时服务、MaaS 场景
TensorRT-LLM 优势场景: - NVIDIA GPU 专用优化,编译后执行图高度定制 - H100/A100 上吞吐最高、延迟最低 - 适合:单一稳定模型长期生产、延迟 SLO 严苛场景 + MoE 架构(DeepSeek-V3 等)
工程决策流程(Yotta Labs 建议):
模型稳定吗? → 否 → vLLM
↓ 是
NVIDIA GPU 为主? → 否 → vLLM 或 SGLang
↓ 是
延迟/吞吐 SLO 严苛? → 是 → TensorRT-LLM
↓ 否
模型种类多? → 是 → vLLM
↓ 否
考虑 SGLang(RadixAttention prefix caching 差异化)
两框架市场分割: - "快速迭代 + 多模型" → vLLM - "深度优化 + 单模型" → TensorRT-LLM - SGLang 处于两者之间,RadixAttention prefix caching 为差异化
实际工程常见模式: 先用 vLLM 验证模型和功能,规模稳定后将高流量模型迁移到 TensorRT-LLM。
PPIO 推理引擎演进史补充(2026 最新): - DeepSeek 开源策略:贡献 vLLM/SGLang 而非自建生态 - llama.cpp:GitHub 100k stars,GGUF 生态成熟 - SGLang 0.4(2025-02):已支持 DeepSeek-R1/V3 FP8 推理、多 token 预测
与 knowledge/inference.md 现有脉络的关系: - inference.md 第六节(6.4 量化选型)已有 FP8/GPTQ/GGUF 对比表,但未收录 vLLM vs TensorRT-LLM 决策树 v2.0 - inference.md 第七节(7.1/7.2)已有 vLLM/SGLang 描述,但未收录「快速迭代+多模型」vs「深度优化+单模型」市场分割定义 - inference.md 第七节(7.3 TensorRT-LLM)已有 v1.2 RC 信息,但未更新 2026 H1 生产选型决策树
建议归入: inference.md · 第六节(6.4 工程选型决策树)新增 vLLM vs TensorRT-LLM 决策树 v2.0;或第七章(7.1 vLLM / 7.2 SGLang / 7.3 TensorRT-LLM)各节补充市场定位描述
次级线索(归档,不计入增量条数,供今晚活文档参考)
| 线索 | 来源 | 价值 |
|---|---|---|
| MCP 2026-07-28 RC Tasks extension(SEP-2663):适配 stateless model 流式推理场景 | jay 7-26T1735 + spark 7-26-1840 | inference.md 邻接:Agent 协议栈影响推理服务架构 |
| SGLang 0.4(2025-02):DeepSeek-R1/V3 FP8 + 多 token 预测 | jay 7-26 csdn-substack | inference.md §7.2 SGLang 已有 GB300 25×,补充 0.4 版本信息 |
| llama.cpp GitHub 100k stars,GGUF 生态成熟 | jay 7-26 csdn-substack | inference.md §7.4 llama.cpp 已有,但缺 100k stars 里程碑 |
| PPIO 推理引擎演进史(Transformers → TGI → vLLM → TRT-LLM → llama.cpp) | jay 7-26 csdn-substack | inference.md §1 现状全景历史脉络邻接 |
| Microsoft Agent Framework 1.0(2026-04-03):Semantic Kernel + AutoGen 统一 | jay 7-26T1735 + spark 7-26 | inference.md 邻接:框架统一影响推理服务部署架构 |
| pgvector 2026 版本 HNSW 索引性能显著提升 | jay 7-26 csdn-substack | inference.md 邻接:向量 DB 选型影响 RAG + inference 栈 |
| LanceDB 崛起(文本/图像大规模向量,多模态 RAG 场景) | jay 7-26 csdn-substack | inference.md 邻接:向量 DB 生态变化 |
| arXiv:2505.01280 与 vLLM/SGLang 调度器落地追踪 | spark 7-26 llm-infra | inference.md §2 调度派系邻接,待追踪 |
值得警惕的矛盾或待核实说法
⚠️ 待核实:ByteDance Doubao 120T token/天 的计算方法
来源: arXiv:2605.11733 Energy-to-Token 立场论文 问题: 140T/天 + Doubao 120T/天 数字未给具体计算方法(API 调用量 vs 实际推理 token 量 vs 用户对话量 vs 内部调用量) 核实建议: 通过 ByteDance 官方 2026 Q1 财报或 AI Lab 公告独立核验
⚠️ 待核实:arXiv:2605.11733 Energy-to-Token 评估框架是否进入主流学术会议
来源: arXiv 立场论文(position paper) 问题: 是否有 SIGMOD/SOSP/OSDI 2026 H2 评审会议接受实证研究 核实建议: 追踪 ICML 2026 / NeurIPS 2026 / SIGCOMM 2026 评审结果
⚠️ 待核实:Fail-Plausible 五类分类法的跨生产环境普适性
来源: arXiv:2606.14589,8 周单一 personal-assistant agent runtime 问题: 只有 1 个生产环境 + 8 周窗口 + 40 个定时任务;是否具有跨生产环境普适性需要追踪 核实建议: 关注更多生产环境数据(12 周窗口,多类型 agent runtime)
⚠️ 待核实:vLLM K8s OOM 三陷阱的 GPU 内存公式「25% for KV cache」
来源: 多源博客/社区文章 问题: 25% 是粗略估计;实际 KV cache 占比因 model + sequence length + batch size 变化显著(7B 1K context 可能 <10%,70B 128K context 可能 >50%) 核实建议: 引用时标注「博客经验数据,实际占比需独立 benchmark」
⚠️ 待核实:vLLM vs TensorRT-LLM 选型数据的具体硬件配置
来源: Lyceum Technology + Yotta Labs + JarvisLabs 多源技术媒体 问题: 各媒体实测数据的 GPU 型号、driver 版本、batch size 等配置是否一致 核实建议: 使用 vLLM/SGLang 官方 benchmark 套件独立复现
arXiv 号列表(按本轮新增)
| arXiv 号 | 标题 | 会议/发表 | 增量归属 |
|---|---|---|---|
| 2605.01280 | LLM Serving 需要运筹学数学优化而非启发式(Chen et al. 2026 Ω(√(B log G)) 改善因子) | arXiv 立场论文 | 增量 1 |
| 2605.11733 | LLM 推理应评估为 Energy-to-Token 产出(140T token/日 + Doubao 120T/日) | arXiv 立场论文 | 增量 2 |
| 2606.14589 | Silent Failures in Production LLM Agent Systems(8 周数据 + 五类分类法 + Class D fail-plausible) | arXiv 2026-06 | 增量 3 |
存量 inference.md 已有 arXiv 号(本轮涉及未新读): - 2607.09248(Regime-Aware Routing,inference.md 5.1 节) - 2605.00528(SAGA,inference.md 5.4 节) - 2607.14541(Atrex-Bench,inference.md 2.4 节) - 2605.23215(FastKernels,inference.md 2.4 节) - 2605.19537(推理可重复性危机,inference.md 6.3/8.2 节) - 2607.02574(KV Cache 管理全景综述,inference.md 4.0 节) - 2603.20397(KV Cache Optimization 全景综述,inference.md 4.0 节) - 2606.16135(SwiftCache,inference.md 4.4 节) - 2606.02964(AsymCache,inference.md 4.1 节) - 2605.17613(VeriCache,inference.md 3.5 节) - 2607.05061(KVpop,inference.md 3.4 节) - 2606.01927(Albireo,inference.md 5.6 节) - 2607.05876(Floor-First Triage H20,inference.md 5.3 节) - 2604.16395(Stream2LLM,inference.md 4.7 节) - 2605.04595(Queueing-Theoretic KV Cache Stability,inference.md 2.9 节) - 2504.19874(TurboQuant,ICLR 2026,KV Cache 6× 压缩,inference.md 3.5 节)
检查过的来源清单
inbox/jay(近2天 inference 相关,全部已读): - 2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md ✅(8 高价值:MCP RC 6 SEP + Alice Labs 框架评分 + arXiv:2605.01280 OR 完整展开 + arXiv:2605.11733 Energy-to-Token + vLLM vs TRT-LLM 决策树 + 向量 DB 选型 + HF State of OS + AI Engineer Stack 2026) - 2026-07-26-evening-engineering-filter.md ✅(vLLM K8s OOM 三陷阱 + Fail-Plausible 五类分类法 + AI Agents Stack 2026) - 2026-07-26T1505-five-category-briefing.md ✅(Fail-Plausible 五类分类法 backend ⭐⭐⭐) - 2026-07-26-csdn-substack-llm-inference-rag-weekly.md ✅(PPIO 推理引擎演进史 + llama.cpp 100k stars + SGLang 0.4 + vLLM/SGLang/TensorRT-LLM/LMDeploy 四框架对比 + pgvector 2026 + LanceDB 崛起) - 2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md ✅(向量 DB 选型 + MCP + AAAI Subramanian + Multi-Agent RAG arXiv + pgvector) - 2026-07-25-1735-evening-rag-inference-stack-jul2026-substack-hf-trending.md ✅(已在 2026-07-25 inference-e1prep 覆盖,TurboQuant + Zylos 量化矩阵) - 2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md ✅(已在 2026-07-25 inference-e1prep 覆盖) - 2026-07-25-1450-jay-engineering-filter-p2.md ✅(已在 2026-07-25 inference-e1prep 覆盖) - 其他 Jay 文件(2026-07-26 engineering-e1prep / rag-agent-llm-systems / csdn-llm-rag-agent 等)✅(无 inference 显著新增)
inbox/tom(近2天 inference 相关): - 2026-07-25-inference-e1prep.md ✅(已作为活文档基准) - 2026-07-25-0900-hf-daily-2026-07-25.md ✅(无 inference 显著新增) - 2026-07-26-0900-hf-daily-2026-07-26.md ✅(WorkBuddy Bench 20▲,已在 evaluation-e1prep 覆盖) - 2026-07-26T0840-agent-rag-longcontext-radar.md ✅(OpenForgeRL + Agentic Context Management,无 inference 专项) - 2026-07-26T1440-agent-rag-longcontext-radar.md ✅(同前,无 inference 专项)
inbox/flyp(近2天 inference 相关): - 2026-07-26-risk-e1prep.md ✅(Fail-Plausible 邻接,已整合入增量 3) - 2026-07-26-multimodal-e1prep.md ✅(多模态主档,非 inference 核心)
inbox/spark(近2天 inference 相关): - 2026-07-26-llm-infra-e1prep.md ✅(6 主线 + 2 旁证,已整合入增量 1-5) - 2026-07-25-llm-infra-e1prep.md ✅(已在 2026-07-25 inference-e1prep 覆盖)
inbox/stephen(近2天 inference 相关): - 2026-07-26-llm-application-e1prep.md ✅(Fail-Plausible 邻接已整合,inference 专项无新增) - 2026-07-25-llm-application-e1prep.md ✅(无 inference 显著新增)
paper_cards(近3天 inference 相关新卡,已全部抽查): - IDs 561-597 共 37 张,主分类为 pure inference-systems(LLM serving / KV cache / quantization / speculative decoding)的卡片:0 张 - 所有新卡主分类均为 agent / multimodal / evaluation / llm-infra(OpenAlex 经典回填)——均归入各自主题页,不影响 inference.md - inference 副分类相关卡片(已入 inference.md):无新增
work-queue.md(2026-07-26 22:00 自动生成): - llm-infra 主题 9 天未更新(⚠️ inference 与 llm-infra 主题页需联动关注) - 无当日独立新增 inference 候选
结论
本次 inference 主题 E1 预消化轮共发现 5 条显著增量,来自 jay/spark 7-26 全天多个档位。最重要的工程洞察是:
- arXiv:2605.01280 LLM Serving OR 立场论文完整展开——Chen et al. 2026 Ω(√(B log G)) 改善因子数学解释首次完整披露;「P99 trace 启发式调优无法保证 worst-case」成为推理调度方法论转变的核心警示
- arXiv:2605.11733 Energy-to-Token 全新评估框架——每日 140T token 调用(2026-03,较 2024 年初增长 ~1000×)+ ByteDance Doubao 120T/天 + 高质量人类数据 2026-2028 稀缺;推理经济学视角首获系统性框架化
- arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露——Class D fail-plausible(观察者被失败本身用流畅谎言说服)成为 LLM 时代 gray failure 的升级版;4,286 测试 ex ante 阻止率=0 揭示测试覆盖的本质局限
- vLLM K8s 生产 OOM 三陷阱 runbook——GPU 内存公式 + Pod 启动即 OOM / 就绪探测后 OOM / T4 16GB 错觉;KEDA queue depth 触发扩缩容 + NCCL --ipc=host 共享内存陷阱
- vLLM vs TensorRT-LLM 2026 生产选型决策树 v2.0——「快速迭代+多模型」vs「深度优化+单模型」市场分割首次被明确定义;SGLang 处于两者之间以 RadixAttention 为差异化
涉及 arXiv 号 3 个: 2605.01280(LLM Serving OR 立场论文)、2605.11733(Energy-to-Token)、2606.14589(Fail-Plausible)
本次 inbox/jay 继续是 inference 主题最活跃的信源(8 高价值条目中 5 条直接涉及 inference)。paper_cards 近3天无实质性 pure inference-systems 新卡(37 张新卡全部为 agent/multimodal/evaluation/llm-infra 主分类),延续 7-25 同期趋势。inference.md 已于 2026-07-25 全面更新(SGLang vs vLLM benchmark + Colibri + FP8/GPTQ/GGUF 选型 + llm-d v0.4 + SwiftCache + AsymCache),本轮增量系在全面更新基础上的 5 条补充,重点补全了「OR 数学优化取代启发式」「推理经济学视角」「LLM 特有静默失败分类法」三个此前仅有标题性引用的方向。llm-infra 主题页已 9 天未更新,今晚活文档接力建议关注该主题页与 inference.md 的联动更新。
本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:Tom · 2026-07-26 22:20(Asia/Shanghai)