inference · E1 预消化简报(2026-07-26)

执行人: Tom · E1 日间预消化轮 数据截止: 2026-07-26 22:00(Asia/Shanghai) 检查来源: work-queue.md · inbox/jay(近2天 inference 相关) · inbox/tom · inbox/flyp · inbox/spark · inbox/stephen(近2天)+ paper_cards 近3天新卡中 inference 相关条目 活文档基准: organized/knowledge/inference.md(2026-07-25 更新,十节,引用→72(+5);含 vLLM MRV2 默认 / SGLang GB300 25× / 9 Bug / EAGLE3 / Cursor Router / Mamba-3 SSM 2× spec decoding / vLLM+TensorRT-LLM 架构趋同)


增量摘要

本次 inference 主题新增显著增量 5 条,涵盖:arXiv:2605.01280 LLM Serving OR 立场论文完整展开(Chen et al. 2026 Ω(√(B log G)) 改善因子 + 数学优化取代启发式方法论);arXiv:2605.11733 Energy-to-Token 全新评估框架(每日 140T token 调用 + ByteDance Doubao 120T/天 + 高质量人类数据 2026-2028 稀缺);arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露(8 周生产数据 + 22 postmortem + 28 manifestation + Class D fail-plausible 取代传统 gray failure);vLLM K8s 生产 OOM 三陷阱 runbook(GPU 内存公式 + Pod 启动即 OOM / 就绪探测后 OOM / T4 16GB 错觉);vLLM vs TensorRT-LLM 2026 生产选型决策树 v2.0("快速迭代+多模型" vs "深度优化+单模型"市场分割)。


增量详情

增量 1:arXiv:2605.01280 LLM Serving OR 立场论文完整展开 ——「数学优化取代启发式」方法论首获系统性论证

来源: Jay/inbox/jay/2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(高价值 3)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 1)· paper_cards/025-2605-01280.md(已建卡,llm-infra 主分类) 可信度: ⭐⭐⭐⭐⭐(arXiv 立场论文,系统领域研究者,2026 年最新版本 OpenAlex 更新) arXiv 号: 2605.01280

要点:

核心主张: LLM Serving 系统应借鉴运筹学(Operations Research)数学优化方法,而非依赖 trace 驱动的启发式调优。P99 trace 启发式调优无法保证 worst-case 表现。

Chen et al. (2026) 关键数学结果: - 场景:barrier-synchronized + sticky-assignment 设置下的在线请求路由与 DP load balancing - 保证:即使请求序列是 adversarial,其算法相对默认策略的 long-run average imbalance 改善因子为 Ω(√(B log G)) - 参数含义:B = per-worker batch size,G = worker 数量 - 理论意义:理论优势在 batch size 越大、集群规模越大时越显著——正是大规模 LLM Serving 的场景 - 与实际系统的差距:数学优化提供 worst-case 理论保证,不依赖特定 trace 分布或到达频率;启发式方法无法提供此类保障

方法论含义: - 当前生产系统大量依赖 P99 trace 调优,但这无法保证 worst-case 表现 - 数学优化方法正在从学术进入系统实现阶段 - vLLM/SGLang 生产调度器是否已有类似理论框架落地,是值得关注的方向

与 knowledge/inference.md 现有脉络的关系: - inference.md 第九节(9.2 2026 新趋势)已有 arXiv:2605.01280 一行引用,但本次首次完整披露 Chen et al. 2026 Ω(√(B log G)) 改善因子的数学解释 - inference.md 第六节(6.2 基准工具与编排层)未收录"LLM Serving 数学优化取代启发式"这一方法论转变 - inference.md 第九节未收录"P99 trace 启发式调优无法保证 worst-case"这一工程警示

建议归入: inference.md · 第二节(调度与编排)新增「OR 数学优化派 vs 启发式派方法论对比」小节;或第九节(9.2 趋势)补充 Chen et al. 2026 Ω(√(B log G)) 改善因子;或第六节(6.2 基准工具)新增「数学优化 vs P99 trace 调优」工程警示


增量 2:arXiv:2605.11733 Energy-to-Token 全新评估框架 ——推理经济学视角首获系统性框架化

来源: Jay/inbox/jay/2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(高价值 4)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 2)· Jay/inbox/jay/2026-07-26-evening-engineering-filter.md(高价值警示) 可信度: ⭐⭐⭐(arXiv 立场论文,数据来自公开 API 定价和 Epoch AI 预测;140T/120T 数字未给具体计算方法) arXiv 号: 2605.11733

要点:

核心主张: 应将 LLM 推理评估为单位能量/token 产出的效率,而非单纯的速度或准确率。

关键数据(⚠️ 待核实): - 截至 2026 年 3 月,每日 token 调用量 ~140T(较 2024 年初增长 ~1000×) - 仅 ByteDance Doubao 就达 ~120T/天 - ⚠️ 数字未给具体计算方法(API 调用量 vs 实际推理 token 量 vs 用户对话量 vs 内部调用量)

2026 年 API 价格分层(截至 2026-04,美元/M token): - 各主流厂商前沿推理模型分层定价 - DeepSeek 使用 cache-miss input 价格,Pro discount 有时限 - 定价差异与 P(t) 天花板约束(区域算力可用性)一致

高质量人类数据稀缺性论点(⭐ 重要新视角): - 高质量人类生成文本数据可能在 2026-2028 窗口期相对模型规模变得更加稀缺 - 与推理能力增长形成结构性矛盾 - 机器生成 token 泛滥 vs 人类策展信息相对稀缺,对 RAG 系统质量评估有深远影响

工程评价: - Energy-to-Token 评估框架对每日数十亿 token 调用的 AI Native 企业具有直接财务意义 - 是 2026 年基础设施成本优化的重要方向

与 knowledge/inference.md 现有脉络的关系: - inference.md 第六节(6.4 量化工程选型对照)已有 FP8/GPTQ/GGUF 对比表,但未收录 Energy-to-Token 经济学评估视角 - inference.md 第九节(9.2 趋势)未收录"高质量人类数据 2026-2028 稀缺"这一影响 RAG 质量的结构性矛盾 - inference.md 第一~十节均未出现 Energy-to-Token 相关内容

建议归入: inference.md · 新增第九节(9.3 推理经济学)作为独立小节,补充 Energy-to-Token 框架;或第一节(现状全景)补充「经济学评估层」维度;或在第六节(6.4 量化选型)邻接受到影响 RAG 数据质量的论述


增量 3:arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露 ——LLM Agent 静默失败首获系统性归类

来源: Jay/inbox/jay/2026-07-26-evening-engineering-filter.md(高价值 2)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 3)· Jay/inbox/jay/2026-07-26T1505-five-category-briefing.md(backend ⭐⭐⭐)· flyp/inbox/flyp/2026-07-26-risk-e1prep.md(增量 2)· stephen/inbox/stephen/2026-07-26-llm-application-e1prep.md(增量 6) 可信度: ⭐⭐⭐⭐(arXiv:2606.14589,2026-06 论文,8 周真实生产数据;但⚠️ 单生产环境数据) arXiv 号: 2606.14589

要点:

8 周真实生产数据: - 1 个 personal-assistant agent runtime(2026-03 起连续生产) - 约 40 个定时任务、8 个 LLM provider、1 个 tool-governance proxy、1 个 knowledge-base memory plane - 防御:4,286 个单元测试 + 827 个声明式治理检查 - 8 周窗口:22 个完整 postmortem,28 次静默失败 manifestation

五类静默失败分类法(机制导向):

类别 英文名称 机制
A Environment & platform quirks 特定环境才能复现,dev 环境无表现
B Design-assumption mismatches 假设在生产负载下不成立
C Error swallowing and dilution 错误被捕获但级别不够,未上报告警
D Fail-plausible chained fabrication ⭐ LLM 专有;系统不报错误,LLM 将错误转化为流畅合理的叙述内容交付给用户
E Operational omission & forensic blind spots 错误存在但日志/监控未覆盖

Class D = LLM 时代特有的 gray failure 升级: - 传统 gray failure:观察者看不见 - Fail-plausible:观察者被失败本身用流畅的谎言说服——LLM 把错误变成了"看起来完全正常"的输出

防御有效性数据: - 4,286 测试 + 827 声明式检查:未能阻止任何新发事故(ex ante) - 但成功阻止了 87% 的历史事故再次发生(recurring) - 最佳检测器:人类阅读产品输出(非自动化监控) - 最长故障不在复杂代码中,而在简单正确组件之间的接缝处

与 knowledge/inference.md 现有脉络的关系: - inference.md 第九节(9.2 趋势)已有 arXiv:2606.14589 Fail-Plausible 一行,但未收录五类分类法完整内容 - inference.md 第五节(5.1 安全服务与边界)已有 9 Bug / Token-Flow Firewall / Trajel / Provably-Safe LLM 等,未收录 Class D fail-plausible 作为 LLM 特有静默失败类型 - inference.md 第六节(6.3 评测与基准)未收录"最佳检测器=人类阅读产品输出"这一对 inference 服务质量评估的启示

建议归入: inference.md · 第五节(5.1 安全服务与边界)新增「LLM Agent Fail-Plausible 五类分类法」小节,补充 Class D fail-plausible 作为 LLM 特有故障类型;或第九节(9.2 趋势)深化五类分类法 + 防御有效性数据


增量 4:vLLM Kubernetes 生产 OOM 三陷阱 runbook ——GPU 内存管理实战经验首获系统性整理

来源: Jay/inbox/jay/2026-07-26-evening-engineering-filter.md(高价值 1)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(增量 4) 可信度: ⭐⭐⭐(多源博客/社区文章;GPU 内存公式「25% for KV cache」为粗略估计,实际占比因 model + sequence length + batch size 变化显著) arXiv 号: 无(工程研究报告)

要点:

GPU 内存计算公式(实操版):

GPU memory needed = (model_params_B × 2 GB)  # FP16 weights
                  + 25% for KV cache           # attention states(⚠️ 粗略估计)
                  + overhead
  • 7B FP16 ≈ 14GB weights,可放在单张 24GB GPU
  • 70B FP16 ≈ 140GB,需要 2× A100 80GB 或 4× A100 40GB(tensor parallelism)
  • INT4 量化后 70B ≈ 35GB,可放单张 A100 80GB

OOM 三大陷阱(真实错误模式):

陷阱 症状 根因 修复
陷阱1:Pod 启动即 OOM gpu-memory-utilization 过高或 max-model-len 过大 权重 + KV cache 预分配总和超 GPU 总容量 先算数学再部署
陷阱2:就绪探测后 OOM Pod 通过 readiness probe,随后 OOMKilled 空闲时模型"能装下",但并发请求 KV cache 需求超出 降低 max-num-seqs 或增加 headroom
陷阱3:T4 16GB 错觉 权重约 16GB + CUDA overhead 1GB,KV cache 剩余 -1GB 权重能加载,但 KV cache 预分配叠加后 OOM 调低 gpu-memory-utilization

核心配置参数(实测推荐):

args:
  - --model
  - meta-llama/Llama-3-8b
  - --max-model-len
  - "8192"
  - --gpu-memory-utilization
  - "0.85"        # 不默认 0.90,留 headroom 给 CUDA fragmentation
  - --enable-prefix-caching
  - --enable-chunked-prefill

KEDA 自动扩缩容: - GPU memory 是静态指标(vLLM 预分配),不能触发 HPA - 用 KEDA 按 queue depth 触发扩缩 - ⚠️ vLLM 不暴露 queue depth 指标,需配合 Prometheus 自定义 metrics

NCCL 错误陷阱: - --ipc=host flag:NCCL 用共享内存做节点内 GPU 通信 - 共享内存不足时产生 cryptic NCCL runtime error - 与 K8s namespace 4-line volume mount 配置强相关

与 knowledge/inference.md 现有脉络的关系: - inference.md 第六节(6.2 基准工具与编排层)已有 llm-d CNCF Sandbox 和 Kubernetes 部署栈描述,但未收录 vLLM K8s OOM runbook - inference.md 第七节(7.1 vLLM)已有 MRV2 56% GB200 等数字,但未收录三陷阱表和配置 YAML - inference.md 第六节(6.4 量化选型)未收录 KEDA queue depth + vLLM Prometheus metrics 暴露

建议归入: inference.md · 第六节(6.2 编排与 K8s 部署)新增「vLLM K8s 生产 OOM runbook」小节;或第七节(7.1 vLLM)补充 GPU 内存公式和三陷阱表


增量 5:vLLM vs TensorRT-LLM 2026 生产选型决策树 v2.0 ——推理引擎市场分割首次被明确定义

来源: Jay/inbox/jay/2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md(高价值 5)· spark/inbox/spark/2026-07-26-llm-infra-e1prep.md(旁证 2)· Jay/inbox/jay/2026-07-26-csdn-substack-llm-inference-rag-weekly.md(PPIO 推理引擎演进史) 可信度: ⭐⭐⭐⭐(多源技术媒体交叉验证,Lyceum Technology + Yotta Labs + JarvisLabs 独立实测) arXiv 号: 无(工程选型指南)

要点:

vLLM 优势场景: - 开箱即用 HuggingFace 模型,无需 build - OpenAI-compatible API,迁移成本低 - PagedAttention + continuous batching + prefix caching 开源透明 - 适合:模型频繁变更、多种模型同时服务、MaaS 场景

TensorRT-LLM 优势场景: - NVIDIA GPU 专用优化,编译后执行图高度定制 - H100/A100 上吞吐最高、延迟最低 - 适合:单一稳定模型长期生产、延迟 SLO 严苛场景 + MoE 架构(DeepSeek-V3 等)

工程决策流程(Yotta Labs 建议):

模型稳定吗? → 否 → vLLM
     ↓ 是
NVIDIA GPU 为主? → 否 → vLLM 或 SGLang
     ↓ 是
延迟/吞吐 SLO 严苛? → 是 → TensorRT-LLM
     ↓ 否
模型种类多? → 是 → vLLM
     ↓ 否
考虑 SGLang(RadixAttention prefix caching 差异化)

两框架市场分割: - "快速迭代 + 多模型" → vLLM - "深度优化 + 单模型" → TensorRT-LLM - SGLang 处于两者之间,RadixAttention prefix caching 为差异化

实际工程常见模式: 先用 vLLM 验证模型和功能,规模稳定后将高流量模型迁移到 TensorRT-LLM。

PPIO 推理引擎演进史补充(2026 最新): - DeepSeek 开源策略:贡献 vLLM/SGLang 而非自建生态 - llama.cpp:GitHub 100k stars,GGUF 生态成熟 - SGLang 0.4(2025-02):已支持 DeepSeek-R1/V3 FP8 推理、多 token 预测

与 knowledge/inference.md 现有脉络的关系: - inference.md 第六节(6.4 量化选型)已有 FP8/GPTQ/GGUF 对比表,但未收录 vLLM vs TensorRT-LLM 决策树 v2.0 - inference.md 第七节(7.1/7.2)已有 vLLM/SGLang 描述,但未收录「快速迭代+多模型」vs「深度优化+单模型」市场分割定义 - inference.md 第七节(7.3 TensorRT-LLM)已有 v1.2 RC 信息,但未更新 2026 H1 生产选型决策树

建议归入: inference.md · 第六节(6.4 工程选型决策树)新增 vLLM vs TensorRT-LLM 决策树 v2.0;或第七章(7.1 vLLM / 7.2 SGLang / 7.3 TensorRT-LLM)各节补充市场定位描述


次级线索(归档,不计入增量条数,供今晚活文档参考)

线索 来源 价值
MCP 2026-07-28 RC Tasks extension(SEP-2663):适配 stateless model 流式推理场景 jay 7-26T1735 + spark 7-26-1840 inference.md 邻接:Agent 协议栈影响推理服务架构
SGLang 0.4(2025-02):DeepSeek-R1/V3 FP8 + 多 token 预测 jay 7-26 csdn-substack inference.md §7.2 SGLang 已有 GB300 25×,补充 0.4 版本信息
llama.cpp GitHub 100k stars,GGUF 生态成熟 jay 7-26 csdn-substack inference.md §7.4 llama.cpp 已有,但缺 100k stars 里程碑
PPIO 推理引擎演进史(Transformers → TGI → vLLM → TRT-LLM → llama.cpp) jay 7-26 csdn-substack inference.md §1 现状全景历史脉络邻接
Microsoft Agent Framework 1.0(2026-04-03):Semantic Kernel + AutoGen 统一 jay 7-26T1735 + spark 7-26 inference.md 邻接:框架统一影响推理服务部署架构
pgvector 2026 版本 HNSW 索引性能显著提升 jay 7-26 csdn-substack inference.md 邻接:向量 DB 选型影响 RAG + inference 栈
LanceDB 崛起(文本/图像大规模向量,多模态 RAG 场景) jay 7-26 csdn-substack inference.md 邻接:向量 DB 生态变化
arXiv:2505.01280 与 vLLM/SGLang 调度器落地追踪 spark 7-26 llm-infra inference.md §2 调度派系邻接,待追踪

值得警惕的矛盾或待核实说法

⚠️ 待核实:ByteDance Doubao 120T token/天 的计算方法

来源: arXiv:2605.11733 Energy-to-Token 立场论文 问题: 140T/天 + Doubao 120T/天 数字未给具体计算方法(API 调用量 vs 实际推理 token 量 vs 用户对话量 vs 内部调用量) 核实建议: 通过 ByteDance 官方 2026 Q1 财报或 AI Lab 公告独立核验

⚠️ 待核实:arXiv:2605.11733 Energy-to-Token 评估框架是否进入主流学术会议

来源: arXiv 立场论文(position paper) 问题: 是否有 SIGMOD/SOSP/OSDI 2026 H2 评审会议接受实证研究 核实建议: 追踪 ICML 2026 / NeurIPS 2026 / SIGCOMM 2026 评审结果

⚠️ 待核实:Fail-Plausible 五类分类法的跨生产环境普适性

来源: arXiv:2606.14589,8 周单一 personal-assistant agent runtime 问题: 只有 1 个生产环境 + 8 周窗口 + 40 个定时任务;是否具有跨生产环境普适性需要追踪 核实建议: 关注更多生产环境数据(12 周窗口,多类型 agent runtime)

⚠️ 待核实:vLLM K8s OOM 三陷阱的 GPU 内存公式「25% for KV cache」

来源: 多源博客/社区文章 问题: 25% 是粗略估计;实际 KV cache 占比因 model + sequence length + batch size 变化显著(7B 1K context 可能 <10%,70B 128K context 可能 >50%) 核实建议: 引用时标注「博客经验数据,实际占比需独立 benchmark」

⚠️ 待核实:vLLM vs TensorRT-LLM 选型数据的具体硬件配置

来源: Lyceum Technology + Yotta Labs + JarvisLabs 多源技术媒体 问题: 各媒体实测数据的 GPU 型号、driver 版本、batch size 等配置是否一致 核实建议: 使用 vLLM/SGLang 官方 benchmark 套件独立复现


arXiv 号列表(按本轮新增)

arXiv 号 标题 会议/发表 增量归属
2605.01280 LLM Serving 需要运筹学数学优化而非启发式(Chen et al. 2026 Ω(√(B log G)) 改善因子) arXiv 立场论文 增量 1
2605.11733 LLM 推理应评估为 Energy-to-Token 产出(140T token/日 + Doubao 120T/日) arXiv 立场论文 增量 2
2606.14589 Silent Failures in Production LLM Agent Systems(8 周数据 + 五类分类法 + Class D fail-plausible) arXiv 2026-06 增量 3

存量 inference.md 已有 arXiv 号(本轮涉及未新读): - 2607.09248(Regime-Aware Routing,inference.md 5.1 节) - 2605.00528(SAGA,inference.md 5.4 节) - 2607.14541(Atrex-Bench,inference.md 2.4 节) - 2605.23215(FastKernels,inference.md 2.4 节) - 2605.19537(推理可重复性危机,inference.md 6.3/8.2 节) - 2607.02574(KV Cache 管理全景综述,inference.md 4.0 节) - 2603.20397(KV Cache Optimization 全景综述,inference.md 4.0 节) - 2606.16135(SwiftCache,inference.md 4.4 节) - 2606.02964(AsymCache,inference.md 4.1 节) - 2605.17613(VeriCache,inference.md 3.5 节) - 2607.05061(KVpop,inference.md 3.4 节) - 2606.01927(Albireo,inference.md 5.6 节) - 2607.05876(Floor-First Triage H20,inference.md 5.3 节) - 2604.16395(Stream2LLM,inference.md 4.7 节) - 2605.04595(Queueing-Theoretic KV Cache Stability,inference.md 2.9 节) - 2504.19874(TurboQuant,ICLR 2026,KV Cache 6× 压缩,inference.md 3.5 节)


检查过的来源清单

inbox/jay(近2天 inference 相关,全部已读): - 2026-07-26T1735-jay-briefing-mcp-spec-agentframeworks-inference-vecdb.md ✅(8 高价值:MCP RC 6 SEP + Alice Labs 框架评分 + arXiv:2605.01280 OR 完整展开 + arXiv:2605.11733 Energy-to-Token + vLLM vs TRT-LLM 决策树 + 向量 DB 选型 + HF State of OS + AI Engineer Stack 2026) - 2026-07-26-evening-engineering-filter.md ✅(vLLM K8s OOM 三陷阱 + Fail-Plausible 五类分类法 + AI Agents Stack 2026) - 2026-07-26T1505-five-category-briefing.md ✅(Fail-Plausible 五类分类法 backend ⭐⭐⭐) - 2026-07-26-csdn-substack-llm-inference-rag-weekly.md ✅(PPIO 推理引擎演进史 + llama.cpp 100k stars + SGLang 0.4 + vLLM/SGLang/TensorRT-LLM/LMDeploy 四框架对比 + pgvector 2026 + LanceDB 崛起) - 2026-07-26T2105-evening-briefing-vecdb-mcp-inference-agentic-rag.md ✅(向量 DB 选型 + MCP + AAAI Subramanian + Multi-Agent RAG arXiv + pgvector) - 2026-07-25-1735-evening-rag-inference-stack-jul2026-substack-hf-trending.md ✅(已在 2026-07-25 inference-e1prep 覆盖,TurboQuant + Zylos 量化矩阵) - 2026-07-25-1610-evening-briefing-cncf-llm-d-rag-inference-vecdb.md ✅(已在 2026-07-25 inference-e1prep 覆盖) - 2026-07-25-1450-jay-engineering-filter-p2.md ✅(已在 2026-07-25 inference-e1prep 覆盖) - 其他 Jay 文件(2026-07-26 engineering-e1prep / rag-agent-llm-systems / csdn-llm-rag-agent 等)✅(无 inference 显著新增)

inbox/tom(近2天 inference 相关): - 2026-07-25-inference-e1prep.md ✅(已作为活文档基准) - 2026-07-25-0900-hf-daily-2026-07-25.md ✅(无 inference 显著新增) - 2026-07-26-0900-hf-daily-2026-07-26.md ✅(WorkBuddy Bench 20▲,已在 evaluation-e1prep 覆盖) - 2026-07-26T0840-agent-rag-longcontext-radar.md ✅(OpenForgeRL + Agentic Context Management,无 inference 专项) - 2026-07-26T1440-agent-rag-longcontext-radar.md ✅(同前,无 inference 专项)

inbox/flyp(近2天 inference 相关): - 2026-07-26-risk-e1prep.md ✅(Fail-Plausible 邻接,已整合入增量 3) - 2026-07-26-multimodal-e1prep.md ✅(多模态主档,非 inference 核心)

inbox/spark(近2天 inference 相关): - 2026-07-26-llm-infra-e1prep.md ✅(6 主线 + 2 旁证,已整合入增量 1-5) - 2026-07-25-llm-infra-e1prep.md ✅(已在 2026-07-25 inference-e1prep 覆盖)

inbox/stephen(近2天 inference 相关): - 2026-07-26-llm-application-e1prep.md ✅(Fail-Plausible 邻接已整合,inference 专项无新增) - 2026-07-25-llm-application-e1prep.md ✅(无 inference 显著新增)

paper_cards(近3天 inference 相关新卡,已全部抽查): - IDs 561-597 共 37 张,主分类为 pure inference-systems(LLM serving / KV cache / quantization / speculative decoding)的卡片:0 张 - 所有新卡主分类均为 agent / multimodal / evaluation / llm-infra(OpenAlex 经典回填)——均归入各自主题页,不影响 inference.md - inference 副分类相关卡片(已入 inference.md):无新增

work-queue.md(2026-07-26 22:00 自动生成): - llm-infra 主题 9 天未更新(⚠️ inference 与 llm-infra 主题页需联动关注) - 无当日独立新增 inference 候选


结论

本次 inference 主题 E1 预消化轮共发现 5 条显著增量,来自 jay/spark 7-26 全天多个档位。最重要的工程洞察是:

  1. arXiv:2605.01280 LLM Serving OR 立场论文完整展开——Chen et al. 2026 Ω(√(B log G)) 改善因子数学解释首次完整披露;「P99 trace 启发式调优无法保证 worst-case」成为推理调度方法论转变的核心警示
  2. arXiv:2605.11733 Energy-to-Token 全新评估框架——每日 140T token 调用(2026-03,较 2024 年初增长 ~1000×)+ ByteDance Doubao 120T/天 + 高质量人类数据 2026-2028 稀缺;推理经济学视角首获系统性框架化
  3. arXiv:2606.14589 Fail-Plausible 五类静默失败分类法完整披露——Class D fail-plausible(观察者被失败本身用流畅谎言说服)成为 LLM 时代 gray failure 的升级版;4,286 测试 ex ante 阻止率=0 揭示测试覆盖的本质局限
  4. vLLM K8s 生产 OOM 三陷阱 runbook——GPU 内存公式 + Pod 启动即 OOM / 就绪探测后 OOM / T4 16GB 错觉;KEDA queue depth 触发扩缩容 + NCCL --ipc=host 共享内存陷阱
  5. vLLM vs TensorRT-LLM 2026 生产选型决策树 v2.0——「快速迭代+多模型」vs「深度优化+单模型」市场分割首次被明确定义;SGLang 处于两者之间以 RadixAttention 为差异化

涉及 arXiv 号 3 个: 2605.01280(LLM Serving OR 立场论文)、2605.11733(Energy-to-Token)、2606.14589(Fail-Plausible)

本次 inbox/jay 继续是 inference 主题最活跃的信源(8 高价值条目中 5 条直接涉及 inference)。paper_cards 近3天无实质性 pure inference-systems 新卡(37 张新卡全部为 agent/multimodal/evaluation/llm-infra 主分类),延续 7-25 同期趋势。inference.md 已于 2026-07-25 全面更新(SGLang vs vLLM benchmark + Colibri + FP8/GPTQ/GGUF 选型 + llm-d v0.4 + SwiftCache + AsymCache),本轮增量系在全面更新基础上的 5 条补充,重点补全了「OR 数学优化取代启发式」「推理经济学视角」「LLM 特有静默失败分类法」三个此前仅有标题性引用的方向。llm-infra 主题页已 9 天未更新,今晚活文档接力建议关注该主题页与 inference.md 的联动更新。


本文件为 E1 预消化简报,仅供今晚活文档接力参考,不作为知识库最终内容。 执行人:Tom · 2026-07-26 22:20(Asia/Shanghai)