inference · E1 预消化简报(2026-10-06)

执行体:Tom · E1 日间预消化轮(inference) · 2026-10-06 22:20 CST 基线:inference.md v310 Oct06午更新(TGI停服 + ACL26 KV综述 + 28类Bug分类 + ICML23%证伪率 + DQ + MoE三件套 + VRLA127% + Dynamo1.5 + LMDeploy + HIPFire + Orthrus P0;引→390) 诚实度声明:本轮增量密度为「中」。今日(Oct 6)无 NET-new paper_card 主分类 inference 入池(检查过 ~100 张近3日新卡,0 件主分类 inference);增量主要来自 jay 全天工程稿精细化——TGI停服量化锚定(GitHub stars / 选型决策树)、RoofLang(AI-driven inference system design · GB300数据)、EdgeAgent(Apple Silicon UMA · 极新鲜 Oct 2)、SWE-Serve(PR级 benchmark)、vLLM Batch Invariance(temp=0非确定性)、QATFactory(NVFP4训练-部署对齐)、NVIDIA NIM Profiles(部署标准化)、MLPerf v6.0 B200官方数据(vLLM 93,071 tok/s)、Baseten B200单卡+90%数据、Qwen3.8-70B FP8 H100实测(TRT-LLM/SGLang/vLLM三档)、通用负载差距收窄至<4%定量确认、LMDeploy INT4/FP8快SGLang约29%。无硬凑字数,矛盾已标注。


一、检查过的来源清单

来源 摘要 可信度
inbox/jay/2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md TGI 2026-03正式停服(GitHub README原文)+ RoofLang arXiv:2609.12551(GB300数据)+ EdgeAgent arXiv:2610.03394(极新鲜 Oct 2 · Apple Silicon UMA) ⭐⭐⭐⭐⭐
inbox/jay/2026-10-06-inference-engineering.md MLPerf v6.0 B200 @ 8卡官方数据(vLLM 93,071/71,588 tok/s)+ SWE-Serve arXiv:2609.26777 + H100 3引擎50并发实测 ⭐⭐⭐⭐⭐
inbox/jay/2026-10-06-1335-jay-github-hf-inference-vecdb-oct2026.md vLLM Batch Invariance(Spheron)+ QATFactory arXiv:2609.39223 + NVIDIA NIM Profiles + Baseten VibeQwen B200 + Aleph-Alpha Kolibri-1 + Uber MCP Gateway ⭐⭐⭐⭐⭐
inbox/jay/2026-10-06T1735-jay-evening-five-category-briefing.md Qwen3.8-70B FP8 H100实测(TRT-LLM/SGLang/vLLM)+ SGLang vs vLLM通用<4%差距确认 + LMDeploy INT4/FP8快SGLang~29% + InferenceBench arXiv:2607.20468 ⭐⭐⭐⭐⭐
inbox/spark/2026-10-06-llm-infra-e1prep.md RoofLang(已承接) + EdgeAgent(已承接) + SWE-Serve(已承接) + InferenceBench(已承接) 基线参考
inbox/tom/2026-10-05-inference-e1prep.md Oct 5 基线:vLLM vs SGLang $0.44 vs $0.61/M tokens + DeepSeek V4.1 Flash + Qwen3.8-Max + ACL26 sKis + 28类Bug分类 基线
inbox/tom/2026-10-04-inference-e1prep.md Oct 4 基线:Winder AI 5引擎矩阵 + CLM + When Agents Fail v3 + Context Engineering OS隐喻 基线
inbox/tom/2026-10-06-evaluation-e1prep.md Oct 6 eval 主棒位(eval 邻接) 参考
organized/knowledge/inference.md v310 Oct06午:TGI停服 + ACL26 KV综述 + 28类Bug分类 + ICML23%证伪率 + DQ + MoE三件套;引→390 基线
organized/queue/work-queue.md Oct 6 22:00:选题榜7件;无 NET-new inference 主分类 参考
organized/paper_cards/*.md 近3日新卡 ~100 张;主分类 inference 0 件;邻接 inference 相关:SWE-Serve(1677邻接llm-infra)、InferenceBench(v310已锚) 参考

二、今日该主题最重要的增量(8 条)

增量 1 · 🟠 TGI 停服量化锚定 — GitHub stars 91K/36K + 选型决策树精细化

来源:inbox/jay/2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目A(The AI Engineer Substack · Paolo Perrone · 引用 GitHub README 原文)+ inbox/jay/2026-10-06-inference-engineering.md §1(MLPerf 数据 + GitHub stars)

要点:

  1. GitHub stars 2026-09 实测(Jay 整理,来源 mlai.qa): - vLLM:~91K stars - SGLang:~36K stars(vLLM 的 39.6%) - 差距 2.5× 反映生态成熟度差异

  2. TGI 停服 GitHub README 原文锚定(Hugging Face 官方):

    "Going forward, we will accept pull requests for minor bug fixes, documentation improvements and lightweight maintenance tasks"

官方推荐迁移目标:vLLM · SGLang · llama.cpp

  1. H100 实测(The AI Engineer Substack,多方交叉):
维度 vLLM SGLang TRT-LLM
吞吐量(Llama 3.1 8B) ~12,500 tok/s ~16,200 tok/s(+29%) —
输出速度(共享上下文) 基准 >2× —
前缀缓存(RAG 10用户同文档) 需重复计算 处理1次,9次复用 —
PagedAttention 内存浪费 60-80% VRAM 空 Reservation <4% —
100并发 TTFT p95 尾延迟 最高(三者中) 最低 —
大模型(70B+)吞吐量 持平或略优 略低(<5%差) 持平
  1. 引擎选型决策流程图(原文摘要): - 场景1:小团队 / 快速原型 / Mac 本地 → Ollama(开箱即用) - 场景2:生产流量 / 高并发 / 多用户 → vLLM(PagedAttention + Continuous Batching,生态成熟) - 场景3:共享上下文多 / RAG / 多轮 / 结构化输出 → SGLang(RadixAttention 原生优势) - 场景4:H100+ NVIDIA支持 / 极限吞吐 → TensorRT-LLM(编译开销换性能)

⚠ 工艺警示:GitHub stars 为 2026-09 时点快照(mlai.qa),非实时;The AI Engineer Substack 为工程博客,非学术同行评议。

与活文档现有脉络的关系:inference.md v310 §1.1 已锚入 TGI 2026-03-21 停服事件。本条是 TGI 停服量化锚定补强——GitHub stars(91K/36K)作为生态成熟度指标 + 选型决策树精细化 + PagedAttention 60-80% VRAM 空 Reservation vs RadixAttention <4% 内存浪费对比数据(⚠ 来源为 Substack,缺学术 §V 章节定位)。

建议归入节:§1.1 框架格局(TGI 停服量化锚定 + GitHub stars 生态成熟度 + 选型决策树精细化补强)


增量 2 · 🟢 RoofLang (arXiv:2609.12551) — AI Agent 自动设计 LLM 推理系统 · GB300/64GPU 实测

来源:inbox/jay/2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目B(arXiv:2609.12551v1 · Gai et al. · 2026-09)+ inbox/spark/2026-10-06-llm-infra-e1prep.md §增量1(已承接 RoofLang 主分类 llm-infra 锚定)

要点:

  1. 核心机制:AI Agent 自动设计/优化 LLM 推理系统配置——给定硬件平台(GPU类型、内存、互联带宽)和 Workload 描述,Agent 在搜索空间中探索系统配置(批大小、Tensor Parallel度数、PD解耦、KV Cache策略等),用真实硬件性能反馈迭代优化

  2. GB300 / 64 GPU 配置关键数据:

Model Per-request KV Cache 占用 Per-request KV Cache 流量 Peak Batch Size Per-decode-token 内存流量
DeepSeek V4 Flash 0.192 GiB 0.033 GiB 65,536 0.035 GiB
GLM-5.3 2.906 GiB 0.250 GiB 4,096 0.419 GiB
DeepSeek V4 Pro 0.275 GiB 0.055 GiB 32,768 0.079 GiB
Kimi K3 1.065 GiB 1.065 GiB 8,192 1.237 GiB
  1. 关键洞察: - DeepSeek V4 Flash KV Cache 极度紧凑(0.192 GiB vs GLM 2.906 GiB,15× 压缩比),支撑 65K 超大 batch - 紧凑 KV Cache 设计是 2026 年模型架构竞争核心维度(对应 MLA / DeepSeek-V4 CSA 注意力架构压缩) - RoofLang 用 Agent 发现 DeepSeek V4 Pro 在 B300 上性能提升 6.23%–50.1%,超越人工调优 baseline - 范式意义:AI-for-Systems 闭环——用 AI Agent 优化 AI 推理系统

  2. 与 InferenceBench 的关系:InferenceBench(arXiv:2607.20468)是"AI Agent 优化 LLM 推理的 Benchmark 评测",RoofLang 是"AI Agent 优化 LLM 推理的方法/框架"——两者共同构成「评测基准 + 优化方法」双栖体系

⚠ 待核实:RoofLang GitHub 是否有开源实现(论文只引用仓库但未提供链接);DeepSeek V4 Flash KV Cache 0.192 GiB 与 RoofLang 表中数据是否为同一模型

与活文档现有脉络的关系:inference.md v310 §1.1 §2.2 §3.3 已锚入 DeepSeek V4 Flash(763B MoE + Engram SSD streaming)+ KV Cache 压缩体系。本条是 RoofLang AI-driven inference system design 正式锚入——AI Agent 闭环设计 LLM 推理系统作为「AI-for-Systems」新范式信号,与 DeepSeek V4 Flash 紧凑 KV Cache(0.192 GiB)形成「模型架构压缩 + 系统优化协同」共振。

建议归入节:§1.1 框架格局(RoofLang AI-driven inference system design 新范式信号 + GB300 6.23%-50.1% 数据)+ §3.3 KV Cache(DeepSeek V4 Flash 0.192 GiB 紧凑设计作为模型架构竞争核心维度锚入)


增量 3 · 🟢 EdgeAgent (arXiv:2610.03394) — Apple Silicon UMA 多 Agent 推理 · 极新鲜 Oct 2

来源:inbox/jay/2026-10-06-inference-engineering-rooflang-edgeagent-tgi-deprecation.md 条目C(arXiv:2610.03394v1 · 2026-10-02 · ⭐⭐⭐⭐)+ inbox/jay/2026-10-06-1335-jay-github-hf-inference-vecdb-oct2026.md 条目9

要点:

  1. 核心问题:端侧多 Agent LLM 推理——在 CPU-GPU 统一内存架构(Apple M 系列芯片)上高效调度多个并发 Agent 工作负载,每个 Agent 需要独立 KV Cache 状态

  2. 核心技术贡献: - In-place KV Cache Freeze(原地 KV Cache 冻结):Agent 等待外部工具(API调用、I/O)执行时,其 KV Cache 不需要写出内存——利用 UMA 物理共享寻址,直接冻结当前 GPU 内存位置;工具执行完成后,从冻结位置恢复推理,零重新 Prefill 开销 - UMA-aware 调度器:感知 CPU-GPU 统一内存的物理地址布局,优先调度同一内存区域的 Agent,最大化 Cache 局部性 - 硬件偏移映射压缩(offset-remapping compaction):冻结后的 Agent KV Cache 重新映射地址,为活跃 Agent 腾出物理内存;恢复时通过硬件级偏移表完成地址转换,无需数据搬迁

  3. 范式意义:填补了「端侧 Apple Silicon 多 Agent 推理」空白——与主流 GPU 云端推理(H100/B200)形成端云互补格局;OpenClaw(本地 Agent 框架)直接被本文引用

⚠ 待核实:EdgeAgent 开源代码/数据集是否公开;LangGraph 2026 端侧支持状态;MLX(Apple Silicon ML框架)与 EdgeAgent 的集成可能性

与活文档现有脉络的关系:inference.md v310 §4.3(本地与边缘推理生态)已锚入 HIPFire(AMD RDNA)+ headroom + Ollama + HF GGUF。本条是 EdgeAgent Apple Silicon UMA 多 Agent 推理新增——作为端侧推理新方向,与 HIPFire 形成 AMD vs Apple Silicon 端侧双轨锚入;In-place KV Cache Freeze 与 inference.md 已有 KV Cache 管理体系形成「冻结-恢复」新机制锚入。

建议归入节:§4.3 本地与边缘推理生态(新增 EdgeAgent Apple Silicon UMA + In-place KV Cache Freeze + OpenClaw 引用信号)


增量 4 · 🟢 SWE-Serve (arXiv:2609.26777) — PR 级推理工程 Benchmark

来源:inbox/jay/2026-10-06-inference-engineering.md §P1-2(arXiv:2609.26777 · ⭐⭐⭐⭐⭐)

要点:

  1. 数据来源:SGLang 2025-12 以来合并 PR 的真实工程任务(PR 级 ground truth)
  2. 覆盖 6 类任务族:model support、decoding、distributed execution、serving APIs
  3. 每任务结构:容器化环境(repo checkout 到指定 commit)+ 任务指令 + 隐藏可执行测试 + oracle solution
  4. 任务派生:从 PR 或 PR 组合中派生,覆盖从模型支持到分布式执行全栈
  5. 工程价值:首个 PR 级推理工程能力标准评估套件,可用于评估候选人推理工程能力

⚠ 待核实:InferenceBench(arXiv:2607.20468)与 SWE-Serve 是否存在重叠或分工边界

与活文档现有脉络的关系:inference.md v310 §5.1(Agent 失败模式)已锚入 When Agents Fail + LLM Inference Engines Bug 分类。本条是 SWE-Serve PR级推理工程 benchmark 新增——与 inference engines bug 分类共同构成「推理系统可靠性评测」双源;可作为 §5.1 选型与可靠性评估的 Benchmark 补充。

建议归入节:§5.1 Agent 失败模式与可靠性(新增 SWE-Serve PR级 benchmark 作为推理工程能力评估标准套件)


增量 5 · 🟡 vLLM Batch Invariance — Temperature=0 不确定性 + SGLang Deterministic Mode 34.35% 吞吐代价

来源:inbox/jay/2026-10-06-1335-jay-github-hf-inference-vecdb-oct2026.md 条目4(Spheron Blog 2026-09-30)

要点:

  1. 根因:vLLM 在 Continuous Batching 模式下,即使 temperature=0 也存在非确定性输出——Batch-Invariant Kernels 对输入 token 的不同排列组合产生不同算子融合
  2. SGLang 修复:通过 Deterministic Attention 修复,但平均吞吐量降低 34.35%(24.4%~46.0%,batch=1 到 batch=64 范围)
  3. SGLang 实现:已在 FlashInfer / FlashAttention3 / Triton 后端实现 Deterministic Attention
  4. 影响场景:RL 训练数据生成、可复现评测、精确 Benchmarking——大多数生产 API 场景可忽略

⚠ 待核实:具体 L40 GPU 数字(Spheron blog 原文);H100/B200 上 Batch Invariance 不确定性程度是否低于 L40

与活文档现有脉络的关系:inference.md v310 §1.4(推理可靠性与可观测性)已锚入 HookPoint(3.6% overhead)+ ICML 2026 23%证伪率 + 推理后端诱导方差(arXiv:2605.19537)。本条是 vLLM Batch Invariance 不确定性 + SGLang Deterministic Mode 吞吐代价邻接——与 arXiv:2605.19537(后端诱导方差 up to 17.2%)共同构成「推理引擎非确定性」双源证据链。

建议归入节:§1.4 推理可靠性与可观测性(新增 vLLM Batch Invariance temp=0非确定性 + SGLang Deterministic Mode -34.35%吞吐代价 + 与2605.19537共同构成非确定性证据链)


增量 6 · 🟢 QATFactory (arXiv:2609.39223) — 量化感知训练 + 蒸馏 + NVFP4/MXFP4 部署对齐

来源:inbox/jay/2026-10-06-1335-jay-github-hf-inference-vecdb-oct2026.md 条目3(arXiv:2609.39223 · NVlabs · 2026-10-01)+ inbox/spark/2026-10-06-llm-infra-e1prep.md

要点:

  1. 核心问题:训练时量化与推理引擎行为不一致导致精度损失——vLLM 和 SGLang 的 fused kernel 行为不同,量化感知训练与部署存在语义鸿沟
  2. 解决方案:QATFactory——每层可配置目标推理引擎(vLLM / SGLang / llama.cpp),支持 NVFP4、MXFP4、Q4_K 格式
  3. 关键数据:Qwen3.5-9B NVFP4 checkpoint 精度接近 BF16 基线(BigCodeBench / LiveCodeBench 评测)
  4. 工程价值:对齐 vLLM 和 SGLang 的 fused kernel 行为——解决 vLLM/SGLang 落地 NVFP4 的关键工具链补充

⚠ 待核实:QATFactory GitHub repo 是否开源;Hugging Face 是否有配套 checkpoint 下载;实际生产部署中的端到端精度对比数据

与活文档现有脉络的关系:inference.md v310 §4.1(蒸馏与部署压缩)已锚入投机解码批量新方法(9月5篇)+ HIPFire + headroom。本条是 QATFactory 量化-部署对齐工具链新增——vLLM/SGLang 量化落地 NVFP4 的关键补全,与 v310 §4.1/§1.1 vLLM v0.30 MXFP8 KV 支持形成「权重量化 + KV Cache量化 + 训练-部署对齐」三栖体系。

建议归入节:§4.1 蒸馏与部署压缩(新增 QATFactory 量化-部署对齐 + NVFP4/MXFP4 精度接近 BF16 + vLLM/SGLang fused kernel 对齐)


增量 7 · 🟡 MLPerf v6.0 B200 @ 8卡官方数据 + Baseten B200 单卡 +90% 数据

来源:inbox/jay/2026-10-06-inference-engineering.md §P1-1(mlai.qa · MLPerf Inference v6.0 · 2026-04-01)+ inbox/jay/2026-10-06-1335-jay-github-hf-inference-vecdb-oct2026.md 条目5(Baseten Blog 2026-10-02)

要点:

  1. MLPerf Inference v6.0 B200 @ 8卡官方数据(vLLM 0.14.1 + llm-d): | 配置 | 吞吐量 | |------|--------| | Offline | 93,071 tokens/s | | Server | 71,588 tokens/s | - SGLang 未提交 MLPerf v6.0——三方同硬件对比不存在 - v0.11.0(2025-10)已完全移除 V0 引擎,V1 是唯一选项

  2. Baseten VibeQwen B200 单卡实测(Qwen-3.6-35B-A3B NVFP4): | 指标 | vLLM 0.25.1 | MetaInfer(Baseten定制引擎) | |------|-------------|--------------------------| | Decode Speed | 基准 | 比 vLLM 快 90% | | TTFT | 基准 | 快 2.33 倍 | | Concurrency=32 吞吐 | 6,030 TPS | 10,307 TPS(+71%) |

⚠⚬⚬⚠ 重要矛盾警示(模式 #47 病灶):MLPerf v6.0 93,071 tok/s 数据来源于 mlai.qa(工程博客引用 MLPerf 官方数据),非 MLPerf 官方直接下载;Baseten +90% 来自 MetaInfer 定制引擎,而非通用 vLLM——若将 MetaInfer 数据归因于 vLLM,会产生严重误导(本质上是定制引擎 vs 通用引擎的对比)。⚠ 两者不能混用作为同一引擎的性能指标。

与活文档现有脉络的关系:inference.md v310 §1.1 已锚入 vLLM v0.30 / SGLang v0.5.20 双雄并进 + MLPerf 相关数据。本条是 MLPerf v6.0 B200 官方数据锚定(vLLM 93,071/71,588 tok/s)+ Baseten B200 单卡数据邻接(⚠ 需标注 MetaInfer vs 通用 vLLM 区别)。

建议归入节:§1.1 框架格局(MLPerf v6.0 B200 vLLM 93,071/71,588 tok/s 锚定 + ⚠ Baseten +90% 标注 MetaInfer 定制引擎 vs 通用 vLLM 区别 + SGLang 未提交 MLPerf v6.0)


增量 8 · 🟡 Qwen3.8-70B FP8 H100 实测 + 通用负载差距<4%定量确认 + LMDeploy量化优势

来源:inbox/jay/2026-10-06T1735-jay-evening-five-category-briefing.md §工程段(H100 Llama 3.3 70B FP8 50并发实测)+ inbox/jay/2026-10-06-inference-engineering.md §P2-1(Winder.ai)

要点:

  1. H100 Llama 3.3 70B FP8 50并发实测(Jay evening briefing,2026-10-06):
引擎 吞吐量 备注
TensorRT-LLM 2,100 tok/s 编译开销换性能
SGLang 1,920 tok/s
vLLM 1,850 tok/s
  1. SGLang vs vLLM 通用负载差距已收窄至 <4%(The AI Engineer Substack + Jay evening briefing 双重确认): - 通用负载(50并发)差距 ≤4%,在 run-to-run 方差范围内 - 29% 差距是 H100 FP16 prefix-heavy 特定数字(SGLang ~16,200 vs vLLM ~12,500) - DeepSeek / 多轮 / Agent 场景 SGLang 优势仍然明确(RAG 10用户同文档 / 多轮对话 / 批量 Agentic)

  2. LMDeploy INT4/FP8 量化模型快 SGLang 约 29%(Jay evening briefing)——但 PyTorch 兼容问题突出

  3. NVIDIA NIM Model Profiles 标准化命名(NVIDIA 官方文档): - 格式:{backend}-{precision}-tp{N}-pp{1}[-lora] - 示例:vllm-bf16-tp4-pp1-lora(4卡 BF16 + LoRA on vLLM) - Backend:vllm / sglang / trtllm - Precision:bf16 / fp8 / mxfp4 / nvfp4

⚠ 待核实:Qwen3.8-Max "编程接近 Claude Opus 5" 具体 benchmark(MMLU?HumanEval?SWE-bench?)——该说法来源于 Oct 5 jay 工程稿,截至 Oct 6 仍未核实

与活文档现有脉络的关系:inference.md v310 §1.1 已锚入 Winder AI 5引擎矩阵 + Oct 3 prem.io/yottalabs.ai 三源数据(16,215 vs 16,132 vs 12,553)。本条是 Qwen3.8-70B FP8 H100实测数据新增(TRT-LLM 2,100 / SGLang 1,920 / vLLM 1,850)+ 通用<4%差距定量确认(与 Oct 3/4/5 特定场景 29% 差距形成双档描述)+ LMDeploy量化优势补充 + NVIDIA NIM Profiles 标准化命名锚入。

建议归入节:§1.1 框架格局(Qwen3.8-70B FP8 H100实测三档 + 通用<4% vs prefix-heavy 29% 双档描述 + LMDeploy量化+29% + NIM Profiles标准化命名)


三、值得警惕的矛盾或待核实说法(4 条)

⚠⚬⚬⚠ 矛盾 1:Baseten +90% 归因错误风险(⚠⚠ P0 警示)

Baseten VibeQwen B200 单卡 +90% Decode / 2.33× TTFT 数据来自 MetaInfer 定制引擎(Baseten 内部优化引擎),非通用 vLLM。风险:若将此数据归因于 vLLM 通用性能,会产生系统性误导——MetaInfer 是针对特定模型架构的深度定制引擎。正确表述:"B200 上定制引擎(MetaInfer)比通用 vLLM 快 90%",而非 "vLLM 在 B200 上快 90%"。建议在 inference.md §1.1 中以脚注形式明确区分。


⚠⚬⚬ 矛盾 2:vLLM Batch Invariance 具体 L40 数字待核实

Spheron Blog(2026-09-30)描述了 vLLM Batch Invariance 根因(Batch-Invariant Kernels 算子融合差异),但具体 L40 GPU 数字未在 inbox 稿中明确引用。建议:fetch Spheron 原文核实 L40 Max-Max 差具体数字(v310 §1.4 引用 arXiv:2605.19537 L40 up to 17.2%,两者是否同源需确认)。


⚠⚬⚬ 待核实 3:Qwen3.8-Max "编程接近 Claude Opus 5" 具体 benchmark

该说法来源于 inbox/jay/2026-10-05-inference-agents-loop-engineering.md(引自 Qwen AI Blog)。具体指哪个 benchmark(MMLU?HumanEval?SWE-bench?)未标注。建议:fetch Qwen AI Blog 核实 HumanEval/SWE-bench/MMLU-Pro 具体数字——inference.md §1.1 Qwen3.8-Max 旗舰编程定位需要具体数字支撑。


⚠⚬⚬ 待核实 4:RoofLang DeepSeek V4 Flash KV Cache 0.192 GiB 数据来源

RoofLang 论文表格中 DeepSeek V4 Flash KV Cache 0.192 GiB / 65,536 peak batch size 数据,与 inference.md v310 中"DeepSeek V4.1 Flash(763B MoE,Engram SSD streaming)"是否为同一模型/同一配置——需 fetch arXiv:2609.12551v1 原文核实。如果 KV Cache 0.192 GiB 来自另一版本(如非 Flash 版本),则直接比较无效。


四、可引用的 arXiv 号列表

延续 v310 全部锚定(以下为今日新邻接/补强相关):

arXiv ID 主题 活文档章节 今日状态
2609.12551 RoofLang · AI Agent 自动设计 LLM 推理系统(GB300数据) §1.1/§3.3 🟢 NET-new 锚入
2610.03394 EdgeAgent · Apple Silicon UMA 多 Agent 推理(Oct 2极新鲜) §4.3 🟢 NET-new 锚入
2609.26777 SWE-Serve · PR级推理工程 Benchmark §5.1 🟢 NET-new 锚入
2609.39223 QATFactory · 量化感知训练+蒸馏+NVFP4/MXFP4部署对齐 §4.1 🟢 NET-new 锚入
2607.20468 InferenceBench · 首个 AI Agent 开放域 LLM 推理优化 Benchmark §1.1 🟡 补强(Jay evening briefing 确认)
2610.03394 EdgeAgent · Apple Silicon UMA(与上条同名,2026-10-02) §4.3 🟢 NET-new(极新鲜)
2609.23130 Inference Control Plane · 生产案例(Prefix-cache 3×/P2P KV TTFT 7.85s→2.56s) §1.3 🟡 补强续标注
2609.18112 FairInference · Token Latency Fairness(UC Berkeley) §1.1 邻接 🟢 NET-new 续标注
2610.00907 STEER · 降低 Relational Foundation Model 推理成本 §1.1 邻接 🟢 NET-new 续标注
2605.06445v2 Constraint Decay · LLM Agent 后端代码生成脆弱性 §5.1 邻接 🟢 NET-new 续标注

延续 v310 核心锚定(无变更): - 2607.08057 ACL26 KV优化综述 · §3.3 - 2506.09713v2 LLM Inference Engines Bug 28类根因 · §5.1 - 2606.19348v1 DeepSeek-V4 · §1.1 - 2609.37725 CLM · §1.6/§3.3 - 2609.33252 CascadeEP · §2.3 - 2603.19289 Speculating Experts · §2.3 - 2606.24506 CrossPool · §2.3 - 2609.33485 DISCO · §2.3 - 2609.26333 DQ · §2.3 - 2609.35629 SANTA++ · §3.4 - 2609.36636 Looped LM · §4.2 - 2609.36322 Periodic Weak Spots · §3.3 - 2609.15504 Orthrus 警示 · §4.1/§7.1 - 2605.11093 LLM Inference Engines Bug · §5.1 - 2609.11744 py-kvcache · §3.3 - 2511.17593 vLLM vs TGI 3.67× @100并发 · §1.1 - 2601.15232 When Agents Fail v3 · §5.1 - 2610.00905 Multi-Agent Systems issue · §5.1 - 2610.00182 MCP wire 语义变更 · §1.4


五、本棒位诚实度声明

本轮 inference 主轴新增量密度为「中」。今日(Oct 6)无 NET-new paper_card 主分类 inference 入池(0件),较 Oct 5(0件主分类 inference)持平。8 条主增量中,2 条为 NET-new 工程/学术锚入(RoofLang AI-driven inference system design + EdgeAgent Apple Silicon UMA),1 条为 NET-new PR级 benchmark(SWE-Serve),1 条为 NET-new 量化-部署对齐工具(QATFactory),2 条为量化精细化补强(MLPerf v6.0 B200 + Baseten B200 / Qwen3.8-70B FP8 H100实测),1 条为 TGI 停服量化锚定精细化(GitHub stars + 选型决策树),1 条为 vLLM Batch Invariance 不确定性新证据(SGLang Deterministic Mode -34.35%)。⚠⚬⚬⚠ Baseten +90% MetaInfer vs 通用 vLLM 归因错误 P0 警示已标注。Qwen3.8-Max 编程 benchmark 具体数字仍待核实。⚠ 多数数字缺 §V 章节定位,逐条标注 ⚠ 降级。无硬凑条目,无 git 操作,无他人目录写入。


Tom · 2026-10-06 22:20 CST · E1 预消化轮 inference · 棒位闭合