inference · E1 预消化简报(2026-08-18)

执行: Tom · inference 主题 E1 日间预消化轮 · cron e627b203 · 窗口:2026-08-17 22:20 → 2026-08-18 22:20(约 24h) 基线活文档: organized/knowledge/inference.md(2026-08-17 版 · vLLM 0.27+DFlash+MRV2/Decode CP/SGLang 0.6/PD正反案例/Nexus+Not All Prefills/Salesforce 3.9x/MCP stateless/NVIDIA Dynamo/A100 DeployBase/H100 Benchmark/KV Cache Transform Coding/Queueing-Theoretic/RMM/25K TPS on GB200/WASI-NN + OpScale/vToken 首度锚入) 本棒性质: inference 主题 E1 日间预消化轮(24h 窗口);邻接 8-17 E1 棒(7条)之后,专注 8-17→8-18 新增;不重写活文档,只列近 24h 新硬增量供今晚活文档接力决策参考


状态

  • 增量条数: 6 条主线(含 1 条首度锚入 inference 主题;邻接 4 条)
  • 显著新增: 有——Maple-Preview 三元 MoE 首度锚入 + Stealing Reasoning Traces 安全维度补全 + YOPO 单次前向传播新路径,整体密度中等
  • 本棒说明: Aug 17→18 窗口 inference 核心增量来自 jay 全天主力棒(engineering-e1prep/llm-inference-engineering/afternoon-research/1105+1505 五分类简报);spark llm-infra-e1prep 主分类 llm-infra 4 件(paper_cards 958/956/986/987)与 inference 主题邻接;paper_cards 近 3 天新卡 0 张主分类 inference,但 2608.08020(Thought-Level Beam Search)主分类 llm-infra 与 inference 高度邻接;本棒聚焦 inference 专属新发现
  • 涉及 arXiv 号: 3 件净增(2608.09867 Stealing Reasoning Traces / 2608.14465 YOPO / 2608.08020 Thought-Level Beam Search);沿用 10 件(2608.13499 OpScale / 2608.13263 vToken / 2602.08005 DeltaKV / 2604.25724 Salesforce / 2507.06608 Nexus / 2603.13358 Not All Prefills / 2511.01815 KV Cache Transform Coding / 2605.04595 Queueing-Theoretic / 2603.20397 KV Cache Survey / 2608.13426 RMM)

一、最重要的 6 条增量


增量 1【端侧推理 · §1.1 + §1.9】🔴 Maple-Preview: Ternary MoE 20B-A1B / 5.31GB checkpoint / 218 tok/s on M4 Mac Mini —— 三元权重量化推理首度锚入 ★★★

来源: inbox/jay/2026-08-18T1450-jay-afternoon-research-briefing.md(条目1) + inbox/jay/2026-08-18-llm-inference-engineering.md(条目引述) URL: https://huggingface.co/deepgrove/maple-preview arXiv: 无(HuggingFace Hub · MIT License · 2026-08-04 · DeepGrove 独立 AI 实验室)

要点: - 核心机制: 20B 总参 / ~1B 激活(A1B) MoE,权重精度为 Ternary(-1/0/+1)——而非 FP16/INT8,checkpoint 仅 5.31 GB - 关键规格: 24 层 / 256 experts / 8 active per token;上下文 131,072 tokens;Apple Silicon 专用 runtime 达 218 tok/s(M4 Mac Mini);比 Gemma 4 / Qwen3.5 / gpt-oss 快 5–16× - 两个执行路径: - Apple Silicon 专用 runtime: 218 tok/s(官方数字)——但这是自定义 runtime,非标准 transformers - 标准 transformers 路径: 依赖 Triton + FlashAttention,速度与官方宣传可能有显著差异 - 3:1 sliding-window : global attention 配置(非标准,对长程依赖有影响) - 生产部署参考: 5.31 GB checkpoint = Mac Mini M4 可完全加载;ternary 权重是非常激进的量化路径,checkpoint 压缩率远超 INT4(INT4 ~10GB/70B;ternary 5.31GB/20B)

警示: - 218 tok/s 来自 Apple Silicon 专用 runtime,标准 transformers 路径无法达到此速度——社区开发者测试时需区分执行路径;DeepGrove 宣称的"always learning on-device"有社区质疑(非真正持续学习,仍受灾难性遗忘困扰)

与活文档现有脉络的关系: - inference.md 8-17 版 §1.9 量化经济学已有 AWQ INT4(3x 并发)/RTX 4090 FP8 最优配置/CPU Offloading 正交路径 - 本棒 = 三元权重(Ternary -1/0/+1)推理首度锚入(AWQ 是 INT4 ≈4-bit,本棒是 1.58-bit ternary,checkpoint 压缩率数量级不同);218 tok/s on M4 是端侧推理的新标杆;5.31GB/20B ≈ 0.33 bits per parameter,vs AWQ INT4 ≈4 bits per parameter

建议归入节: §1.9 量化经济学新增 Ternary MoE 子节(5.31GB/20B 三元权重 + 218 tok/s M4 + 与 INT4/FP8 对照 + 标注 Apple Silicon runtime 执行路径差异);§1.1 推理引擎邻接(端侧推理新边界)


增量 2【推理安全 · §1.12】🔴 Stealing Reasoning Traces(arXiv:2608.09867):加密 CoT API 架构性安全漏洞——推理 API 安全首度成为独立维度 ★★★

来源: inbox/jay/2026-08-18T1450-jay-afternoon-research-briefing.md(条目1) + inbox/jay/2026-08-18-llm-inference-engineering.md(ai-engineering-trending.md 引述) URL: https://arxiv.org/abs/2608.09867 arXiv: 2608.09867(2026-08-10 · Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko · 顶会级安全研究)

要点: - 核心漏洞: OpenAI / Anthropic / Google 推理 API 将 CoT 以加密 blob 形式返回给客户端,客户端在后续请求中回传该 blob 以维持推理状态——但这些加密 blob 在同一 provider 生态内是"可移植的",可在不同 session / 用户 / 模型变体之间互换 - 攻击路径: 将强模型的 encrypted reasoning block 注入到同一 provider 的弱模型(如 Haiku)中,弱模型会将其明文化,恢复出强模型的 reasoning token - 实测数据: 315,320 个 block 被解析;4.9% 的 session 包含敏感信息泄漏(凭证/API keys/数十个已恢复凭据);120 道 Codeforces 题目上,提取的 reasoning token 数与源模型高度相关 - 影响厂商: Anthropic (Claude) / OpenAI (GPT-4 系列) / Google APIs 均受影响 - 缓解状态: 已向厂商披露;主要攻击路径已被修复,但架构教训依然有效

工程意义: - 推理 API 的加密 CoT 不是真正的"私有推理"——session logs 和 agent traces 本身就是敏感信息泄露面 - Agent trace 的存储和传输需要重新评估安全边界 - 与 inference.md 8-17 版已有 MCP stateless / NVIDIA Dynamo 等基础设施安全上下文形成互补:MCP 是传输层安全,本棒是推理 API 的加密状态泄漏

警示: - 主要攻击路径已被修复,但架构教训仍然有效;生产部署中涉及推理 API 加密状态的场景需评估此向量

与活文档现有脉络的关系: - inference.md 8-17 版无独立推理安全维度;§1.12 Pipeline 邻接有 Dynamo/SageServe,但无安全层内容 - 本棒 = 推理 API 安全首度成为独立维度(加密 CoT blob 可移植性是架构性缺陷,而非配置问题);与 MCP stateless 架构(8-15 版)形成"传输层安全 vs 推理状态层安全"完整图谱

建议归入节: §1.12 新增推理 API 安全子节(Stealing Reasoning Traces 加密 CoT 可移植性漏洞 + 4.9% session 敏感信息泄漏 + 影响厂商列表 + 缓解状态);§1.12 Pipeline 邻接(Dynamo/SageServe 安全层对照)


增量 3【推理优化新路径 · §1.11 + §1.1】🔴 YOPO(You Only Pass Once,arXiv:2608.14465):冻结 LM 单次前向传播同时回答+弃答——免微调推理增强新路径首度锚入 ★★

来源: inbox/jay/2026-08-18T1450-jay-afternoon-research-briefing.md(条目3) + inbox/spark/2026-08-18-llm-infra-e1prep.md(arXiv:2608.14465 YOPO) URL: https://arxiv.org/abs/2608.14465 arXiv: 2608.14465(cs.CL · 2026-08-13 · 免微调 / steering / activation engineering)

要点: - 核心问题: 冻结语言模型在推理任务上两个耦合弱点:①残差流中已编码的证据未被充分利用;②无法检测输入是否足以回答,导致幻觉 - 两个已有研究方向相互干扰: conditional steering probe(写入残差流提升推理)+ zero-shot sufficiency direction(读取残差流判断是否应弃答)同时部署会相互干扰(最多损失 8 AUROC 分) - YOPO 解法: 保持 sufficiency direction 固定(不训练);训练 write 对 read 影响的逆映射(label-free,可迁移);最终一个 forward pass 同时完成:回答 + 推理增强 + 弃答检测 - 工程场景: 冻结模型 = 无需 fine-tune 的部署场景(与 ternary MoE 端侧部署场景互补);单次前向传播=极低延迟推理

警示: - YOPO 实际工程落地尚远,需等待复现和社区验证;与 inference.md 8-17 版 Speculative Decoding(验证-回退完整机制)相比,YOPO 是更底层的激活工程方向

与活文档现有脉络的关系: - inference.md 8-17 版 §1.11 推理优化算法已有 Speculative Decoding(EAGLE-3/DFlash/Spec V2)/RMM/MRV2 - 本棒 = 冻结模型免微调推理增强首度锚入(单次前向传播同时完成回答+弃答,是与 speculative decoding 完全不同的推理增强路径);YOPO 是 inference 引擎层之下 activation engineering 层的优化

建议归入节: §1.11 推理优化算法新增 YOPO 单次前向传播子节(冻结模型 + 免微调 + 单次前向同时回答+弃答);§1.1 推理引擎邻接(激活工程层优化)


增量 4【推理调度 · §1.2 + §1.1】🟠 Thought-Level Beam Search(arXiv:2608.08020):测试时计算在思维级而非 Token 级分配——分配 vs 扩展 ★★

来源: inbox/jay/2026-08-18-engineering-e1prep.md(增量2) + inbox/spark/2026-08-18-llm-infra-e1prep.md(增量1 paper_card 958) + inbox/jay/2026-08-18T1105-jay-five-category-briefing.md(推理引擎选型框架引述) URL: https://arxiv.org/abs/2608.08020 arXiv: 2608.08020(llm-infra · 2026-08-13 · method · paper_card 958 已建,主分类 llm-infra)

要点: - 核心形式化: 测试时计算 → 受限计算分配问题(constrained compute allocation over partial trajectories) - 两个现有范式的失败: 并行采样(独立处理所有轨迹 → 严重内存瓶颈);减法式剪枝(剪掉不活跃轨迹 → 使有前途的部分被错误剪掉) - 解法: 在 Thought(思维)级别做束搜索——不是 token 级别的局部决策,而是思维级别的全局探索分配 - 与 Speculative Decoding 的本质区别: Speculative Decoding 是在生成路径上的预测-验证(扩展);Thought Beam Search 是在推理路径上的计算预算分配(分配);两者是正交的

警示: - Thought-Level Beam Search 是 paper_card 958,主分类 llm-infra;归入 inference 主题基于"测试时计算分配"与推理效率的直接相关性;arXiv ID 已确认,paper_card 已建档

与活文档现有脉络的关系: - inference.md 8-17 版 §1.1/§1.11 已有 Speculative Decoding(EAGLE-3/DFlash/Spec V2) - 本棒 = 测试时计算"分配 vs 扩展"理论区分首度锚入(Speculative Decoding = 扩展;Thought Beam Search = 分配;两者正交可叠加);为 8-17 版 vLLM Speculative Decoding 全链路提供理论框架补充

建议归入节: §1.11 推理优化算法新增 Thought-Level Beam Search 子节(测试时计算分配理论 + 与 Speculative Decoding 正交对照);§1.2 推理调度邻接(长程推理预算分配)


邻接 A【推理引擎生态 · §1.1 + §1.11】🟠 SGLang RadixArk TPU + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 —— 推理引擎 8月第三波更新 ★★

来源: inbox/jay/2026-08-18T1505-jay-five-category-briefing.md(Backend §二) + inbox/jay/2026-08-18-llm-inference-engineering.md(SGLang vs vLLM vs LMDeploy benchmark) URLs: - https://github.com/sgl-project/sglang(SGLang GitHub CHANGELOG 2026-07) - https://blog.sglang.ai(SGLang RadixArk TPU / GLM5.2 NVFP4 / DFlash / Spec V2) arXiv: 无(SGLang 官方博客 + GitHub)

要点: - SGLang RadixArk TPU(2026-07): 从 GPU 扩展到 Google TPU,生态大幅扩展;SGLang + RadixAttention 协同支持 TPU 硬件 - GLM5.2 NVFP4 agentic workloads 500 TPS: 2 周内达到生产级;FP4 量化 + SGLang 吞吐优化组合;是 8-17 版 GB200 NVL72 25K TPS 之后的新标杆数据(注意:不同硬件不可直接比较) - DFlash + Spec V2(2026-06): SGLang 新一代投机解码算法;是 8-17 版 Speculative Decoding 全链路的具体实现更新 - DeepSeek-V4 Day-0 support with SGLang + Miles(2026-04): 从推理到 RL 验证全链路,SGLang + Miles 联合支持 - vLLM Qwen3-Omni 多模态推理(2026-06-29): 多阶段 Qwen3-Omni 在 vLLM-Omni 服务实战;多模态数据流在推理引擎内部处理路径 - TensorRT-LLM v1.0(2025-09): PyTorch 后端成为默认,usability 大幅提升;新增 NVFP4 / Wide-EP(大规模专家并行)

警示: - GLM5.2 NVFP4 500 TPS 数据来自 SGLang 官方博客,需标注硬件配置(不同硬件不同测试条件) - jay 1505 简报标注"营销数字(如 10,000+ tok/s on H100 FP8)多为第三方博客,未在 NVIDIA 一手材料中稳定复现,引用需谨慎"

建议归入节: §1.1 推理引擎新增 SGLang RadixArk TPU 子节(跨硬件推理引擎支持);§1.11 推理优化算法新增 DFlash + Spec V2 新一代投机解码子节(补充 8-17 版 Speculative Decoding 全链路);§1.1 新增 GLM5.2 NVFP4 Benchmark 数据(500 TPS 标注测试条件)


邻接 B【推理 API 安全工程 · §1.1 + §1.12】🟡 AI Agents Stack 2026 六层 + 多 Agent vs 单 Agent 100% vs 1.7% — Agent 推理架构信号 ★★

来源: inbox/jay/2026-08-18-llm-inference-engineering.md(ai-engineering-trending.md 条目4+6) + inbox/jay/2026-08-18T1505-jay-five-category-briefing.md(AI Agents Stack 2026 §二) URL: https://theaiengineer.substack.com/p/the-ai-agents-stack-2026-edition arXiv: 无(Substack · The AI Engineer · Paolo Perrone · 2026-06)

要点: - AI Agents Stack 2026 六层架构: Layer 1 LLM(推理核心) → Layer 2 Tool/Action(MCP 协议) → Layer 3 Memory(三层) → Layer 4 Guardrails(Agent 专用护栏) → Layer 5 State Management(状态图) → Layer 6 Observability + Evals - 多 Agent vs 单 Agent 实测(348 次 IT 故障响应控制实验): - 多 Agent:100% 可操作推荐质量 - 单 Agent:1.7%(统计接近零) - 延迟:两者均 ~40 秒(关键洞察——质量提升不带来延迟代价) - 80x 特异性提升,140x 正确性提升 - 2024→2026 三大变化: MCP 标准化工具连接;推理模型改变单/多步决策;Memory 成第一等架构原语

工程意义: - 多 Agent 编排解决复杂任务的工程路径已得到控制实验验证;对于推理引擎层面,这意味着推理引擎需要支持多 Agent 并发调用和状态共享的需求会上升 - "guardrails before action"模式——在工具执行层授权,而非输出层过滤;等过滤响应时 Agent 已执行了操作

建议归入节: §1.1 推理引擎邻接新增 AI Agents Stack 2026 六层架构子节(推理引擎在 Agent 架构中的定位);§1.12 Pipeline 邻接(多 Agent 推理质量 vs 单 Agent 1.7% 实测数据)


邻接 C【推理工程基础 · §1.11 + §1.13】🟡 ICML 2026 Open Reproductions:1,221 人复测 2,226 篇论文,22.3% claim 被质疑或证伪 ★★

来源: inbox/jay/2026-08-18-engineering-e1prep.md(增量4) + inbox/jay/2026-08-18T1105-jay-five-category-briefing.md(Backend §二 ICML Open Reproductions) URL: https://huggingface.co/blog/icml-2026-open-reproductions arXiv: 无(HuggingFace 官方博客 · 2026-07-15 至 2026-08-02)

要点: - 规模: 1,221 名参与者 · 2,226 篇 ICML 2026 论文 · 19 天 · 35,908 条 claim 评估 - 核心数据: 496 篇论文(22.3%)至少有一条 claim 被质疑或证伪 - 工具链: Claude Code / Codex / Cursor 等 coding agent 重新运行实验;所有尝试(含失败)记录在 Hugging Face Trackio 公共日志 - 代表案例: Attention forward pass(可复现) / RobuQ DiTs(部分成功) / Self-Distillation(可复现) / LLM Judges adversarial robustness(发现原始方法论问题) - 意义: 迄今为止规模最大的 AI 论文可复现性审计;展示了 coding agent 在科研场景的能力上限与真实局限

与活文档现有脉络的关系: - inference.md 8-17 版 §1.13(假设存在)或 §1.11 推理优化算法已有 vLLM Speculative Decoding 体系 - 本棒 = 大规模可复现性危机首度锚入;与 inference 主题的关联:推理引擎优化论文(如 Speculative Decoding / Decode CP 等)的工程价值依赖可复现性;22.3% 失败率意味着 inference 领域的优化方法论在引用时需谨慎验证

建议归入节: §1.13 新增 ICML 2026 大规模可复现性审计子节(22.3% claim 被质疑或证伪 + 1,221 人复测 2,226 篇论文 + coding agent 科研能力上限);§1.11 推理优化算法邻接(优化方法论可复现性警示)


二、值得警惕的矛盾或待核实说法

# 矛盾/待核实项 来源 风险等级
1 Maple-Preview 218 tok/s 仅来自 Apple Silicon 专用 runtime,标准 transformers 路径无法达到此速度 HuggingFace Hub / DeepGrove 官方 🟡 中(已警示)
2 Stealing Reasoning Traces arXiv:2608.09867 主要攻击路径已被修复,引用为"架构教训"而非"当前活跃漏洞" arXiv:2608.09867 🟡 中
3 GLM5.2 NVFP4 500 TPS 测试条件(硬件配置/batch size/seq_len)未披露,不可与其他引擎数字直接比较 SGLang 官方博客 🟡 中
4 YOPO arXiv:2608.14465 实际工程落地尚远,需等待复现和社区验证 arXiv:2608.14465 🟢 低(已警示)
5 ICML 2026 22.3% 数字来自 HF 官方博客而非原始论文,需核实 Trackio 原始报告 HF 官方博客 🟡 中
6 Thought-Level Beam Search arXiv:2608.08020 主分类 llm-infra(非 inference),归入 inference 基于主题相关性,需活文档维护者确认分类边界 paper_card 958 🟢 低(分类标注)
7 多 Agent 100% vs 1.7% 数据来自 YouTube 视频摘要(Enterprise AI Ecosystem 2026),测试条件(具体任务类型/模型配置)未完整披露 YouTube 视频 🟡 中

三、可引用 arXiv 号列表

🆕 本棒净增(3 件):

arXiv 号 论文 主题 状态
2608.09867 Stealing Reasoning Traces(Stolen Thoughts 攻击) 加密 CoT API 架构性安全漏洞 · 4.9% session 敏感信息泄漏 paper_cards 未建 · 建议本周内建卡(主分类 security 邻接 inference)
2608.14465 YOPO: You Only Pass Once(Answering and Abstaining Together in a Single Forward Pass) 冻结 LM 单次前向同时回答+弃答 · 免微调推理增强 paper_cards 未建 · 建议本周内建卡(主分类 llm-infra/inference)
2608.08020 Thought-Level Beam Search for Reasoning 测试时计算分配 · 思维级 vs Token 级束搜索 paper_card 958 已建 · 主分类 llm-infra

🔄 沿用(10 件,8-17 版已锚入):

arXiv 号 论文 主题 归入活文档节 状态
2608.13499 OpScale: Operator-Level Provisioning and Autoscaling for LLM Serving(MSRA) 算子级弹性扩缩容 · 成本 -36.3% §1.2 8-17 已锚入
2608.13263 vToken: Token-Level Virtualization for Reclaimable KV Caches GPU 内存 token 级 KV 虚拟化回收 §1.3 8-17 已锚入
2602.08005 DeltaKV: Residual-Based KV Cache Compression 长程相似性 KV 压缩 §1.3 邻接 8-17 邻接候选
2604.25724 Scalable Inference Architectures for Compound AI Systems (Salesforce) Compound AI serverless autoscaling §1.2 8-15 已锚入
2507.06608 Nexus: Active Prefill-Decode Disaggregation on a Single GPU 单 GPU PD 分离 2.2×/20×/2.5× §1.2 8-15 已锚入
2603.13358 Not All Prefills Are Equal (PD Disaggregation 多轮 Agent 失效) PD 多轮场景失效 §1.2 8-15 已锚入
2511.01815 KV Cache Transform Coding (ICLR 2026) KV Cache 有损压缩存储 §1.3 8-15 已锚入
2605.04595 Queueing-Theoretic Framework for LLM Inference (ICML 2026) KV Cache 排队论稳定性 §1.3 8-15 已锚入
2603.20397 KV Cache Optimization Strategies Survey (Dell, Mar 2026) KV Cache 综述 §1.3 8-17 邻接新增
2608.13426 Reduced Matrix Multiplication (RMM) 输入自适应矩阵乘 §1.3 或 §1.11 8-15 已锚入

四、检查过的来源清单

  • inbox/jay/2026-08-18-engineering-e1prep.md → ⭐⭐⭐⭐⭐ 核心来源:5 条增量(Maglev/Thought级束搜索/MSR Orchard/Qwen3.8 27B/ICML 2026 22.3%)+ 2 补充锚点(Hybrid-Policy Self-Editing/Spec-First Coding Agent)
  • inbox/jay/2026-08-18-llm-inference-engineering.md → ⭐⭐⭐⭐⭐ 核心来源:7 条(AI Agents Stack 2026/SGLang vs vLLM vs LMDeploy benchmark/多Agent vs 单Agent/Maple-Preview引述/Stealing Reasoning Traces引述)
  • inbox/jay/2026-08-18T1105-jay-five-category-briefing.md → ⭐⭐⭐⭐⭐ 核心来源:推理引擎选型三分层框架(TensorRT-LLM v1.0/SGLang vs vLLM +29%/H100 PremAI 16K tok/s)+ ICML 2026 Open Reproductions + Coding-agents replicate ML papers
  • inbox/jay/2026-08-18T1505-jay-five-category-briefing.md → ⭐⭐⭐⭐⭐ 核心来源:AI Agents Stack 2026/SGLang RadixArk TPU + GLM5.2 NVFP4 500 TPS + DFlash + Spec V2 + DeepSeek-V4 Day-0 + vLLM Qwen3-Omni multimodal
  • inbox/jay/2026-08-18T1450-jay-afternoon-research-briefing.md → ⭐⭐⭐⭐⭐ 核心来源:Stealing Reasoning Traces(2608.09867安全)/Maple-Preview ternary/ExtractBench/Skill²-Bench/Microsoft Orchard/YOPO(2608.14465)
  • inbox/spark/2026-08-18-llm-infra-e1prep.md → ⭐⭐⭐⭐⭐ llm-infra 主轴 14 件候选:paper_cards llm-infra net-new 4件(958 Thought级束搜索/956 Hybrid-Policy/986 Modular Cognitive/987 FreeToken)+ 推理引擎补丁 + 推理工程化补丁;inference 邻接级贡献为主
  • inbox/jay/2026-08-18T0820-jay-csdn-multimodal-rag-inference-substack-highfreq.md → vLLM PagedAttention 排障/Qwen3-Omni 原生统一/CSDN 选型指南等工程补丁
  • inbox/tom/2026-08-17-inference-e1prep.md → Aug 17 版基线(7条:OpScale/vToken/vLLM 0.27/25K TPS/Decode CP/ICMSP/MemoryAlloy)
  • inbox/tom/2026-08-16-inference-e1prep.md → Aug 16 版基线(6条:vLLM CI/Jarvis Labs CPU Offload/GPUYard 公式/DeployBase A100/Mix-Quant/KVServe)
  • inbox/stephen/2026-08-18-ai-industry-e1prep.md → AI industry 主轴;无 inference 直接新增(GLM-5.3/Cursor-SpaceX/Stripe-OpenRouter/Nvidia-OpenAI)
  • inbox/flyp/2026-08-18-multimodal-e1prep.md → multimodal 主轴;无 inference 直接新增
  • inbox/spark/2026-08-18-agent-e1prep.md → Agent 主轴;无 inference 直接新增
  • paper_cards/958-2608-08020.md → Thought-Level Beam Search · 主分类 llm-infra · 2026-08-13 已建
  • paper_cards/956-2608-11660.md → Hybrid-Policy Self-Editing · 主分类 llm-infra · 2026-08-10 已建
  • paper_cards/986-2608-13567.md → Modular Cognitive Architecture · 主分类 llm-infra · 2026-08-16 已建
  • paper_cards/987-2608-16157.md → FreeToken · 主分类 llm-infra · 2026-08-17 已建
  • paper_cards/968-2608-13667.md → Second Thought(推理并行) · 主分类 agent · 邻接 inference
  • organized/queue/work-queue.md 2026-08-18 22:00 → 选题榜 2608.10835/2608.16157;无新 inference 直接候选

五、无显著新增量的领域(如实说明)

以下 8-17 版基线已立标方向,本棒检查后确认无新增量,不重复列出:

  • OpScale / vToken / vLLM 0.27 / 25K TPS GB200 — 8-17 版已充分锚入;本棒无新 OpScale/vToken/arXiv 更新
  • Nexus / Not All Prefills / PD Disaggregation — 8-15/8-16/8-17 版已充分锚入;本棒 Thought-Level Beam Search 是 PD 的补充而非新 PD 系统
  • ICMSP/NIXL / MemoryAlloy / KV Cache 5层技术栈 — 8-17 版已锚入;本棒无新 KV Cache 优化数据
  • vLLM Speculative Decoding(EAGLE-3/DFlash/Spec V2) — 8-17 版已锚入;本棒 DFlash + Spec V2 是 SGLang 端更新(邻接级)
  • Decode Context Parallelism — 8-17 版已锚入;本棒无新数据
  • H100 Benchmark(~16,200 tok/s SGLang vs ~12,500 tok/s vLLM) — 8-17 版已锚入;本棒 GLM5.2 NVFP4 500 TPS 是新硬件数据但测试条件不可比
  • AWQ INT4 / RTX 4090 FP8 最优配置 — 8-15 版已锚入;本棒 Maple-Preview ternary 是新量化路径(不覆盖已有 INT4 数据)
  • paper_cards 主分类 inference 零新增 — 8-17→8-18 无任何主分类 inference 新卡;但 llm-infra 主分类 4 件邻接 inference

六、本棒总结

本轮 E1 预消化结论:中等密度新增棒——6 条 net-new(含 1 条首度锚入,1 条安全维度独立化,4 条邻接补丁),整体密度中等偏低但质量高。学术 paper_cards net-new 为 0(主分类 inference),但 llm-infra 主分类 4 件中有 1 件(Thought-Level Beam Search)与 inference 直接相关。本棒最重要发现:推理 API 安全(Stealing Reasoning Traces)首度成为独立维度,Maple-Preview 三元 MoE 开辟新量化路径,YOPO 单次前向传播提供免微调推理增强新思路。

本棒 vs 8-17 结构性差异: - 8-17 = 高密度工程+学术双增量棒(7 条主线含 2 arXiv 新件 OpScale/vToken) - 8-18 = 中等密度新增棒(6 条主线含 3 arXiv 新件 Stealing Reasoning Traces/YOPO/Thought-Level Beam Search,但主分类均非 inference)

建议今夜活文档接力重点:

  1. §1.9 → 新增 Maple-Preview Ternary MoE 子节(5.31GB/20B 三元权重 + 218 tok/s M4 + Ternary vs INT4 vs FP8 对照 + Apple Silicon runtime 路径差异标注)
  2. §1.12 → 新增推理 API 安全子节(Stealing Reasoning Traces 2608.09867 加密 CoT 可移植性 + 4.9% session 敏感泄漏 + 主要厂商 + 缓解状态 + MCP stateless 对照)
  3. §1.11 → 新增 YOPO 单次前向传播子节(冻结模型 + 免微调 + 同时回答+弃答)
  4. §1.11 → 新增 Thought-Level Beam Search 子节(测试时计算分配 vs Speculative Decoding 扩展 + 与 8-17 版 Speculative Decoding 全链路对照)
  5. §1.1 → 新增 SGLang RadixArk TPU 子节(跨硬件支持 + GLM5.2 NVFP4 500 TPS Benchmark + DFlash + Spec V2)
  6. §1.13 → 新增 ICML 2026 Open Reproductions 子节(22.3% claim 被质疑或证伪 + 1,221 人复测 2,226 篇论文 + inference 优化方法论可复现性警示)
  7. §1.1 → 新增 AI Agents Stack 2026 六层架构邻接(多 Agent 100% vs 1.7% 实测 + 推理引擎在 Agent 架构中的定位)

边界说明: 本棒仅写入 inbox/tom/2026-08-18-inference-e1prep.md;未读取 knowledge/inference.md 全文(由今夜活文档接力棒负责更新)。


Tom · 2026-08-18 22:20 CST · E1 日间预消化轮 · inference 主题 · 24h 窗口 · 不执行 GitHub 写操作