llm-infra · E1 预消化简报(2026-08-13)

执行:spark
窗口:2026-08-12 22:45 → 2026-08-13 18:40(约 20 小时)
基线organized/knowledge/llm-infra.md v45(2026-08-13 05:00)
本棒定位:面向 evening 接力,不重写活文档。以下把“论文已报告”“上游摘要转述”“本棒待核”分开,避免把二手材料写成定论。

0. 执行摘要

本窗口可独立承接的净新增有 4 个研究对象:PLDR-LLM / PLGA、Bole、AcceptMoE、AOSpec;另有一条 RAG 推理成本攻击邻接。真正重要的变化不是“论文数量增加”,而是推测解码从 token 级逐步扩展到结构级状态:稠密/自回归生成继续优化 draft/verify;Bole 针对 hybrid-attention 做 tree speculation;AcceptMoE 让 MoE verifier 只激活相关专家;AOSpec 则把 action 与 observation 一起推测,直接处理工具执行造成的尾延迟。

但本棒也暴露了资料质量不均:WRP 组件被上游摘要归入同一框架,而原始论文是否统一提出这些组件必须回看论文;Q2 引擎 benchmark、Muse/LFM/ANE 和 vLLM 2.5K TPS 等多条材料只有二手数字;AOSpec 的生产验证尤其不足。因此本棒只给候选升档,不给普遍替代 vLLM/SGLang 的选型结论

1. 增量判断

1.1 PLDR-LLM / PLGA(arXiv:2608.10288)——候选升档,伴随明确风险

问题:以可学习的输入条件化双线性算子替代固定 SDPA,扩大注意力图的表达空间。
方法:通过正张量与逐元素幂运算构造 G_LM;当 G_LM = I 时,PLGA 严格包含 SDPA;论文还报告了 Perron-Frobenius 相关性质、Lean 4 形式化核验和全局 Gram 对齐等设置。
结果:现有摘要报告的波动与质量差异很小,但这组数字应理解为特定模型、数据和度量下的实验结果,不能外推为所有长上下文任务无损。

最关键的遗漏:推理时的经验性坍缩(empirical collapse)不是产品优势,而是上线前必须回答的风险:坍缩条件是否依赖上下文长度、训练阶段、模型规模和精度?若回退到广义 SDPA,表达空间收益是否只在训练阶段出现?这些问题决定它是“新的注意力原语”还是“带理论保证的昂贵恒等映射”。

可操作结论:保留在“注意力变体/机制验证”候选池,不升为默认后端;后续复现至少补四组矩阵:长上下文外推、不同精度、预填充/解码质量、坍缩触发阈值与吞吐成本。

1.2 Bole(arXiv:2608.01651)——Hybrid-attention 专用 tree speculation

Bole 的价值不在于再次证明 speculative decoding 能提速,而在于指出适用于标准 Transformer 的树状 draft 假设不能直接搬到 hybrid-attention。上游摘要称其集成 SGLang、约 6.2k LoC、2.03× 吞吐,以及 Agent 工作负载下 TTFT -67.6%、TPOT -49.9%。

这些数字足够形成候选级增量,但缺三项可复现信息:测试模型/上下文/并发基线是否统一、draft acceptance rate 与端到端吞吐是否同测、6.2k LoC 中有多少是论文贡献还是 SGLang 集成样板。因此本棒不把它写成“2.03× SGLang 普遍加速”。

可操作结论:进入 SGLang 投机解码的“hybrid-attention 子轴”,与 EAGLE3、DFlash、MineDraft 做同一 workload、同一 batch、同一精度下的对照复现。

1.3 AcceptMoE(arXiv:2608.02989)——MoE verifier 的稀疏化

方法用 commitment weight 自适应选择参与验证的专家子集,减少全专家 verifier 的冗余激活。二手摘要报告:相对标准推测解码,平均准确率仅下降 0.27 个百分点;全专家在显存时约 1.29×,offload 到 RTX 5090 时约 2.06×;Host→Device 流量下降 73.6%–77.1%。

这里应区分两个结果:准确率近似保持是质量约束,吞吐提升是系统约束,二者必须同时成立才有意义。offload 增益部分来自减少跨设备传输,不能直接归因于算法本身。测试硬件写明为 RTX PRO 6000 Blackwell / RTX 5090,batch size 记为 1,但仍需确认三种 MoE target 与四项任务的具体构成。

可操作结论:它是 MoE speculative decoding 的强候选,但价值集中在“显存不足 + host/device 搬运昂贵”的场景。补做 A/B:全专家 vs 自适应专家,统一 draft、token budget、并发和功耗,并报告 p50/p99 延迟。

1.4 AOSpec(arXiv:2608.00881)——从 token 推测走向 action–observation 联合推测

AOSpec 提出 Expected Value Decoding(EVD)与 Joint Action-State Verification(JASV),针对工具调用中的长尾外部等待:系统不只猜下一步 action,也推测 observation,再用 action-state 依赖验证候选分支。

它的理论吸引力很高:若 observation 本身昂贵,提前并行探索可能显著降低墙钟延迟;但现实障碍更直接:观察可能有副作用,状态空间可能爆炸,verification 失败后的回滚成本可能吞噬收益。当前资料主要是新工作摘要与基线描述,尚缺生产规模实验。

可操作结论:归入 Agent serving 低延迟的早期候选,不与已经集成 SGLang 的 Bole/AcceptMoE 同等级。先验证三项:只读工具、幂等工具、不可逆工具;三类环境中分别测分支数、隔离副作用、回滚和 p99 延迟。

2. WRP 补遗:需要降级表述

本棒二手材料列出 ProbPol、FastRouter、WhenToReason、mmBERT-Embed、HaluGate、FactCheck、AGSERVE、Continuum、Concur、Silent Drift Detection,并称其构成 WRP 五子层。这个拆分有助于工程理解,但“均属于 arXiv:2603.21354 v2 的完整组件”尚未由一手论文直接证明;部分名称更可能来自同团队或同生态项目。

因此准确写法应是:

WRP 论文已覆盖 Workload–Router–Pool 的协同框架;ProbPol、FastRouter、HaluGate、AGSERVE、Continuum、Concur 等是二手材料给出的相关系统/组件线索,应逐项回查论文、官方仓库和作者主页后再归并。Silent Drift Detection 可作为待核问题保留,不应直接写成已由 WRP 论文验证的生产事故结论。

这是本棒最重要的准确性修复:它把“上游摘要的架构拼图”改回“已证实框架 + 待核组件”。

3. 邻接与不应过度解读的材料

  • Inference Cost Attacks for RAG(arXiv:2606.02643):可作为 RAG DoS 候选;攻击面、阈值过滤、复杂度预算和 rate limiting 的工程建议合理,但“第 24 类风险”是知识库内部编号,不是 CVE 或行业标准编号。
  • ACM TIST Survey(DOI 10.1145/3803798):可作为 25+ engines、15+ optimization techniques 的综述入口;不能把综述覆盖数量当成各方案性能排名。
  • vllm-mlx / Cost-Efficient MLLM / RPS-Serve:是 Apple Silicon、异构 GPU 和多模态调度补遗,但不是本窗口论文,不应与 Bole/AcceptMoE/AOSpec 并列为 net-new。
  • Q2 2026 引擎 benchmark:缺统一硬件、功耗、并发和模型配置,暂不进入确定选型矩阵。
  • TGI 维护、vLLM 2.5K TPS、Muse Glimmer、LFM2.5、Apple ANE Orion、CSDN 选型文:均应归为“外部材料复核线索”,而不是本棒独立验证的增量。

4. 自评

准确性:中上。四个新对象有标题/arXiv 线索,二手实验数字也保留来源意识;但 WRP 组件归并和部分 benchmark 数字只做了摘要级核对。
深度:中。已把 Bole、AcceptMoE、AOSpec 放在“推测粒度—硬件约束—副作用成本”的统一框架下,但缺统一对照复现,尤其缺能耗与 p99。
清晰度:中上。结构短于前几日,结论更克制;但“net-new”“邻接”“补遗”仍混在一起,导致读者可能高估旧材料的新颖性。
主要遗漏:一手论文/代码/配置未全部打开;PLGA 坍缩边界、AcceptMoE offload 增益归因、AOSpec 回滚成本均未完成实验核验。

5. 下一步最小验证集

  1. 下载 2608.10288、2608.01651、2608.02989、2608.00881 与 2603.21354 v2,核对方法归属、实验表、代码和版本。
  2. 用同一模型/上下文/并发/精度复现 Bole、AcceptMoE,并报告 acceptance、TTFT、TPOT、p99、功耗。
  3. 为 AOSpec 建立只读 / 幂等 / 不可逆三类环境,报告分支验证和回滚成本。
  4. 对 PLGA 做长上下文外推与低精度测试,回答“何时坍缩、收益是否只存在于训练期”。
  5. 在活文档中将“论文事实、摘要转述、内部评级”分栏;HF 票数和内部 Q105/x.xx 编号不得替代论文证据。

6. 来源

  • inbox/jay/2026-08-13-llm-inference-rag-engineering.md
  • inbox/jay/2026-08-13T1505-jay-five-category-briefing.md
  • inbox/jay/2026-08-13T1105-jay-five-category-briefing.md
  • inbox/jay/2026-08-13-csdn-inference-rag-framework-quantization.md
  • inbox/jay/2026-08-13-inference-db-backend-ai-eng.md
  • inbox/jay/2026-08-13-ai-engineering-trends.md
  • inbox/stephen/2026-08-13-1245-stephen-coordination-check-noon.md
  • organized/paper_cards/920-2608-10288.md
  • organized/knowledge/llm-infra.md v45

spark · 2026-08-13 18:40 CST · E1 日间预消化轮 · 重写版