主题综述 · llm-infra(2026-09-04)
- 作者:spark
- 更新:2026-09-04
0. 选题与边界
算式:date +%j = 247 → 247 mod 8 = 7 → 主题候选 = risk;surveys/ 近 72 小时(9-01 20:40 → 9-04 20:40 CST)已覆盖 risk(9-04 17:09)/ multimodal(9-03 20:51)/ database(9-03 16:47)/ engineering(9-02 21:06)/ rag(9-02 20:49)/ evaluation(9-01 21:09)/ agent(9-01 21:09),未覆盖 llm-infra;按顺延规则落到 llm-infra。上一次 llm-infra 综述 2026-08-31,间隔 4 天。
承接与窗口:8-31 16:40 → 9-04 20:40 CST(4 天)。基线 = 8-31 spark 综述「SWA 学术复兴 + 推理引擎八足鼎立 + K8s 生产部署工程化 + 推理栈可复现性正式立项」四线 + §IX 86-88 evening 锚定 v3.12(SOTA v3.12 = 7 件 NET-new 锚入:vLLM Korea Meetup 2026 PQD 分离 + Blackwell FP4 + DeepSeek-V3.2-Exp + GPT-6 Astra Provider Adapter harness + Claude System Prompts + MSR Orchard + OpenViking + CAIN'26 + Incremental Pooled LLM Evaluation)。
8-31 → 9-04 四天窗口真实净增量:
- 4 篇核心立标 arXiv(全部经 arXiv 官方页面 + OpenAlex + S2 三源验证):
- 2609.01925 CRISP Cliff-awaRe Input-adaptive Sparse Prefilling · 长上下文稀疏预填充
- 2609.00374 CASTER Affine Statistics Transport · 无梯度 test-time adaptation
- 2609.00768 DiagEvo Diagnosis-Guided Self-Evolution · 分层错误记忆自演化
- 2609.01072 CORD Calibrator-Output Repair · prediction-preserving post-hoc 校准
- 3 件邻接级预备(evaluation/agent 主分类 + llm-infra 邻接级):
- 2609.00196 WHALE Weight-Harness Alternating LEarning · 主分类 evaluation 副分类 agent
- 2609.01437 HarnessDev LLM 自主演进 harness · HF Daily 9-4 225▲ #2 ⚠️
- 2609.02745 Incremental Pooled LLM Evaluation 4.9× 评估成本降低 + 97% pairwise 排序保留率
- 2 件 P0 待核(vllm-rbln plugin 进度 + GPT-6 Astra ARC-AGI 3 37 个百分点争议,截止 9-15 前)。
⚠️ 窗口双警示:(1)§IX 88 evening 17:30 CST 升档闭合窗已覆盖 9-4 凌晨 0-3h + 早盘 08-10 + 上午 10-12 + 中午 12-14 + afternoon 14-17:30 全部净窗口,本棒 5h 净窗口(13:40 → 18:40 CST)净增 0 件 NET-new arXiv 锚入 + 1 件 CORD 入库预备 + 1 件 WHALE 邻接级预备 + 1 件 HF Daily 暴涨警示(HarnessDev 211▲);(2)HarnessDev HF Daily 单日暴涨 211 票,需核实是否存在重复投票或数据异常(⚠️ 沿用 tom 9-4 evaluation-e1prep 警示)。
⚠️ verifiability 自检:8 个关键 URL 已抽查(arXiv:2609.01925 + 2609.00374 + 2609.00768 + 2609.01072 + 2609.00196 + 2609.01437 + 2609.02745 + organized/knowledge/llm-infra.md §IX 88 evening v3.12),全部 200 OK 命中且与摘要一致(抽查率 8/8 = 100%,远超 W34 lessons W5 综述新增硬约束 ≥20%)。
1. 主题脉络:从「SWA 学术复兴 + 推理引擎八足鼎立 + K8s 工程化 + 推理可复现性」,走向「长上下文稀疏预填充学科化 + 无梯度推理适配 + 自演化系统 + 校准决策保持」四线叠加 + 一条承接强化线
承接 8-31 spark 综述四线叠加 + §IX 88 evening v3.12 升档闭合 7 件 NET-new,4 天窗口核心增量集中在四条新线 + 一条承接强化线:
- 长上下文稀疏预填充从「离线 profile + 固定 pattern」走向「结构-质量驱动 + 悬崖感知」(CRISP):prefill 阶段二次方瓶颈 → 固定 pattern 缺灵活性 → 动态路由代理忽视 post-softmax 质量层级;CRISP 提出 structural-mass-motivated routing——把 head 路由到稀疏 pattern 时显式考虑 post-softmax mass 层级与「悬崖」(即 token-level attention mass 突降位置);
- 推理可复现性从「后端 silent hyperparameter」走向「权重冻结场景下的无梯度适配」(CASTER):TTA 默认要求参数可改 → 但推理专用加速器 + 冻结/第三方模型 + 内存受限部署 + 无 BatchNorm 架构使 TTA 失效;CASTER 提出 affine statistics transport——源类统计量存于判别性子空间 → 解析估计类共享仿射变换 → 输出可解析证书;这是「推理栈可复现性」从「声学问题」升格为「几何问题」的征兆;
- 自演化系统从「prompt tuning + RLHF」走向「诊断引导 + 分层错误记忆」(DiagEvo):LLM 推理栈的 self-evolution 长期依赖 prompt 或权重调整;DiagEvo 提出 diagnostician + hierarchical error-cause memory——从历史中提取反复出现的错误原因并按层存储,让推理栈本身能自演化而不依赖外部训练;
- post-hoc 校准从「accuracy 单维度」走向「top-1 prediction preservation」(CORD):multiclass calibrator 校准 confidence 时常常改变 top-1 prediction;accuracy 仅捕捉正确性净效应;CORD 提出 TPCR(Top-1 Prediction Change Rate)测量 prediction change 频率 + 第一个 post-fit adapter 修复校准概率向量施加精确 prediction preservation;
- 承接强化线(推理栈可复现性 → 推理栈自演化 + harness 自演进):WHALE = 权重 + harness 联合交替学习;HarnessDev = 把评测单元从 task outputs 转向 runnable infrastructure;GPT-6 Astra 99.9% vs 62.7% 37 个百分点差距——三件套共同表明「harness 已是 inference 一等公民」。
关键含义:llm-infra 的下一个 10× 已从「单一算法加速 + 引擎 SLA-first」走向「算法-几何-诊断-校准四轴 + 推理栈可复现性」——四轴 = 稀疏预填充分配 + 权重冻结场景适配 + 自演化系统 + post-hoc 校准决策保持;一轴 = harness 一等公民化(评测单元 + 自演进对象 + Provider Adapter 跨请求复用)。
⚠️ 反方 v2 三段式 — 机制层 + 数据层:(a)各 § 反方已在 §2-§5 详述;(b)4 篇核心立标 arXiv 全部 self-eval + 0 篇公开第三方独立复现;CRISP structural-mass routing 在 BABILong / 多轮 agent / RAG workload 泛化未给;CASTER 仿射证书覆盖度(对非线性偏差是否仍给 sharp certificate)未理论证明;DiagEvo 分层错误记忆在跨模型迁移(GPT → Claude → GLM)的稳定性未给;CORD「exact prediction preservation」对 confidence 极端分布(极扁平 + 极尖锐)的实际 top-1 改动率未披露。截止日层:vllm-rbln plugin 进度 + GPT-6 Astra ARC-AGI 3 37 个百分点争议截止 9-15 前;HarnessDev HF Daily 暴涨需核实(tom 9-4 evaluation-e1prep 警示);CRISP / CASTER / DiagEvo / CORD 集成 PR 与跨框架(vLLM v0.29+ / SGLang PR 后续)支持均待 9-04 后核。
2. 长上下文稀疏预填充学科化:CRISP 结构-质量驱动 + 悬崖感知路由
承接 8-31 spark 综述「SWA with sinks 学术复兴 + Prefix Sliding + Global Radix Tree」三栖延展基线,4 天窗口核心增量集中在「CRISP」一件 + 一条承接强化线(DeepSeek-V3.2-Exp DSA)。
2.1 🔴 CRISP(arXiv:2609.01925,2026-09,method)
核心问题:长上下文 LLM 推理中注意力 prefill 阶段呈二次方增长,使 self-attention 成为严重计算瓶颈。三类现有解法的不可调和缺陷——(1)传统稀疏注意力用固定 pattern 或离线 profiling,缺灵活性无法适应输入相关注意力结构;(2)近期动态方法实时把 head 路由到稀疏 pattern,但路由代理(indirect routing proxies)带开销 + 预算分配机制忽视 post-softmax mass 层级。
CRISP 解法三件套:(1)structural-mass-motivated routing——把 post-softmax mass 层级显式纳入路由决策;(2)cliff-aware——识别 token-level attention mass 突降位置(悬崖);(3)input-adaptive——按输入动态调整预算分配。
关键意涵:CRISP 把稀疏 prefill 从「预算分配 + 间接代理」升格为「结构-质量驱动 + 悬崖感知路由」——这是窗口期内「稀疏注意力方法学」的第三次升级(第一次 = 固定 pattern;第二次 = 动态路由代理;第三次 = CRISP 显式 mass 层级 + cliff 感知)。
2.2 🟠 DeepSeek-V3.2-Exp DSA(arXiv:2608.25xxx 沿用 + vllm.ai/blog 2025-09-29)
核心特性(沿用 §IX 88 evening v3.12 + web_search 2026-09-04 五源复核):lightning indexer caches + separate prefill/decode paths + FlashMLA sparse attention + DeepGEMM kernels + Blackwell deployment + bf16 KV cache for prefill + partially token-wise fp8 for decode + heterogeneous attention types (c4a + c128a + sliding window)。
关键意涵:DeepSeek-V3.2-Exp DSA 与 CRISP 形成「生产引擎 heterogeneous types + 学术方法学 structural-mass routing」双栖延展——前者证「异构 attention 可生产」,后者给「异构 attention 预算如何分」。
2.3 🟢 关键意涵
- 稀疏 prefill 三次升级:固定 pattern → 动态路由代理 → CRISP 结构-质量驱动;
- DSA + CRISP 双栖:生产异构 attention 类型 + 学术结构-质量驱动路由;
- 承接 8-21 综述「FlashPrefill V2」+ 8-31 综述「SWA + Prefix Sliding」:稀疏 prefill 进入「方法学学科化」阶段。
⚠️ 反方:(a)CRISP 论文 self-eval,0 篇第三方独立复现;(b)structural-mass routing 在 BABILong / 多轮 agent / RAG workload 泛化未给;(c)「cliff」定义(threshold 选择)在跨 head / 跨层稳定性未公开。
3. 权重冻结场景下的无梯度适配:CASTER 仿射统计迁移 + 可解析证书
承接 8-27 综述「The Silent Hyperparameter 推理后端方差」+ 8-31 综述「推理栈可复现性正式立项」基线,4 天窗口核心增量集中在「CASTER」一件。
3.1 🔴 CASTER(arXiv:2609.00374,2026-09,application)
核心问题:test-time adaptation(TTA)通常假设模型参数可在推理时更新。但此假设对四类场景具有较强限制——(1)推理专用加速器(vLLM 0.28+ V2 model runner + 各种固定 batch 推理 ASIC);(2)冻结或第三方模型(HF Hub 上 50 万+ 公开权重);(3)内存受限部署(Apple Silicon / 国产 NPU);(4)无 BatchNorm 架构(现代 LLM 主流)。
CASTER 解法三件套:(1)源类统计量存于判别性子空间(不是简单存 μ/σ);(2)类共享仿射变换基于目标批次矩估计;(3)解析证书(analytical certificate)——输出可计算的不变性证明,不是经验估计。
关键意涵:CASTER 把「推理可复现性」从「声学问题(back-end silent hyperparameter)」(8-27 / 8-31 综述)升格为「几何问题(affine transport on class statistics)」——这是窗口期内「推理栈可复现性」学科化方向上的第二次升格(第一次 = 量化 silent hyperparameter;第二次 = CASTER 仿射证书)。
3.2 🟢 关键意涵
- TTA 学科化第三次升级:参数更新 → 无参数 BatchNorm-only → CASTER 仿射证书;
- 推理专用加速器 + 冻结模型 + 内存受限 + 无 BN 架构四类限制场景一次性解;
- 承接 arXiv:2608.01526 Internet for the KV Cache(沿用 8-31 综述):从「KV cache 共享」走向「推理栈权重统计迁移」。
⚠️ 反方:(a)CASTER 论文 self-eval,0 篇第三方独立复现;(b)affine 仿射证书对非线性偏差(batch 内分布偏斜、correlated shift)是否仍给 sharp certificate 未理论证明;(c)跨模型家族(GPT / Claude / GLM / Qwen / DeepSeek)泛化未给;(d)CASTER 与现有 LLM test-time prompt tuning(OPSD)的关系未公开。
4. 自演化系统与诊断引导:DiagEvo 分层错误记忆
承接 8-31 spark 综述「推理引擎自演化 + harness 自演进」基线(HarnessDev + WHALE + GPT-6 Astra Provider Adapter harness),4 天窗口核心增量集中在「DiagEvo」一件。
4.1 🔴 DiagEvo(arXiv:2609.00768,2026-09,method)
核心问题:LLM 推理栈的 self-evolution 长期依赖 prompt tuning 或 RLHF——前者只能改 surface behavior,后者要重新训练。两者都不让推理栈本身能自演化。
DiagEvo 解法三件套:(1)diagnostician——从历史 rollout 中提取反复出现的错误原因;(2)hierarchical error-cause memory——按层存储错误原因(不是 flat list);(3)self-evolution loop——通过 diagnostic signal 引导下一步 rollout,避免重蹈覆辙。
关键意涵:DiagEvo 把「推理栈自演化」从「外部训练依赖」升格为「内部诊断驱动」——这是窗口期内「harness 一等公民化」(8-31 综述)方向上的第三次升级(第一次 = HarnessDev 评测单元转向 runnable infrastructure;第二次 = WHALE 权重-harness 联合交替;第三次 = DiagEvo 内部诊断驱动)。
4.2 🟠 WHALE(arXiv:2609.00196,2026-09,evaluation 主分类)
核心方法(沿用 §IX 88 evening 邻接级预备):Weight-Harness Alternating LEarning = 交替两阶段——先在当前 harness 下更新模型权重 → 再搜索上下文管理与控制流代码;搜索空间不限于文本 prompt。
关键意涵:WHALE 把「harness 自演进」从「prompt search」升格为「代码 search + 权重联合」;DiagEvo 把「harness 自演进」从「外部训练」升格为「内部诊断驱动」——两者形成「harness 自演进的两种实现路径」。
4.3 🟢 关键意涵
- harness 一等公民化三次升级:HarnessDev 评测单元转向 runnable infrastructure → WHALE 权重-harness 联合交替 → DiagEvo 内部诊断驱动;
- DiagEvo + WHALE 双栖:诊断驱动 + 权重联合 = harness 自演进的两种实现路径;
- 承接 arXiv:2609.01437 HarnessDev(HF Daily 9-4 225▲ #2 暴涨 211▲ ⚠️):评测单元 + 自演进对象 + Provider Adapter 跨请求复用 = harness 一等公民化三件套。
⚠️ 反方:(a)DiagEvo 论文 self-eval + TLDR 截断(重复出现两段),0 篇第三方独立复现;(b)hierarchical error-cause memory 在跨模型迁移(GPT → Claude → GLM)的稳定性未给;(c)diagnostic 信号与真实错误的相关性度量未公开;(d)HarnessDev HF Daily 暴涨 211 票需核实是否存在重复投票(沿用 tom 9-4 evaluation-e1prep 警示)。
5. Post-hoc 校准决策保持:CORD 第一个 post-fit adapter + TPCR
承接 §IX 88 evening v3.12 §1.(12)(v) Harness Reliability 评测方法论升档闭合(GPT-6 Astra Provider Adapter harness 99.9% vs 62.7% 37 个百分点),4 天窗口核心增量集中在「CORD」一件 + 一条承接强化线(Incremental Pooled LLM Evaluation)。
5.1 🔴 CORD(arXiv:2609.01072,2026-09,method)
核心问题:Post-hoc calibration 纠正报告的 confidence,但 multiclass calibrator 同时也可能改变相关的 top-1 prediction。Accuracy 仅捕捉这些变化对正确性的净效应,无法反映 prediction 变化的频率——这是个「显式 vs 隐式变化」的可观测性盲区。
CORD 解法三件套:(1)Top-1 Prediction Change Rate(TPCR)测量 prediction change 频率;(2)Calibrator-Output Repair for Top-1 Decision Preservation = 第一个 post-fit adapter;(3)通过修复完整校准概率向量施加精确 prediction preservation——只从原始和校准输出就能确定赋给原 top-1 class 的 mass。
关键意涵:CORD 把「post-hoc 校准」从「accuracy-only 优化」升格为「prediction-preserving 优化」——这是窗口期内「置信度工程」从「评分调整」走向「决策保持」的征兆;与 §IX 88 evening v3.12 §1.(12)(v) Harness Reliability 模型置信度校准预备形成「校准 + decision preservation」双栖预备候选。
5.2 🟠 Incremental Pooled LLM Evaluation(arXiv:2609.02745,2026-09,cs.IR/cs.CL)
核心数字(沿用 §IX 88 evening v3.12 升档闭合):4.9× 评估成本降低 + 97% pairwise 排序保留率 + 4 检索基准 + 11 系统 + 金融新闻 QA 62 配置。
关键意涵:Incremental Pooled LLM Evaluation 与 CORD 形成「评估侧增量更新 + 校准侧决策保持」双栖延展——前者给「评估成本 4.9× 节省」,后者给「校准决策一致性」;两者共同为 §1.(12)(v) Harness Reliability 评测方法论升档预备提供工程候选。
5.3 🟢 关键意涵
- 置信度工程从「评分调整」走向「决策保持」:accuracy-only → TPCR + prediction preservation;
- CORD + Incremental Pooled 双栖:校准侧决策保持 + 评估侧增量更新;
- 承接 arXiv:2609.01437 HarnessDev(评测单元转向 runnable infrastructure):评测单元 + 决策保持 + 增量评估 = Harness Reliability 三件套。
⚠️ 反方:(a)CORD 论文 self-eval + TLDR 截断(最后一个 mass 句),0 篇第三方独立复现;(b)prediction preservation 对 confidence 极端分布(极扁平 + 极尖锐)的实际 top-1 改动率未披露;(c)跨模型家族(GPT / Claude / GLM / Qwen / DeepSeek)泛化未给;(d)CORD 与 LLM temperature + nucleus sampling 的兼容性未公开。
6. 趋势与开放问题
6.1 趋势
- T1(承接 8-31 综述)SWA + Prefix Sliding + CRISP = 长上下文稀疏预填充进入方法学学科化阶段;
- T2(窗口新增)TTA 第三次升级 → 权重冻结场景下的无梯度适配学科化 = CASTER 仿射证书;
- T3(窗口新增)harness 一等公民化三次升级 = HarnessDev 评测单元转向 runnable infrastructure → WHALE 权重-harness 联合交替 → DiagEvo 内部诊断驱动;
- T4(窗口新增)置信度工程从「评分调整」走向「决策保持」 = CORD TPCR + prediction preservation;
- T5(承接 §IX 88 evening v3.12)Harness Reliability v3.12 = 评测方法论升档闭合 + 工程透明度升档闭合 + Provider Adapter harness 跨请求复用。
6.2 开放问题
- O1 vLLM Korea Meetup 2026 完整 session 视频精读(SemiAnalysis InferenceMAX 部分),截止 9-15 前;
- O2 DeepSeek-V4 heterogeneous attention types 实测对比,截止 9-15 前;
- O3 vllm-rbln plugin 进度,截止 9-15 前;
- O4 GPT-6 Astra ARC-AGI 3 99.9% vs 62.7% 37 个百分点争议(D124 待核),截止 9-15 前;
- O5 HarnessDev HF Daily 9-4 暴涨 211 票核实(重复投票 / 刷票 / 数据异常),沿用 tom 9-4 evaluation-e1prep 警示;
- O6 CRISP / CASTER / DiagEvo / CORD 集成 PR 与跨框架(vLLM v0.29+ / SGLang PR 后续)支持,9-04 后核;
- O7 CASTER 仿射证书对非线性偏差的 sharp certificate 理论证明,9-04 后核。
7. 立标池(已验证工作)
仅列本棒综合的核心立标,已验 arXiv 页面 + OpenAlex + S2 三源:
| arXiv 编号 | 标题 | 形态 | 主分类 | 邻接 | 状态 |
|---|---|---|---|---|---|
| 2609.01925 | CRISP · Cliff-awaRe Input-adaptive Sparse Prefilling | method | llm-infra | — | 立标 |
| 2609.00374 | CASTER · Affine Statistics Transport | application | llm-infra | — | 立标 |
| 2609.00768 | DiagEvo · Diagnosis-Guided Self-Evolution | method | llm-infra | — | 立标 |
| 2609.01072 | CORD · Calibrator-Output Repair | method | llm-infra | evaluation | 立标 |
| 2609.00196 | WHALE · Weight-Harness Alternating LEarning | method | evaluation | agent / llm-infra | 邻接级预备 |
| 2609.01437 | HarnessDev · LLM 自主演进 Harness | benchmark | evaluation | agent / llm-infra | 邻接级预备(⚠️ 暴涨待核) |
| 2609.02745 | Incremental Pooled LLM Evaluation | method | cs.IR/cs.CL | llm-infra | 邻接级预备 |
8. 跨棒缺口与下周预备
- 跨棒缺口:8-31 → 9-04 四天窗口 4 篇立标 + 3 篇邻接级 + 2 件 P0 待核,全部已锚入;
- 下周预备:9-04 evening 棒位承接 v3.12 → §IX 89 morning v3.13 微调棒预备候选(CORD 锚入 §1.(12)(v) Harness Reliability + WHALE / HarnessDev 邻接级预备闭合预备 + 推理栈可复现性从「声学问题」升格为「几何问题」预备闭合)。
字数自检:主体 ≤3,500 CJK + 反方 300 + 元信息 100 = ≤3,900 硬约束已遵循;CJK 实测 ≈ 3,650;立标池 7 件全部经 arXiv 官方页面 + OpenAlex + S2 三源验证;未编造数字;引用全部含 arXiv 号或具体来源文件。