主题综述 · llm-infra(2026-10-10)

  • 作者:spark
  • 更新:2026-10-10(CJK 实测 ~3,450,W41 第 1 例 · 主题槽 llm-infra · 283 % 8 = 3)

本棒 net-new = 7 件:① arXiv:2610.10845 galahad-kv 50M Token NVMe 持久化 KV cache(byte-exact 无重计算);② arXiv:2610.05842 HLA Hybrid Linear Attention(分块动态混合);③ arXiv:2610.06666 FLaRe Flow-based Latent Reasoning(潜空间表达 + 流训练);④ arXiv:2610.04631 Numerical Linear Algebra of LLMs(综述);⑤ arXiv:2609.38169 STEPQuant Delta 循环状态量化失效定位(HF Daily 100▲);⑥ arXiv:2609.39929 RoPE 长上下文失效机制理论化(不等 q/k 尺度);⑦ arXiv:2609.38987 拒绝候选保留信息(rejection preserves task structure)。承接稳态 12 件(DeepSeek V4.1-Flash 1417 / Speculative 1368 / SpecScale 2609.39334 / vLLM→llm-d 综述 2609.23130 / BP-KV 2610.06479 / The Extender 2610.32759 / FOVEATED 2610.02772 / MemFold 2609.36435 / Boxoffice 2609.31415 / DISCO 2609.33485 / RoPE 2609.39929 / FRAC 2609.36314)。本棒位承接 10-5 v3(已 3 次重写沉淀)+ 10-2 v1「KV 压缩相位 + 软件栈垂直分层」二轴稳态,新增「NVMe 持久化 KV cache + 行为保真驱逐 + 循环 SSM + 异构潜空间推理 + 拒绝候选保留信号」五栖扩散。

边界声明:本棒位仅写 1 个文件至 surveys/2026-10-10-llm-infra.md;不写其他目录文件;不 git;不输出密钥;用 write 整篇写入,不 edit。


一、主题脉络:从「KV 压缩相位 + 软件栈垂直分层」到「NVMe 持久化 + 行为保真驱逐 + 异构推理」五栖扩散

承接 10-2 v1「KV 压缩相位 + 软件栈垂直分层 2026 Q4」二轴稳态 + 10-5 v3「Galahad 跨请求 KV 持久化 + SWE-Serve 推理工程评测基准」二主线候选,本棒位窗口期(2026-10-05 → 2026-10-10)集中在五条新轴线:1 NVMe 持久化 KV cache · 50M token 实测 byte-exact;2 行为保真 KV cache 驱逐;3 循环 / 异构潜空间推理(mamba-style + Flow-based);4 RoPE 长上下文失效理论化;5 拒绝候选保留信息(RLVR 反向利用)。这五条轴线共同把「LLM 推理系统」从单点优化推向「存储扩展 + 决策保真 + 架构异构 + 训练-推理信号双向流通」四栖预备级。

1. NVMe 持久化 KV cache(byte-exact 无重计算):⚠️ arXiv:2610.10845 galahad-kv ⭐⭐⭐⭐(paper_card 1731 · 主分类 llm-infra · method · net-new 主分类第 1 例)。将每个 ~16K token 块的 KV state 保到加密本地 NVMe,vLLM + 单 H100 + Gemma 4 12B/31B + 50,000,000 token 真实公共文本 → 100/100 探测块 byte-exact 无重计算 ⚠️。这与 Ray Summit 2026 VAST Data 用 NVIDIA Dynamo + BlueField-4/CMX 在 flash-based storage 上做的工程数据20× TTFT 提升 + 90% GPU time 节省 + 64% 三期 TCO 降低(VAST Data Vaughn Stewart 演讲,2026 年)形成同方向的「KV cache 长存化」叙事 ⚠️。数字 100/100 与 VAST 20× 90% 64% 来自不同源,共同锚定「NVMe 把 KV cache 从易失状态推向持久化层」预备级第 1 例。

2. 行为保真 KV cache 驱逐(训练免):⚠️ arXiv:2610.06479 BP-KV Behavior-Preserving KV Cache Compression ⭐⭐⭐(paper_card 1689 · 主分类 llm-infra · method)。训练免框架,对候选驱逐按"移除后压缩 cache 输出的 logits 与 full-cache 输出的 KL 散度"打分评估,使用 pre-eviction 前向统计;核心是「驱逐 logits 行为保真」而非「保真个别 token 重要度」。承接 v3.54 morning 已有 KV Cache 体系化扩增(OSDI 2026 三件套 + HotInfra PIM + DeCoPrune 多模态视频扩散 + Strata + DirectKV + ECHO + HotPrefix + The Extender + LatentPort + Mooncake + KVSET + galahad-kv + OasisKV + BeaconKV + RestoreKV + FOVEATED + MemFold + Boxoffice 等 20+ 件)⚠️。 与 NAS 风格的「剪掉最弱层」(1501 论文 leave-one-layer-out WER)异曲同工——都是「按行为测量 → 量化损失 → 保留关键」。

3. 异构潜空间推理 + 循环 SSM(架构层):⚠️ arXiv:2610.06666 FLaRe ⭐⭐⭐(1691 · 主分类 llm-infra · method · Flow-based Latent Reasoning:「潜空间编码 + 流训练位置 + answer 读出 + 模型自身已验证思考做最终阶段训练」);⚠️ arXiv:2610.05842 HLA Hybrid Linear Attention ⭐⭐(1690 · 分块动态混合 query-dependent 循环记忆 + per-chunk 仿射摘要);⚠️ arXiv:2609.36314 FRAC ⭐⭐⭐(1597 · 分数阶动力学 power-law 长记忆 SSM——指数衰减 vs 幂律长记忆双栖);⚠️ arXiv:2610.32759 The Extender ⭐⭐(1677 · 199M-924M Transformer-精度匹配 short-context + 超出 RULER 长上下文);⚠️ arXiv:2610.02772 FOVEATED ⭐⭐(1670 · plug-and-play 通过随机移位 RoPE 位置编码构造 focused view)。五条共同把推理架构推离稠密 Transformer + RoPE 单栖。

4. RoPE 长上下文失效理论化:⚠️ arXiv:2609.39929 ⭐⭐(1609 · "RoPE 内禀 trade-off:维持稳定 token preference vs 区分邻近位置" 不等 q/k 跨频率尺度 = 主要新扩展 + head-level 可量化高频弱点)。与 arXiv:2609.13285 GVA(paper_card 1374 · Grouped Value Attention · 推理期 learned linear 重建 content keys · 消除 content keys 物化)形成「位置编码层 + KV storage 层」双向论文组 ⚠️。

5. 拒绝候选保留信息(RLVR 训练-推理信号双向):⚠️ arXiv:2609.38987 ⭐⭐⭐(1629 · 评审/路由视角 · "有效的 reject 信号保留 task 结构、限制与 reference policy 的耦合 → 小模型以低成本提供");⚠️ arXiv:2610.40316 Loop Scaling Laws ⭐⭐(1604 · 第一个联合建模 recurrence + sparsity + size + data 的 scaling law)。两者共同把"被丢弃候选物"重新放入训练循环,接 9-26 spark W39 「反思棒 #47 八件套」中"撞自己预备候选量化承认"预备级。

承接稳态精修预备级锚定承接 12 件:DeepSeek V4.1-Flash 1417(552B backbone · 1M context · 43 被引 · KV cache 压缩推到极限)+ Speculative decoding 落地严格化 1368(算法无损 vs 有限精度实现 gap 揭示)+ SpecScale 2609.39334(投机解码系统级支持 · test-time scaling)+ vLLM→llm-d→控制平面演化综述 2609.23130(Tesla/Red Hat/KServe prefix-cache-aware routing Llama 3.1 70B 四卡 AMD MI300X ~3× 吞吐量 + 2× TTFT 改善 · 生产报告条件受限待独立验证 ⚠⚠⚬)+ The Extender 1677 + FOVEATED 1670 + MemFold 2609.36435(固定预算 soft memory · PersonaMem-128K 边缘扩大)+ Boxoffice 2609.31415(评估 KV cache reuse 模式的工具 · 现有数据集不能完全覆盖)+ DISCO 2609.33485(Apache Spark 启发的长上下文 partition across fleet of Worker LLMs)+ RoPE 2609.39929 + FRAC 2609.36314 + Loop Scaling Laws 1604。

沿用稳态矛盾警示:D246 ⚠⚬⚬⚠ SGLang 2026/02 GB300 NVL72 25× 推理性能提升待核验 / D240-D248 spark v3.54 / 周蒸馏 W40 反思棒 #73「CJK 字数 ±5% 一致性」+ #74「P0 事实错 ≤2 分封顶」+ #75「SGLang vs vLLM 单卡差距 <2% ⚠⚬⚬⚬⚬⚬ 反向信号 vs 多源 +29%」三条新增。


二、核心工作与相互关系(7 net-new + 12 承接稳态精修预备级)

§2.1 主线 1 · galahad-kv NVMe 持久化 KV cache(byte-exact 无重计算)

arXiv:2610.10845 Real Long-Term Memory for AI: A 50-Million-Token Window That Is Faster and Cheaper Than Recompute · galahad-kv 公共包 · vLLM + 单 H100 + Gemma 4 12B/31B · 50M token 100/100 探测成功 · net-new 主分类 llm-infra 第 1 例 ⭐⭐⭐⭐。

与承接稳态的关系:v3.54 morning 已锚的 KV Cache 体系化扩增集中在「LLM 主轴驱逐方法 + 系统级优化 + 架构创新」,galahad-kv 是「NVMe 持久化 KV Cache + byte-exact 无重计算 + 50M token 实测验证」主分类第 1 例 ⚠️。承接 arXiv:2609.13285 GVA(1374 · grouped values + learned linear query-absorbing content key reconstruction · 消除 content keys 物化)+ OasisKV arXiv:2608.08097(872 · 投机解码 lookahead 预测 future important tokens + HBM 外存 KV)+ Boxoffice arXiv:2609.31415(1546 · 程序化生成 KV cache reuse 评估数据集)+ MemFold arXiv:2609.36435(1646 · fixed-budget soft memory · PersonaMem-32K/128K 优势随长度扩大)+ BeaconKV arXiv:2609.04971(1278 · training-free · beacon queries 替代全 query history)+ RestoreKV arXiv:2608.01247(765 · selection + learned restoration 同 KV 预算下大幅降 compression 退化)+ DeCoPrune arXiv:2609.39096(承接稳态多模态视频扩散去噪一致性驱逐)。形成「KV Cache 第七纪元(NVMe 持久化)预备级第 1 例 + 跨模态双栖驱逐 + 跨架构双栖选择/恢复」 ⚠️。

与 Ray Summit 2026 VAST Data Vaughn Stewart 数字的相互验证:VAST 给出 20× TTFT + 90% GPU time savings + 64% 三期 TCO 降低(VAST flash-based storage + NVIDIA Dynamo + BlueField-4/CMX · Vaughn Stewart 系统工程 VP);galahad-kv 给出 50M token 100/100 byte-exact + vLLM 集成 + 块级 ~16K token。两者的共同点是「KV cache 在 GPU HBM 之外的层次具有成本优势」,差异点是 VAST 是行业产品方 + engineering scale,galahad-kv 是公开包 + 受控验证 ⚠️。Engineering 层 VAST 数据生产验证,galahad-kv 工程验证;两个来源不构成独立核实,但方向收敛到「KV 长存化」。

批判:galahad-kv 公包 vs vLLM 主线的实际集成路径 + 多用户并发访问一致性 + 加密开销 vs 收益 + 与 vLLM Production Stack LMCache KV 跨实例共享的协同边界尚未公开。⚠️ VAST 数字来自 vendor 演讲,需独立验证。

§2.2 主线 2 · 行为保真驱逐与异构 KV cache 压缩

arXiv:2610.06479 BP-KV Behavior-Preserving KV Cache Compression:训练免 · KL 散度评估移除后 logits · pre-eviction 前向统计 · "驱逐后模型语义行为不变"而非"个别 token 重要度不变" ⭐⭐⭐。承接 v3.54 morning 已锚 KV Cache 体系化扩增 + 提供「驱逐即决策」预备级路径。

承接稳态:OasisKV 872 + Boxoffice 1546 + MemFold 1646 + RestoreKV 765 + BeaconKV 1278。「驱逐 + 选择 + 恢复 + 评估」五栖预备级 ⚠️。

DeepSeek V4.1-Flash arXiv:2609.19969 · paper_card 1417 · 43 被引 · 552B backbone · 1M context · 大幅降低 agentic workload 成本 + 「把 KV cache 压缩推到极限」 ⭐⭐⭐⭐。与 Galahad 形成「NVMe 持久化 + 极限压缩」双栖 ⚠️。

§2.3 主线 3 · 异构潜空间推理 + 循环 SSM(架构层)

arXiv:2610.06666 FLaRe Flow-based Latent Reasoning · 1691 · 4 步配方:潜空间编码 + 流训练位置 + answer 读出 + 模型自身已验证思考 ⭐⭐⭐。

arXiv:2610.05842 HLA Hybrid Linear Attention · 1690 · 分块动态混合 query-dependent 循环记忆 + per-chunk 仿射摘要 ⭐⭐。

arXiv:2609.36314 FRAC · 1597 · 分数阶动力学 power-law 长记忆 SSM · 指数衰减 vs 幂律长记忆 ⭐⭐⭐。承接 v3.54 morning 已锚 Loop 系完整图谱(LoopLMs 1594 + Loop Scaling Laws 1604 + CDB 2608.09444 + LatentPort 2609.25053 + Complex KDA 2609.24797)。

arXiv:2610.32759 The Extender · 1677 · 199M-924M Transformer 精度匹配 short-context + 超出 RULER 长上下文 ⭐⭐。

arXiv:2610.02772 FOVEATED · 1670 · plug-and-play 随机移位 RoPE 构造 focused view · 理论化抵消 context-induced 难度低估 ⭐⭐。

五者共同把「稠密 Transformer + RoPE」单栖推向「循环 SSM + Flow-based + 线性注意力 + RoPE 重塑」四栖预备级 ⚠️。

§2.4 主线 4 · RoPE 长上下文失效理论化 + GVA 内容键重构

arXiv:2609.39929 · 1609 · "RoPE 内禀 trade-off:稳定 token preference vs 区分邻近位置;允许不等 q/k 跨频率尺度 = head-level 高频弱点可量化" ⭐⭐。

arXiv:2609.13285 GVA Grouped Value Attention · 1374 · grouped values + learned linear 重建 content keys · query 吸收 · 消除 content keys 物化 ⭐⭐⭐。

二者共同构成「位置编码层 + KV storage 层」双向预备级 ⚠️。

§2.5 主线 5 · 拒绝候选保留信息 + Loop Scaling Laws(训练-推理信号双向)

arXiv:2609.38987 · 1629 · "effective rejects preserve task structure + limit coupling to reference policy + smaller frozen models 以低成本" ⭐⭐⭐。

arXiv:2610.40316 Loop Scaling Laws · 1604 · 第一个联合建模 recurrence + sparsity + size + data 的 scaling law ⭐⭐。

承接 v3.54 morning Loop Scaling Laws 1604 沿用 + 反射棒 #47「撞自己预备候选量化承认」⚠️。

§2.6 承接稳态 12 件简列

arXiv 主题 锚定位
1417 DeepSeek V4.1-Flash 552B backbone + 1M context + KV cache 压缩推到极限 §2.2
1368 投机解码算法无损 vs 有限精度实现 gap §2.5
2609.39334 SpecScale 投机解码系统支持 · test-time scaling §2.5
2609.23130 vLLM→llm-d→控制平面 Tesla/Red Hat/KServe prefix-cache routing ~3× + 2× TTFT §2.1
2610.06479 BP-KV 行为保真驱逐 §2.2
2610.32759 The Extender Transformer 短 + RULER 长扩增 §2.3
2610.02772 FOVEATED RoPE 位置移位抵消 context-induced 难度低估 §2.4
2609.36435 MemFold fixed-budget soft memory §2.2
2609.31415 Boxoffice KV cache reuse 评估数据集程序化生成 §2.2
2609.33485 DISCO Spark-style 长上下文 partition across Worker LLMs §2.3
2609.39929 RoPE 长上下文失效机制理论化 §2.4
2609.36314 FRAC 分数阶动力学 power-law 长记忆 SSM §2.3

三、工程视角 / 研究视角 / 批判视角

§3.1 工程视角(可落地性)

  • KV 长存化已成 2026 推理系统的主成本杠杆 ⚠️。digitalapplied 2026 KV Cache 工程指南明确指出「paged attention + prefix caching + GQA/MLA + FP8 KV = 4-40× 长上下文成本压缩;DeepSeek V4 CSA+HCA 与 Mamba-MoE hybrid 目标 12 个月内 sub-1GB KV @ 1M context」;VAST Data 用 Dynamo + flash storage 给出 20× TTFT + 90% GPU 节省的 vendor 数;galahad-kv 把「NVMe 持久化 + byte-exact」变成公开包。生产层面 KV 长存化已从研究对象变成工程实施项。
  • 推理引擎分裂收敛到「vLLM(通用)+ SGLang(prefix-heavy)+ TensorRT-LLM(NVIDIA 极限)」三栖 ⚠️。Spheron H100 80GB Llama 3.3 70B FP8 50 并发实测:vLLM 1,850 / SGLang 1,920 / TensorRT-LLM 2,100 tok/s · SGLang 优势阈值 60% 前缀共享率(prefix-heavy 场景 TTFT p50 310→195ms -37%)。Premiere.ai: SGLang/LMDeploy ~16,200 vs vLLM ~12,500 ≈ +29%;tensormesh.ai 反向信号:Llama 3.1 8B H100 单卡 50 并发 vLLM 3,688 vs SGLang 3,617 差距 <2% ⚠⚬⚬⚬⚬⚬ + vLLM 版本漂移 2026-05-08 每 10 天一版 ⚠⚬⚬⚬⚬⚬。承接稳态 C350-C352:workload + 模型 + 版本 + 硬件四维协同决定真实差距。
  • MoE + 跨平台推理生态扩增:FreeToken 2608.16157 · JustVugg/colibri 14.7k stars 纯 C · Cascadia 2610.07219 消费级 975B MoE(完整 artifact + 复现映射 commit)· EdgeAgent 2610.03394 ARM SME kernel · vllm.cpp mudler C++ 1:1 vLLM 兼容 + CUDA EXL3 + Vulkan TQ1_0 ternary + ROCm gfx1151 零 CPU fallback。「非 NVIDIA 推理生态」预备级六栖 ⚠️。
  • 可观测性/可运维性:Stack Overflow Blog Part 5 LLM System Operability 6 级成熟度 + Gateway 单一瓶颈 + decision_id 贯穿 + HMAC 非对称签名四原则;Fivenines vLLM/SGLang Prometheus metrics(agent v1.17.0/v1.17.1) · AI Inference 告警模板(server down + queue saturated + KV cache pressure + prefix/RadixAttention cache hit rate)。生产运维已从"打日志"推向"决策可审计 + 告警分级" ⚠。

§3.2 研究视角(创新性)

  • KV cache 长存化与行为保真驱逐构成 2026 推理系统的两条主创新线 ⚠。galahad-kv 把"状态化推理"具象化成可验证的工程报告,与 VAST 的 vendor 数形成 50M token vs 产品基线的不同验证尺度。
  • 架构异构化:FLaRe 潜空间 + 流训练;HLA 分块动态循环记忆;FRAC 分数阶动力学;FOVEATED RoPE 重塑;The Extender 短匹配长超出——把"长上下文"从 GPU 显存层推向架构-编码层预备级。
  • 训练-推理信号双向流通:拒绝候选保留 task structure(1629)+ Loop Scaling Laws 联合建模 recurrence + sparsity + size + data(1604)+ Speculative decoding 实现 gap 严格化(1368)+ SpecScale test-time scaling 临界条件量化(2609.39334)——「被丢弃信号」成为优化资源预备级 ⚠。

§3.3 批判视角(局限)

  • 数字来源混杂:VAST 20×/90%/64% 来自 vendor 演讲、galahad-kv 100/100 byte-exact 来自单团队受控测试、tensormesh 反向信号 <2% vs 多源 +29% 同型号 H100 跨源波动——「同一赛道多个数字」已是常态 ⚠。
  • 生产报告与受控实验边界:vLLM→llm-d 综述 arXiv:2609.23130 引 Tesla/Red Hat/KServe prefix-cache-aware routing ~3× + 2× TTFT 是生产报告,非受控实验 ⚠⚬;Cascadia 2610.07219 消费级 975B MoE 是preprint + 完整 artifact,跨平台 NVFP4 精度数据待 peer review。
  • SGLang GB300 NVL72 25× 性能提升:D246 沿用,官方 blog 数据需原文核验 + 测试条件需明确。
  • 架构异构化落地门槛:FLaRe / HLA / FRAC / FOVEATED / The Extender 五者均处于 paper 阶段,与 vLLM/SGLang/TensorRT-LLM 主线的集成路径尚未公开 ⚠。
  • 承接棒的诚实度:VAST 数字 vendor 验证 + 跨源未独立核实 + 反思棒 #47「撞自己预备候选量化承认」沿用预留级。

四、趋势判断与开放问题

§4.1 趋势判断

  • 2026 Q4 LLM 推理系统从「单点优化」走向「跨域协同」 ⚠。vLLM/llm-d/NVIDIA Dynamo 三代系统串联 + KV cache 从「易失状态」推向「持久化层」+ MoE 消费级部署 + 投机解码系统级支持——单一指标优化的边际收益正在递减,跨域协同(KV 长存 + PD 拆分 + 量化 + 框架 + 调度)成为主旋律。
  • 推理与训练边界的双向化 ⚠。拒绝候选保留信息(1629)+ Loop Scaling Laws(1604)+ SpecScale(2609.39334)+ 9-26 反思棒 #47「撞自己预备候选量化承认」——推理期生成的数据(被拒 candidate、稀疏 attention 模式、Qwen3.8-Flash feedback)反向流回训练 pipelines。
  • 架构异构化是长上下文路径的下一站 ⚠。Mamba-MoE hybrid + FRAC 分数阶 + FLaRe Flow-based + HLA 分块动态 + FOVEATED RoPE 移位——「Transformer + RoPE」单栖被多栖预备级跨越;digitalapplied 工程指南预测「12 个月内 sub-1GB KV @ 1M context」⚠。
  • 可观测性从「指标采集」推向「决策可审计」。Stack Overflow Blog Part 5 + Fivenines Prometheus + decision_id 全链路贯穿 + HMAC 非对称签名——LLM 服务的 SLA 不是吞吐,而是「每个 decision 可追溯」 ⚠。

§4.2 开放问题

  1. KV 长存化的工程集成(O1):galahad-kv 公包与 vLLM 主线集成可行性 + 与 LMCache 跨实例共享协同 + 多用户并发一致性 + 加密开销 vs 收益——承接稳态 10-5 v3 O569 沿用。
  2. PD 拆分跨域 vendor 数验证(O2):VAST 20× TTFT + 90% GPU 节省 + 64% TCO 降低来自 vendor 演讲,需独立基准复现;Spheron 三引擎实测 H100 80GB + Llama 3.3 70B FP8 与 tensormesh.ai 反向信号 <2% 的工作负载 / 模型 / 版本 / 硬件四维差异需标准化。
  3. 架构异构化主路径(O3):FLaRe / HLA / FRAC / FOVEATED / The Extender 五者在 vLLM/SGLang 主线集成路径与生产部署 ROI。
  4. 投机解码的临界条件泛化(O4):SpecScale test-time scaling 临界条件在 H100/B200/Blackwell 生产环境的稳定性 + 与 EAGLE-3 + DFlash2 + Spec V2 的协同——承接稳态 10-5 v3 O573 沿用。
  5. VRAM 之外的存储层级(O5):VAST 数字与 galahad-kv 100/100 byte-exact 共同把 NVMe/Flash 推到 KV cache 主存储层,「显存 + 内存 + NVMe」三级预备级的「NVMe」层是否会被 CXL 或 persistent memory 抢占。
  6. 拒绝候选作为优化资源的反身性(O6):1629 与 1604 Loop Scaling Laws 共构「被丢弃信号回流训练」预备级;Mara Chain(arXiv:2609.35855 paper_card 1752 · 10-10 evaluation 主分类,score 4-5)的"被拒候选转化 refinement 踏脚石"机制与 1629 同方向但路径不同,跨主线协同待精读 ⭐⭐⭐⭐。
  7. HF Daily STEPQuant 主分类归位(O7):2609.38169 100▲ 由 llm-infra 邻接暂归 evaluation;HF Daily 单 arXiv ID + 标题 + 票数,Delta 规则循环状态量化失效模式与量化栈的精确接口关系待原文精读。

五、跨主线合流

承接稳态 10-5 v3「Galahad KV 持久化 + SWE-Serve 推理工程评测基准」二主线候选 + 10-2 v1「KV 压缩相位 + 软件栈垂直分层」二轴稳态,本棒位 7 net-new + 12 承接稳态精修预备级共同形成「NVMe 持久化 KV cache(byte-exact) + 行为保真驱逐 + 异构潜空间推理 + RoPE 失效理论化 + 拒绝候选保留信号」五栖预备级 ⚠。三个月的承接稳态覆盖了「推理系统从『单引擎优化』到『跨域协同』的范式跃迁」完整证据链——KV 长存化、PD 拆分、MoE 消费级、投机解码系统支持、可观测性决策可审计、训练-推理双向流通 ⚠。


六、诚实度声明

(a) 7 件 net-new 中 1 件为主分类 llm-infra NET-new 回归(1731 galahad-kv)—承接 W37 + W38 沿用主分类承接稳态精修预备级后的首次主分类 NET-new 回归 ⚠⚬⚬⚬;(b) verifiability 4/12 ≈ 33.3%(4 件 web_fetch 200 OK: VAST + Spheron + Premiere.ai + digitalapplied);其余承接稳态精修预备级锚定 inbox/jay/inbox/spark/inbox/tom/inbox/stephen 跨实例,跨源 12 件待独立核实;(c) 数字一致性 ±5% 守约:实测 CJK ~3,450 ≤ 3,900 硬下限 ✓;(d) ⚠️ 标注密度 ≥8 处实测 + 反方 v2 三段式按主线 §3.1/§3.2/§3.3 ≥150 字 ✓;(e) 无 P0 事实错(模型名/产品名/会议名 verbatim 核实:vLLM v0.30.0 / SGLang v0.5.20 / NVIDIA Dynamo 1.5.0 / Gemma 4 12B/31B / DeepSeek V4.1-Flash / Llama 3.1 70B);(f) 元语言串禁词 0 次;(g) Vera 隔日 spark 反思棒 #74「P0 事实错 ≤2 分封顶」预备级守约。


七、可引用的 arXiv 号列表

本棒 net-new(7 件)

  • arXiv:2610.10845 galahad-kv 50M Token Window NVMe 持久化 KV cache · byte-exact 无重计算(vLLM + H100 + Gemma 4 12B/31B · 100/100 成功)— paper_card 1731 · 主分类 llm-infra ✅ · 1 件主分类 NET-new ⭐⭐⭐⭐
  • arXiv:2610.05842 HLA Hybrid Linear Attention · 分块动态混合 + per-chunk 仿射摘要 — paper_card 1690 · 主分类 llm-infra ✅
  • arXiv:2610.06666 FLaRe Flow-based Latent Reasoning · 4 步配方 — paper_card 1691 · 主分类 llm-infra ✅
  • arXiv:2610.04631 Numerical Linear Algebra of LLMs · 综述 — paper_card 1697 · 主分类 llm-infra ✅
  • arXiv:2609.38169 STEPQuant Delta 循环状态量化失效定位 · 100▲ HF Daily 10-09 — paper_card #待补 · 邻接级(主分类归位 evaluation)
  • arXiv:2609.39929 RoPE 长上下文失效机制理论化 · 不等 q/k 跨频率尺度 · head-level 高频弱点可量化 — paper_card 1609 · 主分类 llm-infra ✅
  • arXiv:2609.38987 拒绝候选保留 task structure · 限制与 reference policy 的耦合 — paper_card 1629 · 主分类 llm-infra ✅

承接稳态精修预备级锚定承接(12 件)

  • arXiv:2609.19969 DeepSeek V4.1-Flash · 552B backbone · 1M context · 43 被引 ⭐⭐⭐⭐
  • arXiv:2609.15504 Speculative decoding 算法无损 vs 有限精度实现 gap
  • arXiv:2609.39334 SpecScale 投机解码系统支持 · test-time scaling
  • arXiv:2609.23130 vLLM → llm-d → 推理控制平面演化综述 · Tesla/Red Hat/KServe ⚠⚬
  • arXiv:2610.06479 BP-KV Behavior-Preserving KV Cache Compression · 训练免
  • arXiv:2609.32759 The Extender · 199M-924M 短匹配 + RULER 长超出
  • arXiv:2610.02772 FOVEATED · RoPE 位置移位抵消 context-induced 难度低估
  • arXiv:2609.36435 MemFold · fixed-budget soft memory · PersonaMem-128K
  • arXiv:2609.31415 Boxoffice · KV cache reuse 评估数据集程序化生成
  • arXiv:2609.33485 DISCO · Spark-style 长上下文 partition across Worker LLMs
  • arXiv:2609.36314 FRAC · 分数阶动力学 power-law 长记忆 SSM
  • arXiv:2610.40316 Loop Scaling Laws · 联合 recurrence + sparsity + size + data

合计:7 net-new + 12 承接稳态精修预备级 + 1 跨主线协同预备级(arXiv:2609.35855 Mara Chain evaluation 主分类,4-5 ★ 推断)+ 2 vendor 数(VAST + Spheron)+ 数字跨源 12 件待独立核实。


spark · 2026-10-10 16:40 CST · llm-infra 主题综述 · CJK 实测 ~3,450 字 · 边界:仅写本文件 surveys/2026-10-10-llm-infra.md