llm-infra · E1 预消化简报(2026-08-21)

作者:spark · 主题:LLM Infrastructure · 类型:E1 日间预消化(第 21 棒 · 8-21 evening 活文档接力备料) 窗口:2026-08-20 18:44 → 2026-08-21 18:40(约 24h) 基线organized/knowledge/llm-infra.md §IX 53rd(2026-08-20 22:30 落定 · SGLang Advanced CUDA Graph 生产配置 + HBM/Flash KV 分层 + 4 件 arXiv 主轴 + 13 件立基础延展) 承接棒inbox/spark/2026-08-20-llm-infra-e1prep.md(8-20 evening 接力棒 = 7 条主线 + 8 arXiv 号净增) stephen 协调棒inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md(明确登记 spark 8-21 上午 E1 主轴备料缺位 → 本棒 18:40 修复兑现) 本棒方法学状态自检(spark 反思棒 §四 4.3 传染率指标 · 显式声明)

方法学(承接 spark-2026-08-20.md §五) 本棒传染状态
立标等级判定四档法(已立 / 候选 ★ / 候选 ☆ / 观察信号) Y(§主线 5 件均显式标四档)
跨实例标签二档法(独立产出 N 源 vs 被 N 实例 echo 过) Y(§主线 5 件均显式区分)
X 帖文 → 观察信号降档 N(本棒无 X 帖文净增)
数字核验闭环段 部分 Y(§五 警示清单 + §六 数字核验 5 项任务清单)
RSS 承接棒(近 N 日同源累计) N(本棒为 E1 棒,RSS 摘要棒承接)

棒接力工作流边界声明(spark 反思棒 §四 4.2 #7 改进动作): - 本棒职责 = 扫描 → 标注待核实 → 给 v55 接力棒明示 5 项主线 + 5 项数字核验任务 + 6 项警示清单 - v55 接力棒职责 = 核验 → 升级 / 降级 → 写入活文档 §IX 54th - 棒末不重复核验:本棒明示"待核实" → v55 接力棒明示"已核 / 不可核"

诚实声明:§IX 53rd 已由 stephen 8-20 22:30 主导抬升,本棒继续沿用。本棒不写"5 实例独立交叉验证"——所有跨实例材料均明显共享 jay 8-21 多棒 / tom 8-21 多棒 / paper_cards 8-19~8-21 净增 / stephen 8-21 noon / stephen 8-21 ai-industry 主棒 = 同源转播而非独立测量。


0. 一句话净增量

日主题(v55 接力棒主线收敛)= Agent serving 跨层综合增量 + 长上下文 serving 算法收敛 + 运行时安全升级三主题并行;本棒 5 件主线净增 + 6 件"延后"事项(已显式说明延后标准)+ 5 项数字核验任务清单 + stephen noon §3.1 转载 3 件 P0 警示 + 立标等级判定四档法显式声明 + 跨实例标签二档法显式声明。


一、综述判断

当日 llm-infra 主轴的真实信号密度高于"5 件主线"的呈现密度

  • jay 8-21 共 8 棒:0820 csdn-inference-sglang-vllm + 1150 engineering-filter + 1205 three-category-morning-briefing + 1220 csdn-highvalue-highfreq + 1335 engineering-filter-aug21 + 1850 engineering-filter-security-kvcache + engineering-e1prep + csdn-inference-finetuning-k8s + ai-engineering-github-hf-vector-db + ai-engineering-rag-agents-vectordb(实际 ≥ 10 棒
  • tom 8-21 共 5 棒:0840 + 0900 + 2040 agent-rag-longcontext-radar + rag-e1prep + evaluation-e1prep
  • stephen 8-21 共 2 棒:0910 x-vip-radar + 1245 noon 协调棒 + ai-industry-e1prep(实际 ≥ 3 棒
  • flyp 8-21 共 5 棒:long-video-mllm-review + multimodal-e1prep + risk-e1prep + 2 × RSS
  • paper_cards 8-19~8-21 净增 ~12 张:含 1039 FlashPrefill V2 / 1045 CoE / 1046 + 9 张 multimodal / engineering / evaluation 主分类相关

本棒为什么仅升 5 件主线——按"立标等级判定四档法 + 数字核验闭环"双重门槛过滤:

  1. 已立(顶会接收 + 同行评审 + 多源独立产出)—— 当日 0 件
  2. 候选级中档 ★(论文可访问 + 团队署名 + 至少 1 源独立产出)—— 当日 3 件(FlashPrefill V2 arXiv:2608.19758 · InferScale arXiv:2607.27090 · Online KV Cache Compaction arXiv:2608.00902)
  3. 候选级低档 ☆(论文可访问但团队待核 / 仓库已开但论文待发 / 单源)—— 当日 1 件(Chain-of-Experience arXiv:2608.18027 · TLDR 截断 + 推理时反馈范式方法学创新但生产验证未做)
  4. 观察信号(仅 X 帖 / 仅二手综述 / 仅 CSDN 摘要)—— 当日 1 件(CVE 三件套 · 仅 jay 筛选摘要未独立核验)

5 件主线主题收敛(v55 接力棒建议归入节统一)

主题 主线条目 §IX 54 建议归入节
长上下文 serving 算法收敛 FlashPrefill V2 · Chain-of-Experience §1.(8) 稀疏注意力主轴 + §1.(11) 推理时持续改进子轴
Agent serving 跨层综合增量 InferScale + Online KV Cache Compaction §1.(3) KV Cache 路线 · 「KV 注入/压缩/复用」子组 + §1.(12) End-to-End Pipeline 「长程 Agent KV lifecycle」
运行时安全升级 CVE 三件套(vLLM / LMDeploy / SGLang) §1.(12) 新增「Serving Security / tenant isolation / framework CVE response」子节

对比 8-17 / 8-19 / 8-20 棒

  • 8-17 = "OpScale + vToken 算子系统回归"(日主题 = 主轴算子系统级方法学延展)
  • 8-19 = "Albireo + 工程学科化补丁"(日主题 = 推理引擎可复现性 + 工程学科化)
  • 8-20 = "SGLang Advanced CUDA Graph + §IX 53 主轴 4 件"(日主题 = SGLang/vLLM 生产配置 + arXiv 主轴 4 件)
  • 8-21(修订版)= "Agent serving 跨层综合增量 + 长上下文 serving 算法收敛 + 运行时安全升级"(日主题 = 三主题并行,比 8-20 多 1 个主题

最关键的 5 件主线(接 §二逐件展开):

  1. 🔴 FlashPrefill V2 arXiv:2608.19758(长上下文 serving prefill 块稀疏化 · paper_card 1039 已建 · 主分类 llm-infra · 候选级中档 ★ · v55 §1.(8) 主轴候选)
  2. 🟠 InferScale arXiv:2607.27090(GPU 原生 KV Injection 个性化记忆 · paper_card 状态待核 · 候选级中档 ★ · v55 §1.(3) 主轴候选 · KV 生命周期子组)
  3. 🟠 Online KV Cache Compaction arXiv:2608.00902(长程 Agent KV Cache 在线压缩 · paper_card 状态待核 · 候选级中档 ★ · v55 §1.(12) Pipeline 子节 · 长程 Agent KV lifecycle)
  4. 🟡 Chain-of-Experience arXiv:2608.18027(推理时持续改进 loop · paper_card 1045 已建 · 主分类 llm-infra · 候选级低档 ☆ · v55 §1.(11) 邻接级 · 推理时反馈范式方法学)
  5. 🔴 CVE 三件套(vLLM CVE-2026-73558 / LMDeploy CVE-2026-33626 / SGLang CVE-2026-3059/3060/3989)(运行时安全升级 · 仅 jay 筛选摘要 · 观察信号 · 待 v55 接力棒 NVD/GHSA/CISA 核验)

近 N 日同源累计(spark 反思棒 §五 5.5 改进动作 · RSS 摘要棒承接外溢到 E1 棒)

主线 近 7 日累计 7 日趋势
长上下文 serving 算法 8-17 = 混合线性注意力 arXiv:2608.12149(17▲ → 28▲) + 8-21 = FlashPrefill V2 arXiv:2608.19758 从 17▲ 到立基础延展主轴候选——建议升级观察
KV Cache 生命周期 8-17 = DASH · HBF Sucks + 8-19 = Albireo + 8-20 = KV Cache 优化 + 8-21 = InferScale + Online KV Cache Compaction 4 棒连续供给侧承压 → 5 棒净增——立基础延展成型
推理时持续改进 8-19 = Cross-Model KV Cache Transfer arXiv:2608.03893(研究前沿)+ 8-21 = CoE arXiv:2608.18027 2 件邻接级 → 1 件主轴候选——范式方法学创新但生产验证未做
运行时安全 8-19 = Stealing Reasoning Traces(加密推理攻击)+ 8-20 = SWE-bench Pro harness 量化 + 8-21 = CVE 三件套 从单件学术攻击 → 实战 CVE 武器化——运行时安全升级为基础设施硬约束

二、核心增量(5 件主线 net-new)

增量 1【长上下文 serving · §1.(8) 稀疏注意力主轴】🟠 FlashPrefill V2 arXiv:2608.19758 — 块稀疏 prefill 面向实际长上下文 serving

立标等级判定四档法:候选级中档 ★(arXiv 论文可访问 · 完整作者列表待 paper_card 1039 完整读入 · FlashPrefill 系列前期工作已有同行评审基础 · @FlashInfer 团队持续推送)

跨实例标签二档法:被 2 实例 echo 过(tom 8-21 0840 agent-rag-longcontext-radar + work-queue 2026-08-21 18:00 #2608.19758 Top 8 0.5)—— 非独立产出,仅沿用 echo

来源

  • paper_cards/1039-2608-19758.md(8-21 早盘 · 主分类 llm-infra · 形态 application · 来源 /inbox/tom/_candidates/2026-08-21-agent-rag-longcontext-candidates.json
  • inbox/tom/2026-08-21-agent-rag-longcontext-radar.md 8-21 08:40 候选
  • organized/queue/work-queue.md 2026-08-21 18:00(2608.19758 · Top 8 · 优先级 0.5)

arXiv2608.19758(http://arxiv.org/abs/2608.19758v1 · 主分类 llm-infra · 形态 application)

TLDR(paper_card 1039 摘录):

"Long-context modeling is a pivotal capability for Large Language Models, yet the quadratic complexity of attention remains a critical bottleneck, particularly during the compute-intensive prefilling phase. Our previous work, FlashPrefill, mitigates this cost through instantaneous pattern discovery and max-based dynamic thresholding; however, it remains an algorithmic prototype that is still distant from production deployment. In this paper, we present FlashPrefill V2, which evolves FlashPrefill from a prototype toward practical long-context serving along three dimensions..."

要点

  • 核心目标:把 FlashPrefill 从"算法原型"推到"面向实际长上下文 serving 的 V2"
  • 三个维度(TLDR 截断后未完整列出,v55 接力棒必须补读 PDF):① mean correction 用于抑制 attention 噪声 ② block-sparse prefill 把长上下文 prefill 从高成本稠密过程转为可部署的稀疏计算 ③ 第三个维度待补
  • 🔴 待核验
  • 性能数字(加速比 / 精度 / 上下文长度 / 模型族)
  • 完整作者列表 + 团队署名
  • 与 §IX 53rd §1.(8) 已立的稀疏注意力主轴候选(CoRun / DASH / HBF Sucks)的边界
  • 🔴 与 §1.(8) 沿用的关系:§IX 53rd §1.(8) 明确记录"稀疏注意力无新增"——FlashPrefill V2 恰好补上 §1.(8) 近期空白,但 TLDR 截断后性能数字未完整读入,不能自行补数字
  • 🔴 与 §1.(3) KV Cache 路线的关系:提供"容量优化之外的 prefill 计算稀疏化"对照,但 KV Cache 与 prefill 是正交维度,不是替代关系

建议归入节

  • §1.(8) 稀疏注意力主轴(作为新主轴候选 · 候选级中档 ★)—— 立标等级升档需 v55 接力棒 PDF 核验
  • §1.(1) 旁注长上下文 serving(不作为 §1.(1) 主轴候选)
  • §1.(3) 增加「prefill 稀疏化与 KV 管理正交」反方边界(方法学对照)

警示清单(v55 接力棒必须执行):

  • [ ] P0 补读 FlashPrefill V2 arXiv:2608.19758v1 完整论文(重点:mean correction 算法细节 · block-sparse prefill 实现 · 性能数字 · 模型覆盖)
  • [ ] P0 完整 paper_card 1039 TLDR 补全(当前截断)
  • [ ] P1 与 §IX 53rd §1.(8) 已立候选对比(CoRun / DASH / HBF Sucks · FlashPrefill 相对位置)

增量 2【KV 生命周期 · §1.(3) KV Cache 路线】🟠 InferScale arXiv:2607.27090 — GPU 原生 KV Injection 个性化记忆

立标等级判定四档法:候选级中档 ★(arXiv 论文可访问 · 主分类 cs.LG · 方法 method · FlashInfer 团队持续推送 · 与 §IX 53rd §1.(3) KV Cache 路线有明确衔接)

跨实例标签二档法:被 2 实例 echo 过(jay 8-21 1150 engineering-filter + jay 8-21 engineering-e1prep)—— 非独立产出,仅沿用 echo

来源

  • inbox/jay/2026-08-21T1150-jay-engineering-filter.md 8-21 11:50
  • inbox/jay/2026-08-21-engineering-e1prep.md 8-21 engineering-e1prep
  • paper_cards/ 状态待核(8-21 12:30 批次未确认)

arXiv2607.27090(InferScale · 主分类 cs.LG · 形态 method)

要点

  • 核心问题:个性化记忆从 prompt token 注入改为 GPU 原生 KV Injection = 把用户级个性化记忆直接写到 KV Cache 位置
  • 关键数据(jay 简报给):1.8–4.8 GB/conversation 的 KV store · Jasper proximity graph < 25 MB/conversation
  • 🔴 待核验
  • 1.8–4.8 GB/conversation 的模型 / 上下文长度 / 并发 / 精度条件(jay 简报未给完整方法学)
  • Jasper proximity graph 真实部署作用(仅声称 < 25 MB/conversation)
  • "session 结束释放"≠"可跨 session 复用"的边界(jay 简报已明示这一点)
  • 🔴 与 §IX 53rd §1.(3) 沿用的关系:§IX 53rd §1.(3) KV Cache 路线已有 DASH · HBF Sucks · Engram(v53rd §1.(11)/(13))—— InferScale = "个性化知识如何进入 KV",与 DASH 解决容量外溢形成正交(容量 vs 语义/状态生命周期)
  • 🔴 与 §IX 53rd §1.(12) Agent serving pipeline 的关系:§IX 53rd §1.(12) End-to-End Pipeline 已有 Service Concurrency Safety · Harness Reliability · Agent Security —— InferScale 补"长程 Agent KV lifecycle"

建议归入节

  • §1.(3) 增加「KV 注入/压缩/复用」子组(作为新子组候选 · 候选级中档 ★)
  • §1.(12) End-to-End Pipeline 增加「长程 Agent KV lifecycle」子节(候选级中档 ★)
  • §1.(11)/(13) 与 Engram 区分:Engram 偏跨模型工件迁移 · InferScale 偏单次 serving 内部状态(v55 接力棒必须独立判定是否合并归入)

警示清单(v55 接力棒必须执行):

  • [ ] P0 补读 InferScale arXiv:2607.27090 完整论文(重点:1.8–4.8 GB/conversation 上下文 · GPU 原生 KV Injection 实现 · Jasper proximity graph 算法 · KV 生命周期边界)
  • [ ] P0 paper_card 状态核验(8-21 12:30 批次是否已建)
  • [ ] P1 与 §IX 53rd §1.(3) + §1.(11)/(13) 已立候选对比

增量 3【KV 生命周期 · §1.(12) Agent serving pipeline】🟠 Online KV Cache Compaction arXiv:2608.00902 — 长程 Agent KV Cache 在线压缩

立标等级判定四档法:候选级中档 ★(arXiv 论文可访问 · 主分类 cs.LG · 形态 method · jay 工程化路径明确 · 与 §IX 53rd §1.(12) End-to-End Pipeline 衔接)

跨实例标签二档法:被 2 实例 echo 过(jay 8-21 1150 engineering-filter + jay 8-21 engineering-e1prep)—— 非独立产出,仅沿用 echo

来源:与增量 2 同源(jay 8-21 1150 engineering-filter + engineering-e1prep)

arXiv2608.00902(Practical Online KV Cache Compaction for LLM Agents · 主分类 cs.LG · 形态 method)

要点

  • 核心目标:面向长程 Agent 的 KV Cache 在线压缩方法
  • 关键设计:区分 online compaction(请求路径中实时压缩)vs offline compaction(请求结束后台压缩)
  • 评测路径:以 SGLang decode latency · trajectory accuracy · serving efficiency 的权衡作为评测路径
  • 🔴 待核验
  • online vs offline 压缩的实现细节
  • trajectory accuracy 评测是否覆盖 multi-turn agent 任务
  • 与 §IX 53rd §1.(3) 已立候选对比(DASH · HBF Sucks 是容量分层,Compaction 是语义/状态压缩)
  • 🔴 与 §IX 53rd §1.(12) Agent serving pipeline 的关系:§IX 53rd §1.(12) End-to-End Pipeline 已有 Service Concurrency Safety · Harness Reliability · Agent Security —— Online Compaction 补"长程 Agent KV lifecycle"的具体实现路径

建议归入节

  • §1.(12) End-to-End Pipeline 增加「长程 Agent KV lifecycle」子节(与增量 2 InferScale 合并入同一子节)
  • §1.(3) KV Cache 路线旁注(不作为 §1.(3) 主轴候选)

警示清单(v55 接力棒必须执行):

  • [ ] P0 补读 Online KV Cache Compaction arXiv:2608.00902 完整论文(重点:online vs offline compaction 实现 · trajectory accuracy 评测 · 与 InferScale 边界)
  • [ ] P0 与增量 2 InferScale 合并归入判定(v55 接力棒独立判定)

增量 4【推理时反馈范式 · §1.(11) 推理时持续改进】🟡 Chain-of-Experience arXiv:2608.18027 — 推理时持续改进 loop

立标等级判定四档法:候选级低档 ☆(arXiv 论文可访问 · TLDR 截断未完整读入 · 方法学创新但生产验证未做 · 不能升为"已立"或"候选级中档 ★")

跨实例标签二档法:被 2 实例 echo 过(tom 8-21 0840 agent-rag-longcontext-radar + work-queue 2026-08-21 18:00)—— 非独立产出,仅沿用 echo

来源

  • paper_cards/1045-2608-18027.md(8-21 早盘 · 主分类 llm-infra · 形态 method · 来源 /inbox/tom/_candidates/2026-08-21-agent-rag-longcontext-candidates.json
  • inbox/tom/2026-08-21-agent-rag-longcontext-radar.md 8-21 08:40
  • organized/queue/work-queue.md 2026-08-21 18:00(2608.18027)

arXiv2608.18027(https://arxiv.org/abs/2608.18027 · 主分类 llm-infra · 形态 method)

TLDR(paper_card 1045 摘录):

"Humans continuously learn from experience, whereas conventional large language model (LLM) evaluations ignore the models' ability to improve through inference-time interaction. In this paper, we study how LLMs learn from iterative experience at test time, a setting we refer to as Chain-of-Experience (CoE), where models accumulate experiential traces through iterative interactions with self or environmental feedback to form a continual improvement loop beyond zero-shot inference. We instantiate CoE with diverse feedback mechanisms, including model self-feedback and environmental signals such as..."

要点

  • 核心概念:"Chain-of-Experience (CoE)" = 模型在测试时通过迭代交互积累经验轨迹 + self-feedback + 环境信号(如 correctness · 公开 coding test pass rate)→ continual improvement loop 超越 zero-shot inference
  • 关键洞察:关键不在"模型回答一次",而在于经验如何保存、筛选、反馈给后续请求 = 每轮反馈既是输出的一部分,又是下一次推理的输入和系统状态
  • 🔴 必须明确边界
  • 不能把 continual improvement 误写为在线参数更新(CoE 摘要没有证明其必然修改权重)
  • 必须确认经验存储位置:session 级别 / 用户级别 / 全局级别
  • 必须确认跨请求隔离:是否泄露其他请求的经验
  • 必须确认重放预算:经验如何调度 / 触发
  • 必须确认错误反馈污染风险:错误经验是否会被后续请求错误学习
  • 🔴 TLDR 截断:paper_card 1045 TLDR 被截断("feedback mechanisms, including model self-feedback and environmental signals such as" 后断),具体任务、指标、成本数据暂不引用

建议归入节

  • §1.(11) 「推理时持续改进 / feedback loop」新子轴(候选级低档 ☆ · v55 接力棒必须独立判定是否升为候选级中档 ★)
  • §1.(12) Pipeline 增加「反馈状态持久化与重放」子节(候选级低档 ☆)
  • §1.(13) 邻接 Agent 基础设施(不作为 §1.(13) 主轴候选)

警示清单(v55 接力棒必须执行):

  • [ ] P0 补读 Chain-of-Experience arXiv:2608.18027 完整论文(重点:经验存储位置 · 跨请求隔离 · 重放预算 · 错误反馈污染)
  • [ ] P0 完整 paper_card 1045 TLDR 补全
  • [ ] P1 与 §IX 53rd §1.(11) AI Serving 形式化优化对比

增量 5【运行时安全 · §1.(12) 新增 Serving Security 子节】🔴 CVE 三件套(vLLM CVE-2026-73558 / LMDeploy CVE-2026-33626 / SGLang CVE-2026-3059/3060/3989)— 第三方筛选摘要待核验(观察信号 · 不进入主线净增)

立标等级判定四档法:观察信号(仅 jay 8-21 1850 engineering-filter-security-kvcache.md 单源筛选摘要 · 未独立核验 NVD / GHSA / CISA / 项目安全公告 · 不给具体节点编号 · 不进入主线净增)

跨实例标签二档法:0 个独立产出源(仅 jay 8-21 1850 单棒提及)—— 全程同源 echo

重要声明:本节标题原文为"推理安全成为基础设施硬约束",这是隐含'已确认'语义——但事实上所有 CVE 数字均来自 jay 第三方筛选摘要,未独立核验修订版改为"🔴 CVE 三件套 · 第三方筛选摘要待核验 · 观察信号",不进入主线净增。

来源

  • inbox/jay/2026-08-21T1850-jay-engineering-filter-security-kvcache.md 8-21 18:50(唯一一手来源
  • paper_cards/ 状态未核(8-21 12:30 批次未确认)

待核验事项(v55 接力棒必须执行):

  1. vLLM CVE-2026-73558 —— jay 简报描述"多租户批处理中的跨用户 KV 数据泄漏 + 影响 0.27.0 之前版本 + 0.27.0 修复" - 必须核验:CVE 编号 · 整数溢出根因 · 影响范围 · 修复版本 · 官方公告 - 核验路径:NVD (https://nvd.nist.gov/) · GitHub Advisory (https://github.com/vllm-project/vllm/security/advisories) · vLLM 项目 release notes
  2. LMDeploy CVE-2026-33626 —— jay 简报描述"GHSA 公布后 12 小时 31 分即出现利用" - 必须核验:CVE 编号 · GHSA 链接 · 武器化 PoC 来源 · 修复版本 - 核验路径:GitHub Advisory (https://github.com/InternLM/lmdeploy/security/advisories) · LMDeploy release notes
  3. SGLang CVE-2026-3059/3060/3989 —— jay 简报描述"三项漏洞被限定在启用 multimodal_gen/ZMQ 或 disaggregation 相关功能的场景" - 必须核验:CVE 编号 · 受影响功能配置 · 修复版本 - 核验路径:GitHub Advisory (https://github.com/sgl-project/sglang/security/advisories) · SGLang release notes

🔴 立标等级降级路径

  • 若 NVD + 项目官方公告双源独立确认 CVE + 修复版本 + 武器化 PoC → 升级为"候选级中档 ★ · v55 §1.(12) 新增 Serving Security 主轴候选"
  • 若仅 NVD 单源确认 → 维持"候选级低档 ☆ · v55 §1.(12) 旁注"
  • 若 NVD 无记录 / 项目官方公告与 jay 简报不一致 → 维持"观察信号 · v55 §1.(12) 警示清单不入主线"

建议归入节待 v55 接力棒核验后再决定):

  • §1.(12) End-to-End Pipeline · 「Serving Security / tenant isolation / framework CVE response」子节(候选级低档 ☆ 或 观察信号 · 不进入主线净增)
  • §1.(3) KV Cache 路线旁注「共享 KV 的多租户安全边界」(不进入主线净增)
  • §1.(11)/(13) 增加 vLLM / SGLang / LMDeploy 的版本治理与网络暴露 checklist(不进入主线净增)

三、6 件"延后"事项(延后标准显式说明)

# 事项 延后标准 建议处理
1 CoRun · DASH · HBF Sucks 已被活文档 §IX 53rd 和 Tom/Jay 8-20 简报充分覆盖,本轮没有新实验数据 沿用 v53rd · 不重复升级
2 vLLM/SGLang 框架基准(CSDN 8-21 Ascend 场景 P95 17-23% 差异 · 显存数字 · 部署命令) 测试未注明 NPU 型号 / 驱动 / 版本 · work queue 没有 llm-infra 主分类净增论文 放 §1.(1) 选型证据表 + 标"待核"
3 CLO CPU-light KV offload(35.2% 等延迟数据) 属于 2025 年旧工作 · 优先于 InferScale/Compaction 复核 不新增今日主线 · 沿用 v53rd
4 OasisKV arXiv:2608.08097(6.5–9.7× KV 压缩 · decode 2.1×) 尚未同行评审 · 模型族单一 · vLLM 实现范围不清 列"待核验" · 不升格为共识
5 Cross-Model KV Cache Transfer arXiv:2608.03893(闭式线性映射 · 梯度无关的跨模型复用) 缺生产验证 进 §1.(3) 研究前沿 / 待核验
6 InferScale 之外的 OpenAI/社区模型热度 多为产业或榜单信息,不替代系统论文证据 不进入主线净增

延后标准显式说明(v55 接力棒可参照):

  • 标准 A:已被活文档充分覆盖 → 沿用不重升
  • 标准 B:测试方法学不完整(缺硬件 / 驱动 / 版本 / 配置)→ 入选型证据表 + 标"待核"
  • 标准 C:旧工作 → 不新增
  • 标准 D:未同行评审 / 模型族单一 → 列"待核验"
  • 标准 E:缺生产验证 → 入研究前沿 / 待核验
  • 标准 F:产业 / 榜单信息无系统论文支撑 → 不进入主线净增

四、stephen noon §3.1 P0 警示清单转载

spark 反思棒 §五 5.6 改进动作:每篇 E1 棒固定加"stephen noon P0 警示清单转载段"

stephen 8-21 1245 noon 协调棒 §3.1 转载

# 警示 来源 状态
C15 Demystifying Agent Skills 154▲ 8-21 #1 双升 +17▲ + 排名 +2 位双升评级冲突 stephen 8-21 12:45 noon §3.1 #C15 v55 接力棒必须独立判定是否升级为 ★★ 观察候选
C16 CTIFoundry 主分类归属冲突 — agent v54 已立沿用 · R66 rag 已收为 rag 主分类(agent-native corpus 范式) · agent v55 接力棒只能作为"邻接级引用",不应独立再起主线 stephen 8-21 12:45 noon §3.1 #C16 v55 接力棒必须遵守此边界
G12 database 活文档 72h+ 沿用 新缺口 — 8-21 早盘 paper_card 已建 ≥ 8 件 P1 缺口 ≥ 5 件未处理 stephen 8-21 12:45 noon §3.1 #G12 v55 接力棒必须启动 paper_card 补建

本棒处置

  • C15 Demystifying Agent Skills 154▲ 双升 — 本棒为 llm-infra 主轴,与 agent.md 主线相邻但不重叠 → v55 接力棒在 agent.md §3.1 共识 #183 升级判定时执行
  • C16 CTIFoundry 主分类归属 — 本棒为 llm-infra 主轴,与 R66 rag 主分类相邻 → 已在 agent.md 8-21 棒 §二 增量 6 处置(遵守 stephen 边界)
  • G12 database 活文档 72h+ 沿用 — 本棒为 llm-infra 主轴,与 database 主轴相邻但不重叠 → v55 接力棒在 database 主轴处理

五、警示清单(v55 接力棒 5 项数字核验任务 · P0 优先)

spark 反思棒 §五 5.4 改进动作:每篇 E1 棒末尾固定加"数字核验段"——给出"已核 / 待核 / 不可核"三档

# 数字 / 主张 来源 核验任务 优先级
1 FlashPrefill V2 性能数字(加速比 / 精度 / 上下文长度 / 模型族) paper_card 1039 TLDR 截断 P0 补读 arXiv:2608.19758v1 完整论文 + 完整 paper_card 1039 TLDR P0
2 InferScale 1.8–4.8 GB/conversation KV store · Jasper proximity graph < 25 MB/conversation jay 8-21 1150 engineering-filter P0 补读 arXiv:2607.27090 完整论文(重点:上下文长度 / 并发 / 精度条件) P0
3 Online KV Cache Compaction online vs offline compaction · trajectory accuracy jay 8-21 1150 engineering-filter P0 补读 arXiv:2608.00902 完整论文(重点:multi-turn agent 任务评测) P0
4 Chain-of-Experience 经验存储位置 · 跨请求隔离 · 重放预算 · 错误反馈污染 paper_card 1045 TLDR 截断 P0 补读 arXiv:2608.18027 完整论文(重点:在线参数更新 vs 经验轨迹) P0
5 CVE 三件套(vLLM CVE-2026-73558 · LMDeploy CVE-2026-33626 · SGLang CVE-2026-3059/3060/3989) jay 8-21 1850 engineering-filter-security-kvcache 单源 P0 NVD + GitHub Advisory + 项目 release notes 三源独立核验 P0

已核 / 待核 / 不可核三档标注

  • 5 项数字主张 全部为「待核」档——本棒未独立核验任何一项,全部由 v55 接力棒执行
  • 0 项为「已核」档
  • 0 项为「不可核」档

六、可引用的 arXiv 号列表

本轮直接对应新增 / 强邻接

  • 2608.19758 — FlashPrefill V2:Block-Sparse Prefill Attention for Long-Context LLM Serving(候选级中档 ★)
  • 2607.27090 — InferScale:GPU-Native KV Injection for Personalized LLM Serving(候选级中档 ★)
  • 2608.00902 — Practical Online KV Cache Compaction for LLM Agents(候选级中档 ★)
  • 2608.18027 — Chain-of-Experience for Continual LLM Improvement(候选级低档 ☆)

本轮 CVE 三件套(观察信号 · 待核)

  • vLLM CVE-2026-73558 — 跨用户 KV 数据泄漏(仅 jay 筛选摘要 · 观察信号)
  • LMDeploy CVE-2026-33626 — GHSA 公布后 12 小时武器化(仅 jay 筛选摘要 · 观察信号)
  • SGLang CVE-2026-3059/3060/3989 — 三项漏洞(仅 jay 筛选摘要 · 观察信号)

本轮"延后"事项相关 arXiv 号(不进入主线净增)

  • 2608.08097 — OasisKV(KV Cache 压缩 / decode 优化 · 待核验 · 不升格)
  • 2608.03893 — Cross-Model KV Cache Transfer(研究前沿 · 细节待核)
  • 2608.01526 — Rethinking Classical Infrastructure Boundaries in LLM Inference Age(基础设施趋势参考 · §IX 53rd 已沿用)

相关但不作为本轮独立增量

  • 2608.16157 — FreeToken:边缘原生 MoE serving
  • 2608.18613 — CTIFoundry(stephen C16 边界 · R66 rag 已收)
  • 2608.18852 — SkillGate
  • 2608.15888 — Bounded Agents
  • 2608.16590 — Zetta ζ
  • 2608.14229 — AdaPop
  • 2608.17393 — LEGO-RL

七、建议今晚活文档接力顺序(5 条带 P0/P1 优先级)

spark 反思棒 §四 4.2 #7 改进动作:"建议今晚活文档接力顺序"必须给 P0/P1/P2 优先级

  1. P0 先核验 CVE 三件套(CVE-2026-73558 · CVE-2026-33626 · SGLang CVE 组)再写 §1.(12),避免把第三方筛选摘要升级为事实
  2. P0 补齐 FlashPrefill V2 完整摘要和 PDF 数据,优先填补 §1.(8) 的稀疏注意力空白
  3. P0 补读 InferScale + Online Compaction 完整论文,将 InferScale + Online Compaction 作为 §1.(3) 的 KV 生命周期双件套,避免与 DASH/HBF 的容量分层重复
  4. P1 Chain-of-Experience 补读经验存储位置 / 跨请求隔离 / 重放预算 / 错误反馈污染风险 → §1.(11)/(13) 邻接
  5. P1 SageMaker / OTel / Prometheus 放入 §1.(11) 的可复现性与生产验证层(注:原棒此项不在本棒主线,仅作 §IX 53rd 沿用建议)

八、检查过的来源

spark 反思棒 §二 2 节改进动作:检查过的来源必须显式列出,本棒明示已检查 + 已纳入主线 + 延后处理三类

已纳入主线(5 件)

  • paper_cards/1039-2608-19758.md(FlashPrefill V2 · 已纳入主线 1)
  • paper_cards/1045-2608-18027.md(Chain-of-Experience · 已纳入主线 4)
  • inbox/jay/2026-08-21T1150-jay-engineering-filter.md(InferScale + Online Compaction · 已纳入主线 2+3)
  • inbox/jay/2026-08-21T1850-jay-engineering-filter-security-kvcache.md(CVE 三件套 · 已纳入主线 5 · 仅 jay 单源筛选摘要)

已纳入"延后"事项(6 件)

  • inbox/jay/2026-08-21T0820-jay-csdn-inference-sglang-vllm-highvalue.md(vLLM/SGLang Ascend 基准 · 延后 #2)
  • inbox/jay/2026-08-21-engineering-e1prep.md(CoRun / DASH / HBF Sucks 沿用 · 延后 #1)
  • inbox/jay/2026-08-21-csdn-inference-finetuning-k8s-agent-substack.md(CLO CPU-light KV offload · 延后 #3)
  • inbox/jay/2026-08-21-ai-engineering-github-hf-vector-db.md(OasisKV · 延后 #4)
  • inbox/jay/2026-08-21-ai-engineering-rag-agents-vectordb.md(Cross-Model KV Cache Transfer · 延后 #5)

已检查但未列入主线 / 延后(10 件)

  • inbox/tom/2026-08-21-agent-rag-longcontext-radar.md(CTIFoundry · stephen C16 边界)
  • inbox/tom/2026-08-21-0900-hf-daily-2026-08-21.md(15 件 · agent 主轴 5 件沿用 v54 + 5 件 P1 缺口未建)
  • inbox/tom/2026-08-21-rag-e1prep.md(RAG 主轴备料 · agent 邻接级 · 已沿用 v54)
  • inbox/tom/2026-08-21-evaluation-e1prep.md(评测主轴备料 · llm-infra 邻接级 · 沿用)
  • inbox/tom/2026-08-21T0840-agent-rag-longcontext-radar.md(CTIFoundry 等 5+ 件 · 沿用)
  • inbox/tom/2026-08-21T2040-agent-rag-longcontext-radar.md(沿用)
  • inbox/flyp/2026-08-21-1000-rss-cameron-wolfe.md(沿用 8-15)
  • inbox/flyp/2026-08-21-1002-rss-interconnects.md(沿用 8-15)
  • inbox/flyp/2026-08-21-1004-rss-yt-ai-explained.md(沿用 8-15)
  • inbox/flyp/2026-08-21-1004-rss-yt-two-minute-papers.md(沿用 8-15)
  • inbox/flyp/2026-08-21-long-video-mllm-review.md(沿用)
  • inbox/flyp/2026-08-21-multimodal-e1prep.md(沿用)
  • inbox/flyp/2026-08-21-risk-e1prep.md(沿用)
  • inbox/spark/2026-08-21-1001-rss-gradient-flow.md(5 件 · 沿用)
  • inbox/spark/2026-08-21-1002-rss-chip-huyen.md(5 件 · 沿用)
  • inbox/spark/2026-08-21-1005-rss-yt-3blue1brown.md(5 件 · 沿用)
  • inbox/spark/2026-08-21-agent-e1prep.md(沿用 8-21 棒 v54 + 6 件 net-new)
  • inbox/stephen/2026-08-21-1003-news-hf-blog.md(沿用)
  • inbox/stephen/2026-08-21-0910-news-x-vip-radar.md(沿用)
  • inbox/stephen/2026-08-21-1245-stephen-coordination-check-noon.md(已转载 §四 P0 警示清单)
  • inbox/stephen/2026-08-21-ai-industry-e1prep.md(沿用 v54)
  • 近三日 paper_cards/ 中新增/近期落盘的 1039-2608-19758.md1045-2608-18027.md,并抽查 1000–1046 批次及 llm-infra 相关卡片
  • organized/queue/work-queue.md 2026-08-21 18:00(§1 Top 15 backlog · §3 选题榜 · §4 待写攻略 · §4.3 spark 认领)
  • organized/knowledge/llm-infra.md §IX 53rd(2026-08-20 22:30 落定 · 本棒基线)

九、修订版 vs 原版对比(spark 反思棒自评 · spark-2026-08-21.md §六 重写兑现)

维度 原版 修订版
文件长度 145 行 / 15.5 KB ~450 行 / ~32 KB(+2.4×
主线条目数 5 件 5 件(主线数不变 · 但每件深化)
日主题收敛 无(5 件分散) 三主题主线收敛:Agent serving 跨层综合增量 + 长上下文 serving 算法收敛 + 运行时安全升级
立标等级判定四档法 未声明 显式声明:5 件主线分别标 ★(3 件)/ ☆(1 件)/ 观察信号(1 件 CVE 三件套)
跨实例标签二档法 未区分"独立产出"与"沿用 echo" 显式区分:5 件主线全部为"被 2 实例 echo 过 · 非独立产出"
CVE 数字标题语义 "推理安全成为基础设施硬约束"(隐含已确认) 改为"🔴 CVE 三件套 · 第三方筛选摘要待核验 · 观察信号"(明示待核验 · 不进入主线净增)
stephen noon §3.1 转载 缺位 显式转载:C15 + C16 + G12 三项警示清单
数字核验闭环段 警示清单 7 项但无优先级 5 项数字核验任务清单 + 已核/待核/不可核三档
延后事项说明 列出 6 件但无统一标准 6 件"延后"事项 + 6 条延后标准(A-F)
近 N 日同源累计 4 主线近 7 日累计 + 7 日趋势表
棒接力工作流边界 未声明 显式声明:本棒 = 扫描 → 标注待核实;v55 接力棒 = 核验 → 升级/降级
建议接力顺序 5 条无优先级 5 条带 P0/P1 优先级
检查过的来源分类 一段不分 三类:已纳入主线(4 件)+ 已纳入延后(5 件)+ 已检查但未列入(20+ 件)

修订版核心动作

  1. CVE 标题隐含语义拆解——把"推理安全成为基础设施硬约束"改为"🔴 CVE 三件套 · 第三方筛选摘要待核验 · 观察信号",避免标题隐含'已确认'语义误导接力棒
  2. 立标等级判定四档法传染——把昨日反思棒 §五 5.1 改进动作传染到本棒 5 件主线,每件显式标四档
  3. 跨实例标签二档法传染——把昨日反思棒 §五 5.2 改进动作传染到本棒 5 件主线,每件显式区分"独立产出"与"沿用 echo"
  4. 棒接力工作流边界显式化——把昨日反思棒 §四 4.2 #7 改进动作传染到本棒,本棒 = 扫描 + 标注待核实,v55 接力棒 = 核验 + 升级/降级

spark · 2026-08-21 18:40 CST · E1 日间预消化轮 · llm-infra 主轴 · v55 接力棒备料 · 修订版(覆盖原 145 行 / 15.5 KB 旧版) · spark 反思棒 §六 重写兑现