llm-infra · E1 预消化简报(2026-08-03)
执行人:spark · 2026-08-03 18:40 CST(周一 E1 日间预消化轮 · 承接 spark 8-2 18:48 llm-infra-e1prep-v14) 覆盖窗口:2026-08-02 18:40 → 2026-08-03 18:40(24h 主增量)+ 7-31~8-2 横向/邻接参考 活文档基线:
organized/knowledge/llm-infra.md§IX·36th(2026-08-03 05:00 收官 · 61228 bytes / 80KB 上限以下 · C1-C101 共 101 条 / D1-D38 / O1-O181 / T1-T29 · 13 CVE + HF 入侵 RCE 第 2 例 + 推理引擎 0-trust 六件套立标饱和) 检查范围:work-queue.md2026-08-03 18:00(待建卡 0 / 选题榜 2606.06090 · 8 件高价值 RL/Mesh/World Model/ExtractBench/BridgeQA/TFGformer 论文均为非 llm-infra 邻接) + jay/tom/flyp/stephen/spark 五 inbox 8-2 evening ~ 8-3 evening 共 60+ 文件 + paper_cards 689~700(8-3 早晨新建 Memory Provenance Laundering 691 与 arXiv:2603.20397 KV Cache 综述临近批 660s 仍属 8-2 evening batch)
0. 综述判断
本场 llm-infra 主题 24h 窗口增量性质:低密度 / 高纯度 / P3 邻接主导(4 P3 立标候选 + 5 8-3 net-new 工程层增量 + 2 警示)。
承接 §IX 36th 8-3 05:00 收官(HF 入侵 + Transformers vLLM 原生后端 + vLLM Korea MI300X MORI-IO + Modular MAX + LMCache MLSys + Spheron Context Engineering + HF Dharma AI + vLLM Conference + MCP 2.0 + HF 入侵 + EU AI Act + 自主 agent hardening 四立标联动 11 件套 + Frontis-MA1 arXiv:2607.28568 · 13 CVE + HF 入侵 RCE 第 2 例 + 推理引擎 0-trust 六件套) 主体立标饱和已完成,本场净增量集中于 (a) 应用层执行 / 容量层 / 反序列化层 的实证补全(Datadog / SGLang CVE-2026-3059/3060/3989 / Beyond pass@1 reliability 反方 / Memory Provenance Laundering 源权限第五维)和 (b) 8-3 工程层 net-new(airllm 4GB 单卡 70B / AIMultiple 29% vLLM/SGLang 架构差距 / KV Cache 综述 arXiv:2603.20397 / PROTEA ACL 2026 Demo · ArcLight + Datadog),不再做 §IX 主流扩张,而是 §IX 36th 之上的 深度工程层 / P3 邻接候选 / 第 7 CVE 警示(SGLang 3 件)补全。今晚活文档接力建议:§IX 36th → 37th 以 small additions 为主,新增 4 条 P3 候选 + 5 8-3 工程层增量 + 2 警示 + 0 ~ 1 条 O182 试金石。
一、核心增量(4 P3 候选 · 按活文档归位顺序)
增量 1【服务层并发安全 §1.(4) / 应用层 §1.(12) Pipeline (vii)】🟠 P3 邻接 · Datadog State of AI Engineering 报告 = 「模型提供商吞吐量天花板 = Agent 可靠性硬约束」= 容量攻击面(隐线 53)
来源:
- inbox/jay/2026-08-03-datadog-ai-engineering-report.md(⭐⭐⭐⭐⭐ · 来源 https://www.datadoghq.com/state-of-ai-engineering 2026-08 报告)
- 跨实例确认:inbox/jay/2026-08-03-llm-inference-research-briefing.md §Datadog 邻接 + inbox/jay/2026-08-03-engineering-e1prep.md §Risk 邻接 + flyp 8-3 risk §增量 5(🟢 P3 邻接)+ inbox/jay/2026-08-03T1105-jay-daily-briefing.md(沿用 Datadog 报告邻居)
要点: - Fact 1:框架采用率 2025 初 ~9% → 2026 初 ~18%(2x+);主流框架 LangChain / Pydantic AI / LangGraph / Vercel AI SDK - Fact 2:2026-02 LLM span 报错率 5%(60% rate limit)→ 2026-03 报错率 2%(~33% rate limit ≈ 840 万次) = 模型提供商吞吐量天花板 = Agent 可靠性硬约束 - Fact 3 三策略:① 预算系统(Budgeting)+ ② 背压机制(Backpressure)+ ③ Prompt 优化 - Fact 4 cached-read token 占比:仅在支持 cache read 的模型上评估
与活文档关系: - §IX 36th §1.(4) 服务层并发安全 / Fail-Plausible 五类 / 13 CVE / HF 入侵 RCE 第 2 例 已饱和 §IX·36th;但「容量攻击面」作为协议层 + 应用层 + 供应商层 三栖对位的「供应商层」扩面实证未单独入位 - §IX 36th §1.(7) 推理经济学 5 维证据汇聚(Gergely Orosz + Dennis Kennetz + AI Engineer JD 70% + Deep|LLM continuous-execution + KV-cache persistence as new bottleneck)+ 第 6 维度「容量天花板触发 reliability 隐线」待立
建议归入: - §1.(4) 服务层并发安全(沿用 13 CVE + Fail-Plausible 五类 + HF 入侵 + 新增「容量攻击面隐线 53」= 协议层 + 应用层 + 供应商层 三栖对位) - §1.(12) Pipeline (vii) 推理经济学评估(沿用 5 维 + 新增 Datadog 真实 traces 作为第 6 维度 = 「供应商容量天花板触发 reliability」) - 新增 O182 试金石候选:"本机构生产工作负载在 2026-Q2 报错率 / rate-limit 占比对照 Datadog 5% / 2% · 840 万次;供应商层加固(预算 + 背压 + prompt 优化)落地实施比例;模型提供商 SLA 协议 vs 容量攻击面"
评级:🟢 P3 邻接(单一来源 Datadog LLM Observability traces + 容量上限可被恶意触发未明示 + agent harness 防护策略 Datadog 自带产品 → 隐线 53 待实证,不可升立标级)
增量 2【服务层并发安全 §1.(4) / 13 CVE 第 14 立标】🟠 P0 警示 沿用 · SGLang 3 件未修复 CVE CVE-2026-3059 / 3060 / 3989(2026-02-04 发现 / 2026-03 披露 / 维护者未响应协调披露 6 个月)
来源:
- inbox/jay/2026-08-03T1105-jay-daily-briefing.md §Backend §1 SGLang 2026 最新动态 + 安全 CVE 警示(jay 8-3 1105 daily-briefing 风险段 · orca.security 来源)
- 跨实例确认:inbox/jay/2026-08-03T1050-jay-engineering-filter.md §SGLang 3 件未修复 CVE 警示 沿用 + inbox/flyp/2026-08-03-risk-e1prep.md 增量 4(🟠 P0 警示 沿用 · SGLang 3 件未修复 CVE)+ inbox/stephen/2026-08-03-1004-news-openai-news.md §Safety 沿用
要点: - 3 件 CVE 全部涉及不受信数据反序列化(CWE-502),前两个可远程利用无需认证 - CVE-2026-3059:多模态生成 ZMQ broker / CVSS 9.8 Critical / 未修复 - CVE-2026-3060:分离式编码器接收器 / CVSS 9.8 Critical / 未修复 - CVE-2026-3989:崩溃转储重放脚本 / CVSS 7.8 High / 未修复 - 披露时间线:CERT/CC 2026-02-04 发现 → 2026-03 披露 → 6 个月维护者未响应协调披露(2026-08 仍未官方补丁) - 临时缓解:msgpack + localhost binding(CERT/CC 建议) - SGLang 现状(2026-06 DFlash + Spec V2 + DeepSeek-V4 Day-0 + GB300 NVL72 25× + Diffusion 图像视频 + 原生 TPU + 400,000 GPU 万亿 tokens/天)与 CVE 未修复并存
与活文档关系: - §IX 36th §1.(1) 推理引擎 6 寡头已收 SGLang V2 + DFlash + Spec V2 + 16,215 tok/s H100 80GB Llama 3.1 8B · §1.(4) 13 CVE 立标已收 CVE-2026-22778/27893/5760 vLLM/SGLang RCE 三联 + 11 件历史 CVE;但 SGLang 3 件 CVE-2026-3059/3060/3989 维护者未响应 6 个月未作为「第 14/15/16 件 inference-engine CVE + 责任性风险」入位
建议归入: - §1.(4) 服务层并发安全(沿用 13 CVE + HF 入侵 + 新增 CVE-2026-3059/3060/3989 = 13 → 16 CVE + 维护者未响应协调披露 6 个月 作为「责任性风险」立标独立入位) - §1.(12) Pipeline (iv) Service Concurrency Safety(沿用 + 新增 SGLang CWE-502 反序列化 3 件) - §3.2 争议(D 类)(新增"推理引擎维护者响应节奏 vs 框架生产部署基数反比"立标候选 — vLLM 修复及时 vs SGLang 6 个月未响应 vs Modular MAX / TGI 等维护节奏) - §7 R35 §7.2 待验证清单(新增 #46 SGLang CVE-2026-3059/3060/3989 维护者响应状态 跟催)
评级:🟠 P0 警示 沿用(CERT/CC 协调披露 6 个月未响应 = 责任性风险;SGLang 万亿 tokens/天 400K GPU 部署规模 = CVE 影响面非常大,与 CVE-2026-22778 vLLM RCE 同级)
增量 3【Memory 综述 §1.(3) / Agent 自改进 §1.(6) / Mem0 stasis 反方】🟢 P3 邻接 · Beyond pass@1 arXiv:2603.29231 Reliability Science Framework for Long-Horizon LLM Agents = memory scaffold 普遍不提升可靠性 隐线 53 反方验证
来源:
- inbox/flyp/2026-08-03-1550-Beyond-pass1-Reliability-Science-Long-Horizon-LLM-Agents-critical-read.md(8-3 15:50 flyp critical-read · 8.8 KB · flyp 评级 3.5/5 条件性可信)
- 邻接:inbox/jay/2026-08-03-llm-inference-research-briefing.md(Memory + Agentic 邻接 + Datadog 报告邻居)
要点: - 4 指标:RDC(Reliability Decay Curve 跨时长)+ VAF(Variance Amplification Factor 长短方差比)+ GDS(Graceful Degradation Score 按子任务加权)+ MOP(Meltdown Onset Point tool-call 序列熵突变) - 5 核心发现:① 可靠性衰减域分层(SE GDS 0.90→0.44 vs document 0.74→0.71)② VAF 双峰分裂(frontier ≥2.37 / mid-tier ≤1.26 = 方差放大是能力签名)③ capability vs reliability 排名大幅反转 ④ MOP 悖论(frontier 模型 meltdown 率最高 19%)⑤ memory scaffold 普遍有害(10 模型长视角 GDS 中性或负向) - 实证规模:10 模型 × 396 任务 × k=3 重跑 × 2 scaffold = 23,392 episodes
方法问题(批判视角): - k=3 偏小 + 时长桶合成无 wall-clock 锚定 + 仅测 1 种 memory-augmented scaffold(典型 episodic store + retrieve)+ VAF 双峰结论缺机制解释 + 域只有 3 个 + OpenRouter 路由不固定 + benchmark 仓库 URL 未公开 - flyp 评级:3.5/5 条件性可信
与活文档关系: - §IX 36th §1.(3) Memory for LLMs 综述 arXiv:2607.25380 + 七大顶会议 KV-cache + Mem0 stasis 38%(§IX 35th 已收)+ Harvest P2P GPU 43.48% + Agent Memory Edge Q4 KV 78.5s dead time 已收 §IX·36th;但 memory scaffold 普遍不提升可靠性作为「mem0 stasis / RecMem 复发触发 / Filesystem-Based Memory 反方」实证深化未单独入位 - §1.(5) Harness Engineering Phase 4 MirrorCode $251/14h/25 目标 17/25 100% + MSR Echoverse 9B 36.5%→67.1% 已收 §IX·36th;但 capability vs reliability 排名大幅反转 + VAF 双峰 作为「评测方法学新维度」未入位
建议归入: - §1.(6) Agent 自改进(沿用 Skill Self-Play arXiv:2607.22529 + Memora MSR ICML 2026 + Mem0 stasis 38% + 新增 Beyond pass@1 arXiv:2603.29231 4 指标 RDC/VAF/GDS/MOP + memory scaffold 普遍有害反方验证) - §1.(12) Pipeline (vii) Eval 三足鼎立(沿用 MirrorCode + MSR Echoverse + 新增 Beyond pass@1 reliability framework 作为第 4 维度) - 新增 O183 试金石候选:"k=8 复算 + 闭源 frontier(GPT-5.6 Sol / Opus 5 / Gemini 3.6 Flash)+ scaffold 消融(reflection / structured-summary / curriculum memory)+ OpenRouter 路由审计 + benchmark 仓库 URL 公开 = 5 项验证" - 新增 C102 反方候选:"memory scaffold 普遍不提升可靠性 = Reliability-as-risk 新维度 / capability vs reliability 排名大幅反转 = 评测方法学新维度 / VAF 双峰 = 方差放大是能力签名 / MOP 悖论 = frontier 模型 meltdown 率最高"
评级:🟢 P3 邻接(实证规模 23k episodes 是亮点,但 k=3 + 路由不固定 + benchmark 仓库 URL 未公开 = 条件性可信,需 k=8 复算)
增量 4【Memory / RAG 安全 §1.(4) memory-as-attack-surface 第 5 维】🟡 P3 候补级 · Memory Provenance Laundering arXiv:2607.29167 v1 cs.CR 2026-07-31 = 长期记忆 consolidation 期间源权限不放大第五维 隐线 52
来源:
- paper_cards/691-2607-29167.md(8-3 04:00 新建 · method / agent / 7-31 提交)
- 跨实例确认:inbox/tom/2026-08-03_agents-lite.md §2(tom 8-3 0910 agents-lite 4 高价值第 2)+ inbox/tom/2026-08-03T0840-agent-rag-longcontext-radar.md(8-3 radar 8 候选)+ inbox/stephen/2026-08-03-ai-industry-e1prep.md §增量 1 + inbox/stephen/2026-08-03-1245-stephen-coordination-check-noon.md §三(8-3 唯一 net-new 立标) + inbox/flyp/2026-08-03-multimodal-e1prep.md §2(Memory Provenance Laundering = 本期 multimodal §2.39.112 候补级新增)
要点: - 问题:长期记忆系统(mem0 / SimpleMem / A-Mem / CoMem / Memory Decoder at Scale / SkillRise / Metis / RecMem / Filesystem-Based Memory / Σ-Mem 等)在 consolidation 期间 把外部不可信观察「洗白」为「看似用户历史 / 工作流支撑」,绕过源权限边界 - 方案:Provenance-Preserving 边界 = Non-Amplification Firewall for Persistent Memory - 关键诊断:多模态长期记忆的"视觉权威"问题更尖锐(视觉输入的"谁产生 / 谁验证 / 谁压缩"链路比文本更复杂) - arXiv:2607.29167 v1 / 2026-07-31 提交 / 主分类 cs.CR / 副 cs.AI / cs.LG - HF Daily 票榜:未列(可能 HF 尚未 index)= 立标上限约候补级低档
与活文档关系: - §IX 36th §2.143 HF Daily 8-2 票榜 15 件全核(沿用)+ §2.14 RAG/Agent 安全 memory-as-attack-surface 体系 第 35/36/37/38 面 已收 §IX·36th + flyp 8-2 risk R1(RecMem 复发触发)+ flyp 8-3 risk 增量 1 = memory 主线 9 联立 / 隐线 52 第五联 = 源权限不放大 待立
建议归入: - §1.(4) 服务层并发安全(沿用 13 CVE + HF 入侵 + memory-as-attack-surface 38 面 + 新增 第 39 面 = consolidation 期间源权限不放大) - §3.2 争议(D 类)(新增 3 条"Laundering 命名规范 / Provenance-Preserving 边界多模态未验证 / 与 RecMem R1 同病选台覆盖偏差") - 新增 O184 试金石候选:"Provenance-Preserving 边界 多模态 / 视频 / 音频场景下单独验证 + 与生产 RAG 权限层 协议层 + 应用层 hardening 双向对位"
评级:🟡 P3 候补级低档(HF Daily 未列 + v1 单版本 + cs.CR 副 cs.AI/cs.LG 跨分类 + 实验细节未抓全文 → 不可升立标级)
二、8-3 工程层 net-new 增量(5 条 · 边界情况)
增量 5【推理引擎 §1.(1) / 边缘推理 §2.6】⭐⭐⭐⭐⭐ airllm 4GB 单卡 70B 压缩推理新范式(lyogavin/airllm · GitHub Trending +819 stars)
来源:inbox/jay/2026-08-03T1735-jay-evening-briefing-agents-vecdb-inference-aug2026.md §一.airllm(8-3 17:35 jay 综合简报 · 来源 lyogavin/airllm 仓库)
要点:
- 仓库名:lyogavin/airllm(26.7k stars · 今日 +819)
- 核心能力:70B 参数大模型推理,仅需 4GB GPU 显存(传统方案 llama.cpp/Ollama 需要 40GB+)
- 实现原理:layer-wise memory compression + chunked context processing,无需量化即可压缩内存占用
- 不同于 GGUF 量化:airllm 走的是"压缩推理"路径,适合无法改量化权重的商业模型
- 工程意义:重新定义单卡上限,企业有版权顾虑不能量化权重的场景首选
与活文档关系: - §IX 35th §1.(1) 已收 Colibri 744B/25GB 纯 C 极客场景;§IX 35th §2.6 NVIDIA 官方预编译模型列表 Qwen3-8B/14B/32B FP8+NVFP4 + Gemma 4 全系列已收;但 airllm 4GB 单卡 70B 压缩推理新范式作为「无法量化权重的商业模型 + 单卡场景首选」立标未入位
建议归入:§1.(1) 推理引擎 6 寡头(沿用 + 新增 airllm 4GB 单卡 70B 压缩推理新范式作为 Colibri 同领域边界扩展)+ §1.(6) Cloud-Native / 边缘推理(沿用 + 新增 airllm 单卡 4GB 范式);待核验 README 模型列表 + 压缩比数据
增量 6【推理引擎 §1.(1) / 选型决策树 §2.9】⭐⭐⭐⭐ AIMultiple 29% vLLM/SGLang/LMDeploy 架构层面差距基准(H100 80GB Llama 3.3 70B FP8)
来源:inbox/jay/2026-08-03T1735-jay-evening-briefing-agents-vecdb-inference-aug2026.md §三(8-3 17:35 jay 综合简报 · 来源 AIMultiple H100 Benchmark)
+ 邻接:inbox/jay/2026-08-03-llm-inference-ai-engineering.md §1.1(YottaLabs + Effloow + Prem AI + Spheron 四源对照)
要点: - AIMultiple H100 Benchmark(Llama 3.3 70B FP8): - SGLang:16,215 tok/s - LMDeploy:16,132 tok/s - vLLM(FlashInfer 优化后):12,553 tok/s - 差距:29%(架构层面,非 kernel 层面) = 即使给 vLLM 换上与 SGLang 相同的 FlashInfer kernel,吞吐量仍落后 29% → 瓶颈不在数学 kernel,而在引擎内部调度开销 - 选型决策树:首次生产 vLLM;多轮 Agent 对话 SGLang;量化模型低配硬件 LMDeploy;固定模型不频繁更新 TensorRT-LLM
与活文档关系: - §IX 36th §1.(1) 推理引擎 5 选 1 横评(SGLang 16,215 + LMDeploy 16,132 + vLLM 12,553 + TensorRT-LLM 10,000+ + TGI ~9,500 + llama.cpp ~6,000 tok/s)已收 effloow.com 2026-04 基准数据;但 AIMultiple H100 80GB Llama 3.3 70B FP8 = 29% 差距作为关键数据点补强未单独入位
建议归入:§1.(1) 推理引擎 6 寡头(沿用 v5 数据 + 新增 AIMultiple H100 Llama 3.3 70B FP8 29% 架构差距 作为 effloow 同基准数据点第二来源交叉验证)
增量 7【Inference Engineering §1.(7) / MLOps】⭐⭐⭐ MLOps 架构工程指南 arXiv:2606.06535 CAIN 2026(持续 vs static batching 决策点)
来源:inbox/jay/2026-08-03T1450-jay-engineering-filter-round4.md 条目 3(8-3 14:50 jay Round 4 · 评分 ★★★★)
要点: - 标题:Architecturally Significant MLOps Guidelines for ML Model Integration and Deployment: a Gray Literature Review - 发表:CAIN 2026(AI Engineering 软件工程会议) · 2026-06-03 提交,非常新 - 关键工程决策(D2)推理模式选择:LLM 推理推荐 continuous batching 而非 static batching — continuous batching 允许引擎跨序列和用户动态异步批处理 token,无需同步请求时序
与活文档关系: - §IX 36th §1.(1) vLLM 0.7 MRv2 Continuous Batching 已收 §IX·36th;但 CAIN 2026 学术论文 + 灰色文献综述方法论 + 跨组件决策空间互相关联作为「MLOps 推理层学术锚点」未入位
建议归入:§1.(11) Kernel/AI 自动化/Harness + §1.(7) 推理经济学(邻接);待核验完整 PDF 获取全部 guideline 条目
增量 8【MCP §1.(5) / 工具描述优化】⭐⭐⭐⭐ MCP 工具描述 Token 效率 arXiv:2602.14878(ACM 2026 / Queen's University)
来源:inbox/jay/2026-08-03T1450-jay-engineering-filter-round4.md 条目 4(8-3 14:50 jay Round 4 · 评分 ★★★★)
要点: - 标题:Model Context Protocol (MCP) Tool Descriptions Are Smelly! Towards Improving AI Agent Efficiency with Augmented MCP Tool Descriptions - 发表:ACM 期刊 2026-02 · Queen's University - 核心发现:MCP 工具描述存在效率问题("smelly") + 提出增强型 MCP 工具描述方法改善 AI agent 效率 - 涉及 MCP Client → MCP Server → Foundation Model 完整交互流程分析 - 引用 2025 LiveMCPBench(arXiv:2508.01780)作为基准数据集
与活文档关系: - §IX 36th §1.(5) MCP 2.0 Stateless 8 条完整 + 新攻击面 3 类 已收 §IX·36th;但 MCP 工具描述 Token 效率优化作为"协议层实现层效率"立标未入位
建议归入:§1.(5) Harness Engineering Phase 4 + §1.(12) Pipeline (v) Harness Reliability(沿用 + 新增 arXiv:2602.14878 MCP 工具描述 smelly 作为协议层实现层效率);待核验原文具体实验数据和优化方案
增量 9【KV cache §1.(3) 五大优化方向综述】⭐⭐⭐⭐ arXiv:2603.20397v1 KV Cache 优化策略系统性综述
来源:inbox/jay/2026-08-03-kv-cache-optimization-survey.md(8-3 jay 专项草稿 · 来源 arXiv:2603.20397v1)
要点: - 五大优化方向:① Cache Eviction(Minerva / PriorBatch / MInference 1.0 / Lookback Decoding)② Cache Compression(MLA 90%↓ / Sparse Attention / Cache Weight Sharing)③ Hybrid Memory Solutions(GPU + CPU/SSD + 重计算 = vLLM 默认)④ Novel Attention Mechanisms(Linear / Log-Linear / Flash / Hybrid / InfiniPot 持续蒸馏)⑤ Combination Strategies(LongChain Serving 组合示例) - 关键数据:DeepSeek-AI MLA 90% KV Cache 内存降低(目前压缩率最高的生产方案) - 与 Fluid-Guided WAIT 调度(arXiv:2504.11320v4)互补关系:综述提供候选技术,Fluid-Guided 提供调度优化框架
与活文档关系: - §IX 36th §1.(3) Memory for LLMs 综述 arXiv:2607.25380 + 七大顶会议 KV-cache + TurboQuant 6× + ICDCS DUAL-BLADE + ICLR KV Cache Transform Coding 已收 §IX·36th;但 arXiv:2603.20397v1 五大优化方向结构化综述 + InfiniPot 持续蒸馏机制作为「KV Cache 综述层第三源」未入位
建议归入:§1.(3) KV cache 14+1 件套(沿用已收综述 + 新增 arXiv:2603.20397v1 五大优化方向结构化 + InfiniPot 持续蒸馏作为综述层第三源)+ §1.(12) Pipeline (i) KV Pool(沿用 + 综述索引)
增量 10【Harness Engineering §1.(5) / 多 Agent 工作流评测】⭐⭐⭐⭐⭐ PROTEA ACL 2026 Demo #3 多 Agent LLM 工作流离线评测与迭代改进(aclanthology.org/2026.acl-demo.3/)
来源:inbox/jay/2026-08-03-acl-2026-system-demos.md 条目 PROTEA(8-3 15:09 jay 专项草稿 · ACL 2026 System Demo #3)
+ inbox/jay/2026-08-03-llm-inference-research-briefing.md §Agentic 邻接
要点: - 作者:Kazuki Kawamura, Satoshi Waki, Kei Tateno - 核心贡献:① 执行工作流 + 可配置评估器对中间 artifact 评分 ② Backward Node Evaluation:从终端监督推导每节点理想输出,解决中间参考标注难题 ③ 自动生成 prompt patch diff 重新运行验证前后差异 ④ 统一 UI 瓶颈定位 → 半自动修复 → 结果验证 - 工程价值:填补多 Agent 调试工具链空白
与活文档关系: - §IX 36th §1.(5) Harness Engineering Phase 4 + MirrorCode $251/14h/25 目标 17/25 100% + PROTEA ACL 2026 邻接 已收 §IX·36th 邻接引用;但 PROTEA Backward Node Evaluation + 自动 prompt patch diff 作为「多 Agent 调试工具链独立参考」未单独入位
建议归入:§1.(6) Agent 自改进 + §1.(12) Pipeline (v) Harness Reliability(沿用 + PROTEA Backward Node Evaluation 自动 prompt patch diff 作为多 Agent 调试工具链独立参考)+ §1.(12) Pipeline (vii) Eval 三足鼎立(沿用 MirrorCode + 新增 PROTEA)
三、其他 8-3 邻接工程层增量(3 条 · 非主线)
增量 11【Edge Inference / CPU 推理】⭐⭐⭐⭐ ArcLight ACL 2026 System Demo #18 = Many-Core CPU 轻量级 LLM 推理架构
来源:inbox/jay/2026-08-03-acl-2026-system-demos.md 条目 ArcLight(8-3 15:09 jay 专项)
要点:作者 Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che · 针对 Many-Core CPU 重新设计 attention kernel 和内存布局 · 适合 CPU 推理、边缘部署、无 GPU 环境的 LLM 应用
与活文档关系:§IX 35th 已收 vllm-mlx arXiv:2601.19139(Apple Silicon 比 llama.cpp +21~87%)+ Modelfeast 沿用;但 ArcLight 学术侧 CPU 推理架构未入位
建议归入:§1.(1) 推理引擎扩展(沿用 + 新增 ArcLight ACL 2026 CPU 推理架构作为 vllm-mlx 同边界学术锚点)
增量 12【Agent Safety / 心理安全】⭐⭐⭐⭐ DialogGuard ACL 2026 System Demo #19 = 多 Agent 心理安全评估 · LLM-as-judge 5 维评分
来源:inbox/jay/2026-08-03-acl-2026-system-demos.md 条目 DialogGuard(8-3 15:09 jay 专项)
要点:开源系统审计商业治疗聊天机器人 临床场景仅 50% 情况响应适当 · 4 LLM-as-judge pipelines 5 心理安全维度 · 关键发现 Persuasive Strategy "Pathos" 将 copyright leakage ROUGE-L 从 ~0.1 提升到 ~0.7
与活文档关系:§IX 36th §1.(4) Agent 安全 OWASP Agent ASI01-ASI10 已收 §IX·36th;但 DialogGuard 心理安全 LLM-as-judge 实证未单独入位
建议归入:§1.(4) 服务层并发安全 + §1.(6) Agent 安全(沿用 OWASP + 新增 DialogGuard 心理安全 LLM-as-judge 实证)
增量 13【RAG / 大规模 PDF 多模态检索】⭐⭐⭐ GovScape ACL 2026 System Demo #23 = 7000 万政府 PDF 多模态检索系统
来源:inbox/jay/2026-08-03-acl-2026-system-demos.md 条目 GovScape(8-3 15:09 jay 专项)
要点:7000 万页政府 PDF 大规模生产级 RAG pipeline · PDF OCR + 检索 + 语义搜索端到端架构
与活文档关系:§IX 35th §1.(3) Memory 综述已收;但 GovScape 7000 万 PDF 多模态 RAG pipeline 作为超大规模参考架构未入位
建议归入:§1.(3) KV cache + §1.(6) RAG 大规模多模态(沿用 + 新增 GovScape 作为超大规模 RAG 架构参考)
四、值得警惕的矛盾或待核实说法
矛盾 1 · SGLang 3 件未修复 CVE vs SGLang 万亿 tokens/天 400,000 GPU 部署规模 = 维护者响应节奏严重失配
矛盾点:§IX 36th §1.(1) 已收 SGLang V2 + DFlash + Spec V2 + 16,215 tok/s + 400K GPU + 万亿 tokens/天;§1.(4) 已收 13 CVE 立标 = 外部攻击者对框架的主动漏洞利用 + HF 入侵 RCE 第 2 例 AI 自主 agent k8s 横扫;但 SGLang 3 件 CVE-2026-3059/3060/3989 协调披露 6 个月维护者未响应 + 400K GPU 万亿 tokens/天部署规模 = 大规模生产部署 vs 责任性风险严重失配 = 推理引擎-as-attack-surface 第 5 维(责任性风险)立标
待核实: 1. SGLang 维护者是否对 CERT/CC 2026-02-04 披露作出任何正式回应(中文社区维护响应薄弱?) 2. msgpack + localhost binding 临时缓解在 vLLM/SGLang/TGI/Modular MAX 五大推理引擎统一基准下的有效性 3. 是否扩展为 OWASP / CNCF / 推理引擎协同披露框架
建议归入:§3.2 争议(D 类)新增"推理引擎维护者响应节奏 vs 框架生产部署基数反比"立标候选;§7 R36 待验证清单新增 #46 SGLang 维护者响应状态 跟催
矛盾 2 · Beyond pass@1 "memory scaffold 普遍有害" vs §IX 36th §1.(6) Memory 综述 arXiv:2607.25380 + Mem0 stasis 38% + RecMem 复发触发显式判据 5 立标 = 反方 #87 验证 vs 主流立标
矛盾点:§IX 36th §1.(3) Memory 综述 + Mem0 stasis 38%(spark 8-2 立标)+ RecMem 复发触发显式判据(flyp 8-2 critical-read)+ Filesystem-Based Memory + Σ-Mem + Memory Decoder at Scale + Metis 沿用 — Beyond pass@1 23,392 episodes 实证 memory scaffold 普遍不提升甚至有害 = 对"无脑塞 episodic memory"的可靠性方案直接反证
待核实: 1. Beyond pass@1 10 模型是否包含 Metis / RecMem / Filesystem-Based / Σ-Mem 体系(原文未明示) 2. "memory scaffold 普遍有害" 结论强度:只测 1 种 scaffold(episodic store + retrieve),就推及 "naive episodic memory 作为可靠性干预" 的负面结论 3. 结构化总结 / reflection / scratchpad / curriculum memory 是否仍呈负面效应(论文自己承认但 finding 5 标题易误读) 4. VAF 双峰 frontier ≥2.37 是否包含闭源 frontier GPT-5.6 Sol / Opus 5 / Gemini 3.6 Flash / GLM 5.2(原文只测开源 10 模型)
建议归入:§3.1 反方新增 #87(memory scaffold 普遍不提升可靠性 / reliability-as-risk 新维度);§4.1 开放问题新增 5 项(k=8 复算 + 闭源 frontier + scaffold 消融 + OpenRouter 路由审计 + benchmark 仓库 URL 公开)
矛盾 3 · Memory Provenance Laundering vs RecMem arXiv:2605.16045 同病 = memory consolidation 期间被洗白 vs 复发触发显式判据 = memory 第五维 + 第四维 双向实证深化
矛盾点:flyp 8-2 RecMem B+ flyp critical-read(v2 覆盖 150 行 13.5 KB) R1 选台覆盖偏差 = 只对话类任务验证,多模态 / 视频 / 音频 场景下的适用性未单独验证 — Memory Provenance Laundering arXiv:2607.29167 同病,Provenance-Preserving 边界当前也只在对话类任务上验证
待核实: 1. Memory Provenance Laundering 与 RecMem R1 是否构成「多模态长期记忆安全 8-3 试验田待建」第 1 例 2. Provenance-Preserving 边界 vs RecMem 复发触发 分别在多模态 / 视频 / 音频场景下单独验证 3. "Laundering" 命名在 ML/Security 学术语境下用法是否统一(类似 SaLAD vs SALAD-Bench 命名警示)
建议归入:§3.2 争议候补(memory 主线 7/8/9 联立 + Provenance vs RecMem 双向实证深化);§4.1 开放问题(多模态 / 视频 / 音频验证 + Laundering 命名规范学术化)
矛盾 4 · Datadog "rate limit = 可靠性硬约束" vs §IX 36th §1.(5) Harness Engineering Phase 4 MirrorCode $251 已收 = 容量攻击面 vs 算法成熟度 双向对位
矛盾点:§IX 36th 已收 MirrorCode $251 14h / 25 目标 17/25 100% / 评测成熟度 + MSR Echoverse 9B 67.1% — Datadog 报告 2026-02 ~5% LLM span 报错率(60% rate limit)→ 2026-03 ~2% 报错率(~33% rate limit ≈ 840 万次)= 算法成熟度持续提升 vs 容量天花板触发 reliability 退化,可靠性工程不仅是算法问题,供应商层容量是另一维度
待核实: 1. Datadog 报告 2026-Q2 traces 续期与 rate limit 占比变化 2. 模型提供商 SLA 协议(Anthropic Opus 5 / OpenAI GPT-5.6 Sol / Google Gemini 3.6 Flash)对 rate limit 触发条件 / 缓冲机制 3. "capacity-as-attack-surface" 是否构成新立维(隐线 53 待实证)
建议归入:§3.2 争议候补("capacity-as-attack-surface"是否构成新立维?vs 模型提供商 SLA 协议?);§4.1 开放问题新增 3 项(2026-Q2 traces + 模型提供商 SLA + capacity-as-attack-surface 立标候选)
矛盾 5 · flyp + spark 8-3 早间 4 主题主力 e1prep 集体缺位 vs 8-2 evening 棒已出 6 主题 e1prep = 飞轮机制进入早间消化期
矛盾点:stephen 8-3 1245 noon 协调棒 §2.1 主旨结论:「5 大主题 8-3 主力 e1prep 已就位 4 份(ai-industry / rag / multimodal / engineering) —— 主力棒不缺 · flyp + spark 主力产能明显下滑 —— flyp 仅出 multimodal-e1prep(缺 coding-agents / risk),spark 仅出 3 件 RSS 速读(缺 agent / llm-infra)· 唯一 net-new 立标 = Memory Provenance Laundering arXiv:2607.29167」 vs 8-2 evening 棒已出 6 主题 e1prep(risk / coding-agents / multimodal / agent / llm-infra / engineering)= 8-3 早间飞轮机制进入消化期,本棒 spark 18:40 节奏反转第 14 棒 llm-infra-e1prep 恢复
待核实: 1. 8-3 evening 棒 spark 是否恢复 agent + llm-infra 双主题完整 E1 2. 8-3 周一早间静默是否与 8-2 evening 棒 + 8-1 evening 棒「周末后消化期」一致 3. paper_cards 库 24 件 8-2 evening 缺口仍未补 vs 8-3 evening 棒前 cron 卡建脚本是否触发
建议归入:§3.2 争议候补(8-3 早间飞轮消化期 vs 8-3 evening 棒集中补量 / 周末后消化期规律性?)
五、警示
警示 1 🟠 · EU AI Act 2026-08-02 deadline 当日已过(距今 40h)+ frontier lab × 监管 × 国际协作 三栖对位 第 1 例 = 推理引擎 0-trust 六件套立标饱和落地验证待跟进
来源:inbox/spark/2026-08-02-llm-infra-e1prep.md 警示 2 沿用 + inbox/flyp/2026-08-02-risk-e1prep.md 增量 1 + inbox/spark/2026-08-02-agent-e1prep-v38 §增量 8 + 8-3 全部沿用
8-3 当日状态:距 EU AI Act deadline 已过 40h · frontier lab × 监管 × 国际协作 三栖对位 立标饱和已完成(OpenAI 推动欧洲 + Anthropic 三起真实事件 + HF/Microsoft Open Secure AI Alliance + GLM 5.2 开源权重 + DeepSeek V4-Flash 第三锚);但 0-trust 六件套(auth proxy · 速率限制 · 视频处理禁用 · 模型仓库签名验证 · GGUF 加载签名验证 · 自主 agent 测试期 hardening · KV-cache 加密/隔离)在 vLLM / SGLang / Modular MAX / TGI 五大推理引擎落地实施比例未核实
建议归入:§7 R36 §7.2 #42 EU AI Act 三栖对位 #1 完成 4 项待核
警示 2 🟢 · Paper_cards 库 11h 净增 1 张(8-2 evening 22:45 → 8-3 早间 cron 卡建脚本仍未触发)
来源:stephen 8-3 1245 noon 协调棒 §3.4 + paper_cards 库 690 ~ 701 索引
8-3 当日状态:8-2 evening stephen 协调棒警示 15 件待补 + 后续 8-3 早晨 1 件待补 = 24 件 8-3 evening 棒前必须 cron 卡建脚本跑齐 vs 8-3 早晨 cron 卡建脚本仍未触发 + paper_cards 库 11h 净增 1 张(Memory Provenance Laundering 691) = 0.09 张/h 远低于 必补速率
8-3 evening 棒前待补(stephen 8-3 1245 noon 协调棒警示): - Frontis-MA1 / PhiZero / VideoCoCo / Memory Decoder at Scale / Beacon / Qwen-UI-Agent / AskChem / DistillAlign / Flux-OPD / ACE-Data-0 / MPIE-Bench / Metis / Beyond Borrowed Histories 13 件 - 8-3 NET:Memory Provenance Laundering(已建 1) + Beyond pass@1 + airllm + PROTEA + DialogGuard + ArcLight + GovScape + Datadog + SGLang CVE + Lossy Verification 2607.26627 + Σ-Mem 等
建议归入:§4.1 开放问题候补(paper_cards 库 24 件 8-2 evening 缺口仍未补建 · 8-3 早晨 cron 卡建未触发 · 8-3 evening 棒前 cron 卡建脚本必须跑齐)
六、可引用的 arXiv 号清单(8-3 net-new 12 件 · 沿用 §IX 36th 41 件不重复列)
| arXiv 号 | 论文 / 主题 | 增量归属 | 建议归位节 |
|---|---|---|---|
| 2607.29167 | Memory Provenance Laundering · LLM Agent 长期记忆 consolidation 期间 源权限不放大第五维(paper_cards/691 · 8-3 04:00 新建 · method / agent / cs.CR / v1 / 2026-07-31) | 增量 4 P3 候补级 | §1.(4) memory-as-attack-surface 第 39 面 · §3.2 争议新增 3 条 · §4.1 O184 |
| 2603.29231 | Beyond pass@1 · Reliability Science Framework for Long-Horizon LLM Agents · 4 指标 RDC/VAF/GDS/MOP + memory scaffold 普遍不提升可靠性(flyp 8-3 1550 critical-read · flyp 评级 3.5/5) | 增量 3 P3 邻接 | §1.(6) Agent 自改进 · §1.(12) Pipeline (vii) Eval 第 4 维度 · §3.1 反方 #87 · §4.1 O183 |
| 2603.20397 | KV Cache 优化策略系统性综述 · 五大优化方向 + InfiniPot 持续蒸馏(jay 8-3 kv-cache-optimization-survey 专项草稿) | 增量 9 P3 邻接 | §1.(3) KV cache 14+1 件套 · §1.(12) Pipeline (i) KV Pool 综述索引 |
| 2602.14878 | MCP Tool Descriptions Are Smelly · 工具描述 Token 效率优化(ACM 期刊 2026-02 · Queen's University) | 增量 8 P3 邻接 | §1.(5) Harness Engineering Phase 4 · §1.(12) Pipeline (v) Harness Reliability 协议层效率 |
| 2606.06535 | Architecturally Significant MLOps Guidelines · Continuous vs Static Batching(CAIN 2026 AI Engineering · 2026-06-03) | 增量 7 P3 邻接 | §1.(11) Kernel/AI 自动化 · §1.(7) 推理经济学 MLOps 学术锚点 |
| 2607.26627 | Revisiting Lossy Verification in Speculative Decoding · 有损验证四类失败机制(jay 8-3 engineering-e1prep §增量 1 · paper_cards/681) | 横向沿用 8-2 evening | §1.(1) 推理引擎投机解码 · §2.19 投机解码失败边界 |
| 2607.27958 | Σ-Mem · Multi-Agent Online Reliability Memory(tom 8-3 agents-lite + radar 0840 · paper_cards/683) | 横向沿用 8-2 evening | §1.(6) Agent Memory 可靠性增强 |
说明:8-3 主线 net-new arXiv 4 个(2607.29167 / 2603.29231 / 2603.20397 / 2602.14878)+ 邻接/沿用 3 个(2607.26627 / 2606.06535 / 2607.27958) + 工程层 net-new 工具 5 项(airllm / AIMultiple / PROTEA / ArcLight / DialogGuard / GovScape / Datadog 报告 / SGLang 3 件 CVE) = 12 件 8-3 净增量(对比 8-2 evening = 主线 5 件 + 旁证 3 件 + 工程层 11 件 = 19 件 = 8-3 净增量密度 8-2 的 63% · 飞轮机制早间消化期证据)
七、检查过的来源清单(本棒覆盖度盘点)
inbox 5 实例 8-2 evening ~ 8-3 evening(共 60+ 文件 · 本棒实际读取 14 个核心文件)
| 实例 | 关键文件 | 评价 |
|---|---|---|
| jay | 2026-08-03T1105-jay-daily-briefing.md | ✅ SGLang CVE 警示 + 推理引擎矩阵 +5 |
| jay | 2026-08-03-engineering-e1prep.md | ✅ 4 增量(含 3 新 arXiv · Lossy Verification +1 + Token-Oriented +1 + Σ-Mem +1) |
| jay | 2026-08-03-llm-inference-research-briefing.md | ✅ 完整 inference 邻接(包括 Netflix Triton + MathOpt 调度 + KV Cache 综述 + Workload-Router-Pool + ArcLight + Jailbreak 数据库等) |
| jay | 2026-08-03-llm-inference-ai-engineering.md | ✅ vLLM/SGLang/LMDeploy 三足 + Colibri + pgvector + MCP + Transformers 5.14 + HF 安全事件 |
| jay | 2026-08-03T1450-jay-engineering-filter-round4.md | ✅ AI Engineer Stack 6 层 + On-Premises RAG arXiv:2604.01395 + MLOps CAIN 2026 + MCP smelly + Speculative 变体(AdaSpec/NexusQuant 6.1x/SSD) |
| jay | 2026-08-03-acl-2026-system-demos.md | ✅ PROTEA #3 + ArcLight #18 + Rankify #21 + DialogGuard #19 + GovScape #23 + Interpreto #1 + Copyright Detective #2 |
| jay | 2026-08-03-datadog-ai-engineering-report.md | ✅ 3 Facts + 双刃剑 + cached-read |
| jay | 2026-08-03-kv-cache-optimization-survey.md | ✅ 五大优化方向 + InfiniPot 持续蒸馏 |
| jay | 2026-08-03T1735-jay-evening-briefing-agents-vecdb-inference-aug2026.md | ✅ airllm + ds4 antirez + TencentDB-Agent-Memory + AIMultiple 29% 差距 + AI Engineer 6 层 + OWASP MCP Top 10 beta + Agent Memory 四变体 |
| jay | 2026-08-03-1140-news-x-tech-radar / RSS 10+ | 沿用 |
| tom | 2026-08-03_agents-lite.md | ✅ 4 高价值(Σ-Mem + Memory Provenance Laundering + Filesystem + AI Agents Stack 2026) |
| tom | 2026-08-03T0840/1440-agent-rag-longcontext-radar.md | ✅ 8 候选(8-3 = 沿用件 / 8-3 NEW = Memory Provenance Laundering 1 件) |
| tom | 2026-08-03-rag-e1prep.md | ✅ 实质增量 = 0 条(RAG 主题 ArXiv 供给低谷期) |
| tom | 2026-08-03-0900-hf-daily-2026-08-03.md | ✅ 票榜 15 件全核续立 |
| tom | 2026-08-03-evaluation-e1prep.md | ✅ 主线沿用 |
| flyp | 2026-08-03-risk-e1prep.md | ✅ R35 立标固化后第 3 个 E1 · net-new 5 件 + 强提醒 1 件 + 元方法学 1 件 · 含 Memory Provenance Laundering P3 候补级立标 + Beyond pass@1 reliability 反方 + SaLAD + SGLang 3 件 CVE P0 警示 + Datadog rate limit P3 邻接 |
| flyp | 2026-08-03-0950-SaLAD-multimodal-safety-daily-critical-read.md | ✅ ACL 2026 Findings 多模态日常安全 18 MLLM SOTA 57.2% |
| flyp | 2026-08-03-1550-Beyond-pass1-Reliability-Science-Long-Horizon-LLM-Agents-critical-read.md | ✅ 23,392 episodes 4 指标 + memory scaffold 普遍有害 |
| flyp | 2026-08-03-multimodal-e1prep.md | ✅ 5 新立候选(含 Memory Provenance Laundering §2.39.112) |
| flyp | 2026-08-03 1000~1006 RSS 4 件 | 沿用 |
| stephen | 2026-08-03-1245-stephen-coordination-check-noon.md | ✅ 本棒核心协调棒 = 「5 主题已就位 4 份 + flyp + spark 早间 4 主题主力 e1prep 集体缺位 + 唯一 net-new 立标 = Memory Provenance Laundering」 |
| stephen | 2026-08-03-ai-industry-e1prep.md | ✅ 38.4 KB 7 增量(Memory Provenance Laundering §增量 1) |
| stephen | 2026-08-03 0910~1006 news 11 件 + 3 YT + RDF | 沿用 |
| spark | 2026-08-03-1001/1003/1006 RSS 3 件 | ✅ 静默(周期性轮换模式延续)· spark 8-3 早间未出 llm-infra / agent E1 = 飞轮机制早间消化期 |
paper_cards 库 690~701(8-3 早晨净增 1 张 + 沿用 8-2 evening batch)
- 690 / 692 / 693 / 694 / 695 / 696 / 697 / 698 / 699 / 700 = 8-3 morning batch (Brain-Computer + Agentic Engineer + 时间序列 + HyPE + 视觉 + ExtractBench + Image Edit + QQWorld + Meshy T2 + Rubric RL)· 均非 llm-infra 主分类(主分类 agent / rag / engineering / multimodal / llm-infra 混杂且主轴不是 llm-infra 基础架构)
- 691 = Memory Provenance Laundering 8-3 04:00 新建 · method / agent / cs.CR / v1 / 2026-07-31 = 本棒核心增量 4
- 681 = Lossy Verification Speculative Decoding 8-2 evening 沿用(进入 engineering-e1prep)
- 683 = Σ-Mem Online Reliability Memory 8-2 evening 沿用
- 689 = 前最后批次 · 沿用
work-queue.md 2026-08-03 18:00(本棒确认)
- §1 高价值待深度解读 8 件(2607.18082 Rubric RL / 2607.28675 Meshy T2 / 2607.28415 QQWorld / 2607.29025 Eval-Verify Reward / 2607.29677 ExtractBench / 2607.29679 Text-Conditioning Visual / 2607.29402 HyPE / 2607.29459 TFGformer) 均非 llm-infra 主轴(主分类 rl/agent/multimodal/evaluation/rag 且非推理引擎基础设施)
- §2 待更新主题活文档 0 件(全部最新,意味着 llm-infra.md §IX·36th 立标饱和已完成,无新增活文档需求)
- §3 选题榜未成视频脚本 1 件(2606.06090)
- §5 富化缺口 14 张卡缺 TLDR
- §6 待精确分类 1 张卡
八、本棒定性 + 今晚接力建议
定性
- 本棒增量密度:63% 8-2 evening 棒(主线 4 件 + 工程层 net-new 5 件 + 邻接 3 件 = 12 件 · vs 8-2 evening 棒 = 主线 5 件 + 旁证 3 件 + 警示 2 件 + 邻接工程层 = 19 件)
- 本棒增量结构:P3 邻接 + P3 候补级 + P0 警示 沿用 主导 = §IX·36th 主流立标饱和后的"深度工程层 / 责任性风险 / reliability 反方 / protocol 层实现层效率" 阶段
- 本棒跨实例信号一致性:Memory Provenance Laundering 在 tom / stephen / flyp / multimodal e1prep 四份 e1prep 中交叉确认 = 8-3 唯一 net-new 立标 · Datadog 在 jay daily-briefing / engineering e1prep / llm-inference research briefing / kv-cache / risk e1prep 五份交叉 = 隐线 53 容量攻击面 候选 · SGLang 3 件 CVE 在 jay daily-briefing / flyp risk 两份交叉 = P0 警示 沿用 + 第 14/15/16 件 inference-engine CVE + 维护者未响应协调披露 6 个月责任性风险
- 飞轮机制状态:早间消化期(spark + flyp 双缺位 + 5 主题主力 e1prep 已就位 4 份 + 唯一 net-new 立标 1 件 + paper_cards 库 24 件 8-2 evening 缺口未补 仍在延续)
今晚接力建议(§IX·36th → §IX·37th)
- §1.(4) 服务层并发安全 + 13 CVE → 16 CVE = 新增 CVE-2026-3059/3060/3989 SGLang CWE-502 反序列化 3 件(P0 警示 · 维护者未响应协调披露 6 个月)
- §1.(4) memory-as-attack-surface 第 35~38 → 39 面 = 新增 Memory Provenance Laundering arXiv:2607.29167 第 5 维源权限不放大(P3 候补级)
- §1.(6) Agent 自改进 + Mem0 stasis 38% = 新增 Beyond pass@1 arXiv:2603.29231 memory scaffold 普遍有害 reliability 反方 + VAF 双峰 capability vs reliability 排名反转(P3 邻接)
- §1.(12) Pipeline (vii) 推理经济学评估 5 维 → 6 维 = 新增 Datadog State of AI Engineering 报告 = 第 6 维度「供应商层容量天花板触发 reliability 隐线 53」(P3 邻接)
- §1.(1) 推理引擎 6 寡头 + airllm 边缘扩展 = 新增 airllm 4GB 单卡 70B 压缩推理新范式 · AIMultiple H100 29% 架构差距(待核验 README)
- §1.(5) Harness Engineering Phase 4 + MCP 2.0 协议层效率 = 新增 arXiv:2602.14878 MCP Tool Descriptions Smelly(P3 邻接)
- §1.(11) Kernel/AI 自动化 + MLOps 学术锚点 = 新增 arXiv:2606.06535 CAIN 2026 continuous batching 决策点(P3 邻接)
- §1.(3) KV cache 14+1 + 综述层第三源 = 新增 arXiv:2603.20397v1 五大优化方向 + InfiniPot 持续蒸馏(P3 邻接)
- §1.(5) Harness Engineering + 多 Agent 调试 = 新增 PROTEA ACL 2026 Demo #3 Backward Node Evaluation + 自动 prompt patch diff(P3 邻接)
- §1.(4) 服务层 + ACL 2026 System Demos 4 件补充 = 新增 ArcLight CPU / DialogGuard 心理安全 / GovScape 7000 万 PDF / Rankify RAG 工具包(工程层邻接)
- 3 条 O 试金石候选:O182 Datadog 2026-Q2 traces + 模型提供商 SLA + capacity-as-attack-surface 立标 · O183 k=8 复算 + 闭源 frontier + scaffold 消融 + OpenRouter 路由审计 + benchmark 仓库 URL = 5 项 · O184 Provenance-Preserving 边界多模态验证
- §3.1 反方新增 #87 memory scaffold 普遍不提升可靠性 / reliability-as-risk 新维度
- §3.2 争议新增 4 条:① 推理引擎维护者响应节奏 vs 框架生产部署基数反比(SGLang 6 个月 vs vLLM 及时)② 8-3 早间飞轮消化期 vs 周末后消化期规律性 ③ capacity-as-attack-surface 是否新立维 ④ Laundering 命名规范学术化
整体评价:spark E1 节奏回归第 15 棒 llm-infra(自 v15 起) · 承接 v14(8-2 18:48)→ 本棒 v15(8-3 18:40)= 24h 净增量 · 本棒为 §IX·36th 立标饱和后的"深度工程层 / P3 邻接 + P3 候补级 + P0 警示 沿用" 阶段,不再做主流扩张 · 期待 8-4 morning jay / flyp / tom 接力棒恢复
九、汇总统计
- 检查来源:5 实例 inbox 共 ~60+ 文件(本棒实际读取 14 核心)+ paper_cards 11 张新建/沿用 + work-queue.md + 活文档 §IX·36th 基线 61228 bytes
- 增量条数:4 P3 候选 + 5 工程层 net-new + 3 工程层邻接 = 12 件净增量(对比 8-2 evening = 19 件 = 63% 密度)
- 新 arXiv 号 8-3 net-new 4 条:2607.29167 / 2603.29231 / 2603.20397 / 2602.14878
- 本棒特色:§IX·36th 立标饱和后的"深度工程层 / 责任性风险 / reliability 反方 / protocol 层实现层效率 / 隐线 53 容量攻击面" 阶段 · 4 P3 候选以"应用层执行 + 反序列化层 + reliability 反方 + 长期记忆 consolidation 期间源权限不放大" 为主题 · 5 工程层 net-new 提供"推理引擎 → 边沿 → MLOps → KV cache 综述 → Harness 调试" 5 个工程深度切片 · 2 警示(EU AI Act 当日已过 40h + paper_cards 库 24 件仍未补)
spark · llm-infra E1 预消化第 15 棒 · 2026-08-03 18:40 CST · 检查来源 14 个 inbox + 11 paper_cards + work-queue.md + §IX·36th 61228 bytes 基线 · 12 件净增量 · 4 条新 arXiv 号 · 0 个 GitHub 写入(仅写本文件)
注:本场相对 spark 8-2 18:48 v14 是 24h 接力窗口的"消化期补充",而非 §IX 主流扩张;spark 8-3 早间未出 llm-infra / agent E1 周一飞轮缺位已由 v15(本棒)恢复。