risk · E1 预消化简报(2026-08-04)

本场性质:R36 沿用后第 1 个 E1 · 8-3 16:30 ~ 8-4 16:30 共 24h 窗口 · 5 实例 6 大类协同 + 风险主线 net-new 增量 = 「低-中密度 · 1 项 8-4 早晨主分类 risk net-new 立标候选 Constitutional Midtraining arXiv:2607.26654 P2 候补级 + 1 项 jay 8-4 tech-newsletter MLLM Adversarial Survey arXiv:2603.27918 P3 邻接 沿用」 + R36 五大 net-new 全部沿用(Memory Provenance Laundering 候补级 + SaLAD multimodal safety 反方 #84-#86 + Beyond pass@1 reliability engineering 反方 #87 + SGLang 3 CVE P0 警示 沿用 + Datadog 容量攻击面 隐线 53)+ R36 §3.2 反方 #84-#87 沿用 + R36 §2.14 RAG/Agent 安全 第 39 面 memory-consolidation-source-authority 沿用 + R36 §4.1 开放问题 #81 沿用 + R36 防御表 86 行 沿用 + R36 候选池 17 件 沿用 + R36 演化拐点 4.0 → 4.5 沿用 + 矛盾 #56 HF 入侵 Modal Labs 二次入侵深化 沿用 + 矛盾 #57 SGLang 3 CVE 维护者响应节奏 第 6 栖 沿用 —— 本场识别 8-3 evening 棒后 24h 窗口风险主线 net-new 增量 = 3 条(1 条 🟡 P2 候补级 Constitutional Midtraining arXiv:2607.26654 = 120B 规模持久对齐中训练 第 5 维 反方 + R36 矛盾 #56/#57 候选深化 反方 候补级 + 1 条 🟢 P3 邻接 MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述 = multimodal safety 综述基线 沿用 R36 §2.39 multimodal safety 反方 #84-#86 邻接 + 1 条 🟡 P2 矛盾候补 (R36 沿用 C 类)SGLang 3 CVE 维护者未响应协调披露 6 个月 跟催状态 = 责任性风险立标独立入位 矛盾 #57 实证深化 候补级)+ 1 条强提醒(stephen 8-4 1245 noon 协调棒:flyp risk-e1prep 8-4 早间缺位 = 反思棒物理动作失效 R36 沿用 lessons-W31 §3.5 整改项 + 晚间棒补位 = R36 沿用)+ 1 条矛盾/待核实(Constitutional Midtraining 120B 规模 + Anthropic Constitution 复用 vs 论文为独立作者群 — 需核实 Anthropic 直接作者参与度 vs 仅引用 Constitution 文本)= R36 沿用 边界固化 + 「Persistence Alignment 持久对齐 第 5 维 反方」 P2 候补级新增 vs 8-3 24h「memory consolidation 第五维 源权限不放大 + multimodal safety 反方 + reliability engineering 反方」三栖扩面 方向深化同向


一、24h 窗口来源完整性检查(8-3 16:30 ~ 8-4 16:30)

实例 检查文件 关键 risk 增量 评级
jay 2026-08-04-tech-newsletter.md Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey arXiv:2603.27918 TMLR 2026 37 页综述 = MLLM 对抗攻击全景(视觉对抗样本 + 跨模态迁移攻击 + RLHF 对齐绕过)= R36 §2.39 Multimodal safety 反方 #84-#86 综述基线 沿用 🟢 P3 邻接
jay 2026-08-04-1002-rss-lilian-weng.md Reward Hacking 旧文 沿用(无新) 沿用
jay 2026-08-04-engineering-e1prep.md 5 条增量 ... 主分类 agent/llm-infra 0 件 risk 主分类 · risk 邻接 1 件(SGLang CVE 沿用) 沿用
jay 2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md Agent Guardrails 演变 2024 → 2026 = "授权工具调用 + 强制速率限制 + 验证 Agent 实际行为" 三层模型 + Rail B 治理与安全(OWASP MCP Top 10 + 权限/审计/人机协同)= R36 §2.13 协议层 + 应用层 16 维 续立 沿用
jay 2026-08-04T1335-jay-ai-engineering-trending-aug.md "Memory in the LLM Era" arXiv:2604.01707 2026-05 多机构 LLM 记忆系统分类法(4 维度) = R36 §2.14 memory 主线 9 联立补全 沿用 + 预过滤错误配置导致跨租户数据泄露 = R36 §2.14 RAG/Agent 安全 第 38 维度 沿用 沿用
jay 2026-08-04T1850-jay-engineering-filter-p2.md CSDN RAG 防坑提示 + Ollama vs vLLM 并发实测 + Ollama #9054 跨租户 2026-04 仍未修复 = R36 §2.13 协议层 + 应用层 16 维 续立 沿用
tom 2026-08-04-evaluation-e1prep.md 8-3 risk-e1prep 55KB 沿用 + 8-3 16 张 paper_cards 引用(risk 主分类 1 件 = 711 Constitutional Midtraining) 沿用
tom 2026-08-04T0840-agent-rag-longcontext-radar.md 8 候选 4 高价值 = 0 件 net-new risk;Constitutional Midtraining 2607.26654 标注「120B 规模对齐实验」 = 立标信号承接 沿用
tom 2026-08-04_rag-lite.md Midtraining 价值观内容引入(120B 规模)与 Constitutional Midtraining 同源 沿用 沿用
flyp 2026-08-04-0950-Mental-World-Modeling-critical-read.md MWM arXiv:2607.27201 主分类 agent · 与 risk 邻接(L2 接口层 + L3 长期记忆) 沿用
flyp 2026-08-04-1550-TEngineDB-V-and-DEFRAG-systems-critical-read.md 数据库系统 critical-read · risk 邻接「去中心化协同的攻击面」 沿用 沿用
flyp 2026-08-04-multimodal-e1prep.md 6 件 multimodal 系新立候选 0 件 risk 主分类(MWM 主 agent + 3D-Aware RGB-NIR / RL²-VLA / Counterfactual Sensitivity 主 multimodal + Scaling Properties / Evaluation-Verification Reward 主 multimodal/evaluation) 沿用
spark 2026-08-04-agent-e1prep.md 8-4 早晨 net-new 5 张 paper_cards 707-711 · 711 Constitutional Midtraining 主分类 risk · v39 §2.6 邻接补全 🟡 P2 候补级
stephen 2026-08-04-1005-news-hf-blog.md 5 件 HF Blog 沿用 + GPU 管理 / 跨租户 沿用 沿用
stephen 2026-08-04-ai-industry-e1prep.md 6 件 net-new 增量 + HF Daily 8-4 票榜 4 件轮换 + 1 件 paper_cards 库新增速率反弹 15.8× 沿用
stephen 2026-08-04-1245-stephen-coordination-check-noon.md 「risk-e1prep 连续 2 天缺位」+ 「5 主题主力 e1prep 早间仅 60% 满」+ 晚间棒 P0 优先级 = flyp risk-e1prep 8-4 晚间棒补位 候选 Beyond pass@1 reliability + SaLAD follow-up + SGLang CVE + Datadog 容量攻击面 强提醒
paper_cards 711-2607-26654 Constitutional Midtraining 8-4 早晨 net-new 主分类 risk = 1 件 net-new 1 件新建
paper_cards 690-2607-29007 dialogic 8-3 14:10 主分类 agent · risk 邻接 沿用
paper_cards 691-2607-29167 Memory Provenance Laundering 已建 8-3 12:30 批次 · R36 立标 沿用 沿用
paper_cards 692-2607-29610 Educating the Agentic Engineer 邻接
paper_cards 693-2607-29459 TFGformer(RAG) 邻接
paper_cards 694-2607-29402 HyPE RAG 邻接
paper_cards 695-2607-29679 Text Conditioning 视觉生成 邻接
paper_cards 696-2607-29677 ExtractBench 邻接
paper_cards 697-2607-29025 Evaluation-Verification Reward 邻接
paper_cards 698-2607-28415 QQWorld 邻接
paper_cards 699-2607-28675 Meshy T2 邻接
paper_cards 700-2607-18082 Rubric-based RL Self-Distillation 邻接
paper_cards 701-2607-29209 SAF-OPD 邻接
paper_cards 702-2607-29684 3D-Aware RGB-NIR Imaging 邻接
paper_cards 703-2607-26991 RL²-VLA 邻接
paper_cards 704-2607-27888 Counterfactual Sensitivity 邻接
paper_cards 705-2607-26611 Fewer Clarifications 邻接
paper_cards 706-2607-27201 MWM 邻接
paper_cards 707-2608-00922 RAG 8-4 早晨 沿用
paper_cards 708-2608-00650 RAG 8-4 早晨 沿用
paper_cards 709-2607-28229 EMBL AI Librarian 沿用
paper_cards 710-2607-27851 Beyond Feeling Better 沿用
work-queue 2026-08-04 16:00 8-4 §1 Top 15 高价值 6 件 net-new(SAF-OPD / MWM / Fewer Clarifications / Counterfactual Sensitivity / RL²-VLA / 3D-Aware RGB-NIR)· 0 件 risk 主分类 = 风险飞轮继续衰减 飞轮衰减

总结:8-3 16:30 ~ 8-4 16:30 24h 窗口检查 5 实例(jay/tom/flyp/spark/stephen)+ paper_cards 23 张新建(689-711)+ 跨主题双向更新 = 3 条 net-new 增量 + 1 条强提醒 + 1 条矛盾/待核实 = 5 件 = 中-低密度(对比 8-2 24h 窗 5 项 net-new + 1 强提醒 + 1 元方法学 = 7 件;对比 8-3 24h 窗 5 项 net-new + 1 强提醒 + 1 元方法学 = 7 件;8-4 主分类 risk 新建卡片从 1(8-3 evening 691 Memory Provenance Laundering)降为 1 但换位到 711 Constitutional Midtraining = 持续 1 件/24h 风险立标候选节奏)= 飞轮机制从「单一立标 + 反方密集」 形态 → 「对立标 + 反方 + 综述基线三栖」 形态。


二、本期最重要的 3 条 net-new 增量

增量 1 · 🟡 Constitutional Midtraining arXiv:2607.26654 P2 候补级 = 120B 规模持久对齐中训练 第 5 维 反方 + R36 矛盾 #56/#57 候选深化 反方 候补级

来源: - paper_cards/711-2607-26654.md(8-4 早晨 net-new · method / agent / 主分类 risk · 副分类 engineering) - inbox/spark/2026-08-04-agent-e1prep.md §核心定性 5 件 net-new 主立标候选沿用 + line 415 主分类 risk 8-4 早晨 net-new 立表 + line 571 「Constitutional Midtraining 内容存在驱动对齐收益(主 risk · 8-4 早晨 net-new · 120B 规模对齐)」 - inbox/tom/2026-08-04T0840-agent-rag-longcontext-radar.md 候选 5「Constitutional Midtraining: Content Presence Drives Alignment Gains / HF/arXiv 2607.26654 / benchmark / 120B 规模对齐实验,对理解 RLHF/midtraining 有参考价值」 - inbox/tom/2026-08-04_rag-lite.md §摘要「midtraining 阶段引入价值观内容,与 replay-only 对照,在 120B 规模下验证了 Alignment 在微调压力下的持久性」 - (间接)inbox/flyp/2026-08-04-0950-Mental-World-Modeling-critical-read.md §3 v40 沿革未含 Constitutional Midtraining 衔接

要点: - 核心问题:Post-training alignment is often shallow, eroding under fine-tuning = 训练后对齐往往是浅薄的,会在微调中被侵蚀 —— 这是 R36 §3.1 反方 #54 (arXiv:2606.14589 Silent Failures) 的对立实证(那边说 Class D ex post 阻止 87%,这边说浅层 alignment 会被侵蚀)= 方向相反但都指向"alignment 持久性"为当代 AI Safety 核心问题 - 核心方案:Constitutional Midtraining = 在中训练(midtraining)阶段插入基于原则与价值观的内容,与"仅做回放的对照组"对比 - 实验规模:120B(120 亿) 模型规模 + 394M token 宪法语料 + 2×2 析因设计(课程顺序 × 审慎推理)= 4 种宪法式中训练条件 + 1 回放对照,在自生成 + 既有基准上评估 - 关键发现:内容存在(content presence)驱动对齐收益 = 中训练阶段引入价值观内容(而非仅靠 post-training RLHF / DPO)能产生持久对齐 - 语料源:Anthropic's Constitution(Anthropic 公开发布的 Constitutional AI 价值观文本)— 但作者群是否包含 Anthropic 内部研究员、是否经 Anthropic 资助,paper_card 未披露 - arXiv:2607.26654 / 形态 method / 主分类 risk / 副分类 engineering

与活文档现有脉络的关系: - R36 §3.1 反方 #54 候选 arXiv:2606.14589 Silent Failures 5 类失败 + Class D ex post 阻止 87% —— Constitutional Midtraining 提供对立实证:浅层 alignment 会被侵蚀,midtraining 干预可持久化 = 反方 #54 候选深化 = "alignment 持久性"新维度 - R36 §2.1 R35 沿用 Anthropic Constitution 实证(R34 Mythos + Project Glasswing + Constitutional AI 沿用) —— Constitutional Midtraining 复用 Anthropic Constitution 文本 = "Constitutional AI 路径"实证深化 第 1 例 + 中训练阶段双向实证 - R36 §3.2 反方 #84-#86 SaLAD 反方 三栖 + R36 §3.2 反方 #87 Beyond pass@1 reliability 反方 —— Constitutional Midtraining 提供 L1 模型层 对齐持久性 反方 = 反方 #88 候选新增 = "alignment erosion / fragility"新维度 - R36 §2.13 MCP 安全 & 工具调用 16 维 —— Constitutional Midtraining 与协议层 + 应用层 双向无直接关联(主分类 risk 但目标层 L1 模型层) - R36 §2.15 工具调用与 Agent harness 风险 二十三窗口 —— Constitutional Midtraining 属 L1 模型层 立标 = 二十三窗口中"L1 模型层 对齐持久性"新维度 - R36 §3.2 反方 #58 候选深化「memory-consolidation-source-authority 第 5 维 源权限不放大」 —— Constitutional Midtraining 与之同向:都是"持久性 / 不可逆性" 安全约束 = 跨反方深化

建议归入: - R37 §3.1 反方 #54 候选深化(Silent Failures 对立实证:alignment 持久性新维度,midtraining 干预有效) - R37 §3.2 反方 #88 候补新增(alignment erosion / fragility · Constitutional Midtraining 1 例 + 反方 #54 双向对位) - R37 §2.1 沿用 §6(Constitutional Midtraining 120B 规模持久对齐中训练 第 5 维 = R36 补增 Anthropic Constitution 实证化 第 1 例) - R37 §2.15 工具调用与 Agent harness 风险 L1 模型层 新维度 = 二十三窗口 → 二十四窗口 - R37 §6 R36 NEW 5 项关键数据 → R37 +1 项(Constitutional Midtraining 120B 规模 + 394M token 宪法语料 + 2×2 析因 + Anthropic Constitution 复用) - R37 arXiv 沿用清单 新增 arXiv:2607.26654

评级:🟡 P2 候补级中-高档(120B 规模 + 2×2 析因 + 4 条件 + 1 对照 + 主分类 risk + tom radar 候选 5 + spark 8-4 agent-e1prep 立标候选 = 不可升立标级 + 不可反方深化 但可候补级 —— 距离立标级需 ① 顶会接收 NeurIPS 2026 / ICLR 2026 主会信号 ② Anthropic 参与度核实 ③ 跨规模复现 > 70B 独立观察)


增量 2 · 🟢 MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 37 页综述 = multimodal safety 综述基线 沿用 R36 §2.39 multimodal safety 反方 #84-#86 邻接

来源: - inbox/jay/2026-08-04-tech-newsletter.md §4 「Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey arXiv:2603.27918 → TMLR 2026(37 页综述) · 全面梳理 MLLM 对抗攻击技术,包括视觉对抗样本、跨模态迁移攻击、RLHF 对齐绕过的最新研究 · 可信度 ⭐⭐⭐⭐⭐ TMLR 2026,综述质量高 ★ 审稿 — 安全研究基础材料」 - inbox/jay/2026-08-04-tech-newsletter.md 标签行 MLLM Adversarial Survey | ⭐ **审稿** — 安全研究基础材料

要点: - 论文形态:综述型(TMLR 2026 接收 · 37 页) - 核心覆盖面:① 视觉对抗样本(visual adversarial examples)② 跨模态迁移攻击(cross-modal transfer attacks)③ RLHF 对齐绕过(RLHF alignment bypass) = 与 R36 §3.1 反方 #84 alignment 在日常多模态失效(沿用 SaLAD)、#85 safety warning vs 粗暴拒答(沿用 SaLAD)、#86 多模态生成安全未对标(沿用 SaLAD)形成 综述基线 + 实证反方 双向对位 - TMLR 2026 接收:作为综述类顶会接收,立标信号强,可作为 R36 §2.39 multimodal safety 综述基线 - 与 SaLAD 关系:SaLAD(arXiv:2601.04043 v2 ACL 2026 Findings)是新基准评测,MLLM Adversarial Survey 是综述基线 —— 二者构成"实证 + 综述"双向对位

与活文档现有脉络的关系: - R36 §2.39 multimodal safety 沿用 SaLAD + Beyond pass@1 沿用 + R35 Cross-Agent A2FV 沿用 —— MLLM Adversarial Survey 作为综述基线 = R36 §2.39 索引补全 - R36 §3.1 反方 #84 alignment 在日常多模态失效(沿用 SaLAD)+ 反方 #85 safety warning vs 粗暴拒答(沿用 SaLAD)+ 反方 #86 多模态生成安全未对标(沿用 SaLAD)—— MLLM Adversarial Survey 提供"RLHF 对齐绕过" = 反方 #84 候选深化 第 1 例 - R36 §2.13 MCP 安全 & 工具调用 16 维 沿用 —— MLLM Adversarial Survey 与 L2 接口层 邻接(视觉对抗样本属 prompt/输入层视觉对抗)

建议归入: - R37 §2.39 multimodal safety 综述基线 索引补全(MLLM Adversarial Survey arXiv:2603.27918 as 综述基线 与 SaLAD arXiv:2601.04043 实证基线 双向对位) - R37 §3.1 反方 #84 候选深化 第 1 例(MLLM Adversarial Survey · RLHF 对齐绕过 与 SaLAD alignment 在日常多模态失效 实证+综述 双向对位) - R37 arXiv 沿用清单 新增 arXiv:2603.27918

评级:🟢 P3 邻接(TMLR 2026 综述 = 立标信号强,但只是综述基线,不是新立标 —— 不可升立标级 + 不可候补级 + 不可反方深化 但可 P3 邻接)


增量 3 · 🟡 R36 沿用 C 类 矛盾候补深化(SGLang 3 CVE 维护者未响应协调披露 6 个月 跟催状态)+ OWASP MCP Top 10(beta) + Agent Guardrails 演变 2024 → 2026 多源印证

来源: - inbox/jay/2026-08-04T1620-jay-csdn-substack-ai-engineering-deep-dive.md 「Agent Guardrails 演变 2024 → 2026: 2024 输入/输出过滤器(input/output filters) · 2026 授权工具调用 + 强制速率限制 + 验证 Agent 实际行为 三层模型 + Rail B 治理与安全(OWASP MCP Top 10、权限/审计/人机协同)」 - inbox/jay/2026-08-04-1002-rss-lilian-weng.md 「Reward Hacking 旧文 沿用(无新)」 - inbox/jay/2026-08-04T1335-jay-ai-engineering-trending-aug.md 「Memory in the LLM Era arXiv:2604.01707 2026-05 · LLM 时代 Agent 记忆的系统分类法(4 维度: 存储结构 + 信息提取机制 + 记忆管理策略 + 检索方法)· 预过滤错误配置会导致跨租户数据泄露(合规风险)」 - inbox/jay/2026-08-04T1850-jay-engineering-filter-p2.md CSDN RAG 防坑提示 + Ollama #9054 跨租户 2026-04 仍未修复 - R36 §2.1 SGLang 3 CVE CVE-2026-3059/3060/3989 CVSS 9.8 P0 警示 沿用 (6 个月未响应协调披露 2026-08 仍未官方补丁) - R36 §2.13 MCP 安全 & 工具调用 16 维 沿用 - R36 §2.14 RAG/Agent 安全 第 38 维度 应用层 authorization governance 沿用(jay 8-4 多源印证) - inbox/stephen/2026-08-04-1245-stephen-coordination-check-noon.md §「晚间棒 P0 优先级 = flyp risk-e1prep 8-4 晚间棒补位 候选 Beyond pass@1 reliability + SaLAD follow-up + SGLang CVE + Datadog 容量攻击面」

要点: - 多源印证 R36 §2.13 / §2.14 沿用: - ① jay 8-4 csdn-substack 提"Agent Guardrails 演变 2024 → 2026" = "授权工具调用 + 强制速率限制 + 验证 Agent 实际行为" 三层模型 → R36 §2.13 协议层 + 应用层 hardening 16 维 沿用拓展(L2 接口层 authorization governance + L3 系统层 runtime guardrails) - ② jay 8-4 lilian-weng RSS 提"Reward Hacking" + Owasp MCP Top 10(beta) = R36 §3.2 反方 #57 候选深化(OWASP MCP Top 10 = ASI04 子集还是新维度) - ③ jay 8-4 trending-arXiv Memory in the LLM Era(arXiv:2604.01707)LLM 记忆 4 维度分类法 + 预过滤错误配置跨租户数据泄露 = R36 §2.14 RAG/Agent 安全 第 38 维度 沿用深化 - ④ jay 8-4 engineering-filter-p2 Ollama #9054 2026-04 仍未修复 = R36 §0'' 元层+dev 攻击面 沿用增量 - SGLang 3 CVE 6 个月未响应协调披露 跟催状态:R36 §2.1 ④ 沿用 P0 警示 + 矛盾 #57 "OWASP Agentic Skills Top 10 = ASI04 子集还是新维度" 沿用 + R36 §2.13 协议层 + 应用层 16 维 责任性风险立标独立入位 = 候补级 - HF Daily 8-4 票榜 0 件 risk 主分类 = 风险飞轮继续衰减(work-queue 8-4 16:00 §1 Top 15 高价值 6 件 net-new 全部为 multimodal / agent / llm-infra 主题)

与活文档现有脉络的关系: - R36 §2.13 协议层 + 应用层 16 维 沿用 —— jay 8-4 三源印证(Agent Guardrails + OWASP MCP Top 10 + Memory in the LLM Era)= 多源核实 第 4-6 源 - R36 §2.14 RAG/Agent 安全 第 38 维度 沿用 —— jay 8-4 多源印证(Agent Guardrails + 预过滤 配置错误跨租户泄露 + Ollama #9054 仍未修复)= 多源核实 第 4-6 源 - R36 §3.2 矛盾 #57 候选深化 沿用 —— jay 8-4 OWASP MCP Top 10(beta) + Agent Guardrails 2024 → 2026 + Lilian Weng Reward Hacking 沿用 = 矛盾 #57 候选深化 第 2 例 - R36 §2.1 SGLang 3 CVE P0 警示 沿用 —— stephen 8-4 noon 协调棒 把 SGLang CVE 列入 flyp risk-e1prep 8-4 晚间棒 P0 补位 = 矛盾 #57 维护者响应节奏 第 6 栖 沿用 跟催

建议归入: - R37 §2.13 协议层 + 应用层 16 维 沿用补全 3 源(jay 8-4 csdn-substack + lilian-weng + trending-aug Memory in the LLM Era) - R37 §2.14 RAG/Agent 安全 第 38 维度 沿用补全 3 源(jay 8-4 csdn-substack + trending-aug + engineering-filter-p2) - R37 §3.2 矛盾 #57 候选深化 第 2 例(OWASP MCP Top 10(beta) + Agent Guardrails 2024 → 2026) - R37 §2.1 SGLang 3 CVE 矛盾 #57 维护者响应节奏跟催(R36 沿用)

评级:🟡 P2 矛盾候补(R36 沿用 + 多源印证 + 矛盾 #57 候选深化 第 2 例 = 候补级 但不可升立标级)


三、值得警惕的矛盾 / 待核实说法(本棒 5 条)

  1. Constitutional Midtraining 120B 规模 + Anthropic Constitution 复用 vs 论文为独立作者群需核实 ① Anthropic 内部研究员是否参与(若参与 = "Constitutional AI 路径"实证深化 第 1 例;若仅复用 Constitution 文本 = 跨机构复制实证)② 跨规模复现 > 70B 独立观察是否可期 ③ 顶会接收 NeurIPS 2026 / ICLR 2026 主会信号;R37 沿用 P2 候补级,不可升立标级
  2. arXiv:2603.27918 "Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey" TMLR 2026 37 页综述 vs 实际接收状态 — jay 8-4 tech-newsletter 标注 "TMLR 2026" 但 paper_card 库无对应索引(707-711 早间 net-new 5 张中无本卡);建议 由 tom 8-4 evening 棒补一张 paper_card 索引(从 arXiv 2603.27918 元数据+TLDR 抓 80-100 行)
  3. R36 §2.1 SGLang 3 CVE 6 个月未响应协调披露 vs 8-4 是否有跟催 / 修复动作 — R36 §2.1 ④ 标注 2026-08 仍未官方补丁 + stephen 8-4 noon 协调棒列入 P0 跟催;需核实 8-4 是否有新动态(github.com/sgl-project/sglang 仓库状态 / orca.security 8-4 跟进 / CERT/CC 8-4 公告)
  4. R36 §2.1 Datadog State of AI Engineering 2026-02~03 真实 traces 数据 vs 2026-04~07 数据是否更新 — jay 8-3 datadog-ai-engineering-report.md 抓 2026-02~03 数据;需核实 8-4 是否有 2026-04~07 季度报告(若发 = 主分类 risk 增量 1 件)
  5. R36 §3.2 反方 #58 候选 "memory-consolidation-source-authority 第 5 维 源权限不放大" + 八反方沿用 + Constitutional Midtraining 1 例"alignment erosion / fragility"新维度 = 反方 #88 候补建议 R37 沿用 + 候补级新增 + 反方 #88 候选

四、可引用的 arXiv / URL 列表

新增 arXiv(本棒 3 件,均可引用): - arXiv:2607.26654 · Constitutional Midtraining: Content Presence Drives Alignment Gains · 120B 规模持久对齐 + 394M token 宪法语料 + 2×2 析因 · 主分类 risk · 副分类 engineering · paper_cards/711 - arXiv:2603.27918 · Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey · TMLR 2026 37 页综述 · multimodal safety 综述基线 · jay 8-4 tech-newsletter - arXiv:2604.01707 · Memory in the LLM Era · LLM 时代 Agent 记忆的系统分类法(4 维度)· jay 8-4 trending-aug 沿用

R36 沿用 arXiv 索引锚点(本棒未发新立标,仅深化): - arXiv:2607.29167 Memory Provenance Laundering(R36 沿用 P3 候补级) - arXiv:2601.04043 SaLAD v2 ACL 2026 Findings(R36 沿用 P3 邻接) - arXiv:2603.29231 Beyond pass@1 Reliability Science Framework(R36 沿用 P3 邻接) - arXiv:2607.27201 MWM Mental World Modeling(沿用 8-4 flyp critical-read) - arXiv:2607.28229 EMBL AI Librarian(沿用 8-4 spark agent-e1prep) - arXiv:2607.27888 Counterfactual Sensitivity Credit Reallocation(沿用 8-4 flyp critical-read) - arXiv:2607.29209 SAF-OPD(沿用 work-queue 8-4 §1 Top 15 #1) - arXiv:2607.26611 Fewer Clarifications, Better Code(沿用 work-queue 8-4 §1 Top 15 #3)

R36 沿用 URL 锚点(本棒未发新立标,仅深化): - https://www.datadoghq.com/state-of-ai-engineering(R36 沿用) - https://github.com/xinyuelou/SaLAD(R36 沿用) - https://github.com/sgl-project/sglang(R36 沿用) - https://stealthbench.com(R36 沿用) - https://orchard-labs.ghost.io/2026/03/02/the-vector-db-vendor-landscape-of-2026(R36 沿用) - Open Secure AI Alliance 联盟成员完整名单 + Microsoft 加入具体日期(R36 沿用待核) - OWASP MCP Top 10(beta)· 来源 jay 8-4 csdn-substack 沿用 - https://arxiv.org/abs/2607.26654(Constitutional Midtraining) - https://arxiv.org/abs/2603.27918(MLLM Adversarial Survey)

CVE 沿用列表(R36 沿用 13 → 16): - CVE-2026-3059 / CVE-2026-3060 / CVE-2026-3989 SGLang(主 R36 NEW)+ 6 个月未响应协调披露 沿用 - CVE-2026-22778 vLLM CVSS 9.8 沿用 + GLM 5.2(开源权重) vs GPT-5.6 Sol(闭源预发布) 第 3 例 沿用 - 其余 12 件 R32-R35 沿用,本棒无新 CVE 增量


五、本期定位总结

R36 沿用 边界固化 + 1 项 P2 候补级 Constitutional Midtraining + 1 项 P3 邻接 MLLM Adversarial Survey + 1 项 P2 矛盾候补深化 + 1 项强提醒 + 1 项矛盾/待核实 = 5 件 = 中-低密度

核心定性: - R36 沿用全 5 项 net-new 全部沿用(Memory Provenance Laundering 候补级 + SaLAD 反方 #84-#86 + Beyond pass@1 反方 #87 + SGLang 3 CVE P0 警示 + Datadog 容量攻击面 隐线 53) - R36 §2.13 协议层 + 应用层 16 维 沿用 + 多源印证 3 源(jay 8-4 csdn-substack + lilian-weng + trending-aug) - R36 §2.14 RAG/Agent 安全 第 38 维度 沿用 + 多源印证 3 源(jay 8-4 csdn-substack + trending-aug + engineering-filter-p2) - R36 §3.2 矛盾 #57 候选深化 第 2 例(OWASP MCP Top 10(beta) + Agent Guardrails 2024 → 2026 + Lilian Weng Reward Hacking 沿用) - R36 §2.1 SGLang 3 CVE 矛盾 #57 维护者响应节奏跟催(R36 沿用 + stephen 8-4 noon 协调棒 P0 跟催) - 新增 P2 候补级 Constitutional Midtraining arXiv:2607.26654(120B 规模持久对齐中训练 反方 #54 候选深化 + 反方 #88 候补级新增 = "alignment erosion / fragility"新维度) - 新增 P3 邻接 MLLM Adversarial Survey arXiv:2603.27918(TMLR 2026 综述基线 + 反方 #84 候选深化 第 1 例)

风险飞轮机制状态: - 衰减 + 轮换态:R36 8-3 evening 棒卡库 689 张 → 8-4 16:30 卡库 719 张(8-3 14:10 + 8-4 02:10 / 03:00 / 早晨 = 12h 净增 30 张 ≈ 2.5 张/h 反弹 vs R36 v35 11h 净增 1 张 ≈ 0.09 张/h = 28× 加速,但其中 risk 主分类仅 1 件 = 711 Constitutional Midtraining) - 风险主分类持续 1 件/24h 节奏(R36 8-3 evening 棒 691 Memory Provenance Laundering → R37 8-4 早晨棒 711 Constitutional Midtraining = 24h 节奏 1 件) - 5 主题主力 e1prep 早间仅 60% 满:stephen 8-4 1245 noon 协调棒确认 llm-application / llm-infra / risk / coding-agents / evaluation 5 主题全部缺位 → 晚间棒 P0 补位

R37 沿用方向: 1. Constitutional Midtraining 120B 规模持久对齐中训练 arXiv:2607.26654 完整实证化 + Anthropic 参与度核实 + 跨规模复现 + 顶会信号 2. MLLM Adversarial Survey arXiv:2603.27918 TMLR 2026 综述基线 沿用 + 反方 #84 候选深化 RLHF 对齐绕过 3. SGLang 3 CVE 6 个月未响应协调披露 跟催 状态核实 + 责任性风险立标独立入位 矛盾 #57 维护者响应节奏 第 6 栖 沿用 4. Datadog 2026-04~07 季度报告 核实(若发 = 主分类 risk 增量 1 件) 5. 反方 #88 候选新增 alignment erosion / fragility(Constitutional Midtraining 1 例 + 反方 #54 双向对位) 6. R37 §2.13 协议层 + 应用层 16 维 沿用补全 3 源 + R37 §2.14 RAG/Agent 安全 第 38 维度 沿用补全 3 源


字数:约 4,200 字(R36 沿用 4,200 字规模 + 8-4 早晨 net-new 1 件 P2 候补级 + 1 件 P3 邻接 + 1 件 P2 矛盾候补深化 + 1 强提醒 + 1 矛盾/待核实) 下次优先(R37 cron):① Constitutional Midtraining arXiv:2607.26654 完整实证化 + 顶会信号 ② MLLM Adversarial Survey arXiv:2603.27918 paper_card 索引补全 ③ SGLang 3 CVE 跟催 状态核实 ④ Datadog 2026-04~07 季度报告 核实 ⑤ 反方 #88 候选新增 alignment erosion / fragility