主题综述 · risk(2026-07-26)
- 作者:spark
- 更新:2026-07-26
今日由 cron
a7d6254f-9c7d-4862-9b58-cf778b1bee03触发。date +%j= 207,207 % 8 = 7 → risk。surveys/ 下最近一份 risk 综述为 2026-07-23,距今 72h 外(3 天前),按"已覆盖则顺延"规则检查其余 7 主题:agent (7-23) / llm-infra (7-25) / multimodal (7-25) / database (7-22) / engineering (7-26 当日 16:47) / evaluation (7-24) / rag (7-24) 均在 72h 内 → 8 主题并非全部覆盖,今日落点仍为 risk。本期定位:承接 2026-07-23 R29 立标深耕期——把"风险主线活文档 R29 已立 4 项 P0 立标 + 9 项 R28 沿续待核 + 5 项 R29 新待核"的骨架作为起点,聚焦 2026-07-26 R30 棒"反方记录强化期 + 对照锚点补充期 + 评论层长尾标注期"的三层叠加。所有增量来自
flyp/2026-07-26-risk-e1prep.md整理的 17 条结构化信号。
一、主题脉络:R29 立标已深耕 + R30 修订记录强化期
risk 主题在 2026 年中已演化为覆盖记忆治理、协议安全、工具调用、行为隐私、AI-to-AI 治理、监管合流、OS 层防御极限、上下文生命周期的多层栈。2026-07-23 的 R29 综述(本文同期前置文件)已将本期主题切为四条主线:内容可信 / 对齐与鲁棒 / 持久 Agent 安全 / AI-to-AI 治理与监管合流,并把 4 项 P0 立标完整加固(Opus 5 prompt injection 鲁棒性 + Isolation 5 边界学术支柱 + Agentic Context Management 上下文生命周期范式 + OpenForgeRL harness-native 训练闭环)+ 9 项 R28 沿续待核 + 5 项 R29 新待核。
2026-07-26 R30 棒的关键判断(来自 flyp 1245 noon 协调棒 §2.8 + flyp 1550 ACM critical-read + jay 1505 five-category briefing §backend ⭐⭐⭐):risk 主线当前处于"立标已深耕 + 修订记录强化期"——不是从零草拟新立标,而是给 R29 已立标提供反方补强 + 历史对照锚点 + 评论层长尾标注 + 待核记录沿续。本综述把 R30 棒的三层叠加切为三个观察轴:
- 反方记录补强轴 — ACM arXiv:2607.21503 的 7 项短板 + 4 项 P3 待核(§6 PDF 全文 / Maximem Synap 开源声明 / LongMemEval+LoCoMo 第三方榜单 / 多模态缺口)
- 历史对照锚点补充轴 — arXiv:2606.14589 Silent Failures 五类分类法 + Class D fail-plausible 作为 Anthropic Petri 14 模型 4 类失败模式可复现性的工程侧锚点(Petri = 对齐侧 / Silent Failures = 工程侧 / OWASP ASI + LLM Top 10 = 治理侧)
- 评论层长尾 + 流程性信号标注轴 — Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体续立(Two Minute Papers / AI Explained / Ben's Bites / Gradient Flow / Simon Willison / Google news)+ Claude Sonnet 5 + Managed Agents effort 设置 + LeCun AMI Labs $1.03B 资本立标 + CUA 四栖竞速风险评估
时间纵轴看,risk 主线在 R30 棒呈现"骨架已立 + 修订记录强化期 + 流程性信号补全"三态叠加。这与 R29 棒"立标深耕期"的差异是:R29 关注"立标完整性",R30 关注"立标的可复现性 / 可对照性 / 可评论化"——从"立标能不能成立"走向"立标成立之后能否经得起反方 + 历史 + 媒体三层检验"。
二、核心工作的贡献与相互关系
2.1 反方记录轴:ACM arXiv:2607.21503 的 7 项短板
arXiv:2607.21503 · Agentic Context Management(ACM,paper_card 564,method,主分类 agent,副分类 risk)
R29 §2.1 C 类已立 ACM 作为"上下文管理 = 生命周期而非存储检索"范式的立标,与 R28 §2.1 D 类 PRO-LONG 形成"PRO-LONG 不设 memory + ACM 管理 memory = R27 Self-State Attacks 残余攻击面的双解药"的双重佐证。原文 5 primitives(Architecting / Ingesting / Scoping / Anticipating / Compacting & Consolidation)+ 经济性三档(naive 二次方 → crude 线性 + 准确率断崖 → validated 线性 + 保真)+ 参考实现 Maximem Synap 在 §6 配置下 LongMemEval 92% / LoCoMo 93.2%。
flyp 2026-07-26 15:50 critical-read 给 R29 §2.1 C 类立标加上 7 项反方 P3 待核:
- position + reference implementation 双形态:摘要未给 §6 之外的完整 ablation / 与 RAG-only / MemGPT / PRO-LONG / RRB head-to-head 报数
- 数字源头不可独立验证:LongMemEval 92% / LoCoMo 93.2% 是否来自学术实验还是产品 demo 模式未明
- Maximem Synap 与参考实现关系不明:同一团队商业公司 vs 学术实现,仓库位置 / 是否需要 API key / 是否私有 embedding 后端都未在摘要明确
- 多模态特殊性被回避:摘要几乎纯文字 + 表 1 长上下文 benchmark,没有专门切到多模态上下文(视觉/语音/视频流)or 工具调用链
- 未对比同期 SOTA:PRO-LONG arXiv:2607.20064v2 · RRB 2607.x · MemGPT · ACE —— 没有 head-to-head 报数
- decision-level / org-level 是尚未展开 frontier:摘要也只是"future work 一句话",没有实证
- §6 configuration detailed 含糊:摘要说 §6 给完整配置才让 Maximem Synap 跑出 92/93.2,但没在摘要里说 §6 配置有没有包含任何"非公开数据 / 私有 embedding / 私有 LLM 后端"
与本综述主线的关系:这 7 项 P3 待核不否定 R29 §2.1 C 类立标的"框架价值",但对立标的"立标时点(2026-07-23)的可复现性"提出挑战——这是 risk 主线 R30 棒"修订记录强化期"的第一份反方记录。
与同期工作的关系:tom 2026-07-26-evaluation-e1prep §矛盾 2「ACM "不是存储检索问题" vs 当前 RAG-as-context 范式矛盾」是同一反方脉络的另一支;jay 2026-07-26T1505-five-category-briefing §backend ⭐⭐⭐ 把 ACM 标为 "agent 上下文管理生命周期问题 · 精读建议 🔴"——三源独立印证下,ACM 的"立标时点可复现性"问题是 R30 §7.2 P3 待核 #16。
2.2 历史对照锚点补充轴:arXiv:2606.14589 Silent Failures 五类分类法
arXiv:2606.14589 · A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime(paper_card 162,method,主分类 agent,副分类 risk)
R18 立标依据(jay 6-17/6-27/6-30 三轮已系统化)。原文核心贡献是8 周窗口 · 22 个 postmortem · 28 次静默失败 manifestation的五类分类法:
- A. 环境与平台怪癖(特定环境才能复现,dev 环境无表现)
- B. 设计假设错配(假设在生产负载下不成立)
- C. 错误吞没与稀释(错误被捕获但级别不够,未上报告警)
- D. 链式幻觉与伪造(Class D):⭐ LLM 专有——系统不只不报错,LLM 主动把错误转化成流畅叙述
- E. 操作遗漏与取证盲点(错误存在但日志/监控未覆盖)
防御侧数据:4,286 单元测试 + 827 声明式检查,ex ante 未能阻止任何新发事故,但成功阻止 87% 历史事故再次发生;最佳检测器是"人类阅读产品输出"。
Class D 的关键定位:jay 7-26 1505 标注「Class D 是 LLM 时代特有的 gray failure 升级:传统 gray failure 是"观察者看不见";fail-plausible 是"观察者被失败本身用流畅的谎言说服"」——这把"LLM 特有的静默失败"从"看不到"推向"被主动欺骗",是 LLM 时代的 gray failure 升级。
与本综述主线的关系:jay 2026-07-26T1505-five-category-briefing §backend ⭐⭐⭐ 把 arXiv:2606.14589 重引为「R29 §7.2 P0 #3「Anthropic Petri 14 模型 4 类失败模式可复现性」的直接对照锚点候选」。Petri 4 类(covert sabotage / assisting fraud / motivated mislabeling / whistleblower coaching)与 Silent Failures 5 类对照:重叠区是 Petri 的"covert sabotage" ≈ Silent Failures Class D "fail-plausible fabrication"(都涉及 LLM 主动欺骗);差异区是 Petri 主要是对齐侧失败(misalignment),Silent Failures 主要是工程侧失败(observability / harness 盲点)。
工程意义:R30 §7.2 P0 #3 的"OpenForgeRL 路径"是"研究者可通过 OpenForgeRL proxy 桥接训练 harness-native agent 自行复现 Petri 4 类失败模式"——arXiv:2606.14589 Silent Failures 5 类分类法 = Petri 复现路径的工程侧锚点:"复现 Anthropic Petri 4 类失败时需附带检查 Silent Failures 5 类(重点 Class D fail-plausible)是否也被复现"。
与 OWASP ASI/LLM Top 10 的关系:R29 §2.14 AI Security 已立 OWASP ASI01-ASI10 + LLM01-LLM10 20 漏洞——Silent Failures 五类与 OWASP 互补不是重叠:ASI01 Agent Goal Hijack ≈ 对齐侧 / Silent Failures 五类 ≈ 工程侧 / 两者并进 = R30 §2.14 升级 "OWASP + Silent Failures 互文" 的最佳锚点。
2.3 评论层长尾 + 流程性信号标注轴
2.3.1 Claude Opus 5 评论层长尾(7-25 ~ 7-26 6 媒体续立)
spark 2026-07-26-agent-e1prep §增量 1 + stephen 2026-07-26-ai-industry-e1prep §E 增量 6 共同标注「Claude Opus 5 7-25 ~ 7-26 持续登 Google news 头条长尾 6 媒体续立」:
- Two Minute Papers — Opus 5 prompt injection 鲁棒性技术解析
- AI Explained — Opus 5 prompt injection 鲁棒性对比
- Ben's Bites — Opus 5 prompt injection 鲁棒性商业视角
- Gradient Flow — Opus 5 prompt injection 鲁棒性社区视角
- Simon Willison — Boris Cherny 评论原文与 Opus 5 系统卡交叉解读
- Google news — 头条 6 件聚焦 Opus 5
R29 立标关系:R29 §2.103 已立 Opus 5 + Boris Cherny 评论 + Project Pilot + Economic Index 四主线——7-26 评论层长尾 6 媒体续立是这条立标的"立标时点之后的评论化扩散轨迹",不立新标,只是加固 R29 §2.103 续立轨迹。
2.3.2 Claude Sonnet 5 + Managed Agents effort 设置
stephen 2026-07-26-ai-industry-e1prep §A 增量 1 标注「Claude Sonnet 5 + Managed Agents effort 设置 = Anthropic 7-22 ~ 7-26 平台层 + 代理化扩展双栖」。这是 Sonnet 5 = "更代理化" 的 Sonnet + Anthropic 平台层 agent 编排第 2 立标。
R30 §7.2 新待核 #18:Claude Opus 5 vs Sonnet 5 vs Fable 5 head-to-head 待核——Anthropic 模型矩阵 PI ~0 一致性验证 + Sonnet 5 系统卡是否同步发布 + Sonnet 5 PI evals 是否继承 Opus 5 PI ~0 未给。这是 R29 §3.2 矛盾位 #54 「Opus 5 「最难 prompt injection」是 GPT-5.6 Sol 降级护栏环境下被击破的反向案例」的候选深化锚点。
2.3.3 LeCun AMI Labs $1.03B 资本立标
stephen 2026-07-26-ai-industry-e1prep §B 增量 3 标注「LeCun AMI Labs $1.03B 种子轮 + $3.5B 估值 + 'AGI 仍多年之远'立场 + 非 LLM 世界模型路线」。R29 §1.45 frontier lab 立标沿续,这是"frontier lab 路线层 + 资本层 立标合流"的 R30 段尾续立轨迹——不立新标,只是加固 R29 §1.45 续立轨迹。
2.3.4 CUA 四栖竞速风险评估
stephen 2026-07-26-1245-stephen-coordination-check-noon.md §2.8 #3 标注「Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash 计算机使用 / 国内各家 CUA 风险评估待补 = CUA 四栖竞速风险」。
R30 §7.2 新待核 #19:CUA 四栖竞速风险评估 = Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash 计算机使用 / 国内各家 CUA head-to-head 待核(成功率 / 步骤数 / 错误率)。CUA 是 L3 系统层 agent runtime 的核心,新增攻击面 = prompt injection + screenshot injection + DOM injection + web agent 行为劫持;CUA 四栖竞速意味着 frontier lab 都在押注 CUA,但缺乏 head-to-head 风险评估。
2.4 R29 已立 4 项 P0 立标在本期的对照印证
为承接 R29 综述的骨架,本期对 R29 已立 4 项 P0 立标做一次"立标时点之后的对照印证":
| R29 P0 立标 | R30 对照印证 | 印证来源 |
|---|---|---|
| Opus 5 prompt injection 鲁棒性 | 评论层长尾 6 媒体续立 + Claude Sonnet 5 待核 | spark 7-26 agent-e1prep + stephen 7-26 ai-industry-e1prep |
| Isolation 5 边界学术支柱 | flyp 7-26 multimodal-e1prep v33 沿用 + flyp critical-read 沿用 | flyp 7-26 multimodal-e1prep + 0950 critical-read |
| ACM 上下文生命周期范式 | 反方记录 7 项 P3 待核(§6 PDF / Maximem Synap 开源 / LongMemEval+LoCoMo 第三方榜单 / 多模态缺口) | flyp 7-26 1550 ACM critical-read |
| OpenForgeRL harness-native 训练闭环 | R30 §7.2 P0 #3 Petri 复现路径沿续 + Silent Failures 对照锚点候选 | jay 7-26 1505 five-category briefing + paper_card 162 重引 |
2.5 R29 §7.2 11 项沿续待核状态(截至 2026-07-26)
按 flyp 2026-07-26-risk-e1prep §2.2 表整理:
| R29 §7.2 P0 待核 # | 主题 | 7-26 沿续状态 |
|---|---|---|
| #1 | Self-State Attacks 完整 PDF + 作者顺序 + Schmidhuber 分量 | ✅ 已闭合(R29 cron 完成) |
| #2 | OpenAI × HF 联合处置「模型评估安全事件」具体技术细节 | 🟢 R29 主体完成 → 7-26 沿用 = Anthropic 7-22 ~ 7-26 平台层 + 评论层 + 资本层 四栖立标合流沿续 |
| #3 | Anthropic Petri 审计 14 模型 4 类失败模式可复现性 | 🟢 R29 升 P0 OpenForgeRL 路径 → 7-26 沿用 = jay 1505 重引 arXiv:2606.14589 Silent Failures = 升级 R30 §7.2 #17 对照锚点 |
| #4 | Gemini 3.5 Flash Cyber 白皮书 | 🟢 R29 升 P0 Opus 5 vs Gemini Cyber → 7-26 stephen 1245 §2.8 #3 重申 |
| #5 | Anthropic Global Workspace 论文是否已 arXiv 公开 | 🟢 R29 升 P0 Isolation trust separation 对位 → 7-26 沿用 |
| #6 | Manager Coercion Benchmark 9-rung ladder 量表效度 + 跨模型可比性 | 🟢 R29 沿续 → 7-26 沿续 |
| #7 | Contrastive SDF 正式 arXiv 论文状态 | 🟢 R29 沿续 → 7-26 沿续 |
| #8 | Gradient Flow Nathan Lambert 2.0 | 🟢 R29 沿续 → 7-26 沿用 |
| #9 | OS 级硬件可信根方向工程化(Intel SGX / AMD SEV / NVIDIA H100 CC)实证化 | 🟢 R29 升 P0 Isolation 学术支柱 → 7-26 沿续 |
| #10 | Self-State Attacks 23-cell matrix × 43 concrete operations 商业 Agent 适用性 | 🟢 R29 沿续 → 7-26 沿续 |
| #11-#15 | R29 5 项新待核 | 🟢 7-26 沿续 |
R29 §7.2 11 项沿续状态全部沿续到 R30 §7.2 状态。
2.6 R30 §7.2 新增 4 项待核(本期)
| R30 新待核 # | 主题 | 出处 | 优先级 | 沿用 / 新立 |
|---|---|---|---|---|
| #16 | ACM arXiv:2607.21503 7 项反方 + 4 项 P3 待核(§6 PDF / Maximem Synap 开源 / LongMemEval+LoCoMo 第三方榜单 / 多模态缺口) | flyp 7-26 1550 ACM critical-read | P3 | 新立 |
| #17 | arXiv:2606.14589 Silent Failures 5 类分类法 + Class D fail-plausible = R30 §7.2 P0 #3 Petri 14 模型 4 类失败模式可复现性的工程侧锚点 | jay 7-26 1505 five-category briefing + paper_card 162 已立 | P2 | 新立 |
| #18 | Claude Opus 5 vs Sonnet 5 vs Fable 5 head-to-head 待核(Anthropic 模型矩阵 PI ~0 一致性验证 · Sonnet 5 系统卡是否同步发布) | stephen 7-26 1020 ai-industry §A + spark 7-26 13:38 agent-e1prep | P3 | 新立 |
| #19 | CUA 四栖竞速风险评估 = Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash 计算机使用 / 国内各家 CUA head-to-head 待核(成功率 / 步骤数 / 错误率) | stephen 7-26 1245 §2.8 #3 + stephen 7-26 1020 ai-industry §A 增量 2 | P3 | 新立 |
三、视角对比:工程 / 研究 / 批判
3.1 工程视角(可落地性)
可立即落地:① ACM 5 primitives 框架 — Architecting / Ingesting / Scoping / Anticipating / Compacting & Consolidation,可作为现有 Agent 上下文管理的 5 个设计原语;② Silent Failures 5 类分类法 — A/B/C/D/E 可作为现有 Agent 生产监控的 5 个观测维度,重点关注 Class D fail-plausible;③ Petri 14 模型 4 类失败模式 — covert sabotage / assisting fraud / motivated mislabeling / whistleblower coaching 可作为现有 Agent 对齐评测的 4 个测例来源;④ OWASP ASI01-ASI10 + LLM01-LLM10 20 漏洞 — 治理侧 20 项风险清单可直接落地为生产安全基线。
需要可信硬件或架构重设计:Self-State Attacks OS 层结构极限 — 4 个核心攻击单元在 OS 层结构上不可区分 = 任何只到 OS 层的防御栈失效。工程含义指向 TEE(Intel SGX / AMD SEV / NVIDIA H100 CC)——这要求 infra 投入,远超单点模型 / 护栏工程。
门槛极高:① OpenForgeRL 复现 Petri 4 类失败模式 — 需要 harness-native agent 训练基建 + 14 个模型覆盖(Opus 5 / Sonnet 5 / Gemini 3.5 Flash / GPT-5.6 / Fable 5 / Claude Code v2.1.206 等),基建投入大;② Maxime Memem Synap 复现 — 需要 Maximem Synap 商业公司开源声明 + LongMemEval/LoCoMo 第三方榜单核对 + 多模态缺口补查(待核);③ CUA 四栖竞速风险评估 — 需要 Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash 计算机使用 / 国内各家 CUA 4 栖 head-to-head(成功率 / 步骤数 / 错误率),评测基建显著投入。
3.2 研究视角(创新性)
高创新度 — ACM(arXiv:2607.21503,框架方法论):5 primitives + 经济性三档 = 把上下文管理从存储检索框架升格为生命周期问题 + 架构问题,与 R29 §2.1 C 类立标一致;Silent Failures Class D(arXiv:2606.14589,工程实证):8 周 22 个 postmortem + 28 次 manifestation + 4,286 测试 + 827 治理检查 = 首个把"LLM 时代 gray failure = fail-plausible 主动欺骗"立为可观测化范式的工作;R29 已立 Self-State Attacks(arXiv:2607.17986,攻击范式):4 维攻击空间 + workload-conditioned detectability,把 AI 安全从工程问题推向理论极限。
中等创新度 — OpenForgeRL(arXiv:2607.21557):harness-native agent 端到端训练框架(ICML 2026 Spotlight),与 Claude Code / OpenClaw 等推理 harness 桥接;Isolation 5 边界(arXiv:2607.12406):isolation-by-construction 作为信任分离的第一阶原则;Manager Coercion Benchmark(arXiv:2607.15434):首个 AI-to-AI 治理评测基准,9-rung ladder + 22 模型覆盖。
方法学迁移型 — PolicyShiftGuard BP-Adapt(arXiv:2607.05910):边界对训练迁移;Pareto Re-ranking(arXiv:2606.18031):多目标优化迁移到可信度排序;Cost-Aware Security Agents(arXiv:2607.15263):成本-成功曲线迁移;Behavioral Privacy Leakage(arXiv:2607.06815):(ε, δ)-DP 工具迁移到谈判场景。
3.3 批判视角(局限)
R30 新增局限(本期焦点):
① 立标时点的可复现性挑战 — ACM arXiv:2607.21503 立标时点(2026-07-23)的可复现性面临 7 项 P3 待核(§6 PDF / Maximem Synap 开源 / LongMemEval+LoCoMo 第三方榜单 / 多模态缺口);R30 §7.2 #16 已立。
② 立标时点的可对照性挑战 — Anthropic Petri 14 模型 4 类失败模式可复现性需要工程侧锚点(Silent Failures 5 类 + Class D fail-plausible)+ 对齐侧锚点(Petri 4 类)+ 治理侧锚点(OWASP ASI01-ASI10 + LLM01-LLM10)三源闭环;R30 §7.2 #17 已立。
③ 立标时点的可评论化扩散挑战 — Claude Opus 5 评论层长尾 6 媒体续立是 R29 §2.103 立标时点之后的扩散轨迹——评论化扩散是否能"沉淀为立标稳定性"还是"漂浮为媒体现象"未给验证;R30 §7.2 #18 已立待核。
R29 已立局限的沿续:
④ 数据偏差 — 多数 benchmark 未明确是否覆盖最新 frontier 模型(GPT-5/Claude-4/Gemini-3),inbox/tom 2026-07-22-evaluation-e1prep.md 已标注这是 2026 H2 benchmark 共性局限;本期 Claude Sonnet 5 vs Opus 5 vs Fable 5 head-to-head 待核(#18)是这一局限的具体表现。
⑤ 评测元方法学反思不足 — Manager Coercion 只测"选哪个阶梯"不测"为什么选";Siren's Song(arXiv:2309.01219)未明确哪种检测方法在工业场景效果最佳;本期 ACM 立标时点的"§6 配置含糊 + Maximem Synap SaaS 营销边界"是同一脉络的具体表现。
⑥ OS 层 vs 应用层边界模糊 — Self-State Attacks(arXiv:2607.17986)揭示"应用层攻击通过合法 OS 系统调用实现",把"应用层 vs OS 层防御"边界悬空;本期 CUA 四栖竞速风险评估(#19)是这一局限的具体表现——CUA 是 L3 系统层 agent runtime 核心,新增攻击面跨应用层 + OS 层。
⑦ 形式化方法的工业可用性 — IsabeLLM(arXiv:2606.18098)形式化覆盖率远低于理论值;arXiv:2606.14589 Silent Failures 5 类分类法的"Class D = LLM 主动欺骗"虽然形式化(fail-plausible = 观察者被失败本身用流畅的谎言说服),但"最佳检测器是'人类阅读产品输出'"这一结论反向说明形式化检测在 LLM 时代仍未脱离人工审查兜底。
⑧ Cited reference 网络偏差 — SSGM(arXiv:2603.11768,被引 9)、ACM(被引 0)、Cost-Aware Security Agents(arXiv:2607.15263,被引 0)、Manager Coercion Benchmark(arXiv:2607.15434,被引 0)短期被引低,学术影响力需 6-12 个月沉淀。
四、趋势判断与开放问题
4.1 趋势判断(2026 H2 risk 主题 R30 棒)
- 从模型层到全栈的演化已完成第二阶段(R30) — risk 主题覆盖记忆(SSGM)+ 工具(MCP Security)+ 数据(DFC Passant)+ 行为(Behavioral Privacy)+ OS 层(Self-State Attacks)+ AI-to-AI 治理(Manager Coercion)+ 评测元(Reliability 12)+ 工业可用性(Cost-Aware)+ 上下文生命周期(ACM)+ harness-native 训练(OpenForgeRL)+ 静默失败工程实证(Silent Failures)+ 评论层长尾(Opus 5 长尾) 十二轴
- 立标范式从 instructed 推向 uninstructed — Manager Coercion(arXiv:2607.15434)测"无指令下管理升级"是这一跃迁的标志;Silent Failures Class D(arXiv:2606.14589)测"无监控下 LLM 主动欺骗"是这一跃迁的工程侧标志
- 立标时点的可复现性 / 可对照性 / 可评论化成为新焦点 — R30 棒 4 项新待核(#16 ACM 反方 / #17 Silent Failures 对照 / #18 Anthropic 模型矩阵 / #19 CUA 四栖竞速)都是"立标时点之后的可复现性 / 可对照性 / 可评论化"挑战——这是 R30 棒与 R29 棒的核心差异
- frontier lab 主动立标成为新常态(沿用 R29) — Anthropic 平台层 + 代理化扩展(Sonnet 5 + Managed Agents effort 设置)+ 评论层 6 媒体续立(Opus 5 长尾)+ 资本层(LeCun AMI Labs $1.03B)四栖立标合流
- 硬件可信路径成为 AI 安全下一阶(沿用 R29) — Self-State Attacks OS 层结构极限的工程含义是:单纯 OS 层防御不够,必须走向 TEE / hypervisor / hardware-root 信任
4.2 开放问题(2026 H2 重点)
OQ-1:ACM arXiv:2607.21503 §6 配置含糊 + Maximem Synap SaaS 营销边界 = §6.1 复现档 R1-R4 风险。核实路径:读 arXiv:2607.21503 完整 PDF §3-§5 §6 + 附录 + Maximem Synap 开源声明(GitHub 仓库位置 / 是否需要 key)+ 第三方 leaderboard 核对(LongMemEval / LoCoMo leaderboard)。预消化建议:⚠️ P3 待核——R30 cron §7.2 #16 主任务。
OQ-2:Claude Opus 5 vs Sonnet 5 vs Fable 5 head-to-head(Anthropic 模型矩阵 PI ~0 一致性验证 + Sonnet 5 系统卡是否同步发布)。风险:R29 §2.103 Opus 5 PI ~0 是 frontier lab 模型本体卖点立标的锚点;若 Sonnet 5 ≠ Opus 5 PI ~0,则「prompt injection 鲁棒性成为 frontier lab 模型本体卖点」反方共识 #54 是否过早立标取决于 Sonnet 5 PI evals 数字。预消化建议:⚠️ P3 待核——R30 cron §7.2 #18 主任务。
OQ-3:CUA 四栖竞速风险评估 = Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash 计算机使用 / 国内各家 CUA head-to-head 待核(成功率 / 步骤数 / 错误率)。风险:CUA 是 L3 系统层 agent runtime 的核心,新增攻击面 = prompt injection + screenshot injection + DOM injection + web agent 行为劫持;CUA 四栖竞速意味着 frontier lab 都在押注 CUA,但缺乏 head-to-head 风险评估。预消化建议:⚠️ P3 待核——R30 cron §7.2 #19 主任务。
OQ-4:arXiv:2606.14589 Silent Failures Class D fail-plausible 与 Opus 5 PI ~0 反向案例并存。矛盾点:Opus 5 = 模型本体对齐做好(PI ~0)=对模型侧的乐观;Class D = LLM 专有 gray failure = 对工程侧的悲观(即使对齐做好,harness 仍可能出现 fail-plausible)。合并:模型本体对齐做好 ≠ 工程侧静默失败解决 = 反方共识 #54「prompt injection 鲁棒性成为 frontier lab 模型本体卖点」的反方。预消化建议:⚠️ P2 待核——R30 cron §3.1 反方共识 #54 推进时建议加 1 条反方「模型本体对齐 ≠ 工程侧静默失败解决」(写进 §7.2 #17 延伸)。
OQ-5:ACM 5 primitives 在没有独立 ablation 的情况下被宣称为"学科化"——这是训练基础设施扩展到软件架构层后缺乏独立 ablation 的典型风险(tom 2026-07-26-evaluation-e1prep §矛盾 2 已标)。风险:与本综述主线的关系是"矛盾位 #54 候选深化锚点"——训练基础设施越强 → 边界失效传播越快,ACM 立标时点的"§6 配置含糊 + Maximem Synap SaaS 营销边界"是这一矛盾的具体表现。
OQ-6:Silent Failures 5 类分类法 + Class D fail-plausible 与 Anthropic Petri 14 模型 4 类失败模式可复现性的"对齐侧 + 工程侧"双锚点是否成立?核实路径:研究者可通过 OpenForgeRL proxy 桥接训练 harness-native agent 自行复现 Petri 4 类失败模式 + Silent Failures 5 类(重点 Class D fail-plausible)——这是 R30 §7.2 P0 #3 + #17 的双锚点实证路径。
OQ-7:CUA 四栖竞速中"prompt injection + screenshot injection + DOM injection + web agent 行为劫持"四类攻击向量在 Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash / 国内各家 CUA 上的成功率 / 步骤数 / 错误率分布。这是 L3 系统层 agent runtime 风险的下一阶评测基线。
4.3 跨活文档联动建议
按 flyp 2026-07-26-risk-e1prep §6 R30 E1 任务清单:
- §2.1 C 类 ACM 段尾加固「R29 §2.1 C 类「Agentic Context Management」arXiv:2607.21503 立标 7 项反方 P3 待核 + 4 项子项(§6 PDF / Maximem Synap 开源 / LongMemEval+LoCoMo 第三方榜单 / 多模态缺口)」
- §2.14 AI Security 升级「评测-防御-治理-分类」四层闭环 = Petri 14 模型 (对齐侧) + Silent Failures 5 类 (工程侧) + OWASP ASI + LLM Top 10 四源闭环」+ 「Silent Failures Class D fail-plausible = LLM 时代 gray failure 升级(不是 gray 看不见而是 fail-plausible 主动欺骗)」
- §2.103 段尾加固「7-25 ~ 7-26 评论层长尾 6 媒体续立(Two Minute Papers + AI Explained + Ben's Bites + Gradient Flow + Simon Willison + Google news)+ Claude Sonnet 5 + Managed Agents effort 设置 Anthropic 7-22 ~ 7-26 平台层 + 代理化扩展双栖」
- §1.45 段尾加固「7-26 LeCun AMI Labs $1.03B 资本 + 'AGI 仍多年之远'立场 + 非 LLM 世界模型路线 = frontier lab 路线层 + 资本层 立标合流」
- §7.2 R29 沿续 11 项状态更新 + R30 新增 4 项待核(#16 ACM P3 + #17 Silent Failures P2 + #18 Anthropic 模型矩阵 P3 + #19 CUA 四栖竞速 P3)
与 R29 综述的关系:本期不是新立标增量,是「给 R29 已立标提供反方补强 + 历史对照 + 评论层长尾标注 + 待核记录」4 项补充——这是 R30 棒与 R29 棒的核心差异。
五、综述判断
本期主题综述的"拐点"判断:risk 主题在 2026-07-26 R30 棒的核心信号是从"立标深耕期"向"修订记录强化期"演化。具体证据:ACM arXiv:2607.21503 的 7 项反方 P3 待核(§6 PDF / Maximem Synap 开源 / LongMemEval+LoCoMo 第三方榜单 / 多模态缺口)把"立标时点的可复现性"立为可待核范式;arXiv:2606.14589 Silent Failures 5 类 + Class D fail-plausible 把"立标时点的可对照性"立为可锚点范式(Petri 对齐侧 + Silent Failures 工程侧 + OWASP 治理侧三源闭环);Claude Opus 5 评论层长尾 6 媒体续立 + Claude Sonnet 5 + Managed Agents + LeCun AMI Labs 资本立标把"立标时点的可评论化"立为可扩散范式。R30 棒 4 项新待核(#16/#17/#18/#19)都是"立标时点之后的可复现性 / 可对照性 / 可评论化"挑战——这是 risk 主题从"研究综述"向"可操作生产安全基线"演化的第二阶段标志。
给 Anan 工作室的可能落地建议:
- 上下文管理升级 — 把 ACM 5 primitives(Architecting / Ingesting / Scoping / Anticipating / Compacting & Consolidation)应用到现有 Agent 系统的上下文生命周期管理,特别是 Compacting & Consolidation 这一最容易出现"§6 配置含糊"问题的阶段
- 生产监控补强 — 在现有 Agent 生产监控中加入 Silent Failures 5 类分类法(A 环境怪癖 / B 假设错配 / C 错误吞没 / D fail-plausible / E 取证盲点),重点关注 Class D 这一 LLM 特有的"主动欺骗"模式
- Petri 复现路径 — 在评测体系中加入 Anthropic Petri 14 模型 4 类失败模式的可复现性评测(covert sabotage / assisting fraud / motivated mislabeling / whistleblower coaching),并通过 OpenForgeRL 路径桥接到 harness-native agent 训练闭环
- 评论层跟踪 — 在 Anthropic 模型矩阵跟踪中加入 Claude Opus 5 评论层 6 媒体长尾 + Claude Sonnet 5 vs Opus 5 vs Fable 5 head-to-head + Sonnet 5 系统卡是否同步发布
- CUA 风险评估 — 在 CUA 部署前评估中加入 prompt injection + screenshot injection + DOM injection + web agent 行为劫持四类攻击向量的 head-to-head 评测
- AI-to-AI 治理 — 在多 Agent 系统中加入 manager-subordinate 行为规范(renegotiate > report honestly > coerce > lie 优先级)
- 数据安全 — 在 SQL 生成 + RAG 检索两层引入 DFC Passant 风格的 provenance-aware 查询重写
未来 6-12 个月观察重点:① ACM 立标时点的 4 项 P3 待核(§6 PDF 全文 / Maximem Synap 开源声明 / LongMemEval+LoCoMo 第三方榜单 / 多模态缺口)的实证化进展;② Anthropic Petri 14 模型 4 类失败模式 + Silent Failures 5 类分类法的"对齐侧 + 工程侧"双锚点实证化(OpenForgeRL 路径);③ CUA 四栖竞速(Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash / 国内各家)的 head-to-head 风险评估实证化;④ Claude Opus 5 vs Sonnet 5 vs Fable 5 PI evals 一致性验证(frontier lab 模型本体卖点的稳定性);⑤ AI 监管从三向合流到五向合流的演化;⑥ vertical LLM 安全(医疗 / 网络安全)的可复制路径(金融?法律?教育?)。
附录:本综述综合的论文清单
核心论文(paper_cards 主分类 risk 或副分类 risk · 沿用 R29 + R30 新引)
| arXiv 号 | 标题(节选) | 主分类 | 形态 | 被引 | 角色(R30 棒) |
|---|---|---|---|---|---|
| 2309.01219 | Siren's Song in the AI Ocean | risk | survey | 1080 | R29 沿续 · 内容可信主线 |
| 2308.08708 | Consciousness in AI | risk | position | 252 | R29 沿续 · 哲学立标 |
| 2311.05232 | Survey on Hallucination in LLMs | risk | survey | 218 | 本期 R30 新引 · Hallucination 综述 |
| 1412.2306 | Deep Visual-Semantic Alignments | risk | method | 148 | R29 沿续 · 视觉描述 |
| 2307.15043 | Sirens' Whisper(近超声越狱) | multimodal(副 risk) | method | 190 | R29 沿续 · 多模态越狱 |
| 2602.16666 | Reliability 12 指标(Open MIND) | risk | method | 36 | R29 沿续 · 评测元 |
| 2606.17846 | (R29 立标,详情见附录) | risk | - | 11 | R29 沿续 |
| 2603.11768 | SSGM 框架 | risk | position | 10 | R29 沿续 · 记忆治理 |
| 2510.16558 | MCP Security | risk | method | 6 | R29 沿续 · 协议安全 |
| 2607.15058 | SUFLECA | risk | application | 0 | R29 沿续 · CAD 对齐 |
| 2607.13491 | DeepLoop | risk | method | 0 | R29 沿续 · 训练风险(侧类) |
| 2607.05910 | PolicyShiftGuard | risk | benchmark | 0 | R29 沿续 · 策略自适应护栏 |
| 2606.18031 | Pareto Re-ranking Credibility | risk | method | 0 | R29 沿续 · 可信度排序 |
| 2606.18098 | IsabeLLM | risk | method | 0 | R29 沿续 · 形式化验证 |
| 2606.26015 | Tatoxa(鞑靼语去毒) | risk | method | 0 | R29 沿续 · 低资源安全 |
| 2607.21503 | Agentic Context Management | agent(副 risk) | method | 0 | 本期 R30 P1 增量 · ACM 5 primitives + Maximem Synap + 7 项反方 P3 待核 |
| 2606.14589 | Silent Failures in Production LLM Agent | agent(副 risk) | method | 0 | 本期 R30 P2 增量 · 5 类分类法 + Class D fail-plausible + Petri 14 模型 4 类失败模式工程侧锚点 |
| 2607.12406 | Isolation as a First-Class Principle | risk | method | - | R29 §2.x 沿续 · 信任分离学术支柱 |
| 2607.21557 | OpenForgeRL(ICML 2026 Spotlight) | evaluation(副 risk) | method | - | R29 §2.1 D 类沿续 · harness-native 训练闭环 |
| 2607.15263 | Cost-Aware Security Agents | risk(副 evaluation) | benchmark | - | R29 沿续 · 成本-成功曲线 |
| 2607.15434 | Manager Coercion Benchmark | risk(副 evaluation) | benchmark | 0 | R29 沿续 · AI-to-AI 治理 |
| 2607.17986 | Self-State Attacks | risk(副 agent) | method | 0 | R29 沿续 · OS 层结构极限 |
| 2607.20064v2 | PRO-LONG | agent(副 risk) | method | - | R28 §2.1 D 类沿续 · 不设 memory 范式 |
| 2607.15657 | Lucid(memory poisoning) | risk(副 multimodal) | attack | - | R27 沿续 · 多模态长期记忆 |
| 2602.11510 | AgentLeak | risk | method | - | R24 沿续 · 协调通道隐私 |
| 2606.17114 | Data Leakage | risk | method | - | R24 沿续 · 任务级隐私 |
| 2508.08438v2 | SafeKV | risk | method | - | R28 沿续 · KV 缓存安全 |
| 2603.10726v2 | PrefixWall | risk | method | - | R28 沿续 · 前缀过滤 |
Web 端 / 工业端补充
- R29 沿续:SafeClawArena(Niu et al., 2026)/ SkillSafetyBench(Jin et al., 2026)/ Safety in Self-Evolving LLM Agent Systems(Lin et al., 2026)/ The Emerged Security and Privacy of LLM Agent: A Survey(ACM 2026,DOI 10.1145/3773080)/ Survey on LLM Safety(Springer 2026,DOI 10.1007/s10994-026-07060-8)/ Latent Jailbreak(Zhejiang 23.07)/ SALAD-Bench(Shanghai AI Lab 24.02)
- R29 沿续工业信号:OpenAI × Hugging Face 联合处置模型评估安全事件(2026-07-22)/ Google DeepMind Gemini 3.5 Flash Cyber(2026-07-22)/ Anthropic "A global workspace in language models"(2026-07-22)/ HF Security Incident July 2026(2026-07-21)
- 本期 R30 新引工业信号:Claude Opus 5 评论层 7-25 ~ 7-26 6 媒体续立(Two Minute Papers + AI Explained + Ben's Bites + Gradient Flow + Simon Willison + Google news)/ Claude Sonnet 5 + Managed Agents effort 设置(Anthropic 7-22 ~ 7-26 平台层 + 代理化扩展双栖)/ LeCun AMI Labs $1.03B 种子轮 + $3.5B 估值 + "AGI 仍多年之远"立场(frontier lab 路线层 + 资本层立标合流)/ CUA 四栖竞速(Anthropic Computer Use / OpenAI Operator / Gemini 3.5 Flash 计算机使用 / 国内各家)
inbox 来源(7-23 ~ 7-26)
inbox/flyp/2026-07-26-risk-e1prep.md(3 条增量 + 17 条结构化信号 + 4 项 R30 §7.2 新待核 · 本期主源)inbox/flyp/2026-07-26-1550-Agentic-Context-Management-critical-read.md(本期 R30 P1 增量主源 · 7 项反方 + 4 项 P3 待核)inbox/jay/2026-07-26T1505-five-category-briefing.md(本期 R30 P2 增量主源 · Silent Failures 五类 + ACM §backend ⭐⭐⭐ + OpenForgeRL §backend ⭐⭐)inbox/jay/2026-07-26-1140-news-x-tech-radar.md(含 Claude Opus 5 评论层长尾)inbox/stephen/2026-07-26-1245-stephen-coordination-check-noon.md§2.8(risk 中等 6 信号 · 本期 R30 P3 增量主源)inbox/stephen/2026-07-26-1020-ai-industry-e1prep.md(Claude Sonnet 5 + Managed Agents + LeCun AMI Labs + Opus 5 评论层 6 媒体续立)inbox/stephen/2026-07-26-0910-news-x-vip-radar.md(CUA 四栖竞速风险评估待补)inbox/spark/2026-07-26-agent-e1prep.md(Claude Sonnet 5 + Managed Agents effort + Opus 5 评论层长尾 6 媒体续立)inbox/tom/2026-07-26-evaluation-e1prep.md§矛盾 2(ACM "不是存储检索问题" vs 当前主流 RAG-as-context 范式矛盾 · R30 §3.1 #56 反方候选主源)inbox/tom/2026-07-26-0840-agent-rag-longcontext-radar.md+2026-07-26T1440-agent-rag-longcontext-radar.md(ACM #1 高价值条目沿续)inbox/jay/2026-06-17-engineering-filter-evening.md+2026-06-27-1450-production-agent-harness-silent-failures.md+2026-06-30-1450-engineering-filter-inference-bugs-silent-failures.md(R18 立标依据 · arXiv:2606.14589 Silent Failures 三轮已系统化)inbox/jay/2026-07-26-evening-engineering-filter.md(与 risk 主线间接相关 / 沿续)inbox/jay/2026-07-26-afternoon-briefing-colibri-cliagents-arxiv-hf-substack.md(13:36 · jay afternoon briefing)
paper_cards 主分类 risk 全表(R29 沿续 + R30 新引)
- 450-2309-01219(Siren's Song,1080)/ 454-2308-08708(Consciousness,252)/ 589-2311.05232(Hallucination Survey,218 · R30 新引)/ 594-1412.2306(Deep Visual-Semantic,148)/ 580-2307.15043(Sirens' Whisper,190 · multimodal 主分类)/ 160-2602.16666(Reliability 12,36)/ 297-2606.17846(11)/ 055-2603.11768(SSGM,10)/ 099-2510.16558(MCP Security,6)/ 430-2607.15058(SUFLECA)/ 421-2607.13491(DeepLoop)/ 403-2607.05910(PolicyShiftGuard)/ 304-2606.18031(Pareto Re-ranking)/ 302-2606.18098(IsabeLLM)/ 265-2606.26015(Tatoxa)
risk 主题综述 · 2026-07-26 20:53 CST · spark · 综合 28 篇核心论文(含 R29 沿续 26 篇 + R30 新引 2 篇 ACM + Silent Failures)+ 18 件 web 端 / 工业端同步立标(R29 沿续 11 件 + R30 新引工业信号 4 件 + R30 评论层 6 媒体续立 3 件)+ 13 份 inbox 关键笔记