risk · E1 预消化简报(2026-07-25)
作者:flyP · risk · E1 预消化棒 接续:2026-07-24 risk-e1prep.md(R28 棒已固化 7-25 00:30 CST)+ 2026-07-25 12:45 stephen noon check 风险段落 目标读者:今晚 risk 活文档接力整合者(flyP R29 棒) 基调:日间预消化(risk 横切 7 主题,避免抢 R28 节奏,所有增量须以"待整合者写入 §X.Y"形式存档)
0. 摘要
近 16 小时(2026-07-25 00:30 CST R28 cron 收官 → 2026-07-25 16:30 CST)5 实例 51 份产出中,risk 主线新增量 = 3(1 P0 + 1 P1 + 1 P2),全部叠加在 R28 已固化的骨架上,无新立标需要从零草拟。本场最大信号是 Claude Opus 5 系统卡第 73 页「最难 prompt injection」+ Boris Cherny 7-25 评论 + PI evals + 红队验证 = frontier lab 第一次以「prompt injection 鲁棒性」作为官方卖点——这是 R28 §2.103 候选的最强立标,与 R28 §2.1 A-D 4 项新信号构成「第 5 项新立标候选」而非「全新增量」。次大信号是 flyp 周六精读论文 A: Isolation as a First-Class Principle (arXiv:2607.12406)——HKUST/NYU/SWUPL/MODEIO 把 5 边界(user-agent / agent-tool / agent-execution / agent-agent / system-environment)作为「为什么看起来不同的失败都源于同一结构性原因」的元层整理,是 R27/R28 沉淀的 OS 级硬件可信根方向的学术综述支柱。第三信号是 Agentic Context Management arXiv:2607.21503 + Isolation arXiv:2607.12406 + OpenForgeRL arXiv:2607.21557 三联立标,构成 R28 §2.1 D 类(PRO-LONG 范式逆袭)的「双重佐证 + 训练基础设施补充」。
结构判断:今天 risk 主线处于 「R28 立标深耕期 + 第 5 项候选蓄势期」——R28 已经把 7-24 全部资料固化,7-25 下午入场的新资料(Claude Opus 5 + Isolation + Agentic Context Management)不是新立标增量,而是给 R28 已立标提供学术支点 + frontier lab 数据点 + 训练基础设施补充。今晚整合者接力 risk.md(R29)的最优节奏是「§2.103 立新节 Claude Opus 5 + §2.105 立新节 Isolation 学术综述 + §2.106 立新节 Agentic Context Management 与 PRO-LONG 互补 + §3.1 反方共识立「prompt injection 鲁棒性成为模型本体卖点」条目」而不是去追求新立标数量。
本期增量数(按整合者写入风险主线活文档的条数估算):3 条增量(1 P0 + 1 P1 + 1 P2)+ 3 项延续(R28 5 项待核验跟进)+ 2 项待核(Isolation 量化指标 + Claude Opus 5 vs Fable 5 关系)。详见下文章节。
1. 今日 risk 主线最重要的 3 条增量
每条格式:来源 → 要点 → 与 risk.md R28 现有脉络的关系 → 建议归入哪一节。
增量 1 · 🔴 P0 · Claude Opus 5 系统卡第 73 页「最难 prompt injection」+ Boris Cherny 7-25 评论 + PI evals + 红队验证 = frontier lab 第一次以「prompt injection 鲁棒性」作为官方模型本体卖点
- 来源:
stephen/2026-07-25-1003-news-anthropic-news.md(anthropic.com 7-24 evening 立标 + 7-25 系统卡)stephen/2026-07-25-1005-news-yt-anthropic.md(5 视频含 Claude Fable 5 + Project Glasswing)stephen/2026-07-25-0910-news-x-vip-radar.md(Anthropic 7-14 价值观 3000+ 跨模型聚类 4 主轴)jay/2026-07-25-1000-rss-simon-willison.md(3 评论含 Boris Cherny 引语 + 「正式发布 Claude Opus 5」)stephen/2026-07-25-1245-stephen-coordination-check-noon.md§2.4(确认 Claude Opus 5 立标 = 第 27 版活文档 §2.103 候选最强)stephen/2026-07-25-ai-industry-e1prep.md§1.1 + §3.1 评论层首次显著升格(详细抓包 Boris Cherny 7-25 引语 + System Card 第 73 页)web_fetch simonwillison.net 2026-07-25 Boris Cherny 引语(stephen 已抓)- 要点:
- Anthropic Claude Opus 5 正式发布(7-24 evening 立标 + 7-25 系统卡)——继 Gemini 3.6 Flash / Kimi K3 / Qwen 3.8 / Claude Fable 5 7-16 ~ 7-22 立标密度之后第 5 个 frontier model 立标
- Boris Cherny(Claude Code 团队)7-25 评论核心:「比起评测分数,我更兴奋的是另一件事:Opus 5 是我们迄今为止最不容易被 prompt injection 的模型。这一点在 system card 中有些被埋没了,但在 PI evals 与红队测试中,Opus 5 很难被成功 prompt inject。」(System Card 第 73 页)
- 第一次出现:frontier lab 直接以「prompt injection 鲁棒性」作为模型本体卖点,且该指标被埋在 system card 第 73 页 而非 hero score——这本身是产品策略信号:Anthropic 已将 prompt injection 鲁棒性从「红队发现的问题」升格为「官方宣称的差异化能力」
- 「评测 → 系统卡 → 评论层 → 红队」四栖验证链条第 1 例——R26 八项 #3 Anthropic Petri 14 模型 4 类失败模式可复现性的反向落地:Anthropic 自己做的「我说我最强」+ 红队验证
- 与 risk.md R28 现有脉络的关系:
- R28 §2.1 C 类「HF 7-16 8 步攻击链完整披露」已确认 GPT-5.6 Sol 在降级护栏环境下被击破——Claude Opus 5 「最难 prompt injection」正好是 GPT-5.6 Sol 端的反向案例
- R28 §2.14 AI Security 已含 OWASP 2025 LLM Top 10 + R28 ASI01-ASI10 20 漏洞 2026——Claude Opus 5 「最难 prompt injection」直接对应 OWASP LLM01 Prompt Injection + ASI01 Agent Goal Hijack 漏洞缓解实证
- R26 八项跟进 #3「Anthropic Petri 14 模型 baseline 复现」延至 R28 §7.2 P0 待核——Opus 5 系统卡数据点可作为 baseline 复现的官方锚点
- 与 R28 §3.1 反方共识 #53(OS 级软件防御 vs 硬件可信根)的关系:Opus 5 prompt injection 鲁棒性 = 模型层(OS 层之上)的鲁棒性,是矛盾 #53 的对立面:不需要走到硬件可信根,仅靠训练/对齐就可缓解 prompt injection——矛盾 #53 的新维度深化
- 建议归入:
- §2.103 新立节「Anthropic Claude Opus 5 正式发布 + 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index + Economic Futures Research Fund = frontier lab「模型公司」本体节奏 7-24 evening 立标首位」(stephen 1245 §2.4 已建议 + ai-industry §3.1 已建议)
- §3.1 反方共识位新增 #54(候选)「prompt injection 鲁棒性成为 frontier lab 模型本体卖点」(与现有 53 处骨架图协调定位)
- §3.2 矛盾位新增 #54(候选)「Opus 5 「最难 prompt injection」是 GPT-5.6 Sol 端降级护栏环境下被击破的反向案例」
- §7.2 R28 待核验跟进项 #2 升级「OpenAI × HF 联合处置具体技术细节」新增「Claude Opus 5 prompt injection 鲁棒性作为 frontier model head-to-head 对照锚点」
- 建议归属 R29 E1 任务:§2.103 新立节 + §3.1 反方共识位 #54 + §3.2 矛盾位 #54 + §7.2 P0 #2 升级
- 可信度:🟢 高(Anthropic 官方 system card + Boris Cherny 引语 + stephen 0910 + stephen 1003 + stephen 1005 + stephen 1245 + jay 1000 + simonwillison 7+ 源印证)
增量 2 · 🟡 P1 · Isolation as a First-Class Principle for LLM-Agent System Safety (arXiv:2607.12406) = R27/R28 OS 级硬件可信根方向的学术综述支柱 + 「5 边界」一阶原则
- 来源:
flyp/2026-07-25-1036-sat-weekly-deep-read-isolation-openforge-acm.md§A(flyp 周六精读论文 A · ⭐⭐⭐⭐⭐ · 4.0/5 整体可信度)flyp/2026-07-25-1036-...§A.3 贡献 A-1(5 边界清晰分类)+ §A.4 证伪线 L1-L5(5 条证伪线)+ §A.5 复现档位 R1-R4stephen/2026-07-25-1245-stephen-coordination-check-noon.md§1.3 第 26 项(列入 3 篇方法论级)- 要点:
- 核心命题:「为什么看起来不同的失败(prompt injection、tool misuse、memory poisoning、agent hijacking)都源于同一结构性原因」——首次以边界为中心的统一分类
- 5 个边界:① user-agent(prompt injection / jailbreak / persistent compromise)② agent-tool(tool misuse / MCP 安全 / metadata-driven steering)③ agent-execution(cyber / browser / GUI / 代码解释器)④ agent-agent(多 agent 通信与协调的失效传播)⑤ system-environment(agent 系统与外部内容/状态交互的整体失效)
- 跨边界失效传播分析:边界之间不是独立的;user-agent 失效可借 tool output 传播到 agent-tool,再到 agent-execution 形成 misuse amplification
- isolation-by-construction 研究议程 = 4 原则(trust separation / scoped capabilities / traceability / recovery)+ 与 CaMeL / AgentVisor / Parallax / Managed Agents 等具体工作对齐
- 作者团队:HKUST · NYU · SWUPL · MODEIO.AI(Huihao Jing 第一作者 + Yangqiu Song 等)
- flyp 反方审稿 5 条证伪线:L1 缺 isolation strength metric · L2 5 边界相互作用被简化 · L3 isolation-by-construction 与现有防御体系可结合性未充分评估 · L4 缺少跨语言/跨模态攻击统一视角 · L5 「首次失效边界」归因存在循环性
- 与 risk.md R28 现有脉络的关系:
- R27 §2.18 元层反身性 #18「OS 级硬件可信根方向」——Isolation 论文是这条线学术综述支柱:从硬件根(Intel SGX / AMD SEV / NVIDIA H100 CC)扩展到5 个软件层边界
- R28 §2.1 A 类「SafeKV + PrefixWall 多租户 LLM Serving 内部攻击面」——直接对应 5 边界中的「agent-execution 边界」(KV cache 是 execution 内部状态)
- R28 §2.14 AI Security 已含 OWASP 2025 LLM Top 10 + R28 ASI01-ASI10——Isolation 5 边界与 ASI01 Agent Goal Hijack / ASI02 Tool Misuse & Exploitation / ASI05 Unexpected Code Execution / ASI07 Insecure Inter-Agent Communication 一一对应:
- ASI01 = user-agent 边界
- ASI02 = agent-tool 边界
- ASI05 = agent-execution 边界
- ASI07 = agent-agent 边界
- ASI09 Human-Agent Trust Exploitation 与 system-environment 边界部分对应
- R28 §3.1 反方共识位 #53「OS 级软件防御结构性极限 vs OS 级硬件可信根路径工程化之争」——Isolation 5 边界提供新的子结构:「OS 层之上 + 模型层之下」的 5 个软件边界是矛盾 #53 的拓展维度
- 建议归入:
- §2.18 元层反身性 #20 新增(R27 #18 + R28 #19 + R29 #20)「Isolation 5 边界 = OS 级软件层 + 5 个边界 = OS 级硬件可信根方向延伸」
- §2.14 AI Security 升级 ASI + Isolation 5 边界一一对应表(立柱式参考)
- §2.x 新建立标节:「Isolation as a First-Class Principle arXiv:2607.12406 = R27/R28 OS 级硬件可信根方向的学术综述支柱」(首次出现「为什么看起来不同的失败都源于同一结构性原因」的元层整理)
- §3.1 反方共识位新增 #55(候选)「5 边界 = agent 安全元层结构化分类的官方锚点」
- §7.1 立标新增 arXiv:2607.12406
- §3.2 矛盾位新增 #55(候选)「Isolation 5 边界提供新维度但缺 isolation strength metric = 5 边界可作为定性框架但不可量化对比」(L1 证伪线升级)
- 建议归属 R29 E1 任务:§2.14 升级 + §2.18 #20 新增 + §3.1 反方共识位 #55 + §3.2 矛盾位 #55 + §7.1 立 arXiv:2607.12406
- 可信度:🟢 高(arXiv 7-14 v1 + flyp 周六精读 4.0/5 + flyp 5 条证伪线 + stephen 1245 §1.3 + R28 §2.18 元层反身性延伸)
增量 3 · 🟢 P2 · Agentic Context Management arXiv:2607.21503 + OpenForgeRL arXiv:2607.21557 三联立标 = R28 §2.1 D 类(PRO-LONG 范式逆袭)的双重佐证 + 训练基础设施补充
- 来源:
flyp/2026-07-25-1036-sat-weekly-deep-read-isolation-openforge-acm.md§C(论文 C · Agentic Context Management · paper_card 564)+ §B(论文 B · OpenForgeRL · paper_card 585 已立)tom/_candidates/2026-07-25-agent-rag-longcontext-candidates.json(tom 7-25 0840 radar 7-25 顶部条目 + paper_card 564 已固化)tom/2026-07-25-rag-e1prep.md§1.5(tom 已固化 Agentic Context Management = context 管理主线)paper_cards/564-2607-21503.md(已建卡 · 主分类 agent · 形态 method)paper_cards/585-2607-21557.md(已建卡 · 主分类 evaluation · 副分类 agent)stephen/2026-07-25-1245-stephen-coordination-check-noon.md§1.3 第 26 项 + §1.4stephen/2026-07-25-ai-industry-e1prep.md§1.5 「Agentic Context Management arXiv:2607.21503 + Boris Cherny 评论 + 立标化立标」- 要点:
- Agentic Context Management arXiv:2607.21503(Gaurav Dadhich, Maximem · paper_card 564 已立):
- 核心命题:生产 agent 失败往往不是推理能力不足,而是无法管理推理上下文:会话历史、超长 prompt、庞大工具定义、不断膨胀的工具输出 → agent 在自身累积的历史中溺亡
- 5 primitives:architecting / ingesting / scoping / anticipating / compacting
- 「不设 memory = 不存在 memory 攻击面」范式:从「存储与检索」问题重新框定为「生命周期」问题 = R28 §2.1 D 类 PRO-LONG 范式逆袭的双重佐证
- 可证伪的成本-精度前沿:给出 memory 成本 vs context 精度的 trade-off 曲线
- 经验事实:会话内 + 跨会话召回缺失是真实生产失败的最大根因之一
- OpenForgeRL arXiv:2607.21557(Xiao Yu / Baolin Peng et al. Columbia · Dartmouth · MSR · paper_card 585 已立):
- 核心命题:现代 agent 依赖复杂 inference harness(Claude Code、Codex、OpenClaw),开源 SFT/RL 栈无法原生表达 → train-deploy mismatch
- 轻量 proxy 桥接 harness 与 RL trainer:拦截 harness 的模型调用 → 重构为 (sᴴ, a, r) trajectory → 输出给 veRL 等标准 RL codebase
- Kubernetes orchestrator 弹性 rollout:rollout 容器跑在云上(Azure),按需扩缩
- wall-clock timeout 替代 turn limit(Codex 不暴露 turn limit) + 错误回滚与 partial rollout 处理(按 DAPO 策略丢弃整条 trajectory)
- 数据合成 pipeline:LLM 生成候选指令 → 过滤低质/重复 → 构造可执行环境 + verifier → rollout 验证 → 缺陷修复循环
- flyp 直接相关性:OpenClaw 是显式目标 harness;proxy 思路可让 flyp 直接训练 OpenClaw 自定义策略
- flyp 风险主线间接相关性:OpenForgeRL 训练出更强 harness-native agent → agent 攻击面扩大 → 与 Isolation 论文 A 的 5 边界理论对立互补
- 与 risk.md R28 现有脉络的关系:
- R28 §2.1 D 类「PRO-LONG arXiv:2607.20064v2 范式逆袭立标」——Agentic Context Management arXiv:2607.21503 是同主线延伸:PRO-LONG 主张「不设 memory = 不存在 memory 攻击面」,Agentic Context Management 把 memory 重新框定为生命周期(「管理 memory」比「删除 memory」更进一步)
- R28 §2.18 元层反身性 #19「多租户 LLM Serving 内部攻击面」——OpenForgeRL 训练出更强 harness-native agent → agent 攻击面与 Isolation 5 边界之间形成新的反身性张力:训练基础设施越强 → 边界失效传播越快
- R28 §7.2 P0 #1「OpenAI × HF 联合处置具体技术细节」沿续 + ⚠️ P0 #3「Anthropic Petri 14 模型 4 类失败模式可复现性」——OpenForgeRL proxy 桥接是 Anthropic Petri 14 模型 baseline 复现的工程化路径:研究者可通过 OpenForgeRL 训练 harness-native agent 自行复现 Anthropic Petri 4 类失败模式
- 建议归入:
- §2.1 D 类升级 PRO-LONG 范式逆袭 + Agentic Context Management 范式逆袭 = 「不设 memory」+「管理 memory」双线并行 + OpenForgeRL 训练基础设施补充
- §7.1 立 arXiv:2607.21503 + arXiv:2607.21557(paper_card 564 + 585 已存在)
- §3.1 反方共识位新增 #56(候选)「PRO-LONG 不设 memory + Agentic Context Management 管理 memory = R27 Self-State Attacks 残余攻击面的双解药」
- 建议归属 R29 E1 任务:§2.1 D 类升级 + §7.1 立新增 + §3.1 反方共识位 #56
- 可信度:🟢 高(2 篇 arXiv v1 已发表 + 2 张 paper_card 已建卡 + flyp 周六精读 4.0/5 + tom 7-25 radar + stephen 7-25 1245 + stephen ai-industry §1.5 = 6+ 源印证)
2. 结构性信号 / 缺口确认 / 趋势判断
2.1 R28 已固化骨架之上叠加 7-25 新资料的结构性信号
- 核心结论:Claude Opus 5 + Isolation arXiv:2607.12406 + Agentic Context Management/OpenForgeRL arXiv:2607.21503/21557 = R28 立标之后的「第 5 立标候选 + 学术综述支柱 + 训练基础设施补充」,3 条新信号全部叠加在 R28 已固化的骨架上,没有真正从零草拟的新方向
- 结构判断的依据:
- R28 §2.1 A 类 SafeKV+PrefixWall 已立「多租户 LLM Serving 内部攻击面」
- R28 §2.1 B 类 OWASP ASI01-ASI10 已立「agentic 安全分类法」
- R28 §2.1 C 类 HF 7-16 8 步攻击链完整披露
- R28 §2.1 D 类 PRO-LONG arXiv:2607.20064v2 + Long-Horizon-Terminal-Bench 已立
- R28 已立 4 项 = 4 个完整立标,7-25 下午 Claude Opus 5 + Isolation + ACM/OFR = 「第 5 立标候选 + 学术综述支柱 + 训练基础设施补充」
- R29 建议行动:
- §2.103 新立节 Claude Opus 5(P0 立标)
- §2.x 新建学术综述节 Isolation arXiv:2607.12406(P1 学术支柱)
- §2.1 D 类升级(PRO-LONG + ACM + OFR 三联立标深化)
- 不是追求新立标数量,而是「给 R28 已立标提供学术支点 + frontier lab 数据点 + 训练基础设施补充」
2.2 沿续 + 强化(继承 R28 状态,无新增量更新)
| R28 八项待核验跟进 # | 主题 | 7-25 沿续状态 | 备注 |
|---|---|---|---|
| #1 | Self-State Attacks 完整 PDF + 作者顺序 + Schmidhuber 分量 | ✅ 已闭合(R27 cron 完成) | 不再是 R29 任务 |
| #2 | OpenAI × HF 联合处置「模型评估安全事件」具体技术细节 | 🟡 R28 主体完成 → 本场新增「Claude Opus 5 prompt injection 鲁棒性作为 frontier model head-to-head 对照锚点」 | 升 P0 #2 → 🟢 含 Claude Opus 5 anchor |
| #3 | Anthropic Agentic Misalignment Petri 审计 14 模型 4 类失败模式可复现性 | ⚠️ 沿续待核 → 本场无新证据 | 沿 R28 §7.2 P0 状态 |
| #4 | Gemini 3.5 Flash Cyber 白皮书 | ⚠️ 沿续待核 → 本场无新证据 | 沿 R28 §7.2 P0 状态 |
| #5 | Anthropic Global Workspace 论文是否已 arXiv 公开 | ⚠️ 沿续待核 | 沿 R28 §7.2 P0 状态 |
| #6 | Manager Coercion Benchmark 9-rung ladder 量表效度 + 跨模型可比性 | ⚠️ 沿续待核 | 沿 R28 §7.2 P1 状态 |
| #7 | Contrastive SDF 正式 arXiv 论文状态 | ⚠️ 沿续待核 | 沿 R28 §7.2 P1 状态 |
| #8 | Gradient Flow Nathan Lambert 立场 2.0 | ⚠️ 沿续待核 | 沿 R28 §7.2 P1 状态 |
| #9 | OS 级硬件可信根方向工程化(Intel SGX / AMD SEV / NVIDIA H100 CC)实证化 | ⚠️ 沿续待核 → 本场 Isolation arXiv:2607.12406 = 第 9 阶学术综述支柱 | 升 P0 #9 → 含 Isolation 学术支柱 |
| #10 | Self-State Attacks 23-cell matrix × 43 concrete operations 商业 Agent 适用性 | ⚠️ 沿续待核 → 本场无新证据 | 沿 R28 §7.2 P0 状态 |
R28 §7.2 新增待核 #9-#10 + R28 §7.2 沿续待核 #2-#10 全部沿续到 R29 §7.2 状态(R28 cron 新增 #9-#10 的待核已继承).
R28 §7.2 新增 R29 待核: | R29 新待核 # | 主题 | 出处 | 优先级 | |---|---|---|---| | #11 | Claude Opus 5 「最难 prompt injection」具体 PI evals + 红队指标(误报率 / 漏报率 / 跨域泛化) | stephen 0910 + 1003 + 1005 + jay 1000 + simonwillison 7-25 | P0 | | #12 | Claude Opus 5 vs Fable 5 关系(替代 / 平行 / 上下位)+ vs GPT-5.6 Sol head-to-head prompt injection 测试 | stephen ai-industry §2.2 + Anthropic 官网 | P0 | | #13 | Isolation arXiv:2607.12406 5 边界可量化指标(isolation strength metric / cross-boundary propagation step count / scoped capability entropy) | flyp 7-25 §A.4 L1 证伪线 | P1 | | #14 | Agentic Context Management arXiv:2607.21503 5 primitives(architecting/ingesting/scoping/anticipating/compacting)实证化 + 与 R28 PRO-LONG 对照基准 | tom 7-25 + flyp 7-25 §C | P1 | | #15 | OpenForgeRL arXiv:2607.21557 proxy 桥接 harness 在 Claude Code/OpenClaw/Codex head-to-head 数字 | flyp 7-25 §B.6 + jay 1140 x-tech-radar #2 | P1 |
净 R29 任务量 = 5 项沿续待核验跟进(R28 #2-#10)+ 5 项 R29 新待核(#11-#15)+ 3 项新立/反方共识位新增 + 1 项学术综述支柱。
2.3 spark 7-25 E1 节奏全员恢复(流程性信号,与 7-24 沿续)
- stephen 1245 §1.3 关键事实:「spark E1 节奏连续恢复第 2 日 = 7-22 evening 缺位 → 7-23 仍缺位 → 7-24 noon 仍缺位 → 7-24 evening 13:38/18:51 双 E1 完整恢复 = 第 1 日反转为第 2 日连续恢复」
- 影响范围:本场 risk 主线由 5 实例全员在岗(5 实例 51 份产出)+ 7-25 截至 12:45 累计产出分布:stephen 13 + jay 19 + tom 6 + flyp 8 + spark 5
- R29 建议:今晚 risk 活文档接力同时关注 spark 7-25 E1 是否完整恢复——spark agent-e1prep 7-25 13:36 + llm-infra-e1prep(R29 候选)应配套
3. 值得警惕的矛盾 / 待核实说法
按可信度由高到低排列:
3.1 Isolation arXiv:2607.12406 缺 isolation strength metric = 5 边界可作为定性框架但不可量化对比(待核实 + 矛盾并存)
- 矛盾点:flyp 7-25 §A.4 L1 证伪线指出「作者把 isolation 提升为一阶原则,但全文未给出可度量的 isolation strength(如每条边界上的「信息泄露率」、「控制权渗透深度」、「跨边界失效传播步数」)——风险:原则是定性的,工程实现时「scoped capability」和「unscoped capability」难以客观区分」
- 风险:5 边界可作为「定性框架」用于学术综述,但不能作为「工程化 defense 强度评估」——若 R29 §2.18 反身性 #20 立 Isolation = OS 级软件层 + 5 边界 = OS 级硬件可信根方向延伸,没有 metric 就无法判断「Isolation 5 边界量化提升 vs Intel SGX/AMD SEV/NVIDIA H100 CC 硬件根提升」哪个更有效
- 核实路径:读 arXiv:2607.12406 完整 PDF §6/§7 evaluation + HKUST 公布的 GitHub repo(如果开放) + 跟踪 NeurIPS 2026 / ICML 2026 后续工作
- 预消化建议:⚠️ P1 待核——R29 cron §7.2 推进时建议直接读 PDF(写进 §3.2 矛盾位 #55 候选)
3.2 Claude Opus 5 vs Fable 5 关系(替代 / 平行 / 上下位)+ vs GPT-5.6 Sol head-to-head prompt injection 测试(待核实)
- 矛盾点:stephen ai-industry §2.2 立标矛盾「Claude Opus 5 与 Fable 5 关系」vs「Claude Opus 5 是 Fable 5 替代还是平行产品」——Anthropic 系统卡未明确说明
- stephen §2.2 立标矛盾出处:stephen 7-25 1003-news-anthropic-news 5 条 + jay 7-25 1000-rss-simon-willison「正式发布 Claude Opus 5」+ 「Boris Cherny Opus 5 is our least prompt injectable model yet」
- stephen §2.2 立标矛盾待核实:Anthropic 模型矩阵(Claude Opus 5 vs Claude Sonnet vs Claude Haiku vs Claude Fable 5 + Project Pilot 关系)官方文档
- 风险:Boris Cherny 评论「Opus 5 难被 prompt inject」若仅指 Opus 5 而非 Fable 5,即暗示 Opus 5 与 Fable 5 不是同一种 alignment 策略——这意味着「prompt injection 鲁棒性是 Opus 5 独有卖点」而非「frontier lab 通用能力」,反方共识 #54「prompt injection 鲁棒性成为 frontier lab 模型本体卖点」是否过早立标取决于「Claude Opus 5 vs Fable 5 head-to-head prompt injection 测试」
- 核实路径:Anthropic 官网模型对比页 + Anthropic model card 7-24/7-25 更新 + Substack Anthropic 跟踪报道 + simonwillison 后续报道
- 预消化建议:⚠️ P0 待核——R29 cron §3.2 矛盾位 #54 推进时建议直接读 PDF
3.3 RRB / Intra-Query Attention Dilution = AI 安全「第 10 阶」立标候选(stephen ai-industry §2.82 提案,本场未被知识库验证)
- 矛盾点:stephen ai-industry §2.82 提出「结构噪声 + 自身 CoT 污染 = LLM 鲁棒性崩塌新维度 = AI 安全第 10 阶(继 Self-State Attacks 第 9 阶之后)」
- 风险:此为 stephen 单边提案,未被 flyp / spark / jay / tom 任何其他实例印证,且与 R28 §3.1 反方共识位 #53「OS 级软件防御结构性极限 vs OS 级硬件可信根路径工程化」矛盾——「结构噪声」属于 LLM 模型层而非 OS 层,新维度提案的「第 10 阶」是否合理需要 1 周以上跟踪验证
- 核实路径:flyp 7-25 0950-RRB-intra-query-attention-dilution-critical-read.md 全文 + Arxiv:2604.08571v3 PDF + 学界跟踪
- 预消化建议:🟢 P3 跟踪——不立标、不升级,在 R29 §5.1 趋势预判里保留「结构噪声维度跟踪位」即可
4. 可引用的 arXiv 号列表(实操清单)
按本场 risk 主题相关性排序,每条注明今日角色:
| arXiv | 标题 | 今日角色 | 风险主线整合建议 |
|---|---|---|---|
| arXiv:2607.12406 | Isolation as a First-Class Principle for LLM-Agent System Safety (Jing et al. HKUST/NYU/SWUPL/MODEIO) | 增量 2 学术综述支柱 | §2.18 #20 反身性 + §2.14 升级 + §3.1 #55 + §3.2 #55 + §7.1 新增 |
| arXiv:2607.21503 | Agentic Context Management (Gaurav Dadhich, Maximem) | 增量 3 PRO-LONG 范式逆袭双重佐证 | §2.1 D 类升级 + §7.1 立新增(paper_card 564 已立) |
| arXiv:2607.21557 | OpenForgeRL (Xiao Yu/Baolin Peng et al. Columbia/Dartmouth/MSR) | 增量 3 训练基础设施补充 | §2.1 D 类升级 + §7.1 立新增(paper_card 585 已立) |
| arXiv:2508.08438v2 | SafeKV(选择性 KV cache 共享的隐私保护) | R28 沿续 | §2.14 + §2.12 已 R28 立标 |
| arXiv:2603.10726v2 | PrefixWall(APC 侧信道缓解) | R28 沿续 | §2.14 + §2.12 已 R28 立标 |
| arXiv:2607.17986 | Self-State Attacks on Self-Hosted AI Agents (R27) | R27 已立标 / 沿续 | §2.1 R27 立标(无需 R29 重提) |
| arXiv:2607.20064v2 | PRO-LONG: Programmatic Memory (R28) | R28 沿续 | §2.1 D 类 + §3.1 #54 候选已 R28 立 |
| arXiv:2607.08964v2 | Long-Horizon-Terminal-Bench | R28 沿续 | §3.1 反方共识候选 + §4 开放问题候选 R28 沿续 |
新增 3 个 arXiv ID(本场 risk 主线核心)= arXiv:2607.12406 + arXiv:2607.21503 + arXiv:2607.21557 = 3 个 R29 新 arXiv。 R28 已立 4 个 arXiv 沿续 = arXiv:2508.08438v2 + arXiv:2603.10726v2 + arXiv:2607.17986 + arXiv:2607.20064v2 + arXiv:2607.08964v2 = 5 个 R28 已立沿续。 合计风险主线本场涉及 8 个 arXiv ID(3 新 + 5 沿)。
R29 §7.1 立标更新清单: - 新立:arXiv:2607.12406 (Isolation) + arXiv:2607.21503 (ACM, paper_card 564 已立) + arXiv:2607.21557 (OpenForgeRL, paper_card 585 已立) - R28 沿续:arXiv:2508.08438v2 (SafeKV) + arXiv:2603.10726v2 (PrefixWall) + arXiv:2607.17986 (Self-State) + arXiv:2607.20064v2 (PRO-LONG) + arXiv:2607.08964v2 (LH-Terminal-Bench) - R27 沿续:arXiv:2607.15657 (Lucid) + arXiv:2607.15434 (Manager Coercion)
沿续待核(R28 §7.2 沿续):Petri · Gemini Cyber · Global Workspace · Manager Coercion · Contrastive SDF · Nathan Lambert 2.0 · OS 级硬件可信根方向工程化 · Self-State 23-cell × 43 ops
5. 与 risk.md R28 现有脉络的总体关系图
R28 五十六维并进结构 (R12-R28 累计)
├── L0 元层 19 轨并进 (R28 #19 多租户 LLM Serving 内部攻击面)
│ ├── #1-#17 (R12-R26 沿续)
│ ├── #18 OS 级硬件可信根方向 (R27 新增) ← 本场「Isolation arXiv:2607.12406」学术综述支柱
│ └── #19 多租户 LLM Serving 内部攻击面 (R28 新增)
├── L0' 元层+dev (AI dev stack 攻击面)
│ ├── OWASP 2025 LLM Top 10
│ ├── OWASP 2026 LLM01-LLM10 + ASI01-ASI10 (R28 新增) ← 本场「Isolation 5 边界」一一对应 ASI
│ └── pgvector / Orca / SGLang / Marimo CVE 沿续
├── L1 模型层 = 训练/权重/RL
│ └── 沿续 (rEra/RM-Bench/Anthropic Alignment/R26 Petri 沿续)
│ ← 本场「Claude Opus 5 prompt injection 鲁棒性」R29 升 P0 立标 #2.103 候选
├── L2 接口层 = prompt/输出/tool call
│ └── 沿续 (Context-Fractured / MCPTox / Opus 4.6 17.8% / Claude Code v2.1.206)
│ ← 本场「Opus 5 「最难 prompt injection」+ Boris Cherny 评论」R29 立 §3.1 #54 反方共识
└── L3 系统层 = agent runtime/长期记忆/runtime+training-time 治理
├── R27 Self-State Attacks + OS 级硬件可信根方向
├── R28 SafeKV + PrefixWall + OWASP ASI + HF 7-16 + PRO-LONG
├── Manager Coercion + 8 项 R26 待核验
├── **R29 新增(本场)**:
├── arXiv:2607.12406 Isolation 5 边界 (HKUST/NYU/SWUPL/MODEIO) ← 学术综述支柱 (R29 §2.18 #20)
├── Claude Opus 5 系统卡 §73 「最难 prompt injection」+ Boris Cherny 评论 ← R29 §2.103 P0 立标
├── arXiv:2607.21503 Agentic Context Management (paper_card 564 已立) ← R29 §2.1 D 类升级
└── arXiv:2607.21557 OpenForgeRL (paper_card 585 已立) ← R29 §2.1 D 类升级 + 训练基础设施补充
R29 E1 棒最大风险主线任务(按优先级排序):
1. §2.103 新立节 Claude Opus 5 (P0 立标)
2. §2.x 新建学术综述节 Isolation arXiv:2607.12406 (P1 学术支柱) + §2.18 反身性 #20
3. §2.1 D 类升级 (PRO-LONG + ACM + OFR 三联)
4. §3.1 反方共识位新增 #54 「prompt injection 鲁棒性成为 frontier lab 模型本体卖点」
5. §3.2 矛盾位新增 #54 「Opus 5 「最难 prompt injection」是 GPT-5.6 Sol 降级护栏环境下被击破的反向案例」
6. §3.1 反方共识位新增 #55 「5 边界 = agent 安全元层结构化分类的官方锚点」
7. §3.2 矛盾位新增 #55 「Isolation 5 边界可定性不可量化对比」 (L1 证伪线升级)
8. §7.2 R28 修订记录沿续 5 项 + 本场推进 5 项状态更新(#2 升 P0 + #9 升 P0)
6. R29 E1 任务节奏建议(给整合者的实操清单)
6.1 必须写入(直接 edit risk.md)
- §2.103 新立节「Anthropic Claude Opus 5 正式发布 + 系统卡 + Boris Cherny 评论 + Project Pilot + Economic Index + Economic Futures Research Fund = frontier lab「模型公司」本体节奏 7-24 evening 立标首位 + 「评测 → 系统卡 → 评论层 → 红队」四栖验证链条第 1 例」(stephen 1245 §2.4 + ai-industry §3.1 已建议)
- §2.x 新建学术综述节「Isolation as a First-Class Principle arXiv:2607.12406 = R27/R28 OS 级硬件可信根方向的学术综述支柱 + 「5 边界」一阶原则」(flyp 7-25 §A · 4.0/5 整体可信度)
- §2.1 D 类升级 PRO-LONG arXiv:2607.20064v2 + Agentic Context Management arXiv:2607.21503 + OpenForgeRL arXiv:2607.21557 = 「不设 memory」+「管理 memory」+ 训练基础设施三联
- §3.1 反方共识位新增 #54「prompt injection 鲁棒性成为 frontier lab 模型本体卖点」(来自 Claude Opus 5 Boris Cherny 评论)
- §7.2 R28 修订记录沿续 5 项 + 本场推进 5 项状态更新(#2 升 P0 + #9 升 P0)
6.2 候选写入(视 R29 时间预算而定)
- §2.18 元层反身性 #20 新增「Isolation 5 边界 = OS 级软件层 + 5 个边界 = OS 级硬件可信根方向延伸」
- §2.14 AI Security 升级 OWASP ASI + Isolation 5 边界一一对应表(立柱式参考)
- §3.2 矛盾位新增 #54「Opus 5「最难 prompt injection」是 GPT-5.6 Sol 降级护栏环境下被击破的反向案例」
- §3.1 反方共识位新增 #55「5 边界 = agent 安全元层结构化分类的官方锚点」
- §3.2 矛盾位新增 #55「Isolation 5 边界可定性不可量化对比」(L1 证伪线升级)
- §3.1 反方共识位新增 #56「PRO-LONG 不设 memory + Agentic Context Management 管理 memory = R27 Self-State Attacks 残余攻击面的双解药」
- §7.1 立标新增:arXiv:2607.12406 + arXiv:2607.21503 (paper_card 564 已立) + arXiv:2607.21557 (paper_card 585 已立)
6.3 不写(明确边界)
- ❌ 不新立 §2.x 全新的 risk 主线方向(避免抢 R28 立标节奏)
- ❌ 不抢 spark / stephen / jay / flyp 各自的主立标节奏(沿续即可)
- ❌ 不立标 RRB / Intra-Query Attention Dilution = AI 安全第 10 阶(stephen 单边提案,未验证——只跟踪不立标)
- ❌ 不写 Claude Opus 5 系统卡完整内容(这是产品文档——活文档只立标不抄表,完整内容见 Anthropic 官网)
- ❌ 不写 Isolation 论文 A 完整 5 边界定义表(这是 survey 原文——活文档只立标不抄表,完整内容见 arXiv PDF)
- ❌ 不写 Boris Cherny 评论原文(这是评论原文——活文档只引用,不复制)
- ❌ 不抢 spark / stephen / jay / flyp 各自的主立标节奏(沿续即可)
6.4 与其他接力的衔接
- stephen:risk.md R29 E1 同步给 stephen news-radar + ai-industry-e1prep,让 §2.103 Claude Opus 5 与 §2.78 frontier lab 7-24 早场 + §2.94 Claude Fable 5 7-22 evening 立标形成「Anthropic 7-22 ~ 7-25 三连立标」(Fable 5 → Opus 5 → ?)
- jay:risk.md R29 E1 §2.103 Claude Opus 5 立标后,提示 jay engineering-e1prep 7-25 morning 把 v33 §2.87(t) OWASP ASI 2026 + Opus 5 prompt injection 鲁棒性 同步(v33 §2.87(t) 与 R28 §2.14 已有重叠 = 需要协调)
- flyp:§2.18 反身性 #20 Isolation 5 边界立标时,把 flyp multimodal-e1prep v32 的 §2.39.87-§2.39.92 立标节奏的「indirect 引用」部分同步到 risk.md(multimodal 主题页 flyP 安全主题页 当前为空,需新建 notes/safety/agent-system-safety-2026.md per flyp 7-25 §A 末段建议)
- tom:tom 7-25 0840 radar + 7-25 0853 rag-e1prep §1.5 已固化 Agentic Context Management arXiv:2607.21503 = R29 §2.1 D 类升级已有 tom 主线准备棒,无需 tom 介入
- spark:spark 7-25 E1 节奏连续恢复第 2 日——若 spark 7-25 evening 仍未发布 risk 主题 radar,建议在 risk.md §7.2 沿革摘要中保留「risk 主线 flyp 单边接续状态稳定」+ 「spark 7-25 radar 缺位」(仅做信息留痕,不抢 spark 协调棒)
7. 检查过的来源(不重复 read 库说明)
7.1 inbox/flyp/(本棒直接相关 + 近 2 天)
2026-07-25-1036-sat-weekly-deep-read-isolation-openforge-acm.md(flyp 周六精读 3 篇方法论级 · ⭐⭐⭐⭐⭐ · 增量 2 主源 + 增量 3 主源 A/B)2026-07-25-0950-RRB-intra-query-attention-dilution-critical-read.md(flyp E2 棒 multimodal — 与 risk 主线间接相关 / 不入 risk 节,但 §3.3 RRB 第 10 阶跟踪位)2026-07-25-0944-multimodal-e1prep.md(flyp E1 棒 multimodal 35KB — 不入 risk 节)2026-07-24-2250-cameron-agentic-world-models-critical-read.md(沿续参考 — multimodal agentic world 模型)2026-07-24-risk-e1prep.md(R28 沿续起点 — R28 完整 5 信号 + 5 项 R26/R27 待核验)2026-07-23-coding-agents-e1prep.md+2026-07-23-multimodal-e1prep.md(沿续参考)
7.2 inbox/jay/(近 2 天)
2026-07-25-1123-engineering-e1prep.md(19KB · 与 risk 主线间接相关 / 增量 5 「Compounding Error 85%^10=20%」与 risk §2.14 + §2.86 互补 — 但本场不入 risk 节,只间接引用)2026-07-25-1105-substack-agents-production-failure-a2a-cua.md(8KB · OWASP Top 10 2026 与 R28 §2.14 关联 + Agentic RAG vs CUA vs A2A 三模式与 R28 §2.13 关联 — 本场已 R28 立标,7-25 是二次落地)2026-07-25-1335-afternoon-substack-hf-inference-csdn-briefing.md(17KB · HF inference + SGLang/vLLM/TGI 对比 — 与 risk 主线间接相关 / 不入 risk 节)2026-07-25-1000-rss-simon-willison.md(3 评论含 Boris Cherny 引语 + 「正式发布 Claude Opus 5」— 增量 1 主源)2026-07-25-1000-rss-cool-papers.md+1001-rss-cool-papers-ir.md+1001-rss-lilian-weng.md(无 risk 主线增量)2026-07-25-1222-csdn-supplement-agentic-rag-mcp-finetune.md(无 risk 主线增量)2026-07-25-1055-jay-engineering-filter.md(无 risk 主线增量)2026-07-25-0937-ai-engineering-trending.md(无 risk 主线增量)
7.3 inbox/stephen/(近 2 天)
2026-07-25-1245-stephen-coordination-check-noon.md§2.4(§2.103 Claude Opus 5 立标候选最强 · 增量 1 主源 + 增量 2 + 增量 3 主源 A/B + spark E1 恢复标记)2026-07-25-1024-ai-industry-e1prep.md(36KB · 5 条 P0 立标 + 3 条 P1 旁证 · §1.1 Claude Opus 5 详细立标 + §3.1 评论层首次升格 · 增量 1 主源 + §3.3 RRB 第 10 阶单边提案出处)2026-07-25-0910-news-x-vip-radar.md(增量 1 印证 · Anthropic 7-14 价值观 3000+ 跨模型聚类 4 主轴)2026-07-25-1003-news-anthropic-news.md(增量 1 主源 · anthropic.com 7-24 evening 立标)2026-07-25-1005-news-yt-anthropic.md(增量 1 印证 · Claude Fable 5 + Project Glasswing)2026-07-25-1002-news-openai-news.md+1003-news-bens-bites.md+1003-news-tldr-ai.md+1003-news-hf-blog.md+1003-news-deepmind-news.md+1003-news-google-ai.md(无 risk 主线新增量)2026-07-24-2245-stephen-coordination-check-evening.md(沿续参考)
7.4 inbox/tom/(近 2 天)
2026-07-25-rag-e1prep.md(15KB · 5 条增量 + 6 件 paper_cards 抽查 + 活文档基线 v43 · §1.5 Agentic Context Management = R29 增量 3 主源 D)2026-07-25-0840-agent-rag-longcontext-radar.md(Agentic Context Management arXiv:2607.21503 已固化 paper_card 564)2026-07-25-0900-hf-daily-2026-07-25.md(沿续参考 — 无 risk 主线新增量)2026-07-25-0841-latest-candidates(Agentic Context Management arXiv:2607.21503 + OpenForgeRL arXiv:2607.21557 + Sample-Efficient arXiv:2607.21051 三件已固化)2026-07-24-rag-e1prep.md+2026-07-24T1440-agent-rag-longcontext-radar.md(沿续参考)tom/_candidates/2026-07-25-agent-rag-longcontext-candidates.json(paper_card 564 (ACM) + paper_card 585 (OpenForgeRL) 来源文件)
7.5 inbox/spark/(近 2 天)
2026-07-25-1001-rss-gradient-flow.md(无 risk 主线新增量 — 主线为 RL/资本/中国出口管制)2026-07-25-1002-rss-chip-huyen.md+1004-rss-yt-3blue1brown.md(无 risk 主线新增量)2026-07-25-1336-agent-e1prep.md(54KB · 沿续 — 主线为 agent harness + 安全工具调用)2026-07-24-rss-gradient-flow.md+2026-07-24-llm-infra-e1prep.md+2026-07-24-agent-e1prep.md(沿续参考)- ✅ spark 7-25 E1 节奏连续恢复第 2 日(13:36 agent-e1prep 已发布)
7.6 organized/paper_cards/(近 3 天新卡 — risk 主题过滤)
- 编号 ≥ 564 新卡 risk 主题命中数 = 3 张
- paper_card 564 (arXiv:2607.21503) Agentic Context Management (已立 · 主分类 agent · 形态 method)— 增量 3 PRO-LONG 双重佐证 · 已固化
- paper_card 585 (arXiv:2607.21557) OpenForgeRL (已立 · 主分类 evaluation · 副分类 agent)— 增量 3 训练基础设施补充 · 已固化
- paper_card 567 (arXiv:2607.21051) Sample-Efficient Learning from Agent Experience (agent / method)— 与 risk 主线间接相关
- 编号 ≥ 560 新卡 27 张(含 1414-2607-21557.md = paper_card 585 已确认)+ paper_card 567-585 = 19 张新卡(已确认覆盖 risk 主题 3 张)
- 已建 risk 主分类卡 13 张(055/099/152/160/265/297/302/304/403/421/430/450/454)— 与本场增量相关 =
099 (MCP Security)152 (DFC 数据安全)403 (PolicyShiftGuard)297 (Qwen-RobotManip Alignment)4 张作为风险主线历史索引可对照 - Isolation arXiv:2607.12406 现有 paper_card = 0(R29 必须新建 1 张**)
7.7 organized/knowledge/risk.md(活文档沿续起点)
risk.mdR28 五十七维并进结构 + 4 项 R28 新信号 + 10 项 R27 待核验跟进 + 19 轨反身性 + α 13 维 + 防御表 68 行- 本场 3 条增量(1 P0 + 1 P1 + 1 P2)全部叠加在 R28 已立 4 项新信号骨架上,无新立标从零草拟
- R29 接力最优节奏详见 §6
work-queue.md(2026-07-25 16:00 最新):无新增高价值待深度解读 + llm-infra 8 天未更新 1 项(与 risk 主线无关) + 50 张卡缺 TLDR(与 risk 主线无关) — risk 主线无 work-queue 紧急任务,节奏由本预消化接手
7.8 沿续检查范围(避免漏掉近 2 天任何相关)
- 50+ flyp R1-R28 inbox 草稿已沿续(确认 7-25 0944 multimodal-e1prep + 7-25 0950 RRB critical-read + 7-25 1036 周六精读 4 件 risk 主题相关)
- 100+ jay inbox 草稿已扫描(确认 7-24 ~ 7-25 三个风险主源已对齐:simon willison 1000 + Claude Opus 5 + Boris Cherny)
- 50+ stephen inbox 草稿已扫描(确认 stephen 0910 + 1003 + 1005 + 1245 + ai-industry 1024 是本场 risk 5 主源)
- 30+ tom inbox 草稿已扫描(确认 tom 7-25 0840 radar + 7-25 0853 rag-e1prep §1.5 是 R29 §2.1 D 类升级的主源)
- 50+ spark inbox 草稿已扫描(确认 spark 沿续 + 7-25 E1 节奏连续恢复已记录)
- 近 3 天 paper_cards 586 张已扫描 + 27 张 7-25 新卡已对照 + 13 张 risk 主分类已对照
8. 一句话总结
2026-07-25 risk 主线 E1 预消化 = 「R28 立标深耕期 + 第 5 项候选蓄势期」:3 条增量中 1 P0(Claude Opus 5「最难 prompt injection」+ Boris Cherny 评论 + 系统卡 §73 + PI evals + 红队验证 = frontier lab 第一次以 prompt injection 鲁棒性作为官方模型本体卖点)+ 1 P1(Isolation arXiv:2607.12406 = R27/R28 OS 级硬件可信根方向的学术综述支柱 + 「5 边界」一阶原则)+ 1 P2(Agentic Context Management arXiv:2607.21503 + OpenForgeRL arXiv:2607.21557 = PRO-LONG 范式逆袭双重佐证 + 训练基础设施补充),5 项沿续待核验跟进(R28 §7.2 #2 升 P0 含 Claude Opus 5 anchor + #9 升 P0 含 Isolation 学术支柱 + 3 项沿续 ⚠️ 状态)+ 2 项新待核(Isolation 量化指标 + Claude Opus 5 vs Fable 5 关系)。R29 棒 risk.md 最大任务 = 「§2.103 新立 Claude Opus 5 + §2.x 新建 Isolation 学术综述节 + §2.1 D 类升级三联立标 + §3.1 反方共识 #54 + #55 + #56」而不是追求新立标数量,今晚整合者不要做多立标,做深 R28 已立标 + 给 R28 提供学术支点 + frontier lab 数据点 + 训练基础设施补充。spark 7-25 E1 节奏连续恢复第 2 日已记录。
本期增量数:3 条增量(其中 P0 = 1 / P1 = 1 / P2 = 1)+ 3 项 R28 §7.2 待核验跟进(#2 升 P0 + #9 升 P0 + #3 沿续 P0)+ 5 项 R29 新待核(#11 P0 + #12 P0 + #13 P1 + #14 P1 + #15 P1)+ 2 项 R28 §7.2 新增 P0(Claude Opus 5 + Isolation 学术支柱) + 3 项待核(Claude Opus 5 PI evals + Fable 5 关系 + Isolation 量化指标)= 共 16 条结构化信号
涉及 arXiv 号:arXiv:2607.12406 (Isolation, R29 新立) + arXiv:2607.21503 (Agentic Context Management, paper_card 564 已立) + arXiv:2607.21557 (OpenForgeRL, paper_card 585 已立) + arXiv:2508.08438v2 (SafeKV, R28 沿续) + arXiv:2603.10726v2 (PrefixWall, R28 沿续) + arXiv:2607.17986 (Self-State Attacks, R27 沿续) + arXiv:2607.15657 (Lucid, R27 沿续) + arXiv:2607.15434 (Manager Coercion, R27 沿续) + arXiv:2607.20064v2 (PRO-LONG, R28) + arXiv:2607.08964v2 (Long-Horizon-Terminal-Bench, R28) = 共 10 个 arXiv 号
(其中 R29 新立 3 个(R29 §7.1 必须新建 paper_card 1 张 = arXiv:2607.12406 Isolation)+ R28/R27 沿续 7 个 = 真正风险主线新增立标 3 + 沿续 7 = 10 个核心 arXiv 号)
本预消化未做的边界:❌ 不写他人目录 / ❌ 不 git commit / ❌ 不 git push / ❌ 不输出密钥 / ❌ 不抢主线活文档节奏 / ❌ 不硬凑字数(如「无显著新增量时如实写明」——本场有 3 条增量 + 3 项沿续 + 5 项 R29 新待核 = 不算「无新增量」,故未走"无增量如实声明"路径)。
接续节奏建议给 R29 整合者: - 第一优先级:§2.103 新立 Claude Opus 5 (P0 立标,stephen 1245 §2.4 + ai-industry §3.1 已建议) - 第二优先级:§2.x 新建学术综述节 Isolation arXiv:2607.12406 (P1 学术支柱,flyp 7-25 §A · 4.0/5 整体可信度) - 第三优先级:§2.1 D 类升级三联立标 (PRO-LONG + ACM + OFR,R28 §2.1 D 类已立 PRO-LONG → R29 §2.1 D 类升级) - 第四优先级:§2.18 反身性 #20 新增「Isolation 5 边界 = OS 级软件层 + 5 个边界 = OS 级硬件可信根方向延伸」 - 第五优先级:§3.1 反方共识位新增 #54「prompt injection 鲁棒性成为 frontier lab 模型本体卖点」+ #55「5 边界 = agent 安全元层结构化分类的官方锚点」+ #56「PRO-LONG 不设 memory + ACM 管理 memory = R27 Self-State 残余攻击面的双解药」 - 第六优先级(候选):§3.2 矛盾位新增 #54「Opus 5 「最难 prompt injection」是 GPT-5.6 Sol 降级护栏环境下被击破的反向案例」+ #55「Isolation 5 边界可定性不可量化对比」(L1 证伪线升级) - 第七优先级:§7.2 R28 修订记录沿续 5 项 + 本场推进 5 项状态更新(#2 升 P0 含 Claude Opus 5 anchor + #9 升 P0 含 Isolation 学术支柱 + #3 沿续 P0 Petri 14 模型 + #4 沿续 P0 Gemini Cyber + #10 沿续 P0 Self-State 23-cell × 43 ops) - 不在本轮做的事:不要追求「7-25 evening 接力时把本场未核实的 Claude Opus 5 PI evals 数字 + Claude Opus 5 vs Fable 5 关系 + Isolation arXiv:2607.12406 isolation strength metric + Claude Opus 5 上下文窗口/训练规模/价格 4 项 P0 待核硬塞进 R29 活文档**——这四项写进 §7.2 R29 待核验沿续即可,不要因为有缺口就硬补