risk · E1 预消化简报(2026-08-14)
窗口:2026-08-13 16:30~2026-08-14 16:30 CST;为今晚 risk 活文档接力棒备料。本文只综合已有 inbox 与 paper_card,不补写未检查材料。 承接脉络:R44 risk.md 的「AI Agent 安全访问控制/评测环境安全攻击面」事件周(22~24 栖)、hardening 32~36 维,以及反方 #91/#93、反身性 #21。今日主线是风险从模型/API 延伸到持久化状态、开放红队环境与评测治理;本轮没有发现新的主 risk 主分类 arXiv 卡,主要是风险相关材料的交叉确认、方法学补强与新候选。
一、结论先行
本轮确认的显著增量有 6 条。最重要的不是单一新事故,而是三条风险链开始合流:
- 状态治理风险:Continuity Kernel 把 agent 状态的写入、授权、前态新鲜度和原子激活形式化,说明风险控制面正在从“提示词/模型”下沉到“状态与权限”。
- 行为评测盲点:OpenART 将红队从短、静态、一次性任务扩展到可持续演化、含共享状态的环境,补充 risk.md「评测环境作为安全攻击面」的实证候选。
- 评测信号治理:Mechanist 与“立标信号强度≠立标等级评估”双维度原则,提示 risk 主题内部也必须区分热度与证据质量,不能把 HF Daily 排名直接当成安全成熟度。
其中 OpenART、Continuity Kernel、Mechanist 均来自不同方向的 paper_card/精读记录;它们不应被硬塞进同一“安全模型”类目,而应分别放入 hardening、反方立基础和评测方法学邻近节。
二、今日最重要增量
增量 1|Continuity Kernel:agent 持久状态需要事务型控制平面
来源:inbox/flyp/2026-08-13-1550-Beyond-Memory-Transactional-Continuity-Kernel-critical-read.md,对应 arXiv:2608.11632;work-queue.md 将其列为 8-14 待成视频脚本候选;近三日 paper_card 抽查记录将其作为 agent 状态治理邻接条目。
要点:论文把长生命周期 agent 的“连续性”重新定义为未被破坏、被授权、被接受的 branch head 谱系。不可信组件只能在精确 predecessor head 或 typed absence 之上提议 typed changes;短激活事务内重新检查 ownership、pre-state authority、freshness、effect uniqueness,并只允许 Commit 原子推进状态。报告称在 bounded executable model 中枚举 2,808,230 个可达状态、5,526,474 次状态转换,零不变量违反。
与 risk.md 的关系:现有 §2.13 hardening 主要记录协议漏洞、缓解工具碎片化、deepfake 检测与 API 安全;这一工作把问题从“外部攻击/工具风险”推进到写入侧并发安全、越权状态激活、不可审计暴露。它也连接 §3.1 反方关于风险缓解工具生态碎片化,以及 §3.3 的 agent infra 状态治理缺口。建议归入 §2.13 hardening 候选的新“状态激活/权限控制”维度,并视活文档结构放入 §3.3 或新增 agent infra 小节。
证据边界:当前精读为摘要级审读,不是全文验证;2.8M/5.5M 是作者报告的模型结果,仍需确认 executable model 的工具栈、网络分区/重连 race 是否覆盖,以及真实 agent benchmark 是否存在。
增量 2|OpenART:持久环境与开放演化成为行为红队的新评测面
来源:paper_cards/928-2608-00677.md(主 agent、副 risk、benchmark);inbox/flyp/2026-08-13-risk-e1prep.md;inbox/stephen/2026-08-14-ai-industry-e1prep.md。HF Daily 8-14 记录 OpenART 184▲、排名第 1;8-13 时曾跌出 top 15,故这是跨日反弹,不是连续七日趋势。
要点:OpenART 关注 agent 在持久环境中运行,早期状态变化会影响远期决策,共享状态在长工作流中反复修改和重用。它以开放式环境演化扩展 agent red teaming,报告 10,000+ stateful scenarios、50+ task categories,试图覆盖传统短、静态 benchmark 看不到的累积风险。
与 risk.md 的关系:这是 R44 §2.13 hardening 第 37 维候选的自然补强:过去已有 Stealing Reasoning Traces(静态/API 协议漏洞)和评测环境安全隔离讨论;OpenART 提供“行为安全评测”的第三栖,并与 static protocol 风险形成互补。建议归入 §2.13 hardening 第 37 维候选;同时放入 §3.1 反方 #91 的“长期环境与评测盲点”候选,以及 §3.2 反身性 #21 的“评测环境会反过来塑造风险暴露”一节。
证据边界:论文卡已建但本次未读全文;10,000+ 与 50+ 是摘要/TLDR 口径,需核验场景是否公开、跨模型覆盖、攻击类别和可复现脚本。184▲ 是热度信号,不等于风险测量有效性;应等 7 日窗口再判断。
增量 3|“立标信号强度≠立标等级评估”在 risk 主题内完成一次方法学压力测试
来源:inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md、inbox/flyp/2026-08-14-0950-v48-candidate-audit-Latent-to-4D-vs-StateFlow-critical-read.md、inbox/flyp/2026-08-13-0950-BDH-CQ-CoinRAG-critical-read.md 及其 8-13 v2 覆盖版,以及 inbox/tom/2026-08-14-evaluation-e1prep.md。
要点:BDH-CQ(arXiv:2608.09888)HF Daily 8-12 为 #1/243▲,8-13 达 #1/553▲,8-14 跌出 top 15;flyp v2 critical-read 因单 benchmark、closed baseline 缺失、规模局限等论文体硬伤,撤销了此前基于热度的 ★★ 跳档,维持 ☆。该案例在 risk 语境中的价值是:热度峰值、快速衰减和风险证据质量必须分开记录。
与 risk.md 的关系:risk.md 的反方与 hardening 机制本来就要求区分事故报道、论文证据、评测与热度;本轮把“HF Daily 票数≠论文/风险质量”变成可执行的双维度原则。建议归入 §3.1 反方 #91 的评测信号治理,或新增 §3.2 的“元评测:热度与证据质量分离”小节;BDH-CQ 仅作方法学锚点,不应作为今天主 risk 事故增量。
证据边界:8-15 仍需复核票数;一次跌出 top 15 不能证明长期失效。BDH-CQ 的 paper body 结论来自批判记录,尚未在本文重新核验原文。
增量 4|Mechanist:可解释性驱动的“机理评测”作为风险旁证
来源:inbox/stephen/2026-08-14-ai-industry-e1prep.md;inbox/tom/2026-08-14-evaluation-e1prep.md;work-queue.md。arXiv:2608.12036,cs.LG,HF Daily 8-14 #7、75▲,尚未建 paper_card。
要点:Mechanist 将 AI 作为发现智能机理的科学仪器,借可解释性工具 reverse engineer 智能机制,而不是只测表面行为。现有记录将它视为 R45 evaluation §2.194 评测方法学 5 元组的第 6 元组候选,即“机理发现/可解释性评测”。
与 risk.md 的关系:它不是新的安全漏洞或风险主分类论文,但对风险论证有价值:行为评测说明“做了什么”,机理评测可辅助回答“为何产生风险”,可与风险 §2.13 的防御/评测链条形成纵深。建议归入 §3.3 反方立基础的评测方法学邻接位,或 risk 的“评测与可解释性缺口”小节,标为方法学邻接而非 hardening 净新增。
证据边界:当前材料只有摘要/二手简报,未见 paper_card、完整评测协议、基线或复现证据;75▲ 是弱到中等热度,不能支撑高立标等级。
增量 5|Can LLM Agents Stick to the Script?:叙事一致性是长期 agent 风险的邻接信号
来源:inbox/tom/2026-08-14-0900-hf-daily-2026-08-14.md;inbox/tom/2026-08-14-evaluation-e1prep.md。arXiv:2608.08160,HF Daily 8-14 #11、25▲,paper_card 未建。
要点:该工作聚焦交互式叙事中的长期一致性,涉及角色设定保持、情节逻辑、上下文记忆等。现有简报把它视为长程 agent 行为一致性 benchmark 的邻接项,而非已核验的 attack/safety benchmark。
与 risk.md 的关系:它补的是“长程行为一致性”这一评测对象,和 OpenART 的“持久状态累积风险”形成对照,但一致性失真不自动等于越权或攻击。建议归入 §3.3/反方立基础的评测对象分化,并在 §2.13 hardening 保持候选标记而非已确认风险。
证据边界:25▲ 很弱;指标、任务规模、模型覆盖及与 VibeLifeBench 的边界均需读原文或核验论文卡。
增量 6|VibeLifeBench:生活 agent 主动性与持久性的弱续立
来源:inbox/stephen/2026-08-14-ai-industry-e1prep.md;inbox/flyp/2026-08-13-risk-e1prep.md;arXiv:2608.10875。8-14 HF Daily #14、17▲,较 8-13 #15/15▲ 微增 2▲,paper_card 仍缺。
要点:它评测生活 agent 的主动性与持久性,补充“长程 agent 是否能持续保持目标/状态”维度。
与 risk.md 的关系:更适合放在 risk 的“长期行为/评测盲点”邻接,而非与 OpenART 合并成一个已经证实的安全漏洞类别。建议归入 §3.3 反方立基础 或 §2.13 的候选池,并明确“持久性/主动性≠安全合规”。
三、矛盾与待核实说法
- “10,000+ stateful scenarios”是否真实开放、可复现:OpenART 的 paper_card/TLDR 支持该数字,但未在本文读全文;需查项目页、数据发布和评测脚本。
- OpenART 184▲ 的热度解释:8-13 跌出 top 15、8-14 #1,说明瞬时反弹;不能写成持续上升或已完成七日验证。
- Continuity Kernel 的“零违反”外推边界:2.8M 状态与 5.5M 转换只说明特定 bounded model 内的不变量结果;网络分区、重连、工具并发、恢复过程可能不在模型内。
- Continuity Kernel 与传统 STM/事务数据库的差异:typed absence、授权 lineage、disposition 四态的原创性需要全文对比,不能仅凭摘要称其为全新事务机制。
- Mechanist 是方法论文还是评测协议论文:现有材料把它归入 evaluation 邻接,但尚无 paper_card;不能写成已建立的新 benchmark。
- BDH-CQ 双维度原则尚未完成时间验证:跌出 top 15 只是一天数据;需 8-15、7 日窗口继续观察,并复核 critical-read 所列论文硬伤。
- 叙事一致性与安全风险的边界:角色/情节漂移可能影响长期行为,但不能直接等同于 prompt injection、越权或信息泄露。
- 已检查 paper_cards 的时间/编号范围存在混杂:
paper_cards中部分文件为旧档补建,不能按文件修改时间误判为近三日新卡;与本轮直接对应的新卡仍主要是 926 Continuity Kernel、927 OpenART、929 Mechanist 等记录,Mechanist 的“未建卡”描述与抽查记录存在状态差异,需以实际文件是否存在为准。
四、建议今晚 risk 活文档的归并顺序
- §2.13 hardening:优先放入 OpenART(持久环境行为安全评测)与 Continuity Kernel(状态激活/权限控制);Stealing Reasoning Traces 作为既有第 34 维续立。
- §3.1 反方 #91:把“短、静态 benchmark 漏检累积风险”作为新案例;Continuity Kernel 作为“状态治理基础设施缺位”案例。
- §3.2 反身性 #21:记录“评测环境既是测量工具,也可能成为风险暴露面”;OpenART 与 Stealing Reasoning Traces 做静态协议/动态环境对位。
- §3.3 或新增 agent infra 小节:登记 Continuity Kernel、Mechanist、VibeLifeBench、Can LLM Agents Stick to the Script?,但明确层级:方法学候选/评测邻接,不与主 risk 漏洞等量齐观。
- §4.1 待核清单:至少保留 OpenART 全文、Continuity Kernel 全文/附录、Mechanist paper_card、BDH-CQ 8-15 票数四项。
五、涉及 arXiv 号(可引用)
今日直接涉及: - arXiv:2608.00677 — OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution(主 agent、副 risk;paper_card 928) - arXiv:2608.11632 — Beyond Memory: A Transactional Continuity Kernel for Long-Lived AI Agents(主 agent;状态治理/控制平面) - arXiv:2608.12036 — Mechanist(AI as a Scientific Instrument for Discovering Mechanisms of Intelligence;方法学邻接) - arXiv:2608.08160 — Can LLM Agents Stick to the Script?(长期一致性评测邻接) - arXiv:2608.10875 — VibeLifeBench(生活 agent 主动性与持久性邻接)
本轮用于交叉脉络的基线/锚点: - arXiv:2608.09867 — Stealing Reasoning Traces from Proprietary LLM APIs(主 risk;持续热度) - arXiv:2608.09888 — BDH-CQ(热度与论文质量双维度案例) - arXiv:2608.12314 — StateFlow(立标信号与立标等级分离案例) - arXiv:2608.10744 — Beyond Pixels: From Video Priors to 4D Worlds(立标等级修正案例) - arXiv:2608.08722 — Benchmark Fingerprinting(评测-风险交叉基线) - arXiv:2608.09900 — Decoding-Level Taboo(评测鲁棒性/安全边界邻接) - arXiv:2608.07446 — Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools(风险工具治理基线) - arXiv:2608.06865 — Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection(风险检测基线)
六、来源检查记录与限制
本轮实际检查/交叉阅读了:
- organized/queue/work-queue.md;
- 2026-08-12~14 的 jay、tom、flyp、spark、stephen inbox 风险相关内容,包括 HF Daily、radar、agent/evaluation/ai-industry/risk E1、Continuity Kernel 精读;
- 近三日 paper_card 抽查记录中与 risk、agent、evaluation、multimodal 邻接的 Continuity Kernel、OpenART、Mechanist、360CityArena 等条目;
- 昨日 flyp/2026-08-13-risk-e1prep.md 的既有脉络与 arXiv 列表。
限制:本次没有重新抓取外部网页、没有对全部约数百份 inbox 文件逐份人工阅读,也没有对上述论文 PDF 做全文核验;因此对热度和摘要级主张均保留“待核实”标签,未把未读全文的条目升级为已证实风险。
生成:flyP · 2026-08-14 16:30 CST · risk E1 预消化;仅写入本文件。