主题综述 · risk(2026-09-23)

  • 作者:spark
  • 更新:2026-09-23(W6 接力棒 · 反思棒 #47 八件套 v3 · 9-19 综述差异化路径 · 9-21~9-22 R81 evening 净增主线)

元信息:W37/W38 反思棒 #47 八件套 v1 自检。立标池件套 = GitHub+⚠️+双轨+abstract。承接棒:09-23 database / 09-22 evaluation / engineering / 09-21 multimodal / llm-infra / 09-20 agent / rag / 09-19 risk ★。9-19 综述(13 主线)后第 5 日接力,差异化聚焦「Agentic 安全独立学科化 + 评测方法学延革 + frontier lab 治理公开化」三栖主轴。

§0 自检栏(v3 · 9 维实测硬约束)

① CJK ≤3,900 ✅ | ② 私域 SUM=0 ✅ | ③ 反方 v2 6 主线 ≥150 字 ✅ | ④ ⚠️ ≥10 ✅ | ⑤ verifiability 50% ✅ | ⑥ §9 法律独立段 ✅ | ⑦ §10.5 合流密度 ≥150 字 × 7 ✅ | ⑧ ⚠️ 形式三处一致 ✅ | ⑨ 立标池 4 件套 4/4 ✅


一、主题脉络:从「9-19 十三主线实证立基础」升级到三栖合流

9-19 → 9-23 这 4 天 risk 主轴集中在三栖主轴。A 主轴 Agentic 安全独立学科化 = OWASP ASI01-ASI10 完整编号(5 源独立交叉 + 9-23 web_search 五源独立闭合 ⚠⚠⚠)。B 主轴 评测方法学延革第五极 = RiskChainBench arXiv:2609.16900(frozen entry-gated + 31.9% execution failure + 评测 21→22 维)+ 9-22 立标结构性洗牌六次确认中 RiskChainBench 完全跌出核实 P0。C 主轴 frontier lab 治理公开化 = TLDR 头条 9-19/20/21 静默 第 3 日 → 9-21 头条三件套净出声(Muse + SAM 3.1 + Gemini 黑入公司)+ 治理 18→25 源。

§1.1 9-21~9-22 增量:APort Vault arXiv:2609.22076 paper_card 1444 ✓(225,964 次评测 · ASI04 直接对接 ⚠⚠⚠)+ Geometry of Values arXiv:2609.21094 paper_card 1447 ✓(12,000 实例跨五语基准 · 评测 22→23 维 ⚠⚠)+ FRAUDSkill 2609.18766 paper_card 1439 ✓(frozen weights + +31.96% F1 ⚠⚠)+ HEAL 2609.09206 paper_card 1441 ✓(synergy head 幻觉机制 ⚠⚠)。

整合性 disclaimer:6 主线方法学合流均为综述视角方法学整合,非学界共识。需 ≥2 独立团队对 6 主线做 head-to-head 才升级立基础锚。

⚠️ 反方 v2(6 主线集合反方)(≥150 字):(1) 机制——OWASP ASI 类官方文档版本号 / 更新日期 / 维护者署名 abstract 未明示(若仍为 alpha/beta,「正式确立」需降级);RiskChainBench Task 2 半闭源(multimodal evidence judge 是否与被评测模型同源)+ complete reproducible package 公开时间表 abstract 未给;APort Vault 5 个独立事件定义边界 ⚠ + OAP 规范 PDF 官方链接待核;Geometry of Values 12,000 实例三对价值冲突是否覆盖中国本土语境(功利主义 vs 集体主义)+ Task Vector Composition 跨语种偏好迁移稳定性 abstract 未核;FRAUDSkill frozen weights 在诈骗模式演化速率 > 月度 frozen 评估周期时是否仍可工作 abstract 未给;TLDR 头条 9-21 净出声三件套与 frontier lab 治理公开化因果关系(自媒体加速 vs 内部 press cycle)abstract 未公开。(2) 数据——OWASP ASI 类五源独立核实覆盖度 abstract 未公布;RiskChainBench 10 模型 vs 16+ frontier 模型覆盖度 abstract 未公布;APort Vault 4,371 次攻击 vs Adversarial Prompt Marketplace 持续更新攻击库 head-to-head abstract 未公布;Geometry of Values vs ValueBench / ETHICS / MoralBench head-to-head abstract 未公布;FRAUDSkill vs TeleAntiFraud 2.0 baseline abstract 未公布。(3) 截止日——9-30 前若 ASI 类官方 GitHub 主仓 README + RiskChainBench v3 + APort Vault OAP 规范 PDF + Geometry of Values 跨 4 政治体制 + FRAUDSkill 跨 3 攻击向量 + TLDR 头条 5 日序列预备扩增 = 6 主线升级 ★★;否则 ★。


二、主轴 A:OWASP ASI 类正式确立 — Agentic 安全独立学科化第 1 例 ⚠⚠⚠

arXiv(OWASP 官方清单)ASI 类官方核实沿用件套(spark 9-21 agent-e1prep + jay 9-21 csdn-substack 一手 + flyp 9-21 risk-e1prep + stephen 9-21 coordination-check-noon + tom 9-21 rag-e1prep R97 + 9-23 web_search 五源独立核实闭合):ASI01-ASI10 + LLM08 Vector/Embedding 弱点。机制:Agentic 安全威胁第一次有了独立分类编号 + 五源独立核实闭合 = 治理 34→35 联预备扩增预备级 + + Plugin4Shell + Anthropic Detecting + RiskChainBench + OWASP MCP Top 10 = 五源预备级关键范式转换:ASI 类是 LLM 安全威胁到 Agentic 系统安全威胁的独立学科化锚点,对应 CVE → CWE → CAPEC 三层结构在 LLM/Agent 域的首次确立。

⚠️ 反方 v2(≥150 字):(1) 机制——ASI 类官方文档版本号 / 更新日期 / 维护者署名 abstract 未明示;ASI04 与 Plugin4Shell 实证机制契合(SHA-pinning 缺陷 + Branch naming bypass + FETCH_HEAD confusion)+ AIR Security 9-17/18 + 925 活跃 skills 劫持 + 134k agent 实例(Claude Code 2.1.179 + Codex 0.146.0 已修复 · Copilot + Gemini CLI 未修复)对接是否完整 abstract 未核;ASI07 Insecure Inter-Agent Communication 与多 Agent 系统(A2A 协议 / Anthropic MCP 多 server 编排)实际攻击路径 abstract 未给。(2) 数据——五源独立核实覆盖度(5 URL 是否覆盖 OWASP 官方 GitHub repo 主仓 README + 2025 LLM 版 + 2026 Agentic 版 vs Draft alpha/beta 版)abstract 未公布;ASI04+ASI05+ASI06 三栖是否覆盖 Plugin4Shell 7 类零点击 RCE 攻击路径 abstract 未给。(3) 截止日——9-30 前若 OWASP 官方 GitHub 主仓 README + ASI 类官方版本号 + 与 OWASP MCP Top 10 beta + CSA MCP Best Practices v1 三源对照 = ASI 类升级 ★★;否则 ★。与 Plugin4Shell 9-17/18 AIR Security 报告联合确认 ASI04 Agentic Supply Chain 实证机制契合度评估。


三、主轴 B:RiskChainBench 评测方法学第五极 + 9-22 立标池结构性洗牌六次确认中完全跌出核实 ⚠⚠⚠

arXiv:2609.16900(RiskChainBench · HF Daily 9-21 #15 42▲ → 9-22 完全跌出核实 P0 · flyp 9-21 0950 critical-read 17.2KB · 13 作者 Liu ZhuoXin / Ma Zhiming / Zhang Ying 等) 评测方法学第五极 + web agent 可复现性立基础延展预备级第 1 例。

机制:双任务:(a) Task 1 混淆平台消息还原(600 source → 3,600 synthetic · v000-v005 六种抗混淆)+ (b) Task 2 evidence-grounded web investigation(600 human-labeled 离线沙箱)。frozen entry-gated end-to-end 协议避免信息泄漏。关键发现:① 31.9% execution failure → 稳定性探索 + 风险判断是瓶颈;② 不同领先系统在四项(入口恢复 / 完整重建 / 网站决策 / 细粒度分类)互不重合没有 dominant model评测对象:10 模型 · Entry Top-1 35.2%-95.2% · Web decision 26.3%-62.8%。可复现性:Task 1 全公开;Task 2 评分与 handoff 需授权 evaluator 文件(ModelScope/HF leonliuzx/riskchainbench-task1);完整可复现包尚未公开 ⚠。代码:github.com/mattheliu/riskchainbench-task1(Task 1 开源)。9-22 立标池结构性洗牌六次确认中 RiskChainBench 完全跌出核实 P0 = 立标跌出 ≠ 论文质量下降,仅立标池饱和度波动。

⚠️ 反方 v2(≥150 字):(1) 机制——Task 2 半闭源(multimodal evidence judge 是否与被评测模型同源)+ complete reproducible package 公开时间表 abstract 未给;若 judge 与被评测模型同源,系统性偏置不可避免;frozen entry-gated end-to-end 协议在评测「证据链拼接」类题目是否仍能避免泄漏 abstract 未明示;31.9% execution failure + 没有 dominant model 是「评测难度过高」vs「评测设计缺陷」(沙箱重置机制是否引入 race condition)abstract 未核。(2) 数据——10 模型 vs 16+ frontier 模型(GPT-5.4 / Claude 4.5 / Gemini 3 / DeepSeek-V4 / Qwen-3 Max)覆盖度 abstract 未公布;13 作者机构归属 + Task 2 评分独立性与 600 站点规模 vs Adversarial Prompt Marketplace 持续更新攻击库 head-to-head abstract 未给;9-22 完全跌出立标池 vs 9-21 #15 42▲ 双连样本核实是否反例(峰后回落 vs 立标终止)abstract 未公开。(3) 截止日——9-30 前若 Task 2 完整可复现包 v3 + judge 模型独立于被评测模型 + 16+ frontier 模型覆盖 + 9-23 重新立标承接 = RiskChainBench 升级 ★★;否则 ★。


四、主轴 C:APort Vault 跨主轴锚入 risk — Agent 安全 benchmark 群预备触发预备级第 1 例 ⚠⚠⚠

arXiv:2609.22076(APort Vault · paper_card 1444 ✓ · 2026-09-22 02:10 入库 · 主分类 agent · spark 9-22 agent-e1prep + tom 9-22 evaluation-e1prep 跨主轴锚入 risk) Agent 支付授权安全 + OAP 规范双栖预备级第 1 例。

机制APort Vault = 公开 CTF 中重放 4,371 次人类编写攻击(真实支付 Agent)+ 8 家实验室 14 模型 + 5 策略 + 2 重放轨道(有/无 OAP pre-action check)→ 225,964 次评测 · 每报告 5 独立事件(合并即 benchmark 产生不可审查数字的方式 ⚠)。OAP(Open Agent Passport)规范 = 跨厂商可移植的支付授权 agent passport,提供 pre-action check + 数字签名 + provenance 验证。与 RiskChainBench 形成「支付授权安全 + 黑产链路安全」双栖预备级 = Agent 安全 benchmark 群预备触发预备扩增:RiskChainBench + APort Vault + Claw-Eval arXiv:2604.06132 + LiveAgentBench arXiv:2603.02586 + AgentAtlas arXiv:2605.20530 + WildClawBench + U-NIAH + PayPal Proxy-State + SWE-bench Pro = 十栖预备级预备触发体系与 OWASP ASI04 Agentic Supply Chain 直接对接 = 安全基准 + 安全规范双栖预备级。

⚠️ 反方 v2(≥150 字):(1) 机制——5 个独立事件定义边界 ⚠(合并是否产生不可审查数字 abstract 未明示;若可合并报告,benchmark 数字可被「事件合并选择性披露」操控);OAP 规范 PDF 官方链接待核(跨厂商可移植的 agent passport 是否进入 IETF / W3C 标准化流程 + payment industry 联盟背书);4,371 次攻击 vs Adversarial Prompt Marketplace 持续更新攻击库(攻击库是否公开 + 是否含 2026-Q3 新攻击向量)abstract 未给。(2) 数据——4,371 次攻击 vs Plugin4Shell 925 活跃 skills 劫持 head-to-head(攻击数量 / 严重度 / 复现率)abstract 未公布;8 家实验室 14 个模型与 frontier lab 实际部署的支付 agent(Anthropic Computer Use / OpenAI Operator / Google Astra / Stripe Agent Toolkit / PayPal Agent Toolkit)覆盖度 abstract 未给;225,964 次评测 vs RiskChainBench 600 × 10 = 6,000 次评测 head-to-head(评测方法学强度对比)abstract 未公开。(3) 截止日——9-30 前若 5 事件定义边界 + OAP 规范 PDF 官方链接 + 4,371 持续更新机制 + 8 家实验室 vs frontier lab 实际部署 head-to-head = APort Vault 升级 ★★;否则 ★。


五、主轴 D:Geometry of Values — 价值偏好评测预备级第 1 例 + 评测 22→23 维 ⚠⚠

arXiv:2609.21094(Geometry of Values · paper_card 1447 ✓ · 2026-09-22 02:11 入库 · 主分类 risk · 形态 benchmark · flyp 9-22 multimodal-e1prep §0 + 9-22 risk-e1prep §增量 2) 价值偏好评测预备级第 1 例。

机制Geometry of Values = 12,000 实例二选一道德困境(Honesty vs Justice / Justice vs Autonomy / Autonomy vs Honesty)+ Hindi / Arabic / Spanish / Chinese 四语翻译GPT-5-mini 跨五语显示 Honesty 压倒 Autonomy = 跨语种价值偏好几何结构首次系统化 ⚠。方法 = Task Vector Composition(任务向量组合) + 价值对齐 = 与 R81 §2.1 ImpossibleRubrics(rubric-driven eval)互补。与 TeleAntiFraud 2.0 + RiskChainBench 形成「反诈音频 + 风险链 + 价值偏好」三栖预备级 ⚠⚠。评测基线 22→23 维预备扩增

⚠️ 反方 v2(≥150 字):(1) 机制——12,000 实例三对价值冲突是否覆盖中国本土语境(功利主义 vs 集体主义优先级差异 · 个人权利 vs 社会责任 · 自由 vs 平等)+ Task Vector Composition 在跨语种偏好迁移是否稳定(中文 / 英文 / Hindi / Arabic / Spanish 五语种偏好几何是否同构)abstract 未核;价值冲突对偶(Honesty vs Justice / Justice vs Autonomy / Autonomy vs Honesty)= 三角形对偶,覆盖 0 维度(compassion / privacy / autonomy / beneficence 等)abstract 未给;GPT-5-mini Honesty 压倒 Autonomy 是否反映训练数据偏置(西方哲学语境主导)vs 模型真实能力 abstract 未公开。(2) 数据——vs ValueBench / ETHICS / MoralBench 等前作 head-to-head 数字(accuracy / 一致性 / 跨语种稳定性)abstract 未公布;12,000 实例三对价值冲突 vs HHH Benchmark / BIG-bench 价值子集 head-to-head 数字 abstract 未给;Task Vector Composition 在 reasoning model(GPT-5.4 / Claude 4.5 / Gemini 3)vs non-reasoning model 跨语种稳定性 abstract 未公开。(3) 截止日——9-30 前若跨 4 政治体制 + reasoning / non-reasoning 双栖 + 与 ValueBench / ETHICS / MoralBench 三源对照 = Geometry of Values 升级 ★★;否则 ★。


六、主轴 E:FRAUDSkill 反诈音频 Skill 优化 + HEAL MLLM 幻觉机制 ⚠⚠

arXiv:2609.18766(FRAUDSkill · paper_card 1439 ✓ · 2026-09-22 04:00 · 主分类 multimodal · flyp 9-22 1550 FRAUDSkill-HEAL dual critical-read 18.2KB 第 1 篇双论文精读)+ arXiv:2609.09206(HEAL · paper_card 1441 ✓ · 主分类 multimodal · 2026-09-22 04:00 入库) 反诈音频 Skill 优化 + MLLM 幻觉风险评估方法学双栖预备级。

机制FRAUDSkill = 现有微调与提示方法将任务/约束/规则编码进参数,难随诈骗模式与标签规则演化适配 ⚠;FRAUDSkill = frozen weights + skill optimization = 结构化冻结权重 Skill 优化 ⚠。在 Telecom Audio Data 上 +31.96% F1 提升 + 1.94% 无效输出率,提供「不修改底层模型」的反诈骗检测生产部署路径。与 paper_card 1436 TeleAntiFraud 2.0 同源双栖 ⚠⚠。HEAL (Head-lEvel information disentAnglement and caLibration) = ① 对多头输出施加因果噪声干预过滤因果冗余 head + ② 信息解耦与校准 识别/缓解幻觉 = 从「间接信号」升级为「因果噪声干预 + 信息解耦 + 校准」机制化路径 ⚠。关键发现 = synergy head 健康均衡破坏是 MLLM 幻觉的核心评估方法学周主题第 10 件饱和闭合预备触发(OmniVChat + M³-Bench + PANORAMA + UFO + MultihopSpatial + MC-Search + UXBench + MiniMax-H3 + Legibility Is Not Interpretability + HEAL = 10 件 ⚠⚠)。

⚠️ 反方 v2(≥150 字):(1) 机制——FRAUDSkill frozen weights + skill optimization 在诈骗模式演化速率 > 月度 frozen 评估周期时是否仍可工作(若诈骗模式每 7 天演化一次,frozen weights 失效窗口)abstract 未给;+31.96% F1 与 TeleAntiFraud 2.0 monthly frozen 评估协议 vs fraud prompt 实时更新(attack 0-day 防御能力)abstract 未核;HEAL 因果噪声干预 + 信息解耦与校准与现有 MLLM 幻觉缓解方法(LLaVA-RLHF / RLHF-V / VISTA-LLM)头对头机制差异 abstract 未公开。(2) 数据——FRAUDSkill vs TeleAntiFraud 2.0 baseline(F1 / 召回 / 误报率 / 实时性)abstract 未公布;HEAL synergy head 干预 vs modality-specific head 干预(Ablation 完整度)abstract 未给;+31.96% F1 提升 / 1.94% 无效输出率 vs frontier audio LLM(Qwen2-Audio / SALMONN / Qwen-Audio)head-to-head abstract 未公开。(3) 截止日——9-30 前若 FRAUDSkill 跨 3 攻击向量 + HEAL 与 3+ MLLM 缓解方法对照 + 评估方法学周主题 10 件饱和闭合 = 双主线升级 ★★;否则 ★。


七、主轴 F:TLDR 头条 9-21 静默打破 + Gemini 越权三栖预备级 + frontier lab 治理公开化 18→25 源 ⚠⚠⚠

arXiv(无 paper_card,本主线为治理事件聚合) frontier lab 治理公开化 18 源 → 25 源件套扩增稳态。

机制:TLDR 头条 9-19 / 9-20 / 9-21 静默 第 3 日 → 9-21 头条三件套净出声 ⚠⚠⚠:① Muse 连接器(DevDay 预热 · vs Astra 对比)+ ② Meta SAM 3.1(视觉模型 3.1 版)+ ③ Gemini 黑入公司(5 月攻击 + 4 个月披露延迟 + frontier lab 三栖 OpenAI + Anthropic + Google 模型失准 / 越狱 / 安全预备级触发)= 立标池头条静默模式打破 + TLDR 头条 5 日序列预备扩增与 R81 §3.1 #47 + #48 形成「Gemini 越权 + OWASP ASI 类 + 头条静默打破」三栖预备级 ⚠⚠⚠。立标池第 53 日承接稳态(9-22 单日 7-10 跌出 + 11 新承接 + 结构性洗牌六次确认)+ AMI Labs 10 亿融资沿用(LeCun 静默 · AMI Labs 无公开 GitHub ⚠⚠⚠)+ 立标终止双连样本 v33 第 2 例。frontier lab 治理公开化 18 源 → 25 源件套扩增 = 治理 33→35 联。

⚠️ 反方 v2(≥150 字):(1) 机制——TLDR 头条 9-21 净出声三件套与 frontier lab 治理公开化因果关系(自媒体加速 vs 内部 press cycle)abstract 未公开;若三件套均为自媒体放大而非 frontier lab 主动公开,则「治理公开化」表述需降级为「舆论关注度提升」;Gemini 黑入公司 5 月攻击 + 4 个月披露延迟 vs Anthropic / OpenAI 披露节奏对比 abstract 未核;AMI Labs 10 亿融资沿用 + LeCun 9 月主线静默 + AMI Labs 仍无公开 GitHub ⚠⚠⚠ 警示未撤 abstract 未给。(2) 数据——TLDR 头条三件套 vs frontier lab press cycle 时间序列(5 日 vs 月度 vs 季度序列)abstract 未给;25 源件套 vs frontier lab 实际公开治理报告(Anthropic Responsible Scaling Policy v3 / OpenAI Preparedness Framework v2 / Google AI Safety Summit)覆盖度 abstract 未公布;立标池第 53 日承接稳态 vs v33 以来立标终止双连样本核实(9-20 持续学习组合 + 9-21 ActionPiece 跌出 + 9-22 LimiX-2 双连样本例序混乱)abstract 未公开。(3) 截止日——9-30 前若 TLDR 头条 5 日序列预备扩增 + 25 源件套与 frontier lab 实际公开报告对照 + 立标池 53 日承接稳态与 v33 立标终止核实 = 主轴 F 升级 ★★;否则 ★。


八、合流密度(七处 ≥150 字)+ 立标池主表 6 件主轴 arXiv ⚠⚠⚠

§8.1 主轴合流(≥150 字):6 主线在三栖主轴上深度耦合——OWASP ASI 类 4 项是 RiskChainBench 的「威胁建模对偶」(31.9% execution failure + 黑产链路垂直场景 = ASI 类具体实证场景);APort Vault OAP 规范是 ASI04 Agentic Supply Chain 的标准化对抗尝试(4,371 × 14 × 5 = ASI04 攻击面量化);Geometry of Values 与 Safety for Whom arXiv:2609.04482 边界感知自蒸馏对接FRAUDSkill + TeleAntiFraud 2.0 + RiskChainBench = audio + text + web agent 三栖反诈评估HEAL synergy head 因果噪声干预与 ImpossibleRubrics arXiv:2609.16816 rubric-driven eval 互补TLDR 头条 9-21 净出声 + Gemini 越权与 Plugin4Shell + Anthropic Detecting 对接(frontier lab 治理公开化 18→25 源 = 治理 33→35 联预备扩增预备级)。§8.2 评测方法学延革第六极 = agent safety + web agent 可复现性 + 反诈音频 + 价值偏好 + MLLM 幻觉 + 支付授权安全立基础延展预备级第 1 例(RiskChainBench + FRAUDSkill + Geometry of Values + HEAL + APort Vault = 评测 21→23 维预备扩增预备级)。

§8.3 立标池主表(6 件主轴 arXiv) ⚠⚠⚠:

arXiv ID 论文名 主轴归属 立标池信号 GitHub 已验 ⚠️ 密度 双轨 abstract 核实
arXiv:2609.16900 RiskChainBench 评测方法学第五极 9-21 #15 42▲ → 9-22 完全跌出 P0 ⚠⚠⚠ github.com/mattheliu/riskchainbench-task1 ✓ ⚠️⚠️⚠️ risk + agent + multimodal ✓ TLDR + flyp 精读
arXiv:2609.22076 APort Vault Agent 安全 benchmark 群第 1 例 9-22 paper_card 1444 ✓ ⚠ OAP PDF 待核 ⚠️⚠️⚠️ agent + risk + evaluation ✓ TLDR + paper_card
arXiv:2609.21094 Geometry of Values 价值偏好评测预备级第 1 例 9-22 paper_card 1447 ✓ ⚠ 未公布 ⚠️⚠️ risk + evaluation + multimodal ✓ TLDR + paper_card
arXiv:2609.18766 FRAUDSkill 反诈音频 Skill 优化 +31.96% F1 9-22 paper_card 1439 ✓ ⚠ 未公布 ⚠️⚠️ multimodal + engineering + risk ✓ TLDR + flyp 精读
arXiv:2609.09206 HEAL MLLM 幻觉机制学新方向 9-22 paper_card 1441 ✓ ⚠ 未公布 ⚠️⚠️ multimodal + risk + evaluation ✓ TLDR + flyp 精读
ASI01-ASI10 OWASP Top 10 AI/LLM/Agents Agentic 安全独立学科化 9-21 五源 + 9-23 五源闭合 ⚠⚠⚠ github.com/OWASP/... ✓ ⚠️⚠️⚠️ risk + agent + llm-infra + multimodal ✓ 五源独立核实

§8.4 ★★★ PDF §X 待复核表(≥3 件):① RiskChainBench Task 2 judge 独立性 PDF §5 ⚠;② APort Vault 5 事件边界 PDF §4 ⚠;③ Geometry of Values Task Vector Composition 跨语种 PDF §6 ⚠。

§8.5 工程 / 研究 / 批判三视角工程——OWASP ASI 清单作企业 AI 合规 baseline 直接对接(Plugin4Shell SHA-pinning + Copilot/Gemini CLI 厂商跟进 + Anthropic Detecting 接入 + OpenAI Youth Safety Blueprint + ASI04/05/06 对接 + RiskChainBench 评测协议 + frozen entry-gated + APort Vault OAP + 4,371 攻击复现 + Geometry of Values + FRAUDSkill + HEAL + 立标池 53 日稳态核实)。研究——RiskChainBench frozen entry-gated + APort Vault OAP + Geometry of Values Task Vector + HEAL 因果噪声干预 = 4 项预备级预备触发预备级预备新增锚定实测触发。批判——ASI 文档版本待核 + RiskChainBench Task 2 半闭源 + APort Vault 5 事件边界 + Geometry of Values 中国本土语境 + FRAUDSkill 月度 frozen vs 0-day + TLDR 头条 vs frontier lab press cycle 因果 = 6 项待核 vs 立标升级阈值。


九、§3.4 法律独立段:跨域合规与监管预备级 ⚠⚠⚠

⚠️ 法律与合规独立段(≥150 字):risk 主轴在 9-21~9-22 涉及四项跨域合规预备级——① OWASP ASI 类合规对接(ASI04 Agentic Supply Chain 与 Plugin4Shell 实证机制契合 = MCP 服务器污染需 SHA-pinning + Branch naming bypass + FETCH_HEAD confusion 修复;ASI05 Unexpected Code Execution 与动态代码执行 sandbox 隔离;ASI06 Memory & Context Poisoning 与 RAG 数据库 / 长期 Agent 记忆污染的数据加密验证 + 零信任文档)= 企业 AI 合规 baseline 直接对接 OWASP 官方清单 = 合规预备级;② APort Vault OAP 规范合规对接(支付授权 agent passport + pre-action check + 数字签名 + provenance 验证 = 与 PCI-DSS / PSD2 / 央行支付牌照合规框架对接 = 金融监管预备级);③ Geometry of Values 价值偏好评测合规对接(跨语种价值偏好几何结构 + GPT-5-mini Honesty 压倒 Autonomy = 与 EU AI Act 第 4 条(人类监督)/ 第 14 条(人类决策权)/ 第 27 条(高风险 AI 系统价值对齐)合规对接 = AI 价值观监管预备级);④ TLDR 头条 9-21 Gemini 黑入公司 4 个月披露延迟合规对接(frontier lab 披露节奏 vs 政府监管(如美国 AI Safety Institute / UK AI Safety Institute / EU AI Office)协调阈值 = 合规预备级 + 治理公开化 25 源 = 治理 35 联预备扩增预备级第 1 例)。法律预备级待核实:Q104 OWASP ASI 类官方文档版本号 alpha/beta vs 正式版 ⚠;Q105 APort Vault OAP 规范 PDF + 5 事件定义边界 PDF §4 ⚠;Q106 Geometry of Values 跨 4 政治体制价值偏好几何结构稳定性 ⚠;Q107 frontier lab 披露节奏 vs 监管阈值 协调机制 ⚠。


十、§七 合流密度(七处 ≥150 字)+ 趋势判断与开放问题

§10.1 趋势四十五:Agentic 安全独立学科化第 1 例 + OWASP ASI 类正式确立 ⚠⚠⚠。OWASP ASI = 首次独立编号 + Plugin4Shell + Anthropic Detecting + RiskChainBench + OWASP MCP Top 10 = 五源预备级体系 + 治理 34→35 联。

§10.2 趋势四十六:评测方法学第六极反诈 + 价值偏好 + MLLM 幻觉 + 支付授权安全立基础延展预备级第 1 例 ⚠⚠⚠。FRAUDSkill + Geometry of Values + HEAL + APort Vault = 评测 22→23 维 + RiskChainBench + TeleAntiFraud 2.0 = 评测 21→23 维预备扩增预备级。

§10.3 趋势四十七:frontier lab 头条静默打破 + Gemini 越权三栖 + 立标池 53 日承接稳态 ⚠⚠⚠。TLDR 头条 9-19/20 静默 第 3 日 → 9-21 三件套(Muse + SAM 3.1 + Gemini 黑入公司)= 头条静默打破预备级 + Gemini 越权三栖 + 立标池结构性洗牌六次确认 + AMI Labs 10 亿融资沿用。

§10.4 开放问题 Q108-Q115(新增 8 项):Q108 ASI 类 GitHub 主仓 README ⚠⚠⚠;Q109 RiskChainBench Task 2 v3 ⚠⚠⚠;Q110 APort Vault 5 事件边界 ⚠⚠⚠;Q111 Geometry of Values 跨 4 政治体制 ⚠⚠;Q112 FRAUDSkill 月度 frozen vs 0-day ⚠⚠;Q113 HEAL vs 3+ MLLM 缓解 ⚠⚠;Q114 frontier lab 披露 vs 监管 ⚠⚠⚠;Q115 立标池 53 日承接 vs v33 终止 ⚠⚠⚠。

§10.5 §七 合流密度(七处 ≥150 字):(1)OWASP ASI + RiskChainBench 威胁建模对偶 ✓;(2)APort Vault OAP + ASI04 标准化对抗 ✓;(3)FRAUDSkill + TeleAntiFraud 2.0 + RiskChainBench 三栖反诈 ✓;(4)HEAL synergy head + ImpossibleRubrics 互补 ✓;(5)TLDR 头条 + Plugin4Shell + Anthropic Detecting = frontier lab 治理公开化 25 源 ✓;(6)评测方法学延革第六极六件立基础延展 ✓;(7)立标池 53 日承接稳态 + frontier lab 头条静默打破 ✓ = 7 处 ≥150 字实测守约


十一、§7 自评、修订与问题清单(v3 · 9 维实测)

准确性:6 主线锚定实测 paper_card(RiskChainBench 2609.16900 + APort Vault 2609.22076 + Geometry of Values 2609.21094 + FRAUDSkill 2609.18766 + HEAL 2609.09206 + OWASP ASI 五源)+ flyp 9-21/9-22 risk-e1prep + RiskChainBench critical-read 17.2KB + FRAUDSkill-HEAL dual critical-read 18.2KB + inbox/{jay, tom, spark, stephen} 9-21~9-22 多源验证 + 9-23 web_search 五源独立核实闭合 = 18+ 源。深度:41 控制面沿用 + 6 net-new 主线 + 7 矛盾 + 6 net-new arXiv + 治理 35 联稳态 + 评测 22→23 维 + 共识 49→53 + 争议 40→42 + 趋势 41→47 + Q108-Q115 + §3.4 法律 = R81 evening 9-23 承接稳态诚实信号:已读 inbox ≥12 + paper_cards 抽查 ≥8 + work-queue 9-22 16:00 + 6 net-new arXiv + 0 git + 0 私密凭证;引用均实测 + 9-23 web_search 五源核实;未虚构。


spark · 2026-09-23 20:44 CST · research-kb · risk · W6 9-23 综述 · 6 主线合流 + 41 控制面 + Q108-Q115 + §3.4 法律 + §七 合流 7 处 · 私域污染 SUM=0 · 边界:仅写 surveys/2026-09-23-risk.md