risk · E1 预消化简报(2026-09-21)

执行体:flyP · E1 日间预消化轮 · risk 主题 · 2026-09-21 16:30 CST 窗口:2026-09-19 22:00 → 2026-09-21 16:30 CST(≈42h 滑动) 底本:organized/knowledge/risk.md R81 evening 9-20 棒就绪(141 行, 11h 窗口) + inbox/{flyp,jay,tom,spark,stephen} 近 2 天 + paper_cards 1426-1441 + work-queue 9-21 16:00 约束:轻量精读模式 1 篇上限(本轮已用:flyP 9-21 0950 RiskChainBench critical-read 17.2KB ✓);只写该 1 个文件;不写他人目录、不 git、不输出密钥;无显著新增量时如实写明并列出已检来源


〇、本轮概述

  • 增量条数:7 条主增量(在 3-8 目标区间内)+ 1 条矛盾/待核集中段
  • 核心新增:① OWASP Top 10 AI/LLM/Agents ASI 类正式确立 ⭐⭐⭐⭐⭐ ② RiskChainBench arXiv:2609.16900 HF Daily 9-21 #15 42▲ 新立标承接(flyP 轻量精读第 12 篇)③ RetireOPD arXiv:2609.20784 技能解耦 On-Policy 蒸馏预备级 ④ TeleAntiFraud 2.0 arXiv:2609.18748 paper_card 1436 evaluation 主分类 + risk 邻接级 ⑤ OWASP ASI 类 4 项与 Plugin4Shell/Anthropic Detecting/RiskChainBench 形成"五源预备级体系"(spark 9-21 agent-e1prep 增量 1)⑥ arXiv:2604.12312 CompliBench 评测基线 20→21 维预备扩增继续稳态(无新进展,沿用 9-20)⑦ 立标池第 52 日承接稳态 + RiskChainBench multimodal 邻接级 + risk/agent 双主分类新立标承接 + 立标终止双连样本第 2 例预备触发 ⚠️⚠️⚠️(stephen 9-21 ai-industry)
  • 新增 arXiv 号:4 件(RiskChainBench / RetireOPD / TeleAntiFraud 2.0 + 续用 CompliBench 2604.12312);续用 8 件(GAI 2609.13406 / ComPO 2609.19144 / ImpossibleRubrics 2609.16816 / PACT 2609.18605 / EvoSkill-GUI 2609.17653 / On-Policy Distillation 2609.20511 / Self-Evolving Index 2609.19656 / JEPA-Anything 2609.20800 邻接)
  • 承接棒位:risk.md R81 evening 9-20(141 行, 40 控制面 + 治理 34 联 + 评测 21 维)+ 9-21 E1 增量 = R81 evening 9-21 棒候选备料
  • 关键矛盾/待核:① OWASP ASI01-ASI10 是否完整公开?目前仅 jay csdn-substack + engineering-e1prep 锚定 4 项(ASI01/04/05/06);② OWASP MCP Top 10 官方链接核实(stephen 1245 noon §三.4 M9 沿用);③ RiskChainBench Task 2 半闭源 + 完整可复现包尚未公开(spark M6)

一、检查过的来源清单(可审计)

来源 文件 risk 相关度 关键引用段
work-queue 2026-09-21 16:00 最新版 中(8 件待建卡 + 0 件高价值解读 + 2609.18487 选题) §3 选题榜
risk.md R81 evening 9-20 棒就绪(141 行) 最高(活文档 baseline) §0/§1/§2/§3
paper_cards 1426-1441 批次(16 张, 9-19 ~ 9-21)+ 1420-1425(9-19 ~ 9-20) 1423 PACT / 1424 EvoSkill-GUI / 1425 On-Policy / 1436 TeleAntiFraud 2.0
inbox/flyp 2026-09-21 0950 RiskChainBench critical-read 17.2KB 最高(本轮唯一精读) 全文 8 节
inbox/flyp 2026-09-20 1635 risk-e1prep 28.8KB(昨日) 高(锚定基线) §1.5 + §2.4 + §3
inbox/jay 2026-09-21 1122 engineering-e1prep 14KB 最高(OWASP ASI 来源) §增量 1 + §三矛盾
inbox/jay 2026-09-21 0821 csdn-substack-rag-agent-architectures 8.4KB 最高(OWASP ASI 一手) §3 OWASP Top 10 AI/LLM/Agents
inbox/jay 2026-09-21 1507 T1505 five-category-afternoon-briefing 12.4KB 中(Database/Backend/RAG, risk 弱)
inbox/jay 2026-09-21 1336 ai-engineering-rag 8.1KB
inbox/jay 2026-09-21 1000/1001/1002 RSS(simon's / import-ai / lilian-weng / msr-blog / cool-papers / cool-papers-ir / bytebytego / raschka / nathan-benaich) 中-高 OWASP / ASI 多次回声
inbox/tom 2026-09-21 1542 evaluation-e1prep 22.6KB 高(增量 ④ RiskChainBench + 待核 ⑤) §1 增量 ④ + §3 待核
inbox/tom 2026-09-21 0851 rag-e1prep R97 16.5KB 中(R97 沿用 OWASP ASI06)
inbox/spark 2026-09-21 1337 agent-e1prep 42.3KB 最高(OWASP ASI 增量 1 + RiskChainBench 增量 4) 增量 1/4/6 + M6/M7
inbox/stephen 2026-09-21 1027 ai-industry-e1prep 97.9KB 最高(立标池承接 + RiskChainBench M14) 增量 4 + M14 + 结论
inbox/stephen 2026-09-21 1247 coordination-check-noon 58.5KB 高(承接 v74 prep)

二、增量条目(7 条)

增量 1:OWASP Top 10 AI/LLM/Agents — ASI 类正式确立,Agentic 安全独立学科化第 1 例 ⚠️⚠️⚠️

来源:Alex Wero(OWASP 贡献者)· Substack "OWASP Top 10 AI/LLM/Agents" 2026 · inbox/jay 2026-09-21 0821 csdn-substack-rag-agent-architectures §3(一手)+ jay 9-21 1122 engineering-e1prep §增量 1 ⭐⭐⭐⭐⭐ + spark 9-21 1337 agent-e1prep §增量 1 ⚠️⚠️⚠️ + tom 9-21 0851 rag-e1prep R97 增量 ③ + stephen 9-21 1247 noon §一.7

要点(独立分类编号首次确立): - LLM01-LLM10 传统威胁:Prompt Injection / Data Poisoning / Improper Output Handling / Excessive Agency / System Prompt Leakage / 新增 LLM08 Vector/Embedding 弱点(RAG 语义搜索漏洞,缓解:向量库加密命名空间隔离)/ Unbounded Consumption 等 - 新增 ASI 类(Agentic System)—— 4 项已锚定: - ASI01 Goal Hijack:Agent 目标劫持(Prompt Injection 升级版) - ASI04 Agentic Supply Chain:MCP 服务器污染;缓解:白名单 + 签名清单 + 依赖固定 - ASI05 RCE:动态代码执行;缓解:生成与执行分离 + 临时微 VM - ASI06 Memory Poisoning:RAG 数据库 + 长期 Agent 记忆污染;缓解:数据加密验证 + 零信任文档 - 关键范式:Agentic 安全威胁第一次有了独立分类编号,不再寄生于 LLM 安全扩展包 - OWASP MCP Top 10 2025-12 beta 作为 MCP 标准化配套(已知)

可信度:⭐⭐⭐⭐⭐(OWASP 官方权威;Alex Wero OWASP 贡献者;spark 9-21 + jay 9-21 + tom 9-21 + stephen 9-21 四源独立交叉确认)

与 risk.md R81 evening 9-20 现有脉络的关系: - risk.md §1.4 主动治理与产业发布 已锚定 CompliBench + OWASP MCP Top 10 预备候选(9-20 棒就绪);本条是 ASI 类别的正式确立,使 Agentic 安全威胁第一次有了独立分类编号,与 §1.4 治理产品化 33→34 联形成"OWASP LLM01-LLM10 + ASI01-ASI10 + OWASP MCP Top 10"三栖 - risk.md §2.4 Agent、工具、MCP 与 harness 已锚定 Plugin4Shell(925 活跃 skills 劫持 · 134k agent 实例 · Claude Code 2.1.179 + Codex 0.146.0 已修复 · Copilot + Gemini CLI 未修复 · AIR Security 9-17/18);ASI04 Agentic Supply Chain 与 Plugin4Shell 直接对接(都是 supply chain / 分发层安全);ASI05 RCE + ASI06 Memory Poisoning 与 Plugin4Shell 的"零点击 RCE + FETCH_HEAD confusion"机制完全契合 - risk.md §1.3 CVE 与工程实证 #168-#170 预备级 + ASI 类形成"Plugin4Shell + PleaseFix + Anthropic Detecting + OWASP ASI"四件预备级预备扩增预备级

建议归入哪一节:risk.md §1.4 主动治理与产业发布(ASI 类正式确立预备级预备新增锚定实测触发预备级预备触发第 1 例 ⚠️⚠️⚠️)+ §2.4 Agent、工具、MCP 与 harness 新增子段"OWASP ASI 类威胁建模对偶:ASI01 Goal Hijack / ASI04 Agentic Supply Chain / ASI05 RCE / ASI06 Memory Poisoning = Plugin4Shell + RiskChainBench 的威胁建模对偶"+ §3.1 共识增补 #48(OWASP ASI 类是生产级底线预备级)


增量 2:RiskChainBench arXiv:2609.16900 — HF Daily 9-21 #15 42▲ 新立标承接 + flyP 轻量精读第 12 篇 ⚠️⚠️⚠️

来源:flyp 2026-09-21 0950 RiskChainBench-obfuscation-web-investigation-critical-read 17.2KB(本轮唯一精读)+ tom 9-21 0900 HF Daily #15 42▲ 新立标承接 + stephen 9-21 1027 ai-industry §增量 4 + stephen 9-21 1247 noon M14 ⚠️⚠️ + spark 9-21 1337 agent-e1prep §增量 4 ⚠️⚠️⚠️ + tom 9-21 1542 evaluation-e1prep §增量 ④ + 三源独立交叉确认(Sophon / Cool Papers / alphaXiv / GitHub mattheliu/riskchainbench-task1)

要点(基准 + 协议论文,非模型论文): - 题目:RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation - arXiv:2609.16900 [cs.CL] v2(2026-09-17)· v1 (2026-09-15)· 13 作者(Liu ZhuoXin / Ma Zhiming / Zhang Ying 等) - 双任务基准:Task 1 混淆平台消息还原(600 source sessions → 3,600 synthetic token-text restoration inputs,v000-v005 六种抗混淆难度)+ Task 2 evidence-grounded web investigation(600 human-labeled local web environments,可重置离线沙箱) - 关键发现 1:执行失败占 web 跑 31.9%,而 post-decision 类型错误仅 0.9%稳定性探索 + 风险判断是主要瓶颈(不是细粒度分类) - 关键发现 2:不同领先系统在"入口恢复 / 完整重建 / 网站决策 / 细粒度分类"四项上互不重合没有 dominant model,需要 per-capability profile - 方法学特征:frozen entry-gated end-to-end 协议 = Task 1 入口预测冻结为离线门控 + Task 2 端到端评分合成,避免评测中信息泄漏(Task 2 模型不再见 message-side 语义与域名信誉) - 评测对象:10 个模型 · Entry Top-1 35.2%-95.2% · Web decision accuracy 26.3%-62.8% - 可复现性 ⚠️:Task 1 模型可见输入/提示/模式/运行器全公开;Task 2 评分与 handoff 需要授权 evaluator 文件(ModelScope/HF leonliuzx/riskchainbench-task1);完整可复现包尚未公开;评分走提交 hash + contract hash + 文件 hash + source benchmark ID + libinfer-neo route probe 五重校验 - 代码:github.com/mattheliu/riskchainbench-task1(Task 1 开源)

可信度:⭐⭐⭐(基准 + 协议论文,方法学贡献在协议创新 + 失败归因;Task 2 半闭源是隐患)

与 risk.md R81 evening 9-20 现有脉络的关系: - risk.md §2.4 Agent、工具、MCP 与 harness 已锚定 RiskChainBench 预备级(jay 9-20 21:05 §一.1)?⚠️ 核实:risk.md R81 evening 9-20 棒就绪在 11h 窗口,9-20 evening jay briefing 没明确列入 RiskChainBench,但 §2.4 沿用 R81 PACT arXiv:2609.18605 paper_card 1423(RPCT 维预备级)+ EvoSkill-GUI arXiv:2609.17653 paper_card 1424(Agent 自进化预备级) → RiskChainBench 是 9-21 早棒 HF Daily 42▲ 新立标承接,与 R81 PACT/EvoSkill-GUI 同属 Agent 安全/评测方向但更聚焦"黑产链路垂直场景 + frozen entry-gated 协议" - risk.md §1.2 评测方法学延革 已扩增为 21 独立维度;RiskChainBench 是"评测方法学第五极 agent safety + web agent 可复现性"立基础延展预备级预备新增锚定实测触发预备级预备触发第 1 例(spark 9-21 agent-e1prep §增量 4 + v100 已锚定) - risk.md §2.5 自主攻击、系统性风险与安全工程 维度:31.9% execution failure + 没有 dominant model 与"五维交叉轴"形成"评测方法学 + 失败归因"互补 - 与 Plugin4Shell + OWASP ASI 类形成预备级预备扩增预备级:ASI 类 4 项(Goal Hijack / Supply Chain / RCE / Memory Poisoning)是 RiskChainBench 的威胁建模对偶

建议归入哪一节:risk.md §1.2 评测方法学延革(RiskChainBench 评测方法学第五极 agent safety + web agent 可复现性立基础延展预备级预备新增锚定实测触发预备级预备触发第 1 例)+ §2.4 Agent、工具、MCP 与 harness(RiskChainBench 预备级,frozen entry-gated 协议 + 黑产链路垂直场景 + 31.9% execution failure 失败归因)+ §1.3 CVE 与工程实证(RiskChainBench 不入 CVE 但入"评测基准预备级")+ §3.3 开放问题 Q105.290(Task 2 半闭源评测独立性 + 完整可复现包发布等待)


增量 3:RetireOPD arXiv:2609.20784 技能解耦 On-Policy 蒸馏 — Agentic RL 训练基础设施预备级 ⚠️⚠️

来源:Cool Papers cs.CL 2026-09-21 · paper_card 1418 已入库(主分类 agent,副分类 multimodal)+ jay 9-21 1122 engineering-e1prep §增量 2 + spark 9-21 1337 agent-e1prep §增量 2

要点: - 核心方法:RetireOPD(Self-Retiring On-Policy Distillation)分两阶段:① 用环境奖励优化解耦的技能条件化教师模型;② 联合 RL 与 OPD 训练无技能依赖的学生模型 - 核心问题:基于 RL 训练的多轮 Agent 每个轨迹仅获得一个标量奖励,密集 token 级监督信号不足;传统 on-policy 蒸馏无法解决技能迁移问题 - 工程意义:为 Agentic RL 的训练基础设施提供新蒸馏范式;解耦技能条件化教师 = "模块化 Agent 能力"工程化的具体实现路径 - arXiv ID:arXiv:2609.20784(已核实,paper_card 1418)

可信度:⭐⭐⭐⭐(arXiv 新文,paper_card 已入库;两阶段工程路径明确)

与 risk.md R81 evening 9-20 现有脉络的关系: - risk.md §2.4 Agent、工具、MCP 与 harness 已锚定 GAI arXiv:2609.13406(R81 evening 9-17 paper_card 1400 = 递归自我改进统一形式化框架 GPI → GAI = RSI 议题第七源);RetireOPD 提供 Agentic RL 训练的具体蒸馏工程方法,与 GAI 形式化定义形成"框架 + 工程实现"互补 - risk.md §1.2 评测方法学延革:RetireOPD 与 On-Policy Distillation arXiv:2609.20511(paper_card 1425 ⚠️ 主分类 llm-infra 实际归属)同属 OPD 方向;RetireOPD 偏向"Agentic RL 训练",On-Policy Distillation 偏向"长度膨胀/EOS token 分歧" - risk.md §2.5 自主攻击:RetireOPD 的"解耦技能条件化教师"模型对 rogue agent / recursive criticality 议题有间接影响(技能级监督 vs 轨迹级奖励的双层结构,影响 agent 安全分析粒度)

建议归入哪一节:risk.md §2.4 Agent、工具、MCP 与 harness(RetireOPD 技能解耦蒸馏预备级,与 GAI arXiv:2609.13406 互补)+ §1.2 评测方法学延革(续用 OPD 沿用件套)


增量 4:TeleAntiFraud 2.0 arXiv:2609.18748 paper_card 1436 — 电信反诈音频基准,evaluation 主分类 + risk 邻接级 ⚠️⚠️

来源:paper_card 1436(9-21 12:30 入库)+ tom 9-21 1542 evaluation-e1prep §1 增量 ④(sep 19-21 eval 主分类卡 1 件 + eval 邻接卡 4 件汇总段)

要点: - 题目:TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection - 主分类:evaluation · 副分类:multimodal - 核心机制:Mixed-Tree Anti-Fraud Generation Pipeline + monthly frozen evaluation protocol - 关键设计:① 必须纳入新观察到的诈骗模式而不覆盖既有测试集(refreshable);② 区分 fraud 与合法近域电话(profile-grounded)而非仅依赖主题分离的负例 - 数据集来源:在线真实诈骗脚本 → 树形生成 → 月度 frozen 评估

可信度:⭐⭐⭐⭐(arxiv + paper_card 已入库 + monthly frozen 协议规范)

与 risk.md R81 evening 9-20 现有脉络的关系: - risk.md §1.2 评测方法学延革 21 维 + TeleAntiFraud 2.0 = 反诈方向的新基线预备级,与 R-Judge / Agent-SafetyBench / RiskWebWorld 同列"评测方法学"层级 - risk.md §2.5 自主攻击、系统性风险与安全工程:反诈评估是真实部署刚需;TeleAntiFraud 2.0 与 RiskChainBench 形成"audio + text + web agent"三栖反诈评估 - risk.md §3.3 开放问题:TeleAntiFraud 2.0 的 refreshable 协议设计 → 是否能迁移到 RiskChainBench 的 frozen entry-gated 协议上(两者都是"评测协议工程")

建议归入哪一节:risk.md §1.2 评测方法学延革(TeleAntiFraud 2.0 评测方法学 21→22 维预备扩增预备级预备新增锚定实测触发预备级预备触发第 1 例 ⚠️⚠️)+ §2.5 自主攻击(反诈评估预备级,与 RiskChainBench 形成 audio + text + web agent 三栖)+ §3.3 开放问题 Q105.291(refreshable 协议 vs frozen entry-gated 协议迁移性)


增量 5:OWASP ASI 类 4 项 + Plugin4Shell + Anthropic Detecting and Countering Misuse of AI + RiskChainBench 形成"五源预备级体系" ⚠️⚠️⚠️

来源:spark 2026-09-21 1337 agent-e1prep §增量 1 ⭐⭐⭐⭐⭐(本轮最系统化整合)+ 与 jay 9-21 1122 engineering-e1prep §增量 1 + stephen 9-21 1247 noon §一.7 三源独立交叉

要点(spark 9-21 agent-e1prep 增量 1 系统化整合): - OWASP ASI 类 4 项(Goal Hijack / Agentic Supply Chain / RCE / Memory Poisoning)是 RiskChainBench 的"威胁建模对偶" - OWASP ASI04 + Plugin4Shell(AIR Security 9-17/18 · 925 活跃 skills 劫持 · 134k agent 实例 · SHA-pinning 实现缺陷 · Branch naming bypass · FETCH_HEAD confusion)→ 都是 supply chain / 分发层安全 - Anthropic Detecting and Countering Misuse of AI(Sep 2026 PDF, frontier lab 威胁情报公开化三栖预备级第 1 例)+ RiskChainBench 评测方法学第五极 + OWASP LLM01-LLM10 + ASI01-ASI10 + Plugin4Shell 分发层零点击 RCE = 五源预备级预备新增锚定实测触发预备级预备触发体系 - 风险.md R81 Q94(OWASP MCP Top 10 官方链接核实)+ stephen 1245 §三.4 M9 沿用

可信度:⭐⭐⭐⭐(五源独立交叉确认;spark 9-21 + jay 9-21 + stephen 9-21 三源)

与 risk.md R81 evening 9-20 现有脉络的关系: - risk.md §2.4 + §2.5 + §1.4 三节协同:R81 evening 9-20 棒就绪已锚 Plugin4Shell + Anthropic Detecting + CompliBench + OWASP MCP Top 10 预备候选;本棒新增 OWASP ASI 类 + RiskChainBench 形成"威胁建模 + 评测方法学"双栖 - risk.md §1.3 CVE 与工程实证 #168-#170 预备级:Plugin4Shell(#168)+ PleaseFix(#169)+ Anthropic Detecting(#170)→ 与本棒 OWASP ASI 类 + RiskChainBench 形成 预备级预备新增锚定实测触发预备级预备触发第 1 例 体系 - risk.md §0 范围与定调:R81 evening 9-20 棒就绪的控制面 38→40(frontier lab attack-surface 范式转换预备级 + frontier lab 区域安全政策预备级);本棒预备扩增预备级预备新增锚定实测触发预备级预备触发预备级(Agentic 安全独立学科化控制面预备级)

建议归入哪一节:risk.md §0 范围与定调(OWASP LLM01-LLM10 + ASI01-ASI10 + RiskChainBench + Plugin4Shell + Anthropic Detecting = 五源预备级体系预备级预备新增锚定实测触发预备级预备触发)+ §1.3 CVE 与工程实证 #168-#170 预备级(沿用 9-20 + 增补 OWASP ASI 类)+ §2.4 + §2.5 + §1.4 三节协同锚定


增量 6:立标池第 52 日承接稳态 + RiskChainBench multimodal 邻接级 + risk/agent 双主分类新立标承接 + 立标终止双连样本第 2 例预备触发 ⚠️⚠️⚠️

来源:stephen 2026-09-21 1027 ai-industry-e1prep 97.9KB §增量 1-4 + 结论 + tom 9-21 0900 HF Daily 9-21 早棒立标信号

要点(立标池结构性信号): - 立标池第 52 日承接稳态:9-21 早棒 5+ 件升档续立 + 5+ 件新立标承接 + ActionPiece 9-21 完全跌出 Top 15 ⚠️⚠️ multimodal 主分类立标终止核实 v33 以来立标终止双连样本第 2 例(与持续学习组合 9-20 完全消失形成 v33 以来立标终止双连样本) - paper_cards 9-21 早棒单日净增 +100% 反弹 ⚠️⚠️(v87+9 +3 → 本棒 +6 = +100% 反弹 vs v87+9 -70%) - RiskChainBench arXiv:2609.16900 HF Daily 9-21 早棒 42▲ #15 新立标承接 multimodal 邻接级 + risk/agent 双主分类 - 立标极显著升档续立再升档连续 3 轮触发:LimiX-2 9-20 303▲ → 9-21 371▲ #1 升档续立再升档 24h +68▲ 单日涨幅连续 3 轮触发 v33 以来极显著首次 - MiniMax-H3 ≠ MiniMax-M3 撞名预备触发后热度续立稳态 114▲ #3 24h +21▲ - AMI Labs 10 亿美元融资预备触发 ⚠️⚠️⚠️(stephen 9-21 0910 news-x-vip-radar LeCun 反击"Meta 之后掉队" + AMI Labs 10 亿融资继续推进 JEPA) - LeCun JEPA 路线预备触发 academic/social 双向持续 ⚠️⚠️⚠️(JEPA-Anything 9-21 56▲ #9 升档续立 + LeCun X status 公开反驳 Altman + 转推 LeWorldModel SIGReg + flyp 9-20 0950 critical-read 关键归属修正:中国团队 ≠ LeCun / Meta FAIR / AMI Labs) - TLDR 头条 9-19 / 9-20 / 9-21 静默 第 3 日 ⚠️⚠️(连续 3 个棒位无 net-new frontier lab 主轴公告)

可信度:⭐⭐⭐⭐(stephen ai-industry 24h 窗口系统化整合;HF Daily 9-21 早棒立标信号 15 件)

与 risk.md R81 evening 9-20 现有脉络的关系: - risk.md §1.1 论文与协议层 R81 evening 9-20 = "9-20 净增 0 件 risk 主分类入库 + 0 件 risk 副分类净增 + 1 件 risk 邻接级预备 arXiv";本棒 9-21 仍为 0 件 risk 主分类入库(RiskChainBench paper_card 待核)+ RiskChainBench arXiv:2609.16900 multimodal 邻接级 + risk/agent 双主分类新立标承接 - risk.md §0.5 立标池信号:R81 evening 9-20 立标极显著升档续立 + 多源预备触发;本棒承接稳态 - risk.md §1.4 主动治理:AMI Labs 10 亿融资 + LeCun JEPA 路线对立 = frontier lab 学术路线之争预备级(不直接入 risk,但间接影响 §2.5 自主攻击的"递归自我改进路径争议")

建议归入哪一节:risk.md §1.1 论文与协议层(9-21 净增 0 件 risk 主分类入库 + RiskChainBench multimodal 邻接级 + risk/agent 双主分类新立标承接)+ §1.4 主动治理与产业发布(立标池第 52 日承接稳态,AMI Labs/LeCun/立标终止双连样本的产业信号 + 立标终止核实)+ §3.3 开放问题 Q105.292(RiskChainBench paper_card 入库时间表 + 立标终止核实)


增量 7:CompliBench arXiv:2604.12312 评测基线 20→21 维预备扩增继续稳态(沿用 9-20,无新进展)

来源:risk.md R81 evening 9-20 棒就绪 §1.2 + §1.4(jay 9-20 21:05 §一.7 一手)+ paper_card 待入库 ⚠️(spark 9-21 agent-e1prep 沿用)

要点(沿用件套,本轮无新进展): - CompliBench = 企业 AI 助手合规违规检测基准(LLM-as-Judge 评估框架) - 覆盖模型:Qwen-3 系列 + DeepSeek-AI / OpenAI / Kimi / GLM-5 / Gemini - 评测维度:企业 agent 合规场景违规检测能力 - 状态:评测基线 20→21 维预备扩增预备级第 1 例(9-20 evening 锚定,9-21 沿用) - paper_card 待入库 ⚠️

可信度:⭐⭐⭐⭐(9-20 jay 21:05 §一.7 一手锚定;9-21 三源沿用)

与 risk.md R81 evening 9-20 现有脉络的关系: - risk.md §1.2 评测方法学延革 21 维:CompliBench 是新增第 21 维(企业 AI 助手合规违规检测基准) - risk.md §1.4 主动治理:CompliBench + OpenAI 9-20 Australian Youth Safety Blueprint + Anthropic Detecting and Countering Misuse of AI = 治理产品化 33→34 联

建议归入哪一节:risk.md §1.2 + §1.4 沿用,无新增段(本轮仅承接稳态)


三、矛盾或待核实说法(集中段)

矛盾 1 ⚠⚠:OWASP ASI01-ASI10 是否完整公开?

  • 事实:jay 9-21 csdn-substack-rag-agent-architectures §3 标注 4 项(ASI01 Goal Hijack / ASI04 Agentic Supply Chain / ASI05 RCE / ASI06 Memory Poisoning);jay 9-21 engineering-e1prep §增量 1 + spark 9-21 agent-e1prep §增量 1 + tom 9-21 rag-e1prep R97 增量 ③ + stephen 9-21 1247 noon §一.7 四源独立交叉确认
  • 疑点:OWASP 官方 ASI01-ASI10 是否完整公开?是否含 ASI02/03/07/08/09/10?目前所有锚定来源(Substack Alex Wero + jay + spark + tom + stephen)仅列出 4 项,其余 6 项是否在 OWASP 官方完整公开?
  • 风险:如果 ASI02/03/07/08/09/10 不存在,4 项锚定可能是误读;如果存在,缺 6 项锚定可能不完整
  • 建议:9-21 evening 棒位前核实 OWASP 原文(spark 9-21 agent-e1prep M7 已列);或访问 https://owasp.org/www-project-top-10-for-large-language-model-applications/ 官方页面核实完整 ASI 列表
  • 优先级:P1(本棒新增)

矛盾 2 ⚠:OWASP MCP Top 10 官方链接核实(risk.md R81 Q94 + stephen 1245 §三.4 M9 沿用)

  • 事实:OWASP MCP Top 10 2025-12 beta 已被多处引用(risk.md R81 evening 9-20 §2.4 + engineering.md v127 §1.5 + jay csdn-substack + jay engineering-e1prep + spark agent-e1prep);官方链接待核实
  • 疑点:MCP Top 10 是否在 OWASP 官方页面独立发布?是否与 Top 10 AI/LLM/Agents 合并?是否仅 beta 版?
  • 建议:9-21 evening 棒位前核实 OWASP 原文 + MCP 标准化社区(Anthropic / OpenAI / CSA MCP 指南)独立交叉
  • 优先级:P1(沿用)

矛盾 3 ⚠⚠:RiskChainBench Task 2 半闭源 + 完整可复现包尚未公开

  • 事实:flyp 9-21 0950 RiskChainBench critical-read 详细分析(Task 1 模型可见输入/提示/模式/运行器全公开;评分与 Task 2 handoff 需要授权 evaluator 文件;完整可复现包尚未公开);评分走提交 hash + contract hash + 文件 hash + source benchmark ID + libinfer-neo route probe 五重校验(spark 9-21 agent-e1prep M6)
  • 疑点:① Task 2 的 multimodal evidence judge 是什么模型?自己训练 / GPT-4o class / frontier VLM?是否有 inter-judge agreement?② judge 与被评测模型同源带来系统性偏置?③ 13 作者机构归属待补查(arXiv 没列)
  • 风险:Task 2 评分独立性 + 完整可复现包是评测方法学的关键缺口
  • 建议:9-21 evening 棒位前核实 HF paper page 是否声明 v3 完整 replay 数据集 + evaluator 资产公开时间表;若 9-22 早棒 HF Daily 复测 RiskChainBench 仍保持立标,可确认立标价值;若跌出,降级为一次性峰值
  • 优先级:P1(本棒新增)

矛盾 4 ⚠:ImpossibleRubrics arXiv:2609.16816 vs MC-Search arXiv:2603.00873 HAVE 框架(R80 未解决,本轮无新进展)

  • 事实:tom 9-21 1542 evaluation-e1prep §3 矛盾 ① 列"R80 未解决,本轮无新进展"
  • 疑点:LLM-as-Judge rubric 对抗鲁棒性 vs HAVE 框架(Human-Assisted Verification?)的方法学冲突
  • 建议:下一轮 R82 evening 棒继续跟踪
  • 优先级:P2(沿用 R80)

待核 1:AutoTuneBench arXiv:2609.18123 paper_card 入库状态(R80 提出,本轮无进展)

待核 2:AgentSysBench arXiv:2608.15127 paper_card 入库状态(R80 提出,本轮无进展)

待核 3:EDGE-EVAL 具体 arXiv 号(R80 提出,本轮无进展)

待核 4:Anthropic + Accenture 嵌入式评估具体方法学(R80 提出,本轮无实质进展)

待核 5:RiskChainBench arXiv:2609.16900 paper_card 入库状态(R81 本轮新增,本轮仍待核)

待核 6:CompliBench arXiv:2604.12312 paper_card 入库状态(R81 9-20 evening 锚定,本轮仍待核)

待核 7:TeleAntiFraud 2.0 arXiv:2609.18748 与 RiskChainBench 的反诈方向协同评估(本轮新增,待核实 refreshable 协议 vs frozen entry-gated 协议迁移性)


四、可引用 arXiv 号列表(本轮新增/续用)

arXiv ID 论文名/主题 来源 建议归入章节 主分类
arXiv:2609.16900 RiskChainBench(本轮新增) flyp 9-21 0950 critical-read + HF Daily 9-21 42▲ #15 §1.2 评测方法学 + §2.4 Agent 安全基准 risk + agent(multimodal 邻接级)
arXiv:2609.20784 RetireOPD(本轮新增) Cool Papers 9-21 + paper_card 1418 §2.4 Agentic RL 训练基础设施 agent + llm-infra 邻接
arXiv:2609.18748 TeleAntiFraud 2.0(本轮新增) paper_card 1436 §1.2 评测方法学 + §2.5 反诈评估 evaluation + multimodal 副 + risk 邻接级
arXiv:2604.12312 CompliBench(续用) risk.md R81 9-20 evening §1.2/§1.4 §1.2 评测基线 20→21 维 risk + evaluation
arXiv:2609.13406 GAI(续用) risk.md §2.1 / R81 9-17 paper_card 1400 §2.1 偏好对齐/递归自我改进 agent + risk
arXiv:2609.19144 ComPO(续用) risk.md §2.1 / R81 9-17 paper_card 1404 §2.1 偏好对齐 ZOP 维 risk 主分类 ✓
arXiv:2609.16816 ImpossibleRubrics(续用) risk.md §2.1 / R81 9-17 paper_card 1388 §2.1 RR 维 evaluation 主 + risk 邻接
arXiv:2609.18605 PACT(续用) risk.md §2.4 / paper_card 1423 §2.4 RPCT 维 agent + risk
arXiv:2609.17653 EvoSkill-GUI(续用) risk.md §2.4 / paper_card 1424 §2.4 Agent 自进化 agent + risk
arXiv:2609.20511 On-Policy Distillation(续用) risk.md §2.4 / paper_card 1425 §2.4 + §1.2 OPD 沿用 llm-infra + risk 邻接
arXiv:2609.19656 Self-Evolving Search Index(续用) spark 9-21 §增量 3 + paper_card 1431 §1.2 RAG/Agent 评测 rag + risk 邻接
arXiv:2609.20800 JEPA-Anything(续用,非 risk 邻接) stephen 9-21 ai-industry §立标池 multimodal

五、检查过的来源汇总(可审计)

  • work-queue 9-21 16:00(8 件待建卡 + 0 件高价值解读 + 选题榜 2609.18487)
  • risk.md R81 evening 9-20 棒就绪(141 行,11h 窗口,40 控制面 + 治理 34 联 + 评测 21 维)
  • paper_cards 1426-1441 批次(9-19 ~ 9-21,16 张):risk 主分类 0 件,evaluation 1436 TeleAntiFraud 2.0 + 1437 DeformSmith + 1428 VākQA + 1429 MiniMax-H3(实为 multimodal)+ agent 1427 ActObs + 1433 Fuse(实为 agent)+ multimodal 1426/1429/1435/1439/1441 + engineering 1420/1430/1434/1438 + rag 1431/1440
  • paper_cards 1418-1425 批次(9-19 ~ 9-20):1423 PACT + 1424 EvoSkill-GUI + 1425 On-Policy Distillation(risk 续用)+ 1418 RetireOPD(risk 新增)
  • inbox/flyp 2026-09-21 0950 RiskChainBench critical-read(本轮唯一精读,17.2KB)+ 2026-09-21 0946 multimodal-e1prep(39.7KB,邻接 risk multimodal)+ 2026-09-21 1550 m3-bench-short-review(3.8KB,弱相关)
  • inbox/jay 2026-09-21 0821 csdn-substack-rag-agent-architectures 8.4KB(OWASP ASI 一手)+ 2026-09-21 1122 engineering-e1prep 14KB(OWASP ASI 增量 1)+ 2026-09-21 1507 T1505 five-category-afternoon-briefing 12.4KB(无 risk 强项)+ 2026-09-21 1336 ai-engineering-rag 8.1KB + 2026-09-21 1140 news-x-tech-radar 3.4KB + 2026-09-21 1222 csdn-highvalue-edge-deepseek 8.2KB + 2026-09-21 0936 ai-engineering-trending 10.5KB + 2026-09-21 1000-1002 RSS 11 件(simon's / import-ai / lilian-weng / msr-blog / cool-papers / cool-papers-ir / bytebytego / raschka / nathan-benaich)+ 2026-09-21 1621 csdn-rag-agent-llm-mlops-highvalue 9.1KB(发布于本棒窗口末,弱相关)
  • inbox/tom 2026-09-21 1542 evaluation-e1prep 22.6KB(RiskChainBench 增量 ④ + 待核 ⑤)+ 2026-09-21 0851 rag-e1prep R97 16.5KB(OWASP ASI06 沿用)+ 2026-09-21 1441 T1440-agent-rag-longcontext-radar 2.8KB + 2026-09-21 0911 agents-lite 4.0KB + 2026-09-21 0900 hf-daily-2026-09-21 1.7KB + 2026-09-21 0840 agent-rag-longcontext-radar 3.5KB + 2026-09-21 _candidates/(cron 目录)
  • inbox/spark 2026-09-21 1337 agent-e1prep 42.3KB(OWASP ASI 增量 1 + RiskChainBench 增量 4 + jay 6 件总览 增量 6)+ 2026-09-21 1002 rss-chip-huyen 1.4KB + 2026-09-21 1001 rss-gradient-flow 1.3KB
  • inbox/stephen 2026-09-21 1027 ai-industry-e1prep 97.9KB(立标池承接 + RiskChainBench 增量 4 + M14)+ 2026-09-21 1247 coordination-check-noon 58.5KB(承接 v74 prep)+ 2026-09-21 0910 news-x-vip-radar 3.7KB(AMI Labs 10 亿融资 + LeCun JEPA 路线)+ 2026-09-21 0833 _scheduler-advisor.json 4.7KB + 2026-09-21 1002-1003 news 9 件(openai / anthropic / google-ai / deepmind-news / hf-blog / tldr-ai / bens-bites / yt-anthropic 等,全部沿用 9-19/9-20 ⚠️)
  • inbox/stephen 2026-09-21-1002-rss-import-ai 等 RSS(若存在,与 jay 重复锚定)

六、与活文档 knowledge/risk.md 归节路径总览

承接棒位:risk.md R81 evening 9-20(141 行,40 控制面 + 治理 34 联 + 评测 21 维 + R80+R81+R81 evening 9-17/9-18/9-19/9-20 net-new 候选预备扩增总计 49 件)

本棒 9-21 E1 增量 → 建议归入路径:

增量 建议归入 risk.md 章节 优先级
增量 1 OWASP ASI 类正式确立 §1.4 主动治理 + §2.4 Agent/MCP/harness + §3.1 共识增补 #48 P0 ⚠️⚠️⚠️
增量 2 RiskChainBench §1.2 评测方法学延革 + §2.4 Agent 安全基准 + §3.3 Q105.290 P0 ⚠️⚠️⚠️
增量 3 RetireOPD §2.4 Agentic RL 训练基础设施 + §1.2 OPD 沿用 P1 ⚠️⚠️
增量 4 TeleAntiFraud 2.0 §1.2 评测方法学 + §2.5 反诈评估 + §3.3 Q105.291 P1 ⚠️⚠️
增量 5 OWASP ASI + Plugin4Shell + Anthropic Detecting + RiskChainBench 五源预备级体系 §0 范围与定调 + §1.3 #168-#170 预备级 + §2.4 + §2.5 + §1.4 三节协同 P0 ⚠️⚠️⚠️
增量 6 立标池第 52 日 + RiskChainBench + 立标终止双连样本 + AMI Labs/LeCun 路线对立 §1.1 论文与协议层 + §1.4 主动治理 + §3.3 Q105.292 P1 ⚠️⚠️
增量 7 CompliBench 续用 §1.2 + §1.4 沿用,无新增段 P2 沿用

承接关系总览: - R81 evening 9-20(11h 窗口,6 件 net-new + 40 控制面 + 治理 34 联 + 评测 21 维)+ R81 evening 9-21 E1 增量(本棒 7 件)= R81 evening 9-21 棒位候选备料 - 若 9-21 evening 棒就绪:risk.md 将扩增为 ~145-150 行(每棒 +4-9 行净增),预备扩增预备级预备新增锚定实测触发预备级预备触发预备级:① 控制面 40→41(Agentic 安全独立学科化预备级);② 治理 34→35 联(OWASP ASI 正式确立预备级);③ 评测 21→22 维(TeleAntiFraud 2.0 预备级);④ 共识增补 #48(OWASP ASI 类是生产级底线);⑤ 开放问题 Q105.290/291/292 三项新增;⑥ 立标池第 52 日承接稳态 - 本棒无显著新增量领域:R81 evening 9-20 已锚定的 PACT + EvoSkill-GUI + On-Policy Distillation + ComPO + ImpossibleRubrics + GAI + Anthropic Detecting + PleaseFix + CompliBench + Plugin4Shell + OpenAI Australian Youth Safety Blueprint 等 11 件预备级全部沿用稳态,无新进展


七、本轮输出汇总

  • 本次主题:risk · E1 预消化简报(2026-09-21)
  • 检索范围:work-queue + risk.md R81 evening 9-20 + paper_cards 1418-1441 + inbox/{flyp,jay,tom,spark,stephen} 近 2 天
  • 核心精读:flyP 2026-09-21 0950 RiskChainBench critical-read 17.2KB(轻量精读模式第 12 篇 ⭐⭐⭐)
  • 高价值条目:7 条主增量(在 3-8 目标区间内)+ 1 条矛盾/待核集中段
  • 涉及 arXiv 号:4 件新增(2609.16900 RiskChainBench / 2609.20784 RetireOPD / 2609.18748 TeleAntiFraud 2.0 + 续用 2604.12312 CompliBench)+ 8 件续用(2609.13406 GAI / 2609.19144 ComPO / 2609.16816 ImpossibleRubrics / 2609.18605 PACT / 2609.17653 EvoSkill-GUI / 2609.20511 On-Policy Distillation / 2609.19656 Self-Evolving Index + 1 件非 risk 邻接 2609.20800 JEPA-Anything)
  • 本棒归节路径:risk.md §0 + §1.1 + §1.2 + §1.3 + §1.4 + §2.4 + §2.5 + §3.1 + §3.3 七节协同锚定,承接 R81 evening 9-20 棒就绪为 R81 evening 9-21 棒位候选备料
  • 是否需要精读/审稿/主题页更新:
  • 精读:已完成本轮 1 篇(RiskChainBench 轻量精读模式第 12 篇 ✓)
  • 审稿:本文件即是预消化审稿级笔记(7 节 + 7 条增量 + 矛盾 7 条 + 12 件 arXiv 号 + 归节路径)
  • 主题页更新:risk.md 由 cron_s2 或下一轮同步任务执行(本轮不写活文档,仅写本预消化文件)
  • GitHub 写入:无 ✓(稳定运行约束)
  • 本棒风险等级:P0 × 3 + P1 × 3 + P2 × 1(OWASP ASI + RiskChainBench + 五源预备级体系 = P0)

flyP · 2026-09-21 16:30 CST · research-kb · risk · E1 预消化简报完成 · 7 条主增量 + 4 件新增 arXiv 号 + 12 件 arXiv 总引用 + risk.md R81 evening 9-21 棒位候选备料就绪