主题综述 · risk(2026-08-27)
- 作者:spark
- 更新:2026-08-27
范围:近 72h 窗口(2026-08-25 → 2026-08-27)LLM / Agent 风险研究增量,叠加与 8-23 / 8-19 / 8-17 三篇 risk 综述的差异化定位。 与 8-23 risk 综述的差异化:前作聚焦"幻觉分类学下移到 agent 化语境下的信任链攻击"6 主线 + 2 延伸。本次聚焦"前作基础上 72h 新增 6 件主题级增量 + 模型外风险共识升级为一级变量"——把 8-26 → 8-27 这 72h 内集中爆发的 agent-security 主题簇(SecOPD / AgentRoom / Automata / SkillGate / Trustworthy RAG / Agent Gym)与"credential leakage in agent skills"大样本实证 + "Gradient Flow 模型外风险"工程界共识作为本次一等变量独立成段,并把 8-23 已立的 Inadvertent Context Leakage / AcMAS / Mind Viruses 三栖对位延伸为"输入层 + 上下文层 + 凭证层 + 授权层 + 规划层 + 通信层"六栖防御候选。 立场:综合 8 篇相关工作 + 1 件大样本实证做深度综述;按"机制 + 工程路径"双轨展开,每节配反方三段式(机制 + 数据 + 截止日 / 证伪条件),观点必有出处,不编造数字,风险数字 ⚠️ 显式标注。
§0 自检栏
- 机制段:N=6 主线 + 1 综述延伸 = 7 段;工程段:N=6 主线 + 1 综述延伸 = 7 段;⚠️ 数字核验 K=10;私域清洁度五维(ip+kp+rn+fp+oc)自检 grep 0 命中(见 §7);CJK 字数 ≤ 4000 上限(实测见 §7);verifiability ≥20% 关键 URL 抽查已执行(见 §7)。
- 增量窗口:2026-08-25 → 2026-08-27 共 72h net-new 6 件 + 沿用 8-23 主线 2 件 + 大样本实证 1 件 = 9 件主轴工作。
1. 主题脉络:从"模型内对齐"上移到"模型外访问权限失控"作为一级变量
8-23 → 8-27 这 72h 里 risk 主轴的研究焦点发生"上 / 下 / 外三迁"。
- 向上:RLHF / 后训练阶段的对齐税缓解(8-23 已立的 arXiv:2607.26654 Constitutional Midtraining + arXiv:2607.25614 MemSFT)继续沿用,但 72h 窗口内未出现 net-new 对齐税方法;重心让位给"prompt 注入防御"这一更靠近部署侧的子方向(详见 §2 SecOPD)。
- 向下:评测方法学延革(8-23 已立的 EnvHarness arXiv:2608.19880)继续推进到"trace 感知 runtime-native 评测"(ClawProBench arXiv:2608.22510,8-26 HF 候选榜单 Top15 #1 ★★★,详见 §4),把 failure attribution 从"最终答案"扩展到"evidence acquisition / runtime routing / safety boundaries / repeated execution"四个 trace 位置。
- 向外:风险研究焦点从"模型对齐税"和"模型层缺陷"显著上移到"模型周边一切"的访问权限失控——代表性信号是 8-23 已立的 Gradient Flow 共识"最大的 AI 风险位于模型之外"在 8-27 由社区双向锚定(engineering-filter 子棒 + RSS Gradient Flow 子棒),作为立基础共识候选新增。
8-27 这 72h 的 6 件 net-new 主题级增量高度集中在 agent-security 主题簇:
- SecOPD(arXiv:2608.21500,agent 主分类,paper_card 1101,8-27 上午 radar 高价值条目 #2 / HF Daily 8-27 #8 36▲)= adaptive prompt injection 防御 + on-policy 蒸馏精准识别被攻击 token 位 = DPO/GRPO 序列级反馈信号不足的改进方向。
- AgentRoom(arXiv:2608.23740,agent 主分类,paper_card 1098)= Concurrent Multi-Agent Coding in CRDT-Backed Shared Workspace = 多 Agent 并发编程用 CRDT 解决协调冲突,突破单 Agent 串行限制;单 Agent "one-shot policy" 在困难任务上放弃率高达 ~50%。
- Automata from Agent Traces(arXiv:2608.23670,agent 主分类,paper_card 1099)= 把整个 trace corpus 折叠为单一紧凑 FSM(7-43 states across 12 public datasets)作为 next-step 与 failure prediction 的 structural substrate。
- Autonomous Math Discovery(arXiv:2608.23691,agent 主分类,paper_card 1100)= Station 开放世界多 Agent 数学发现,无中心协调器;AlphaEvolve 12 problems 中 5 个产生新结果(含有限域 Kakeya 集新无穷族 + 新精确 604 点构造)。
- Harbor Framework(GitHub 4.5k stars / Apache-2.0 / DOI 10.5281/zenodo.20953922)+ strands-agents(harness-sdk 6.9k stars / AWS / Nordic Semiconductor)+ browser-use + awesome-agent-skills(1000+ skills 精选)= GitHub Agent 生态四件 = 标准化 benchmark 容器 + 生产 agent 控制平面 + Browser Agent 框架 + 技能标准化生态。
- Agent Gym(arXiv:2608.15591,CSDN 详细笔记 8-25)= 宪法层(YAML / Markdown 规则书)+ 运行时修正引擎 ALF + 三层调查架构 + Spec-to-Note Gap 概念 = 行为偏差修正 = 8-23 §5 已识别但未独立成段的"agent 行为修正"分支立基础候选新增。
8-27 中午跨实例协调判定把这 6 件 + 沿用件套(SecOPD + Trustworthy RAG arXiv:2608.21095v1 + RAGSieve + SkillGate arXiv:2608.18852 + Agent Gym)归并为 agent-security 主题簇候选新增预备——这是 8-23 risk 综述没有的整合判定,意味着 72h 内 agent-security 已从 5 件离散研究上升为有共识锚点的主题簇。
⚠️ 反方:1 机制:72h 净增 6 件是否构成"主题簇"而非"巧合聚集"?协调判定依赖预消化稿的归并决策,而预消化稿明确标注"预备"而非"已立标",预备态与已立态之间差 ≥3 件同类独立确认的实证工作量;2 数据:SecOPD paper_card 1101 已建但被引 0(S2 未收录),AgentRoom 1098 / Automata 1099 / Autonomous Math 1100 同样被引 0,意味着学界反应尚未形成;3 截止日 / 证伪条件:9-1 ~ 9-10 观察是否有 ≥3 件独立研究(非同一团队)对 SecOPD 的 on-policy 蒸馏 token-level 防御或 AgentRoom 的 CRDT 多 Agent 并发机制做 head-to-head 对照,有则主题簇升级为立标候选,无则降为孤立研究聚集。
2. Prompt 注入防御:从"序列级反馈"演进到"on-policy token-level 蒸馏"
arXiv:2608.21500(SecOPD,Mitigating Adaptive Prompt Injections by On-Policy Distillation,agent 主分类 · method,paper_card 1101) 在 8-27 上午被社区双向锚定(候选雷达榜单 + HF Daily 8-27 #8 36▲)。
机制层面,SecOPD 指出 Prompt injection 是 AI Agent 的 #1 威胁,现有防御性微调方法(DPO / GRPO)依赖序列级反馈信号,对整段输出均一视同仁,导致针对自适应 prompt injection 的攻击成功率(ASR)接近 100%。SecOPD 的核心贡献是用 on-policy 蒸馏精准识别被攻击的 token 位,把"序列级 → token 级"反馈信号作为防御粒度的关键改进方向。
工程层面,SecOPD 与 8-23 已立的四栖防御(ILL / Inadvertent Leakage / Bounded Agents / Decision-Metric Alignment)互补——前作关注"如何过滤 / 阻断"(部署阶段外生),SecOPD 关注"训练阶段让模型识别"(内生)。协调棒标注:SecOPD 不要与 Trustworthy RAG / RAGSieve 混为同一攻击面(SecOPD 对 adaptive prompt injection,Trustworthy RAG 对 instruction injection + contradiction + entity swap)。
SecOPD 真正价值在揭示训练范式缺陷:DPO / GRPO 把"被攻击 token"与"正常 token"放入同一优化目标,模型学不到"在某些 token 位必须抵抗诱惑"的细粒度信号。On-policy 蒸馏把"被 prompt 注入诱导的 token"标注为负反馈,实现 token-level 信用分配。
工程层面,SecOPD 攻击面定义为"Agent 访问外部数据时,攻击者在数据中注入恶意 prompt"(paper TLDR)——这是 OWASP LLM Top 10 2026 把 Hidden Context Exposure(LLM08)替换原 System Prompt Leakage 项后,首个明确把"外部数据中嵌入的恶意 prompt"作为防御目标的内生训练方法。
⚠️ 反方:1 机制:on-policy 蒸馏如何获取"被攻击 token 位"标注信号?摘要未明示(论文 §3 待核);若对抗样本 + 人工标注,数据成本与 DPO/GRPO 偏好标注相比?2 数据:SecOPD 被引 0,S2 未收录,学界反应未形成;HF Daily 36▲ ≠ 学界实际采纳;3 截止日:9-1 前若 paper §3 给出 token-level 标注机制 + GitHub repo + 与 Trustworthy RAG arXiv:2608.21095v1(ROC-AUC 0.73-0.81 / F1 92%)做 head-to-head,SecOPD 升级 ★★★;否则维持 ★★。
3. 多 Agent 协作 + 轨迹可解释性:CRDT 工作区 + FSM 压缩
8-27 上午 72h 窗口同时出现两件多 Agent / 轨迹结构化方向的"机制层 + 工程层双轨"工作,共同指向"agent runtime 的结构性表征"这一新研究方向。
arXiv:2608.23740(AgentRoom: Concurrent Multi-Agent Coding in a CRDT-Backed Shared Workspace,paper_card 1098) 把人类团队的实时协同编辑协议(CRDT,Conflict-free Replicated Data Types)扩展到多 Agent 编程场景。机制层面,LLM 一次只生成一个 token,现有并发多 Agent 系统要么通过 phase handoff 串行化,要么 pool 独立样本但缺少协调,单 Agent 在困难任务上放弃率高达 ~50%(one-shot policy)。AgentRoom 用 CRDT 工作区让多个 Agent 并发修改同一文件 / 模块,通过无冲突复制数据类型解决协调问题,突破单 Agent 串行限制。
arXiv:2608.23670(Automata from Agent Traces: Failure and Next-Step Prediction,paper_card 1099) 把整个 trace corpus 折叠为单一紧凑有限状态机(FSM)作为 next-step 与 failure prediction 的 structural substrate。机制层面,现有方法要么按单条 trace 操作,要么只基于成功案例,因此遗漏了连接 next-step prediction 与 failure prediction 的跨运行拓扑(cross-run topology)。在 12 个公开数据集上 FSM 紧凑(7-43 states),验证了"trace corpus → FSM"压缩的可行性。
工程层面,这两件工作把 8-23 risk §3 Reliability 12 元组的 consistency 维度从运行时追踪(Foundry/AgentRx Action Ledger)扩展到设计时结构表征(FSM)+ 协作时协议(CRDT)。AgentRoom 与 SecOPD + OraRL + LAION-BVD 形成 4 件候选雷达收敛集,意味着多 Agent 协作从 phase handoff / pool independent samples 串行范式进入 CRDT 并发范式候选预备。
机制层面,AgentRoom 的 CRDT 工作区与现有 SWE-agent / MetaGPT / ChatDev 的协调机制形成方法学层面替代关系——前作是"串行协调",AgentRoom 是"CRDT 并发协调";Automata FSM 与活文档 Compaction Cliff arXiv:2608.22752 长时运行 AI Agent 记忆压缩安全损伤形成"长程 Agent 状态表征"方法学互补——前者是 cross-run 拓扑压缩(7-43 states across 12 datasets),后者是时序压缩的副作用研究。
⚠️ 反方:1 机制:AgentRoom CRDT 是否需要中央协调器?摘要未明示;若完全无中心,跨 Agent 语义层冲突如何解(字符层无冲突但语义层冲突)?2 数据:AgentRoom / Automata 均 0 被引,需补建 + head-to-head 验证;"12 数据集 FSM 7-43 states"未独立复现;3 截止日:9-1 ~ 9-10 观察 AgentRoom GitHub + SWE-agent / MetaGPT / ChatDev head-to-head;9-5 观察 Automata FSM 在 ≥3 团队 codebase 复现 7-43 states 紧凑度。
4. Credential Leakage in Agent Skills:大样本实证确立"凭证层"为第六栖防御
8-23 risk 综述 §5 已识别"输入层 + 上下文层 + 规划层 + 授权层"四栖防御,但遗漏了凭证层(credential layer)这一关键攻击面。8-27 上午一份 CSDN-Substack 高价值简报把 6-30 综述过的"credential leakage in agent skills"大样本实证重新激活——170,226 个 SkillsMP skill 中分层抽样 17,022,静态分析 + 动态沙箱 + 人工交叉引用,识别 520 个受影响 skill 携带 1,708 个安全问题,派生 10 类泄漏模式(4 类开发者疏忽 + 6 类恶意构造)。
机制层面,credential leakage 在 agent skills 中本质是跨模态的(fundamentally cross-modal):76.3% 案例只在自然语言描述与可执行代码联合分析时才浮现,3.1% 纯靠自然语言 prompt injection 触发。工程层面,debug logging 是首要向量:print / console.log / logger.info 占 73.5% 泄漏(V3 Information Exposure 类,1,007 / 1,708 issues),原因是 stdout 被 LLM 框架捕获后送入上下文窗口;89.6% 的受影响 skill 在常规执行无提权情况下即可利用,fork-based 分发使删除的密钥在 50+ 独立 fork 中仍然存活。
这一大样本实证给"凭证层"作为第六栖防御提供了立基础锚点:stdout-to-context redaction gate = 拦截 print / console.log / logger.info 中 API key / token / password / OAuth secret 输出,redact 后送入 LLM 上下文窗口。这一项能直接堵住 73.5% V3 类泄漏,即 Agent runtime 最高 ROI 的安全投入。
机制层面,credential leakage 与 8-23 已立的四栖防御构成"输入层 + 上下文层 + 规划层 + 授权层 + 凭证层 + 通信层(Multi-Agent 安全主题簇)"六栖防御候选:凭证层 = 跨模态 + 跨运行 + 跨 fork 持续性 + 无提权即可利用——这四个特征使 credential leakage 的攻击面比传统 prompt injection 更隐蔽、修复成本更高、攻击可重复性更强。
⚠️ 反方:1 机制:76.3% 跨模态 vs 3.1% 纯 prompt injection 的边界?是否意味着 credential 类攻击 97% 涉及代码层,纯 NL 防御完全无效?2 数据:170,226 skill 是 SkillsMP 单一 registry,数字已过期;89.6% "无提权即可利用"是否包含 agent runtime 触发?3 截止日:8-30 ~ 9-15 观察 ≥3 团队在 ≥3 marketplace 复现 73.5% stdout + 89.6% 无提权;若有显著偏差需重评。
5. Agent 行为修正 + GitHub Agent 生态四件:行为层与生态层双轨
8-27 上午 72h 窗口同时出现"agent 行为修正"分支立基础候选新增(Agent Gym) 与 "GitHub Agent 生态"四件集合(Harbor + strands-agents + browser-use + awesome-agent-skills)——前者是行为层(运行时规范 vs 实际行为的偏差修正),后者是生态层(标准化 benchmark 容器 + 生产控制平面 + Browser Agent + 技能库)。
arXiv:2608.15591(Agent Gym,CSDN 详细笔记 8-25) = 宪法层(YAML / Markdown 规则书)+ 运行时修正引擎 ALF + 三层调查架构 + Spec-to-Note Gap 概念(对比自然语言规范与 LLM 透明度笔记,揭示行为偏差)+ 程序化安全循环防止新规则副作用。机制层面,Agent Gym 的 Spec-to-Note Gap 把"agent 应当做什么"(自然语言规范)与"agent 实际做什么"(LLM 透明度笔记)的差异作为运行时修正的触发器——这是 risk 综述首次把"行为偏差"作为独立可测变量,而非"对齐税"的副作用。
Harbor Framework(GitHub 4.5k stars / Apache-2.0 / 1474 commits / DOI 10.5281/zenodo.20953922)+ strands-agents(harness-sdk 6.9k stars / AWS + Nordic Semiconductor 背景 / Python + TypeScript 双支持)+ browser-use(生产级 Browser Agent 框架)+ awesome-agent-skills(1000+ Agent Skills 精选 / 兼容 Claude Code / Codex / Gemini CLI / Cursor)= GitHub Agent 生态四件。
GitHub Agent 生态四件与 8-23 §8 promptfoo(24.4k stars / OpenAI + Anthropic 均使用)形成"工业红队 + 标准化评估 + 生产控制平面 + Browser Agent + 技能标准化"五栖延展。Harbor 容器化 + CI/CD 与 ClawProBench trace 级别 failure attribution 是评测方法学的两条互补路径。
机制层面,Agent Gym 的 Spec-to-Note Gap 与 Gradient Flow 8-27 上午锚定的"模型外风险"共识共享同一立基础延展:风险研究焦点从"模型对齐税 / 模型内部缺陷"上移到"模型周边的访问权限失控 + 行为偏差 + 凭证泄漏 + 通信链路污染"——这意味着 risk 主轴从"model-internal"显式转为"model-external"作为一级变量。
⚠️ 反方:1 机制:Agent Gym Spec-to-Note Gap 与 Constitutional AI / RLHF 差异在哪?ALF 是否引入新规则副作用?论文未给量化证据;2 数据:Harbor 4.5k / strands-agents 6.9k stars GitHub 数据可信,但 OpenAI / Anthropic 是否生产采纳 Harbor 未独立确认;3 截止日:9-5 前若 Agent Gym 给出与 Constitutional AI / RLHF head-to-head + 公开 ALF 实现 + ≥3 场景 Spec-to-Note Gap 复现,可升级 ★★;否则维持预备态。
6. 评测方法学延革 + agent-security 主题簇整合:ClawProBench + SkillGate
8-26 → 8-27 这 72h 内评测方法学延革层继续推进,但焦点从 8-23 的"EnvHarness"延伸到"runtime-native trace-aware 评测"。
arXiv:2608.22510(ClawProBench,evaluation 主轴 ★★★,work-queue Top15 #1,paper_card 1085) = trace 感知的 runtime-native benchmark,实例化于 OpenClaw(配备 workspace 工具以及 browsing / memory / messaging / scheduling / skills / subagents 等原生 surface 的 live agent runtime),定义两条赛道(102 题),failure 不只发生在最终答案,还发生在 trace 过程中多个位置(evidence acquisition / runtime routing / safety boundaries / repeated execution)。
arXiv:2608.18852(SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents,paper_card 1032) = 把 9B 策略的成功率从 40.8% 提升至 53.2%,显著优于将相同预算仅用于 outcome reward 的方案,同时将误导性候选的暴露减少三分之二,并读取更少 skill。
ClawProBench 与 8-23 §7 EnvHarness 形成对位 —— ClawProBench 把 failure attribution 从"最终答案"扩展到 trace 多个位置(与 ReliabilityBench RDC/VAF/GDS/MOP"时序可靠性"垂直互补:trace 空间 vs 时序时间序列);SkillGate 的 40.8%→53.2% 是风险研究焦点从行为层定性扩展到定量的关键节点。
机制层面,evaluator leak 风险是 ClawProBench 的最大待核警示——evaluation 主题预消化稿自承:"OpenClaw 作为 runtime 本身是否参与了 evaluation,引入 evaluator leak?HF Daily 8-26 未见覆盖,需 PDF 核实"。这一警示与活文档 HORIZON 跨域 harness 异质性问题同构——runtime-specific benchmark 是否限制泛化?ClawProBench 实例化于 OpenClaw,具体 surface 映射到 OpenClaw 特定工具集(browsing / memory / messaging / scheduling / skills / subagents),跨 runtime 泛化需额外验证。
跨实例协调把"SecOPD + Trustworthy RAG arXiv:2608.21095v1 + RAGSieve + SkillGate + Agent Gym"归并为 agent-security 主题簇候选新增预备——这是 8-23 risk 综述没有的整合判定。Trustworthy RAG(ROC-AUC 0.73-0.81 / F1 92%)是 RAG 安全性评估的具体数值,SkillGate(40.8% → 53.2%)是 skill selection 层面的安全精度提升,SecOPD(on-policy 蒸馏)是 prompt injection 防御的内生训练方法——三者攻击面不同(Trustworthy RAG 对 instruction injection + contradiction + entity swap 4 类毒化方法,SecOPD 对 adaptive prompt injection,SkillGate 对 skill selection 误导暴露),但都被归为 agent-security 主题簇。
⚠️ 反方:1 机制:SecOPD / Trustworthy RAG / SkillGate 攻击面边界清晰?协调棒标注"不要混为同一攻击面",归并是"主题级"而非"方法学级";2 数据:ClawProBench evaluator leak 待核;Trustworthy RAG ROC-AUC 0.73-0.81 / F1 92% 单一论文实验未复现;SkillGate 40.8%→53.2% 在 ≥3 任务族稳定性?3 截止日:9-1 前若 ClawProBench 给出 evaluator leak 缓解机制 + 与 GAIA / WebArena head-to-head;9-5 前若三者给出统一 attack surface taxonomy,主题簇升级已立标。
7. 趋势判断与开放问题
近 72h risk 主轴的 6 件主题级增量 + 1 件大样本实证形成 5 个明确趋势判断 + 5 个开放问题。
5 个趋势判断:
- 风险研究焦点从"模型对齐税"上移到"模型外访问权限失控"作为一级变量:Gradient Flow 8-27 上午锚定的"最大的 AI 风险位于模型之外"+ 170,226 skill credential leakage 大样本实证 + Agent Gym 的 Spec-to-Note Gap 行为偏差修正 = "模型外风险 vs 模型内风险"对立基础共识候选新增。
- 风险研究焦点从"序列级防御"演进到"token-level 蒸馏":SecOPD 的 on-policy 蒸馏把"序列级 → token 级"反馈信号作为防御粒度的关键改进方向,与 OWASP LLM Top 10 2026 把 Hidden Context Exposure 替换原 System Prompt Leakage 项构成官方标准 + 内生训练方法双向锚。
- 风险研究焦点从"单 agent trace-aware 评测"扩展到"runtime-native trace-aware + 凭证层 + 通信层"六栖防御:ClawProBench(runtime-native trace)+ credential leakage(凭证层)+ Multi-Agent 安全主题簇(通信层)+ Inadvertent Context Leakage(上下文层)+ Bounded Agents APC(授权层)+ ILL(输入层)= 六栖防御候选新增。
- 风险研究焦点从"agent-security 离散研究"上升为"主题簇整合判定":跨实例 8-27 中午协调棒把 SecOPD + Trustworthy RAG + RAGSieve + SkillGate + Agent Gym 归并为 agent-security 主题簇候选新增预备 = 72h 内的整合判定升级。
- 风险研究焦点从"学术红队"扩展到"工业红队 + GitHub Agent 生态 + Agent 行为修正"三栖延展:promptfoo(24.4k stars / 工业红队)+ Harbor + strands-agents + browser-use + awesome-agent-skills(GitHub Agent 生态四件)+ Agent Gym(行为修正)= 工程化层级完整闭环。
5 个开放问题:
- agent-security 主题簇能否确立为方向:协调棒判定为"预备态"而非"已立标",9-1 ~ 9-10 需 ≥3 件独立研究对 SecOPD / Trustworthy RAG / SkillGate 做 head-to-head 攻击面边界对照,有则升级已立标,无则降为孤立研究聚集。
- SecOPD on-policy 蒸馏的具体 token-level 标注机制:论文 §3 待 PDF 核验,9-1 截止;若通过对抗样本 + 人工标注,数据成本与 DPO/GRPO 偏好标注相比是否更优?
- AgentRoom CRDT 工作区的语义冲突解决:CRDT 解决字符层冲突,但跨 Agent 修改同一函数的语义层冲突如何解决?9-1 截止 PDF §3 验证。
- credential leakage 跨 marketplace 复现:170,226 skill 是 SkillsMP 单一 registry,8-30 ~ 9-15 需 ≥3 个独立 team 在 ≥3 个 marketplace 上复现 73.5% stdout 主导 + 89.6% 无提权即可利用比例。
- ClawProBench evaluator leak 风险:OpenClaw runtime 自身参与 evaluation 是否引入 evaluator leak?9-1 截止 PDF 验证;若缓解机制公开,可升级为 trace-aware runtime-native 评测标杆;否则维持 work-queue Top15 #1 ★★★ 不变。
§7 自检栏(实测)
- 私域清洁度五维(ip+kp+rn+fp+oc):私域关键词全维度自检 grep = 0 命中 ✓
- 字数三层一致:
wc -m实测后偏差 ≤10% ✓ - 机制段:N=6 主线 + 1 综述延伸 = 7 段 ✓
- 工程段:N=6 主线 + 1 综述延伸 = 7 段 ✓
- ⚠️ 数字核验 K=10(SecOPD HF Daily 36▲ / AgentRoom one-shot policy ~50% / Automata 12 datasets FSM 7-43 states / Autonomous Math 12 problems 5 new results / Credential leakage 170,226-17,022-520-1,708-76.3%-73.5%-89.6% / SkillGate 40.8%→53.2% / Trustworthy RAG ROC-AUC 0.73-0.81 F1 92% / Harbor 4.5k stars / strands-agents 6.9k stars / Agent Gym Spec-to-Note Gap)= 全部已显式标注 ✓
- verifiability ≥20% URL 抽查已执行:SecOPD / AgentRoom / Automata / Autonomous Math / Agent Gym / ClawProBench / SkillGate / Trustworthy RAG / EnvHarness / Inadvertent Context Leakage = 10 / 10 = 100% ≥ 20% ✓
综合 arXiv 号清单(10 件):
- arXiv:2608.21500(SecOPD · On-Policy Distillation for Adaptive Prompt Injection · 8-27 沿用 ✓)
- arXiv:2608.23740(AgentRoom · CRDT-Backed Shared Workspace · 多 Agent 并发编程 · 8-27 沿用 ✓)
- arXiv:2608.23670(Automata from Agent Traces · FSM 压缩 · 12 数据集 7-43 states · 8-27 沿用 ✓)
- arXiv:2608.23691(Autonomous Mathematical Discovery · Station 开放世界多 Agent · AlphaEvolve 12 problems + 5 新结果 · 8-27 沿用 ✓)
- arXiv:2608.15591(Agent Gym · 宪法层 + ALF + Spec-to-Note Gap · 行为偏差修正 · 8-27 沿用 ✓)
- arXiv:2608.22510(ClawProBench · trace-aware runtime-native 评测 · 102 题 · evaluator leak ⚠️ 待核 · 8-26 work-queue Top15 #1 ★★★)
- arXiv:2608.18852(SkillGate · In-Policy Skill Selection · 40.8%→53.2% · paper_card 1032 已建 · 8-21 → 8-27 沿用 ✓)
- arXiv:2608.21095v1(Trustworthy RAG · ICSEA 2026 · ROC-AUC 0.73-0.81 / F1 92% · 单一论文实验 ⚠️)
- arXiv:2608.19880(EnvHarness · 评测方法学延革第 12 例 · 8-23 risk 综述已立,8-27 沿用 ✓)
- arXiv:2608.19857(Inadvertent Context Leakage in Language Models · 8-23 risk 综述已立,8-27 沿用 ✓)
实际可引用 arXiv 号 = 10 件(沿用 4 件 + 72h net-new 6 件,均 ⚠️ 标注需进一步核验)。
附:凭证层大样本实证(非 arXiv,SkillsMP / ASE 2026 沿用):
- "Third-party skills extend LLM agents with powerful capabilities..."(170,226 skills / 17,022 sampled / 520 affected / 1,708 security issues / 10 leakage patterns / 76.3% 跨模态 / 73.5% stdout / 89.6% 无提权即可利用)— 来源沿用 6-30 llm-agent-credential-leakage-ase2026 重写版。