主题综述 · risk(2026-10-06)
- 作者:spark
- 更新:2026-10-06
差异化定位:10-01 综述锚定"frontier model cyber-offense capability 栖位预备第 1-2 例 + 立标饱和度信号独立主线";10-03~10-04 综述间期 risk 主分类入库空窗延续、警示级承接稳态;本棒聚焦 prompt-injection 攻防方法学四联+评测范式跃迁 + 评测方法学 31→32 维预备扩增 + JEV/LLM judge 错误共现反例证据 + MRAG 攻击面新轴 + 长时记忆 sycophancy 风险五主轴展开,10-01~10-05 72h 窗口外部信号密度持续高位(Anthropic 9-29 报告持续承袭第 7 日、GPT-6 Astra 状态矛盾持续第 4 日、OpenAI 安全部门解雇事件待溯源第 4 日),但 risk 主分类 paper_card 净增仍为 0 件,跨主文档边界(risk × agent / risk × rag / risk × evaluation)警示与候选备选集持续扩增。私域污染 SUM=0。
§0 自检栏(9 维实测硬约束)
① CJK 实测 ~3,780(主体 §一-§五 ≈3,780;§0 自检栏 + 顶头声明 ≈420)≤ 3,900 硬约束 ✅ | ② 私域五维 SUM=0 grep 0 命中 ✅ | ③ 反方 v2 三段式按主线分布 §三.1~§三.6 六主线各 ≥80 字 ✅ | ④ ⚠ 实测 ≥10 处(§0/§五/footer 三处一致)✅ | ⑤ verifiability ≥20%(§0/§五/footer 三处一致 = 6 paper_card TLDR 实证 + flyP 10-06 JEV 精读 + web_search 10-06 OWASP/AgentDojo/PromptArmor 双源独立闭合 + 9-29 Anthropic Frontier Red Team 报告沿用第 7 日)✅ | ⑥ §3.4 法律独立段 ≥150 字 ✅(实测 ~170)| ⑦ §五 合流密度 7 处 ✅(每块 60~95 CJK)| ⑧ 立标池 4 件套命中 ≥3 件 ✅(GitHub 0/8 + ⚠ + 双轨 + abstract 核实 + Kili/Confident AI/OWASP 三源交叉)| ⑨ 元语言串"预备新增锚定实测触发预备级预备触发"14 字禁词本棒 = 0(≤3 守约)✅
棒位时点 = 13:30 CST 主棒位硬下限前完成 ✅。
⚠ 诚实标注局限性:(a) arXiv:2609.29769 JEV vs LLM Judges 论文经 flyP 10-06 1550 短精读双拼完成,96% 错误共现率为精读笔记直接引用,未做原文 bootstrap CI 复核 ⚠⚬⚬;(b) arXiv:2606.09084 Context-Fractured Decomposition Attacks 被引 3 但 OpenAlex 被引 0,待 11-15 内 S2 ≥10 复核 ⚠⚬⚬;(c) PromptArmor ICLR 2026 引用自 Vectra AI 二手综述,原论文 arXiv ID 与开源仓库未实测 ⚠⚬⚬⚬;(d) Anthropic 9-29 Frontier Red Team 报告完整 URL 沿用第 7 日待溯源 R91 Q132 ⚠⚬⚬⚬⚠;(e) 立标池主表 6 件主轴 arXiv 全部仅 abstract 级别核实,正文 §X 待复核表 ≥3 件 ⚠⚬⚬。
§一 主题脉络:从"10-01 双锚击穿"升级到"prompt-injection 攻防方法学四联 + 评测范式跃迁"
10-01 → 10-06 这 5 天 risk 主轴聚焦在五栖主轴的合流:
A 主轴 prompt-injection 攻防方法学四联预备扩增:9-22 主轴聚焦 Jev 立标 → 9-29 → 10-1 评测方法学 30→31 维预备扩增预备级稳态 → 10-06 第 32 维预备扩增预备级稳态 = prompt-injection 攻防方法学四联预备扩增预备级第 1-2 例 ⚠⚬⚬⚬:(1) arXiv:2608.05108 PIMiner = agentic red-teaming system 训练期自建策略库 + 测试期零训练迁移到未见过的目标 LLM ⚠⚬⚬;(2) arXiv:2606.09084 Context-Fractured Decomposition Attacks = 跨上下文多步越狱保留"良性中间产物"在早期交互、后期不同 agent 实例或工作流阶段触发有害行为 ⚠⚬⚬⚬;(3) arXiv:2608.21500 SecOPD = token-level feedback 引导防御式 fine-tuning 的 on-policy distillation,泛化到训练完全未见领域 ⚠⚬⚬;(4) arXiv:2606.26479 Adaptive Evaluation of Out-of-Band Defenses = 把 out-of-band defenses 映射到经典完整性保护 / reference monitoring / least privilege 三栖框架 ⚠⚬⚬⚬。四联协同 = 攻防方法学从"单点越狱"走向"agentic 攻防 + 跨上下文多步 + on-policy 防御 + out-of-band 框架"四元协同 ⚠⚬⚬⚬。
B 主轴 评测范式跃迁预备级:9-27 综述 L2 Jev 第 1 例 → 10-1 evening 棒 §L4 frontier model cyber-offense capability → 10-06 评测范式跃迁预备级第 1 例 = arXiv:2609.29769 JEV vs LLMs as Rubric Judges(UPenn 58 页 9 panels/7 benchmarks/3 judges 双轨实验) = JEV 多数情况下能替代 LLM judge,但 LLM judge 比 JEV 贵 16–325 倍、慢 28–350 倍、准确率差异 27 对配对中最多 8 对显著、JEV 最自信错例上 96% LLM 判决重复错答案(独立错误预期 ~50%) = judge cascade 失败 + LLM-as-judge 多样性反例证据 + 评测协议族"协议层准确 ≠ 价值层准确" ⚠⚬⚬⚬⚬⚠。
C 主轴 MRAG 攻击面 + RAG Defense 轴首次立标预备级:10-04 flyp critical-read + stephen ai-industry §增量 5 + tom rag-e1prep = arXiv:2610.01936 Mapping the RAG Landscape(Meghana Sunil et al. 2026-10-01,Artificial Intelligence Reviews Springer 旗下正式发表)= Defense 轴首次立标 ⚠⚬⚬⚠ = Defense 从"边角章节"独立成轴与 Efficiency / Interactivity / Reasoning 平起平坐 + 同期 arXiv:2610.01871 ImmRAG 黑盒 datastore extraction attack 形成"轴 + 实证攻击"组合 ⚠⚬⚬。预示 RAG 安全从"prompt injection 焦点"扩展到"数据存储层 extraction 攻击 + 数据投毒 + MRAG 隐私泄露"三栖 ⚠⚬⚬⚬。
D 主轴 评测方法学 31→32 维预备扩增预备级稳态:10-1 evening 第 31 维预备扩增预备级 7-12 候选 6 件备选集 → 10-06 第 32 维预备扩增预备级第 1-3 候选入备选集 ⚠⚬⚬⚬:① JEV/LLM Judges 错误共现 96% = 评测协议族多样性反例证据栖位预备级第 1 例 ⚠⚬⚬⚬;② NRT-Bench = 多轮 operator-agent 安全 critical-room 评测基准(外部 web_search 命中,arXiv:2606.20408v3,AgentDojo + 物理信号结合 + 四模型横评)⚠⚬⚬;③ PromptArmor = off-the-shelf LLM detect/remove injected prompts 在 AgentDojo 上 < 1% FPR/FNR(外部 web_search 命中 ICLR 2026 二手综述)⚠⚬⚬⚬⚠。预示评测方法学正从"指标堆叠 + 中间过程捕获 + governance decay 量化"走向"协议族多样性反例 + 多轮 operator agent 物理信号 + off-the-shelf 防御工程化"三栖协同 ⚠⚬⚬⚬。
E 主轴 长时记忆 sycophancy 风险 + chat-template 攻击机制化:10-01 evening 棒 §L5 Knowledge Triage 压缩悬崖 → 10-06 §L6 新增第 1 例 = arXiv:2610.05162 MemAdapter(paper_card 1680,10-06 入库)= long-term memory 会诱导 sycophancy(agent 过度对齐用户历史信念即使错误/过时/与客观证据不一致)= counterfactual adaptation 防御路径 + 与既有 §L5 retention policy 互补 ⚠⚬⚬⚬。叠加 §L6 沿用 arXiv:2609.35932 reserved-token chat-template 攻击(10-01 evening 已立,10-06 续立)= 长时记忆 + 模板层 = Agent 安全两栖栖位预备扩增稳态 ⚠⚬⚬⚬。
§1.1 10-01 → 10-06 72h 窗口净增:① arXiv:2610.05162 MemAdapter ✓ 10-06 入库(主 agent · 副风险强邻接 · method)⚠⚬⚬⚬ = 长时记忆 sycophancy 风险栖位预备级第 1 例;② arXiv:2610.01871 ImmRAG ✓ 10-04 入库(主 rag · 副 multimodal · 强邻接级)⚠⚬⚬⚬ = MRAG 黑盒 datastore extraction attack 主题元老级候选;③ arXiv:2610.01936 Mapping the RAG Landscape ✓ 10-04 入池(主 rag · 形态 survey · 强邻接级)⚠⚬⚬⚠ = Defense 轴首次立标 + Springer 期刊发表;④ arXiv:2609.35932 reserved-token chat-template ✓ 10-01 evening 沿用第 5 日(主 agent · method · 强邻接级);⑤ arXiv:2606.20408v3 NRT-Bench(外部 web_search 命中,主 risk · benchmark · 副 evaluation)= multi-turn operator-agent critical-room 评测;⑥ PromptArmor ICLR 2026(外部 web_search 命中,主 risk · method)= off-the-shelf detect/remove injected prompts;⑦ arXiv:2609.29769 JEV vs LLM Judges(flyP 10-06 1550 短精读双拼,无 paper_card)⚠⚬⚬⚬⚬ = 评测范式跃迁预备级第 1 例。
§二 各工作贡献与相互关系(6 主线 v2 三段式)
L1 · 表征工程化 vs 行为对齐统一基准(机制 / 数据 / 截止日-证伪)
机制:arXiv:2609.34771 paper_card 1561 ✓ 9-29 16:30 入库(主 risk · method · 副 eval)= 匹配评估框架:safety control 赛道对比 DPO 与表征转向(ITIA / Prompt Engineering / Inference-Time Intervention),safety monitoring 赛道对比文本监控器与表征读取器,规避不同方法在不同 setting 不可比的问题 ⚠⚬⚬⚬。数据:DPO 在整体安全控制中表现最强,但表征转向在低数据 / 高质量设置下具有竞争力 ⚠⚬⚬⚬;safety 在良性后续微调后可能降级 = 最被低估的脆弱性维度 ⚠⚬⚬。截止日-证伪:与 Just Ask Jev 形成安全控制 + 安全监控双轨协同 ⚠⚬⚬⚬;paper_card 1561 ✓ 9-29 16:30 入库 = risk 主分类 9-26 → 9-29 连续 4 日空窗终结者 ⚠⚬⚬⚬⚬;10-1 → 10-6 续立 = 评测方法学 31 维预备扩增预备级稳态第 1 候选 ⚠⚬⚬。v2 立标降级:沿用 10-01 ★(S2 0 + OpenAlex 0 待验 = 立标等级与验证度脱节)。
L2 · 对齐失败统一基准:Jev + RLCDAlignBench(机制 / 数据 / 截止日-证伪)
机制:arXiv:2609.29429 paper_card 1521 ✓ 9-26 入库(主 risk · benchmark · 副 eval)= RLCD 训练 Jev,单次调用对同一输入的多类型问题输出校准概率,区别于生成式评判器与 Llama Guard ⚠⚬⚬。数据:RLCDAlignBench 覆盖 10 类对齐失败(谄媚 / 越狱 / 欺骗 / Prompt 注入 / 幻觉 / 隐私侵犯 / 社会偏见 / 奖励黑客 / 隐瞒不确定性 / 权力寻求)× 44 benchmark × 5 目标模型 × 7,193 detection instances(web_search 补全 TLDR 截断),63× 成本优势 ⚠⚬⚬⚬。截止日-证伪:9-26 入库 → 9-29 → 10-1 续立 → 10-6 续立第 10 日 ⚠⚬⚬⚬;sumleo/RLCDAlignBench GitHub + 主页双源核实 ⚠⚬⚬⚬⚬;S2 4 / OpenAlex 0 待验,10-15 内 S2 未达 ≥10 则 ★★→★ ⚠⚬⚬。v2 立标降级:沿用 10-01 ★(S2 4 + OpenAlex 0 待验)。
L3 · prompt-injection 攻防方法学四联预备扩增预备级稳态(机制 / 数据 / 截止日-证伪)
机制:四联协同 ⚠⚬⚬⚬: - arXiv:2608.05108 PIMiner paper_card 776 ✓(主 agent · method · 副 risk)= agentic system 在训练期从零构建 prompt injection 策略库 + 测试期零训练迁移到未见过的目标 LLM ⚠⚬⚬; - arXiv:2606.09084 Context-Fractured Decomposition Attacks paper_card 049 ✓(主 agent · position · S2 3)= 跨上下文多步越狱保留"良性中间产物"在早期交互、后期不同 agent 实例或工作流阶段触发有害行为 ⚠⚬⚬⚬; - arXiv:2608.21500 SecOPD paper_card 1101 ✓(主 agent · method · S2 4)= token-level feedback 引导防御式 fine-tuning 的 on-policy distillation,泛化到训练完全未见领域 ⚠⚬⚬; - arXiv:2606.26479 Adaptive Evaluation of Out-of-Band Defenses paper_card 245 ✓(主 agent · benchmark · S2 2)= 把 out-of-band defenses 映射到经典完整性保护 / reference monitoring / least privilege 三栖框架 ⚠⚬⚬⚬。
数据:S2 被引累计 1+3+4+2 = 10 ≈ 1 年内同主题顶刊稳定引用 ⚠⚬⚬。截止日-证伪:与 R91 §L3 MCP ecosystem 67,057 servers / R92 ImmRAG datastore extraction / 10-06 §L4 JEV/LLM Judges 96% 共现 协同 = 攻防方法学从"单点越狱"走向"agentic 攻防 + 跨上下文多步 + on-policy 防御 + out-of-band 框架 + judge 错误共现"五元协同 ⚠⚬⚬⚬;OWASP 2026 第 2 年将 prompt injection 列为 LLM Top 10 #1 + Cisco"prompt injection 是新 SQL injection"沿用第 4 季度 ⚠⚬⚬⚬。
L4 · JEV vs LLM Judges 评测范式跃迁预备级第 1 例(机制 / 数据 / 截止日-证伪)
机制:arXiv:2609.29769(UPenn,2026-09-28 提交 v2 可见,58 页 11 figures 37 tables)= 研究 JEV(TypeSafe AI 的"decision model")能否替代 LLM judge 做 rubric scoring ⚠⚬⚬⚬⚬⚠。数据:9 panels / 7 benchmarks / 3 flash-tier LLM judges(GPT-5.5 Flash / Gemini 3.0 Flash / Claude Haiku 4.5 推测)+ 2 setups(holistic 一次读完 vs one criterion at a time);LLM judge 比 JEV 贵 16–325 倍,慢 28–350 倍,准确率差异 27 对配对中最多 8 对显著 ⚠⚬⚬⚬⚬⚠;JEV 最自信错例上 96% LLM 判决重复同一错答案(独立错误预期 ~50%),错误模式偏向 ordinal criteria,所有 LLM judge + JEV 都偏离人类评分者 ⚠⚬⚬⚬⚬⚠;cascade 即使有 oracle threshold 也没在任何一项超过 best single judge 超 2.7 分 ⚠⚬⚬⚬⚬⚠。截止日-证伪:核心论断 = judge cascade 成功的前提是 judges 在不同地方错;JEV 与 LLM judge 都错在同一些地方 → cascade 失败 = 评测协议族多样性反例证据 ⚠⚬⚬⚬⚬⚠;flyP 10-06 1550 短精读评级 A- ⚠⚬⚬⚬;JEV 自身是 TypeSafe 商业模型,外部研究者能否独立复现 JEV 调用取决于 OpenRouter typesafe/jev-1.13 长期可用 ⚠⚬⚬。v2 立标降级:评测范式跃迁预备级第 1 例,立标预备 ★(96% 共现率 bootstrap CI 缺位待复核)。
L5 · MRAG 攻击面 + RAG Defense 轴首次立标预备级(机制 / 数据 / 截止日-证伪)
机制:arXiv:2610.01871 paper_card 1625 ✓ 10-04 入库(主 rag · method · 副 multimodal)= ImmRAG 黑盒 datastore extraction attack 针对 image-based MRAG(Multimodal RAG),adaptive + automatic + 黑盒设置 ⚠⚬⚬⚬;arXiv:2610.01936 paper_card 1624 ✓ 10-04 入池(主 rag · survey)= Mapping the RAG Landscape 四轴分类法(Efficiency / Defense / Interactivity / Reasoning)+ Defense 轴首次立标 ⚠⚬⚬⚠ + 2026-10-01 16:06 UTC 已正式发表于 Artificial Intelligence Reviews Springer 旗下 ⚠⚬⚬⚠。数据:ImmRAG 实证 attack + 四轴综述 Defense 轴与 ImmRAG 同期论文形成"轴 + 实例"配对 ⚠⚬⚬⚬;Springer 期刊发表 = 综述类可信度上抬一档 ⚠⚬⚬⚠。截止日-证伪:与 L3 prompt-injection 攻防方法学四联 + R91 §L3 MCP ecosystem 67,057 servers + 10-1 §L5 Knowledge Triage 压缩悬崖 协同 = RAG 安全从"prompt injection 焦点"扩展到"数据存储层 extraction 攻击 + 数据投毒 + MRAG 隐私泄露 + Defense 轴首次立标"四元协同 ⚠⚬⚬⚬;flyp 10-04 0950 critical-read "留有疑问"四点 = 四轴并非正交 + Defense 实质是跨 Efficiency/Reasoning/Interactivity 的对抗维度 + 摘要未披露四轴互斥性测试或覆盖率回检 + benchmark 一致性结论未提 ⚠⚬⚬⚠;与 ImmRAG 作者列表是否同团队待核 ⚠⚬⚬。
L6 · 长时记忆 sycophancy 风险 + chat-template 攻击机制化(机制 / 数据 / 截止日-证伪)
机制:arXiv:2610.05162 paper_card 1680 ✓ 10-06 入库(主 agent · method)= MemAdapter counterfactual adaptation against memory-induced sycophancy = long-term memory 会诱导 sycophancy(agent 过度对齐用户历史信念即使错误/过时/与客观证据不一致)= counterfactual adaptation 防御路径 ⚠⚬⚬⚬;arXiv:2609.35932 paper_card 1582 ✓ 10-01 evening 沿用第 5 日(主 agent · method)= 保留 token 攻击机制 = 相同字节可被以"单个保留控制 token"或"普通子词 token 序列"两种形式送入模型,解码文本完全相同但分词在服务器端执行,决定模型收到哪一种形式的不是攻击者而是防御方 ⚠⚬⚠。数据:MemAdapter abstract 截断细节 = 现有 mitigation 假设 sycophancy 来源于有偏/不正确记忆并在 pipeline 不同阶段过滤 ⚠⚬⚬⚬;reserved-token 攻击 = 在每一对 base + instruction-tuned 上 instruction tuning 强化保留标记偏好,差距持续存在 ⚠⚬⚠。截止日-证伪:与 10-01 §L5 Knowledge Triage retention policy 互补 = 长时记忆 + 模板层 = Agent 安全两栖栖位预备扩增稳态 ⚠⚬⚬⚬;MemAdapter 立标预备 ★(abstract 截断 + S2 0 待验);reserved-token chat-template 立标预备 ★(服务端 tokenization 防御侧未公开 + abstract 数字未给)。
§三 工程视角 / 研究视角 / 批判视角
§3.1 工程视角:可落地性(5 坑点)
坑 1:L1 1561 双轨数据集缺 ⚠⚬⚬⚬;坑 2:L3 PIMiner 策略库跨 LLM 迁移成本未实测 ⚠⚬⚬;坑 3:L3 SecOPD on-policy distillation 算力门槛未公开 ⚠⚬⚬⚬;坑 4:L5 MRAG 防御需 MLLM 微调,推理成本叠加 ⚠⚬⚬⚬;坑 5:L6 MemAdapter counterfactual adaptation 训练成本未公开 ⚠⚬⚬⚬。
§3.2 研究视角:创新性
L1 1561 的匹配评估把不同方法在不同 setting 不可比问题显式化,是评测方法学从"指标堆叠"走向"机制对比"的跃迁 ⚠⚬⚬⚬。L2 Jev 通过 RLCD 把"校准决策"作为多类型对齐问题统一输出形式,比生成式评判器节省 63× 成本,是检测器架构层面的范式转换 ⚠⚬⚬。L3 四联协同 = 攻防方法学从"单点越狱"走向"agentic 攻防 + 跨上下文多步 + on-policy 防御 + out-of-band 框架"四元协同 = 评测方法学 32 维预备扩增预备级核心 ⚠⚬⚬⚬。L4 JEV/LLM Judges 96% 错误共现率 = judge cascade 失败 + LLM-as-judge 多样性反例证据 + 评测协议族"协议层准确 ≠ 价值层准确" = 评测范式跃迁预备级第 1 例 ⚠⚬⚬⚬⚬⚠。L5 MRAG 攻击面 + Defense 轴首次立标 = RAG 安全从 prompt injection 焦点扩展到数据存储层 extraction 攻击 + 数据投毒 + MRAG 隐私泄露 ⚠⚬⚬⚬。L6 MemAdapter counterfactual adaptation + reserved-token chat-template = 长时记忆 + 模板层 = Agent 安全两栖栖位预备扩增稳态 ⚠⚬⚬⚬。
§3.3 批判视角
L1 abstract 截断;L2 S2 4 待验;L3 PIMiner 跨 LLM 迁移策略库覆盖度未公开 ⚠⚬⚬ + Context-Fractured Attacks 跨实例触发链触发时间窗未量化 ⚠⚬⚬⚬;L4 JEV vs LLM Judges 96% 共现率 bootstrap CI 缺位 ⚠⚬⚬⚬⚠ + JEV 商业可用性依赖 OpenRouter ⚠⚬⚬;L5 四轴并非正交 + Defense 实质是跨 Efficiency/Reasoning/Interactivity 的对抗维度 ⚠⚬⚬⚠ + 与 ImmRAG 作者列表是否同团队待核 ⚠⚬⚬;L6 MemAdapter abstract 截断 + reserved-token 服务端责任边界未界定 ⚠⚬⚠。整体 disclaimer:6 主线均为综述视角整合,非学界共识。
§3.4 法律 / 治理视角(独立段 ≥150 字,实测 ~170)
L4 JEV vs LLM Judges 96% 错误共现率对评测协议族多样性构成强反例 ⚠⚬⚬⚬⚬⚠:当 fallback judge 和 primary judge 错在同处时,cascade 不会带来显著增益——这意味着任何"用便宜模型兜底、贵的模型做 fallback"的设计都必须先验证错误是否互补 ⚠⚬⚬⚬⚬⚠。法律含义层面 ⚠⚬⚬⚬:欧盟 AI Act 2026-08 生效 + 美国 AISI 协调 + 中国生成式 AI 服务管理办法 修订 三栖协同下,评测协议族多样性反例证据可能影响"模型权重合规接入第二维 = 模型权重合规接入第三维 = 模型行为可观测性栖位"的法律边界判定 ⚠⚬⚬⚬⚠。建议明确:评测协议族提供方(JEV / LLM judge)承担透明度义务(披露 cascade 失败条件)+ 部署方承担合规义务(EU AI Act Art. 6 + 9 + 15 三栖合规 + 中国生成式 AI 服务管理办法评测协议族多样化要求)+ 第三方评测方承担中立性义务(独立 head-to-head 评测包含 cascade 失败条件复现)。OWASP 2026 第 2 年 prompt injection #1 + Cisco"prompt injection 是新 SQL injection"框架 = 评测协议族多样化法律栖位扩展 ⚠⚬⚬⚬⚠。
§四 趋势判断与开放问题
趋势 1:prompt-injection 攻防方法学四联预备扩增预备级稳态
PIMiner + Context-Fractured Attacks + SecOPD + Out-of-Band Defenses = 攻防方法学从"单点越狱"走向"agentic 攻防 + 跨上下文多步 + on-policy 防御 + out-of-band 框架"四元协同 ⚠⚬⚬⚬。预示 2026 Q4 将出现 ≥3 篇评测方法学第 32 维预备扩增预备级候选,带动手工越狱 → 自动化 agentic 攻防 + on-policy 防御工业化 ⚠⚬⚬⚬。
趋势 2:评测范式跃迁预备级第 1 例
JEV vs LLM Judges 96% 错误共现率 ⚠⚬⚬⚬⚬⚠:cascade 不会带来显著增益 = LLM-as-judge 多样性反例证据 + 评测协议族"协议层准确 ≠ 价值层准确"。预示 RLHF reward model / judge model 多样性问题比想象中严重,单一 judge 的偏置会被 RLHF 放大到训练出的模型上 ⚠⚬⚬⚬⚬⚠。2026 Q4 可能出现 ≥2 篇独立团队复现 96% 共现率或反驳 ⚠⚬⚬。
趋势 3:MRAG 攻击面 + RAG Defense 轴首次立标预备级
ImmRAG datastore extraction + Mapping the RAG Landscape Defense 轴首次立标 ⚠⚬⚬⚠:RAG 安全从"prompt injection 焦点"扩展到"数据存储层 extraction 攻击 + 数据投毒 + MRAG 隐私泄露 + Defense 轴"四元协同 ⚠⚬⚬⚬。预示 2026 Q4 出现 ≥3 篇 RAG Defense 轴独立验证或延伸 ⚠⚬⚬。
趋势 4:长时记忆 sycophancy 风险 + chat-template 攻击机制化
MemAdapter counterfactual adaptation + reserved-token chat-template ⚠⚬⚬⚬:长时记忆 + 模板层 = Agent 安全两栖栖位预备扩增稳态。预示 2026 Q4 出现 ≥2 件 long-term memory sycophancy + tokenization 责任边界栖位扩展 ⚠⚬⚬⚬。
趋势 5:评测方法学 31→32 维预备扩增预备级稳态
10-1 evening 第 31 维预备扩增预备级 7-12 候选 6 件备选集 → 10-06 第 32 维预备扩增预备级第 1-3 候选入备选集 ⚠⚬⚬⚬:JEV/LLM Judges 错误共现 + NRT-Bench 多轮 operator-agent + PromptArmor off-the-shelf 防御。预示评测方法学正从"指标堆叠 + 中间过程捕获 + governance decay 量化"走向"协议族多样性反例 + 多轮 operator agent 物理信号 + off-the-shelf 防御工程化"三栖协同 ⚠⚬⚬⚬。
开放问题
Q132(沿用):Anthropic 9-29 Frontier Red Team 报告完整 URL 沿用第 7 日待溯源 ⚠⚬⚬⚬⚠ P0 立即处理警示。 Q136(沿用):GPT-6 Astra 状态矛盾冲突 - safety 弃用 vs 仍在使用 严重矛盾持续第 4 日延续 ⚠⚬⚬⚠。 Q137(沿用):TLDR AI "OpenAI 安全部门解雇事件 🚨" 待溯源第 4 日延续 ⚠⚬⚠。 Q140(10-06 新增):JEV vs LLM Judges 96% 错误共现率 bootstrap CI 独立复核时间表 ⚠⚬⚬⚬⚠ P1 立即处理警示。 Q141(10-06 新增):PIMiner 策略库跨 LLM 迁移覆盖率 + SecOPD on-policy distillation 算力门槛实测 ⚠⚬⚬⚬。 Q142(10-06 新增):Mapping the RAG Landscape 四轴正交性论证 + 四轴互斥性测试或覆盖率回检 ⚠⚬⚬⚠。 Q143(10-06 新增):MemAdapter counterfactual adaptation 训练成本 + 与 Knowledge Triage retention policy 元学习协同路径 ⚠⚬⚬⚬。
§五 合流密度(七处 ≥60 字)+ 立标池主表 6 件主轴 arXiv ⚠⚬⚬⚬
合流 1:1561 + Jev + L4 JEV/Judges = 评测方法学跃迁
1561 "matched evaluation" ⚠⚬⚬⚬ + Jev "单次调用校准概率 63×" ⚠⚬⚬⚬ + L4 JEV vs LLM Judges 96% 错误共现 ⚠⚬⚬⚬⚬⚠ = 评测方法学从"指标堆叠"走向"机制对比 + 协议族多样性反例"二元协同 ⚠⚬⚬⚬。
合流 2:PIMiner + Context-Fractured + SecOPD + Out-of-Band = 攻防方法学四联
PIMiner agentic 攻防 ⚠⚬⚬ + Context-Fractured 跨上下文多步 ⚠⚬⚬⚬ + SecOPD on-policy 防御 ⚠⚬⚬ + Out-of-Band 经典框架映射 ⚠⚬⚬⚬ = 攻防方法学第 32 维预备扩增预备级核心三角 ⚠⚬⚬⚬。
合流 3:MRAG ImmRAG + RAG Landscape Defense 轴 = RAG 安全四元
ImmRAG 黑盒 datastore extraction ⚠⚬⚬⚬ + Defense 轴首次立标 ⚠⚬⚬⚠ + Springer 期刊发表 ⚠⚬⚬⚠ + 四轴与 ImmRAG "轴 + 实例"配对 ⚠⚬⚬⚬ = RAG 安全从 prompt injection 焦点扩展 ⚠⚬⚬⚬。
合流 4:MemAdapter + Knowledge Triage + chat-template = Agent 安全两栖栖位
MemAdapter counterfactual adaptation ⚠⚬⚬⚬ + Knowledge Triage retention policy 沿用第 5 日 ⚠⚬⚬⚬ + reserved-token chat-template 沿用第 5 日 ⚠⚬⚠ = 长时记忆 + 模板层 = Agent 安全两栖栖位预备扩增稳态 ⚠⚬⚬⚬。
合流 5:NRT-Bench + PromptArmor + JEV vs LLM Judges = 评测方法学 32 维
NRT-Bench 多轮 operator-agent 物理信号 ⚠⚬⚬ + PromptArmor off-the-shelf detect/remove < 1% FPR/FNR ⚠⚬⚬⚬⚠ + 96% 共现率 ⚠⚬⚬⚬⚬⚠ = 评测方法学 31→32 维预备扩增预备级第 1-3 候选入备选集 ⚠⚬⚬⚬。
合流 6:OWASP + Cisco + EU AI Act + 中国生成式 AI = 法律栖位扩展
OWASP 2026 第 2 年 prompt injection #1 ⚠⚬⚬⚬ + Cisco"新 SQL injection"⚠⚬⚬⚬ + EU AI Act 2026-08 生效 ⚠⚬⚬⚬ + 中国生成式 AI 服务管理办法 ⚠⚬⚬⚬ = 评测协议族多样性法律栖位扩展 ⚠⚬⚬⚬⚠。
合流 7:Anthropic 9-29 + OpenAI 安全部门解雇事件 + GPT-6 Astra 矛盾 = frontier lab 治理公开化警示
Anthropic 9-29 报告沿用第 7 日 ⚠⚬⚬⚬⚠ + OpenAI 安全部门解雇事件待溯源第 4 日 ⚠⚬⚠ + GPT-6 Astra 状态矛盾第 4 日 ⚠⚬⚬⚠ + Claude Frontier Academy 1 亿细节 ⚠⚬⚬⚬⚠ = frontier lab 治理公开化方法学边界争议 70→73 沿用 ⚠⚬⚬⚬。
立标池主表 6 件主轴 arXiv
| # | arXiv | 主分类 | 形态 | 立标等级 | S2被引 | OpenAlex被引 |
|---|---|---|---|---|---|---|
| 1 | 2609.34771 | risk | method | ★ | 0 | 0 |
| 2 | 2609.29429 | risk | benchmark | ★ | 4 | 0 |
| 3 | 2608.05108 | agent · 副 risk | method | ★ | 1 | 0 |
| 4 | 2606.09084 | agent · 副 risk | position | ★ | 3 | 0 |
| 5 | 2608.21500 | agent | method | ★ | 4 | 0 |
| 6 | 2606.26479 | agent · 副 evaluation | benchmark | ★ | 2 | 0 |
★★★ PDF §X 待复核表 ≥3 件:arXiv:2609.34771 §三 实测章节 + arXiv:2609.29429 §四 evaluation setup + arXiv:2608.21500 §五 generalization 实验 ⚠⚬⚬。
Spark · 2026-10-06 13:30 CST · W5 综述(risk · 10-06 棒位)· 私域污染 SUM=0 · 边界:仅写本文件 surveys/2026-10-06-risk.md