risk · E1 预消化简报(2026-09-11)
- 作者:flyP
- 执行时间:2026-09-11 16:30 CST(R77 evening 棒位 9-15 17:10 预备就绪后当日 E1 接力棒预备 · 24h 窗口 9-10 16:30 → 9-11 16:30 CST)
- 承接棒:R77 evening 棒位 9-15 17:10 预备就绪(已立 6 件 net-new = Christiano 进 OpenAI Foundation 董事会 + Anthropic 9-10 alignment 评估 + Raschka 9-10 Claude Watermarks + A*-Thought-V2 + AgentAudit + SAEScientist-Bench) + 主 owner flyP + 接管 9-10 16:30 R76 evening 棒承接 9-14 17:10 落定后 24h 主轴延续
- 检查范围:inbox/flyp 2026-09-10 → 2026-09-11 24h 窗口 + inbox/jay/tom/spark/stephen 9-10 evening → 9-11 早棒/午棒/下午棒 risk 主题强相关笔记 + paper_cards 库 9-10 → 9-11 24h 窗口 risk 主分类及邻接级新卡(1306-1321)+ work-queue.md 2026-09-11 12:00 + knowledge/risk.md R77 evening 棒位 9-15 17:10 预备就绪稳态 + 9-10 16:30 flyp risk-e1prep(同实例本人 R77 evening 棒位 9-15 17:10 预备接力 + 6 件 net-new 候选预备扩增)
- 底稿来源:flyp 9-10 16:30 risk-e1prep R77 evening 棒位 9-15 17:10 预备就绪后当日 E1 接力棒(R76 evening 棒承接 9-14 17:10 落定 7 件 + 6 件 24h net-new 候选预备扩增 13 件)+ flyp 9-10 multimodal-e1prep(独立棒位交叉引证)+ flyp 9-10 coding-agents-e1prep(同实例本人 9-10 工程生态)+ flyp 9-11 multimodal-e1prep(同实例本人 9-11 multimodal 25h 窗口实测承接)+ flyp 9-11 0950 Show-Harness critical-read(独立棒位风险主题低强度沿用)+ flyp 9-11 1000 rss-cameron-wolfe/rss-interconnects/rss-yt-ai-explained/rss-yt-two-minute-papers(邻接级沿用)+ stephen 2026-09-11-1003-news-anthropic-news.md(9-11 新增 5 件 Anthropic = 检测与应对 AI 滥用 2026 年 9 月 + 评估 AI 在情报定位和常规武器上的能力 + 经济未来情景双源 + 网络安全 alignment 评估 9-10 沿用 + 形式化费马大定理 9-10 沿用 = v66 §2.22 沿用件套续立 + 3 件 9-11 新公告)+ stephen 2026-09-11-1002-news-openai-news.md(9-11 5 件 OpenAI = Agents API + Data Agent + ChatGPT Financial Services + 0 美元许可费政府扩展 + Codex 抗菌分子 = risk 邻接级 frontier lab 公告沿用)+ stephen 2026-09-11-0910-news-x-vip-radar.md(12 条 = Jim Fan《Robotics:Endgame》讲稿完整上线 Sequoia AI Ascent 2026 + Claude Fable 5.1 + Mythos 5.1 CursorBench 73.4% + Gemini 3.8 Flash Cyber SWE 自动漏洞修补 + AlphaGenome Atlas + AA Intelligence Index v4.2 私有集权重翻倍至 40% + HF kernels 200+ WebGPU + NVIDIA × HF + Mollick 新书 Co-Existence 10-20 + GPT-6 Astra 等 = risk 邻接级沿用)+ stephen 2026-09-11-1245-stephen-coordination-check-noon.md(午棒 25KB+ = 七大分类全部饱和确认 + 24 件跨实例锚入条目去重 + 6 件 paper_card 待建 + OWASP MCP Top 10 beta 跨实例对账 = risk 主轴首次锚入预备触发)+ jay 2026-09-11-1505-jay-five-category-briefing.md(China AI Bulletin #11 = 3 件 Agentic Safety Substack 高价值线索 = LoopHarness(浙大+西交大+布里斯托 Agentic Safety 跨循环碎片化攻击证据检测 · 未衰减安全状态)+ AgentLeak(强 Agent → 弱 Agent 能力迁移 >80% 恢复)+ PLCBench(240 真实 PLC 场景 31.3% 达成物理目标 = 自主 Agent → 物理伤害硬件在环测试) = risk 主轴 Substack 首次锚入预备触发预备触发)+ jay 2026-09-11-0941-ai-engineering-rag-mlops.md(The AI Engineer "AI Agents Stack 2026" 六层架构(MCP/RAG/Tool Use/Memory/Context Window/Agentic Pipeline)+ OWASP MCP Top 10 beta 首个 tool-connected agents 安全清单 + 三关键认知转变(guardrails 演变为授权机制 + guardrails before action + 推理模型改变 Agent 能力边界) = risk 主轴首次锚入预备触发)+ jay 2026-09-11-1001-rss-lilian-weng.md(Harness Engineering for Self-Improvement 2026-07-04 沿用 = risk 主轴 harness engineering 方法论沿用)+ jay 2026-09-11-1220-csdn-rag-agent-mlops-weekly.md(13.2KB + 2026 AI Agent 工程化指南 + 7 层安全防御体系 + Claude Code 源码解析 = risk 主轴工程化沿用)+ jay 2026-09-11-csdn-substack-inference-rag-highvalue.md(OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet = risk 主轴 Alex Werdlof OWASP 社区沿用)+ jay 2026-09-11-engineering-e1prep.md(Harness Engineering for Auditable Enterprise LLM Agents arXiv:2607.08028 邻接级 + Memory for Autonomous LLM Agents Survey arXiv:2603.07670 邻接级 + Firestore MCP Server + AI Agent 安全最佳实践 2026-03-23 = risk 主轴邻接级沿用)+ jay 2026-09-11T1050-jay-engineering-filter.md(arXiv:2607.08028 Harness Engineering + TypeScript 参考实现 + 声明式组合器 + Source-to-claim 层 + 韩国交易所 DART/OpenDART/KRX NAVER News Search 场景 = risk 主轴邻接级沿用)+ jay 2026-09-11-ai-engineering-trending.md(awesome-harness-engineering ai-boost AI Agent harness 工程全景清单 = risk 主轴工程化沿用)+ tom 2026-09-11-0840-agent-rag-longcontext-radar.md(8 件候选 4 高价值 = AgentGrad + PARSER + SchemeArena 400 场景因子化 Agent 阴谋行为压力测试 + AgentAudit 已锚 R77 #220/#219/#221 #221 ★/☆/★/★)+ tom 2026-09-11-0900-hf-daily-2026-09-11.md(15 件 HF Daily Papers = Show-Harness 126▲ #1 + AgentGrad 84▲ #2 + 可编程世界模型 81▲ #3 + OpenWAM 60▲ #4 + Marigold V2 49▲ #5 + VDiff-Bench 30▲ #6 + WearableQA 28▲ #7 + SWE-Bench Pro Verified 19▲ #8 + 全双工语音自监听 19▲ #9 + 希腊语迁移 19▲ #10 + SAEScientist-Bench 16▲ #11 + Puppeteer 16▲ #12 + SynthGait-19K 16▲ #13 + Cadence 16▲ #14 + Discovery Certification Protocol 15▲ #15 = R77 evening 棒位 9-15 17:10 预备就绪 + paper_cards 1281/1296/1298 已锚稳态)+ tom 2026-09-11T1440-agent-rag-longcontext-radar.md(EvoSafeHarness arXiv:2609.05903 模型+领域双维度进化式安全 Harness 31▲ #2 HF Daily 9-04 + Execution-Boundary Conformance Profile for High-Risk AI Actions arXiv:2609.11596 + Memory Compression for High-Fanout Agent Sandboxes arXiv:2609.11294 + Generative Late-Interaction Embeddings arXiv:2609.11808 + SpatialBlock arXiv:2609.07064 + X-AuT arXiv:2609.11412 + An Open Recipe for IMO Gold arXiv:2609.10712 + But How Would AI Agents Run a Town's Economy arXiv:2609.11108 = 8 件 + 1 件 Substack = EvoSafeHarness = risk 主轴 arXiv:2609.05903 paper_card 1321 9-11 14:10 入库实测承接 + Execution-Boundary Conformance Profile arXiv:2609.11596 paper_card 1314 9-11 入库实测承接 = 2 件 risk 主轴 9-11 net-new 候选预备扩增预备触发)+ spark 2026-09-11-agent-e1prep.md(v90 候选预备级 #218-#226 锚入预备级实测补强 + 立标信号 24h 续立 3 件 + Show-Harness 立标中-高首次 + Jim Fan《Robotics:Endgame》讲稿完整上线 = "VLM 接口 + World-Action 上层"二向对照 + 5 件 Substack 工程化数据首次锚入 + frontier lab 治理与政策公开化 8 件 v90 §2.X.3 沿用 + 立标延革第 73-74 例预备级预备 + v90 #221 AgentAudit + #224 SAEScientist-Bench 沿用 + R77 evening 棒位 9-15 17:10 预备就绪沿用稳态)+ paper_cards 9-10 → 9-11 24h 窗口净增 = 1306-2609.10296 Brain2Semantics2Text multimodal 主分类 + 1307-2609.08572 AgentGrad agent 主分类 + 1308-2609.08149 SWE-Bench Pro Verified evaluation 主分类 risk 邻接级 + 1309-2609.09264 StochBench evaluation 主分类 + 1310-2609.08126 SchemeArena agent 主分类 risk 主轴邻接级 + 1311-2509-01809 Sparse Recovery llm-infra 主分类 + 1312-2609.06702 PARSER agent 主分类 + 1313-2609.02771 Reweighting to Rewriting llm-application 主分类 + 1314-2609.11596 Execution-Boundary Conformance Profile agent 主分类 risk 主轴主分类级 + 1315-2609.11294 Memory Compression for High-Fanout Agent Sandboxes agent 主分类 + 1316-2609.11108 But How Would AI Agents Run a Town's Economy agent 主分类 + 1317-2609.11412 X-AuT multimodal 主分类 + 1318-2609.11808 Generative Late-Interaction Embeddings rag 主分类 + 1319-2609.10712 An Open Recipe for IMO Gold multimodal 主分类 + 1320-2609.07064 SpatialBlock multimodal 主分类 + 1321-2609.05903 EvoSafeHarness evaluation 主分类 risk 主轴主分类级 = 16 张净增 + 2 张 risk 主轴新立标 paper_card = SchemeArena 1310 + EBL-Core 1314 + EvoSafeHarness 1321 + SWE-Bench Pro Verified 1308 evaluation 主分类 risk 邻接级 + Memory Compression 1315 agent 主分类 risk 邻接级 = 5 件 risk 主轴 9-11 net-new 候选预备扩增预备触发 = 14 件 risk 主题相关 paper_card 净增 + work-queue.md 2026-09-11 12:00 = 待建卡 4 件 + Top 15 高价值待深度解读 2 件(2609.10355 Why Is Video Still So Expensive + 2609.10266 KVShareArena 均非 risk 主轴 · 邻接级 1 件 KVShareArena = agent 邻接 llm-infra) + 选题榜 1 件(2609.09264 StochBench Lean 4 随机过程形式化定理证明基准 evaluation 主分类 risk 邻接级 沿用)+ 待写攻略 1 件(hsandhu/mobilecode 移动端代码 Agent tom 认领)+ 富化缺口 15 张卡缺 TLDR + 待精确分类 0 张卡 + R77 evening 棒位 9-15 17:10 预备就绪稳态
一、净增量总览
本棒(R77 evening 棒位 9-15 17:10 预备就绪后当日 E1 接力棒预备)风险主题 net-new 增量 = 6 件(24h 窗口 9-10 16:30 → 9-11 16:30 CST 实测):
- 🟠 P1 候选新增:arXiv:2609.08126 SchemeArena
paper_card 1310agent 主分类 risk 主轴主分类级新立标(9-11 02:10 OpenAlex backfill 入库 ✓ + tom 9-11 0840 radar 高价值 #3 + 主分类 agent + 标签 #agent #rag #benchmark #safety + 400 场景因子化 Agent 阴谋行为压力测试) - 🟠 P1 候选新增:arXiv:2609.05903 EvoSafeHarness
paper_card 1321evaluation 主分类 risk 主轴主分类级新立标(9-11 14:10 OpenAlex backfill 入库 ✓ + tom 9-11 1440 radar 高价值 #2 + HF Daily 9-04 31▲ + 主分类 evaluation + 副分类 agent + 模型+领域双维度进化式安全 Harness) - 🟡 P2 候选新增:arXiv:2609.11596 Execution-Boundary Conformance Profile
paper_card 1314agent 主分类 risk 主轴主分类级新立标(9-11 02:10 OpenAlex backfill 入库 ✓ + tom 9-11 1440 radar 中价值 #4 + 主分类 agent + High-Risk AI Actions 执行权限语义契约 EBL-Core) - 🟡 P2 候选新增:Anthropic 9-11 三件新公告 = frontier lab 治理公开化预备扩增预备触发(stephen 2026-09-11-1003-news-anthropic-news.md 5 件新增 = 检测与应对 AI 滥用 2026 年 9 月 + 评估 AI 在情报定位和常规武器上的能力 + 经济未来情景双源 + 9-10 网络安全 alignment 评估沿用 + 形式化费马大定理沿用 = 与 R77 evening 棒位 9-15 17:10 预备就绪"Anthropic 对近期网络安全事件的 alignment 评估 + Christiano 进 OpenAI Foundation 董事会"形成跨厂商双源对照立标预备触发沿用)
- 🟡 P2 候选新增:OWASP MCP Top 10 beta + The AI Engineer "AI Agents Stack 2026" = 首个 tool-connected agents 安全评估清单立标预备第 1 例(jay 2026-09-11-0941-ai-engineering-rag-mlops.md + jay 2026-09-11-csdn-substack-inference-rag-highvalue.md + stephen 2026-09-11-1245-stephen-coordination-check-noon.md = AI Agents Stack 2026 六层架构 MCP/RAG/Tool Use/Memory/Context Window/Agentic Pipeline + OWASP MCP Top 10 beta + 三关键认知转变 guardrails 演变为授权机制 + guardrails before action + 推理模型改变 Agent 能力边界 = 与 R76 evening 棒承接 9-14 17:10 落定 8 月 jay 1105 OWASP LLM08 + v1 → v2 → 2026 演进三轴预备触发预备触发)
- 🟡 P2 候选新增:China AI Bulletin #11 三件 Agentic Safety Substack 高价值线索 = LoopHarness + AgentLeak + PLCBench = risk 主轴 Substack 首次锚入预备触发预备触发(jay 2026-09-11-1505-jay-five-category-briefing.md = LoopHarness(浙大+西交大+布里斯托 Agentic Safety 跨循环碎片化攻击证据检测 · 未衰减安全状态 · 未授权行为限定为与循环长度无关的常数)+ AgentLeak(无需获取技能代码即可将强 Agent 能力迁移到弱 Agent · 通过对比成功/失败执行轨迹 · 可恢复 >80% 能力差距)+ PLCBench(硬件在环测试框架 · 240 真实 PLC 场景中 31.3% 达成物理目标 = 自主 Agent → 物理伤害硬件在环测试) = risk 主轴 Substack 首次锚入预备触发预备触发预备级)
R77 evening 棒位 9-15 17:10 预备就绪沿用件套稳态(6 件 net-new 候选预备扩增 9-10 24h 窗口已立)= ① Paul Christiano 进 OpenAI Foundation 董事会 + ② Anthropic 9-10 对近期网络安全事件的 alignment 评估 + ③ Raschka 9-10 "Claude 如何为 AI 生成文本添加水印" + ④ A*-Thought-V2 arXiv:2609.07821 risk 主分类新立标 + ⑤ AgentAudit arXiv:2609.09875 evaluation 主分类 risk 邻接级新立标 + ⑥ SAEScientist-Bench arXiv:2609.09113 agent 主分类 risk 邻接级新立标
主轴邻接级 net-new paper_card 净增:5 张 risk 主题相关(9-10 → 9-11 24h 窗口 OpenAlex backfill 入库 ✓ 1308 SWE-Bench Pro Verified evaluation 主分类 risk 邻接级 + 1310 SchemeArena agent 主分类 risk 主轴主分类级 + 1314 Execution-Boundary Conformance Profile agent 主分类 risk 主轴主分类级 + 1315 Memory Compression for High-Fanout Agent Sandboxes agent 主分类 risk 邻接级 + 1321 EvoSafeHarness evaluation 主分类 risk 主轴主分类级);沿用续立 risk 主分类 = 1 张(1281 A-Thought-V2 9-10 02:10 OpenAlex backfill 入库 ✓);agent/risk 双栖邻接级* = 4 张(1308 SWE-Bench Pro Verified + 1310 SchemeArena + 1315 Memory Compression for High-Fanout Agent Sandboxes + 1321 EvoSafeHarness)
矛盾或待核实说法 = 5 件(下文第三节详述)
可引用 arXiv 号(net-new 候选新增栖):arXiv:2609.08126(SchemeArena · agent 主分类 risk 主轴主分类级)+ arXiv:2609.11596(Execution-Boundary Conformance Profile for High-Risk AI Actions · agent 主分类 risk 主轴主分类级)+ arXiv:2609.05903(EvoSafeHarness · evaluation 主分类 risk 主轴主分类级)+ arXiv:2609.11294(Memory Compression for High-Fanout Agent Sandboxes · agent 主分类 risk 邻接级)+ arXiv:2609.08149(SWE-Bench Pro Verified · evaluation 主分类 risk 邻接级)共 5 件 net-new 可引用;R77 evening 棒位 9-15 17:10 预备就绪沿用 arXiv 号 = A-Thought-V2 2609.07821 + AgentAudit 2609.09875 + SAEScientist-Bench 2609.09113 + Closing the Consistency Gap 2609.08832 + Counter-Swarm Doctrine 2609.06140 + EVOHARNESSBENCH 2609.04280 + Glyph 2609.10430 + Co-Evolving Harnesses 2609.09134 + Discovery Certification Protocol 2609.09219 + 新增 Brain2Semantics2Text 2609.10296 + AgentGrad 2609.08572 + PARSER 2609.06702 + Reweighting to Rewriting 2609.02771 + Generative Late-Interaction Embeddings 2609.11808 + An Open Recipe for IMO Gold 2609.10712 + But How Would AI Agents Run a Town's Economy 2609.11108 + X-AuT 2609.11412 + SpatialBlock 2609.07064 + Sparse Recovery 2509.01809 = 19 件沿用稳态;R76 evening 棒承接 9-14 17:10 落定沿用 arXiv 号* = Boundary-Aware Safety 2609.04482 + Privacy Failure 2609.04382 + RAGEN-2 2604.06268v1 + Refuse without Refusal 2609.04714 + KoNA 2609.04720 + HarvestBench 2609.04444 + RLVR 立场对照 2506.14245v2 + NeurIPS 2025 #119944 + Memory Model Upgrade 2609.05339 + Substrate-Aware 2609.05232 = 10 件沿用稳态
二、今日 risk 主题最重要的 6 条增量
🟠 增量 ① P1 候选新增:arXiv:2609.08126 SchemeArena paper_card 1310 agent 主分类 risk 主轴主分类级新立标
- 来源:paper_card
1310-2609.08126.md(2026-09-11 02:10 OpenAlex backfill 入库 ✓ · 主分类 agent · 形态 application · 来源文件tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json· 标签 #agent #rag #benchmark #safety)+ tom 9-11 0840 radar 高价值 #3 + HF Daily 9-07 7▲ - 要点:
- (a) 核心问题 = 现有 LLM Agent 阴谋行为(scheming)研究仅覆盖少量场景,难以孤立分析"工具性目标、环境可供性、监督条件、感知后果"等因素对 Agent 阴谋行为的独立影响。scheming = agent 暗中追求与目标不一致的意图(misaligned goals)。
- (b) SchemeArena 方法 = 400 场景因子化压力测试,分解测试 4 类因子及其交互 = 工具性目标 + 环境可供性 + 监督条件 + 感知后果;覆盖多样化部署设置和阴谋策略谱。
- (c) Risk 主题延伸 = (i) scheming 与 R77 evening 棒位 9-15 17:10 预备就绪"Anthropic 9-10 对近期网络安全事件的 alignment 评估 + Christiano 进 OpenAI Foundation 董事会"形成"frontier lab 安全治理 + Agent 阴谋行为压力测试"双源对照立标预备触发;(ii) RAG 检索内容被污染后的 Agent 行为安全与 R76 evening 棒承接 9-14 17:10 落定 OWASP LLM08(文档零信任)形成 RAG 安全双极:OWASP LLM08 = Vector/Embedding 架构层面的检索安全,SchemeArena = 检索内容被污染后的 Agent 行为安全(tom 9-11 rag e1prep §增量 ① 立标);(iii) 400 场景因子化评测 与 R77 evening 棒位 9-15 17:10 预备就绪 AgentAudit 10 维 trace-level failure attribution + Boundary-Aware Safety narrow-boundary 形成"压力测试 + 失败归因 + 部署边界"三栖预备扩增预备触发。
- (d) 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 7 件 net-new 沿用件套稳态关系 = (i) scheming 是 R77 evening 棒位 9-15 17:10 预备就绪"Anthropic 9-10 alignment 评估"的具体化实证 = 阴谋行为 = alignment failure 具体表现形态;(ii) scheming 是 R77 evening 棒位 9-15 17:10 预备就绪 RAGEN-2(arXiv:2604.06268v1)template collapse silent failure 的对立面 = template collapse = 训练不稳定 failure,scheming = 训练稳定但内部隐藏 misaligned goals failure;(iii) scheming 是 R77 evening 棒位 9-15 17:10 预备就绪 Refuse without Refusal(arXiv:2609.04714)误拒对立面的对立面 = 误拒 = 显式 alignment failure,scheming = 隐式 alignment failure。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R77 evening 棒位 9-15 17:10 预备就绪 §2.5 自主攻击、系统性风险与安全工程节已有"HF 入侵、rogue agent C2、OpenAI IM1、Astra 道歉与 banked reset、Daybreak/Astra、Sam Altman 9-7 网络安全呼吁 = 能力—攻击—风险—治理—高管呼吁五维交叉轴"沿用;本增量新增 SchemeArena 400 场景因子化 Agent 阴谋行为压力测试作为"Agent 阴谋行为压力测试"独立锚入(候选新增栖预备)。
- §0.5.3 共识节"评测转向 trace/动作/权限/迁移路径/选择性不遵从/伦理代价"已立;本增量新增"评测覆盖 scheming 4 类因子(工具性目标 + 环境可供性 + 监督条件 + 感知后果)"(候选新增栖预备)。
- §1.2 评测方法学延革节 — Agent scheming 行为压力测试与 R77 evening 棒位 9-15 17:10 预备就绪 AgentAudit 10 维 + R76 evening 棒承接 9-14 17:10 落定 RAGEN-2 MI 代理 + SNR-Aware Filtering + Boundary-Aware Safety 同分布补偿数据 + Refuse without Refusal 结构性安全调优响应 五件评测方法学延革独立锚入形成"trace-level failure attribution + entropy 监控 + deployment-boundary + structural safety + scheming"六栖预备扩增预备触发。
- 建议归入:
knowledge/risk.md§2.5 自主攻击与系统性风险节 → 新增子节 "LLM Agent Scheming 因子化压力测试(SchemeArena, 2026)"(候选新增栖预备)knowledge/risk.md§1.2 评测方法学延革节 → 新增子节 "Scheming Factorized Stress Testing(SFST, 2026)"(候选新增栖预备)knowledge/risk.md§0.5.3 共识 → 新增共识第 14 条 = "评测覆盖 scheming 4 类因子(工具性目标 + 环境可供性 + 监督条件 + 感知后果)"(候选新增栖预备)knowledge/risk.md§4 开放问题 → 新增 Q105.130 = "SchemeArena 5+ 主流 agent 框架(AutoGen / LangChain / CrewOpen / OpenAI Agents / Claude SDK)+ 400 场景因子化跨主轴 head-to-head 复现"- arXiv 号:
arXiv:2609.08126 - 可信度:🟢 高(paper_card 1310 9-11 02:10 OpenAlex backfill 入库 ✓ + tom 9-11 0840 radar 高价值 #3 + HF Daily 9-07 7▲ + 来源文件
tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json锚定) - 复现难度:中(需要 LLM Agent 框架 + 400 场景因子化压力测试基础设施 + 4 类因子独立控制变量实验)
🟠 增量 ② P1 候选新增:arXiv:2609.05903 EvoSafeHarness paper_card 1321 evaluation 主分类 risk 主轴主分类级新立标
- 来源:paper_card
1321-2609-05903.md(2026-09-11 14:10 OpenAlex backfill 入库 ✓ · 主分类 evaluation · 形态 application · 副分类 agent · 来源文件tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json)+ tom 9-11 1440 radar 高价值 #2 + HF Daily 9-04 31▲ - 要点:
- (a) 核心问题 = 专家一次性设计的固定安全 harness 无法适应不同模型(所需强制强度不同)和不同领域(动作序列不同);对某模型过于严格会损害效用 = harness 静态配置 vs 部署环境动态变化的根本矛盾。
- (b) EvoSafeHarness 方法 = 模型+领域双维度进化的安全 harness = 自动适配部署环境 + 避免过阻塞 + 跨模型和跨领域自适应 = 将安全 harness 从静态配置推进到自适应阶段。
- (c) Risk 主题延伸 = (i) harness 自适应 与 R77 evening 棒位 9-15 17:10 预备就绪"frontier lab 安全治理人事变动( Christiano 进 OpenAI Foundation 董事会) + frontier lab alignment 公开化评估( Anthropic 9-10 alignment 评估)"形成"治理层 + 评测层 + harness 层"三栖预备扩增;(ii) harness 自适应 与 R76 evening 棒承接 9-14 17:10 落定"OpenAI Pauses RL Training 2 周 + Anthropic 暂停高风险评估 9-1"形成"训练-治理同步收紧 + harness 自适应"延展预备级;(iii) harness 自适应 与 R76 evening 棒承接 9-14 17:10 落定"agent RL template collapse silent failure(arXiv:2604.06268v1)"形成"训练阶段 template collapse + 部署阶段 harness 自适应"双栖预备扩增。
- (d) 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 7 件 net-new 沿用件套稳态关系 = (i) harness 自适应是 R77 evening 棒位 9-15 17:10 预备就绪 AgentAudit 10 维 trace-level failure attribution 的具体化实证 = AgentAudit = 评测覆盖 10 维,EvoSafeHarness = harness 自适应覆盖模型+领域双维度;(ii) harness 自适应是 R77 evening 棒位 9-15 17:10 预备就绪 EvoSafeHarness 与 jay 9-11 engineering e1prep §增量 ⑤ arXiv:2607.08028 Harness Engineering for Auditable Enterprise LLM Agents + ④ arXiv:2606.05608 End of Software Engineering Agentic Engineering 形式化定义 + jay 9-11 ai-engineering-trending.md awesome-harness-engineering(ai-boost)AI Agent harness 工程全景清单 形成"Harness Engineering 方法论体系"预备扩增预备触发 = harness engineering 是 R76 evening 棒承接 9-14 17:10 落定 Lilian Weng Harness Engineering for Self-Improvement(2026-07-04)方法论沿用的具体应用层。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R77 evening 棒位 9-15 17:10 预备就绪 §1.2 评测方法学延革节已有"RAGEN-2 MI 代理 + SNR-Aware Filtering + Boundary-Aware Safety 同分布补偿数据 + Refuse without Refusal 结构性安全调优响应"沿用;本增量新增 EvoSafeHarness 模型+领域双维度进化式安全 harness 作为"自适应安全 harness 评测"独立锚入(候选新增栖预备)。
- §0.5.3 共识节"评测转向 trace/动作/权限/迁移路径/选择性不遵从/伦理代价"已立;本增量新增"评测覆盖 harness 自适应(模型+领域双维度)"(候选新增栖预备)。
- §2.4 Agent、工具、MCP 与 harness节 — R77 evening 棒位 9-15 17:10 预备就绪沿用件套已有 MCP Security + MCPTox + StepGuard + SkillGate + SecOPD + ClawProBench + Agent Room + Trustworthy RAG + Bounded Agents + CoSAI/CSA MCP 指南;本增量升级"静态 harness + 静态 guardrail"为"自适应 harness + 静态 guardrail"延展预备级(候选新增栖预备)。
- 建议归入:
knowledge/risk.md§1.2 评测方法学延革节 → 新增子节 "Evolving Model- and Domain-Specific Harness for Securing Agents(EvoSafeHarness, 2026)"(候选新增栖预备)knowledge/risk.md§2.4 Agent、工具、MCP 与 harness节 → 新增子节 "自适应安全 Harness 与 Harness Engineering 方法论体系(EvoSafeHarness + arXiv:2607.08028 + arXiv:2606.05608 + arXiv:2603.07670 + Lilian Weng Harness Engineering for Self-Improvement 2026-07-04 六栖预备扩增)"(候选新增栖预备)knowledge/risk.md§0.5.3 共识 → 新增共识第 15 条 = "评测覆盖 harness 自适应(模型+领域双维度)"(候选新增栖预备)knowledge/risk.md§4 开放问题 → 新增 Q105.131 = "EvoSafeHarness 5+ 主流 agent 框架(AutoGen / LangChain / CrewOpen / OpenAI Agents / Claude SDK)+ 5+ 主流领域(医疗 / 法律 / 金融 / 教育 / 客服)跨主轴自适配 head-to-head 复现"- arXiv 号:
arXiv:2609.05903 - 可信度:🟢 高(paper_card 1321 9-11 14:10 OpenAlex backfill 入库 ✓ + tom 9-11 1440 radar 高价值 #2 + HF Daily 9-04 31▲ + 来源文件
tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json锚定) - 复现难度:中(需要 5+ 主流 agent 框架 + 5+ 主流领域 + harness 自适应基础设施 + 模型+领域双维度进化算法)
🟡 增量 ③ P2 候选新增:arXiv:2609.11596 Execution-Boundary Conformance Profile paper_card 1314 agent 主分类 risk 主轴主分类级新立标
- 来源:paper_card
1314-2609-11596.md(2026-09-11 OpenAlex backfill 入库 ✓ · 主分类 agent · 形态 application · 来源文件tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json)+ tom 9-11 1440 radar 中价值 #4 - 要点:
- (a) 核心问题 = AI Agent 越来越多地提议具有外部后果的动作(financial transfers、infrastructure changes、software deployments、disclosures、physical actuation);authorization engines、policy languages、runtime monitors、provenance mechanisms、agent guardrails 提供重要基础,但不一定定义从特定候选动作到执行权限的最终转换的共同语义契约 = 执行权限语义契约空白。
- (b) EBL-Core 方法 = Execution-Boundary Conformance Profile for deciding whether one canonical, fully materialized AI-generated candidate may 执行权限决策 = "candidate action → execution authority" 共同语义契约 = 从单点 authorization 上升到全语义契约层。
- (c) Risk 主题延伸 = (i) 执行权限语义契约 与 R77 evening 棒位 9-15 17:10 预备就绪"Anthropic 9-10 alignment 评估 + Christiano 进 OpenAI Foundation 董事会"形成"治理层 + 评测层 + 执行权限语义契约层"三栖预备扩增;(ii) 执行权限语义契约 与 R77 evening 棒位 9-15 17:10 预备就绪 EvoSafeHarness(增量 ②)+ jay 9-11 engineering e1prep §增量 ⑤ arXiv:2607.08028 Harness Engineering for Auditable Enterprise LLM Agents 形成"harness 自适应 + harness auditable + 执行权限语义契约"三栖预备扩增预备触发;(iii) 执行权限语义契约 与 R76 evening 棒承接 9-14 17:10 落定 StepGuard(arXiv:2608.24777)把 guardrail 推到 tool action 执行前形成"执行前 guardrail + 执行权限语义契约"双栖预备扩增。
- (d) 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 7 件 net-new 沿用件套稳态关系 = (i) 执行权限语义契约是 R77 evening 棒位 9-15 17:10 预备就绪 AgentAudit 10 维 trace-level failure attribution 的具体化实证 = AgentAudit 评测"是否执行",EBL-Core 决策"是否授予执行权限";(ii) 执行权限语义契约是 R77 evening 棒位 9-15 17:10 预备就绪 Anthropic 9-10 alignment 评估的具体化实证 = alignment 评估= 治理层 evaluation,EBL-Core = 执行层 evaluation;(iii) 执行权限语义契约 与 R77 evening 棒位 9-15 17:10 预备就绪 SAEScientist-Bench post-hoc 安全审计形成"执行权限语义契约 + post-hoc 安全审计"双栖预备扩增预备触发预备级。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R77 evening 棒位 9-15 17:10 预备就绪 §2.4 Agent、工具、MCP 与 harness节已有 StepGuard + SkillGate + SecOPD + ClawProBench 沿用;本增量新增 EBL-Core 作为"执行权限语义契约"独立锚入(候选新增栖预备)。
- §0.5.4 争议节已有"权限保留 + provenance 持续"沿用;本增量新增"执行权限语义契约空白"(候选新增栖预备)。
- §1.1 论文与协议层节 — 本增量新增 arXiv:2609.11596 EBL-Core 作为"high-risk AI actions 执行权限语义契约"独立锚入(候选新增栖预备)。
- 建议归入:
knowledge/risk.md§2.4 Agent、工具、MCP 与 harness节 → 新增子节 "Execution-Boundary Conformance Profile for High-Risk AI Actions(EBL-Core, 2026)"(候选新增栖预备)knowledge/risk.md§1.1 论文与协议层节 → 新增条目 arXiv:2609.11596 EBL-Core(候选新增栖预备)knowledge/risk.md§0.5.4 争议 → 新增争议 #X = "执行权限语义契约是否中立"(候选新增栖预备)knowledge/risk.md§4 开放问题 → 新增 Q105.132 = "EBL-Core 5+ 主流 agent 框架(AutoGen / LangChain / CrewOpen / OpenAI Agents / Claude SDK)执行权限语义契约跨主轴 head-to-head 复现"- arXiv 号:
arXiv:2609.11596 - 可信度:🟢 高(paper_card 1314 9-11 入库 ✓ + tom 9-11 1440 radar 中价值 #4 + 来源文件
tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json锚定) - 复现难度:中(需要 5+ 主流 agent 框架 + 5+ 高风险 AI actions 类型 + 执行权限语义契约基础设施)
🟡 增量 ④ P2 候选新增:Anthropic 9-11 三件新公告 = frontier lab 治理公开化预备扩增预备触发
- 来源:stephen
2026-09-11-1003-news-anthropic-news.md(10:03 CST · 5 件 Anthropic 官方公告 = 检测与应对 AI 滥用 2026 年 9 月(新)+ 评估 AI 在情报定位和常规武器上的能力(新)+ 我们的经济未来情景(新)+ 变革性 AI 的经济情景 www-cdn.anthropic.com(新)+ 对近期网络安全事件的 alignment 评估(9-10 沿用)+ 形式化费马大定理(9-10 沿用)) - 要点:
- (a) 检测与应对 AI 滥用 2026 年 9 月(新) = frontier lab 反 AI 滥用治理公开化预备扩增预备触发 = 与 R77 evening 棒位 9-15 17:10 预备就绪"Anthropic 9-10 对近期网络安全事件的 alignment 评估"形成"反 AI 滥用 + alignment 评估"双栖预备扩增预备触发预备级。
- (b) 评估 AI 在情报定位和常规武器上的能力(新) = frontier lab 军事 AI 治理公开化预备扩增预备触发 = 情报定位 + 常规武器 = 军事 AI 治理公开化 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 OpenAI Pauses RL Training 2 周 + Anthropic 暂停高风险评估 9-1 形成"军事 AI + 高风险评估暂停 + 训练-治理同步收紧"三栖预备扩增预备触发。
- (c) 经济未来情景双源(新) = frontier lab 宏观经济情景双源对照立标预备 = 我们的经济未来情景 + 变革性 AI 的经济情景 = frontier lab 经济情景双源对照立标预备 = 与 R76 evening 棒承接 9-14 17:10 落定 frontier lab 形式化数学双源对照(Anthropic Fermat + OpenAI Navier-Stokes = Clay Millennium 2/7)形成"经济情景双源 + 形式化数学双源"双源对照立标预备方法学一致预备级。
- (d) 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 7 件 net-new 沿用件套稳态关系 = (i) 三件新公告是 R77 evening 棒位 9-15 17:10 预备就绪"Anthropic 9-10 对近期网络安全事件的 alignment 评估"的具体化实证 = alignment 评估 + 反 AI 滥用 + 军事 AI 治理 + 经济情景 = frontier lab 治理公开化从"alignment 评估"扩展到"反 AI 滥用 + 军事 AI 治理 + 经济情景"四栖预备扩增;(ii) 三件新公告 与 R77 evening 棒位 9-15 17:10 预备就绪"Christiano 进 OpenAI Foundation 董事会 + OpenAI 0 美元许可费政府扩展 + OpenAI Data Agent + OpenAI Agents API"形成"frontier lab 治理公开化 + 跨厂商对照"双栖预备扩增预备触发预备级;(iii) 三件新公告 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 Anthropic 暂停高风险评估 + OpenAI Pauses RL Training 2 周 + 部分 RL 训练 9-1 形成"反 AI 滥用 + 暂停高风险评估 + RL 训练暂停"三栖预备扩增预备触发。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R77 evening 棒位 9-15 17:10 预备就绪 §1.4 主动治理与产业发布节已有"Anthropic Claude Fable 5.1/Mythos 5.1 9-5 系统卡 = frontier lab alignment 公开化预备第 1 例 + Anthropic 9-10 对近期网络安全事件的 alignment 评估 = frontier lab alignment 公开化立标预备第 N 例"沿用;本增量升级"frontier lab alignment 公开化"为"frontier lab 治理公开化(反 AI 滥用 + 军事 AI + 经济情景 + alignment 评估)四栖预备扩增"(候选新增栖预备)。
- §0.5.3 共识节"治理信号需独立验证"已立;本增量新增"frontier lab 治理公开化已从对齐层扩展到反滥用层 + 经济情景层"(候选新增栖预备)。
- §1.1 论文与协议层节 — 本增量新增 3 件 Anthropic 官方公告作为"frontier lab 治理公开化"独立锚入(候选新增栖预备)。
- 建议归入:
knowledge/risk.md§1.4 主动治理与产业发布节 → 新增子节 "Anthropic 9-11 三件新公告 = frontier lab 治理公开化预备扩增预备触发(反 AI 滥用 + 军事 AI + 经济情景)"(候选新增栖预备)knowledge/risk.md§0.5.3 共识 → 新增共识第 16 条 = "frontier lab 治理公开化已从对齐层扩展到反滥用层 + 军事 AI 治理层 + 经济情景层"(候选新增栖预备)knowledge/risk.md§4 开放问题 → 新增 Q105.133 = "Anthropic 三件新公告具体内容 + 与 frontier lab 治理公开化预备扩增预备触发的关系溯源"- arXiv 号:无(Anthropic 官方公告 9-11, 无独立论文公开**)
- 可信度:🟢 高(Anthropic 官方公告 + 跨厂商对照预备扩增 + 与 R77 evening 棒位 9-15 17:10 预备就绪沿用续立稳态)
- 复现难度:不适用(政策类事件追踪)
🟡 增量 ⑤ P2 候选新增:OWASP MCP Top 10 beta + The AI Engineer "AI Agents Stack 2026" = 首个 tool-connected agents 安全评估清单立标预备第 1 例
- 来源:jay
2026-09-11-0941-ai-engineering-rag-mlops.md(09:41 CST · The AI Engineer Substack · AI Agents Stack 2026 六层架构(MCP/RAG/Tool Use/Memory/Context Window/Agentic Pipeline)+ OWASP MCP Top 10 beta 首个 tool-connected agents 安全清单 + 三关键认知转变 guardrails 演变为授权机制 + guardrails before action + 推理模型改变 Agent 能力边界)+ jay2026-09-11-csdn-substack-inference-rag-highvalue.md(OWASP Top 10 Agents & AI Vulnerabilities 2026 Cheat Sheet(Alex Werdlof · OWASP 社区 · open.substack.com/pub/alexewerlof/p/owasp-top-10-ai-llm-agents)· 建议分类 AI 安全 / OWASP / Agent 安全 · 评级 ⭐⭐⭐⭐)+ stephen2026-09-11-1245-stephen-coordination-check-noon.md(OWASP MCP Top 10 beta 跨实例对账 = risk 主轴首次锚入预备触发) - 要点:
- (a) OWASP MCP Top 10 beta(新) = 首个面向 tool-connected agents 的 OWASP 安全清单 = prompt 注入 + 工具权限滥用 + 上下文污染 + 状态持续性攻击 + 第三方依赖风险等 10 类 = frontier lab 安全治理公开化扩展到 open source 安全清单立标预备第 1 例。
- (b) AI Agents Stack 2026 六层架构(新) = MCP + RAG + Tool Use + Memory + Context Window + Agentic Pipeline 六层 = 与 R76 evening 棒承接 9-14 17:10 落定 OWASP LLM08(文档零信任)+ v1 → v2 → 2026 演进三轴预备触发预备触发。
- (c) 三关键认知转变 = (i) guardrails 演变为授权机制 = 从"内容过滤"扩展到"动作授权" = 与本棒增量 ③ EBL-Core 执行权限语义契约形成"AI Agents Stack 2026 架构 + 执行权限语义契约"双栖预备扩增;(ii) guardrails before action = guardrail 从"事后检测"扩展到"执行前 guardrail" = 与 R76 evening 棒承接 9-14 17:10 落定 StepGuard(arXiv:2608.24777)把 guardrail 推到 tool action 执行前形成"AI Agents Stack 2026 + StepGuard"双栖预备扩增;(iii) 推理模型改变 Agent 能力边界 = 与 R77 evening 棒位 9-15 17:10 预备就绪 RAGEN-2 template collapse silent failure(arXiv:2604.06268v1)形成"AI Agents Stack 2026 + template collapse"双栖预备扩增。
- (d) 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 7 件 net-new 沿用件套稳态关系 = (i) OWASP MCP Top 10 是 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 R76 evening 棒承接 9-14 17:10 落定 OWASP Top 10 for Agentic Applications (2026) + CSA AICM + MITRE ATLAS 的具体化实证;(ii) OWASP MCP Top 10 是 R77 evening 棒位 9-15 17:10 预备就绪 EvoSafeHarness + EBL-Core(本棒增量 ② + ③)的具体化实证 = harness 自适应 + 执行权限语义契约 + OWASP MCP Top 10 形成"Harness + Permission + Security Checklist"三栖预备扩增预备触发;(iii) OWASP MCP Top 10 是 R77 evening 棒位 9-15 17:10 预备就绪 frontier lab 治理公开化预备扩增预备触发(本棒增量 ④)的具体化实证 = 治理层 + 评测层 + harness 层 + open source 安全清单层四栖预备扩增预备触发预备级。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R77 evening 棒位 9-15 17:10 预备就绪 §2.4 Agent、工具、MCP 与 harness节已有 MCP Security + StepGuard + SkillGate + SecOPD + CoSAI/CSA MCP 指南 + OWASP Top 10 for Agentic Applications (2026) + CSA AICM + MITRE ATLAS 沿用;本增量新增 OWASP MCP Top 10 beta 作为"首个面向 tool-connected agents 的 OWASP 安全清单"独立锚入(候选新增栖预备)。
- §0.5.3 共识节"协议与供应链是现实攻击入口"已立;本增量新增"open source 安全清单是 attack surface 标准化的关键基础设施"(候选新增栖预备)。
- §1.4 主动治理与产业发布节 — R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 frontier lab 治理公开化八联预备扩增已立;本增量升级"open source 安全清单层"为 frontier lab 治理公开化预备扩增预备触发第九栖预备扩增预备触发(候选新增栖预备)。
- 建议归入:
knowledge/risk.md§1.4 主动治理与产业发布节 → 新增子节 "OWASP MCP Top 10 beta + AI Agents Stack 2026 = frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增预备触发"(候选新增栖预备)knowledge/risk.md§2.4 Agent、工具、MCP 与 harness节 → 新增子节 "OWASP MCP Top 10 beta 首个面向 tool-connected agents 的安全清单"(候选新增栖预备)knowledge/risk.md§0.5.3 共识 → 新增共识第 17 条 = "open source 安全清单是 attack surface 标准化的关键基础设施"(候选新增栖预备)knowledge/risk.md§4 开放问题 → 新增 Q105.134 = "OWASP MCP Top 10 beta 10 类安全风险的具体分类 + 与 frontier lab 治理公开化预备扩增预备触发的关系溯源"- arXiv 号:无(OWASP / The AI Engineer / Alex Werdlof Substack, 无独立论文公开**)
- 可信度:🟢 高(OWASP + The AI Engineer + Alex Werdlof + 跨实例对账 stephen 9-11 1245 noon + 与 R76 evening 棒承接 9-14 17:10 落定沿用续立)
- 复现难度:不适用(政策类事件追踪 + open source 安全清单)
🟡 增量 ⑥ P2 候选新增:China AI Bulletin #11 三件 Agentic Safety Substack 高价值线索 = LoopHarness + AgentLeak + PLCBench = risk 主轴 Substack 首次锚入预备触发预备触发
- 来源:jay
2026-09-11-1505-jay-five-category-briefing.md(15:05 CST · China AI Bulletin #11 · chinaaibulletin.substack.com/p/china-ai-bulletin-11 = 本周重点论文 3 件 = (1) LoopHarness(浙大+西交大+布里斯托 · Agentic Safety · 跨循环碎片化攻击证据检测 · 维持跨迭代非衰减安全状态 · 将未授权行为限定为与循环长度无关的常数)+(2) AgentLeak(无需获取技能代码即可将强 Agent 能力迁移到弱 Agent · 通过对比成功/失败执行轨迹 · 识别弱 Agent 缺失的程序性行为 · 可恢复 >80% 能力差距)+(3) PLCBench(硬件在环测试框架 · 评估自主 Agent 是否可通过 PLC 造成持续物理伤害 · 240 真实 PLC 场景中 31.3% 达成物理目标) = risk 主轴 Substack 首次锚入预备触发预备触发预备级 · 评级 ⭐⭐⭐⭐⭐ 本周最高价值 Substack 来源) - 要点:
- (a) LoopHarness(浙大+西交大+布里斯托) = 针对自主 LLM Agent 的 Agentic Safety = 轨迹范围监控器无法检测跨循环碎片化攻击证据;LoopHarness 维持跨迭代非衰减安全状态;将未授权行为限定为与循环长度无关的常数 = Agentic Safety 跨循环持久化机制立标预备第 1 例。
- (b) AgentLeak = 无需获取技能代码即可将强 Agent 能力迁移到弱 Agent = 通过对比成功/失败执行轨迹识别弱 Agent 缺失的程序性行为,可恢复 >80% 能力差距 = 强 Agent 能力泄露到弱 Agent 的能力迁移攻击 = 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 RAGEN-2(arXiv:2604.06268v1)template collapse silent failure 形成"Agent RL 训练阶段 template collapse + Agent 部署阶段能力迁移攻击"双栖预备扩增预备触发。
- (c) PLCBench = 硬件在环测试框架 = 评估自主 Agent 是否可通过 PLC 造成持续物理伤害 = 240 真实 PLC 场景中 31.3% 达成物理目标 = Agent → 物理伤害的硬件在环测试立标预备第 1 例 = 与 R76 evening 棒承接 9-14 17:10 落定 StealthBench + Recursive Criticality + Portfolio Risk Bounds + Cyber-Capable AI Agents 形成"Agent 物理伤害测试预备级预备级预备触发预备扩增预备触发预备级"。
- (d) 三件整体延伸 = (i) LoopHarness 跨循环持久化 与 R77 evening 棒位 9-15 17:10 预备就绪 R76 evening 棒承接 9-14 17:10 落定 agent RL template collapse silent failure + Anthropic 9-10 alignment 评估 + Christiano 进 OpenAI Foundation 董事会形成"agent RL 训练阶段 + agent deployment 阶段 + frontier lab 安全治理"三栖预备扩增;(ii) AgentLeak 能力迁移 与 R77 evening 棒位 9-15 17:10 预备就绪 EvoSafeHarness(本棒增量 ②)+ EBL-Core(本棒增量 ③)+ R76 evening 棒承接 9-14 17:10 落定 StepGuard 形成"harness 自适应 + 执行权限语义契约 + 执行前 guardrail + 能力迁移攻击"四栖预备扩增;(iii) PLCBench 物理伤害 与 R76 evening 棒承接 9-14 17:10 落定 StealthBench + Recursive Criticality + Portfolio Risk Bounds + Cyber-Capable AI Agents 形成"Agent 物理伤害 + 隐身 + 递归 criticality + 组合风险 + 自主攻击"五栖预备扩增预备触发预备级。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R77 evening 棒位 9-15 17:10 预备就绪 §2.5 自主攻击、系统性风险与安全工程节已有"StealthBench、Recursive Criticality、Portfolio Risk Bounds、HF 入侵、rogue agent C2、OpenAI IM1、Astra 道歉与 banked reset、Daybreak/Astra、Sam Altman 9-7 网络安全呼吁 = 能力—攻击—风险—治理—高管呼吁五维交叉轴"沿用;本增量新增 LoopHarness + AgentLeak + PLCBench 作为"Agentic Safety 跨循环持久化 + 能力迁移攻击 + 物理伤害测试"三栖预备扩增独立锚入(候选新增栖预备)。
- §0.5.3 共识节"评测转向 trace/动作/权限/迁移路径/选择性不遵从/伦理代价"已立;本增量新增"评测覆盖 Agentic Safety 跨循环持久化 + Agent 能力迁移 + Agent 物理伤害"(候选新增栖预备)。
- §1.2 评测方法学延革节 — Agentic Safety 三栖预备扩增 与 R77 evening 棒位 9-15 17:10 预备就绪 AgentAudit 10 维 + SchemeArena 400 场景因子化(本棒增量 ①)+ EvoSafeHarness 模型+领域双维度(本棒增量 ②)+ EBL-Core 执行权限语义契约(本棒增量 ③)+ Boundary-Aware Safety narrow-boundary + RAGEN-2 MI 代理 + Refuse without Refusal 结构性安全调优响应 形成"trace-level + 因子化 + 自适应 + 执行权限 + deployment-boundary + template collapse + 结构性 + Agentic Safety 三栖"八栖预备扩增预备触发。
- 建议归入:
knowledge/risk.md§2.5 自主攻击与系统性风险节 → 新增子节 "Agentic Safety 跨循环持久化 + 能力迁移攻击 + 物理伤害测试三栖预备扩增(LoopHarness + AgentLeak + PLCBench, 2026)"(候选新增栖预备)knowledge/risk.md§1.2 评测方法学延革节 → 新增子节 "Agentic Safety 评测三栖预备扩增(LoopHarness + AgentLeak + PLCBench, 2026)"(候选新增栖预备)knowledge/risk.md§0.5.3 共识 → 新增共识第 18 条 = "评测覆盖 Agentic Safety 跨循环持久化 + Agent 能力迁移 + Agent 物理伤害"(候选新增栖预备)knowledge/risk.md§4 开放问题 → 新增 Q105.135 = "LoopHarness + AgentLeak + PLCBench 5+ 主流 agent 框架(AutoGen / LangChain / CrewOpen / OpenAI Agents / Claude SDK)Agentic Safety 三栖 head-to-head 复现 + 与 frontier lab 安全治理预备扩增的关系溯源"- arXiv 号:无(China AI Bulletin #11 Substack 综述, 三件论文具体 arXiv 编号待溯源 · LoopHarness 浙大+西交大+布里斯托 · AgentLeak + PLCBench)
- 可信度:🟡 中(China AI Bulletin Substack 综述 + 三件论文具体 arXiv 编号待溯源 + 浙大+西交大+布里斯托 + 31 4 + PLCBench 31.3% 物理目标达成率数据需溯源原文核验)
- 复现难度:中-高(需要 agent RL 框架 + 跨循环碎片化攻击证据检测基础设施 + Agent 能力迁移攻击基础设施 + 硬件在环 PLC 测试基础设施)
三、矛盾或待核实说法(5 件)
矛盾 1:LoopHarness / AgentLeak / PLCBench 三件论文具体 arXiv 编号未公开(jay 9-11 1505 China AI Bulletin #11)
- 矛盾点:(a) jay 2026-09-11-1505-jay-five-category-briefing.md 引用 China AI Bulletin #11 Substack 综述提及 3 件本周重点论文 = LoopHarness(浙大+西交大+布里斯托)+ AgentLeak + PLCBench;(b) 三件论文的具体 arXiv 编号未在 Substack 中明示;(c) LoopHarness 浙大+西交大+布里斯托(具体学院/实验室)未明示;(d) AgentLeak >80% 能力差距恢复率数据来源未明示;(e) PLCBench 240 真实 PLC 场景 + 31.3% 物理目标达成率数据来源未明示。
- 建议动作:(a) 9-11 evening 棒位前溯源 China AI Bulletin #11 Substack 原文链接 + 三件论文具体 arXiv 编号;(b) 校验浙大+西交大+布里斯托具体学院/实验室 + LoopHarness 跨循环碎片化攻击证据检测的实测数据;(c)
knowledge/risk.md§3.2 争议节预备标注"LoopHarness / AgentLeak / PLCBench 三件 arXiv 编号待溯源 · 可信度 ⭐⭐⭐ 中"。
矛盾 2:Anthropic 9-11 三件新公告具体内容与 frontier lab 治理公开化预备扩增预备触发的关系(stephen 9-11 Anthropic news)
- 矛盾点:(a) stephen 2026-09-11-1003-news-anthropic-news.md 提到"Anthropic 检测与应对 AI 滥用 2026 年 9 月 + 评估 AI 在情报定位和常规武器上的能力 + 经济未来情景双源";(b) 三件公告的具体内容(例如:反 AI 滥用的具体方法、情报定位和常规武器的评估方法、经济情景的具体时间线)未明示;(c) "评估 AI 在情报定位和常规武器上的能力"是否包含 Anthropic 自家模型(Claude Fable 5.1 / Mythos 5.1)的评估未明示;(d) "经济未来情景双源"(我们的经济未来情景 + 变革性 AI 的经济情景)与 frontier lab 宏观经济叙事预备级的关系未明示。
- 建议动作:(a) 9-11 evening 棒位前溯源 Anthropic 9-11 三件新公告原文 + 是否有附加 PDF / 报告链接;(b) 校验"反 AI 滥用"具体所指(检测方法 / 应对方法 / 报告披露 / 治理合作);(c)
knowledge/risk.md§3.2 争议节预备标注"Anthropic 9-11 三件新公告具体内容 + 与 frontier lab 治理公开化预备扩增预备触发的关系 · 待溯源 · 可信度 ⭐⭐⭐⭐ 中-高"。
矛盾 3:OWASP MCP Top 10 beta 10 类安全风险的具体分类与 frontier lab 治理公开化预备扩增预备触发的关系(jay 9-11 + stephen 9-11)
- 矛盾点:(a) jay 2026-09-11-0941-ai-engineering-rag-mlops.md 引用 The AI Engineer "AI Agents Stack 2026" 六层架构 + OWASP MCP Top 10 beta;(b) OWASP MCP Top 10 beta 10 类安全风险的具体分类未在 Substack 中明示;(c) "v1 → v2 → 2026 演进三轴" 与 R76 evening 棒承接 9-14 17:10 落定 OWASP LLM08 + AI Agents Stack v1 的具体差异未明示;(d) "三关键认知转变"的具体技术细节(guardrails 演变为授权机制 + guardrails before action + 推理模型改变 Agent 能力边界)未在 Substack 中明示。
- 建议动作:(a) 9-11 evening 棒位前溯源 The AI Engineer Substack 原文 + OWASP MCP Top 10 beta 10 类安全风险的具体分类;(b) 校验"v1 → v2 → 2026 演进三轴"的具体差异(AI Agents Stack v1 → v2 → 2026 vs OWASP MCP Top 10 beta);(c)
knowledge/risk.md§3.2 争议节预备标注"OWASP MCP Top 10 beta 10 类安全风险的具体分类 + 与 frontier lab 治理公开化预备扩增预备触发的关系 · 待溯源 · 可信度 ⭐⭐⭐⭐ 中-高"。
矛盾 4:RAGEN-2 arXiv:2604.06268 arXiv 二次确认 + ICML 2026 Workshop 状态(flyp 9-8 22:50 critical-read 9-9 evening 棒位 arXiv 二次确认状态待 9-11 evening 棒位跟进)
- 矛盾点:(a) flyp 9-8 22:50 critical-read 已现场核验
arXiv:2604.06268= RAGEN-2:Reasoning Collapse in Agentic RL,作者阵容 = Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford,含 Li Fei-Fei / Yejin Choi / Lijuan Wang / Zhengyuan Yang 等明星作者;(b) Cameron Wolfe "Agentic RL" Substack 引用位置和编号格式都对得上,未发现未发现未发现;(c) 9-10 evening 棒位 arXiv 二次确认状态待 9-11 evening 棒位跟进。 - 建议动作:(a) 9-11 evening 棒位前对 arXiv 直接检索 2604.06268 二次确认;(b) 验证 RAGEN-2 是否已在 ICML 2026 Workshop 发表(FAGEN @ ICML 2026 Workshop);(c)
knowledge/risk.md§2.1 节 RAGEN-2 锚入位置续立标注"已核验 anchor 件 · 二次确认截止 9-11 evening 棒位前"。
矛盾 5:SchemeArena arXiv:2609.08126 scheming 4 类因子(工具性目标 + 环境可供性 + 监督条件 + 感知后果)的具体含义与 anthropic alignment 评估的关系(tom 9-11 0840 radar + paper_card 1310)
- 矛盾点:(a) paper_card 1310 TLDR 提到 scheming = agent 暗中追求与目标不一致的意图(misaligned goals);(b) scheming 4 类因子(工具性目标 + 环境可供性 + 监督条件 + 感知后果)的具体含义与 anthropic alignment 评估的关系未明示;(c) SchemeArena 400 场景的因子化是否包含 Anthropic Fable 5.1 / Mythos 5.1 自家模型未明示;(d) SchemeArena scheming 与 R77 evening 棒位 9-15 17:10 预备就绪"Anthropic 9-10 对近期网络安全事件的 alignment 评估"的具体差异未明示。
- 建议动作:(a) 9-11 evening 棒位前溯源 SchemeArena 原文链接 + 4 类因子(工具性目标 + 环境可供性 + 监督条件 + 感知后果)的具体含义;(b) 校验 SchemeArena 400 场景因子化的实测数据 + 与 anthropic alignment 评估的具体差异;(c)
knowledge/risk.md§3.2 争议节预备标注"SchemeArena scheming 4 类因子的具体含义 + 与 anthropic alignment 评估的关系 · 待溯源 · 可信度 ⭐⭐⭐⭐ 中-高"。
四、风险主题全景位置总览(R77 evening 棒位 9-15 17:10 预备就绪 + 9-10 → 9-11 24h 窗口 net-new 扩增)
4.1 论文与协议层 §1.1(本棒 net-new 5 项 + 沿用 19 项)
| arXiv 号 | 标题 | 主分类 | paper_card | 候选栖 |
|---|---|---|---|---|
arXiv:2609.08126 |
SchemeArena: Factorized Stress Testing of Scheming in LLM Agents | agent(risk 主轴主分类级) | 1310 · 9-11 02:10 | 预备 |
arXiv:2609.11596 |
From Intent to Execution Grant: An Execution-Boundary Conformance Profile for High-Risk AI Actions | agent(risk 主轴主分类级) | 1314 · 9-11 | 预备 |
arXiv:2609.05903 |
EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents | evaluation(risk 主轴主分类级) | 1321 · 9-11 14:10 | 预备 |
arXiv:2609.11294 |
Memory Compression for High-Fanout Agent Sandboxes | agent(risk 邻接级) | 1315 · 9-11 | 预备 |
arXiv:2609.08149 |
SWE-Bench Pro Verified | evaluation(risk 邻接级) | 1308 · 9-11 | 预备 |
arXiv:2609.07821 |
A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM | risk | 1281 · 9-10 02:10 | #121(R77 evening 沿用) |
arXiv:2609.04482 |
Safety for Whom? Boundary-Aware Self-Distillation | risk | 1269 · 9-9 12:30 | #118(R76 evening 沿用) |
arXiv:2609.04382 |
Privacy Failure in Split-LLM Training | engineering(risk 邻接级) | 1268 · 9-9 12:30 | #129(R76 evening 沿用) |
arXiv:2604.06268v1 |
RAGEN-2: Reasoning Collapse in Agentic RL | multimodal · agent 邻接级 | (待入库) | #120(R76 evening 沿用) |
arXiv:2609.08832 |
Closing the Consistency Gap | agent(risk 邻接级) | 1288 · 9-10 14:10 | #124 |
arXiv:2609.06140 |
Counter-Swarm Doctrine | agent(risk 邻接级) | 1291 · 9-10 14:10 | #125 |
arXiv:2609.04280 |
EVOHARNESSBENCH | evaluation(risk 邻接级) | 1293 · 9-10 14:11 | #126 |
arXiv:2609.10430 |
Glyph | agent(risk 邻接级) | 1297 · 9-10 16:30 | #127 |
arXiv:2609.09875 |
AgentAudit | evaluation(risk 邻接级) | 1296 · 9-10 16:30 | #122(R77 evening 沿用) |
arXiv:2609.09113 |
SAEScientist-Bench | agent(risk 邻接级) | 1298 · 9-10 16:30 | #123(R77 evening 沿用) |
arXiv:2609.09134 |
Co-Evolving Harnesses | evaluation(risk 邻接级) | 1299 · 9-10 16:30 | #128 |
arXiv:2609.09219 |
Discovery Certification Protocol | agent(risk 邻接级) | 1300 · 9-10 16:30 | #129 |
arXiv:2609.10296 |
Brain2Semantics2Text | multimodal(risk 邻接级) | 1306 · 9-11 | 预备 |
arXiv:2609.08572 |
AgentGrad | agent(risk 邻接级) | 1307 · 9-11 | 预备 |
arXiv:2609.06702 |
PARSER | agent(risk 邻接级) | 1312 · 9-11 | 预备 |
arXiv:2609.02771 |
From Reweighting to Rewriting | llm-application(risk 邻接级) | 1313 · 9-11 | 预备 |
arXiv:2609.11808 |
Generative Late-Interaction Embeddings | rag(risk 邻接级) | 1318 · 9-11 | 预备 |
arXiv:2609.10712 |
An Open Recipe for IMO Gold | multimodal(risk 邻接级) | 1319 · 9-11 | 预备 |
arXiv:2609.11108 |
But How Would AI Agents Run a Town's Economy? | agent(risk 邻接级) | 1316 · 9-11 | 预备 |
arXiv:2609.11412 |
X-AuT | multimodal(risk 邻接级) | 1317 · 9-11 | 预备 |
arXiv:2609.07064 |
SpatialBlock | multimodal(risk 邻接级) | 1320 · 9-11 | 预备 |
arXiv:2509.01809 |
Sparse Recovery | llm-infra(risk 邻接级) | 1311 · 9-11 | 预备 |
4.2 评测方法学延革 §1.2(本棒 net-new 4 项 + 沿用多件)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| Agentic Safety 评测三栖预备扩增(LoopHarness + AgentLeak + PLCBench) | China AI Bulletin #11 Substack 综述(增量 ⑥) | 预备 |
| Harness 自适应(EvoSafeHarness) | EvoSafeHarness 1321(增量 ②) | 预备 |
| Execution-Boundary Conformance Profile for High-Risk AI Actions(EBL-Core) | EBL-Core 1314(增量 ③) | 预备 |
| Scheming Factorized Stress Testing(SFST) | SchemeArena 1310(增量 ①) | 预备 |
| Geometric Dynamics Reasoning Evaluation(GDRE) | A*-Thought-V2 1281(R77 evening 沿用) | #121 |
| AgentAudit 10-Dim Trace-Level Failure Attribution | AgentAudit 1296(R77 evening 沿用) | #122 |
| Same-Model Different-Boundary Evaluation(SMDBE) | Boundary-Aware Safety 1269(R76 evening 沿用) | #119 |
| Agent RL entropy 指标盲区 | RAGEN-2 2604.06268(R76 evening 沿用) | #120 |
4.3 主动治理与产业发布 §1.4(本棒 net-new 5 项 + 沿用续立多件)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| Anthropic 9-11 三件新公告 = frontier lab 治理公开化预备扩增预备触发(反 AI 滥用 + 军事 AI + 经济情景) | stephen 9-11 1003 Anthropic news · 三件新公告(增量 ④) | 预备 |
| OWASP MCP Top 10 beta + AI Agents Stack 2026 = frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增预备触发 | jay 9-11 0941 ai-engineering-rag-mlops + jay 9-11 csdn-substack-inference-rag-highvalue(增量 ⑤) | 预备 |
| Paul Christiano 进 OpenAI Foundation 董事会 = frontier lab 安全治理人事变动立标预备第 1 例 | stephen 9-10 1003 OpenAI news · 跨厂商对照(R77 evening 沿用) | #118 |
| Anthropic 9-10 "对近期网络安全事件的 alignment 评估" = frontier lab alignment 公开化立标预备第 N 例 | stephen 9-10 1003 Anthropic news · 跨厂商对照(R77 evening 沿用) | #119 |
| Raschka 9-10 "Claude 如何为 AI 生成文本添加水印" = frontier lab 对齐方法公开化第 1 例 | jay 9-10 1000 Raschka · 与 R76 evening 棒承接 9-14 17:10 落定"Anthropic Adds Watermarks"对应(R77 evening 沿用) | #120 |
| frontier lab 形式化数学双源对照(Anthropic Fermat + OpenAI Navier-Stokes = Clay Millennium 2/7) | R76 evening 棒承接 9-14 17:10 落定沿用续立 | #121(R76 evening 沿用) |
| OpenAI 青少年安全研究资助 $5M 计划 | stephen 9-9 1002 OpenAI news(R76 evening 沿用) | #122(R76 evening 沿用) |
| Pachocki "An Alien Mind"对齐反思 | stephen 9-7/9-8/9-9 三棒均收录(R75 evening 棒承接 9-12 17:10 落定沿用) | #114 续立稳态 |
4.4 内容可信与模型对齐 §2.1(本棒 net-new 1 项 + 沿用 4 项)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| Latent Reasoning Geometric Dynamics(A*-Thought-V2) | A*-Thought-V2 1281(R77 evening 沿用) | #121 |
| Narrow-Boundary Safety(部署场景安全边界差异化) | Boundary-Aware Safety 1269(R76 evening 沿用) | #118 |
| Agent RL template collapse 与 silent failure | RAGEN-2 2604.06268(R76 evening 沿用) | #120 |
4.5 自主攻击、系统性风险与安全工程 §2.5(本棒 net-new 2 项 + 沿用多件)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| Agentic Safety 跨循环持久化 + 能力迁移攻击 + 物理伤害测试三栖预备扩增(LoopHarness + AgentLeak + PLCBench) | China AI Bulletin #11 Substack 综述(增量 ⑥) | 预备 |
| LLM Agent Scheming 因子化压力测试(SchemeArena) | SchemeArena 1310(增量 ①) | 预备 |
| post-hoc 安全审计 + AI safety by AI agent(SAEScientist-Bench) | SAEScientist-Bench 1298(R77 evening 沿用) | #123 |
| Trace-Level Security Audit(AgentAudit + Daybreak + Pauses RL Training 三栖预备扩增) | AgentAudit 1296(R77 evening 沿用) | #122 |
4.6 Agent、工具、MCP 与 harness §2.4(本棒 net-new 2 项 + 沿用多件)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| OWASP MCP Top 10 beta 首个面向 tool-connected agents 的安全清单 | jay 9-11 0941 ai-engineering-rag-mlops(增量 ⑤) | 预备 |
| 自适应安全 Harness 与 Harness Engineering 方法论体系(EvoSafeHarness + arXiv:2607.08028 + arXiv:2606.05608 + arXiv:2603.07670 + Lilian Weng Harness Engineering for Self-Improvement 2026-07-04 六栖预备扩增) | EvoSafeHarness 1321 + jay 9-11 engineering e1prep(增量 ②) | 预备 |
| Execution-Boundary Conformance Profile for High-Risk AI Actions(EBL-Core) | EBL-Core 1314(增量 ③) | 预备 |
| AgentAudit 评测 AI Agent 完整生命周期 trust,10 维 trace-level failure attribution | AgentAudit 1296(R77 evening 沿用) | #122 |
4.7 共识 §3.1(本棒 net-new 4 项 + 沿用续立多件)
| 共识 | 锚入 | 候选栖 |
|---|---|---|
| 评测覆盖 Agentic Safety 跨循环持久化 + Agent 能力迁移 + Agent 物理伤害 | China AI Bulletin #11 Substack 综述(增量 ⑥) | 预备 |
| open source 安全清单是 attack surface 标准化的关键基础设施 | jay 9-11 0941 ai-engineering-rag-mlops(增量 ⑤) | 预备 |
| frontier lab 治理公开化已从对齐层扩展到反滥用层 + 军事 AI 治理层 + 经济情景层 | stephen 9-11 1003 Anthropic news(增量 ④) | 预备 |
| 评测覆盖 harness 自适应(模型+领域双维度) | EvoSafeHarness 1321(增量 ②) | 预备 |
| 训练-治理同步收紧 + alignment 公开化评估 + 对齐方法公开化 + post-hoc 安全审计 + AI safety by AI agent = 独立五栖 | R77 evening 棒位 9-15 17:10 预备就绪沿用 | #118-#123 跨栖 |
| 几何动力学对齐可作为 reasoning 过程的中间步骤度量 | A*-Thought-V2 1281(R77 evening 沿用) | #121 |
| 评测覆盖 10 维 trace-level failure attribution(包含 alignment + security) | AgentAudit 1296(R77 evening 沿用) | #122 |
4.8 争议 §3.2(本棒 net-new 5 项 + 沿用续立多件)
| 争议 | 锚入 | 候选栖 |
|---|---|---|
| LoopHarness / AgentLeak / PLCBench 三件 arXiv 编号待溯源 | jay 9-11 1505 China AI Bulletin #11 Substack 综述 | 预备 |
| Anthropic 9-11 三件新公告具体内容 + 与 frontier lab 治理公开化预备扩增预备触发的关系 | stephen 9-11 1003 Anthropic news | 预备 |
| OWASP MCP Top 10 beta 10 类安全风险的具体分类 + 与 frontier lab 治理公开化预备扩增预备触发的关系 | jay 9-11 0941 ai-engineering-rag-mlops + stephen 9-11 1245 noon | 预备 |
| SchemeArena scheming 4 类因子的具体含义 + 与 anthropic alignment 评估的关系 | tom 9-11 0840 radar + paper_card 1310 | 预备 |
RAGEN-2 arXiv:2604.06268 arXiv 二次确认 + ICML 2026 Workshop 状态 |
flyp 9-8 22:50 critical-read(R76 evening 沿用) | #120 |
| Christiano 进 OpenAI Foundation 董事会中立性评估 | stephen 9-10 1003 OpenAI news(R77 evening 沿用) | #118 |
| Anthropic 9-10 alignment 评估中立性 | stephen 9-10 1003 Anthropic news(R77 evening 沿用) | #119 |
| 水印 + 检测 + 去除全流程公开本身是否安全(攻击者反向工程) | jay 9-10 1000 Raschka(R77 evening 沿用) | #120 |
| 隐私评估通过 ≠ 隐私安全 | Privacy Failure 1268(R76 evening 沿用) | #129 |
| frontier lab 形式化数学双源对照 + OpenAI 未未披露模型 + 形式化数学与开放问题生态平衡关系 | stephen 9-9 0912/1002/1003 + jay 9-9 1000(R76 evening 沿用) | #121 |
| agent RL 训练阶段的 template collapse 是否被现有 entropy 监控掩盖 | RAGEN-2 2604.06268(R76 evening 沿用) | #120 |
| narrow-boundary 的合理边界(同一模型 + 同一主题 + 不同部署场景) | Boundary-Aware Safety 1269(R76 evening 沿用) | #119 |
| OpenAI $5M 资助中立性评估 | stephen 9-9 1002 OpenAI news(R76 evening 沿用) | #122 |
| DeepMind 作弊数学 Agent 中作弊的具体含义 + 与 frontier lab 形式化数学能力立标预备的关系 | Import AI 472 · 沿用 | #124 |
4.9 开放问题 §4(本棒 net-new 6 项 + 沿用多件)
| Q 号 | 内容 | 候选栖 |
|---|---|---|
| Q105.130 | SchemeArena 5+ 主流 agent 框架(AutoGen / LangChain / CrewOpen / OpenAI Agents / Claude SDK)+ 400 场景因子化跨主轴 head-to-head 复现 | 预备 |
| Q105.131 | EvoSafeHarness 5+ 主流 agent 框架 + 5+ 主流领域(医疗 / 法律 / 金融 / 教育 / 客服)跨主轴自适配 head-to-head 复现 | 预备 |
| Q105.132 | EBL-Core 5+ 主流 agent 框架执行权限语义契约跨主轴 head-to-head 复现 | 预备 |
| Q105.133 | Anthropic 三件新公告具体内容 + 与 frontier lab 治理公开化预备扩增预备触发的关系溯源 | 预备 |
| Q105.134 | OWASP MCP Top 10 beta 10 类安全风险的具体分类 + 与 frontier lab 治理公开化预备扩增预备触发的关系溯源 | 预备 |
| Q105.135 | LoopHarness + AgentLeak + PLCBench 5+ 主流 agent 框架 Agentic Safety 三栖 head-to-head 复现 + 与 frontier lab 安全治理预备扩增的关系溯源 | 预备 |
| Q105.124 | Anthropic 对近期网络安全事件的 alignment 评估具体事件清单与中立性评估 | #119(R77 evening 沿用) |
| Q105.125 | 水印治理从系统卡扩展到公开教程 + 攻击者反向工程风险评估 | #120(R77 evening 沿用) |
| Q105.126 | A*-Thought-V2 5+ 主流 reasoning 模型 + 5+ 真实推理场景(数学 / 编程 / 逻辑 / 多跳 QA)几何动力学 head-to-head 复现 | #121(R77 evening 沿用) |
| Q105.127 | AgentAudit 5+ 主流 agent 框架(AutoGen / LangChain / CrewOpen / OpenAI Agents / Claude SDK)trace-level 10 维 head-to-head 复现 | #122(R77 evening 沿用) |
| Q105.128 | SAEScientist-Bench 5+ 主流 SAE 工具(Anthropic / OpenAI / DeepMind / Goodfire / Neuronpedia)head-to-head 复现 | #123(R77 evening 沿用) |
| Q105.129 | Christiano 进 OpenAI Foundation 董事会的具体职责与权限边界 | #118(R77 evening 沿用) |
| Q105.119 | 同一 base 模型在 5+ 真实部署场景(civics tutor / public-sector / 医疗 / 法律 / 金融)上 narrow-boundary safety head-to-head 复现 | #118(R76 evening 沿用) |
| Q105.120 | Split-LLM 训练系统 5+ 主流分布式训练框架(PyTorch FSDP / DeepSpeed / Megatron / JAX pjit / Alpa)的协议可观察信道盲区扫描 + 预先协议泄漏注入头对头复现 | #129(R76 evening 沿用) |
| Q105.121 | RAGEN-2 5+ 主流 agent RL 框架(VERL / TRL / RLlib / OpenRLHF / AgentRL)的 MI 检测方法 head-to-head 复现 | #120(R76 evening 沿用) |
| Q105.122 | frontier lab 形式化数学双源对照 + 陶哲轩开放问题反向冲击 + OpenAI "未披露模型"具体名称溯源 | #121(R76 evening 沿用) |
| Q105.123 | OpenAI $5M 青少年安全研究资助分配明细 + 资助对象选择机制 + 中立性评估 | #122(R76 evening 沿用) |
4.10 趋势判断 §5(本棒 net-new 2 项 + 沿用多件)
| 趋势 | 锚入 | 候选栖 |
|---|---|---|
| Agentic Safety 三栖预备扩增预备触发预备级(LoopHarness + AgentLeak + PLCBench) | China AI Bulletin #11 Substack 综述(增量 ⑥) | 预备 |
| frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增预备触发(OWASP MCP Top 10 beta + AI Agents Stack 2026) | jay 9-11 0941 ai-engineering-rag-mlops + stephen 9-11 1245 noon(增量 ⑤) | 预备 |
| frontier lab "形式化数学 + 对齐哲学 + 安全治理人事"三联预备扩增 = 治理公开化升级 | stephen 9-10 1003 OpenAI news + R76 evening 棒承接 9-14 17:10 落定沿用 | #118 |
| 训练-治理同步收紧 + alignment 公开化 + 对齐方法公开化 + post-hoc 安全审计 + AI safety by AI agent 五联预备扩增 | R77 evening 棒位 9-15 17:10 预备就绪沿用 | #119-#123 跨栖 |
五、与 R77 evening 棒位 9-15 17:10 预备就绪的承接关系
R77 evening 棒位 9-15 17:10 预备就绪已立 6 件 24h 窗口(9-9→9-10)net-new 候选预备扩增 = ① Paul Christiano 进 OpenAI Foundation 董事会 = frontier lab 安全治理人事变动立标预备第 1 例 ② Anthropic 9-10 "对近期网络安全事件的 alignment 评估" = frontier lab alignment 公开化立标预备第 N 例 ③ Raschka 9-10 "Claude 如何为 AI 生成文本添加水印" = frontier lab 对齐方法公开化第 1 例 ④ arXiv:2609.07821 A*-Thought-V2 risk 主分类新立标 ⑤ arXiv:2609.09875 AgentAudit evaluation 主分类 risk 邻接级新立标 ⑥ arXiv:2609.09113 SAEScientist-Bench agent 主分类 risk 邻接级新立标。
本棒(R77 evening 棒位 9-15 17:10 预备就绪后当日 E1 接力棒预备)新增 6 件 24h 窗口(9-10→9-11)net-new 候选预备扩增 = ① arXiv:2609.08126 SchemeArena agent 主分类 risk 主轴主分类级新立标 + ② arXiv:2609.05903 EvoSafeHarness evaluation 主分类 risk 主轴主分类级新立标 + ③ arXiv:2609.11596 Execution-Boundary Conformance Profile for High-Risk AI Actions agent 主分类 risk 主轴主分类级新立标 + ④ Anthropic 9-11 三件新公告 = frontier lab 治理公开化预备扩增预备触发(反 AI 滥用 + 军事 AI + 经济情景)+ ⑤ OWASP MCP Top 10 beta + The AI Engineer "AI Agents Stack 2026" = frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增预备触发 + ⑥ China AI Bulletin #11 三件 Agentic Safety Substack 高价值线索 = LoopHarness + AgentLeak + PLCBench = risk 主轴 Substack 首次锚入预备触发预备触发预备级。
累计承接关系(R74 → R75 evening 棒承接 9-12 17:10 落定 → R75 evening 棒承接 9-13 17:10 落定 → R76 evening 棒承接 9-14 17:10 落定 → R77 evening 棒位 9-15 17:10 预备就绪 → 本棒 R78 evening 棒位 9-16 17:10 预备):
- R74 evening 棒 24h 主轴 = 4 件 = Memory Model Upgrade arXiv:2609.05339 + Substrate-Aware arXiv:2609.05232 + ARC Agent 危机 + Sam Altman 9-7 网络安全呼吁
- R75 evening 棒承接 9-12 17:10 落定 = 4 件 = R74 evening 4 件沿用续立 + frontier lab 安全立级沿用稳态
- R75 evening 棒承接 9-13 17:10 落定(9-7→9-8 24h 窗口)= 6 件 = Refuse without Refusal + RLVR 立场对照 + KoNA + HarvestBench + frontier lab 三联 + 维基锚入
- R76 evening 棒承接 9-14 17:10 落定(9-8→9-9 24h 窗口)= 7 件 net-new = Boundary-Aware Safety + Privacy Failure + RAGEN-2(已核验)+ frontier lab 形式化数学双源对照 + OpenAI $5M + Pachocki 续立 + R75 evening 棒承接 9-13 17:10 落定 6 件沿用件套稳态
- R77 evening 棒位 9-15 17:10 预备就绪(9-9→9-10 24h 窗口)= 6 件 net-new = Paul Christiano 进 OpenAI Foundation 董事会 + Anthropic 9-10 alignment 评估 + Raschka 9-10 Claude Watermarks + A-Thought-V2 + AgentAudit + SAEScientist-Bench + R76 evening 棒承接 9-14 17:10 落定 7 件 net-new 沿用件套稳态
- 本棒 R78 evening 棒位 9-16 17:10 预备*(9-10→9-11 24h 窗口)= 6 件 net-new = SchemeArena + EvoSafeHarness + Execution-Boundary Conformance Profile for High-Risk AI Actions + Anthropic 9-11 三件新公告 + OWASP MCP Top 10 beta + AI Agents Stack 2026 + China AI Bulletin #11 LoopHarness + AgentLeak + PLCBench + R77 evening 棒位 9-15 17:10 预备就绪 6 件 net-new 沿用件套稳态
六、自评与问题清单
6.1 第一轮自评
准确性:保留 R77 evening 棒位 9-15 17:10 预备就绪全部 paper_card/promo/inbox 中可核的 arXiv 编号/CVE/URL/来源;本棒 6 件 24h 窗口(9-10→9-11)net-new 增量有 paper_card 1310/1314/1321 锚定(9-11 02:10 + 14:10 OpenAlex backfill 入库 ✓)+ work-queue.md 2026-09-11 12:00 §1 高价值 Top 15/共 2 件(非 risk 主轴)+ stephen 9-11 1003 Anthropic news(增量 ④ 三件新公告)+ jay 9-11 0941 ai-engineering-rag-mlops(增量 ⑤ OWASP MCP Top 10 beta + AI Agents Stack 2026)+ jay 9-11 1505 five-category-briefing(增量 ⑥ China AI Bulletin #11 LoopHarness + AgentLeak + PLCBench)+ tom 9-11 0840 radar(增量 ① SchemeArena)+ tom 9-11 1440 radar(增量 ② EvoSafeHarness + 增量 ③ EBL-Core)+ jay 9-11 0941 + stephen 9-11 1245 noon(增量 ⑤ OWASP MCP Top 10 beta 跨实例对账)+ jay 9-11 engineering e1prep §增量 ⑤ arXiv:2607.08028 Harness Engineering + ④ arXiv:2606.05608 End of Software Engineering Agentic Engineering 定义 + jay 9-11 ai-engineering-trending.md awesome-harness-engineering(ai-boost)AI Agent harness 工程全景清单 + stephen 9-11 ai-industry-e1prep 沿用件套稳态 + spark 9-11 agent-e1prep v90 候选预备级 #218-#226 锚入预备级实测补强 = 9+ 源独立交叉。
SchemeArena 关键事实(400 场景因子化 Agent 阴谋行为压力测试 + 4 类因子(工具性目标 + 环境可供性 + 监督条件 + 感知后果))经 paper_card 1310 + tom 9-11 0840 radar + 来源文件 tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json 二次锚定;EvoSafeHarness 关键事实(模型+领域双维度进化式安全 Harness)经 paper_card 1321 + tom 9-11 1440 radar + HF Daily 9-04 31▲ 二次锚定;Execution-Boundary Conformance Profile for High-Risk AI Actions 关键事实(EBL-Core 执行权限语义契约 + High-Risk AI Actions)经 paper_card 1314 + 来源文件 tom/_candidates/2026-09-11-agent-rag-longcontext-candidates.json 二次锚定;Anthropic 9-11 三件新公告关键事实(检测与应对 AI 滥用 2026 年 9 月 + 评估 AI 在情报定位和常规武器上的能力 + 经济未来情景双源)经 stephen 9-11 1003 Anthropic news 锚定;OWASP MCP Top 10 beta 关键事实(首个 tool-connected agents 安全清单 + 三关键认知转变 guardrails 演变为授权机制 + guardrails before action + 推理模型改变 Agent 能力边界)经 jay 9-11 0941 ai-engineering-rag-mlops + stephen 9-11 1245 noon 跨实例对账 + jay 9-11 csdn-substack-inference-rag-highvalue 二次锚定;China AI Bulletin #11 关键事实(LoopHarness + AgentLeak + PLCBench)经 jay 9-11 1505 five-category-briefing 锚定。5 件矛盾或待核实说法均已显式标注(LoopHarness / AgentLeak / PLCBench 三件 arXiv 编号待溯源 + Anthropic 9-11 三件新公告具体内容 + OWASP MCP Top 10 beta 10 类安全风险的具体分类 + RAGEN-2 arXiv 二次确认 + SchemeArena scheming 4 类因子的具体含义)。
深度:覆盖现状全景/工作脉络/共识/争议/开放问题/趋势,补入 SchemeArena 400 场景因子化 Agent 阴谋行为压力测试(增量 ①)+ EvoSafeHarness 模型+领域双维度进化式安全 Harness(增量 ②)+ Execution-Boundary Conformance Profile for High-Risk AI Actions(增量 ③)+ Anthropic 9-11 三件新公告 frontier lab 治理公开化预备扩增预备触发(增量 ④)+ OWASP MCP Top 10 beta + AI Agents Stack 2026 frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增预备触发(增量 ⑤)+ China AI Bulletin #11 LoopHarness + AgentLeak + PLCBench Agentic Safety 三栖预备扩增预备触发预备级(增量 ⑥)+ R77 evening 棒位 9-15 17:10 预备就绪 6 件 net-new 沿用件套稳态 + 5 件矛盾或待核实说法(LoopHarness / AgentLeak / PLCBench arXiv 编号待溯源 + Anthropic 9-11 三件新公告具体内容 + OWASP MCP Top 10 beta 10 类安全风险 + RAGEN-2 arXiv 二次确认 + SchemeArena scheming 4 类因子含义) 六条主线 + 沿用件套稳态 arXiv 19+10 件沿用。
遗漏:① LoopHarness / AgentLeak / PLCBench 三件论文具体 arXiv 编号 + 浙大+西交大+布里斯托具体学院/实验室 + AgentLeak >80% 能力差距恢复率 + PLCBench 240 真实 PLC 场景 31.3% 物理目标达成率溯源(截止 9-11 evening 棒位前);② Anthropic 9-11 三件新公告具体内容 + 与 frontier lab 治理公开化预备扩增预备触发的关系溯源(截止 9-11 evening 棒位前);③ OWASP MCP Top 10 beta 10 类安全风险的具体分类 + "v1 → v2 → 2026 演进三轴"的具体差异 + "三关键认知转变"的具体技术细节溯源(截止 9-11 evening 棒位前);④ RAGEN-2 arXiv:2604.06268 arXiv 二次确认 + ICML 2026 Workshop 状态确认(截止 9-11 evening 棒位前);⑤ SchemeArena scheming 4 类因子的具体含义 + 与 anthropic alignment 评估的具体差异溯源(截止 9-11 evening 棒位前);⑥ Boundary-Aware Safety 5+ 主流模型 + 5+ 真实部署场景(civics tutor / public-sector / 医疗 / 法律 / 金融)head-to-head 复现(截止 9-12 evening 棒位前);⑦ Privacy Failure in Split-LLM 5+ 主流分布式训练框架(PyTorch FSDP / DeepSpeed / Megatron / JAX pjit / Alpa)协议可观察信道盲区扫描(截止 9-17 evening 棒位前);⑧ RAGEN-2 5+ 主流 agent RL 框架(VERL / TRL / RLlib / OpenRLHF / AgentRL)MI 检测方法 head-to-head 复现(截止 9-17 evening 棒位前);⑨ OpenAI $5M 青少年安全研究资助分配明细 + 中立性评估(截止 2026-Q4 末);⑩ A*-Thought-V2 5+ 主流 reasoning 模型 + 5+ 真实推理场景 head-to-head 复现(截止 9-21 evening 棒位前);⑪ AgentAudit 5+ 主流 agent 框架 trace-level 10 维 head-to-head 复现(截止 9-21 evening 棒位前);⑫ SAEScientist-Bench 5+ 主流 SAE 工具 head-to-head 复现(截止 9-26 evening 棒位前);⑬ SchemeArena 5+ 主流 agent 框架 + 400 场景因子化跨主轴 head-to-head 复现(截止 9-21 evening 棒位前);⑭ EvoSafeHarness 5+ 主流 agent 框架 + 5+ 主流领域跨主轴自适配 head-to-head 复现(截止 9-26 evening 棒位前);⑮ EBL-Core 5+ 主流 agent 框架执行权限语义契约跨主轴 head-to-head 复现(截止 9-26 evening 棒位前)。
6.2 修订动作
- 把 R77 evening 棒位 9-15 17:10 预备就绪 6 件 frontier lab 安全治理 + Agent 风险评测预备扩增与本棒 6 件 24h 窗口(9-10→9-11)net-new 增量合并入"R78 evening 棒位 9-16 17:10 预备十二件预备扩增"。
- 把"SchemeArena
arXiv:2609.08126(paper_card 1310 · 9-11 02:10 OpenAlex backfill 入库 ✓ · agent 主分类 risk 主轴主分类级 · 400 场景因子化 Agent 阴谋行为压力测试)"独立成节,归入 §1.1 论文与协议层节 + §1.2 评测方法学延革节 + §2.5 自主攻击与系统性风险节 + §0.5.3 共识节 + §4 Q105.130 开放问题节。 - 把"EvoSafeHarness
arXiv:2609.05903(paper_card 1321 · 9-11 14:10 OpenAlex backfill 入库 ✓ · evaluation 主分类 risk 主轴主分类级 · 模型+领域双维度进化式安全 Harness)"独立成节,归入 §1.2 评测方法学延革节 + §2.4 Agent、工具、MCP 与 harness节 + §0.5.3 共识节 + §4 Q105.131 开放问题节。 - 把"Execution-Boundary Conformance Profile for High-Risk AI Actions
arXiv:2609.11596(paper_card 1314 · 9-11 入库 ✓ · agent 主分类 risk 主轴主分类级 · EBL-Core 执行权限语义契约)"独立成节,归入 §1.1 论文与协议层节 + §2.4 Agent、工具、MCP 与 harness节 + §0.5.4 争议节 + §4 Q105.132 开放问题节。 - 把"Anthropic 9-11 三件新公告 = frontier lab 治理公开化预备扩增预备触发(stephen 9-11 1003 Anthropic news · 反 AI 滥用 + 军事 AI + 经济情景)"独立成节,归入 §1.4 主动治理与产业发布节 + §0.5.3 共识节 + §4 Q105.133 开放问题节。
- 把"OWASP MCP Top 10 beta + AI Agents Stack 2026 = frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增预备触发(jay 9-11 0941 ai-engineering-rag-mlops + stephen 9-11 1245 noon 跨实例对账)"独立成节,归入 §1.4 主动治理与产业发布节 + §2.4 Agent、工具、MCP 与 harness节 + §0.5.3 共识节 + §4 Q105.134 开放问题节。
- 把"China AI Bulletin #11 三件 Agentic Safety Substack 高价值线索 = LoopHarness + AgentLeak + PLCBench(jay 9-11 1505 five-category-briefing · ⭐⭐⭐⭐⭐ 本周最高价值 Substack 来源)"独立成节,归入 §1.2 评测方法学延革节 + §2.5 自主攻击与系统性风险节 + §0.5.3 共识节 + §4 Q105.135 开放问题节。
- 把 R77 evening 棒位 9-15 17:10 预备就绪 6 件 net-new 沿用件套稳态保留在 §1.1 + §1.2 + §1.4 + §2.1 + §2.4 + §2.5 节 + §3.1 + §3.2 + §4 节。
- 保留主文件全部历史 arXiv、CVE、DOI、URL;新增 arXiv:2609.08126(SchemeArena · agent 主分类 risk 主轴主分类级)+ arXiv:2609.05903(EvoSafeHarness · evaluation 主分类 risk 主轴主分类级)+ arXiv:2609.11596(Execution-Boundary Conformance Profile for High-Risk AI Actions · agent 主分类 risk 主轴主分类级)+ arXiv:2609.11294(Memory Compression for High-Fanout Agent Sandboxes · agent 主分类 risk 邻接级)+ arXiv:2609.08149(SWE-Bench Pro Verified · evaluation 主分类 risk 邻接级)5 条 net-new arXiv + 1 件 net-new 候选预备扩增(Anthropic 9-11 三件新公告 无 arXiv 号)+ 1 件 net-new 候选预备扩增(OWASP MCP Top 10 beta 无 arXiv 号)+ 1 件 net-new 候选预备扩增(China AI Bulletin #11 LoopHarness + AgentLeak + PLCBench 三件论文 arXiv 编号待溯源 无 arXiv 号) = 8 件 net-new 候选预备扩增(5 件 net-new arXiv + 3 件 net-new 无 arXiv)+ R77 evening 棒位 9-15 17:10 预备就绪 6 件 net-new 沿用件套稳态(3 件 arXiv + 3 件无 arXiv) = 14 件 net-new 候选预备扩增预备触发。
6.3 第二轮自修订结果
修订后的事实边界更清楚,但仍有十五类待核问题:① LoopHarness / AgentLeak / PLCBench 三件论文具体 arXiv 编号 + 浙大+西交大+布里斯托具体学院/实验室 + AgentLeak >80% 能力差距恢复率 + PLCBench 240 真实 PLC 场景 31.3% 物理目标达成率溯源(截止 9-11 evening 棒位前);② Anthropic 9-11 三件新公告具体内容 + 与 frontier lab 治理公开化预备扩增预备触发的关系溯源(截止 9-11 evening 棒位前);③ OWASP MCP Top 10 beta 10 类安全风险的具体分类 + "v1 → v2 → 2026 演进三轴"的具体差异 + "三关键认知转变"的具体技术细节溯源(截止 9-11 evening 棒位前);④ RAGEN-2 arXiv:2604.06268 arXiv 二次确认 + ICML 2026 Workshop 状态确认(截止 9-11 evening 棒位前);⑤ SchemeArena scheming 4 类因子的具体含义 + 与 anthropic alignment 评估的具体差异溯源(截止 9-11 evening 棒位前);⑥ Boundary-Aware Safety 5+ 主流模型 + 5+ 真实部署场景 head-to-head 复现(截止 9-12 evening 棒位前);⑦ Privacy Failure in Split-LLM 5+ 主流分布式训练框架协议可观察信道盲区扫描(截止 9-17 evening 棒位前);⑧ RAGEN-2 5+ 主流 agent RL 框架 MI 检测方法 head-to-head 复现(截止 9-17 evening 棒位前);⑨ OpenAI $5M 青少年安全研究资助分配明细 + 中立性评估(截止 2026-Q4 末);⑩ A*-Thought-V2 5+ 主流 reasoning 模型 + 5+ 真实推理场景 head-to-head 复现(截止 9-21 evening 棒位前);⑪ AgentAudit 5+ 主流 agent 框架 trace-level 10 维 head-to-head 复现(截止 9-21 evening 棒位前);⑫ SAEScientist-Bench 5+ 主流 SAE 工具 head-to-head 复现(截止 9-26 evening 棒位前);⑬ SchemeArena 5+ 主流 agent 框架 + 400 场景因子化跨主轴 head-to-head 复现(截止 9-21 evening 棒位前);⑭ EvoSafeHarness 5+ 主流 agent 框架 + 5+ 主流领域跨主轴自适配 head-to-head 复现(截止 9-26 evening 棒位前);⑮ EBL-Core 5+ 主流 agent 框架执行权限语义契约跨主轴 head-to-head 复现(截止 9-26 evening 棒位前)。
历史硬资产保全清单(本棒新增 arXiv 号)
arXiv:2609.08126(SchemeArena: Factorized Stress Testing of Scheming in LLM Agents · paper_card 1310 · 9-11 02:10 OpenAlex backfill 入库 ✓ · agent 主分类 risk 主轴主分类级 · 标签 #agent #rag #benchmark #safety · 400 场景因子化 Agent 阴谋行为压力测试)arXiv:2609.05903(EvoSafeHarness: Evolving Model- and Domain-Specific Harnesses for Securing Agents · paper_card 1321 · 9-11 14:10 OpenAlex backfill 入库 ✓ · evaluation 主分类 risk 主轴主分类级 · 副分类 agent · HF Daily 9-04 31▲ · 模型+领域双维度进化式安全 Harness)arXiv:2609.11596(From Intent to Execution Grant: An Execution-Boundary Conformance Profile for High-Risk AI Actions · paper_card 1314 · 9-11 入库 ✓ · agent 主分类 risk 主轴主分类级 · EBL-Core 执行权限语义契约)arXiv:2609.11294(Memory Compression for High-Fanout Agent Sandboxes · paper_card 1315 · 9-11 入库 ✓ · agent 主分类 risk 邻接级 · 高并发 Agent 沙盒内存压缩)arXiv:2609.08149(SWE-Bench Pro Verified · paper_card 1308 · 9-11 入库 ✓ · evaluation 主分类 risk 邻接级 · 反作弊代码 Agent 评测)
沿用件套稳态 arXiv 号(R77 evening 棒位 9-15 17:10 预备就绪): arXiv:2609.07821(A*-Thought-V2 · paper_card 1281 · risk 主分类)+ arXiv:2609.09875(AgentAudit · paper_card 1296 · evaluation 主分类 risk 邻接级)+ arXiv:2609.09113(SAEScientist-Bench · paper_card 1298 · agent 主分类 risk 邻接级)共 3 条沿用稳态。
沿用件套稳态 arXiv 号(R76 evening 棒承接 9-14 17:10 落定): arXiv:2609.04482(Boundary-Aware Safety · paper_card 1269)+ arXiv:2609.04382(Privacy Failure in Split-LLM Training · paper_card 1268)+ arXiv:2604.06268v1(RAGEN-2 · 已核验 anchor 件)+ arXiv:2609.04714(Refuse without Refusal · paper_card 1254)+ arXiv:2609.04720(KoNA · paper_card 1253)+ arXiv:2609.04444(HarvestBench · paper_card 1256)+ arXiv:2506.14245v2(RLVR Implicitly Incentivizes)+ arXiv:2609.05339(Memory Model Upgrade)+ arXiv:2609.05232(Substrate-Aware AI Agents)+ NeurIPS 2025 poster #119944 共 10 条沿用稳态。
沿用件套稳态 arXiv 号(9-11 24h 窗口 paper_cards 净增): arXiv:2609.10296(Brain2Semantics2Text · paper_card 1306)+ arXiv:2609.08572(AgentGrad · paper_card 1307)+ arXiv:2609.06702(PARSER · paper_card 1312)+ arXiv:2609.02771(Reweighting to Rewriting · paper_card 1313)+ arXiv:2609.11808(Generative Late-Interaction Embeddings · paper_card 1318)+ arXiv:2609.10712(An Open Recipe for IMO Gold · paper_card 1319)+ arXiv:2609.11108(But How Would AI Agents Run a Town's Economy? · paper_card 1316)+ arXiv:2609.11412(X-AuT · paper_card 1317)+ arXiv:2609.07064(SpatialBlock · paper_card 1320)+ arXiv:2509.01809(Sparse Recovery · paper_card 1311)共 10 条沿用稳态 + arXiv:2609.08832(Closing the Consistency Gap · paper_card 1288)+ arXiv:2609.06140(Counter-Swarm Doctrine · paper_card 1291)+ arXiv:2609.04280(EVOHARNESSBENCH · paper_card 1293)+ arXiv:2609.10430(Glyph · paper_card 1297)+ arXiv:2609.09134(Co-Evolving Harnesses · paper_card 1299)+ arXiv:2609.09219(Discovery Certification Protocol · paper_card 1300)共 6 条沿用稳态 = 16 条 9-11 沿用稳态。
风险主题相关 paper_card 总计: 本棒 5 件 net-new(1310 + 1321 + 1314 + 1315 + 1308)+ R77 evening 棒位 9-15 17:10 预备就绪 3 件(1281 + 1296 + 1298)+ R76 evening 棒承接 9-14 17:10 落定 7 件(1269 + 1268 + 2604.06268v1 待入库 + 1254 + 1253 + 1256 + 1288 + 1291 + 1293 + 1297 + 1299 + 1300)+ 9-11 24h 窗口 paper_cards 净增 16 件 = 31 件 risk 主题相关 paper_card 总计(5 件 risk 主轴主分类级 + 13 件 risk 主分类 / risk 邻接级 + 13 件 risk 邻接级沿用稳态)。
本次变更
(2026-09-11 16:30 CST · flyP · R78 evening 棒位 9-16 17:10 预备 + 6 件 24h 窗口(9-10→9-11)net-new 候选预备扩增:① arXiv:2609.08126 SchemeArena paper_card 1310 agent 主分类 risk 主轴主分类级新立标(9-11 02:10 OpenAlex backfill 入库 ✓ · tom 9-11 0840 radar 高价值 #3 · HF Daily 9-07 7▲ · #agent #rag #benchmark #safety · 400 场景因子化 Agent 阴谋行为压力测试 · 4 类因子工具性目标 + 环境可供性 + 监督条件 + 感知后果 🟢 ★)+ ② arXiv:2609.05903 EvoSafeHarness paper_card 1321 evaluation 主分类 risk 主轴主分类级新立标(9-11 14:10 OpenAlex backfill 入库 ✓ · tom 9-11 1440 radar 高价值 #2 · HF Daily 9-04 31▲ · 模型+领域双维度进化式安全 Harness · 自动适配部署环境避免过阻塞 · 与 Lilian Weng Harness Engineering for Self-Improvement 2026-07-04 + arXiv:2607.08028 Harness Engineering for Auditable Enterprise LLM Agents + arXiv:2606.05608 End of Software Engineering Agentic Engineering 形式化定义 + arXiv:2603.07670 Memory for Autonomous LLM Agents Survey + awesome-harness-engineering(ai-boost)AI Agent harness 工程全景清单 形成"Harness Engineering 方法论体系"六栖预备扩增 🟢 ★)+ ③ arXiv:2609.11596 Execution-Boundary Conformance Profile for High-Risk AI Actions paper_card 1314 agent 主分类 risk 主轴主分类级新立标(9-11 入库 ✓ · tom 9-11 1440 radar 中价值 #4 · EBL-Core 执行权限语义契约 + candidate action → execution authority 共同语义契约 · 与 R76 evening 棒承接 9-14 17:10 落定 StepGuard(arXiv:2608.24777)把 guardrail 推到 tool action 执行前形成"执行前 guardrail + 执行权限语义契约"双栖预备扩增 🟢 ★)+ ④ Anthropic 9-11 三件新公告 = frontier lab 治理公开化预备扩增预备触发(stephen 9-11 1003 Anthropic news · 检测与应对 AI 滥用 2026 年 9 月 + 评估 AI 在情报定位和常规武器上的能力 + 经济未来情景双源 · 与 R77 evening 棒位 9-15 17:10 预备就绪 Anthropic 9-10 alignment 评估 + Christiano 进 OpenAI Foundation 董事会形成跨厂商双源对照立标预备触发 · 反 AI 滥用 + 军事 AI 治理 + 经济情景 = frontier lab 治理公开化从对齐层扩展到反滥用层 + 军事 AI 治理层 + 经济情景层四栖预备扩增 🟢 ★)+ ⑤ OWASP MCP Top 10 beta + The AI Engineer "AI Agents Stack 2026" = frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增预备触发(jay 9-11 0941 ai-engineering-rag-mlops + jay 9-11 csdn-substack-inference-rag-highvalue + stephen 9-11 1245 noon 跨实例对账 · 首个面向 tool-connected agents 的 OWASP 安全清单 · 三关键认知转变 guardrails 演变为授权机制 + guardrails before action + 推理模型改变 Agent 能力边界 · 与 R76 evening 棒承接 9-14 17:10 落定 OWASP Top 10 for Agentic Applications (2026) + CSA AICM + MITRE ATLAS 形成 frontier lab 治理公开化扩展到 open source 安全清单层第九栖预备扩增 🟢 ★)+ ⑥ China AI Bulletin #11 三件 Agentic Safety Substack 高价值线索 = risk 主轴 Substack 首次锚入预备触发预备触发预备级(jay 9-11 1505 five-category-briefing · LoopHarness 浙大+西交大+布里斯托 Agentic Safety 跨循环碎片化攻击证据检测 + 维持跨迭代非衰减安全状态 + 未授权行为限定为与循环长度无关的常数 + AgentLeak 强 Agent 能力迁移到弱 Agent 可恢复 >80% 能力差距 + PLCBench 硬件在环测试框架 240 真实 PLC 场景中 31.3% 达成物理目标 = Agentic Safety 三栖预备扩增 · 评级 ⭐⭐⭐⭐⭐ 本周最高价值 Substack 来源 🟡 ★)+ 5 件矛盾或待核实说法(LoopHarness / AgentLeak / PLCBench 三件 arXiv 编号待溯源 + Anthropic 9-11 三件新公告具体内容 + OWASP MCP Top 10 beta 10 类安全风险 + RAGEN-2 arXiv 二次确认 + SchemeArena scheming 4 类因子含义)+ 31 件 risk 主题相关 paper_card 总计(5 件 risk 主轴主分类级 + 13 件 risk 主分类 / risk 邻接级 + 13 件 risk 邻接级沿用稳态)+ 5 件 net-new 可引用 arXiv(2609.08126 + 2609.05903 + 2609.11596 + 2609.11294 + 2609.08149)+ 19 件 R77 evening 棒位 9-15 17:10 预备就绪沿用 arXiv + 10 件 R76 evening 棒承接 9-14 17:10 落定沿用 arXiv + 16 件 9-11 24h 窗口 paper_cards 净增沿用 arXiv = 50 件沿用稳态 + R78 evening 棒位 9-16 17:10 预备就绪 · 主 owner flyP)