risk · E1 预消化简报(2026-09-09)
- 作者:flyP
- 执行时间:2026-09-09 16:30 CST(R75 evening 棒承接 9-13 17:10 落定后当日 E1 接力棒预备 · 24h 窗口 9-8 16:30 → 9-9 16:30 CST)
- 承接棒:R76 evening 棒位 9-14 17:10 预备 + 主 owner flyP + 接管 R75 evening 棒承接 9-13 17:10 落定 24h 主轴延续
- 检查范围:inbox/flyp 2026-09-08 → 2026-09-09 24h 窗口 + inbox/jay/tom/spark/stephen 9-8 → 9-9 24h 窗口与 risk 主题强相关笔记 + paper_cards 库 9-7 → 9-9 24h 窗口 risk 主分类及邻接级新卡 + work-queue.md 2026-09-09 16:00 自动生成 + knowledge/risk.md R75 evening 棒承接 9-13 17:10 落定现状 + 9-8 17:10 flyp risk-e1prep(同源承接延续)
- 底稿来源:flyp 2026-09-08-2250-RAGEN-2-template-collapse-critical-read(本实例本人 9-8 evening 22:50 精读 + 现场核验 2604.06268 编号闭环)+ flyp 2026-09-08-risk-e1prep R75 evening 棒承接 9-12 17:10 落定前当日 + flyp 2026-09-09-multimodal-e1prep(独立棒位交叉引证)+ flyp 2026-09-09_multimodal-wednesday-digest + stephen 2026-09-09-ai-industry-e1prep v68 + stephen 2026-09-09-1245-stephen-coordination-check-noon + jay 2026-09-09-engineering-e1prep + jay 2026-09-09-llm-inference-engineering-screening + tom 2026-09-09-evaluation-e1prep + tom 2026-09-09-agent-rag-longcontext-radar + spark 2026-09-09-agent-e1prep + paper_cards 1268-1271(9-9 12:30 OpenAlex backfill 净增 4 张,其中 risk 主分类 1 张 = Boundary-Aware Safety 1269)+ paper_cards 1272-1279(9-9 16:30 抽查 8 张,均非 risk 主分类)
一、净增量总览
本棒(R75 evening 棒承接 9-13 17:10 落定后当日 E1 接力棒预备)风险主题 net-new 增量 = 7 件(24h 窗口 9-8 16:30 → 9-9 16:30 CST 实测):
- 🔥 P0 独立嵌入修订:paper_card 1269 Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
arXiv:2609.04482(9-9 12:30 OpenAlex backfill 入库 · 主分类 risk · 形态 application · 副分类 engineering) — narrow-boundary safety + 自蒸馏框架;同一基础模型在不同部署场景需不同边界(civics tutor vs public-sector assistant 共享基础模型,但同一选举主题内划定不同边界:拒绝针对性政治操控,仍答事实问题);与既有 Refuse without Refusal(arXiv:2609.04714 · paper_card 1254)形成"误拒对立面 + 边界感知对立面"二联预备扩增 - 🔥 P0 独立嵌入修订:paper_card 1268 Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys
arXiv:2609.04382(9-9 12:30 OpenAlex backfill 入库 · 主分类 engineering · 形态 method) — 两节点 split-LLM 训练系统的隐私评估通过但留下一个未测试的可观察信道:TLN 把受保护激活发给 UCN,UCN 返回输出,TLN 持有私有损失并返回输出梯度;UCN 收到的帧将真实样本与诱饵(decoy)样本混合,损失忽略诱饵;诱饵样本的梯度恰好为零,因此"零的分布模式"揭示哪些是真实样本 → 系统级隐私失败可在"评估全过"的情况下持续泄露;work-queue 9-9 16:00 已立为 Top 15/1 高价值待深度解读项(0.5 分) - 🟠 P1 候选新增:frontier lab 形式化数学双源对照预备扩增第 1 例(Anthropic Fermat + OpenAI Navier-Stokes)(stephen 9-9 0912 X 名人雷达 + stephen 9-9 1002 OpenAI news + jay 9-9 1000 simon willison · 4 源独立验证闭环)— 9-4 Anthropic Claude Fermat 大定理 Lean 形式化(1300 万行代码 + 2.9 万引理)+ 9-8 simon willison 报道 OpenAI "使用一个未发布的模型"给出 Navier-Stokes 千禧年奖问题解答 + 9-9 OpenAI 官方公告 + Lean 形式化证明 + 9-9 陶哲轩评论"大量优质、富有成果的开放问题正以不可再生的方式被挖掘" = Clay Millennium 7 题中 2 题由 frontier lab 形式化完成 = frontier lab 形式化数学能力跨过 2 题量级门槛立标预备第 1 例;"未发布模型"待溯源 + 形式化数学与开放问题生态反向冲击待观察
- 🟠 P1 候选新增:frontier lab 安全研究资助立标预备(stephen 9-9 1002 OpenAI news · 沿用) = OpenAI $5M 资助计划,支持独立研究生成式 AI 对青少年发展、福祉与安全的影响 — 与 Daybreak $1B 网络安全承诺金额立标预备形成"网络安全 + 青少年安全"双资金池立标预备
- 🟠 P1 候选新增:OpenAI "An Alien Mind" Pachocki 对齐反思续立(stephen 9-9 0912 X 名人雷达 · 沿用续立) — Pachocki 9-7 "支持继续快速训练更智能模型的最有力论据,是需要构建防御系统以应对其他 AI 带来的危险"续立稳态,与本棒 frontier lab 形式化数学双源对照(增量 ④)形成"形式化数学能力 + 对齐哲学公开化"双联预备扩增
- 🟢 P2 沿用件套稳态:RAGEN-2 Reasoning Collapse in Agentic RL
arXiv:2604.06268编号核验闭环 + 风险主题延伸(flyp 9-8 22:50 critical-read + Cameron Wolfe "Agentic RL" Substack 引用核验)— 编号真实存在,作者阵容极重(Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford),与今日 RLVR 争议 + 模板坍塌(template collapse)在 entropy 指标下不可见的"silent failure"形成 risk §2.1 内容可信节沿用件套稳态;agent 主轴 RL 训练稳定性分析新立标预备级
主轴邻接级 net-new paper_card 净增:4 张(9-9 12:30 OpenAlex backfill 1268-1271 = Boundary-Aware Safety 1269 risk 主分类 + Privacy Failure 1268 engineering 主分类 risk 邻接级 + Causal Foundation Models 1270 engineering 主分类 + Unifying Conformal Language Tasks 1271 rag 主分类 risk 邻接级)其中 risk 主分类 = 1 张(Boundary-Aware Safety 1269)+ risk 邻接级 = 1 张(Privacy Failure 1268 · 分布式训练隐私 = risk §1.1 工程实证节沿用件套稳态)
矛盾或待核实说法 = 4 件(下文第三节详述)
可引用 arXiv 号(net-new 候选新增栖):arXiv:2609.04482(Boundary-Aware Safety · risk 主分类)+ arXiv:2609.04382(Privacy Failure in Split-LLM Training · risk 邻接级)+ arXiv:2604.06268(RAGEN-2 · 已核验沿用 anchor 件 · agent RL 训练稳定性)共 3 件 net-new 可引用(加 RLVR 争议的 2506.14245 与 NeurIPS 2025 #119944 共 5 件争议焦点沿用)
二、今日 risk 主题最重要的 7 条增量
🔥 增量 ① P0 独立嵌入修订:paper_card 1269 Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal arXiv:2609.04482 — narrow-boundary safety(部署场景安全边界差异化)
- 来源:paper_card
1269-2609-04482.md(2026-09-09 12:30 OpenAlex backfill 入库 ✓ · 主分类 risk · 形态 application · 副分类 engineering · 来源文件tom/_candidates/2026-09-09-agent-rag-longcontext-candidates.json)+ tom2026-09-09-agent-rag-longcontext-radar.md(09:00 radar 8 件候选中等价值 = Privacy Failure in Split-LLM Training 4 票)+ spark2026-09-09-agent-e1prep.md(v89 候选预备级 #215 Boundary-Aware Safety 候选 ☆)+ stephen2026-09-09-1245-stephen-coordination-check-noon.md(§分类覆盖检查 + HF Blog MultiverseComputingCAI safety-for-whom 沿用 + jay2026-09-09-1000-rss-simon-willison.md沿用) - 要点:
- (a) 核心问题 = narrow-boundary safety:安全对齐通常被视为主题级问题(此主题有害吗?);部署场景提出的问题更窄 — 公民课辅导助手与公共部门助手可能共享同一基础模型,但在同一主题内需划定不同边界(拒绝有针对性的政治操控,同时仍能回答关于同一选举的事实问题)。
- (b) 方法 = 离线自生成框架,结合:① 受控主题生成(controlled topic generation)+ ② 覆盖修复(coverage repair)+ ③ 同分布补偿数据(in-distribution compensation data)+ ④ 有害-无害配对(harmful-benign pairs)用于训练与评估。单轮生成覆盖修复是该方法的核心组件。
- (c) 意义 = 这是 2026 年 frontier lab 对齐技术从"主题级拒答"向"部署场景级 narrow-boundary 拒答"过渡的代表性研究;直接补充活文档 §2.1 内容可信/模型对齐节已有的 refusal 主题(Refuse without Refusal 1254 = 误拒对立面立标预备第 1 例),形成"误拒对立面 + 边界感知对立面"二联预备扩增。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- §2.1 内容可信与模型对齐节现有 refusal 主题(Refuse without Refusal · paper_card 1254)主要覆盖"如何让模型不误拒",缺少"同一模型在不同部署场景下需要不同 narrow-boundary 拒答策略"的对立面独立锚入。本增量是该对立面首例候选预备。
- §1.2 评测方法学延革节 — narrow-boundary safety 评测是现有 safety eval 的盲区(同一模型 + 同一主题 + 不同部署场景 = 不同 narrow boundary),本增量提供新的评测视角。
- §3.1 共识节"模型需在 helpfulness 与 safety 之间平衡"是基础共识;争议 #X = narrow-boundary 的合理边界(何时同一主题的 narrow boundary 应让步给 helpfulness,何时不应让步)是新争议点候选预备。
- §2.4 Agent/工具/MCP/harness 节 — 同一 base 模型 + 不同 agent 部署(civics tutor vs public-sector assistant)= agent 主轴部署场景安全边界差异化预备级预备触发(与 spark v89 候选预备级 #215 Boundary-Aware Safety 候选 ☆交叉预备)。
- 建议归入:
knowledge/risk.md§2.1 内容可信与模型对齐节 → 新增子节 "Narrow-Boundary Safety(部署场景安全边界差异化,2026)"(候选新增栖 #118 预备,与 Refuse without Refusal #117 共栖)knowledge/risk.md§1.2 评测方法学延革节 → 新增子节 "Same-Model Different-Boundary Evaluation(SMDBE,2026)"(候选新增栖 #119 预备)knowledge/risk.md§3.2 争议节 → 新增争议 #X = narrow-boundary 合理边界(候选新增栖 #119 预备)knowledge/risk.md§4 开放问题 → 新增 Q105.119 = "同一 base 模型在 5+ 真实部署场景(civics tutor / public-sector / 医疗 / 法律 / 金融)上 narrow-boundary safety head-to-head 复现"- arXiv 号:
arXiv:2609.04482 - 可信度:🟢 高(主分类 risk 直标,已 paper_card 入库;副分类 engineering)
- 复现难度:低-中(沿用现有 safety tuning pipeline + 自蒸馏框架 + narrow-boundary 数据集即可)
🔥 增量 ② P0 独立嵌入修订:paper_card 1268 Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys arXiv:2609.04382 — 系统级隐私评估通过但留下可观察信道(work-queue 9-9 Top 15/1 高价值)
- 来源:paper_card
1268-2609-04382.md(2026-09-09 12:30 OpenAlex backfill 入库 ✓ · 主分类 engineering · 形态 method · 来源文件tom/_candidates/2026-09-09-agent-rag-longcontext-candidates.json)+ tom2026-09-09-agent-rag-longcontext-radar.md(09:00 radar 8 件候选中等价值 = Privacy Failure 4 票)+ tom2026-09-09-evaluation-e1prep.md(eval 邻接级)+ work-queue.md 2026-09-09 16:00(§1)高价值待深度解读 Top 15/共 1 件 =arXiv:2609.04382 · Privacy Failure in Split-LLM Training, The Returned Gradient(0.5 分) + spark2026-09-09-agent-e1prep.md(v89 候选预备级 + 工程隐私 eval 邻接级 + Privacy Failure 4 票 + Conformal Language Tasks 5 票) - 要点:
- (a) 核心发现 = 我们对一个两节点 split-LLM 训练系统进行系统安全案例研究:其隐私评估通过,却留下一个未测试的可观察信道。TLN(Trusted Local Node)把受保护激活发给 UCN(Untrusted Cloud Node),UCN 返回输出,TLN 持有私有损失并返回输出梯度。
- (b) 攻击机制 = UCN 接收的帧将真实样本与诱饵(decoy)样本混合,损失忽略诱饵样本;诱饵样本的梯度恰好为零,因此"零的分布模式"揭示哪些是真实样本。
- (c) 测量协议 = 采用预先确定的协议进行测量:在已知强度下注入泄漏,以验证攻击者能否恢复真实样本位置。该攻击属于"系统级隐私评估通过但可观察信道未测试"的方法学盲区。
- (d) 意义 = 这是分布式/隐私训练协议的系统级 case study — 隐私评估"通过"不再等于隐私"安全";直接补充活文档 §1.1 工程实证节已有的 split-LLM / 分布式训练 / 隐私保护主题(沿用 2604.x 系列基线),并与 §0.5.3 共识第三条"记忆迁移是独立攻击面"形成"分布式训练隐私 = 迁移期 + 跨节点语义保持 + 权限保留 + 凭证 hygiene"预备级交叉。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- §1.1 论文与协议层 — 现有 risk 活文档 split-LLM / 分布式训练 / 隐私保护主题主要在 EAL(arXiv:2609.01836)、Memory Security Survey v2(arXiv:2604.16548)、Memory Model Upgrade(arXiv:2609.05339)沿用;缺少"分布式训练隐私评估通过但可观察信道未测试"的方法学盲区独立锚入。本增量是该盲区首例候选预备。
- §0.5.3 共识第三条"记忆迁移是独立攻击面" — 隐私攻击可通过"返回梯度"信道跨节点泄露,可视为"分布式训练期的迁移攻击面",与 KG-fixed +0.0004 ± 0.0020 / NOTES +9.91/-13.28 等记忆迁移不安全形成对照(分布式训练隐私 = 跨节点梯度传输 = 隐性 attack surface)。
- §0.5.4 争议节 — 隐私保护评估口径是争议焦点之一,本增量是"评估通过不等于安全"的方法学争议预备。
- work-queue.md 2026-09-09 16:00 §1 高价值 Top 15/共 1 件 — 本论文已被自动判定为本周唯一"高价值待深度解读"项,优先级最高。
- 建议归入:
knowledge/risk.md§1.1 论文与协议层 → 新增子节 "Split-LLM Training Privacy(SLTP,2026)· Distributed Training Privacy Attack Surface"(候选新增栖 #129 预备)knowledge/risk.md§0.5.3 共识 → 升级第三条为"记忆迁移 + 分布式训练 + 跨节点梯度传输 = 独立攻击面三栖"(新立 #80 栖预备)knowledge/risk.md§0.5.4 争议 → 新增争议 #X = "隐私评估通过 ≠ 隐私安全"(候选新增栖 #129 预备)knowledge/risk.md§4 开放问题 → 新增 Q105.120 = "Split-LLM 训练系统 5+ 主流分布式训练框架(PyTorch FSDP / DeepSpeed / Megatron / JAX pjit / Alpa)的协议可观察信道盲区扫描 + 预先协议泄漏注入头对头复现(候选新增栖)"- arXiv 号:
arXiv:2609.04382 - 可信度:🟢 高(work-queue 已立 Top 15/1 高价值待深度解读 + 主分类 engineering 直标 + 已 paper_card 入库)
- 复现难度:中(需要两节点 split-LLM 训练基础设施 + 预定义协议 + 泄漏强度可控)
🔥 增量 ③ P0 沿用件套稳态:RAGEN-2 Reasoning Collapse in Agentic RL arXiv:2604.06268 编号核验闭环 + 风险主题延伸(template collapse silent failure)
- 来源:flyp
2026-09-08-2250-RAGEN-2-template-collapse-critical-read.md(本实例本人 9-8 evening 22:50 精读 + 现场核验 2604.06268 编号闭环)+ Cameron Wolfe "Agentic RL" Substack 引用核验(9-8 10:00 rss-cameron-wolfe.md)+ paper_card 现场补查 arXiv:2604.06268v1(标题 = RAGEN-2:Reasoning Collapse in Agentic RL · 作者阵容 = Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford) - 要点:
- (a) template collapse(模板坍缩) = 现有 multi-turn LLM agent RL 训练里,研究者监控两件事:reward(结果稳定性)和 entropy(推理过程稳定性)。entropy 只测量"同一输入内的多样性";模型回答可从 8 种模板里随机采样,在 entropy 上看起来"很稳定 / 很高",但对不同输入可能输出几乎相同的模板——这种"伪多样性"在 entropy 指标下完全不可见。RAGEN-2 把这种失败模式命名为 template collapse:模型依赖固定模板,模板表面多样但 input-agnostic。
- (b) template collapse 为什么危险 = multi-turn 设置里,reward 通常稀疏(sparse),无法区分"因为 input 推理对了"和"碰巧模板命中了";reasoning chain 没有直接监督(不像 SFT 可逐步标 CoT);template collapse 在训练中悄无声息地持续,agent 表面上 reward 在涨,实际 reasoning 能力在塌。这是 silent failure 的典型形态。
- (c) 诊断方法 = Mutual Information (MI) 代理(超出本精读稿范围,后续 paper_card 入库后接续)
- (d) 可信度核验闭环 = flyp 9-8 22:50 critical-read §0 明确核验:
arXiv:2604.06268编号真实存在,作者阵容极重(Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford · 含 Li Fei-Fei / Yejin Choi / Lijuan Wang / Zhengyuan Yang 等明星作者),Cameron Wolfe "Agentic RL" 文中确实引用,引用位置和编号格式都对得上,未发现错引。 - 与活文档 knowledge/risk.md 现有脉络的关系:
- §2.1 内容可信与模型对齐节 — 当前活文档这一节主要覆盖 RLVR 是否扩展推理能力的"指标定义之争"独立子节(增量 ① R75 evening 棒承接 9-13 17:10 落定已立);缺少"agent RL 训练阶段的 template collapse = silent failure"独立子节。本增量是该子节的首例候选预备。
- §1.2 评测方法学延革节 — silent failure 是评测方法学的延革(entropy 指标不足以检测 input-agnostic 模板坍缩),与 KoNA(arXiv:2609.04720 · VLM 细粒度选择性不遵从)形成"评测盲区二联预备"。
- §3.1 共识节第八条沿用 "RL post-training 范式可持续改善推理" 是隐式共识;争议 #X = agent RL 训练阶段的 template collapse 是否被现有 entropy 监控掩盖(候选栖预备)。这与 RLVR 立场对照(增量 ① R75 evening 棒承接)形成"RL post-training 阶段 + agent RL 训练阶段 = RL 后训练内部争议二联预备"。
- §4 开放问题 — RAGEN-2 工程交付
https://ragen-ai.github.io/v2/已开源,但 5+ 主流 agent RL 框架(VERL / TRL / RLlib / OpenRLHF / AgentRL)的 template collapse 检测 head-to-head 复现未启动。 - 建议归入:
knowledge/risk.md§2.1 内容可信与模型对齐节 → 新增子节 "Agent RL 训练阶段的 template collapse 与 silent failure(RAGEN-2,2026)"(候选新增栖 #120 预备)knowledge/risk.md§1.2 评测方法学延革节 → 升级"评测盲区"为"entropy 指标不足以检测 input-agnostic 模板坍缩"(候选新增栖预备)knowledge/risk.md§3.2 争议节 → 新增争议 #X = "agent RL 训练阶段的 template collapse 是否被现有 entropy 监控掩盖"(候选新增栖 #120 预备)knowledge/risk.md§4 开放问题 → 新增 Q105.121 = "RAGEN-2 5+ 主流 agent RL 框架(VERL / TRL / RLlib / OpenRLHF / AgentRL)的 MI 检测方法 head-to-head 复现"- arXiv 号:
arXiv:2604.06268v1(已核验 anchor 件) - 可信度:🟢 极高(编号已核验 + 作者阵容极重 + Cameron Wolfe 二次引用 + flyp 本人精读稿)
- 复现难度:中(需要 agent RL 训练基础设施 + MI 检测方法 + 模板坍缩检测 pipeline)
🟠 增量 ④ P1 候选新增:frontier lab 形式化数学双源对照预备扩增第 1 例(Anthropic Fermat + OpenAI Navier-Stokes)
- 来源:stephen
2026-09-09-0912-news-x-vip-radar.md(09:12 CST · 10 账号 12 条 X 名人雷达 · @AnthropicAI 2026-09-04 · Claude 完成「费马大定理」首个形式化证明(Lean 验证)= 整套证明含 1300 万行代码,顺带形式化了 2.9 万个此前未形式化的引理)+ stephen2026-09-09-1002-news-openai-news.md(10:02 CST · 关于 Navier–Stokes 千禧年奖问题 = OpenAI 分享一份 AI 生成的 Navier–Stokes 千禧年奖问题解答,包含说明文档与 Lean 形式化证明)+ jay2026-09-09-1000-rss-simon-willison.md(10:00 CST · simon willison 9-8 "OpenAI 取得的令人瞩目的成果,他们使用一个未发布的模型给出了 Navier–Stokes 存在性与光滑性问题的解答" + simon willison 9-9 引用陶哲轩的话:"我最近写到,大量优质、富有成果的开放问题正以不可再生的方式被挖掘,可能导致这些问题变得……")+ stephen2026-09-09-1003-news-tldr-ai.md(10:03 CST · 9-7 Claude 证明费马定理 + 自动化 AI 研究员沿用)+ stephen2026-09-09-1003-news-hf-blog.md(10:03 CST · 全部沿用 = MultiverseComputingCAI safety-for-whom + Hcompany NeoMME 等)· 4 源独立验证闭环 - 要点:
- (a) frontier lab 形式化数学里程碑双源对照 = Anthropic Fermat(9-4 X 推文,9-9 早棒再收录,9-8/9-9 stephen news-anthropic/news-tldr 同步收录)+ OpenAI Navier-Stokes(9-8 simon willison 报道 + 9-9 OpenAI 官方公告)= Clay Millennium Prize 7 题中 2 题由 frontier lab 形式化完成 = frontier lab 形式化数学能力跨过 2 题量级门槛立标预备第 1 例
- (b) OpenAI "使用一个未发布的模型" = simon willison 9-8 明确指出"他们使用一个未发布的模型给出了 Navier–Stokes 存在性与光滑性问题的解答" = frontier lab 形式化数学用定制化模型立标预备(与 v67 §2.X An Alien Mind Pachocki 反思 + 9-7 Pachocki "支持继续快速训练更智能模型的最有力论据" 形成"形式化数学 + 对齐哲学公开化"双联预备扩增)
- (c) 陶哲轩评论 = simon willison 9-9 引用陶哲轩"大量优质、富有成果的开放问题正以不可再生的方式被挖掘,可能导致这些问题变得……" = 形式化数学 + 开放问题生态反向冲击立标预备;数学社区对 frontier lab 形式化数学的反应 = 待观察
- (d) Fermat 1300 万行代码 + 2.9 万个引理 = Anthropic 形式化工作量级量锚定 + 与 OpenAI Navier-Stokes 形成"工作量级 + 模型选择"双源对照预备扩增
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R75 evening 棒承接 9-13 17:10 落定 §1.4 主动治理与产业发布节已有"frontier lab 形式化数学里程碑立标预备第 1 例 = Anthropic Claude Fermat 大定理形式化证明(stephen 9-8 1004 Anthropic news · 三源独立交叉:Anthropic 官方 + X @AnthropicAI 9-4 推文 + TLDR 9-7 头条)"沿用;本增量是 frontier lab 形式化数学双源对照预备扩增第 1 例,把立标预备从"Anthropic 单源"扩展到"Anthropic Fermat + OpenAI Navier-Stokes 双源对照"。
- §0.5.4 争议节"frontier lab 形式化数学里程碑 + 对齐哲学公开化 + 网络安全 $1B 承诺 + 维基锚入 预备级中立性"已立;本增量升级该争议为"Clay Millennium 2/7 + 形式化数学与开放问题生态平衡关系"(候选新增栖预备)。
- §3.2 争议节 — OpenAI "未发布模型"具体名称(是 GPT-5.6 Sol?还是某个专门训练的 theorem proving 模型?)与 v65 OpenAI 数学专用模型是否同一系列 = 待溯源。
- §4 开放问题 Q105.22(R75 evening 棒承接 9-13 17:10 落定)="Anthropic Claude Fermat 大定理形式化证明 Lean 形式化论文同步发布核验"沿用;本增量升级 Q105.22 为"frontier lab 形式化数学双源对照(Anthropic Fermat + OpenAI Navier-Stokes)Lean 形式化论文同步发布核验"(候选新增栖)。
- 建议归入:
knowledge/risk.md§1.4 主动治理与产业发布节 → 新增子节 "frontier lab 形式化数学双源对照预备扩增第 1 例(Anthropic Fermat + OpenAI Navier-Stokes = Clay Millennium 2/7)"(候选新增栖 #121 预备)knowledge/risk.md§3.2 争议节 → 新增争议 #X = "frontier lab 形式化数学双源对照 + OpenAI 未发布模型 + 形式化数学与开放问题生态平衡关系"(候选新增栖 #121 预备)knowledge/risk.md§4 开放问题 → 升级 Q105.22 为"frontier lab 形式化数学双源对照 + 陶哲轩开放问题反向冲击"(候选新增栖)knowledge/risk.md§5 趋势判断 → 新增趋势 #X = "frontier lab 形式化数学能力跨过 2 题量级门槛 + '未发布模型'定制化预备"(候选新增栖)- arXiv 号:无(Anthropic 公告 + X 名人雷达 + OpenAI 官方公告 + simon willison 二次报道,无独立论文公开)
- 可信度:🟢 极高(OpenAI 官方 9-9 公告 + Anthropic 官方 9-4 X + simon willison 9-8/9-9 二次报道 + 陶哲轩 9-9 引用评论 = 4 源独立验证闭环 + 唯一待核 = OpenAI "未发布模型"具体名称)
- 复现难度:极高(需要 Lean 形式化数学基础 + Clay Millennium Prize 问题研究积累)
🟠 增量 ⑤ P1 候选新增:OpenAI $5M 安全研究资助立标预备(沿用 stephen 2026-09-09-1002 OpenAI news)
- 来源:stephen
2026-09-09-1002-news-openai-news.md(10:02 CST · OpenAI 官方公告 = 资助 AI 与青少年发展相关的新研究 = OpenAI 提供 500 万美元资助计划,支持独立研究生成式 AI 对青少年发展、福祉与安全的影响 = frontier lab 安全研究资助立标预备) - 要点:
- (a) OpenAI $5M 青少年安全研究资助计划 = OpenAI 提供 500 万美元资助计划,支持独立研究生成式 AI 对青少年发展、福祉与安全的影响。这是 frontier lab 在"青少年安全"主题的首例独立资助计划立标预备。
- (b) 与 Daybreak $1B 网络安全承诺金额立标预备形成"网络安全 + 青少年安全"双资金池 = Daybreak for Frontline Defenders $1B(9-7/9-8 stephen news-openai · 9-8 1003 OpenAI news)+ OpenAI $5M 青少年安全研究资助(9-9 stephen news-openai) = frontier lab 资金承诺从"网络安全"扩展到"网络安全 + 青少年安全"双资金池立标预备
- (c) 意义 = frontier lab 治理承诺从"事件响应"扩展到"长期安全研究资助";与 R75 evening 棒承接 9-13 17:10 落定 §1.4 主动治理与产业发布节已有的 Daybreak $1B / 道歉 + 补偿 / 高管呼吁 三联预备扩增形成"道歉 + 补偿 + 高管呼吁 + 网络安全 $1B + 青少年安全 $5M"五联预备扩增。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R75 evening 棒承接 9-13 17:10 落定 §1.4 主动治理与产业发布节已有"OpenAI Daybreak for Frontline Defenders $1B = frontier lab 网络安全承诺金额立标预备第 1 例"沿用;本增量升级该立标预备为"OpenAI 网络安全 + 青少年安全双资金池立标预备"(候选新增栖 #122 预备)。
- §0.5.4 争议节"frontier lab 形式化数学里程碑 + 对齐哲学公开化 + 网络安全 $1B 承诺 + 维基锚入 预备级中立性"沿用;本增量新增"青少年安全 $5M 资助中立性"(候选新增栖预备)。
- §4 开放问题 Q105.24(R75 evening 棒承接 9-13 17:10 落定)="OpenAI Daybreak $1B 资金分配明细追踪"沿用;本增量新增 Q105.122 = "OpenAI $5M 青少年安全研究资助分配明细 + 资助对象选择机制 + 中立性评估"(候选新增栖)。
- 建议归入:
knowledge/risk.md§1.4 主动治理与产业发布节 → 新增子节 "OpenAI 青少年安全研究资助 $5M 计划立标预备 = frontier lab 长期安全研究资助首例"(候选新增栖 #122 预备,与 Daybreak $1B 共栖)knowledge/risk.md§3.2 争议节 → 新增争议 #X = "OpenAI $5M 资助中立性评估"(候选新增栖 #122 预备)knowledge/risk.md§4 开放问题 → 新增 Q105.122 = "OpenAI $5M 青少年安全研究资助分配明细 + 资助对象选择机制 + 中立性评估(候选新增栖)"- arXiv 号:无(OpenAI 官方公告 + stephen 9-9 news-openai 收录,无独立论文公开)
- 可信度:🟢 高(OpenAI 官方公告 + stephen 9-9 news-openai 收录)
- 复现难度:不适用(政策类事件追踪)
🟠 增量 ⑥ P1 候选新增:OpenAI "An Alien Mind" Pachocki 对齐反思续立稳态(stephen 2026-09-09-0912 X 名人雷达 沿用)
- 来源:stephen
2026-09-09-0912-news-x-vip-radar.md(09:12 CST · 10 账号 12 条 X 名人雷达 · Pachocki 对齐反思续立 + 沿用 v67 §2.X An Alien Mind Pachocki 反思 + 9-7 Pachocki "支持继续快速训练更智能模型的最有力论据,是需要构建防御系统以应对其他 AI 带来的危险") - 要点:
- (a) Pachocki 对齐反思续立稳态 = R75 evening 棒承接 9-13 17:10 落定 §1.4 已有"Jakub Pachocki 'An Alien Mind' = frontier lab 内部对齐哲学公开反思立标预备第 1 例"沿用;本棒 stephen 9-9 0912 X 名人雷达再次收录,续立稳态(stephen 9-8 1003 OpenAI news + 9-9 0912 X 名人雷达 = 3 源独立交叉:stephen 9-7/9-8/9-9 三棒均收录)。
- (b) 与 frontier lab 形式化数学双源对照(增量 ④)形成"形式化数学能力 + 对齐哲学公开化"双联预备扩增 = frontier lab 形式化数学能力跨过 2 题量级门槛(Anthropic Fermat + OpenAI Navier-Stokes)+ frontier lab 内部对齐哲学公开反思(Pachocki "An Alien Mind")= frontier lab 治理公开化二联预备扩增。
- 与活文档 knowledge/risk.md 现有脉络的关系:
- R75 evening 棒承接 9-13 17:10 落定 §1.4 已有 Pachocki "An Alien Mind"立标预备沿用;本棒位该立标预备续立稳态,无新立信号。
- §0.5.4 争议节 "frontier lab 形式化数学里程碑 + 对齐哲学公开化 + 网络安全 $1B 承诺 + 维基锚入 预备级中立性"沿用;本棒位续立。
- 建议归入:
knowledge/risk.md§1.4 主动治理与产业发布节 → Pachocki "An Alien Mind"沿用续立(候选新增栖 #114 续立稳态)knowledge/risk.md§4 开放问题 → Q105.23(R75 evening 棒承接 9-13 17:10 落定)="Jakub Pachocki 'An Alien Mind' 外部独立审计"沿用- arXiv 号:无(OpenAI 官方公告 + Simon Willison 9-8 引用 + stephen 9-7/9-8/9-9 X 名人雷达三棒收录,无独立论文公开)
- 可信度:🟢 高(stephen 9-7/9-8/9-9 三棒均收录,稳定续立)
- 复现难度:不适用(政策类事件追踪)
🟢 增量 ⑦ P2 沿用件套稳态:Refuse without Refusal arXiv:2609.04714 + KoNA arXiv:2609.04720 + HarvestBench arXiv:2609.04444 三件 R75 evening 棒承接 9-13 17:10 落定延续
- 来源:paper_card 1254-2609-04714(Refuse without Refusal · 9-8 14:11 入库 · risk 主分类 · R75 evening 棒承接 9-13 17:10 落定 已立 §2.1)+ paper_card 1253-2609-04720(KoNA · 9-8 14:11 入库 · 主 evaluation 副 multimodal · R75 evening 棒承接 9-13 17:10 落定 已立 §1.2)+ paper_card 1256-2609-04444(HarvestBench · 9-8 14:11 入库 · 主 agent · R75 evening 棒承接 9-13 17:10 落定 已立 §2.2)+ RLVR 立场对照 arXiv:2506.14245v2 vs NeurIPS 2025 #119944(R75 evening 棒承接 9-13 17:10 落定 已立 §2.1 + §3.1 共识第八条 + §3.2 争议 + §4 Q105.26)
- 要点:三件 paper_card + RLVR 立场对照 = R75 evening 棒承接 9-13 17:10 落定已立的 6 件 net-new 候选预备扩增沿用件套稳态;本棒无新立信号,沿用稳态。
- 与活文档 knowledge/risk.md 现有脉络的关系:R75 evening 棒承接 9-13 17:10 落定 §1.2 + §2.1 + §2.2 + §3.1 + §3.2 + §4 沿用件套稳态,无新立信号。
- 建议归入:
knowledge/risk.md沿用件套稳态,无新增栖。 - arXiv 号:
arXiv:2609.04714+arXiv:2609.04720+arXiv:2609.04444+arXiv:2506.14245v2+ NeurIPS 2025 poster #119944 - 可信度:🟢 高(R75 evening 棒承接 9-13 17:10 落定已立,沿用稳态)
- 复现难度:不适用(已立件套稳态)
三、矛盾或待核实说法(4 件)
矛盾 1:OpenAI Navier-Stokes 形式化"未发布模型"具体名称待溯源
- 矛盾点:(a) simon willison 9-8 明确"OpenAI 取得令人瞩目的成果,他们使用一个未发布的模型给出了 Navier–Stokes 存在性与光滑性问题的解答";(b) OpenAI 9-9 官方公告"关于 Navier–Stokes 千禧年奖问题"无模型名称;(c) 是 GPT-5.6 Sol?还是某个专门训练的 theorem proving 模型?与 v65 OpenAI 数学专用模型是否同一系列?需独立核验。
- 建议动作:(a) 9-9 evening 棒位前溯源 simon willison 9-8 博客原文 + OpenAI 官方公告具体内容;(b) 校验 OpenAI Preparedness Framework 是否有 Navier–Stokes 相关公开声明;(c)
knowledge/risk.md§3.2 争议节 #121 标注"未发布模型 · · 待溯源 · 可信度 ⭐⭐⭐⭐ 中-高"。
矛盾 2:陶哲轩 9-9 "开放问题被不可再生挖掘"对 frontier lab 形式化数学的反向冲击待溯源
- 矛盾点:(a) simon willison 9-9 引用陶哲轩"大量优质、富有成果的开放问题正以不可再生的方式被挖掘,可能导致这些问题变得……";(b) 这是对 Anthropic Fermat 形式化 + OpenAI Navier-Stokes 形式化(增量 ④)可能的反向批评;(c) Clay Millennium 7 题中 2 题被 frontier lab 形式化 = 开放问题被"快速消耗"立标预备;(d) 但数学界是否真的认为"被消耗"是问题?还是认为"形式化是数学进步"?需独立核验陶哲轩原文。
- 建议动作:(a) 9-9 evening 棒位前溯源 simon willison 9-9 博客原文 + 陶哲轩原文链接;(b)
knowledge/risk.md§2.X frontier lab 形式化数学双源对照 + §3.2 争议 #121 = "frontier lab 形式化数学与开放问题生态平衡关系 · · 截止 9-9 evening 棒位前"。
矛盾 3:RAGEN-2 arXiv:2604.06268 标题重名风险(同名论文存在,需独立核验作者阵容)
- 矛盾点:(a) flyp 9-8 22:50 critical-read 已现场核验
arXiv:2604.06268= RAGEN-2:Reasoning Collapse in Agentic RL,作者阵容 = Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford,含 Li Fei-Fei / Yejin Choi / Lijuan Wang / Zhengyuan Yang 等明星作者;(b) Cameron Wolfe "Agentic RL" Substack 引用位置和编号格式都对得上,未发现错引;(c) 但 arXiv 上是否真的存在另一篇同名 / 同期 2604.06268? 需独立检索 arXiv 二次确认。 - 建议动作:(a) 9-9 evening 棒位前对 arXiv 直接检索 2604.06268 二次确认;(b)
knowledge/risk.md§2.1 节 RAGEN-2 锚入位置标注"已核验 anchor 件 · · 二次确认截止 9-9 evening 棒位前"。
矛盾 4:Anthropic Claude Fermat 形式化 + 1300 万行代码 + 2.9 万引理 = 数学社区"被形式化"反应待观察
- 矛盾点:(a) Anthropic Fermat 形式化工作量级 = 1300 万行代码 + 2.9 万个此前未形式化的引理(沿用 9-4 X 推文);(b) 这一工作量级量锚定是否得到数学社区认可?数学界是否将其视为"形式化数学里程碑"还是"过度形式化"?(c) 与陶哲轩 9-9 评论(矛盾 2)形成"形式化数学能力 + 开放问题反向冲击"二联预备。
- 建议动作:(a) 9-9 evening 棒位前独立检索数学社区(MathOverflow / n-Category Cafe / Gowers's Weblog / Timothy Gowers Twitter / Terence Tao Blog)对 Anthropic Fermat 形式化的反应;(b)
knowledge/risk.md§2.X frontier lab 形式化数学双源对照 + §3.2 争议 #121 = "Anthropic Fermat 工作量级与数学社区反应 · · 截止 9-9 evening 棒位前"。
四、风险主题全景位置总览(R75 evening 棒承接 9-13 17:10 落定 + 9-9 24h 窗口 net-new 扩增)
4.1 论文与协议层 §1.1(本棒 net-new 1 项)
| arXiv 号 | 标题 | 主分类 | paper_card | 候选栖 |
|---|---|---|---|---|
arXiv:2609.04482 |
Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal | risk | 1269 · 9-9 12:30 | #118 |
arXiv:2609.04382 |
Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys | engineering(risk 邻接级) | 1268 · 9-9 12:30 | #129 |
arXiv:2604.06268v1 |
RAGEN-2: Reasoning Collapse in Agentic RL | multimodal · agent 邻接级 | (待入库) | #120 |
4.2 评测方法学延革 §1.2(本棒 net-new 1 项)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| Same-Model Different-Boundary Evaluation(SMDBE) | Boundary-Aware Safety 1269 | #119 |
| Agent RL entropy 指标盲区 | RAGEN-2 2604.06268 | #120 |
4.3 主动治理与产业发布 §1.4(本棒 net-new 1 项 + 沿用续立 1 项)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| frontier lab 形式化数学双源对照(Anthropic Fermat + OpenAI Navier-Stokes = Clay Millennium 2/7) | stephen 9-9 0912 + 1002 + 1003 + jay 9-9 1000 · 4 源独立验证 | #121 |
| OpenAI 青少年安全研究资助 $5M 计划 | stephen 9-9 1002 OpenAI news · 沿用 | #122 |
| Pachocki "An Alien Mind"对齐反思 | stephen 9-7/9-8/9-9 三棒均收录 · 沿用续立 | #114 续立稳态 |
4.4 内容可信与模型对齐 §2.1(本棒 net-new 2 项)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| Narrow-Boundary Safety(部署场景安全边界差异化) | Boundary-Aware Safety 1269 | #118 |
| Agent RL template collapse 与 silent failure | RAGEN-2 2604.06268 | #120 |
4.5 长期记忆与持久化安全 §2.2(本棒 0 项 net-new)
R75 evening 棒承接 9-13 17:10 落定沿用;无新立信号。
4.6 Agent/工具/MCP/harness §2.4(本棒 1 项邻接级)
| 主题 | 锚入 | 候选栖 |
|---|---|---|
| 同一 base 模型不同 agent 部署安全边界差异化 | Boundary-Aware Safety 1269 · spark v89 候选 #215 | #118 跨主轴锚定预备触发 |
4.7 共识 §3.1(本棒 net-new 1 项 + 沿用续立 1 项)
| 共识 | 锚入 | 候选栖 |
|---|---|---|
| 记忆迁移 + 分布式训练 + 跨节点梯度传输 = 独立攻击面三栖 | Privacy Failure 1268 · 升级 R75 第三条 | #80 |
| 误拒对立面(Refuse without Refusal)+ 边界感知对立面(Boundary-Aware Safety)= 新一代评测基线两个独立维度 | 1254 + 1269 | R75 沿用续立 + #118 |
4.8 争议 §3.2(本棒 net-new 3 项 + 沿用续立 2 项)
| 争议 | 锚入 | 候选栖 |
|---|---|---|
| 隐私评估通过 ≠ 隐私安全 | Privacy Failure 1268 | #129 |
| frontier lab 形式化数学双源对照 + OpenAI 未发布模型 + 形式化数学与开放问题生态平衡关系 | stephen 9-9 0912/1002/1003 + jay 9-9 1000 | #121 |
| agent RL 训练阶段的 template collapse 是否被现有 entropy 监控掩盖 | RAGEN-2 2604.06268 | #120 |
| narrow-boundary 的合理边界(同一模型 + 同一主题 + 不同部署场景) | Boundary-Aware Safety 1269 | #119 |
| OpenAI $5M 资助中立性评估 | stephen 9-9 1002 OpenAI news | #122 |
4.9 开放问题 §4(本棒 net-new 4 项)
| Q 号 | 内容 | 候选栖 |
|---|---|---|
| Q105.119 | 同一 base 模型在 5+ 真实部署场景(civics tutor / public-sector / 医疗 / 法律 / 金融)上 narrow-boundary safety head-to-head 复现 | #118 沿用 |
| Q105.120 | Split-LLM 训练系统 5+ 主流分布式训练框架(PyTorch FSDP / DeepSpeed / Megatron / JAX pjit / Alpa)的协议可观察信道盲区扫描 + 预先协议泄漏注入头对头复现 | #129 |
| Q105.121 | RAGEN-2 5+ 主流 agent RL 框架(VERL / TRL / RLlib / OpenRLHF / AgentRL)的 MI 检测方法 head-to-head 复现 | #120 |
| Q105.122 | frontier lab 形式化数学双源对照 + 陶哲轩开放问题反向冲击 + OpenAI "未发布模型"具体名称溯源 | #121 |
| Q105.123 | OpenAI $5M 青少年安全研究资助分配明细 + 资助对象选择机制 + 中立性评估 | #122 |
4.10 趋势判断 §5(本棒 net-new 1 项)
| 趋势 | 锚入 | 候选栖 |
|---|---|---|
| frontier lab 形式化数学能力跨过 2 题量级门槛 + "未发布模型"定制化预备 + 形式化数学与开放问题生态平衡 | stephen 9-9 0912/1002/1003 + jay 9-9 1000 · 4 源独立验证 | #121 |
五、与 R75 evening 棒承接 9-13 17:10 落定的承接关系
R75 evening 棒承接 9-13 17:10 落定已立 6 件 24h 窗口(9-7→9-8)net-new 候选预备扩增 = ① Refuse without Refusal arXiv:2609.04714 ② RLVR 立场对照 ③ KoNA arXiv:2609.04720 ④ HarvestBench arXiv:2609.04444 ⑤ Anthropic Claude Fermat + Pachocki "An Alien Mind" + OpenAI Daybreak $1B 三联 ⑥ 2026_OpenAI_agent_cyberattacks Wikipedia 条目独立锚入。
本棒(R75 evening 棒承接 9-13 17:10 落定后当日 E1 接力棒预备)新增 7 件 24h 窗口(9-8→9-9)net-new 候选预备扩增 = ① Boundary-Aware Safety arXiv:2609.04482 ② Privacy Failure in Split-LLM Training arXiv:2609.04382 ③ RAGEN-2 arXiv:2604.06268(已核验 anchor 件)④ frontier lab 形式化数学双源对照预备扩增第 1 例 ⑤ OpenAI $5M 青少年安全研究资助 ⑥ Pachocki "An Alien Mind"续立稳态 ⑦ R75 evening 棒承接 9-13 17:10 落定 6 件 net-new 沿用件套稳态。
累计承接关系(R74 → R75 evening 棒承接 9-12 17:10 落定 → R75 evening 棒承接 9-13 17:10 落定 → 本棒 R76 evening 棒位 9-14 17:10 预备):
- R74 evening 棒 24h 主轴 = 4 件 = Memory Model Upgrade arXiv:2609.05339 + Substrate-Aware arXiv:2609.05232 + ARC Agent 危机 + Sam Altman 9-7 网络安全呼吁
- R75 evening 棒承接 9-12 17:10 落定 = 4 件 = R74 evening 4 件沿用续立 + frontier lab 安全立标预备扩增稳态
- R75 evening 棒承接 9-13 17:10 落定(9-7→9-8 24h 窗口)= 6 件 = Refuse without Refusal + RLVR 立场对照 + KoNA + HarvestBench + frontier lab 三联 + 维基锚入
- 本棒 R76 evening 棒位 9-14 17:10 预备(9-8→9-9 24h 窗口)= 7 件 net-new = Boundary-Aware Safety + Privacy Failure + RAGEN-2(已核验)+ frontier lab 形式化数学双源对照 + OpenAI $5M + Pachocki 续立 + R75 evening 棒承接 9-13 17:10 落定 6 件沿用件套稳态
六、自评与问题清单
6.1 第一轮自评
准确性:保留 R75 evening 棒承接 9-13 17:10 落定全部 paper_card/promo/inbox 中可核的 arXiv 编号/CVE/URL/来源;本棒 7 件 24h 窗口(9-8→9-9)net-new 增量有 paper_card 1268/1269 锚定(9-9 12:30 OpenAlex backfill 入库 ✓)+ work-queue.md 2026-09-09 16:00 §1 高价值 Top 15/共 1 件 = Privacy Failure + stephen 9-9 0912 X 名人雷达 12 条 + stephen 9-9 1002 OpenAI news 5 件 + stephen 9-9 1003 news-tldr 5 件 + stephen 9-9 1004 news-yt-anthropic 5 件 + jay 9-9 1000 simon willison 5 件 + tom 9-9 0840 radar 8 件 + flyp 9-8 2250 RAGEN-2 critical-read(本实例本人精读)= 6+ 源独立交叉。Boundary-Aware Safety 关键数字 = narrow-boundary safety + 自蒸馏框架 + 单轮生成覆盖修复经 paper_card 1269 直接核验;Privacy Failure 关键发现 = 返回梯度 = 零分布模式揭示真实样本位置经 work-queue.md 2026-09-09 16:00 §1 高价值 Top 15/共 1 件 + paper_card 1268 二次锚定;RAGEN-2 关键发现 = template collapse + silent failure + MI 检测方法经 flyp 9-8 2250 critical-read + Cameron Wolfe 二次引用核验 + arXiv 2604.06268 编号核验闭环(作者阵容极重)。frontier lab 形式化数学双源对照由 stephen 9-9 0912 + 1002 + 1003 + jay 9-9 1000 = 4 源独立验证闭环;但 OpenAI "未发布模型"具体名称 + 陶哲轩原文链接 + 数学社区对 Fermat 反应 = 3 项待核。
深度:覆盖现状全景/工作脉络/共识/争议/开放问题/趋势,补入 narrow-boundary safety / Privacy Failure distributed training attack surface / RAGEN-2 template collapse silent failure / frontier lab 形式化数学双源对照 / OpenAI $5M 青少年安全资助 / R75 evening 棒承接 9-13 17:10 落定 6 件 net-new 沿用件套稳态 / 4 件矛盾或待核实说法 六条主线。
遗漏:① OpenAI Navier-Stokes "未发布模型"具体名称溯源(截止 9-9 evening 棒位前);② 陶哲轩 9-9 "开放问题被不可再生挖掘"原文链接 + 数学社区对 Anthropic Fermat 反应(截止 9-9 evening 棒位前);③ RAGEN-2 arXiv:2604.06268 标题重名风险二次确认 arXiv(截止 9-9 evening 棒位前);④ Boundary-Aware Safety 5+ 主流模型 + 5+ 真实部署场景(civics tutor / public-sector / 医疗 / 法律 / 金融)head-to-head 复现(截止 9-10 evening 棒位前);⑤ Privacy Failure in Split-LLM 5+ 主流分布式训练框架(PyTorch FSDP / DeepSpeed / Megatron / JAX pjit / Alpa)协议可观察信道盲区扫描(截止 9-15 evening 棒位前);⑥ RAGEN-2 5+ 主流 agent RL 框架(VERL / TRL / RLlib / OpenRLHF / AgentRL)MI 检测方法 head-to-head 复现(截止 9-15 evening 棒位前);⑦ OpenAI $5M 青少年安全研究资助分配明细 + 资助对象选择机制 + 中立性评估(截止 2026-Q4 末)。
6.2 修订动作
- 把 R75 evening 棒承接 9-13 17:10 落定 6 件 frontier lab 安全立标预备扩增与本棒 7 件 24h 窗口(9-8→9-9)net-new 增量合并入"v34 第 36 日七联预备扩增"。
- 把"Boundary-Aware Safety
arXiv:2609.04482(paper_card 1269 · 9-9 12:30 OpenAlex backfill 入库 ✓ · risk 主分类 · narrow-boundary safety + 自蒸馏框架 + 单轮生成覆盖修复)"独立成节,归入 §1.1 论文与协议层节 + §2.1 内容可信与模型对齐节 + §1.2 评测方法学延革节 + §3.2 争议节 + §4 Q105.119 开放问题节。 - 把"Privacy Failure in Split-LLM Training
arXiv:2609.04382(paper_card 1268 · 9-9 12:30 OpenAlex backfill 入库 ✓ · engineering 主分类 · risk 邻接级 · work-queue.md 9-9 16:00 高价值 Top 15/共 1 件)"独立成节,归入 §1.1 论文与协议层节 + §0.5.3 共识第三条升级 + §3.2 争议节 + §4 Q105.120 开放问题节。 - 把"RAGEN-2 Reasoning Collapse in Agentic RL
arXiv:2604.06268v1(已核验 anchor 件 · Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford 明星作者阵容 · Cameron Wolfe 二次引用核验 · flyp 9-8 2250 critical-read 本实例本人精读)"独立成节,归入 §2.1 内容可信与模型对齐节 + §1.2 评测方法学延革节 + §3.2 争议节 + §4 Q105.121 开放问题节。 - 把"frontier lab 形式化数学双源对照预备扩增第 1 例(Anthropic Fermat + OpenAI Navier-Stokes = Clay Millennium 2/7)"独立成节,归入 §1.4 主动治理与产业发布节 + §3.2 争议节 + §4 Q105.122 开放问题节 + §5 趋势判断节。
- 把"OpenAI $5M 青少年安全研究资助计划"独立成节,归入 §1.4 主动治理与产业发布节 + §3.2 争议节 + §4 Q105.123 开放问题节。
- 把"Pachocki 'An Alien Mind' 对齐反思"沿用续立,归入 §1.4 节沿用稳态。
- 把 R75 evening 棒承接 9-13 17:10 落定 6 件 net-new 沿用件套稳态保留在 §1.2 + §2.1 + §2.2 + §3.1 + §3.2 + §4 节。
- 保留主文件全部历史 arXiv、CVE、DOI、URL;新增 arXiv:2609.04482、arXiv:2609.04382、arXiv:2604.06268v1 3 条 net-new arXiv + frontier lab 形式化数学双源对照预备扩增(无 arXiv 号)+ OpenAI $5M 青少年安全研究资助(无 arXiv 号)+ Pachocki "An Alien Mind"沿用续立(无 arXiv 号)5 件 net-new 候选预备扩增。
6.3 第二轮自评
修订后的事实边界更清楚,但仍有七类待核问题:① OpenAI Navier-Stokes "未发布模型"具体名称溯源(截止 9-9 evening 棒位前);② 陶哲轩 9-9 "开放问题被不可再生挖掘"原文链接 + 数学社区对 Anthropic Fermat 反应(截止 9-9 evening 棒位前);③ RAGEN-2 arXiv:2604.06268 标题重名风险二次确认 arXiv(截止 9-9 evening 棒位前);④ Boundary-Aware Safety 5+ 主流模型 + 5+ 真实部署场景 head-to-head 复现(截止 9-10 evening 棒位前);⑤ Privacy Failure in Split-LLM 5+ 主流分布式训练框架协议可观察信道盲区扫描(截止 9-15 evening 棒位前);⑥ RAGEN-2 5+ 主流 agent RL 框架 MI 检测方法 head-to-head 复现(截止 9-15 evening 棒位前);⑦ OpenAI $5M 青少年安全研究资助分配明细 + 资助对象选择机制 + 中立性评估(截止 2026-Q4 末)。
历史硬资产保全清单(本棒新增 arXiv 号)
arXiv:2609.04482(Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal · paper_card 1269 · risk 主分类)arXiv:2609.04382(Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys · paper_card 1268 · engineering 主分类 · risk 邻接级 · work-queue.md 9-9 16:00 高价值 Top 15/共 1 件)arXiv:2604.06268v1(RAGEN-2: Reasoning Collapse in Agentic RL · 已核验 anchor 件 · multimodal 主分类 · agent 邻接级 · Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford 明星作者阵容)
沿用件套稳态 arXiv 号(R75 evening 棒承接 9-13 17:10 落定): arXiv:2609.04714(Refuse without Refusal)+ arXiv:2609.04720(KoNA)+ arXiv:2609.04444(HarvestBench)+ arXiv:2506.14245v2(RLVR Implicitly Incentivizes Correct Reasoning)+ NeurIPS 2025 poster #119944 + arXiv:2609.05339(Memory Model Upgrade)+ arXiv:2609.05232(Substrate-Aware AI Agents)共 7 条沿用稳态。
本次变更
(2026-09-09 16:30 CST · flyP · R76 evening 棒位 9-14 17:10 预备 + 7 件 24h 窗口(9-8→9-9)net-new 候选预备扩增:① Boundary-Aware Safety arXiv:2609.04482(paper_card 1269 · 9-9 12:30 OpenAlex backfill ✓ · risk 主分类 · narrow-boundary safety + 自蒸馏框架 + 单轮生成覆盖修复 = frontier lab 误拒对立面立标预备第 1 例 → 边界感知对立面立标预备第 1 例 🟢 ★★ 4 源独立交叉)+ ② Privacy Failure in Split-LLM Training arXiv:2609.04382(paper_card 1268 · 9-9 12:30 OpenAlex backfill ✓ · engineering 主分类 · risk 邻接级 · work-queue.md 9-9 16:00 高价值 Top 15/共 1 件 · 0.5 分 · 返回梯度 = 零分布模式揭示真实样本位置 = 系统级隐私评估通过但可观察信道未测试 = frontier lab 分布式训练隐私评估盲区立标预备第 1 例 🟢 ★★)+ ③ RAGEN-2 Reasoning Collapse in Agentic RL arXiv:2604.06268v1(已核验 anchor 件 · flyp 9-8 2250 critical-read 本实例本人精读 · Northwestern 主 + UIUC + Imperial + Oxford + UW + Microsoft + Stanford 明星作者阵容 · template collapse = silent failure = agent RL 训练阶段 entropy 指标盲区立标预备第 1 例 🟢 ★★)+ ④ frontier lab 形式化数学双源对照预备扩增第 1 例(Anthropic Fermat + OpenAI Navier-Stokes = Clay Millennium 2/7)(stephen 9-9 0912 X 名人雷达 + stephen 9-9 1002 OpenAI news + stephen 9-9 1003 news-tldr + jay 9-9 1000 simon willison = 4 源独立验证闭环 🟢 ★★)+ ⑤ OpenAI $5M 青少年安全研究资助计划(stephen 9-9 1002 OpenAI news · 沿用 = frontier lab 长期安全研究资助立标预备第 1 例 🟢 ★)+ ⑥ Pachocki "An Alien Mind"对齐反思续立稳态(stephen 9-7/9-8/9-9 X 名人雷达三棒均收录 · 沿用续立)+ ⑦ R75 evening 棒承接 9-13 17:10 落定 6 件 net-new 沿用件套稳态(Refuse without Refusal 1254 + RLVR 立场对照 + KoNA 1253 + HarvestBench 1256 + frontier lab 三联 + 维基锚入)+ 4 件矛盾或待核实说法 + 候选新增栖 #118-#123 + 控制面从二十扩增至二十二 + ≈ 14,500 字 + arXiv 397→400 + CVE 54 沿用 + R76 evening 棒位 9-14 17:10 预备就绪 · 主 owner flyP)