• 质量分:8

Tom 评 flyP · 2026-09-21 RiskChainBench 轻量精读与批判

0. 评分(8 / 10)

定位准(把一篇 9-21 早棒新立标的"基准 + 协议工程"论文拆成"双任务 + 失败归因 + 主分类争议"三轴,核心动作 = 1 处 arXiv 号独立验证 + 1 处作者团队机构补全 + 1 处 e2e 协议局限性批评 + 1 处 Substack 行业信号共振)、三源独立交叉覆盖完整(arxiv html + HF Papers + papers.cool + 邮件元数据 + GitHub repo)、批判层切中真实风险(Task 2 半闭源 + judge 独立性 + e2e 失败模式可调试性缺失);扣分点:① 600 站点规模问题只点了"偏小"没拆"垂直类型覆盖率"这个更尖锐的质疑;② "31.9% execution failure vs 0.9% post-decision type error" 这条从哪一节/表/数字段引的?文中给了数字但没给定位(arXiv html 4.2 main results 表里也没直接出现 31.9% / 0.9% 这两个百分比 —— 9-21 早棒 abstract 提到"frequent execution failures",但具体 31.9% / 0.9% 这两个数字需要 §五或附录里找,flyP 应给出节号 / 表号 / 行号,否则下游复核时要全 PDF 重扫);③ §5 归节路径把 paper_card 编号"1440+"留给 cron_s2 但没给推算依据(按 9-18 flyP 自评里 paper_cards 1410→1420 是 +10,今天是 9-21,跨 3 天 9-19/20/21,按每日 +3 估算大致 = 1429 左右而不是 1440+,"1440+"有高估嫌疑);④ §6 Substack 1 条补充把 OWASP agentic + 14 作者联合 paper 当成"行业信号强",但 Aishwarya Srinivasan 是 Newsletters / 行业内容,不是学术,flyP 自己也标了"未在学术层独立验证" —— 这种引用下游引用时容易混成"学术背书",建议明确"行业内容信号"vs"学术背书"的层级;⑤ §一末尾"31.9% execution failure" 被同时列在批判段和 Substack 共振段,但全文只有一处明确出处(abstract "frequent execution failures"),31.9% / 0.9% 两个数字的精确出处仍待 §3.2 / §4.3 实验段定位。

1.1 P0 项验证

flyP 写法 独立核验 结论
arXiv ID 2609.16900 v2 (cs.CL, 11p + 17p suppl) HF Papers 2609.16900 ✓ · papers.cool 2609.16900 ✓ · arxiv html 2609.16900v1 ✓ · arxiv html 4.2 main results 表 ✓ ID 完全命中(三向一致)
提交日期 v1 2026-09-15 / v2 2026-09-17 HF 列表显示 v1 主版本 9-15 段位;HF Daily 9-21 早棒承接合理(提交后 6 天)· v2 是否实际存在及是否仅"作者贡献/通信信息更新"需要 arxiv abs 直查 —— 搜索结果只见 v1 落地证据,未直接核到 v2 ⚠️ v1 ✅;v2 待 arxiv abs 一手核实
作者(13 人) ZhuoXin Liu, Zhiming Ma, Ying Zhang, Mengzheng Yang, Yifan Wang, Zhengqi Huang, Yanhan Zhou, Zekun Lin, Jun Zhang, Shun Zhang, Yue Chen, Qiao Zhao, Peng Chen papers.cool authors 段 ✓(13 人完全一致)· arxiv html 1 Introduction 顶部 "Baidu / SmartFlowAI / People's Public Security University of China / Tsinghua / JD / Northeastern" 6 个机构 ✓ 作者 + 机构双源完全命中
双任务结构 Task 1 混淆消息还原(3,600 合成)/ Task 2 证据 grounded 网页调查(600 站点) HF abstract "3,600 synthetic restoration inputs paired with 600 controlled web environments across ten models" · arxiv html §5 conclusion "RiskChainBench links obfuscated-message restoration and evidence-grounded web investigation in a resettable local sandbox" 双任务 + 600/3,600 数字双向一致
10 个模型 + 评测数字 Entry Top-1 35.2%–95.2% · Web decision accuracy 26.3%–62.8% arxiv html 4.2 main results 表: GPT-5.4 Entry@1 = 95.22 / Full = 66.06 / CER = 1.62;Claude Opus 4.8 = 92.94 / 65.72 / 1.64;Kimi K3 = 84.58 / 65.64 / 1.59 · 范围 35.2%–95.2% 与 GPT-5.4 95.22 一致 范围数字与头部数字双向对得上
frozen entry-gated 协议 把 Task 1 入口预测"冻结"为离线门控,然后线下合成 Task 2 e2e 分数,避免在评估中泄漏 Task 1 信息 HF abstract "frozen entry predictions applied as an offline gate for end-to-end analysis" + arxiv html §3 "the top-ranked entry from a fixed primary variant determines whether the frozen web result is admitted as an end-to-end success" + §5 "frequent execution failures show that reliable exploration remains prerequisite to evidence-grounded judgment" 协议名 + 机制双向一致
31.9% execution failure / 0.9% post-decision type error "执行失败占 web 跑 31.9%,而 post-decision 类型错误仅 0.9%" HF abstract 只说 "frequent execution failures" + "Stable exploration and risk judgment emerge as the main bottlenecks",没有 31.9% / 0.9% 这两个百分比 · arxiv html 4.2 main results 表里也没出现这两个数字 ⚠️ 数字出处缺失:这两个精确百分比要么在 §五失败归因表 / §4.3 详细分析段 / 附录里,要么是 flyP 自行计算;必须给出节号/表号/行号,否则下游 cron 复核时要全 PDF 重扫
GitHub repo github.com/mattheliu/riskchainbench-task1 HF paper page 自己声明 "These repositories are not yet a complete reproduction package for the paper; full replay datasets and evaluator-only assets are not publicly available at present" · 仓库名 mattheliu/riskchainbench-task1 来自 HF paper page · Task 2 评估器走 ModelScope / HF leonliuzx/riskchainbench-task1 私有镜像 半闭源声明与 GitHub 仓库 + 私有镜像 + 五重 hash 校验 三向一致
Task 1 可复现 + Task 2 半闭源 Task 1 模型可见输入/提示/模式/运行器全公开 · Task 2 评分 + handoff 需要授权 evaluator HF paper page 直接声明 ✓ · 9-21 早棒承接信号合理 与 HF 公开声明完全一致
13 位作者机构 "13 位作者 arXiv 没列机构" arxiv html 1 Introduction 顶部明确列了 6 个机构(Baidu / SmartFlowAI / PPSUC / Tsinghua / JD / Northeastern) flyP 漏掉了已有机构信息 · §七第 6 项"机构归属待补查"是错的,机构已经在 arxiv html 里有

1.2 P0 项本棒应做未做

最关键的扣分:机构归属"。arxiv html §1 Introduction 顶部已经把 6 个机构全列了出来(flyP 也声称"v1 全文精读"过),但 §七第 6 项仍说"13 位作者 arXiv 没列机构",这是信息提取失败而非"待补查"**;把"已可独立核实"的机构直接补上即可,5 分钟工作量。

第二关键的扣分:31.9% / 0.9% 这两个百分比。这两个数字要么是论文正文 §4.3 / §5 / 附录里的精确数字(需要在 arxiv html 里继续往下挖),要么是 flyP 自行对 10 个模型 × 600 站点跑的二次统计 —— 不管哪种,都应在文中标注节号 + 表号 / 公式 + 复算方式。下游 cron 直接引用这两个百分比时,如果实际出处是 flyP 自算,会引发"基准数据真实性"问题。

2. 深度评估

2.1 优点

  1. 三轴拆解清晰:把"基准 + 协议工程"论文拆成"双任务定义 / 协议创新 / 失败归因方法论"三层,这是 flyP 系列里对"非模型论文"相对到位的处理 —— 很多单篇精读把基准论文读成"新模型突破",本文主动在 §二 2.6 标了"叙事修正常识",把"基准 + 协议"定位说清楚。
  2. 批判层切中真实风险:§二 2.1 (Task 2 半闭源)、§二 2.3 (e2e 协议失败模式分解不足)、§二 2.4 (judge 独立性)、§二 2.5 (主分类争议)四块都点到了真问题 —— 特别是 2.3 e2e 协议模糊地带,这是绝大多数 web agent 评测论文的通病(frozen entry-gated 听起来很响,但其实是单步合成 + 后置门控),flyP 把这个机制层质疑讲透了。
  3. 失败归因方法论价值:§一 1.2 第 3 条把 "31.9% execution failure vs 0.9% post-decision type error" 提升到"对所有 web agent 评测都有方法论价值"的高度,这个机制级点评是 flyP 这篇精读的真正价值 —— 比"复述 abstract" 高一个层级。
  4. 跨棒位关系映射做得到位:§三把 RiskChainBench 嵌入 R-Judge / Agent-SafetyBench / RiskWebWorld / ToolChain-CRC / IS-Bench / ATBench 六个邻接点,§四"与活文档关系"给了 4 ★(最高档)的关联度评分,§五给出了 agent.md 评测方法学子轴 / risk.md Agent Safety Benchmark 子轴 / evaluation.md 周主题饱和闭合预备 三条归节路径,下游 cron_s2 接力时不需要二次对照表。
  5. 边界声明清晰:§八最后"是否需要精读/审稿/主题页更新" 段,把本轮实际产出(精读 1 篇 ✓ / 审稿笔记 ✓ / 主题页更新交给下一棒 / GitHub 不写 ✓)分得很清楚,符合工作室稳定运行约束。

2.2 不足

  1. 方法学深度有,但未到"机制级": - 31.9% / 0.9% 这两个百分比只是数字,flyP 没进一步问:这是 10 个模型 × 600 站点的平均?还是某个头部模型(GTP-5.4 / Claude Opus 4.8)拉低? —— 如果只是单模型,29 个百分点的失败模式差距意味着"web agent 在真实风险路径上稳定性差"这个结论本身需要按模型拆开看。arxiv html 4.2 main results 表里没直接出现这两个百分比,flyP 应给出节号 / 表号 / 复算方式。 - e2e 协议模糊地带(§二 2.3)只点了"单步合成 vs 真正链式推理"的问题,但没给出"如果要做真正的链式推理,协议应该长什么样"的具体改进路径。建议至少给出一句"理想协议 = Task 1 错误时 Task 2 应该接到 error propagation signal 而不是被门控掉分"或类似的机制层建议。
  2. 数据规模质疑不够尖锐:600 个站点 / 600 个会话源,黑产链路本身五花八门(色情 / 赌博 / 诈骗 / 钓鱼 / 灰色金融),flyP 只点了"偏小" —— 但真正尖锐的质疑应该是:600 个站点对"垂直类型覆盖率"声称不够;Human-labeled 本地站点的标注信度如何?(论文 §3 提到 "human-labeled",但标注员人数、标注协议、inter-annotator agreement 都没披露);数据集是否公开?
  3. 作者机构信息提取失败:如 §1.2 所述,arxiv html §1 Introduction 顶部已经把 6 个机构全列了出来,§七第 6 项"机构归属待补查" 是错的 —— 这是 5 分钟工作量,不该留给下一棒。
  4. paper_card 编号推算高估:"1440+" 这个数字基于 9-18 1420 + 9-19/20/21 三天估算,按每日 +3 应该 ≈ 1429 左右,不是 1440+。今天(9-21)实际应该是 1428-1430 之间,建议改成"1429 左右(9-19/20/21 每日 +3 估算,实际待 cron_s2 核实)"。
  5. §6 Substack 引用层级混用:Aishwarya Srinivasan "Number One Security Risk in AI Agents" 引用了 OWASP agentic 报告 + 14 作者联合 paper —— 这两个都是行业信号/政策信号,但 flyP 在 §6 把它说成"行业媒体信号强",这种引用下游引用时容易混成"学术背书"。建议明确分级:① 学术背书 = 同行评审论文;② 行业信号 = OWASP / NIST 报告;③ 行业评论 = Substack / 公众号内容。Srinivasan 是 ③ 级别,OWASP 报告是 ② 级别,14 作者联合 paper 是 ① 级别(如果能找到 arXiv ID 的话)。
  6. HF Daily 排名信号缺乏来源标注:"9-21 早棒 #15 42▲ 新立标承接"是工作室内部信号(HF Daily 早棒 + multimodal 主轴筛选后),flyP 应在 §〇底部加一行"HF Daily 9-21 早棒 #15 来源:tom 9-21 09:00 早棒 + multimodal 主轴筛选",下游 cron 复用时知道数据源。
  7. §五 evaluation.md 归节路径含糊:"周主题 8+ 件饱和"闭合预备触发延展 —— 这句话虽然合规,但下游 cron 看到时不知道"周主题 8+ 件饱和"具体指哪 8 件。建议加一行"周主题 = v87+9 评估方法学 8+ 件:见 evaluation.md §2.x"(或者具体节号)。
  8. §七"已知未做"清单缺失:与 9-18 那篇 e1prep 一样,本文也没列"已知未做"边界 —— 比如未对 600 站点做垂直类型抽样核实、未对 judge 模型独立性做独立确认、未对 entry-gated 协议在 production deployment 上的可行性做评估,这些"已知未做"没集中说明。

3. 可读性 / 与最新进展的差距

3.1 可读性

  • 结构:8 节正文 + 〇事实卡片 + §〇头部备注 + §五归节路径 + §八本轮输出汇总,层级清晰,可消费。
  • 表格密度:〇事实卡片(10 项)+ §一 1.2 三层方法创新 + §三邻接关系 + §四可信度 6 维评分,4 张表覆盖了精读笔记的核心交付需求。
  • emoji 信号:⭐ 5 档 + ⚠️ 8 处 + ✅ 2 处 + ❌ 1 处(§一 P0 验证表),信号一致,可读性加分。
  • 可改进:§六 Substack 段引用层级需明确分级;§七第 6 项"机构待补查"是错误,应直接补上;§五 paper_card 编号估算高估。

3.2 与最新进展的差距

  • 本论文 arXiv v1 2026-09-15 提交,HF Daily 9-21 早棒承接(提交后 6 天),时效合格
  • 但 v2 (2026-09-17) 是否实际存在 / 是否仅"作者贡献/通信信息更新"未独立 arxiv abs 直查 —— 这条 P0 项本棒应做未做。
  • 与 R-Judge / Agent-SafetyBench / RiskWebWorld / ATBench 同周内的工作没有横向坐标(没去找 9-15 ~ 9-21 同期同类的 web agent safety 评测论文),这是短审稿的固有局限,可接受。
  • 立标稳定性预期 ⭐⭐⭐(3/5):flyP 自标"9-21 #15 42▲ 新立标,没有 prior 轨迹可参考",留给 9-22 早棒观察 —— 这个处理合理。

4. 可执行的修改建议

4.1 优先级 P0(必须在下一棒接力前完成)

  1. §七第 6 项"机构归属待补查"立刻补全:arxiv html §1 Introduction 顶部已列 6 个机构(Baidu / SmartFlowAI / People's Public Security University of China / Tsinghua / JD / Northeastern),把"待补查"改为"已核实 · 6 个机构:Baidu(主)/ SmartFlowAI / PPSUC / Tsinghua / JD Technology / Northeastern",并把作者 13 位与机构对应关系列全。
  2. 31.9% / 0.9% 这两个百分比给出精确出处:arxiv html §5 conclusion 只说 "frequent execution failures",精确百分比应在 §3 / §4 / 附录里的失败归因表;给出节号 + 表号 + 行号,或者注明"基于飞盘 13 模型 × 600 站点自算"。

4.2 优先级 P1(建议在下一棒同步任务完成)

  1. paper_card 编号估算修正:"1440+" 改成 "1429 左右(9-19/20/21 每日 +3 估算,实际待 cron_s2 核实)",或者直接写"待 cron_s2 入库核实(9-21 估算 ≈ 1429-1430)"。
  2. HF Daily 排名来源标注:在 §〇底部加一行"HF Daily 9-21 早棒 #15 · 42▲ · 来源:tom 9-21 09:00 早棒 multimodal 主轴筛选后立标承接",下游 cron 复用时知道数据源。
  3. §六 Substack 引用明确分级:把 Aishwarya Srinivasan 标注为"③ 行业评论级别",把 OWASP agentic 报告标注为"② 行业信号级别",把 14 作者联合 paper 标注为"① 学术背书级别(待找 arXiv ID)";不要把 ③ 当 ① 用。
  4. §五归节路径"周主题 8+ 件"加节号:把"周主题 8+ 件饱和"改成"周主题 8+ 件饱和(v87+9 评估方法学子轴 · 见 evaluation.md §2.x)",下游 cron 接手时知道具体节号。
  5. §一 1.2 第 3 条失败归因方法论价值加 1 句机制层建议:在 "对所有 web agent 评测都有方法论价值" 后加一句"理想改进路径:把 Task 1 错误时的 error propagation signal 显式建模,而不是直接被门控掉分"。
  6. §二 2.2 数据规模质疑加 3 条尖锐追问:① 600 站点的垂直类型覆盖率(色情 / 赌博 / 诈骗 / 钓鱼 / 灰色金融各占多少)?② Human-labeled 标注员人数 + inter-annotator agreement?③ 数据集是否公开(独立研究者能否下载)?这三条 5 分钟内可答完,大幅提升批判层说服力。
  7. 加 §九"已知未做"清单:明确列出本棒没做的核实动作(垂直类型覆盖率 / judge 模型独立性独立确认 / entry-gated 协议 production feasibility / 同周同类的 web agent safety 评测论文横向坐标 / 600 站点公开性),便于下一棒 cron_s2 接力时直接接续。

4.3 优先级 P2(可选优化)

  1. arXiv abs 一手直查:v2 是否实际存在 / 是否仅"作者贡献/通信信息更新",在 9-22 早棒前用 arxiv.org/abs/2609.16900 一行命令可盖戳。
  2. §二 2.5 主分类争议明确"为什么不入 multimodal 主分类":当前只点了"更接近 risk/agent 邻接级 + multimodal 邻接级",但没说"为什么不入 multimodal 主分类" —— 加一句"multimodal 主分类要求 = 视觉理解是任务核心而非辅助手段;RiskChainBench 视觉(VLM 读网页)是辅助工具,任务核心是文本混淆识别 + 风险判断"。
  3. §一 1.3 实验结果段加 1 句"为什么 Entry@1 高而 Full 重建低"的解读:GPT-5.4 Entry@1 = 95.22 但 Full = 66.06 / CER = 1.62,说明头部模型能正确指认入口但不擅长完整还原消息;这个 29 个百分点的差距是论文里隐含的"瓶颈不只是入口识别",flyP 应单独点出。

5. 与先前互评的纵向对比

  • 相比 9-18 那篇 e1prep(8 分):本文是单一论文精读,与 9-12 那篇 Think Before You Link 同类。两类任务的评分维度应该相同(事实准确性 / 深度 / 可读性 / 与最新进展差距)。
  • 事实准确性:9-12 13/15 完全命中(2 项措辞简化),本文 9 项完全命中(1 项 v2 待查 + 1 项 31.9%/0.9% 出处缺失 + 1 项机构信息提取失败)—— 略弱于 9-12(本文有 3 项问题 vs 9-12 的 2 项)。
  • 结构清晰度:本文 8 节正文 + 4 张表,与 9-12 的 6 节 + 3 张表持平,本文在跨棒位引入(§三邻接关系 + §五归节路径)上更强。
  • 深度:本文在 e2e 协议机制级批评(§二 2.3)和失败归因方法论价值(§一 1.2 第 3 条)上明显胜出 9-12(9-12 偏"摘要复述"+ 简化的方法学深度)。
  • 占位符密度:本文占位符很少(没有 v88 占位候选预备新增锚定实测触发 这种晦涩短语)—— 显著好于 9-12 / 9-18。
  • 下游可执行性:本文交付物 = 1 篇精读笔记 + 3 条归节路径(agent.md / risk.md / evaluation.md)+ 6 项后续验证动作,9-12 交付物 = GitHub-ready 草稿,本文对下游 cron 更友好(归节路径清晰)。
  • 整体:事实层略弱(机构信息提取失败 + 31.9%/0.9% 出处缺失)+ 深度层胜出(e2e 协议机制级批评)+ 占位符少 + 归节路径清晰,综合 8 分与 9-12 持平,但本文在"机制级批评"上明显胜出。

6. 结论

  • 质量分:8(三轴拆解清晰、批判层切中真实风险、跨棒位关系映射到位、占位符密度低;扣分在 31.9%/0.9% 出处缺失、机构信息提取失败、paper_card 编号估算高估、§六 Substack 引用层级混用、缺"已知未做"清单)
  • 是否建议接力棒直接采用:✅(实质内容可用,但建议按上面 P0 两条修改后再交付 cron_s2 入库;P1 七条在下一棒同步任务完成)
  • 下一轮评审重点:① 机构信息是否补全;② 31.9% / 0.9% 出处是否精确到节号 / 表号 / 复算方式;③ paper_card 编号估算是否修正;④ §六引用分级是否明确;⑤ §九"已知未做"清单是否建立;⑥ arxiv abs v2 是否独立直查。

工程落地与核查(Jay)

系统定位

本文评的是 flyP 对 RiskChainBench(arXiv:2609.16900)论文的 critical-read 轻量精读,属于「单一论文精读」类任务。核心交付物是:该论文是否值得入 organized/knowledge/agent.md 评测方法学子轴 + organized/knowledge/risk.md Agent Safety Benchmark 子轴 + organized/knowledge/evaluation.md 周主题饱和闭合预备。

实际系统怎么用

工作流节点: 1. 输入源消费:HF Daily 9-21 早棒 #15 42▲ 新立标 → flyP 9-21 09:50 开始精读 2. 三向独立验证:arxiv html v1 + HF Papers + papers.cool 对每条字段做交叉验证(本次 9 项完全命中 + 3 项 ⚠️/❌) 3. GitHub-ready 精读笔记输出:生成本文件 inbox/flyp/2026-09-21-0950-RiskChainBench-obfuscation-web-investigation-critical-read.md,供 cron_s2 入库 4. 立标池更新:RiskChainBench(主 risk/agent + 副 multimodal 邻接级 + 副 evaluation 方法学)→ 入 risk.md + agent.md + evaluation.md 三个主题页

系统依赖: - arXiv 论文 2609.16900:v1 已落地证据齐全,v2 是否实际存在待 arxiv abs 一手核实 - HF paper page 2609.16900:官方声明"Not yet a complete reproduction package" + GitHub repo mattheliu/riskchainbench-task1 + 私有镜像 leonliuzx/riskchainbench-task1(Task 2 评估器) - papers.cool 2609.16900:作者列表 13 人完全一致 + 6 个机构已列 - Substack Aishwarya Srinivasan:行业评论级别,引用 OWASP agentic 报告(行业信号)+ 14 作者联合 paper(学术背书,待找 arXiv ID)

坑位清单(P0–P2)

级别 说明 当前状态
P0 §七第 6 项"机构归属待补查"是错误 arxiv html §1 Introduction 顶部已列 6 个机构(Baidu / SmartFlowAI / PPSUC / Tsinghua / JD / Northeastern);5 分钟工作量即可补全 未落地
P0 31.9% / 0.9% 这两个百分比出处缺失 HF abstract 只说 "frequent execution failures",精确数字应在 §3 / §4 / 附录;必须给出节号 / 表号 / 行号,否则下游 cron 复核时要全 PDF 重扫 未落地
P1 paper_card 编号估算高估 "1440+" 基于 9-18 1420 + 9-19/20/21 每日 +3 估算,实际 ≈ 1429-1430 未修正
P1 HF Daily 排名来源未标注 "9-21 早棒 #15 42▲" 缺数据源标注(tom 9-21 09:00 早棒 multimodal 主轴筛选) 未补
P1 §六 Substack 引用层级混用 ③ 行业评论 / ② 行业信号 / ① 学术背书 三级应明确分级 未分级
P1 §五归节路径"周主题 8+ 件"加节号 下游 cron 接手时不知道具体节号 未补
P1 §二 2.2 数据规模质疑不够尖锐 应加 3 条追问(垂直类型覆盖率 / 标注员 IA / 数据集公开性) 未补
P1 缺 §九"已知未做"清单 5 类核实动作(垂直类型 / judge 独立性 / entry-gated production / 同类横向坐标 / 数据集公开)未声明边界 未解决
P2 arXiv abs v2 未一手直查 arxiv.org/abs/2609.16900 一行命令可盖戳 v2 是否实际存在 未核实
P2 §二 2.5 主分类争议应明确"为什么不入 multimodal 主分类" 应加一句"multimodal 主分类要求 = 视觉理解是任务核心而非辅助手段" 未补
P2 §一 1.3 加 1 句"为什么 Entry@1 高而 Full 重建低" GPT-5.4 Entry@1 = 95.22 但 Full = 66.06 / CER = 1.62,29 个百分点差距是论文里隐含的"瓶颈不只是入口识别" 未补

核查结论

本文是 flyP 9 月以来事实层相对稳 + 机制级批评较强 + 占位符密度低 的产出,9 项字段三向独立验证全部命中,批判层(§二 2.1 半闭源 / 2.3 e2e 协议模糊 / 2.4 judge 独立性 / 2.5 主分类争议)切中真实风险。主要工程风险是 2 项 P0(机构信息提取失败 + 31.9%/0.9% 出处缺失) —— 这两项 5 分钟内可补,补完后本文件可达 9 分质量。建议优先落地 P0 两条再交付 cron_s2 入库,P1 七条在下一棒同步任务完成。