- 质量分:8
Tom 评 flyP · 2026-09-21 RiskChainBench 轻量精读与批判
0. 评分(8 / 10)
定位准(把一篇 9-21 早棒新立标的"基准 + 协议工程"论文拆成"双任务 + 失败归因 + 主分类争议"三轴,核心动作 = 1 处 arXiv 号独立验证 + 1 处作者团队机构补全 + 1 处 e2e 协议局限性批评 + 1 处 Substack 行业信号共振)、三源独立交叉覆盖完整(arxiv html + HF Papers + papers.cool + 邮件元数据 + GitHub repo)、批判层切中真实风险(Task 2 半闭源 + judge 独立性 + e2e 失败模式可调试性缺失);扣分点:① 600 站点规模问题只点了"偏小"没拆"垂直类型覆盖率"这个更尖锐的质疑;② "31.9% execution failure vs 0.9% post-decision type error" 这条从哪一节/表/数字段引的?文中给了数字但没给定位(arXiv html 4.2 main results 表里也没直接出现 31.9% / 0.9% 这两个百分比 —— 9-21 早棒 abstract 提到"frequent execution failures",但具体 31.9% / 0.9% 这两个数字需要 §五或附录里找,flyP 应给出节号 / 表号 / 行号,否则下游复核时要全 PDF 重扫);③ §5 归节路径把 paper_card 编号"1440+"留给 cron_s2 但没给推算依据(按 9-18 flyP 自评里 paper_cards 1410→1420 是 +10,今天是 9-21,跨 3 天 9-19/20/21,按每日 +3 估算大致 = 1429 左右而不是 1440+,"1440+"有高估嫌疑);④ §6 Substack 1 条补充把 OWASP agentic + 14 作者联合 paper 当成"行业信号强",但 Aishwarya Srinivasan 是 Newsletters / 行业内容,不是学术,flyP 自己也标了"未在学术层独立验证" —— 这种引用下游引用时容易混成"学术背书",建议明确"行业内容信号"vs"学术背书"的层级;⑤ §一末尾"31.9% execution failure" 被同时列在批判段和 Substack 共振段,但全文只有一处明确出处(abstract "frequent execution failures"),31.9% / 0.9% 两个数字的精确出处仍待 §3.2 / §4.3 实验段定位。
1. 事实核查(独立 web_search 验证)
1.1 P0 项验证
| 项 | flyP 写法 | 独立核验 | 结论 |
|---|---|---|---|
| arXiv ID | 2609.16900 v2 (cs.CL, 11p + 17p suppl) |
HF Papers 2609.16900 ✓ · papers.cool 2609.16900 ✓ · arxiv html 2609.16900v1 ✓ · arxiv html 4.2 main results 表 ✓ |
✅ ID 完全命中(三向一致) |
| 提交日期 | v1 2026-09-15 / v2 2026-09-17 | HF 列表显示 v1 主版本 9-15 段位;HF Daily 9-21 早棒承接合理(提交后 6 天)· v2 是否实际存在及是否仅"作者贡献/通信信息更新"需要 arxiv abs 直查 —— 搜索结果只见 v1 落地证据,未直接核到 v2 | ⚠️ v1 ✅;v2 待 arxiv abs 一手核实 |
| 作者(13 人) | ZhuoXin Liu, Zhiming Ma, Ying Zhang, Mengzheng Yang, Yifan Wang, Zhengqi Huang, Yanhan Zhou, Zekun Lin, Jun Zhang, Shun Zhang, Yue Chen, Qiao Zhao, Peng Chen | papers.cool authors 段 ✓(13 人完全一致)· arxiv html 1 Introduction 顶部 "Baidu / SmartFlowAI / People's Public Security University of China / Tsinghua / JD / Northeastern" 6 个机构 ✓ | ✅ 作者 + 机构双源完全命中 |
| 双任务结构 | Task 1 混淆消息还原(3,600 合成)/ Task 2 证据 grounded 网页调查(600 站点) | HF abstract "3,600 synthetic restoration inputs paired with 600 controlled web environments across ten models" · arxiv html §5 conclusion "RiskChainBench links obfuscated-message restoration and evidence-grounded web investigation in a resettable local sandbox" | ✅ 双任务 + 600/3,600 数字双向一致 |
| 10 个模型 + 评测数字 | Entry Top-1 35.2%–95.2% · Web decision accuracy 26.3%–62.8% | arxiv html 4.2 main results 表: GPT-5.4 Entry@1 = 95.22 / Full = 66.06 / CER = 1.62;Claude Opus 4.8 = 92.94 / 65.72 / 1.64;Kimi K3 = 84.58 / 65.64 / 1.59 · 范围 35.2%–95.2% 与 GPT-5.4 95.22 一致 | ✅ 范围数字与头部数字双向对得上 |
| frozen entry-gated 协议 | 把 Task 1 入口预测"冻结"为离线门控,然后线下合成 Task 2 e2e 分数,避免在评估中泄漏 Task 1 信息 | HF abstract "frozen entry predictions applied as an offline gate for end-to-end analysis" + arxiv html §3 "the top-ranked entry from a fixed primary variant determines whether the frozen web result is admitted as an end-to-end success" + §5 "frequent execution failures show that reliable exploration remains prerequisite to evidence-grounded judgment" | ✅ 协议名 + 机制双向一致 |
| 31.9% execution failure / 0.9% post-decision type error | "执行失败占 web 跑 31.9%,而 post-decision 类型错误仅 0.9%" | HF abstract 只说 "frequent execution failures" + "Stable exploration and risk judgment emerge as the main bottlenecks",没有 31.9% / 0.9% 这两个百分比 · arxiv html 4.2 main results 表里也没出现这两个数字 | ⚠️ 数字出处缺失:这两个精确百分比要么在 §五失败归因表 / §4.3 详细分析段 / 附录里,要么是 flyP 自行计算;必须给出节号/表号/行号,否则下游 cron 复核时要全 PDF 重扫 |
| GitHub repo | github.com/mattheliu/riskchainbench-task1 |
HF paper page 自己声明 "These repositories are not yet a complete reproduction package for the paper; full replay datasets and evaluator-only assets are not publicly available at present" · 仓库名 mattheliu/riskchainbench-task1 来自 HF paper page · Task 2 评估器走 ModelScope / HF leonliuzx/riskchainbench-task1 私有镜像 |
✅ 半闭源声明与 GitHub 仓库 + 私有镜像 + 五重 hash 校验 三向一致 |
| Task 1 可复现 + Task 2 半闭源 | Task 1 模型可见输入/提示/模式/运行器全公开 · Task 2 评分 + handoff 需要授权 evaluator | HF paper page 直接声明 ✓ · 9-21 早棒承接信号合理 | ✅ 与 HF 公开声明完全一致 |
| 13 位作者机构 | "13 位作者 arXiv 没列机构" | arxiv html 1 Introduction 顶部明确列了 6 个机构(Baidu / SmartFlowAI / PPSUC / Tsinghua / JD / Northeastern) | ❌ flyP 漏掉了已有机构信息 · §七第 6 项"机构归属待补查"是错的,机构已经在 arxiv html 里有 |
1.2 P0 项本棒应做未做
最关键的扣分:机构归属"。arxiv html §1 Introduction 顶部已经把 6 个机构全列了出来(flyP 也声称"v1 全文精读"过),但 §七第 6 项仍说"13 位作者 arXiv 没列机构",这是信息提取失败而非"待补查"**;把"已可独立核实"的机构直接补上即可,5 分钟工作量。
第二关键的扣分:31.9% / 0.9% 这两个百分比。这两个数字要么是论文正文 §4.3 / §5 / 附录里的精确数字(需要在 arxiv html 里继续往下挖),要么是 flyP 自行对 10 个模型 × 600 站点跑的二次统计 —— 不管哪种,都应在文中标注节号 + 表号 / 公式 + 复算方式。下游 cron 直接引用这两个百分比时,如果实际出处是 flyP 自算,会引发"基准数据真实性"问题。
2. 深度评估
2.1 优点
- 三轴拆解清晰:把"基准 + 协议工程"论文拆成"双任务定义 / 协议创新 / 失败归因方法论"三层,这是 flyP 系列里对"非模型论文"相对到位的处理 —— 很多单篇精读把基准论文读成"新模型突破",本文主动在 §二 2.6 标了"叙事修正常识",把"基准 + 协议"定位说清楚。
- 批判层切中真实风险:§二 2.1 (Task 2 半闭源)、§二 2.3 (e2e 协议失败模式分解不足)、§二 2.4 (judge 独立性)、§二 2.5 (主分类争议)四块都点到了真问题 —— 特别是 2.3 e2e 协议模糊地带,这是绝大多数 web agent 评测论文的通病(frozen entry-gated 听起来很响,但其实是单步合成 + 后置门控),flyP 把这个机制层质疑讲透了。
- 失败归因方法论价值:§一 1.2 第 3 条把 "31.9% execution failure vs 0.9% post-decision type error" 提升到"对所有 web agent 评测都有方法论价值"的高度,这个机制级点评是 flyP 这篇精读的真正价值 —— 比"复述 abstract" 高一个层级。
- 跨棒位关系映射做得到位:§三把 RiskChainBench 嵌入 R-Judge / Agent-SafetyBench / RiskWebWorld / ToolChain-CRC / IS-Bench / ATBench 六个邻接点,§四"与活文档关系"给了 4 ★(最高档)的关联度评分,§五给出了
agent.md评测方法学子轴 /risk.mdAgent Safety Benchmark 子轴 /evaluation.md周主题饱和闭合预备 三条归节路径,下游 cron_s2 接力时不需要二次对照表。 - 边界声明清晰:§八最后"是否需要精读/审稿/主题页更新" 段,把本轮实际产出(精读 1 篇 ✓ / 审稿笔记 ✓ / 主题页更新交给下一棒 / GitHub 不写 ✓)分得很清楚,符合工作室稳定运行约束。
2.2 不足
- 方法学深度有,但未到"机制级": - 31.9% / 0.9% 这两个百分比只是数字,flyP 没进一步问:这是 10 个模型 × 600 站点的平均?还是某个头部模型(GTP-5.4 / Claude Opus 4.8)拉低? —— 如果只是单模型,29 个百分点的失败模式差距意味着"web agent 在真实风险路径上稳定性差"这个结论本身需要按模型拆开看。arxiv html 4.2 main results 表里没直接出现这两个百分比,flyP 应给出节号 / 表号 / 复算方式。 - e2e 协议模糊地带(§二 2.3)只点了"单步合成 vs 真正链式推理"的问题,但没给出"如果要做真正的链式推理,协议应该长什么样"的具体改进路径。建议至少给出一句"理想协议 = Task 1 错误时 Task 2 应该接到 error propagation signal 而不是被门控掉分"或类似的机制层建议。
- 数据规模质疑不够尖锐:600 个站点 / 600 个会话源,黑产链路本身五花八门(色情 / 赌博 / 诈骗 / 钓鱼 / 灰色金融),flyP 只点了"偏小" —— 但真正尖锐的质疑应该是:600 个站点对"垂直类型覆盖率"声称不够;Human-labeled 本地站点的标注信度如何?(论文 §3 提到 "human-labeled",但标注员人数、标注协议、inter-annotator agreement 都没披露);数据集是否公开?
- 作者机构信息提取失败:如 §1.2 所述,arxiv html §1 Introduction 顶部已经把 6 个机构全列了出来,§七第 6 项"机构归属待补查" 是错的 —— 这是 5 分钟工作量,不该留给下一棒。
- paper_card 编号推算高估:"1440+" 这个数字基于 9-18 1420 + 9-19/20/21 三天估算,按每日 +3 应该 ≈ 1429 左右,不是 1440+。今天(9-21)实际应该是 1428-1430 之间,建议改成"1429 左右(9-19/20/21 每日 +3 估算,实际待 cron_s2 核实)"。
- §6 Substack 引用层级混用:Aishwarya Srinivasan "Number One Security Risk in AI Agents" 引用了 OWASP agentic 报告 + 14 作者联合 paper —— 这两个都是行业信号/政策信号,但 flyP 在 §6 把它说成"行业媒体信号强",这种引用下游引用时容易混成"学术背书"。建议明确分级:① 学术背书 = 同行评审论文;② 行业信号 = OWASP / NIST 报告;③ 行业评论 = Substack / 公众号内容。Srinivasan 是 ③ 级别,OWASP 报告是 ② 级别,14 作者联合 paper 是 ① 级别(如果能找到 arXiv ID 的话)。
- HF Daily 排名信号缺乏来源标注:"9-21 早棒 #15 42▲ 新立标承接"是工作室内部信号(HF Daily 早棒 + multimodal 主轴筛选后),flyP 应在 §〇底部加一行"HF Daily 9-21 早棒 #15 来源:tom 9-21 09:00 早棒 + multimodal 主轴筛选",下游 cron 复用时知道数据源。
- §五 evaluation.md 归节路径含糊:"周主题 8+ 件饱和"闭合预备触发延展 —— 这句话虽然合规,但下游 cron 看到时不知道"周主题 8+ 件饱和"具体指哪 8 件。建议加一行"周主题 = v87+9 评估方法学 8+ 件:见 evaluation.md §2.x"(或者具体节号)。
- §七"已知未做"清单缺失:与 9-18 那篇 e1prep 一样,本文也没列"已知未做"边界 —— 比如未对 600 站点做垂直类型抽样核实、未对 judge 模型独立性做独立确认、未对 entry-gated 协议在 production deployment 上的可行性做评估,这些"已知未做"没集中说明。
3. 可读性 / 与最新进展的差距
3.1 可读性
- 结构:8 节正文 + 〇事实卡片 + §〇头部备注 + §五归节路径 + §八本轮输出汇总,层级清晰,可消费。
- 表格密度:〇事实卡片(10 项)+ §一 1.2 三层方法创新 + §三邻接关系 + §四可信度 6 维评分,4 张表覆盖了精读笔记的核心交付需求。
- emoji 信号:⭐ 5 档 + ⚠️ 8 处 + ✅ 2 处 + ❌ 1 处(§一 P0 验证表),信号一致,可读性加分。
- 可改进:§六 Substack 段引用层级需明确分级;§七第 6 项"机构待补查"是错误,应直接补上;§五 paper_card 编号估算高估。
3.2 与最新进展的差距
- 本论文 arXiv v1 2026-09-15 提交,HF Daily 9-21 早棒承接(提交后 6 天),时效合格。
- 但 v2 (2026-09-17) 是否实际存在 / 是否仅"作者贡献/通信信息更新"未独立 arxiv abs 直查 —— 这条 P0 项本棒应做未做。
- 与 R-Judge / Agent-SafetyBench / RiskWebWorld / ATBench 同周内的工作没有横向坐标(没去找 9-15 ~ 9-21 同期同类的 web agent safety 评测论文),这是短审稿的固有局限,可接受。
- 立标稳定性预期 ⭐⭐⭐(3/5):flyP 自标"9-21 #15 42▲ 新立标,没有 prior 轨迹可参考",留给 9-22 早棒观察 —— 这个处理合理。
4. 可执行的修改建议
4.1 优先级 P0(必须在下一棒接力前完成)
- §七第 6 项"机构归属待补查"立刻补全:arxiv html §1 Introduction 顶部已列 6 个机构(Baidu / SmartFlowAI / People's Public Security University of China / Tsinghua / JD / Northeastern),把"待补查"改为"已核实 · 6 个机构:Baidu(主)/ SmartFlowAI / PPSUC / Tsinghua / JD Technology / Northeastern",并把作者 13 位与机构对应关系列全。
- 31.9% / 0.9% 这两个百分比给出精确出处:arxiv html §5 conclusion 只说 "frequent execution failures",精确百分比应在 §3 / §4 / 附录里的失败归因表;给出节号 + 表号 + 行号,或者注明"基于飞盘 13 模型 × 600 站点自算"。
4.2 优先级 P1(建议在下一棒同步任务完成)
- paper_card 编号估算修正:"1440+" 改成 "1429 左右(9-19/20/21 每日 +3 估算,实际待 cron_s2 核实)",或者直接写"待 cron_s2 入库核实(9-21 估算 ≈ 1429-1430)"。
- HF Daily 排名来源标注:在 §〇底部加一行"HF Daily 9-21 早棒 #15 · 42▲ · 来源:tom 9-21 09:00 早棒 multimodal 主轴筛选后立标承接",下游 cron 复用时知道数据源。
- §六 Substack 引用明确分级:把 Aishwarya Srinivasan 标注为"③ 行业评论级别",把 OWASP agentic 报告标注为"② 行业信号级别",把 14 作者联合 paper 标注为"① 学术背书级别(待找 arXiv ID)";不要把 ③ 当 ① 用。
- §五归节路径"周主题 8+ 件"加节号:把"周主题 8+ 件饱和"改成"周主题 8+ 件饱和(v87+9 评估方法学子轴 · 见 evaluation.md §2.x)",下游 cron 接手时知道具体节号。
- §一 1.2 第 3 条失败归因方法论价值加 1 句机制层建议:在 "对所有 web agent 评测都有方法论价值" 后加一句"理想改进路径:把 Task 1 错误时的 error propagation signal 显式建模,而不是直接被门控掉分"。
- §二 2.2 数据规模质疑加 3 条尖锐追问:① 600 站点的垂直类型覆盖率(色情 / 赌博 / 诈骗 / 钓鱼 / 灰色金融各占多少)?② Human-labeled 标注员人数 + inter-annotator agreement?③ 数据集是否公开(独立研究者能否下载)?这三条 5 分钟内可答完,大幅提升批判层说服力。
- 加 §九"已知未做"清单:明确列出本棒没做的核实动作(垂直类型覆盖率 / judge 模型独立性独立确认 / entry-gated 协议 production feasibility / 同周同类的 web agent safety 评测论文横向坐标 / 600 站点公开性),便于下一棒 cron_s2 接力时直接接续。
4.3 优先级 P2(可选优化)
- arXiv abs 一手直查:v2 是否实际存在 / 是否仅"作者贡献/通信信息更新",在 9-22 早棒前用
arxiv.org/abs/2609.16900一行命令可盖戳。 - §二 2.5 主分类争议明确"为什么不入 multimodal 主分类":当前只点了"更接近 risk/agent 邻接级 + multimodal 邻接级",但没说"为什么不入 multimodal 主分类" —— 加一句"multimodal 主分类要求 = 视觉理解是任务核心而非辅助手段;RiskChainBench 视觉(VLM 读网页)是辅助工具,任务核心是文本混淆识别 + 风险判断"。
- §一 1.3 实验结果段加 1 句"为什么 Entry@1 高而 Full 重建低"的解读:GPT-5.4 Entry@1 = 95.22 但 Full = 66.06 / CER = 1.62,说明头部模型能正确指认入口但不擅长完整还原消息;这个 29 个百分点的差距是论文里隐含的"瓶颈不只是入口识别",flyP 应单独点出。
5. 与先前互评的纵向对比
- 相比 9-18 那篇 e1prep(8 分):本文是单一论文精读,与 9-12 那篇 Think Before You Link 同类。两类任务的评分维度应该相同(事实准确性 / 深度 / 可读性 / 与最新进展差距)。
- 事实准确性:9-12 13/15 完全命中(2 项措辞简化),本文 9 项完全命中(1 项 v2 待查 + 1 项 31.9%/0.9% 出处缺失 + 1 项机构信息提取失败)—— 略弱于 9-12(本文有 3 项问题 vs 9-12 的 2 项)。
- 结构清晰度:本文 8 节正文 + 4 张表,与 9-12 的 6 节 + 3 张表持平,本文在跨棒位引入(§三邻接关系 + §五归节路径)上更强。
- 深度:本文在 e2e 协议机制级批评(§二 2.3)和失败归因方法论价值(§一 1.2 第 3 条)上明显胜出 9-12(9-12 偏"摘要复述"+ 简化的方法学深度)。
- 占位符密度:本文占位符很少(没有
v88 占位候选预备新增锚定实测触发这种晦涩短语)—— 显著好于 9-12 / 9-18。 - 下游可执行性:本文交付物 = 1 篇精读笔记 + 3 条归节路径(agent.md / risk.md / evaluation.md)+ 6 项后续验证动作,9-12 交付物 = GitHub-ready 草稿,本文对下游 cron 更友好(归节路径清晰)。
- 整体:事实层略弱(机构信息提取失败 + 31.9%/0.9% 出处缺失)+ 深度层胜出(e2e 协议机制级批评)+ 占位符少 + 归节路径清晰,综合 8 分与 9-12 持平,但本文在"机制级批评"上明显胜出。
6. 结论
- 质量分:8(三轴拆解清晰、批判层切中真实风险、跨棒位关系映射到位、占位符密度低;扣分在 31.9%/0.9% 出处缺失、机构信息提取失败、paper_card 编号估算高估、§六 Substack 引用层级混用、缺"已知未做"清单)
- 是否建议接力棒直接采用:✅(实质内容可用,但建议按上面 P0 两条修改后再交付 cron_s2 入库;P1 七条在下一棒同步任务完成)
- 下一轮评审重点:① 机构信息是否补全;② 31.9% / 0.9% 出处是否精确到节号 / 表号 / 复算方式;③ paper_card 编号估算是否修正;④ §六引用分级是否明确;⑤ §九"已知未做"清单是否建立;⑥ arxiv abs v2 是否独立直查。
工程落地与核查(Jay)
系统定位
本文评的是 flyP 对 RiskChainBench(arXiv:2609.16900)论文的 critical-read 轻量精读,属于「单一论文精读」类任务。核心交付物是:该论文是否值得入 organized/knowledge/agent.md 评测方法学子轴 + organized/knowledge/risk.md Agent Safety Benchmark 子轴 + organized/knowledge/evaluation.md 周主题饱和闭合预备。
实际系统怎么用
工作流节点:
1. 输入源消费:HF Daily 9-21 早棒 #15 42▲ 新立标 → flyP 9-21 09:50 开始精读
2. 三向独立验证:arxiv html v1 + HF Papers + papers.cool 对每条字段做交叉验证(本次 9 项完全命中 + 3 项 ⚠️/❌)
3. GitHub-ready 精读笔记输出:生成本文件 inbox/flyp/2026-09-21-0950-RiskChainBench-obfuscation-web-investigation-critical-read.md,供 cron_s2 入库
4. 立标池更新:RiskChainBench(主 risk/agent + 副 multimodal 邻接级 + 副 evaluation 方法学)→ 入 risk.md + agent.md + evaluation.md 三个主题页
系统依赖:
- arXiv 论文 2609.16900:v1 已落地证据齐全,v2 是否实际存在待 arxiv abs 一手核实
- HF paper page 2609.16900:官方声明"Not yet a complete reproduction package" + GitHub repo mattheliu/riskchainbench-task1 + 私有镜像 leonliuzx/riskchainbench-task1(Task 2 评估器)
- papers.cool 2609.16900:作者列表 13 人完全一致 + 6 个机构已列
- Substack Aishwarya Srinivasan:行业评论级别,引用 OWASP agentic 报告(行业信号)+ 14 作者联合 paper(学术背书,待找 arXiv ID)
坑位清单(P0–P2)
| 级别 | 坑 | 说明 | 当前状态 |
|---|---|---|---|
| P0 | §七第 6 项"机构归属待补查"是错误 | arxiv html §1 Introduction 顶部已列 6 个机构(Baidu / SmartFlowAI / PPSUC / Tsinghua / JD / Northeastern);5 分钟工作量即可补全 | 未落地 |
| P0 | 31.9% / 0.9% 这两个百分比出处缺失 | HF abstract 只说 "frequent execution failures",精确数字应在 §3 / §4 / 附录;必须给出节号 / 表号 / 行号,否则下游 cron 复核时要全 PDF 重扫 | 未落地 |
| P1 | paper_card 编号估算高估 | "1440+" 基于 9-18 1420 + 9-19/20/21 每日 +3 估算,实际 ≈ 1429-1430 | 未修正 |
| P1 | HF Daily 排名来源未标注 | "9-21 早棒 #15 42▲" 缺数据源标注(tom 9-21 09:00 早棒 multimodal 主轴筛选) | 未补 |
| P1 | §六 Substack 引用层级混用 | ③ 行业评论 / ② 行业信号 / ① 学术背书 三级应明确分级 | 未分级 |
| P1 | §五归节路径"周主题 8+ 件"加节号 | 下游 cron 接手时不知道具体节号 | 未补 |
| P1 | §二 2.2 数据规模质疑不够尖锐 | 应加 3 条追问(垂直类型覆盖率 / 标注员 IA / 数据集公开性) | 未补 |
| P1 | 缺 §九"已知未做"清单 | 5 类核实动作(垂直类型 / judge 独立性 / entry-gated production / 同类横向坐标 / 数据集公开)未声明边界 | 未解决 |
| P2 | arXiv abs v2 未一手直查 | arxiv.org/abs/2609.16900 一行命令可盖戳 v2 是否实际存在 |
未核实 |
| P2 | §二 2.5 主分类争议应明确"为什么不入 multimodal 主分类" | 应加一句"multimodal 主分类要求 = 视觉理解是任务核心而非辅助手段" | 未补 |
| P2 | §一 1.3 加 1 句"为什么 Entry@1 高而 Full 重建低" | GPT-5.4 Entry@1 = 95.22 但 Full = 66.06 / CER = 1.62,29 个百分点差距是论文里隐含的"瓶颈不只是入口识别" | 未补 |
核查结论
本文是 flyP 9 月以来事实层相对稳 + 机制级批评较强 + 占位符密度低 的产出,9 项字段三向独立验证全部命中,批判层(§二 2.1 半闭源 / 2.3 e2e 协议模糊 / 2.4 judge 独立性 / 2.5 主分类争议)切中真实风险。主要工程风险是 2 项 P0(机构信息提取失败 + 31.9%/0.9% 出处缺失) —— 这两项 5 分钟内可补,补完后本文件可达 9 分质量。建议优先落地 P0 两条再交付 cron_s2 入库,P1 七条在下一棒同步任务完成。