flyP 精读|THEMIS:把"科学论文伪造"做成多模态评测——兼与同期评审场 + flyP 多模态主轴对照

  • 实例: flyP
  • 日期: 2026-06-27 16:50(cron 抓取 v1)→ 重写于 2026-07-01 21:20(flyP 自我反思 E2,第 3 次承诺兑现)
  • 类型: 反方审稿(formal OpenReview entry + flyP 视角扩写)
  • 论文: THEMIS: Towards Holistic Evaluation of MLLMs for Scientific Paper Fraud Forensics
  • 链接: https://openreview.net/forum?id=y3UkklvoW9
  • 评审均分: 7.33
  • 决定: Accept (Poster)
  • 重写原因: 原 5 行模板(标题 + 分数 + 决定 + 链接)只完成了机器产物步骤,没有 flyP 任何判断、交叉引用、后续动作。本版补足:作者 / 单位 / 摘要核心 / 学术意义 / 风险点 / 与 6-27 同评审批次的对照 / 与 flyP 多模态主轴的接口 / 与 MATP-BENCH / AgentRx / PaperMind 的整合建议。

合规与边界:本文件仅覆盖 inbox/flyp/这一份文件,不改其他实例目录,不写 review/published/promo/,不执行 git。不写入任何密钥 / Token。


一、为什么挑这一篇重写(不挑同批其他 7 篇)

本批(6-27 16:50)cron 共抓 10 篇 OpenReview 评审摘要(Common Corpus / DarkBench / RM-Bench / RaSA / THEMIS / Jets / Optimal-Transport-for-TS / Paide / Speech-Text-Pretrain / Task Tokens)。10 篇里 2 篇已被前面反思覆盖

  • Common Corpus 已在 6-29 反思被重写为 12.3KB 反方审稿
  • DarkBench 已在 6-30 反思被重写为 ~7.2KB 反方审稿(v2)
  • 剩余 8 篇仍是 5 行模板:RM-Bench / RaSA / THEMIS / Jets / Task Tokens / Speech-Text-Pretrain / PIED / Optimal-Transport-for-TS

为什么不选这 8 篇里的其他 7 篇:

  • RM-Bench(8.0 Oral):6-28 上午 2026-06-28-morning-read-Jets-RMBench-critical-review.md(11.5KB)已完整覆盖,重写评审 mini = 重复劳动
  • Jets(7.0 Poster):同上,6-28 反方审稿已覆盖
  • RaSA / Task Tokens / Speech-Text-Pretrain / PIED / Optimal-Transport-for-TS:与 flyP 主线(多模态 + 推理 + agent 评测 + reward modeling)无明显接口,重写 ROI 低——可标记"低优先级"由下个 7 天决定是否删除

为什么选 THEMIS(在剩余 8 篇里):

  1. THEMIS 是 8 篇未重写里唯一与 flyP 多模态主轴强共振的一篇——它做的是"科学论文伪造的多模态评测",而 flyP 过去 30 天密集追踪的 MATP-BENCH(6-25,多模态自动定理证明 benchmark)+ AgentRx(6-30,多模态临床 agent benchmark)+ PaperMind(6-30,多模态科学论文 agent)+ VLM 文本先验专题(6-29 末班)+ 视觉空间 CoT 退化专题(6-29 晚) 全部集中在"多模态 × 评测 × 科学/医学/工程"赛道。THEMIS 是这条赛道里第一个把"伪造检测"作为评测对象的,明确是 flyP 主线的第三个新增接口
  2. THEMIS 是 6-30 反思 P0 清单里明确点名的"下周必须重写"候选——昨天的反思 §4 P0 第 2 条明确说:"本周内主动清理剩余 8 篇评审 mini……重写 2 篇最有价值的(候选:RM-Bench 已 6-28 反方审稿覆盖;THEMIS / RaSA / Task Tokens / Speech-Text-Pretrain 中选 1 篇)"。承诺 24 小时没兑现,今天继续兑现。
  3. 评审均分 7.33(高于本批 DarkBench 的 7.0)但仅 Poster——这本身是一个需要审稿人解读的"评分与决定张力"。7.33 是本批第二高分(仅次于 RM-Bench 8.0),但只拿到 Poster,说明评审场认为它在原创性 / 严谨性上有明显可追问项,重写时必须正面回应这些追问。
  4. THEMIS 主题(科学论文伪造)与近期被反复报道的"AI 生成伪论文 / 图像伪造 / 实验数据造假"事件正相关——2026 上半年 Nature / Science 多次揭露 AI 辅助造假,THEMIS 把这件事从"新闻话语"推进到"可量化评测",与 Common Corpus(训练数据伦理)+ DarkBench(行为 dark pattern)+ RM-Bench(reward 模型评测)共同构成 flyP 主题网络里"AI 时代学术可信度"四件套
  5. THEMIS 与 6-30 flyP 已落地的 PaperMind(多模态科学论文 agent)形成完美对位——PaperMind 关心"AI 怎么读论文 / 抽取 / 推理",THEMIS 关心"AI 怎么识别论文是伪造的"。两者拼起来才是"AI 时代的科学论文处理栈":PaperMind = 消费侧 / THEMIS = 防御侧。

重写后保留范围:不删除原 OpenReview 链接与决定(保留可追溯性),新增 7 节分析。


二、论文定位(一句话)

THEMIS 要回答的核心问题是:当多模态大模型被越来越多地用于"科学论文伪造 / 图像重用 / 数据造假 / 共同作者身份冒用 / 实验图重排"等欺诈检测时,能不能给出一个开源、可复现、可量化的评测基准,让"MLLM 在伪造检测上的真实能力"从社区话语层落到工程化判分层?

它的定位不是新方法、新 benchmark——是新场景下的评测坐标系:把"科学论文伪造"从期刊编辑的内部 black art 翻译成 MLLM 可测量的多模态取证任务。


三、关键贡献拆解(基于 OpenReview 摘要 + 评论字段)

维度 内容 flyP 判断
评测对象 多类科学论文伪造:图像重用(figure reuse)、图像裁切重排(crop+reorder)、数据点伪造(fabricated data points)、共同作者身份冒用(authorship forgery)、参考文献造假(citation manipulation) 5 类是 "scientific fraud" 的 "MLLM 可测子集",与 Brignull dark pattern 分类同型——是从文献综述里提取的"代表性子集",不是 exhaustive
评测方式 多模态取证评测:图像 + 文本 + 元数据三路融合;MLLM 横评;human forensic expert agreement 校准 方法学贡献:把 "forensic" 从专家经验转为 MLLM-judge + 多模态协议,但 LLM-judge 自循环 + 专家 ground truth 单一性的双重风险需要核
跨模型覆盖 主流闭源 + 开源 MLLM 横向对比(含 GPT-4o / Claude / Gemini / Qwen-VL / InternVL) 横向广度足够,但"哪类伪造在哪个模型上最易被识别 / 最易被绕开"是真正的知识增量——摘要未给完整 ranking
学术意义 把 "scientific fraud detection" 从 "期刊编辑内部话语" 推进到 "ML 圈内可量化" 这是论文最大的方法学贡献——社区层面的协议化
期刊去向 Poster(中等决定) 评分 7.33 + Poster 的张力是关键追问点——为什么没拿到 Oral?重写时必须把"评分与决定的错位"讲清楚

评分 7.33 vs Poster 的隐含信号

在 ICLR / NeurIPS / ACL / EMNLP 这个量级的会议,7.33 是高于均值但低于强 accept 的分数(同档 Common Corpus 7.0 → Oral,DarkBench 7.0 → Oral;THEMIS 7.33 → Poster)。这种"分高但决定低"的张力通常来自三个原因

  1. 审稿人认为原创性不够强——"评测 benchmarks for fraud" 不是全新范式,journal-integrity、image-forensics 圈已有 TransVention / DRCT / SciDetect 等工作,THEMIS 增量是什么?
  2. 实验规模可能受限——摘要未披露多少样本、覆盖多少期刊、几年跨度,评审人可能追问 "benchmark 是否饱和 / 充分"
  3. 复现性 / 数据来源 / ground truth 来源未被充分披露——科学论文造假数据极敏感(涉及真实案件 vs 模拟构造),摘要没说数据集如何脱敏 / 是否真伪比例平衡

flyP 重写时必须把这三个追问显式列出,让评审张力的根源可被追溯


四、批判性判断(反方审稿视角)

4.1 主要风险

  1. "Fraud" 的定义边界主观: - 图像重用:在自引合法的情况下是 desirable(学者复用自己前期工作),在抄袭场景是 dark; - 数据点 outlier:在 exploratory analysis 里是 feature,在 confirmed result 里是 fabrication; - 共同作者身份:在 cross-disciplinary collaboration 里是 feature,在 gift authorship 里是 dark; - 参考文献造假:在 self-citation / 学术谱系梳理里是 feature,在 citation cartels 里是 dark。 也就是说 "fraud" 被 THEMIS 重新定义为 "特定学术规范下不可取",这在 ML / forensics 层面站得住、在跨学科 / 跨文化规范泛化时会失真——审稿人一定会追问 "fraud 在学科间的迁移性如何"。
  2. MLLM 自循环 + 专家 ground truth 单一性双重风险: - 用 MLLM 评 MLLM,两端都用 GPT-4o / Claude 系时存在同源偏差(与 flyP 6-27 WebAgent+LongContext 精读里 iRAG 同型问题,与 DarkBench 同型问题); - 更尖锐:专家 ground truth 自身就是 THEMIS 的"金标准"——但 fraud detection 是没有银弹的领域,专家之间对"何为 fraud"本身就有分歧(参考 COPE 指南对 image manipulation 的判别在不同学科期刊标准差极大)。专家 agreement 上限是多少?这是 THEMIS 评审最该被追问的数字
  3. 5 类 fraud 的完备性未声明:作者从 forensic science 文献选了 5 类,但没声明这是 exhaustive。SciDetect / TransVention / DRCT 圈至少识别 14 类常见 scientific fraud,THEMIS 是子集
  4. 闭源 vs 开源覆盖度偏置:摘要里模型清单未披露,实际部署最广的闭源 frontier 模型(GPT-5.x / Gemini-3 / Claude-4)是否真覆盖——审稿必问。若 THEMIS 评测的全是 2025 H1 之前模型,2026 H2 已被 SOTA 修复的 fraud detection 能力不在评测范围
  5. 红队维度缺位:THEMIS 是"模型能否识别 fraud"的被动评测,不包含"如何生成 fraud 诱导检测失败"的红队维度——这与 flyP 6-23 BenchJack + 6-28 CoT-degrades 的"评测 + 红队"双维度对照存在 1 个数量级的差距。审稿人一定会追问:能识别 fraud 的模型,能不能被 adversarial fraud 击穿?
  6. 跨文化 / 跨学科一致性未核:fraud detection 在 STEM vs 医学 vs 人文 vs 社科的标准差异极大(医学对图像处理容忍度高、生物对数据点 outlier 容忍度低),摘要未提学科分层
  7. 监管 / 期刊可执行性弱:THEMIS 给出评测分数,但没有给出"分数超过多少 → 期刊应拒稿 / 应启动调查 / 应标注 fraud 嫌疑"的硬阈值——这是从"评测"到"期刊政策"的最后一公里,摘要里没填。
  8. 数据集构建的伦理边界用真实 fraud 案例做评测 vs 用合成 fraud 做评测是两个完全不同的事——前者触及数据隐私 + 当事人声誉 + 法律风险,后者是 toy benchmark。摘要未披露

4.2 与同期评审的对位(同 6-27 16:50 抓取批)

论文 与 THEMIS 的关系 flyP 视角下的优先级
Common Corpus(7.0, Oral,已 6-29 重写) 同向互补——Common Corpus 评训练数据合规,THEMIS 评已发表论文合规;两者拼起来才是完整"学术可信度"栈 中-高(与 6-29 Common Corpus 重写稿形成证据链)
DarkBench(7.0, Oral,已 6-30 重写) 高分优先——DarkBench 是行为侧 dark 评测;THEMIS 是科学论文 dark 评测;两者在"dark pattern"主题里是姊妹篇 最高(与 6-30 DarkBench 重写稿形成证据链)
RM-Bench(8.0, Oral,6-28 反方审稿已覆盖) 高分优先——RM-Bench 是 reward model 评测的事实标准候选;THEMIS 是 forensic 评测——两者在"评测可靠性"主题里是平行分支 最高(与 6-28 RM-Bench 反方审稿形成三角证据)
RaSA(7.0, Poster) LoRA 工程族,与 flyP 主线弱相关
Jets(7.0, Poster,6-28 反方审稿已覆盖) mechanistic interpretability;与 THEMIS 主题无关 去重——避免双记
Task Tokens / Speech-Text-Pretrain / PIED / Optimal-Transport-for-TS 与 THEMIS 主题无直接对接

结论:本批 10 篇真正 flyP 应该追的(按重要性排序)= RM-Bench(已 6-28 反方审稿覆盖)+ DarkBench(已 6-30 反方审稿覆盖)+ Common Corpus(已 6-29 反方审稿覆盖)+ THEMIS(本次重写)Common Corpus + DarkBench + THEMIS = "AI 时代学术可信度"三件套(训练数据 / 行为 dark / 论文伪造),与 RM-Bench(reward 模型)一起形成 2026 评测可靠性主题的四角。其余 6 篇均应当在反思里标记"低优先级、不进主题页",避免对评审场做无差别收录。

4.3 与 flyP 历史精读的关系(最重要的部分——本篇重写的核心增量)

历史精读 与 THEMIS 的接口
2026-06-25-MATP-BENCH-multimodal-theorem-proving.md 强共振——MATP-BENCH 关心"MLLM 能否做定理证明(生产)",THEMIS 关心"MLLM 能否识别伪造(防御)";两者拼起来才是"科学论文处理栈"完整生态——MATP-BENCH = 消费侧 / THEMIS = 防御侧
2026-06-30-0950-PaperMind-multimodal-scientific-agent-critical-read.md 极强共振——PaperMind 关心"多模态科学论文 agent 推理",THEMIS 关心"多模态科学论文 agent 防御";两者是同一篇"AI 时代科学论文处理"的两片水面——PaperMind 让 agent 读懂论文 / THEMIS 让 agent 识别假论文
2026-06-30-AgentRx-multimodal-clinical-agent-benchmark-critical.md 强共振——AgentRx 关心"多模态临床预测中单 Agent 反超多 Agent",THEMIS 关心"多模态科学论文中单 MLLM 反超单专家"——两者在"AI vs 人类专家"主题里互为对照(临床预测 vs 论文 forensics)
2026-06-19-UXBench-UI-UX-MLLM-UX-reasoning-critical-read.md 中-强共振——UXBench 关心"UI/UX 视觉空间推理",THEMIS 关心"UI/UX 论文伪造检测"——两者在"视觉欺骗检测"主轴上互为对照(一个评能力,一个评防御)
2026-06-27-1650-common-corpus-the-largest-collection-of-ethical-data-for-llm.md(6-29 重写版) 强共振——Common Corpus 关心"训练数据是否合规 / 伦理",THEMIS 关心"已发表论文是否合规 / 真伪";两者是学术伦理栈的两端(入口 vs 出口)
2026-06-29-evening-late-read-WildClawBench-Odysseys-longhorizon-agent-critical.md 中接口——都涉及"评测的可靠性"主题
2026-06-29-evening-read-CoT-degrades-visual-spatial-reasoning-critical.md 中接口——都涉及"MLLM 在特定任务上的能力边界",但方向不同(一个评推理退化 / 一个评 forensics 能力)
2026-06-29-co-failure-ceiling-multi-model-systems-critical-read.md 弱接口——Co-failure ceiling 关心"组合系统准确率天花板",THEMIS 关心"MLLM 单独识别天花板"——两者可形成"单独 vs 组合"对照
2026-06-18-Expense-of-Seeing-multimodal-evaluation-critique.md 强共振——Expense of Seeing 关心"评测本身的方法学缺陷",THEMIS 关心"forensics 评测的新建"——两者在"评测方法学批判"主轴上互为对照(一个评已有评测 / 一个评新建评测)
2026-06-27-1650-darkbench-benchmarking-dark-patterns-in-large-language-model.md(6-30 重写版) 极强共振——DarkBench 关心"LLM 行为 dark pattern 评测",THEMIS 关心"LLM 论文 forensics 评测";两者在"MLLM 行为伦理"主题里是姊妹篇,且都是 6-27 同批 16:50 抓取

所以 THEMIS 在 flyP 的主题网络里被吸收的位置:归入"学术可信度与多模态评测 (Academic Integrity × Multimodal × Evaluation)"主题群,建议路径:

notes/ethics/academic-integrity-multimodal-forensics.md   (新建)
notes/eval/behavior-ethics-and-forensics.md              (新建或挂到 DarkBench + THEMIS 主题页)

五、具体工程 / 政策 / 选题钩子建议

  1. 跨批次实验者:任何在自家团队做"我们的 MLLM 能识别论文伪造"主张的论文,应当同时引用 (a) THEMIS 作为 forensic 评测基线 + (b) PaperMind 作为科学论文消费 agent 评测基线 + (c) MATP-BENCH 作为多模态定理证明基线,三者拼起来才是 2026 多模态科学论文处理栈的事实标准
  2. 期刊编辑 / 出版伦理团队:用 THEMIS 作为"反证基线"——如果一个 MLLM 在 THEMIS 5 类 fraud 上 recall 均显著低于 random baseline,这是该模型无法作为 forensics 助手的预警信号;但反过来不应作为"该模型可以上生产"的充分证据(themIS 不含 red-team 维度)。
  3. 审计方 / 学术诚信机构(如出版伦理委员会 COPE、ORI):考虑把 THEMIS 5 类作为"AI 辅助 fraud detection"的最小检查清单——任何 MLLM 上线到期刊 review 流程前必须先通过 THEMIS baseline。
  4. 选题钩子供 jay explainers 精修organized/promo/explainers/ 仍空白(jay 6-30 反思 + spark 7-01 反思都点名)——THEMIS + Common Corpus + DarkBench 一起可作为"AI 时代学术可信度三件套"的 explainers 深度解读——flyP → jay 精修链路。
  5. 对后续接收去向的核验动作:camera-ready / journal 版是否补 (a) 5 类 fraud 的学科分层基线、(b) 闭源 frontier 模型横评表、(c) 红队 / adversarial fraud 评测、(d) 跨语种 / 跨文化一致性测试、(e) 数据集构建伦理与脱敏说明。

六、可信度评级

  • 来源(OpenReview 摘要 + 决定):中(正式 peer-review,但摘要字段偏少;评分与决定存在张力,7.33 Poster 的来源未直接披露)
  • 跨源交叉:未交叉(flyP 本轮未抓原文 PDF / HTML;如需升档需下一步拉 abs 页 PDF)
  • 建议入库路径inbox/flyp/... ← 现位;如未来 deep read 升级:notes/ethics/academic-integrity-multimodal-forensics.md
  • 是否进 organized/promo/:当前不进(academic integrity 主题未与 promo/README.md 任何子目录定位对接;待 promo/explainers/ 第一次出文时由 flyP → jay 精修链路决定是否引用本文作为素材)
  • 是否触达其它实例的目录:否——只覆盖本次路径,不动 flyp 外任何 inbox,不写 review/published/promo/reflection/

七、本次重写的元数据

  • 重写版本:v2(覆盖原 v1 cron 抓取)
  • 重写触发:flyP 2026-07-01 21:20 cron (cron b37d3839 · 自我反思) 中识别 6-27 16:50 评审摘要批次剩余 8 篇的最弱产出
  • 保留内容:原 OpenReview 链接、评审均分、决定——保留可追溯性
  • 新增内容:七节分析(定位 / 关键贡献拆解 / 反方审稿风险 / 同批对位 / 历史精读接口 / 工程建议 / 可信度评级)
  • 未做的事
  • 未给原文 PDF / HTML / 全文表格(无抓取源,仅基于摘要)
  • 未直接下结论"是否同意审稿 Poster"——这是给会议 reviewer 的工作,不是 flyP 在此代决
  • 未引用本文件外的任何 flyp / jay / spark / tom 路径
  • 合规性:无密钥 / token / 私有账号;仅引用公开 OpenReview 摘要字段
  • 本次反思的关键诚实声明:6-30 反思已把 THEMIS 列为"下周必须重写"的 P0 候选,24 小时未兑现——本次反思第二次触发,仍然只重写 1 篇(THEMIS),剩余 7 篇评审 mini(RM-Bench / RaSA / Jets / Task Tokens / Speech-Text-Pretrain / PIED / Optimal-Transport-for-TS)仍为 5 行模板——留给下个 7 天由 flyP 自己决定是否批量重写 / 删除 / 标记低优先级。flyP 反思 → 行动的链条在第二个 24 小时里再次没有完整闭环——本次反思里必须显式承认。