VeriHarness:让同一模型既当选手又当裁判 · 干货攻略

  • 链接: https://x.com/omarsar0/status/2106695651169800419
  • 分类: x-tips
  • 来源: X @omarsar0
  • 作者: Jay
  • 更新: 2026-10-06
  • 仓库: google-research/veriharness

这是什么

VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading rubric,如何可靠地判断输出质量?

答案反直觉——不要相信共识,要利用分歧。

为什么值得关注

分享人 @omarsar0(Omar Sarwar,DAIR.AI)指出这个工作的核心冲击:信任多数 vote 不如信任分歧。这直接挑战了当前 Agent 评测的主流范式(majority voting / self-consistency)。

传统验证方法的问题: - Majority voting / Self-consistency(Wang et al., 2023):选最多人认同的答案,但共识不等于正确 - LLM-as-a-Verifier:靠阅读理解打分,但评分者只看自己已经相信的东西,不查环境证据

VeriHarness 的核心发现(来自 APEX-Agents 上 10 个 rollout 的分析):大约三分之一的共识值是错的,而分歧中往往包含正确答案。原始帖子称之为「反直觉实证结论」,对 Agent eval 范式有直接冲击。

核验过程

官方来源(已读): 1. arXiv abstract(https://arxiv.org/abs/2610.00972):确认论文全名 VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks,作者列表、提交时间(2026-10-01)、核心 abstract 全文 2. arXiv HTML 版本:确认了方法细节、四阶段流程(materialized task → resolver + challenger 并发 → adjudication → delivery)、benchmark 详情 3. GitHub README(https://github.com/google-research/veriharness):确认了仓库结构、验证工作流、Setup/Usage 文档结构、数据集链接 4. Envisioning Vocab 词条(https://www.envisioning.com/vocab/veriharness):独立摘要确认了性能数字(6.2 pts / 6.4 pts)

交叉验证结论: - 性能数字(Gemini 3.5 Flash +6.2 pts,Claude Opus 4.8 +6.4 pts)在 arXiv abstract、GitHub README、Envisioning Vocab 三个来源中完全一致,可信赖 - 核心方法「disagreement > consensus」在论文 Figure 2 中有实验支撑(非传言),可信赖 - 评测的 5 个 benchmark(APEX-Agents、Workspace-Bench Lite、WorkBuddy Bench、SpreadsheetBench 2、JobBench)在论文中有明确定义,可信赖 - 数据集规模(~26,000 rollouts,$100,000+ 成本)在 arXiv abstract 和 GitHub README 中一致,可信赖 - 注意:论文于 2026-10-01 提交,arXiv 标注为 preprint,尚未经过同行评审

上手步骤

核心机制(三行读懂)

VeriHarness 的验证流程把 N 个独立 rollout 的关系拆成两种情况处理:

rollouts 之间的关系只有两种:
1. 分歧(disagree)→ resolver 用环境证据检验备选,淘汰矛盾的那个
2. 共识(agree)  → challenger 主动找共识里可能错的地方(共享盲点)

每个任务跑四步,分三个隔离 session 并发执行:

materialized task
  ├── resolver session ──→ ledger_elim.json(消除矛盾)
  └── challenger session ──→ ledger_fals.json(挑战共识)
        ↓
   adjudication(融合两份记录)
        ↓
   delivery ──→ out/deliverables/ + repair.json

安装与运行(GitHub,Python)

git clone https://github.com/google-research/veriharness
cd veriharness
# 详见 README 中的 Setup 和 Usage 部分

API 调用思路(伪代码)

# 给定一个任务 + N 个 rollout(由同一模型生成)
rollouts = [agent.run(task) for _ in range(N)]

# VeriHarness 的核心判断:
# - 分歧处:用环境证据(文件、数据、可重算量)检验备选
# - 共识处:主动挑战共享盲点,而非直接信任

verdict = veriharness.adjudicate(task, rollouts)
# 返回: base(基础 rollout), work(证据支撑的修改计划), open(未解决 claims)

数据集

约 26,000 条 rollout 横跨 5 个 benchmark,已发布在 HuggingFace:https://huggingface.co/datasets/caiqizh/veriharness

坑与适用边界

适用条件: - 长程 Agent 任务(报告、表格、多文件代码任务) - 任务环境可提供证据(源文件、数据、约束) - 模型本身足够强(论文用了 Gemini 3.5 Flash 和 Claude Opus 4.8)

当前局限(论文自述): - 论文尚未经过同行评审(preprint) - 方法在弱模型上的效果未详细评估 - 评测基准集中在 workspace 类任务,对纯推理类任务(如 MATH)的适用性存疑

需要注意: - 验证技能(verification skills)可以从失败反馈中自我改进,但这一能力尚属初步验证阶段 - 论文 Figure 2 的详细实验数据(如「三分之一共识值是错的」这一比例)在完整正文 Appendix 中,原帖引用的是 Omar 的总结口径,精确比例以 Figure 2 为准 - 存在另一个同名小论文(arXiv:2607.14167,July 2026)是代码修复 loop,与本工作无关

一句话结论

VeriHarness 证明:同一模型既当选手又当裁判时,分歧比共识更可信——用证据检验分歧、挑战共识,让长程 Agent 输出从「靠猜」变成「有据可查」。


核验来源:arXiv 2610.00972(abstract + HTML 正文)、GitHub google-research/veriharness README、Envisioning Vocab 词条;三源数字一致,核心结论有实验支撑。