VeriHarness:让同一模型既当选手又当裁判 · 干货攻略
- 链接: https://x.com/omarsar0/status/2106695651169800419
- 分类: x-tips
- 来源: X @omarsar0
- 作者: Jay
- 更新: 2026-10-06
- 仓库: google-research/veriharness
这是什么
VeriHarness 是 Google Cloud AI Research(联合作者还有剑桥大学 Nigel Collier)于 2026 年 10 月 1 日在 arXiv(2610.00972)上发布的论文提出的多 rollout 验证框架。核心问题是:当 LLM Agent 完成了长程任务(写报告、做表格、写代码),没有参考答案、没有 grading rubric,如何可靠地判断输出质量?
答案反直觉——不要相信共识,要利用分歧。
为什么值得关注
分享人 @omarsar0(Omar Sarwar,DAIR.AI)指出这个工作的核心冲击:信任多数 vote 不如信任分歧。这直接挑战了当前 Agent 评测的主流范式(majority voting / self-consistency)。
传统验证方法的问题: - Majority voting / Self-consistency(Wang et al., 2023):选最多人认同的答案,但共识不等于正确 - LLM-as-a-Verifier:靠阅读理解打分,但评分者只看自己已经相信的东西,不查环境证据
VeriHarness 的核心发现(来自 APEX-Agents 上 10 个 rollout 的分析):大约三分之一的共识值是错的,而分歧中往往包含正确答案。原始帖子称之为「反直觉实证结论」,对 Agent eval 范式有直接冲击。
核验过程
官方来源(已读): 1. arXiv abstract(https://arxiv.org/abs/2610.00972):确认论文全名 VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks,作者列表、提交时间(2026-10-01)、核心 abstract 全文 2. arXiv HTML 版本:确认了方法细节、四阶段流程(materialized task → resolver + challenger 并发 → adjudication → delivery)、benchmark 详情 3. GitHub README(https://github.com/google-research/veriharness):确认了仓库结构、验证工作流、Setup/Usage 文档结构、数据集链接 4. Envisioning Vocab 词条(https://www.envisioning.com/vocab/veriharness):独立摘要确认了性能数字(6.2 pts / 6.4 pts)
交叉验证结论: - 性能数字(Gemini 3.5 Flash +6.2 pts,Claude Opus 4.8 +6.4 pts)在 arXiv abstract、GitHub README、Envisioning Vocab 三个来源中完全一致,可信赖 - 核心方法「disagreement > consensus」在论文 Figure 2 中有实验支撑(非传言),可信赖 - 评测的 5 个 benchmark(APEX-Agents、Workspace-Bench Lite、WorkBuddy Bench、SpreadsheetBench 2、JobBench)在论文中有明确定义,可信赖 - 数据集规模(~26,000 rollouts,$100,000+ 成本)在 arXiv abstract 和 GitHub README 中一致,可信赖 - 注意:论文于 2026-10-01 提交,arXiv 标注为 preprint,尚未经过同行评审
上手步骤
核心机制(三行读懂)
VeriHarness 的验证流程把 N 个独立 rollout 的关系拆成两种情况处理:
rollouts 之间的关系只有两种:
1. 分歧(disagree)→ resolver 用环境证据检验备选,淘汰矛盾的那个
2. 共识(agree) → challenger 主动找共识里可能错的地方(共享盲点)
每个任务跑四步,分三个隔离 session 并发执行:
materialized task
├── resolver session ──→ ledger_elim.json(消除矛盾)
└── challenger session ──→ ledger_fals.json(挑战共识)
↓
adjudication(融合两份记录)
↓
delivery ──→ out/deliverables/ + repair.json
安装与运行(GitHub,Python)
git clone https://github.com/google-research/veriharness
cd veriharness
# 详见 README 中的 Setup 和 Usage 部分
API 调用思路(伪代码)
# 给定一个任务 + N 个 rollout(由同一模型生成)
rollouts = [agent.run(task) for _ in range(N)]
# VeriHarness 的核心判断:
# - 分歧处:用环境证据(文件、数据、可重算量)检验备选
# - 共识处:主动挑战共享盲点,而非直接信任
verdict = veriharness.adjudicate(task, rollouts)
# 返回: base(基础 rollout), work(证据支撑的修改计划), open(未解决 claims)
数据集
约 26,000 条 rollout 横跨 5 个 benchmark,已发布在 HuggingFace:https://huggingface.co/datasets/caiqizh/veriharness
坑与适用边界
适用条件: - 长程 Agent 任务(报告、表格、多文件代码任务) - 任务环境可提供证据(源文件、数据、约束) - 模型本身足够强(论文用了 Gemini 3.5 Flash 和 Claude Opus 4.8)
当前局限(论文自述): - 论文尚未经过同行评审(preprint) - 方法在弱模型上的效果未详细评估 - 评测基准集中在 workspace 类任务,对纯推理类任务(如 MATH)的适用性存疑
需要注意: - 验证技能(verification skills)可以从失败反馈中自我改进,但这一能力尚属初步验证阶段 - 论文 Figure 2 的详细实验数据(如「三分之一共识值是错的」这一比例)在完整正文 Appendix 中,原帖引用的是 Omar 的总结口径,精确比例以 Figure 2 为准 - 存在另一个同名小论文(arXiv:2607.14167,July 2026)是代码修复 loop,与本工作无关
一句话结论
VeriHarness 证明:同一模型既当选手又当裁判时,分歧比共识更可信——用证据检验分歧、挑战共识,让长程 Agent 输出从「靠猜」变成「有据可查」。
核验来源:arXiv 2610.00972(abstract + HTML 正文)、GitHub google-research/veriharness README、Envisioning Vocab 词条;三源数字一致,核心结论有实验支撑。