ExtractBench:企业文档结构化提取基准评测 · 干货攻略

  • 链接:https://x.com/jerryjliu0/status/2087195936225108171
  • 分类:x-tips
  • 来源:X @jerryjliu0
  • 作者:Jay
  • 更新:2026-08-15
  • 仓库:run-llama/ExtractBench

这是什么

ExtractBench 是由 LlamaIndex 团队发布的企业文档结构化提取基准评测(GitHub: run-llama/ExtractBench,论文: arXiv:2607.29677,数据集: HuggingFace)。

它的评测任务是:给定一份企业文档(PDF/图片)和一个用户定义的 JSON Schema,提取出符合 Schema 的结构化数据,并标注每条数据的原文证据。 简单说,就是让 AI 照着企业自己写的格式要求,从发票、合同、报告里把数据抽出来。

与传统信息抽取基准不同,ExtractBench 的核心难度在于:

  • Schema 任意性:每个文档类型有独立 Schema,系统必须能处理从未见过的格式定义,不能靠背模板得分。
  • 记录完整性:重复结构(如发票行项目)必须全部抽出来,不能截断或遗漏。
  • 溯源可验证:不仅要求抽对,还要求指出原文证据位置(词级 + 页级 grounding)。
  • 成本透明度:所有系统按统一标准计算每页成本,方便生产决策。

评测规模:370 份真实企业文档,共 4,869 页,覆盖 8 个商业领域、67 种文档类型(每种类型对应独立 Schema)。文档在五个维度上打标签:任务难度、感知难度、表格结构、文档长度、商业领域——低分可直接溯因。


为什么值得关注

@jerryjliu0(Jerry Liu,LlamaIndex CEO)分享了什么

Jerry Liu 在 X 上宣布了 ExtractBench 的发布,核心论点是:

  1. LlamaExtract Agentic Plus 综合准确率 95.59%,Pareto 领先——在准确率、完整性、溯源、成本四个维度同时超越所有对手,没有明显短板。
  2. LlamaExtract Cost Effective 层综合 86.78%,超越 GPT-5.4 Nano 的 74.90%——每页成本仅 $0.01(Nano 为 $0.0021),但准确率高出近 12 个百分点。
  3. LlamaIndex 同期发布 benchmark + evaluation harness + dataset 三件套,工程完整度极高,有仓库、有代码、有数据集,任何人都能复现或扩展。

⚠️ 数字校正:原帖提到"Cost Effective 档 80.1% 即超越 GPT-5.4 Nano 77.4%"——这两个数字分别来自 Medium 文档分项(80.1%)Short 文档分项(77.4%) 的单独得分,官方 leaderboard 综合得分分别为 86.78%74.90%。结论方向一致(Cost Effective 超越 Nano),但原始对比维度不统一,以官方 README 综合排名数字为准。

解决了什么问题

企业级文档提取有三个普遍痛点:

  • 通用 VLM(如 GPT-5.4 Nano)擅长短文档,但长文档截断严重:在 Medium(11-50 页)和 Long(50+ 页)文档上得分大幅下滑,分别仅 76.37% 和 35.81%(Nano),因为它们容易截断重复记录列表。
  • Coding Agent(Claude Code、Codex)准确率高但成本爆炸:Codex (GPT-5.5) 得分 93.57%,但每页成本 $0.2783,是 LlamaExtract Agentic Plus 的 3.4 倍。
  • 开源模型(如 Qwen3.6 35B 自托管)效果好,但部署成本被低估:87.33% 综合分优秀,但 GPU 成本没有计入 $/Page 指标。

ExtractBench 把这四个维度放在一起评,企业可以直接根据场景选最优性价比方案。


核验过程

官方来源

  1. GitHub README (run-llama/ExtractBench):完整 leaderboard、成本估算、安装命令、14 条 pipeline 名称映射。数字与论文摘要高度吻合。
  2. arXiv 论文摘要 (2607.29677):确认评测规模(4,869 页、370 文档、8 领域、67 类型)、三大评测指标(value F1、word-level grounding F1、page-level grounding F1)、结论"LlamaExtract Agentic Plus ranks first on all three metrics"。
  3. LlamaIndex 官方博客 (llamaindex.ai/blog/introducing-extractbench):YouTube 视频同步发布,分文档长度分项展示分数,确认 95.6% 说法来源,以及"One-third to the next best system"(成本描述)。

交叉验证结论

说法 官方来源 验证结果
LlamaExtract Agentic Plus 95.59% GitHub README ✅ 确认(Overall F1)
LlamaExtract Cost Effective 86.78% GitHub README ✅ 确认(Overall F1)
GPT-5.4 Nano 74.90% GitHub README ✅ 确认(Overall F1)
370 文档 / 4,869 页 / 67 类型 / 8 领域 GitHub README + 论文摘要 ✅ 双方一致
benchmark + harness + dataset 三件套 GitHub README ✅ 确认(repo 含代码、数据集、论文)
Codex (GPT-5.5) 93.57% 排第 2 GitHub README ✅ 确认

上手步骤

安装评测工具

# 克隆仓库
git clone https://github.com/run-llama/ExtractBench.git
cd ExtractBench

# 安装(含 pipeline runner 依赖)
uv sync --extra runners

# 快速测试(6 份文档,费用极低)
uv run extract-bench run llamaextract_agentic --test

# 运行完整评测(任意 pipeline,可查看 docs/pipelines.md)
uv run extract-bench run llamaextract_agentic

# 在浏览器查看交互报告
uv run extract-bench serve llamaextract_agentic

配置 API Key

# 创建 .env 文件,填入待评测系统的 API Key
cp .env.example .env
# 编辑 .env,填入 OPENAI_API_KEY / ANTHROPIC_API_KEY 等

支持的 pipeline 完整列表:uv run extract-bench pipelines

使用 HuggingFace 数据集

from datasets import load_dataset

ds = load_dataset("llamaindex/ExtractBench")
print(ds)

全量评测成本参考(官方估算,以 4,869 页为基准)

类别 代表系统 全量运行成本
Commercial VLM GPT-5.4 Nano ~$10
LlamaExtract Cost Effective ~$49
LlamaExtract Agentic ~$152
LlamaExtract Agentic Plus ~$395
Specialized APIs Reducto Deep Extract ~$1,677
Coding Agents Claude Code (Opus 4.8) ~$787

💡 先跑 --test(6 份文档)确认 pipeline 正常工作,再决定是否跑全量。


坑与适用边界

1. Long 文档上通用 VLM 普遍崩溃

GPT-5.4 Nano 在 Short 文档(≤10 页)得 77.43%,Medium(11-50 页)得 76.37%,Long(50+ 页)仅 35.81%——直接腰斩。Gemini 3.5 Flash 的 Long 得分也只有 27.90%。如果你的文档平均超过 50 页,不要选纯 VLM 方案。

2. Coding Agent 成本是 LlamaExtract 的 3-30 倍

Codex (GPT-5.5) 全量评测约 $1,355,Claude Code (Opus 4.8) 约 $787——LlamaExtract Agentic Plus 只需 $395,且得分更高。Coding Agent 的高成本来自每页多次 API 调用(repl + tool use),不适合大规模批跑。

3. 开源模型成本被低估

Qwen3.6 35B 自托管综合 87.33%,排名第五,但官方 $/Page 栏标注 "—"——因为 GPU 成本不通过 API 计费。实际生产中需要把 GPU 占用时间折算进去,真实成本可能接近 LlamaExtract Cost Effective。

4. Grounding 指标是拉开差距的关键

Leaderboard 上后 8 名系统在 word-level grounding 上全部为 0.00——说明大多数系统根本不支持溯源,或溯源结果完全错误。如果你需要"抽出来的数据要能查到原文",至少要选 top 6(LlamaExtract 系列 + Reducto + Extend)。

5. Benchmark 日期锁定在 2026-07-01

README 明确写明"Models and prices reflect each provider's official documentation as of July 1, 2026"——GPT-5.5、Claude Opus 4.8 等版本号对应的是该日期的最新版,后续更新可能导致排名变化。


一句话结论

ExtractBench 是目前最完整的企业文档结构化提取评测(370 文档/4,869 页/67 类型),LlamaExtract Agentic Plus 以 95.59% 综合 F1 和 $0.08/页的成本同时登顶准确率与性价比;若只需低成本方案,Cost Effective 层(86.78%)也已大幅超越 GPT-5.4 Nano(74.90%),而通用 VLM 在长文档上的截断问题是选型时最大的坑。

数据来源:GitHub run-llama/ExtractBench README + arXiv:2607.29677 论文摘要 + LlamaIndex 官方博客;原帖 80.1% / 77.4% 说法为分项数字,已校正为官方综合得分。