ExtractBench:企业文档结构化提取基准评测 · 干货攻略
- 链接:https://x.com/jerryjliu0/status/2087195936225108171
- 分类:x-tips
- 来源:X @jerryjliu0
- 作者:Jay
- 更新:2026-08-15
- 仓库:run-llama/ExtractBench
这是什么
ExtractBench 是由 LlamaIndex 团队发布的企业文档结构化提取基准评测(GitHub: run-llama/ExtractBench,论文: arXiv:2607.29677,数据集: HuggingFace)。
它的评测任务是:给定一份企业文档(PDF/图片)和一个用户定义的 JSON Schema,提取出符合 Schema 的结构化数据,并标注每条数据的原文证据。 简单说,就是让 AI 照着企业自己写的格式要求,从发票、合同、报告里把数据抽出来。
与传统信息抽取基准不同,ExtractBench 的核心难度在于:
- Schema 任意性:每个文档类型有独立 Schema,系统必须能处理从未见过的格式定义,不能靠背模板得分。
- 记录完整性:重复结构(如发票行项目)必须全部抽出来,不能截断或遗漏。
- 溯源可验证:不仅要求抽对,还要求指出原文证据位置(词级 + 页级 grounding)。
- 成本透明度:所有系统按统一标准计算每页成本,方便生产决策。
评测规模:370 份真实企业文档,共 4,869 页,覆盖 8 个商业领域、67 种文档类型(每种类型对应独立 Schema)。文档在五个维度上打标签:任务难度、感知难度、表格结构、文档长度、商业领域——低分可直接溯因。
为什么值得关注
@jerryjliu0(Jerry Liu,LlamaIndex CEO)分享了什么
Jerry Liu 在 X 上宣布了 ExtractBench 的发布,核心论点是:
- LlamaExtract Agentic Plus 综合准确率 95.59%,Pareto 领先——在准确率、完整性、溯源、成本四个维度同时超越所有对手,没有明显短板。
- LlamaExtract Cost Effective 层综合 86.78%,超越 GPT-5.4 Nano 的 74.90%——每页成本仅 $0.01(Nano 为 $0.0021),但准确率高出近 12 个百分点。
- LlamaIndex 同期发布 benchmark + evaluation harness + dataset 三件套,工程完整度极高,有仓库、有代码、有数据集,任何人都能复现或扩展。
⚠️ 数字校正:原帖提到"Cost Effective 档 80.1% 即超越 GPT-5.4 Nano 77.4%"——这两个数字分别来自 Medium 文档分项(80.1%) 和 Short 文档分项(77.4%) 的单独得分,官方 leaderboard 综合得分分别为 86.78% 和 74.90%。结论方向一致(Cost Effective 超越 Nano),但原始对比维度不统一,以官方 README 综合排名数字为准。
解决了什么问题
企业级文档提取有三个普遍痛点:
- 通用 VLM(如 GPT-5.4 Nano)擅长短文档,但长文档截断严重:在 Medium(11-50 页)和 Long(50+ 页)文档上得分大幅下滑,分别仅 76.37% 和 35.81%(Nano),因为它们容易截断重复记录列表。
- Coding Agent(Claude Code、Codex)准确率高但成本爆炸:Codex (GPT-5.5) 得分 93.57%,但每页成本 $0.2783,是 LlamaExtract Agentic Plus 的 3.4 倍。
- 开源模型(如 Qwen3.6 35B 自托管)效果好,但部署成本被低估:87.33% 综合分优秀,但 GPU 成本没有计入 $/Page 指标。
ExtractBench 把这四个维度放在一起评,企业可以直接根据场景选最优性价比方案。
核验过程
官方来源
- GitHub README (run-llama/ExtractBench):完整 leaderboard、成本估算、安装命令、14 条 pipeline 名称映射。数字与论文摘要高度吻合。
- arXiv 论文摘要 (2607.29677):确认评测规模(4,869 页、370 文档、8 领域、67 类型)、三大评测指标(value F1、word-level grounding F1、page-level grounding F1)、结论"LlamaExtract Agentic Plus ranks first on all three metrics"。
- LlamaIndex 官方博客 (llamaindex.ai/blog/introducing-extractbench):YouTube 视频同步发布,分文档长度分项展示分数,确认 95.6% 说法来源,以及"One-third to the next best system"(成本描述)。
交叉验证结论
| 说法 | 官方来源 | 验证结果 |
|---|---|---|
| LlamaExtract Agentic Plus 95.59% | GitHub README | ✅ 确认(Overall F1) |
| LlamaExtract Cost Effective 86.78% | GitHub README | ✅ 确认(Overall F1) |
| GPT-5.4 Nano 74.90% | GitHub README | ✅ 确认(Overall F1) |
| 370 文档 / 4,869 页 / 67 类型 / 8 领域 | GitHub README + 论文摘要 | ✅ 双方一致 |
| benchmark + harness + dataset 三件套 | GitHub README | ✅ 确认(repo 含代码、数据集、论文) |
| Codex (GPT-5.5) 93.57% 排第 2 | GitHub README | ✅ 确认 |
上手步骤
安装评测工具
# 克隆仓库
git clone https://github.com/run-llama/ExtractBench.git
cd ExtractBench
# 安装(含 pipeline runner 依赖)
uv sync --extra runners
# 快速测试(6 份文档,费用极低)
uv run extract-bench run llamaextract_agentic --test
# 运行完整评测(任意 pipeline,可查看 docs/pipelines.md)
uv run extract-bench run llamaextract_agentic
# 在浏览器查看交互报告
uv run extract-bench serve llamaextract_agentic
配置 API Key
# 创建 .env 文件,填入待评测系统的 API Key
cp .env.example .env
# 编辑 .env,填入 OPENAI_API_KEY / ANTHROPIC_API_KEY 等
支持的 pipeline 完整列表:uv run extract-bench pipelines
使用 HuggingFace 数据集
from datasets import load_dataset
ds = load_dataset("llamaindex/ExtractBench")
print(ds)
全量评测成本参考(官方估算,以 4,869 页为基准)
| 类别 | 代表系统 | 全量运行成本 |
|---|---|---|
| Commercial VLM | GPT-5.4 Nano | ~$10 |
| LlamaExtract | Cost Effective | ~$49 |
| LlamaExtract | Agentic | ~$152 |
| LlamaExtract | Agentic Plus | ~$395 |
| Specialized APIs | Reducto Deep Extract | ~$1,677 |
| Coding Agents | Claude Code (Opus 4.8) | ~$787 |
💡 先跑
--test(6 份文档)确认 pipeline 正常工作,再决定是否跑全量。
坑与适用边界
1. Long 文档上通用 VLM 普遍崩溃
GPT-5.4 Nano 在 Short 文档(≤10 页)得 77.43%,Medium(11-50 页)得 76.37%,Long(50+ 页)仅 35.81%——直接腰斩。Gemini 3.5 Flash 的 Long 得分也只有 27.90%。如果你的文档平均超过 50 页,不要选纯 VLM 方案。
2. Coding Agent 成本是 LlamaExtract 的 3-30 倍
Codex (GPT-5.5) 全量评测约 $1,355,Claude Code (Opus 4.8) 约 $787——LlamaExtract Agentic Plus 只需 $395,且得分更高。Coding Agent 的高成本来自每页多次 API 调用(repl + tool use),不适合大规模批跑。
3. 开源模型成本被低估
Qwen3.6 35B 自托管综合 87.33%,排名第五,但官方 $/Page 栏标注 "—"——因为 GPU 成本不通过 API 计费。实际生产中需要把 GPU 占用时间折算进去,真实成本可能接近 LlamaExtract Cost Effective。
4. Grounding 指标是拉开差距的关键
Leaderboard 上后 8 名系统在 word-level grounding 上全部为 0.00——说明大多数系统根本不支持溯源,或溯源结果完全错误。如果你需要"抽出来的数据要能查到原文",至少要选 top 6(LlamaExtract 系列 + Reducto + Extend)。
5. Benchmark 日期锁定在 2026-07-01
README 明确写明"Models and prices reflect each provider's official documentation as of July 1, 2026"——GPT-5.5、Claude Opus 4.8 等版本号对应的是该日期的最新版,后续更新可能导致排名变化。
一句话结论
ExtractBench 是目前最完整的企业文档结构化提取评测(370 文档/4,869 页/67 类型),LlamaExtract Agentic Plus 以 95.59% 综合 F1 和 $0.08/页的成本同时登顶准确率与性价比;若只需低成本方案,Cost Effective 层(86.78%)也已大幅超越 GPT-5.4 Nano(74.90%),而通用 VLM 在长文档上的截断问题是选型时最大的坑。
数据来源:GitHub run-llama/ExtractBench README + arXiv:2607.29677 论文摘要 + LlamaIndex 官方博客;原帖 80.1% / 77.4% 说法为分项数字,已校正为官方综合得分。