ParseBench 文档解析评测基准 · 干货攻略

  • 链接:https://x.com/jerryjliu0/status/2062535626491412621
  • 分类:x-tips
  • 来源:X @jerryjliu0
  • 作者:Jay
  • 更新:2026-07-22
  • 仓库:run-llama/ParseBench

这是什么

ParseBench 是 LlamaIndex 在 CVPR 2026 上发布的首个面向 AI Agent 的文档解析评测基准arXiv:2604.08538,cs.CV)。

它的核心命题是:文档 OCR 不是"把 PDF 转成文字",而是必须保留足够的结构和语义,让 Agent 能可靠地自主决策。一旦表格列对齐错位、小数点丢失、删除线被静默丢弃,Agent 的下游判断就会系统性出错——而传统 OCR 评测指标(BLEU/ROUGE/编辑距离)完全测不出这些错误。

数据集规模(官方数据): - ~2,078 页人工校验的真实企业文档(保险、金融、政府) - 169,011 条测试规则 - 5 个评测维度

官方资源: - GitHub:run-llama/ParseBench - 数据集:HuggingFace llamaindex/ParseBench - 论文:arXiv:2604.08538,2026 年 4 月首次提交,v3 为最新版本


为什么值得关注

@jerryjliu0(LlamaIndex CEO)在 X 上的分享点出了问题的本质:文档 OCR 是 AGI-complete 问题——Agent 读不对,就操作不对。这不只是精度问题,而是整个 Agent 工作流可靠性的地基。

这个基准解决了两个长期痛点

  1. 现有基准测的是"人看着还行",不是"Agent 能用"。大多数文档评测集来自学术论文或网页,企业场景(财报、合同、监管文件)严重不足。OmniDocBench 是此前最全的评测集,但企业文档也只占 6%。

  2. 传统指标(BLEU/ROUGE)测不出 Agent 致命错误。表格列头对调、图表被 OCR 成原始文本、删除线价格被当作当前价格——这些错误不影响 BLEU 分数,但对 Agent 来说是系统性的任务失败。

适用人群: - 构建 RAG / 文档 Agent 的工程师 - 评估/选型文档解析服务的架构师 - 研究文档理解 VLM 的学者


核验过程

官方来源

来源 读取内容 关键结论
GitHub README README、pipelines.md、leaderboard.csv 确认 5 维度定义、命令安装方式、90+ pipeline
arXiv 论文摘要 全文摘要 确认 2,078 页、169K+ 规则、14 种方法对比、LlamaParse Agentic 84.9% 最高分
LlamaIndex 官方博客 完整博文 确认语义正确性(semantic correctness)定义、各维度评测动机、现有基准缺陷分析
HuggingFace 数据集页 数据集结构 确认五大维度分类:Tables、Charts、Content Faithfulness、Semantic Formatting、Visual Grounding
CVPR 2026 现场 Post 会议公告 确认 2026 年 CVPR 发布事实

交叉验证

原帖说法 vs 官方数据

原帖主张 官方数据 结论
2k 页企业文档 ~2,078 页 ✅ 吻合
5 个维度 Tables / Charts / Content Faithfulness / Semantic Formatting / Visual Grounding ✅ 吻合
LlamaParse Agentic 最高分 Overall 84.88%(Tables 90.74, Charts 78.11, Faithfulness 89.68, Format 85.24, Grounding 80.62) ✅ 官方 leaderboard 数据一致
"AGI-complete"表述 论文原文使用"semantic correctness",博客未直接用"AGI-complete"措辞 ⚠️ 原帖用词为主观强调,非论文原文,标注"原帖主张,未核验"

leaderboard 前五名核验(官方 GitHub leaderboard.csv): 1. LlamaParse Agentic — 84.88%($0.0125/页) 2. Pulse Ultra 2 — 77.08%($0.15/页) 3. LlamaParse Cost Effective — 76.77%($0.0038/页) 4. KDL-Frontier-Parser-nano(开源权重)— 76.36% 5. Google Gemini 3 Flash (Thinking High) — 75.05%


上手步骤

安装

# 基础安装
uv sync --extra runners

# 可选:JIT 加速 TEDS 表格指标(numba),分数与默认路径完全一致
uv sync --extra runners --extra fast

配置

在项目根目录创建 .env 文件,填入要评测的解析工具 API key:

# 例如评测 LlamaParse
LLAMAPARSE_API_KEY=llx-xxxx

# 例如评测 OpenAI GPT-5 Mini
OPENAI_API_KEY=sk-xxxx

下载数据集

# 下载完整数据集
uv run parse-bench download

# 下载小测试集(每个分类 3 个文件,适合快速试跑)
uv run parse-bench download --test

# 查看下载状态和统计
uv run parse-bench status

运行评测

# 快速试跑(小数据集,3 文件/分类)
uv run parse-bench run llamaparse_agentic --test

# 完整基准评测
uv run parse-bench run llamaparse_agentic

# 评测所有 pipeline(官方基线 21 个)
uv run parse-bench run --all

# 只在单个维度上评测(节省时间和费用)
uv run parse-bench run --group chart       # 只测图表维度
uv run parse-bench run --group table      # 只测表格维度
uv run parse-bench run --group layout      # 只测视觉定位
uv run parse-bench run --group text_content  # 内容忠实度
uv run parse-bench run --group text_formatting  # 语义格式

# 跳过调用解析工具,仅用已有结果重新评估
uv run parse-bench run --skip_inference

# 查看交互式报告(浏览器打开)
uv run parse-bench serve llamaparse_agentic

可用 Pipeline

官方内置 90+ pipeline,可通过命令查看完整列表:

uv run parse-bench pipelines

部分论文基线 pipeline 速查

Pipeline 名称 对应模型/服务
llamaparse_agentic LlamaParse Agentic
llamaparse_cost_effective LlamaParse 成本优化版
openai_gpt5_mini_reasoning_medium_parse_with_layout_file GPT-5 Mini (Reasoning Medium)
anthropic_opus_4_6_parse_with_layout_file Anthropic Opus 4.6
google_gemini_3_flash_thinking_high_parse_with_layout_file Gemini 3 Flash (Thinking High)
google_gemini_3_flash_thinking_minimal_parse_with_layout_file Gemini 3 Flash (Thinking Minimal)
aws_textract AWS Textract
azure_di_layout Azure Document Intelligence
google_docai_layout Google Cloud Document AI
reducto / reducto_agentic Reducto
docling_parse Docling
qwen3_5_4b_vllm_parse Qwen 3 VL(开源权重)

用 Python 调用评测

from parse_bench import Benchmark, Pipeline

benchmark = Benchmark("llamaparse_agentic")
results = benchmark.run()
benchmark.evaluate(results)

自定义 Pipeline

参考 docs/pipelines.md,可注册任意解析工具的 pipeline 配置。


坑与适用边界

已知的坑

1. API 费用不可忽视 完整评测 LlamaParse Agentic(2,078 页)费用约 2,078 × $0.0125 ≈ $26,按量付费。开源 VLM(如 Qwen3-VL)本地运行无 API 成本,适合预算有限的团队。

2. 数据下载需要较大存储 完整数据集含 2,078 页 PDF + 对应 JSONL 标注,建议预留 5GB+ 空间。

3. 部分指标依赖特定依赖 TEDS 表格指标(GTRM)的 fast 模式需要 numba,未安装时自动回退到慢速路径。

4. "Semantic Formatting"维度的局限性 该维度覆盖的格式类型有限(删除线、上下标、粗体、标题层级),对 PDF 中更复杂的语义格式(如高亮背景色、水印)暂无覆盖。

适用边界

  • 适合:评估企业场景文档解析质量、对比商用 API vs 开源方案、指导 Agent 文档处理管线选型。
  • 不适合:非 PDF 文档(Word/HTML/扫描件)评测;实时流式文档处理性能评测。

一句话结论

ParseBench 把文档解析的评测标准从"肉眼看着差不多"升级到"Agent 能否可靠决策"——5 维度、169K+ 规则、90+ pipeline 开箱即用,是 2026 年做文档 Agent 选型必备的基准工具。