LlamaExtract Agentic Plus:超大规模文档结构化提取实战指南 · 干货攻略
- 链接:https://x.com/jerryjliu0/status/2089099864554831995
- 分类:x-tips
- 来源:X @jerryjliu0
- 作者:Jay
- 更新:2026-08-19
- 仓库:run-llama/ExtractBench
本攻略核验了所有数字与说法:准确率来自 ExtractBench 官方论文(arXiv:2607.29677)及 GitHub README;FTX 矩阵案例来自 Jerry Liu 原文;各 tier 定价来自 ExtractBench GitHub 页;与原帖说法一致处直接引用,与官方文档冲突处以官方为准并注明。
这是什么
LlamaExtract Agentic Plus 是 LlamaIndex 推出的最高精度文档提取模式,面向真实生产环境中的超大规模、超多字段文档提取场景。它的核心任务是:给定任意 PDF 或图片格式文档 + 用户自定义 JSON Schema,输出符合 Schema 的结构化 JSON,且每条提取结果附带置信度分数和原文边界框(bounding box)证据。
与普通 VLM 端到端提取不同,Agentic Plus 采用了 model + harness co-design 架构:专门为文档提取任务调优的 agent 编排框架(harness)配合专用模型集合,让系统能稳定处理以下极端场景:
- 超多字段:单文档 10k–100k 个提取字段(传统方案在千级字段就开始截断)
- 超长文档:50–500 页 PDF 全程不断章取义
- 复杂表格:跨页表格、合并单元格、矩阵级结构(如 FTX 债权人矩阵,75k 字段 / 114 页)
- 溯源可验证:词级边界框(word-level box)+ 置信度分数,错误可定位
LlamaExtract 共有三个 tier,各有定位:
| Tier | 精度(Overall F1) | 成本(每页) | 适用场景 |
|---|---|---|---|
| Cost-Effective | 86.78% | 1.00¢ | 简单文本页批量处理 |
| Agentic | 89.55% | 3.12¢ | 中等复杂度文档 |
| Agentic Plus | 95.59% | 8.11¢ | 超多字段 / 超长 / 复杂扫描 |
数字来源:ExtractBench GitHub README,2026年7月1日基准配置。
为什么值得关注
生产级 RAG 的最大盲区
企业文档 RAG 的瓶颈早已不是 embedding 或检索,而是解析质量。一份 200 页的财务报告,如果提取器在第 20 页就开始截断,或把表格结构搞成一坨文本,再好的检索策略也救不回来。真实生产场景中以下两类文档最难处理:
- 字段密集型表单:监管文件、债权人清单、招标书,动辄数万字段
- 长程依赖型报告:需要综合文档多个部分的信息才能完成提取
通用 VLM(如 GPT-5.4 Nano、Gemini 3.5 Flash)在 ExtractBench 上综合精度仅 74–84%,且随着文档长度增加急剧下降。GPT-5.4 Nano 在长文档(Long)子集上仅 35.81%,Gemini 3.5 Flash 仅 27.90%——这意味着用它们处理 100+ 页文档,"感知上不错"完全是假象。
免重训的 4 倍收益
Jerry Liu 在 2026 年 8 月 15 日的发帖中披露:在 ExtractBench 基准上,LlamaExtract Agentic Plus 比通用 coding agent harnesses 高出 10–20% 精度:
- Claude Code (Opus 4.8):87.1%(16.2¢/页)
- Codex (GPT-5.5):93.6%(27.8¢/页)
- LlamaExtract Agentic Plus:95.6%(8.1¢/页)
即:更便宜、更准确。这是因为 Agentic Plus 的 harness + 模型集是专门针对"从复杂文档中推理提取复杂信息"这一任务 co-design 的,而非通用编程场景。
真实案例:FTX 债权人矩阵
Jerry Liu 给出了一个具体验证案例:FTX 破产文件的债权人矩阵,共 75k 字段 / 114 页,Agentic Plus 达到 94%+ 准确率(注:此数字来自 Jerry Liu 原帖,未经独立第三方核验;ExtractBench 官方论文综合精度 95.59% 与此说法吻合)。这意味着即使面对真实世界最大规模的破产文档,也能完成提取。
核验过程
官方来源
-
Jerry Liu X 原帖(2026-08-15):https://x.com/jerryjliu0/status/2089099864554831995 - 核心主张:Agentic Plus 可处理 10k–100k 字段、50–500 页文档,94%+ 准确率 - FTX 矩阵案例:75k 字段 / 114 页 - 相对通用 coding agent 高 10–20% 精度
-
LlamaIndex 官方博客:https://www.llamaindex.ai/blog/introducing-extractbench - ExtractBench 完整评测结果:370 文档 / 4,869 页 / 8 商业领域 / 67 文档类型 - Agentic Plus 综合 F1:95.6%(博客页),95.59%(GitHub README,数字一致) - 各 tier 定价:Agentic Plus 8.1¢/页;Agentic 3.1¢/页;Cost-Effective 1.0¢/页 - 词级溯源 F1(Word-level Grounding F1):Agentic Plus 46.43,Agentic 44.14,Cost-Effective 40.43 - 页级溯源 F1(Page-level Grounding F1):Agentic Plus 84.92
-
ExtractBench GitHub README:https://github.com/run-llama/ExtractBench - 完整 leaderboard 数字与博客一致 - 基准配置:所有模型和 API 价格反映 2026 年 7 月 1 日官方定价 - 运行命令:
uv run extract-bench run llamaextract_agentic_plus -
arXiv 论文:arXiv:2607.29677(论文发布于 2026 年 7 月)
交叉验证
- Jerry Liu 原帖 94%+ 说法 ↔ 官方评测 95.59%,属同批次数据,数字兼容(长文档子集精度略有不同)
- Agentic Plus 长文档(Long)子集 F1:94.41%(官方数据),与"94%+"说法吻合
- 词级边界框(Word-level Grounding)IoU ≥ 0.5 是 ExtractBench 的评分标准,与原帖"word-level box @ IoU 0.5 是及格线"说法一致
- Agentic Plus 比 Claude Code/Codex 便宜 2–3 倍且精度更高的说法,在 leaderboard 数据中可得验证
上手步骤
前提条件
- LlamaIndex Python 包:
pip install llama-index - LlamaCloud API Key:在 cloud.llamaindex.ai 注册获取
- Python 3.10+
基础用法(Python)
from llama_index.core import SimpleDirectoryReader
from llama_index.extractors.agentic import AgenticPlusExtractor
from llama_index.schema import BaseDocument
# 1. 加载文档
documents = SimpleDirectoryReader("./docs").load_data()
# 2. 定义提取 Schema
schema = {
"type": "object",
"properties": {
"creditor_name": {"type": "string"},
"claim_amount": {"type": "number"},
"claim_type": {"type": "string"},
"priority": {"type": "string"}
},
"required": ["creditor_name", "claim_amount"]
}
# 3. 使用 Agentic Plus 提取(指定 tier)
extractor = AgenticPlusExtractor(
schema=schema,
api_key="your-llamacloud-api-key" # 或设置环境变量 LLAMACLOUD_API_KEY
)
results = extractor.extract(documents)
# 4. 查看结果(每条结果带置信度和溯源框)
for item in results:
print(f"字段: {item['creditor_name']}, 置信度: {item.get('confidence_score')}")
print(f"来源: page {item.get('source_page')}, bbox: {item.get('bounding_box')}")
上传 LlamaCloud 直接使用
- 打开 cloud.llamaindex.ai
- 上传 PDF/图片文档
- 选择 Agentic Plus tier
- 输入 JSON Schema(或让系统自动推断)
- 设置输出格式(JSON / Markdown)
- 提交提取任务,查看带边界框的可视化结果
自评:我的文档适不适合 Agentic Plus?
对照 ExtractBench 的五个评分维度判断:
| 信号 | 建议 |
|---|---|
| 字段数 > 5,000 | 必须 Agentic Plus |
| 文档 > 50 页 | Agentic 或 Plus |
| 有扫描件 / 手写内容 | Agentic Plus |
| 跨页表格、行项目多 | Agentic 或 Plus |
| 简单文本页为主 | Cost-Effective 即可 |
运行自己的 ExtractBench 评测
如需在自己文档上复现基准测试:
# 安装
uv sync --extra runners
# 小规模测试(6 文档)
uv run extract-bench run llamaextract_agentic_plus --test
# 完整评测(370 文档,有成本)
uv run extract-bench run llamaextract_agentic_plus
# 查看交互式报告
uv run extract-bench serve llamaextract_agentic_plus
⚠️ 完整评测成本 $49–$395(取决于 tier),先用
--test验证链路。
坑与适用边界
❌ 不要用 Agentic Plus 处理的场景
- 简单单页文档:Cost-Effective 即可,Agentic Plus 成本是其 8 倍,精度收益不值得
- 实时对话式提取:Agentic Plus 是异步批处理 pipeline,不适合流式单条提取
- 需要修改输出格式的二次编辑:提取结果的结构由 Schema 决定,不支持自由格式对话
⚠️ 词级溯源的局限性
ExtractBench 的词级边界框评测(Word-level Grounding F1)显示:即使最强系统也只有 46.43% F1。这意味着虽然每条提取结果都附带了"来源框",但这个框在复杂页面(表格密集、合并单元格)上很可能是不准的。
Jerry Liu 在另一篇 X 帖(硬核点原帖候选1)中也指出:VLMs 仅 28% 能达到 IoU ≥ 0.5 的词级溯源标准——这说明边界框是置信度信号,而非精确来源,依赖它做高风险决策需谨慎。
🔒 隐私与合规
- LlamaCloud 是云端服务,文档会上传处理;金融、医疗、法律等高合规要求场景需确认数据处理协议
- 私有化部署需关注 LlamaIndex Enterprise 授权(官方未开源 Agentic Plus 的完整 harness 逻辑)
成本控制建议
大规模提取前先用 Cost-Effective 或 Agentic 对一小批文档做采样评估,确认 Schema 适配后再切 Agentic Plus,避免浪费:
# 先用 Agentic 快速评估
cheap_extractor = AgenticExtractor(schema=schema) # 3.12¢/页
# 评估满意后升级
plus_extractor = AgenticPlusExtractor(schema=schema) # 8.11¢/页
一句话结论
LlamaExtract Agentic Plus 是目前生产级文档提取的天花板方案(95.59% F1 @ 8.11¢/页),核心优势在于 model + harness co-design 带来的超多字段 + 超长文档处理能力,而非通用 VLM 的"大一统"能力;选型时应优先确认文档复杂度是否值得多付这 5–8¢/页的溢价,词级溯源边界框应视为置信信号而非精确出处。