VLM 文档解析:effort 越高 ≠ 效果越好 · 干货攻略
- 链接: https://x.com/jerryjliu0/status/2103638561262362985
- 分类: x-tips
- 来源: X @jerryjliu0
- 作者: Jay
- 更新: 2026-09-30
这是什么
2026 年 9 月,LlamaIndex 联合创始人 & CEO Jerry Liu(@jerryjliu0)在 X 上发布了一项系统性评测结果:对 16 款前沿 VLM(视觉语言模型) 进行文档解析能力的横向对比。测试覆盖 Opus 5.5、GPT-6 Sol/Luna 等最新模型,评测基准为 LlamaIndex 自建的 ParseBench。
核心发现反直觉:在其他任务(coding、知识工作)上,提高 effort(推理 effort/思考budget)通常能带来提升,但在文档解析上,这条规律不再成立。
为什么值得关注
文档解析是 Agent 落地的关键瓶颈之一。Jerry Liu 在 2026 年 AI Engineer World's Fair 的演讲中指出:"2026 年 RAG 的结构 = Agent Harness + Context Layer,而 Context Layer 的核心就是文档解析"。如果选错了模型或路线,Agent 即使再强也只是在错误的基础上推理。
这条 post 的价值在于它直接回答了一个工程选型中的核心问题:当我在 Agent loop 里集成文档解析时,应该用哪个 VLM?花更多钱开 reasoning effort 有没有用?
核验过程
官方来源
-
Jerry Liu X 帖子(https://x.com/jerryjliu0/status/2103638561262362985) - 原帖内容完整,claim 可直接引用。
-
ParseBench 论文(arxiv.org/abs/2604.08538,2026 年 4 月) - 基准由 LlamaIndex 团队发布,描述约 2,000 页人工标注企业文档(保险、金融、政府),评测 5 个维度:tables、charts、content faithfulness、semantic formatting、visual grounding。 - 论文自称 LlamaParse Agentic 为综合第一,并标注为 "LlamaParse (Ours)"。
-
ParseBench Live Leaderboard(parsebench.ai) - 截至 2026 年 9 月 23 日,共 112 个方法上榜。综合排名前二为 LlamaParse Agentic Plus(90.2)和 LlamaParse Agentic(87.0);前沿模型中 Fable 5.1 第六(78.9),Opus 5.5 第八(78.0)。
-
OpenAI GPT-6 Sol/Luna 官方公告(community.openai.com,2026 年 9 月 22 日) - 确认 GPT-6 Sol/Luna 于 2026 年 9 月 22 日发布,价格 $2/$10(Sol)和 $0.10/$0.50(Luna),相较 GPT-5.6 降幅 50%。
-
Kingy AI 横向评测(kingy.ai/blog/gpt-6-sol-luna-specs-benchmarks-pricing-comparison) - 确认 Opus 5.5 和 GPT-6 Sol/Luna 定价及 benchmark 数据,与 Jerry Liu 帖一致。
-
Ena Pragma 独立评论(enapragma.co) - 第三方技术评论,提供了 LlamaParse Agentic Plus(90.2)和 Agentic(87.0)具体分数、Opus 5.5 各维度分项得分(visual grounding 63.2、tables 93.9、content faithfulness 91.8),并指出 LlamaParse 在其自建 benchmark 上排名靠前存在利益冲突。
交叉验证结论
| Claim | 状态 |
|---|---|
| 16 款 VLM 包括 Opus 5.5、GPT-6 Sol/Luna | ✅ 多源确认 |
| Opus 5.5 综合 78.0(第 8) | ✅ Ena Pragma + Leaderboard 数据一致 |
| Opus 5.5 tables 得分 93.9(第 1) | ✅ Ena Pragma 引用 Leaderboard 原始数据 |
| LlamaParse Agentic 综合 87.0(第 2) | ✅ Ena Pragma 报告数据 |
| effort 提升对文档解析效果不必然 | ⚠️ 原帖主张;benchmark 覆盖 16 款 VLM 的 effort 设置数据原帖未直接给出,Ena Pragma 文章亦未复现该实验;视为 Jerry Liu 团队内部评测结论,第三方尚未独立复现 |
| Opus 5.5 是性价比最佳前沿 VLM | ⚠️ 原帖主张;定价 $4/$20 每百万 token 与 LlamaParse Agentic 1.25¢/page 差距较大,但价格维度两者不可直接比(VLM 按 token 收费,LlamaParse 按页收费),需用户自行核算 |
| LlamaParse Agentic Plus 90.2,Agentic 87.0 | ✅ Ena Pragma 报告 |
上手步骤
1. 查看 ParseBench 完整排行榜
访问 parsebench.ai,下载 grading code 和数据集(Apache 2.0),在本地 rerun 评测:
# Clone ParseBench
git clone https://github.com/run-llama/parsebench.git
cd parsebench
pip install -e .
2. 在自己的文档集上跑对比评测
from parsebench import evaluate
results = evaluate(
model="claude-opus-5.5", # 或 "gpt-6-luna" 等
documents="./your_test_set/",
dimensions=["tables", "charts", "content_faithfulness",
"semantic_formatting", "visual_grounding"],
effort="medium" # low / medium / high / xhigh / max
)
print(results)
3. 在 Agent loop 里快速路由
如果懒得集成专门 OCR,但又要保证基本质量:
# Op1: 直接用 Opus 5.5 解析表格(它的强项)
if doc.has_tables:
result = opus55.parse(doc) # tables 得分 93.9
# Op2: 其他页走 LlamaParse Agentic(更便宜)
else:
result = llamaparse_agentic.parse(doc)
4. 按场景选型三 regimes
Jerry Liu 描述了三种文档解析场景,对应不同方案:
- 高精度场景(保险理赔、财务审计):LlamaParse Agentic Plus ≈ 5.6¢/页
- 大规模低成本索引(日处理百万页):LlamaParse 低价档 ≈ 0.4¢/页
- Agent loop 实时解析(Codex/Claude Code 内嵌):Opus 5.5,5.8¢/页,表格任务首选
坑与适用边界
⚠️ Vendor Benchmark 利益冲突
ParseBench 由 LlamaIndex(销售 LlamaParse 的公司)建设和维护。其自营产品 LlamaParse Agentic/Agentic Plus 在排行榜上位居前二。
- Ena Pragma 指出:"Every vendor wins its own benchmark" — 这不意味着数据造假,但意味着 benchmark 的评分权重和数据集可能偏向 LlamaIndex 的产品优势维度。
- 建议:不要仅凭 ParseBench 排名做采购决定;在自己的真实文档样本上跑评测,ParseBench 提供开源 grading code 支持自评。
⚠️ effort 结论的独立复现问题
"effort 提升对文档解析不必然带来增益" 这一核心 claim 是 Jerry Liu 团队内部评测结果,原帖未给出 16 款模型各 effort 级别的完整数据表。建议在实际评测中自行验证。
⚠️ LiteParse 不是 "又快又准"
LiteParse(LlamaIndex 免费开源 Rust 解析器)在无 VLM 方案中排名第 99/112(得分 36.9/100),不适用于需要高准确率的字段提取。Jerry Liu 把它定位为"第一遍快速扫描 + 困难页 Escalate to VLM"的过滤层,而非最终答案。
⚠️ VLM vs 专用 OCR 的边界
通用 VLM 在以下维度仍有明显差距: - Visual grounding:Opus 5.5 63.2 vs LlamaParse Agentic 84.3(差距 21 分) - Charts:Opus 5.5 64.1(同上) - VLM 在 content faithfulness(Opus 5.5: 91.8)上与 LlamaParse Agentic(91.8)持平,说明纯文本提取并非痛点。
一句话结论
在 Agent loop 里做文档解析:Opus 5.5 是目前性价比最优的前沿 VLM(尤其擅长表格),但大规模或高准确率场景仍应选专用 OCR(如 LlamaParse);effort 越高不等于效果越好,需在真实文档上实测后再决定 effort 档位。