RAG 2026 新框架:文档上下文层 = Agent Harness + 上下文层 · 干货攻略
- 链接: https://www.youtube.com/watch?v=RQi7x-navxU
- 分类: x-tips
- 来源: X @jerryjliu0
- 作者: Jay
- 更新: 2026-10-06
这是什么
2026年9月,LlamaIndex CEO Jerry Liu 在 AI Engineer World's Fair 2026(AI工程师世界博览会)发表了一场21分钟演讲,标题为 "Building the Document Context Layer for AI Agents"(为 AI Agent 构建文档上下文层)。这场演讲的核心论点是:
RAG 在 2026 年的形态,已不再是"一个框架",而是由两个清晰分层组成的系统——Agent Harness(Agent 编排层)和 Document Context Layer(文档上下文层)。
Agent Harness(Agent 编排层) 负责推理、决策和工具调用循环;Document Context Layer(文档上下文层) 负责把原始文档转化为 Agent 可读、可搜索的上下文。LlamaIndex 的战略定位因此从" RAG 框架"转向"AI Agent 的文档基础设施"。
演讲还系统拆解了文档解析为什么在2026年仍然是未解决的难题,发布/宣布了三项关键工程成果:ParseBench 评测基准(arXiv:2604.08538)、LiteParse 开源解析器(Apache 2.0,Rust)、以及 LlamaParse ChatGPT 原生连接器(2026年9月9日上线)。
为什么值得关注
谁分享的,解决什么问题
Jerry Liu 是 LlamaIndex(一个开源框架兼企业平台)的联合创始人兼 CEO。LlamaIndex 最初以"RAG 框架"闻名,创造了 Advanced RAG 等方法。到2026年,它的定位已演变为"AI Agent 的主要文档基础设施"——帮助 AI 系统理解文档、自动执行知识工作。
这次演讲要回答的问题是:在 Agent 能力快速进化的背景下,RAG 的基础设施应该如何重新组织?文档层为什么是限制 Agent 落地的最大瓶颈?
从 Naive RAG 到 Agentic RAG 的范式转移
Jerry Liu 追溯了从 2023 年1月"Naive RAG"到2026年的完整演进路径:
| 时间节点 | 范式 | 核心特征 |
|---|---|---|
| 2023年1月 | Naive RAG | 语料分块 → Embed → 向量数据库 → 固定 Top-K 检索 → LLM 生成 |
| 2024年 | Advanced/Agentic RAG | 引入 reranking、多步检索、Agent 循环,但仍受 Top-K 限制 |
| 2026年 | Agent Harness + Context Layer | 检索复杂性完全移入 Agent 自身;文档上下文层专职负责解析与存储 |
范式转移的关键逻辑: 2026年 Agent 循环和工具调用能力大幅提升,搜索复杂性可以交给 Agent 自行推理决定(而不是在检索层打补丁)。这使得 Agent 与文档的交互界面可以独立开来,各司其职。
文档为什么是最大瓶颈
Jerry Liu 给出了一个反直觉但令人信服的结构性论断:AI Agent 是新的知识工作者,但大多数知识工作依赖的是非结构化文档,而解锁这些文档上下文是尚未解决的难题。 他引用了一个数字:全球 PDFs、PowerPoints、Word 文档、Excel 表格中锁定了超过 10 万亿页(10 trillion+ pages) 人类知识。这个数字来自原演讲陈述,是 Jerry Liu 的框架性断言,未经独立来源核验,标注为「原帖主张」。
核验过程
官方来源
| 来源 | 链接 | 用途 |
|---|---|---|
| YouTube 演讲(官方发布) | https://www.youtube.com/watch?v=RQi7x-navxU | 全部核心论点、三层架构、PDF 是绘制而非书写、LiteParse 介绍 |
| ParseBench GitHub | https://github.com/run-llama/ParseBench | 数据规模、评测维度、14种方法评测结果、开放许可证(Apache-2.0) |
| ParseBench arXiv 论文 | https://arxiv.org/html/2604.08538 | 评测配置(~2,000 页、169K+ 测试规则、5 个维度) |
| ParseBench 官方博客 | https://www.llamaindex.ai/blog/parsebench | LlamaParse Agentic 排名第一、评测数据集来源(保险/金融/政府) |
| LlamaIndex GitHub (v0.14.25) | https://github.com/run-llama/llama_index | 最新版本发布日期(Sep 21, 2026)、LiteParse 相关代码存在 |
| LiteParse GitHub | https://github.com/run-llama/lite_parse | 开源协议(Apache 2.0)、Rust 实现、v2 发布时间(June 2026) |
| Jerry Liu LinkedIn | https://www.linkedin.com/posts/jerry-liu-64390071_building-the-document-context-layer... | LlamaParse ChatGPT 连接器上线时间(Sep 9, 2026) |
| Jerry Liu X (@jerryjliu0) | https://x.com/jerryjliu0/status/2040113414723514859 | LiteParse 样本仓库、LiteParse 定位(free + fast,~500 pages in 2 seconds) |
| Medium (Miles K.) ParseBench 解读 | https://medium.com/@milesk_33/parsebench-the-document-parsing-benchmark-for-ai-agents-97f16840c4bd | LiteParse no-OCR 配置排名数据(99th/112,score 36.9) |
| Pynions LlamaIndex 指南 | https://pynions.com/llamaindex | LiteParse v2.1 June 2026 发布、与 PyMuPDF4LLM 等对比数据 |
| BigGo Finance 演讲摘要 | https://finance.biggo.com/podcast/63b6233c976108bf | 演讲完整框架、三层架构、低延迟 LightParse/ LiteParse 宣布 |
交叉验证结论
已核验(与官方来源一致): - ParseBench 评测规模:~2,000 页(来自 >1,100 份真实企业文档)、169K+ 测试规则——arXiv 论文与官方博客一致 - 评测五个维度:表格、图表、内容忠实度、语义格式、视觉定位——GitHub README 与论文一致 - LiteParse:Apache 2.0 协议、Rust 实现、无需 GPU——GitHub 与 LinkedIn 帖子一致 - LlamaParse Agentic 在 ParseBench 上排名第一——官方博客与 Medium 评测一致 - LlamaParse ChatGPT 连接器上线时间:2026年9月9日——Jerry Liu LinkedIn 帖子可核验 - LiteParse 发布:2026年6月(v2/v2.1)——多方来源一致
原帖主张(未能独立核验): - "10 万亿页"人类知识锁在文档中——Jerry Liu 演讲陈述,无其他独立来源;本文标注为「原帖主张」 - 演讲中 Jerry Liu 称 ParseBench 评测了"约50个模型"——ParseBench 官方 GitHub 列出的 paper 版本为 14 种方法;完整 leaderboard 包含更多提交配置,两者口径不同;采信 GitHub 官方数字 14 种方法,演讲数字作为参考
与原帖无冲突的官方确认点: - PDF 本质论断(glyphs with coordinates)来自 Jerry Liu 演讲,为领域共识性表述,与 ParseBench 论文对 PDF 结构描述一致 - 三层架构(parsing / semantic storage / document workflows)为 Jerry Liu 框架性表述,已通过演讲、LinkedIn、第三方摘要等多渠道交叉印证
上手步骤
了解三层架构的工作职责
Jerry Liu 的三层文档平台各层职责如下:
① 解析层(Parsing) —— 将 PDF 等原始文档转换为结构化标记(token 高效的 Markdown)和元数据。核心挑战:多栏阅读顺序、表格线条坐标、语义结构重建。
② 语义存储层(Semantic Storage) —— 作为文档管理系统,同时服务于人类和 Agent 的检索需求。支持文档级语义搜索,而不仅仅是 chunk 级向量检索。
③ 文档工作流层(Document Workflows) —— 针对发票处理、KYC(了解你的客户)、保险理赔等可重复场景,构建专用工作流,精细控制成本与准确率。
使用 ParseBench 评估你的解析方案
Step 1 — 了解评测维度
ParseBench 覆盖五个维度,每个维度针对一个生产级 Agent 工作流中的高频失败模式:
- 表格(Tables):503页,来自保险SERFF申报、金融政府文档;含合并单元格、分层表头、跨页表格
- 图表(Charts):支持 bar、line、pie、compound 四类;解析整个 PDF 页面而非裁剪图表区域
- 内容忠实度(Content Faithfulness):解析内容是否忠实于原始 PDF
- 语义格式(Semantic Formatting):标题层级、列表、段落结构是否保留
- 视觉定位(Visual Grounding):元素空间位置是否正确映射
Step 2 — 查看公开 Leaderboard
- 官网:https://www.parsebench.ai
- 原始数据:https://github.com/run-llama/ParseBench(leaderboard.csv)
- HuggingFace 数据集:
llamaindex/ParseBench
Step 3 — 用自己的解析器跑分
# 克隆评测代码
git clone https://github.com/run-llama/ParseBench.git
cd ParseBench
# 查看评测脚本(具体命令见仓库 README)
# 评测配置:~2,000 页,169K+ 测试规则
python evaluate.py --parser your_parser --output results.json
运行自己的解析器在代表性样本上,官方称"大多数团队都会发现至少一个之前未知的失败模式"。
使用 LiteParse:免 GPU 本地快速解析
LiteParse v2/v2.1(2026年6月)是一个无需 GPU、模型无关的开源 PDF 解析器,Rust 实现,Apache 2.0 协议。
# 安装(Python binding)
pip install lite-parse
# 基本使用
from lite_parse import parse
result = parse("document.pdf")
# 返回:Markdown + bounding box 元数据(可用于后续引用定位)
# 速度参考:~500 pages in 2 seconds(无 GPU)
# 开源协议:Apache 2.0
# GitHub:https://github.com/run-llama/lite_parse
Jerry Liu 在演讲中建议的 Agent 内解析策略(两阶段处理):
阶段一(低延迟):LiteParse 快速扫描 → 识别需要深入处理的关键页面
阶段二(按需):LlamaParse(商业版,基于 VLM)→ 高精度解析关键页面
LlamaParse:针对生产级高精度场景
LlamaParse 是 LlamaIndex 的商业文档解析服务,提供 Parse(文档转结构化)、Extract(字段提取)、Index(建立索引)三大能力。
# LlamaParse Python SDK
pip install llama-index-parsers llamaparse
# LlamaParse ChatGPT 连接器(2026年9月9日上线)
# 从 ChatGPT 原生调用 LlamaParse 解析文档
# 参考:https://docs.llamaparse.com
三种场景推荐方案
| 场景 | 推荐方案 | 理由 |
|---|---|---|
| 高精度受监管金融 | LlamaParse(商业) | regulated industries,错误成本极高 |
| 百万文档每日索引 | LiteParse(免费开源) | 低成本批量处理,接受少量错误 |
| Agent 循环内千张上传/分钟 | LiteParse → LightParse | 超低延迟,按需升级到 VLM 解析 |
坑与适用边界
坑 1:LiteParse 在 ParseBench 上排名靠后
第三方独立评测(Medium @milesk_33)显示,截至2026年9月23日,LiteParse no-OCR 配置在 ParseBench 总榜排名 99th/112(得分 36.9),在开源本地解析器中排名第三(落后于 PyMuPDF4LLM 的 53.5 和 Warp Ingest 的 40.2)。Jerry Liu 在演讲中称其为"最快的开源解析器",速度优势确实存在,但精度在某些任务上仍有差距。选型时需要结合自身场景判断:LiteParse 适合作为 Agent 内循环的快速预扫描,而非最终高精度解析的主力。
坑 2:ParseBench 的商业立场
ParseBench 由 LlamaIndex 自家发布,LlamaParse Agentic 在自家基准上排名第一,这一商业动机需要纳入考量。但 ParseBench 本身是开放的:数据集公开(llamaindex/ParseBench)、评测代码开源(Apache-2.0)、Leaderboard CSV 可下载——任何人都可以复现或质疑排名。 相比闭源基准,这已经是较高的透明度。
坑 3:"10 万亿页"数字无法独立核验
Jerry Liu 在演讲中提出"全球文档中锁定了超过 10 万亿页人类知识"。这是一个框架性断言,旨在强调文档解析的重要性,但该数字本身没有给出具体来源。使用这一数字时应注明为「原帖主张」,不应在严谨写作中当作可引用的事实数据。
坑 4:PDF 解析20年未解决——但 VLM 正在快速逼近
Jerry Liu 的核心论点是"PDF 是绘制出来的,不是写出来的",这解释了为什么即使 LLM 能力爆炸,文档解析仍是 AGI 级别难题。但 ParseBench 的评测数据显示,当前 VLMs 已在部分维度上逼近专用解析器——"未解决"不等于"无法解决",而是意味着精度和成本的 Pareto 前沿仍在快速移动。
适用边界
- 本攻略适用于正在构建或评估 RAG/Agent 文档处理 pipeline 的工程师和研究人员
- 不适用于纯理论研究——Jerry Liu 的框架是工程视角,而非理论贡献
- 评测结论(LiteParse vs LlamaParse vs 其他)仅反映截至2026年9月的状态,文档解析领域进展迅速
一句话结论
Jerry Liu 的 2026 RAG 新框架将文档基础设施拆分为 Agent Harness + Document Context Layer,核心瓶颈从"检索算法"转移到"文档解析"——而 ParseBench(开源评测基准)和 LiteParse(Apache 2.0 开源解析器)+ LlamaParse(商业服务)共同构成了当前应对这一瓶颈的工具全家桶;选型时记住:LiteParse 速度快但精度有限,高精度场景用 LlamaParse,快速 Agent 内循环预扫描用 LiteParse,两阶段结合是当前最优工程实践。