RAG 2026 新框架:文档上下文层 = Agent Harness + 上下文层 · 干货攻略

  • 链接: https://www.youtube.com/watch?v=RQi7x-navxU
  • 分类: x-tips
  • 来源: X @jerryjliu0
  • 作者: Jay
  • 更新: 2026-10-06

这是什么

2026年9月,LlamaIndex CEO Jerry Liu 在 AI Engineer World's Fair 2026(AI工程师世界博览会)发表了一场21分钟演讲,标题为 "Building the Document Context Layer for AI Agents"(为 AI Agent 构建文档上下文层)。这场演讲的核心论点是:

RAG 在 2026 年的形态,已不再是"一个框架",而是由两个清晰分层组成的系统——Agent Harness(Agent 编排层)和 Document Context Layer(文档上下文层)。

Agent Harness(Agent 编排层) 负责推理、决策和工具调用循环;Document Context Layer(文档上下文层) 负责把原始文档转化为 Agent 可读、可搜索的上下文。LlamaIndex 的战略定位因此从" RAG 框架"转向"AI Agent 的文档基础设施"。

演讲还系统拆解了文档解析为什么在2026年仍然是未解决的难题,发布/宣布了三项关键工程成果:ParseBench 评测基准(arXiv:2604.08538)、LiteParse 开源解析器(Apache 2.0,Rust)、以及 LlamaParse ChatGPT 原生连接器(2026年9月9日上线)。


为什么值得关注

谁分享的,解决什么问题

Jerry Liu 是 LlamaIndex(一个开源框架兼企业平台)的联合创始人兼 CEO。LlamaIndex 最初以"RAG 框架"闻名,创造了 Advanced RAG 等方法。到2026年,它的定位已演变为"AI Agent 的主要文档基础设施"——帮助 AI 系统理解文档、自动执行知识工作。

这次演讲要回答的问题是:在 Agent 能力快速进化的背景下,RAG 的基础设施应该如何重新组织?文档层为什么是限制 Agent 落地的最大瓶颈?

从 Naive RAG 到 Agentic RAG 的范式转移

Jerry Liu 追溯了从 2023 年1月"Naive RAG"到2026年的完整演进路径:

时间节点 范式 核心特征
2023年1月 Naive RAG 语料分块 → Embed → 向量数据库 → 固定 Top-K 检索 → LLM 生成
2024年 Advanced/Agentic RAG 引入 reranking、多步检索、Agent 循环,但仍受 Top-K 限制
2026年 Agent Harness + Context Layer 检索复杂性完全移入 Agent 自身;文档上下文层专职负责解析与存储

范式转移的关键逻辑: 2026年 Agent 循环和工具调用能力大幅提升,搜索复杂性可以交给 Agent 自行推理决定(而不是在检索层打补丁)。这使得 Agent 与文档的交互界面可以独立开来,各司其职。

文档为什么是最大瓶颈

Jerry Liu 给出了一个反直觉但令人信服的结构性论断:AI Agent 是新的知识工作者,但大多数知识工作依赖的是非结构化文档,而解锁这些文档上下文是尚未解决的难题。 他引用了一个数字:全球 PDFs、PowerPoints、Word 文档、Excel 表格中锁定了超过 10 万亿页(10 trillion+ pages) 人类知识。这个数字来自原演讲陈述,是 Jerry Liu 的框架性断言,未经独立来源核验,标注为「原帖主张」。


核验过程

官方来源

来源 链接 用途
YouTube 演讲(官方发布) https://www.youtube.com/watch?v=RQi7x-navxU 全部核心论点、三层架构、PDF 是绘制而非书写、LiteParse 介绍
ParseBench GitHub https://github.com/run-llama/ParseBench 数据规模、评测维度、14种方法评测结果、开放许可证(Apache-2.0)
ParseBench arXiv 论文 https://arxiv.org/html/2604.08538 评测配置(~2,000 页、169K+ 测试规则、5 个维度)
ParseBench 官方博客 https://www.llamaindex.ai/blog/parsebench LlamaParse Agentic 排名第一、评测数据集来源(保险/金融/政府)
LlamaIndex GitHub (v0.14.25) https://github.com/run-llama/llama_index 最新版本发布日期(Sep 21, 2026)、LiteParse 相关代码存在
LiteParse GitHub https://github.com/run-llama/lite_parse 开源协议(Apache 2.0)、Rust 实现、v2 发布时间(June 2026)
Jerry Liu LinkedIn https://www.linkedin.com/posts/jerry-liu-64390071_building-the-document-context-layer... LlamaParse ChatGPT 连接器上线时间(Sep 9, 2026)
Jerry Liu X (@jerryjliu0) https://x.com/jerryjliu0/status/2040113414723514859 LiteParse 样本仓库、LiteParse 定位(free + fast,~500 pages in 2 seconds)
Medium (Miles K.) ParseBench 解读 https://medium.com/@milesk_33/parsebench-the-document-parsing-benchmark-for-ai-agents-97f16840c4bd LiteParse no-OCR 配置排名数据(99th/112,score 36.9)
Pynions LlamaIndex 指南 https://pynions.com/llamaindex LiteParse v2.1 June 2026 发布、与 PyMuPDF4LLM 等对比数据
BigGo Finance 演讲摘要 https://finance.biggo.com/podcast/63b6233c976108bf 演讲完整框架、三层架构、低延迟 LightParse/ LiteParse 宣布

交叉验证结论

已核验(与官方来源一致): - ParseBench 评测规模:~2,000 页(来自 >1,100 份真实企业文档)、169K+ 测试规则——arXiv 论文与官方博客一致 - 评测五个维度:表格、图表、内容忠实度、语义格式、视觉定位——GitHub README 与论文一致 - LiteParse:Apache 2.0 协议、Rust 实现、无需 GPU——GitHub 与 LinkedIn 帖子一致 - LlamaParse Agentic 在 ParseBench 上排名第一——官方博客与 Medium 评测一致 - LlamaParse ChatGPT 连接器上线时间:2026年9月9日——Jerry Liu LinkedIn 帖子可核验 - LiteParse 发布:2026年6月(v2/v2.1)——多方来源一致

原帖主张(未能独立核验): - "10 万亿页"人类知识锁在文档中——Jerry Liu 演讲陈述,无其他独立来源;本文标注为「原帖主张」 - 演讲中 Jerry Liu 称 ParseBench 评测了"约50个模型"——ParseBench 官方 GitHub 列出的 paper 版本为 14 种方法;完整 leaderboard 包含更多提交配置,两者口径不同;采信 GitHub 官方数字 14 种方法,演讲数字作为参考

与原帖无冲突的官方确认点: - PDF 本质论断(glyphs with coordinates)来自 Jerry Liu 演讲,为领域共识性表述,与 ParseBench 论文对 PDF 结构描述一致 - 三层架构(parsing / semantic storage / document workflows)为 Jerry Liu 框架性表述,已通过演讲、LinkedIn、第三方摘要等多渠道交叉印证


上手步骤

了解三层架构的工作职责

Jerry Liu 的三层文档平台各层职责如下:

① 解析层(Parsing) —— 将 PDF 等原始文档转换为结构化标记(token 高效的 Markdown)和元数据。核心挑战:多栏阅读顺序、表格线条坐标、语义结构重建。

② 语义存储层(Semantic Storage) —— 作为文档管理系统,同时服务于人类和 Agent 的检索需求。支持文档级语义搜索,而不仅仅是 chunk 级向量检索。

③ 文档工作流层(Document Workflows) —— 针对发票处理、KYC(了解你的客户)、保险理赔等可重复场景,构建专用工作流,精细控制成本与准确率。

使用 ParseBench 评估你的解析方案

Step 1 — 了解评测维度

ParseBench 覆盖五个维度,每个维度针对一个生产级 Agent 工作流中的高频失败模式:

  • 表格(Tables):503页,来自保险SERFF申报、金融政府文档;含合并单元格、分层表头、跨页表格
  • 图表(Charts):支持 bar、line、pie、compound 四类;解析整个 PDF 页面而非裁剪图表区域
  • 内容忠实度(Content Faithfulness):解析内容是否忠实于原始 PDF
  • 语义格式(Semantic Formatting):标题层级、列表、段落结构是否保留
  • 视觉定位(Visual Grounding):元素空间位置是否正确映射

Step 2 — 查看公开 Leaderboard

  • 官网:https://www.parsebench.ai
  • 原始数据:https://github.com/run-llama/ParseBench(leaderboard.csv)
  • HuggingFace 数据集:llamaindex/ParseBench

Step 3 — 用自己的解析器跑分

# 克隆评测代码
git clone https://github.com/run-llama/ParseBench.git
cd ParseBench

# 查看评测脚本(具体命令见仓库 README)
# 评测配置:~2,000 页,169K+ 测试规则
python evaluate.py --parser your_parser --output results.json

运行自己的解析器在代表性样本上,官方称"大多数团队都会发现至少一个之前未知的失败模式"。

使用 LiteParse:免 GPU 本地快速解析

LiteParse v2/v2.1(2026年6月)是一个无需 GPU、模型无关的开源 PDF 解析器,Rust 实现,Apache 2.0 协议。

# 安装(Python binding)
pip install lite-parse

# 基本使用
from lite_parse import parse

result = parse("document.pdf")
# 返回:Markdown + bounding box 元数据(可用于后续引用定位)

# 速度参考:~500 pages in 2 seconds(无 GPU)
# 开源协议:Apache 2.0
# GitHub:https://github.com/run-llama/lite_parse

Jerry Liu 在演讲中建议的 Agent 内解析策略(两阶段处理):

阶段一(低延迟):LiteParse 快速扫描 → 识别需要深入处理的关键页面
阶段二(按需):LlamaParse(商业版,基于 VLM)→ 高精度解析关键页面

LlamaParse:针对生产级高精度场景

LlamaParse 是 LlamaIndex 的商业文档解析服务,提供 Parse(文档转结构化)、Extract(字段提取)、Index(建立索引)三大能力。

# LlamaParse Python SDK
pip install llama-index-parsers llamaparse

# LlamaParse ChatGPT 连接器(2026年9月9日上线)
# 从 ChatGPT 原生调用 LlamaParse 解析文档
# 参考:https://docs.llamaparse.com

三种场景推荐方案

场景 推荐方案 理由
高精度受监管金融 LlamaParse(商业) regulated industries,错误成本极高
百万文档每日索引 LiteParse(免费开源) 低成本批量处理,接受少量错误
Agent 循环内千张上传/分钟 LiteParse → LightParse 超低延迟,按需升级到 VLM 解析

坑与适用边界

坑 1:LiteParse 在 ParseBench 上排名靠后

第三方独立评测(Medium @milesk_33)显示,截至2026年9月23日,LiteParse no-OCR 配置在 ParseBench 总榜排名 99th/112(得分 36.9),在开源本地解析器中排名第三(落后于 PyMuPDF4LLM 的 53.5 和 Warp Ingest 的 40.2)。Jerry Liu 在演讲中称其为"最快的开源解析器",速度优势确实存在,但精度在某些任务上仍有差距。选型时需要结合自身场景判断:LiteParse 适合作为 Agent 内循环的快速预扫描,而非最终高精度解析的主力。

坑 2:ParseBench 的商业立场

ParseBench 由 LlamaIndex 自家发布,LlamaParse Agentic 在自家基准上排名第一,这一商业动机需要纳入考量。但 ParseBench 本身是开放的:数据集公开(llamaindex/ParseBench)、评测代码开源(Apache-2.0)、Leaderboard CSV 可下载——任何人都可以复现或质疑排名。 相比闭源基准,这已经是较高的透明度。

坑 3:"10 万亿页"数字无法独立核验

Jerry Liu 在演讲中提出"全球文档中锁定了超过 10 万亿页人类知识"。这是一个框架性断言,旨在强调文档解析的重要性,但该数字本身没有给出具体来源。使用这一数字时应注明为「原帖主张」,不应在严谨写作中当作可引用的事实数据。

坑 4:PDF 解析20年未解决——但 VLM 正在快速逼近

Jerry Liu 的核心论点是"PDF 是绘制出来的,不是写出来的",这解释了为什么即使 LLM 能力爆炸,文档解析仍是 AGI 级别难题。但 ParseBench 的评测数据显示,当前 VLMs 已在部分维度上逼近专用解析器——"未解决"不等于"无法解决",而是意味着精度和成本的 Pareto 前沿仍在快速移动。

适用边界

  • 本攻略适用于正在构建或评估 RAG/Agent 文档处理 pipeline 的工程师和研究人员
  • 不适用于纯理论研究——Jerry Liu 的框架是工程视角,而非理论贡献
  • 评测结论(LiteParse vs LlamaParse vs 其他)仅反映截至2026年9月的状态,文档解析领域进展迅速

一句话结论

Jerry Liu 的 2026 RAG 新框架将文档基础设施拆分为 Agent Harness + Document Context Layer,核心瓶颈从"检索算法"转移到"文档解析"——而 ParseBench(开源评测基准)和 LiteParse(Apache 2.0 开源解析器)+ LlamaParse(商业服务)共同构成了当前应对这一瓶颈的工具全家桶;选型时记住:LiteParse 速度快但精度有限,高精度场景用 LlamaParse,快速 Agent 内循环预扫描用 LiteParse,两阶段结合是当前最优工程实践。