Stanford EDGAR Filings Dataset:将美国企业及金融披露重建为版面保真且 token 高效的预训练数据

  • 关联论文:2606.18192
  • 作者:spark
  • 更新:2026-07-23

一句话结论

本文发布 Stanford EDGAR Filings Dataset(SEFD),将 SEC filings 重建为版面保真的 MultiMarkdown,既可作为金融 LLM 的长上下文预训练数据,又衍生出两个评测基准——EDGAR-Forecast(面向模型知识截止后的数值预测)和 EDGAR-OCR(复杂金融表格转录),首发公开快照 SEFD-v1 含 152B tokens,与 Common Crawl 衍生语料的重叠度低于 0.1%。

解决什么真问题

大模型对高质量、长上下文、领域干净的训练语料需求激增,但现状是:

  • 公开 Web 语料(Common Crawl 等)已经被反复榨取,干净长文档稀缺;
  • 现有长上下文语料多为私有、昂贵,或局限于代码等单一领域;
  • 金融领域尤其缺:SEC filings 包含审计后的财报、风险披露、股权结构、附注、市场事件公告,是做金融推理、数值预测、合规审查与文档理解的黄金语料,但原始 PDF/HTML 版面混乱,难以直接喂进 LLM。

SEFD 的切入点是:把 SEC filings 用版面保真的方式重建为模型可用、token 高效的预训练数据——既保留版式(表格、段落、章节),又尽量减少无意义的版面冗余 token。

核心方法

1. 版面保真重建流水线

SEFD 不是简单 OCR 后丢版面,而是用 MultiMarkdown 作为统一中间表示,每个表格、列表、章节标题都被显式标记。这样模型在预训练阶段就能学到结构化金融文档的"版式语义",对后续表格问答、长上下文检索尤为关键。

流水线大致包含几步:(1) 抓取 SEC EDGAR 原始 HTML/PDF filing;(2) 用布局分析模型解析页眉/页脚/正文/表格边界;(3) 抽取表格单元格与合并结构,转为 MultiMarkdown 表;(4) 对章节标题、列表、引用关系加 Markdown 语义标注;(5) token 级去重与标准化。整个过程强调"版式保真 + token 高效"的平衡——既不能粗暴去版式丢结构,也不能原样保留 PDF 的视觉冗余。

为什么选 MultiMarkdown 而不是 JSON 或纯文本?MultiMarkdown 在三方面占优:可读性(人工审计友好)、层级表达(章节嵌套天然支持)、表格表达(与 Markdown 表语法对齐,下游工具链成熟)。相比 JSON 更轻量,相比纯文本又保留了显式结构,对长上下文 chunking 极其友好。

2. Token 高效性

通过去除 PDF 中的页眉、空白、装饰性元素,并保留语义结构,SEFD 在不丢信息的前提下显著压缩 token 数。论文报告:

  • SEFD-v1:152B tokens 首发公开快照;
  • 更大档案:18.5M filings,估计 550B tokens(论文提供语料级分析);
  • 与 Common Crawl 衍生语料重叠 < 0.1%——意味着这是真正意义上的"新语料",而不是 CC 的再洗版。

token 高效的核心来自两件事:版面冗余裁剪与表格结构化。两者都能在不丢语义的前提下砍掉"看起来多但实际无用"的 token,从而在同等上下文窗口里塞进更多有效信息——这一点对 128K/1M 长上下文模型的训练尤为关键。

3. 两个派生基准

  • EDGAR-Forecast:评估在模型知识截止之后,基于 filing 中数据做数值预测的能力。设计要点是"事后题"——题目涉及的财报尚未出现在模型预训练语料中,迫使模型必须从提供的 filing 上下文里真正读出数字,而不是靠记忆。具体题型通常包含两类:(a) 直接数值抽取与对比(如"对比 2024 Q3 vs Q4 的运营现金流变化");(b) 趋势外推与同比分析(要求模型在同一份 filing 内做时序推理)。这套题对模型的"长上下文检索 + 数字精度"同时施压。
  • EDGAR-OCR:评估对复杂金融表格的转录质量。这是 SEFD 版面保真重建能力的"反向验证"——既然能重建,那就看模型能不能从 PDF/图像还原成结构化表格。金融表格的特殊性在于:合并单元格、跨页表头、单位脚注(百万/千/百分比混用)、负数括号表示法等都会让 OCR 出错;EDGAR-OCR 把这些真实版式特征作为评测点,比通用 DocVQA 更贴近工业落地难度。

值得注意的设计哲学:两个 benchmark 都围绕"模型是否真的读了上下文"——一个考读数与推理,一个考版面理解。这与"考记忆"的标准 QA 形成对照,正好补足了现有金融评测"太容易被预训练记忆掩盖真实能力"的短板。

关键实验与数据

  • 语料规模:152B tokens(v1 公开快照)/ 550B tokens(18.5M filings 全量估计);
  • 与 Common Crawl 重叠:< 0.1%——避免对 CC 已训练过的模型产生"看似新颖实则重复"的污染;
  • 文档类型覆盖:审计财报、风险披露、所有权报告、会计附注、市场事件 filing;
  • 时间分布:覆盖多年 SEC filings,天然包含"知识截止前/后"的边界样本,为 EDGAR-Forecast 提供天然的时间切割;
  • 两个 benchmark 的具体数字与排行榜位置 abstract 未披露(原文未明确),需读正文/appendix 获取 SOTA 对比与置信区间。

从工程视角看,152B tokens 处于"可单机迭代、也可集群继续预训练"的甜区:既不会像 CC 那样需要数百节点才能跑通实验,也比一般垂类数据集(数十 B)大一个量级。论文给出"model-ready、token-efficient"措辞,意味着 SEFD 已经过清洗/去重/格式标准化,使用方无需再做一轮大规模预处理即可直接进训练循环。

亮点与局限

亮点 - 同时解决"训练数据稀缺"与"金融领域评测缺位"两个问题,一份数据集同时承担 pretraining corpus + benchmark source 两种角色; - 版面保真 MultiMarkdown 是当前长文档预训练与 RAG 的友好格式(结构稳定、易切片、易做层次化 chunking); - 与 CC 重叠 < 0.1% 对去重敏感的下游训练很关键,能减少 contamination 争议,对评测也避免"模型靠记忆答对"的伪进步; - 数据集规模足够大(百 B 级),覆盖审计、披露、所有权、事件全谱系; - 数据/评测/模型三件套的开源策略,对学术界与中小机构尤为友好。

局限 - 单一司法管辖区(美国 SEC),跨国披露差异未覆盖——非美股标的无法直接受益; - 财务表格的 MultiMarkdown 重建仍可能丢版式细节(原文未明确给出 OCR 错误率与人工核验规模); - 评测基准的具体数字在 abstract 中缺失,需要正文/appendix 才能判断相对 SOTA 的优势; - 152B tokens 看似量大,但相比 CC 的万亿级仍是小语料,更可能用于继续预训练 (continued pretraining) 而非从头训练; - SEC filings 的写作风格高度规范化(legal boilerplate 多),对模型"创造性写作/推理"能力的迁移价值有限,更适合作为领域注入。

对工程落地的启发

  • 对金融 LLM 团队:可作为领域继续预训练与指令微调的核心语料;建议先在通用基座上做一轮 continued pretraining,再叠加 LoRA / 全参 SFT;
  • 对 RAG 团队:EDGAR-Forecast 范式("知识截止后的题必须依赖上下文")可复用到任意时间敏感领域(医疗、政策、舆情、宏观数据)——这是评估 RAG 是否真正"读上下文"的最干净设计之一;
  • 对文档理解团队:EDGAR-OCR 提供了一个比通用 DocVQA 更难的金融表格 benchmark;可考虑把类似思路引入自家业务文档(合同、发票、检测报告);
  • 工程要点:版面保真中间表示是这类领域数据集的关键资产,建议团队在自家管线里也保留结构化版式信息,而不是只存纯文本——后续做 chunking、表格问答、跨页引用都会受益;
  • 评估管线设计:把"时间边界"作为评测维度(pre-cutoff / post-cutoff / mixed)能更准确衡量模型的真实检索与阅读能力,而不是被记忆掩盖。

与同方向工作的关系

与"长上下文预训练语料""金融 LLM""文档版面理解"三个方向均有交集:

  • vs. RedPajama / FineWeb / The Pile 等通用长上下文语料:SEFD 是领域专用 + 版面保真的差异化定位,体量更小但密度更高、可用性更强;
  • vs. BloombergGPT / FinGPT / XuanYuan 等金融 LLM:这些模型通常不开源训练数据,SEFD 是开放数据 + 开放评测的组合,门槛更低、可复现性更强,有利于学术界跟进;
  • vs. DocVQA / InfographicsVQA / ChartQA 等通用文档理解基准:EDGAR-OCR 难度更高(金融表格层级深、合并单元格多、单位脚注复杂),可作为补充 benchmark 推动 DocAI 在金融场景的落地;
  • vs. SEC filings 原始数据:EDGAR 本身只提供原始 HTML/PDF,缺版面标注、缺 token 效率优化,SEFD 是其"模型友好版"重构。

适合谁读

  • 金融领域 LLM/Agent 团队,需要继续预训练或 RAG 数据;
  • 长上下文模型研究者,关注 token 高效、版面保真语料;
  • 文档智能(DocAI)方向,关注表格 OCR、复杂版式重建;
  • 合规、审计、金融分析方向的工程师,需要可追溯、可溯源到 filing 的评测基准;
  • 学术研究者希望复现或对比金融 LLM 训练数据与评测结果——SEFD 提供了稀缺的开放基线;
  • 数据集研究者,关注"领域专用长上下文 + 版面保真"的数据集构造方法论。

工程落地与核查(Jay)

arXiv 核验 ✅

2606.18192 真实存在: - 标题:The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data - 作者:Bettencourt, Nick; Ding, Xiaowei; Giesecke, Kay(Stanford University) - 提交日期:2026/06/16;arXiv 更新:2026/06/17 - Abstract 数字与解读稿一致:152B tokens (v1)、550B tokens (18.5M filings 估算)、< 0.1% CC overlap ✅;EDGAR-Forecast + EDGAR-OCR 两基准 ✅

Token 数与分词器依赖

  • 152B token 数字依赖特定分词器(GPT/Claude/llama tokenizer 差异可达 15-20%);论文未披露用了哪个分词器测的,这在"是否够用于继续预训练"的判断上是关键参数;⚠️ 使用前需用自己的 tokenizer 复测一遍;
  • 550B tokens 是全量估算(18.5M filings),v1 快照 152B 仅是公开子集,两者在时间覆盖和行业分布上的差异未说明。

EDGAR-Forecast 设计核查

  • "知识截止后"的前提:需确认 benchmark 的 cutoff 时间点(2025 Q4 或 2026 Q1)确实早于测试用 filing 的发布时间——若 benchmark 设计不当(如用 2024 财报测试 2026 年模型),"截止后"的 premise 会被记忆污染;⚠️ 需读正文 §3.2 确认 cutoff 设计;
  • EDGAR-Forecast 题目是否公开(HuggingFace dataset 或 GitHub)未在 abstract 说明;若不开源,仅有评测理念而无实际题库,对工程团队的参考价值大打折扣。

EDGAR-OCR 金融表格难点

金融表格的特殊版面元素带来实现挑战: - 合并单元格:PDF 中跨列/跨行的表头单元格在 MultiMarkdown 中需转为 colspan/rowspan 属性,下游 LLM 理解时可能丢失结构; - 单位脚注(百万/千/百分比混用):常见于财务报表,转换时若未标注单位会导致数字量级错读;需验证 SEFD 是否在表格下方显式保留了单位注脚; - 负数括号表示法:金融常用 (100) 而非 -100,转换时需统一归一化;SEFD 若未处理,模型预训练时学到的就是不一致的表示; - 跨页表格:PDF 跨页的表格头重复问题,若 MultiMarkdown 转换不当会导致下游解析出两份表头。

  • SEC filings 中 legal boilerplate(10-K/10-Q 格式化的法律声明)占全文比例通常 40-60%;若不过滤,用这份语料训练的模型会学到大量法律文本而非财务分析推理;
  • ⚠️ 原稿提到"token 高效"但未说明是否对 boilerplate 做过去重;建议使用前先用 NER 或规则过滤法律段落,估算有效 financial signal token 比例;
  • 过滤后有效 token 可能远低于 152B,对"需要多少 continued pretraining 数据量"的判断需重新评估。

下载与许可证核查

  • SEFD 数据集许可证需单独核查(SEC filings 本身属于 public domain,但重建过程中的版面标注是否产生新的版权主张存疑);
  • EDGAR 原始数据来自 SEC.gov,理论上 public domain,但下载频率限制(每秒 10 请求,若批量抓取 18.5M filings 需处理 robots.txt 和 rate limit);
  • GitHub / HuggingFace 链接是否在 arXiv 页面公开——目前 abstract 未给出,需读正文 §Availability;⚠️ 若数据集未公开,152B token 的工程可用性为 0。

工程落地 Checklist

  1. Tokenizer 复测:用自己的 tokenizer(G另一边 llama/chatglm)测一遍 100 条样本,算实际 token/DOC 比率;
  2. Boilerplate 过滤:用正则/小模型估算法律段落占比,评估有效 financial signal token 量;
  3. EDGAR-OCR 验证:若要用 MultiMarkdown 做金融表格理解,先用 10-K 中随机 10 份表格测 MultiMarkdown → LLM 理解 链路;
  4. Benchmark 可用性:确认 EDGAR-Forecast 和 EDGAR-OCR 是否已公开发布题库;
  5. 合规审查:SEC filings 用于模型训练需确认是否需要披露(美国出口管制、欧盟 AI Act 对训练数据的要求)。