预训练基础模型综述:从 BERT 到 ChatGPT 的发展历程

  • 关联论文:2302.09419
  • 作者:Tom
  • 更新:2026-07-26

一句话结论

Pretrained Foundation Models(PFM)是 AI 基础设施范式的根本转变:一份跨模态(文本/图像/图)的全景式综述,梳理了从 BERT/GPT 到 ChatGPT 的技术演进脉络,并指出 scalability、security、reasoning、cross-domain 是通向 AGI 的四大核心挑战。

解决什么真问题

在 PFM 出现之前,每个 AI 下游任务都需要从头收集标注数据、训练专属模型。BERT(2018)和 GPT 系列证明:在超大规模无标注数据上预训练的通用模型,只需少量微调即可在广泛任务上达到 SOTA。

本文解决的核心问题是:如何系统理解 PFM 的全貌? 不同模态的预训练方法有何关联?有哪些关键问题尚未解决?本文为研究者和工程师提供了统一的知识框架。

核心方法:三大模态的预训练体系

本文综述的核心贡献之一是将 NLP、CV、Graph Learning 三大模态的 PFM 统一到一个框架下描述。

NLP 预训练:从 BERT 到 GPT 系列

BERT 路线(Encoder-only,双向) - 预训练任务:MLM(Masked Language Modeling)+ NSP(Next Sentence Prediction) - 核心创新:双向注意力,能同时看到上下文两侧 - 代表模型:BERT-base/large、RoBERTa、ALBERT、ELECTRA、DeBERTa

GPT 路线(Decoder-only,自回归) - 预训练任务:CLM/Causal LM(下一个 token 预测) - 核心创新:自回归生成,zero-shot/to-few-shot 泛化能力 - 代表模型:GPT-2、GPT-3、InstructGPT、ChatGPT、GPT-4

Encoder-Decoder 路线(完整 Transformer) - 预训练任务:Prefix LM 或 Plain Text-to-Text - 代表模型:T5、BART、UL2

CV 预训练:从有监督到自监督

有监督预训练 - ImageNet 预训练 → 下游任务 Fine-tune - 局限:需要大量人工标注

自监督 CV PFM - MAE(Masked AutoEncoder):遮蔽图像块并重建 - DALL-E/CLIP:图文对比学习 - SAM(Segment Anything Model):统一分割任务

Graph 预训练

  • Graph AutoEncoder、GraphSage、对比学习(GCA)等
  • 节点级/图级任务的双重预训练目标

多模态融合趋势

  • 早期:各模态独立预训练,融合阶段才联合
  • 当下趋势:端到端联合预训练(GPT-4V、Gemini)

预训练任务设计

NLP 中的预训练任务

任务类型 方法 代表模型
LM(语言建模) 自回归预测下一个 token GPT-2/3
MLM(遮蔽 LM) 随机遮蔽 token 并预测 BERT
PLM(Permutation LM) 任意顺序预测 XLNet
DAE(去噪自编码) 文本+噪声→重建 T5、BART
Contrastive 对比正负样本 SimCSE、ECT
Prefix LM 前缀双向,生成单向 T5、UniLM

CV 中的预训练任务

任务类型 方法 代表模型
MAE 遮蔽并重建像素/token MAE、BEiT
CLIP-style 图文对比学习 CLIP、BLIP
重建式 直接重建原始图像 CAE

PFM 的四大核心挑战

本文明确指出通向 AGI 级别 PFM 需要解决:

1. Scalability(可扩展性)

  • 数据 scaling law:数据量、模型参数量与性能的关系
  • 训练稳定性:大模型训练的工程挑战(gradient clipping、mixed precision)
  • 高效推理:蒸馏、量化、剪枝
  • 原文未明确给出 scaling exponents 的具体数字(不同工作的幂律系数有差异)

2. Security(安全性)

  • 对抗攻击:精心设计的输入能诱导模型输出有害内容
  • 隐私保护:模型可能记忆并泄露训练数据中的隐私信息
  • 恶意利用:生成虚假信息、钓鱼内容
  • 版权问题:训练数据的知识产权争议

3. Logical Reasoning(推理能力)

  • 符号推理:形式逻辑、数学证明
  • 多跳推理:需要多步推理链(如 Chain-of-Thought、Tree-of-Thought)
  • 跨模态推理:文本↔图像↔3D 的联合推理
  • 原文未明确各推理能力的量化评测指标

4. Cross-domain Generalization(跨域泛化)

  • 领域适应:从 source domain 到 target domain 的知识迁移
  • 持续学习:避免灾难性遗忘
  • 小样本适应:LoRA、Adapter 等参数高效微调方法

关键技术:参数高效微调

为降低微调成本,涌现出多种 PEFT 方法:

方法 核心思想 代表工作
Adapter 插入小型适配层 AdapterBERT
LoRA 低秩分解更新权重矩阵 LoRA、QLoRA
Prefix Tuning 训练连续 prompt PrefixLM
Prompt Tuning 仅微调 soft prompt P-tuning
BitFit 仅微调偏置项 BitFit

评测基准与下游应用

NLP 评测

  • GLUE/SuperGLUE:综合语言理解评测
  • SQuAD:阅读理解
  • MMLU:多任务知识评测
  • BIG-Bench:200+ 复杂任务评测

多模态评测

  • VQA(视觉问答)
  • MSCOCO Captioning
  • NLVR2

下游应用

  • 文本:摘要、翻译、问答、情感分析、对话系统
  • 图像:分类、分割、检测、生成(扩散模型)
  • :节点分类、链接预测、分子性质预测

亮点与局限

亮点: - 跨模态全景视角在当时(2023年2月)是较为全面的综述 - 明确提出四大核心挑战,为后续研究指明方向 - 作者阵容庞大(18位作者,跨8所机构),综合了多元视角 - 对预训练任务的分类整理清晰,有助于理解各路模型的设计差异

局限: - ChatGPT/GPT-4 的分析较浅,作为调研截止日期附近的最新模型,论文更多是描述性而非深度分析 - 扩散模型(DDPM、Stable Diffusion)在 CV PFM 部分着墨不多,但 2023 年扩散模型已是 CV 生成的主流 - Graph PFM 部分相对薄弱,与 NLP/CV 的深度不成比例 - Scaling law 的讨论停留在定性层面,未给出系统性的实验对比

对工程落地的启发

  1. 模型选型决策:Encoder-only 模型适合理解任务(分类、NER),Decoder-only 适合生成任务,Encoder-Decoder 适合 seq2seq 任务
  2. 微调策略:在资源有限的情况下,优先考虑 LoRA/QLoRA,已能覆盖大多数业务场景
  3. 安全红线:生产系统需要配备对抗性输入检测和输出过滤层
  4. 评测优先:上线前在 MMLU、BIG-Bench 等基准上评估模型能力边界,避免盲目上线
  5. 持续迭代:PFM 领域更新极快,建议每季度重新评估最新模型,重新选择基础模型

与同方向工作的关系

  • 与 Bommasani et al.(Stanford Foundation Model Report,2021)同属早期 PFM 基础综述,但本文更侧重技术细节
  • 与 Brown et al.(GPT-3,2020)的关系:Brown 证明了 scaling 的力量,本文则梳理了整个生态
  • 与后续的 LLM 专项综述(如 Zhao et al. 2023)互补:本文是 2023 年初的快照,后续 LLM 专项综述更聚焦语言模型本身
  • 在图学习领域,与之前 Zhang et al.(Graphormer)等各自独立,本文提供了图 PFM 的统一视角

适合谁读

  • AI 研究者:快速了解 PFM 全貌,建立跨模态认知框架
  • 算法工程师:理解不同预训练范式的优劣,做出更好的模型选型决策
  • 产品/PM:理解 LLM 能做什么、不能做什么,合理设定产品能力边界
  • 学生:PFM/Foundation Model 领域的全景地图,为深入某一方向打下基础

工程落地与核查(Jay)

事实核查

  1. "BERT(2018)和 GPT 系列证明:在大规模无标注数据上预训练的通用模型,只需少量微调即可在广泛任务上达到 SOTA"大体准确,但需注意:BERT 本身并非"无标注数据预训练",其预训练依赖 MLM 任务,本质上是在无标注文本上做自监督;"SOTA"表述视具体任务和时期而定,GPT-2/3 的 zero-shot 能力与"少量微调"路线并不完全相同。
  2. "ChatGPT/GPT-4 的分析较浅" → 这是综述(survey)的通病:截止日期限制使得最新模型无法深入,建议读者把 2302.09419 作为 2023 年初的快照而非持续更新文档。
  3. "扩散模型(DDPM、Stable Diffusion)在 CV PFM 部分着墨不多"准确。该综述截止于 2023 年 2 月,彼时扩散模型已崭露头角但在 CV PFM 框架梳理中确实位置尴尬——可视为该综述的时间局限之一。
  4. NSP 任务存疑:RoBERTa 等后续工作已表明 NSP 对下游任务帮助有限甚至有负面影响,BERT 原论文的 NSP 价值后来被大幅修正;综述中未提及此争议。
  5. "GLUE/SuperGLUE" → GLUE 是评测基准,不是具体模型,表格标注正确;但后文提及"AdapterBERT"等写法略非标准(应为 Adapter-BERT 或 adapter tuning 变体),不影响实质。

可读性精修建议

  1. "Encoder-Decoder 路线(完整 Transformer)" → "完整 Transformer"易误导为"完整编码器+完整解码器",实际是编码器-解码器架构,建议改为"Encoder-Decoder 架构(如 T5)"。
  2. "PFM 是 AI 基础设施范式的根本转变" → "根本转变"偏营销语气,可改为"重要范式转变"更学术。
  3. "作者阵容庞大(18位作者,跨8所机构)" → 综述类文章的大阵容作者并不必然代表质量,建议改为"作者来源多元,跨 8 所机构"。
  4. PLM(Permutation LM)行:XLNet 实际上用的是"双流注意力"实现 permutation,而非简单的"任意顺序预测",措辞略显简化。

工程落地关键坑

  1. Decoder-only vs Encoder-only 选型:GPT 路线生成能力强但推理成本高;BERT 路线推理快但生成弱。实际系统若需同时兼顾理解+生成,建议用 Encoder-Decoder(如 T5/FLAN-T5)而非硬套 GPT 或 BERT 路线。
  2. LoRA/QLoRA 显存:QLoRA 4-bit 量化 + LoRA 在单卡 24GB 上可微调 65B 模型,但收敛速度慢于全量微调,建议先在小模型上验证 pipeline 再 scale up。
  3. PEFT 的坑:Adapter 引入额外推理延迟(每次 forward 多一次 adapter forward);Prefix Tuning 和 Prompt Tuning 在复杂推理任务上效果不如 full fine-tuning;LoRA 是目前工程最成熟的折中方案。
  4. 评测基准的选择:GLUE/SuperGLUE 在 2023 年已被 MMLU 逐渐取代;生产系统应同时在领域专属数据集上评估,避免刷榜。
  5. 安全:RLHF 的隐性幻觉:RLHF 能对齐但也会引入新的 hallucination 模式(过度拒绝回答 vs 过度顺从),ChatGPT/GPT-4 报告中均提及;生产系统用 SFT + DPO 替代 RLHF 可减少这类风险。
  6. 图 PFM 的工程现状:Graph PFM 远不如 NLP/CV PFM 成熟,工业级图模型仍以 GCN/GAT 等轻量架构为主,不建议盲目追 Graph PFM 概念。
  7. 持续学习(Continual Learning):灾难性遗忘问题至今无完美解;工程上常用 EWC、Replay、Adapter 三种策略,各有权衡。
  8. 多模态融合:GPT-4V/Gemini 式的端到端联合预训练仍是闭源或高资源门槛;工程上"各模态独立提取特征 + 简单拼接"的轻量多模态方案更实用。