ChatGPT 是怎么"炼"出来的 —— 一篇被引 153 次的综述,把 BERT/GPT 到 ChatGPT 的演进一次讲透

  • 关联论文:2302.09419

"AI 已经能写邮件、画画、编曲、写代码、做研究助手。" "它是怎么从'只会填空'走到'什么都能聊'的?"

这个故事,不讲 Transformer、不讲 attention 公式也能听明白

arXiv 编号 2302.09419,2023 年 2 月发布的预训练基础模型综述,被引 153 次——它给"从 BERT 到 ChatGPT 的演进"画了一张完整的地图。


一个关键认知先放在前面

过去十年 AI 最大的一次范式转变:从"每个任务训一个模型"变成"一个大模型通吃所有任务"

这件事发生在 2018 年——BERT 和 GPT 几乎同时证明了一件事:

在大规模无标注数据上预训练一个超大模型,然后用少量数据微调,就能在无数下游任务上达到 SOTA。

这就是"预训练基础模型"(Pretrained Foundation Models, PFM)的核心思想。

它的影响远超技术圈: - 教育:语言模型能改作文、能答疑; - 医疗:蛋白质结构预测、医学影像分析; - 创作:绘画、配音、视频生成; - 工业:代码补全、文档摘要、数据分析。

今天你看到的每一个 ChatGPT 类应用,根基都在 2018 年的这一次范式转变


三大流派,三大路线

这篇综述最核心的贡献,是把"看似混乱"的 PFM 世界梳理成三大流派:

🟢 BERT 路线(Encoder-only,双向)

  • 代表模型:BERT、RoBERTa、ALBERT、ELECTRA、DeBERTa
  • 核心思想:双向注意力——读一句话时,左右都看
  • 训练任务:MLM(遮住一个词,猜它是什么)
  • 优势:理解类任务超强(分类、NER、问答)
  • 局限:不会"接着写"——它是"读"模型,不是"写"模型

🟡 GPT 路线(Decoder-only,自回归)

  • 代表模型:GPT-2、GPT-3、InstructGPT、ChatGPT、GPT-4
  • 核心思想:从左到右一个 token 一个 token 写
  • 训练任务:下一个 token 预测
  • 优势:生成类任务无敌,zero-shot 能力惊人(不训练也能干活)
  • 局限:理解类任务不如 BERT(因为它只看上文)

🔵 Encoder-Decoder 路线(完整 Transformer)

  • 代表模型:T5、BART、UL2
  • 核心思想:前半段读,后半段写——既理解又生成
  • 优势:翻译、摘要、seq2seq 任务 SOTA
  • 局限:结构最复杂,工程落地最麻烦

一句话区分三种路线: - BERT = "读完就能答"(理解) - GPT = "接着写下去"(生成) - T5 = "读完之后再写"(理解+生成)


不止文本 —— 三大模态的演进

综述把视角扩展到了文本之外,覆盖了图像和图:

🖼️ 图像预训练

阶段 方法 代表
有监督 ImageNet 预训练 → 微调 ResNet、VGG
自监督 MAE(遮住图块重建) MAE、BEiT
图文对齐 CLIP(把图和文映射到同一空间) CLIP、BLIP
统一分割 SAM(给个点,就能圈出对象) Segment Anything

🕸️ 图(Graph)预训练

  • Graph AutoEncoder、GraphSage、对比学习
  • 用途:社交网络分析、分子性质预测、知识图谱补全
  • 局限:远不如 NLP/CV PFM 成熟,工业界仍以 GCN/GAT 为主

🔀 多模态融合:从独立到联合

  • 早期:每个模态单独预训练,融合阶段才拼一起
  • 当下:端到端联合预训练(GPT-4V、Gemini)
  • 趋势:模态越来越多(文本+图+音+视频+3D)

ChatGPT 是怎么"炼"出来的?三步走

如果你只想知道一件事:ChatGPT 是怎么从 GPT-3 走到 ChatGPT 的——三步:

第 1 步:GPT-3 已经很强了(2020)

  • 1750 亿参数,zero-shot 能力惊人——不训练就能写代码、写文章
  • 但问题是:不可控——让它写诗,它可能写出一段跑题的长篇

第 2 步:InstructGPT 对齐人类意图(2022)

  • SFT(监督微调):人工写"高质量问答对",让模型学"该怎么回答"
  • RLHF(人类反馈强化学习):让人类给模型的不同回答打分,模型学"哪种回答更受欢迎"
  • 结果:听话了——能按指令干活了

第 3 步:ChatGPT + GPT-4:产品化(2022-2023)

  • 加对话记忆(多轮上下文)
  • 加安全护栏(有害内容过滤)
  • 加工具调用(代码执行、网页浏览)
  • 加 RLHF 大规模迭代

一句话总结 ChatGPT 的"炼成": 大预训练模型(能力) + SFT(听话) + RLHF(对齐) + 对话记忆(场景) + 安全护栏(兜底) = ChatGPT


通往 AGI 的四大核心挑战

综述在最后明确指出,通向 AGI 级别的 PFM 还需解决四个核心挑战:

1️⃣ Scalability(可扩展性)

  • 数据、参数、性能三者之间的 scaling law
  • 大模型训练的工程难题(梯度裁剪、混合精度)
  • 高效推理:蒸馏、量化、剪枝

2️⃣ Security(安全性)

  • 对抗攻击:精心设计的输入能诱导有害输出
  • 隐私保护:模型可能"记住"训练数据并泄露
  • 版权问题:训练数据的知识产权争议

3️⃣ Reasoning(推理能力)

  • 符号推理、数学证明、多跳推理(CoT、ToT)
  • 跨模态推理:文本↔图像↔3D 联合推理

4️⃣ Cross-domain Generalization(跨域泛化)

  • 领域适应:从 source 到 target 知识迁移
  • 持续学习:避免灾难性遗忘
  • 小样本适应:LoRA、Adapter、Prompt Tuning

为什么 2026 年还要读一篇 2023 年的综述?

你可能想:这事都过去 3 年了,还有读的必要吗?

有必要,因为:

  • 它是 153 次引用的基础参考——今天所有 PFM 相关论文的"共同语境"
  • 它的分类法至今稳定——后续工作都在它的框架内推进
  • 它的"四大挑战"至今未解决——Scalability / Security / Reasoning / Cross-domain,每个仍是 2026 年的研究热点
  • 它给出了一个"全景快照"——你想理解 LLM 生态,这一篇顶十篇

⚠️ 几处需要警惕的边界

  1. "ChatGPT/GPT-4 的分析较浅"——这是综述(survey)的通病,截止日期限制使得最新模型无法深入。把本文作为 2023 年初的快照而非持续更新文档。
  2. NSP(下一句预测)任务——RoBERTa 等后续工作已表明 NSP 对下游任务帮助有限甚至有负面影响,综述中未提及此争议。
  3. 扩散模型(DDPM、Stable Diffusion)着墨不多——该综述截止于 2023 年 2 月,彼时扩散模型已崭露头角但在 CV PFM 框架梳理中位置尴尬,可视为综述的时间局限之一。
  4. Graph PFM 部分相对薄弱——与 NLP/CV 的深度不成比例,工程现状也远不如 NLP/CV PFM 成熟。
  5. Scaling law 的讨论停留在定性层面——未给出系统性的实验对比;scaling exponents 在不同工作中数值有差异。

一句话总结

预训练基础模型(PFM)是 AI 基础设施范式的根本转变——从"每个任务训一个模型"变成"一个大模型通吃所有任务"。理解 BERT/GPT/T5 三条路线的差异,你就理解了今天所有 LLM 应用的技术根基。


三个标题变体

  1. ChatGPT 是怎么"炼"出来的 —— 一篇被引 153 次的综述,把 BERT/GPT 到 ChatGPT 的演进一次讲透
  2. 从"只会填空"到"什么都能聊":AI 十年最大的范式转变,被一篇综述讲清楚了
  3. BERT、T5、GPT 到底什么区别?一篇 153 次引用的综述,画出了 LLM 世界的全景地图

小红书风格卡片文案(可直接发布)

🤖 ChatGPT 是怎么"炼"出来的? 🤖

它不是一夜之间变聪明的。

这个故事,不讲 Transformer、不讲 attention 公式也能听明白

📌 arXiv 2302.09419,被引 153 次 的 PFM(预训练基础模型)综述,画出了从 BERT/GPT 到 ChatGPT 的完整地图。

🔸 过去十年 AI 最大的一次范式转变: 从"每个任务训一个模型" → "一个大模型通吃所有任务"

这件事发生在 2018 年 —— BERT 和 GPT 几乎同时证明: 大规模无标注数据 + 超大模型 + 少量微调 = 无数下游任务 SOTA

🔸 三大流派,三条路线

🟢 BERT 路线(Encoder-only,双向) - 代表:BERT、RoBERTa、ELECTRA - 思路:双向看上下文,读完就能答 - 强项:理解类(分类、NER、问答) - 弱项:不会接着写

🟡 GPT 路线(Decoder-only,自回归) - 代表:GPT-2/3、InstructGPT、ChatGPT、GPT-4 - 思路:从左到右一个 token 一个 token 写 - 强项:生成类(写作、对话、代码) - 弱项:理解不如 BERT(只看上文)

🔵 Encoder-Decoder(完整 Transformer) - 代表:T5、BART、UL2 - 思路:前半段读,后半段写 - 强项:翻译、摘要、seq2seq - 弱项:结构复杂,工程落地麻烦

🔸 ChatGPT 的"炼成"三步走

1️⃣ GPT-3 已经很强大(2020) - 1750 亿参数,zero-shot 写代码、写文章 - 但:不可控——让它写诗,可能跑题

2️⃣ InstructGPT 对齐人类意图(2022) - SFT:人工写"高质量问答对",教它怎么回答 - RLHF:让人类给回答打分,它学哪种更受欢迎 - 结果:听话了——能按指令干活

3️⃣ ChatGPT + GPT-4 产品化(2022-2023) - 对话记忆(多轮上下文) - 安全护栏(有害内容过滤) - 工具调用(代码执行、网页浏览) - 大规模 RLHF 迭代

一句话总结: 大预训练(能力) + SFT(听话) + RLHF(对齐) + 对话记忆(场景) + 安全护栏(兜底) = ChatGPT

🔸 通往 AGI 的四大核心挑战(至今未解决!) 1. Scalability(可扩展性):数据/参数/性能 scaling law 2. Security(安全性):对抗攻击、隐私泄露、版权争议 3. Reasoning(推理能力):符号推理、多跳推理、跨模态 4. Cross-domain Generalization(跨域泛化):灾难性遗忘、小样本适应

🔸 不止文本 —— 三大模态 - 🖼️ 图像:有监督(ImageNet)→ 自监督(MAE)→ 图文对齐(CLIP)→ 统一分割(SAM) - 🕸️ 图:Graph AutoEncoder、GraphSage、对比学习(工业现状远不如 NLP/CV) - 🔀 多模态融合:从独立预训练 → 端到端联合(GPT-4V、Gemini)

🔧 工程落地 5 条启发 1. 模型选型:理解任务选 BERT 路线,生成任务选 GPT 路线,seq2seq 选 Encoder-Decoder 2. 微调策略:资源有限优先 LoRA/QLoRA,已能覆盖 80% 业务场景 3. 安全红线:对抗输入检测 + 输出过滤层 + 敏感字段脱敏 4. 评测优先:上线前在 MMLU + 领域专属数据集评估,避免盲目上线 5. 持续迭代:PFM 领域每季度重新评估最新模型,重新选基座

💡 为什么 2026 年还要读 2023 年的综述? - 153 次引用的基础参考——后续论文的"共同语境" - 分类法至今稳定——所有后续工作都在这框架内推进 - 四大挑战至今未解决——仍是 2026 年研究热点 - 一篇顶十篇——你想理解 LLM 生态,从这一篇开始

📎 论文 ID:2302.09419(被引 153 次) 📅 发布:2023-02(全文框架至今仍是后续工作的基础引用) 💬 评论区聊聊:你团队选基座时,BERT 路线 / GPT 路线 / Encoder-Decoder 怎么选?为什么?

AI #大模型 #LLM #ChatGPT #BERT #GPT #Transformer #预训练 #FoundationModel #深度学习 #论文分享 #技术分享 #AI科普 #人工智能 #NLP