ChatGPT 是怎么"炼"出来的 —— 一篇被引 153 次的综述,把 BERT/GPT 到 ChatGPT 的演进一次讲透
- 关联论文:2302.09419
"AI 已经能写邮件、画画、编曲、写代码、做研究助手。" "它是怎么从'只会填空'走到'什么都能聊'的?"
这个故事,不讲 Transformer、不讲 attention 公式也能听明白。
arXiv 编号 2302.09419,2023 年 2 月发布的预训练基础模型综述,被引 153 次——它给"从 BERT 到 ChatGPT 的演进"画了一张完整的地图。
一个关键认知先放在前面
过去十年 AI 最大的一次范式转变:从"每个任务训一个模型"变成"一个大模型通吃所有任务"。
这件事发生在 2018 年——BERT 和 GPT 几乎同时证明了一件事:
在大规模无标注数据上预训练一个超大模型,然后用少量数据微调,就能在无数下游任务上达到 SOTA。
这就是"预训练基础模型"(Pretrained Foundation Models, PFM)的核心思想。
它的影响远超技术圈: - 教育:语言模型能改作文、能答疑; - 医疗:蛋白质结构预测、医学影像分析; - 创作:绘画、配音、视频生成; - 工业:代码补全、文档摘要、数据分析。
今天你看到的每一个 ChatGPT 类应用,根基都在 2018 年的这一次范式转变。
三大流派,三大路线
这篇综述最核心的贡献,是把"看似混乱"的 PFM 世界梳理成三大流派:
🟢 BERT 路线(Encoder-only,双向)
- 代表模型:BERT、RoBERTa、ALBERT、ELECTRA、DeBERTa
- 核心思想:双向注意力——读一句话时,左右都看
- 训练任务:MLM(遮住一个词,猜它是什么)
- 优势:理解类任务超强(分类、NER、问答)
- 局限:不会"接着写"——它是"读"模型,不是"写"模型
🟡 GPT 路线(Decoder-only,自回归)
- 代表模型:GPT-2、GPT-3、InstructGPT、ChatGPT、GPT-4
- 核心思想:从左到右一个 token 一个 token 写
- 训练任务:下一个 token 预测
- 优势:生成类任务无敌,zero-shot 能力惊人(不训练也能干活)
- 局限:理解类任务不如 BERT(因为它只看上文)
🔵 Encoder-Decoder 路线(完整 Transformer)
- 代表模型:T5、BART、UL2
- 核心思想:前半段读,后半段写——既理解又生成
- 优势:翻译、摘要、seq2seq 任务 SOTA
- 局限:结构最复杂,工程落地最麻烦
一句话区分三种路线: - BERT = "读完就能答"(理解) - GPT = "接着写下去"(生成) - T5 = "读完之后再写"(理解+生成)
不止文本 —— 三大模态的演进
综述把视角扩展到了文本之外,覆盖了图像和图:
🖼️ 图像预训练
| 阶段 | 方法 | 代表 |
|---|---|---|
| 有监督 | ImageNet 预训练 → 微调 | ResNet、VGG |
| 自监督 | MAE(遮住图块重建) | MAE、BEiT |
| 图文对齐 | CLIP(把图和文映射到同一空间) | CLIP、BLIP |
| 统一分割 | SAM(给个点,就能圈出对象) | Segment Anything |
🕸️ 图(Graph)预训练
- Graph AutoEncoder、GraphSage、对比学习
- 用途:社交网络分析、分子性质预测、知识图谱补全
- 局限:远不如 NLP/CV PFM 成熟,工业界仍以 GCN/GAT 为主
🔀 多模态融合:从独立到联合
- 早期:每个模态单独预训练,融合阶段才拼一起
- 当下:端到端联合预训练(GPT-4V、Gemini)
- 趋势:模态越来越多(文本+图+音+视频+3D)
ChatGPT 是怎么"炼"出来的?三步走
如果你只想知道一件事:ChatGPT 是怎么从 GPT-3 走到 ChatGPT 的——三步:
第 1 步:GPT-3 已经很强了(2020)
- 1750 亿参数,zero-shot 能力惊人——不训练就能写代码、写文章
- 但问题是:不可控——让它写诗,它可能写出一段跑题的长篇
第 2 步:InstructGPT 对齐人类意图(2022)
- SFT(监督微调):人工写"高质量问答对",让模型学"该怎么回答"
- RLHF(人类反馈强化学习):让人类给模型的不同回答打分,模型学"哪种回答更受欢迎"
- 结果:听话了——能按指令干活了
第 3 步:ChatGPT + GPT-4:产品化(2022-2023)
- 加对话记忆(多轮上下文)
- 加安全护栏(有害内容过滤)
- 加工具调用(代码执行、网页浏览)
- 加 RLHF 大规模迭代
一句话总结 ChatGPT 的"炼成": 大预训练模型(能力) + SFT(听话) + RLHF(对齐) + 对话记忆(场景) + 安全护栏(兜底) = ChatGPT
通往 AGI 的四大核心挑战
综述在最后明确指出,通向 AGI 级别的 PFM 还需解决四个核心挑战:
1️⃣ Scalability(可扩展性)
- 数据、参数、性能三者之间的 scaling law
- 大模型训练的工程难题(梯度裁剪、混合精度)
- 高效推理:蒸馏、量化、剪枝
2️⃣ Security(安全性)
- 对抗攻击:精心设计的输入能诱导有害输出
- 隐私保护:模型可能"记住"训练数据并泄露
- 版权问题:训练数据的知识产权争议
3️⃣ Reasoning(推理能力)
- 符号推理、数学证明、多跳推理(CoT、ToT)
- 跨模态推理:文本↔图像↔3D 联合推理
4️⃣ Cross-domain Generalization(跨域泛化)
- 领域适应:从 source 到 target 知识迁移
- 持续学习:避免灾难性遗忘
- 小样本适应:LoRA、Adapter、Prompt Tuning
为什么 2026 年还要读一篇 2023 年的综述?
你可能想:这事都过去 3 年了,还有读的必要吗?
有必要,因为:
- 它是 153 次引用的基础参考——今天所有 PFM 相关论文的"共同语境"
- 它的分类法至今稳定——后续工作都在它的框架内推进
- 它的"四大挑战"至今未解决——Scalability / Security / Reasoning / Cross-domain,每个仍是 2026 年的研究热点
- 它给出了一个"全景快照"——你想理解 LLM 生态,这一篇顶十篇
⚠️ 几处需要警惕的边界
- "ChatGPT/GPT-4 的分析较浅"——这是综述(survey)的通病,截止日期限制使得最新模型无法深入。把本文作为 2023 年初的快照而非持续更新文档。
- NSP(下一句预测)任务——RoBERTa 等后续工作已表明 NSP 对下游任务帮助有限甚至有负面影响,综述中未提及此争议。
- 扩散模型(DDPM、Stable Diffusion)着墨不多——该综述截止于 2023 年 2 月,彼时扩散模型已崭露头角但在 CV PFM 框架梳理中位置尴尬,可视为综述的时间局限之一。
- Graph PFM 部分相对薄弱——与 NLP/CV 的深度不成比例,工程现状也远不如 NLP/CV PFM 成熟。
- Scaling law 的讨论停留在定性层面——未给出系统性的实验对比;scaling exponents 在不同工作中数值有差异。
一句话总结
预训练基础模型(PFM)是 AI 基础设施范式的根本转变——从"每个任务训一个模型"变成"一个大模型通吃所有任务"。理解 BERT/GPT/T5 三条路线的差异,你就理解了今天所有 LLM 应用的技术根基。
三个标题变体
- ChatGPT 是怎么"炼"出来的 —— 一篇被引 153 次的综述,把 BERT/GPT 到 ChatGPT 的演进一次讲透
- 从"只会填空"到"什么都能聊":AI 十年最大的范式转变,被一篇综述讲清楚了
- BERT、T5、GPT 到底什么区别?一篇 153 次引用的综述,画出了 LLM 世界的全景地图
小红书风格卡片文案(可直接发布)
🤖 ChatGPT 是怎么"炼"出来的? 🤖
它不是一夜之间变聪明的。
这个故事,不讲 Transformer、不讲 attention 公式也能听明白。
📌 arXiv 2302.09419,被引 153 次 的 PFM(预训练基础模型)综述,画出了从 BERT/GPT 到 ChatGPT 的完整地图。
🔸 过去十年 AI 最大的一次范式转变: 从"每个任务训一个模型" → "一个大模型通吃所有任务"
这件事发生在 2018 年 —— BERT 和 GPT 几乎同时证明: 大规模无标注数据 + 超大模型 + 少量微调 = 无数下游任务 SOTA
🔸 三大流派,三条路线
🟢 BERT 路线(Encoder-only,双向) - 代表:BERT、RoBERTa、ELECTRA - 思路:双向看上下文,读完就能答 - 强项:理解类(分类、NER、问答) - 弱项:不会接着写
🟡 GPT 路线(Decoder-only,自回归) - 代表:GPT-2/3、InstructGPT、ChatGPT、GPT-4 - 思路:从左到右一个 token 一个 token 写 - 强项:生成类(写作、对话、代码) - 弱项:理解不如 BERT(只看上文)
🔵 Encoder-Decoder(完整 Transformer) - 代表:T5、BART、UL2 - 思路:前半段读,后半段写 - 强项:翻译、摘要、seq2seq - 弱项:结构复杂,工程落地麻烦
🔸 ChatGPT 的"炼成"三步走
1️⃣ GPT-3 已经很强大(2020) - 1750 亿参数,zero-shot 写代码、写文章 - 但:不可控——让它写诗,可能跑题
2️⃣ InstructGPT 对齐人类意图(2022) - SFT:人工写"高质量问答对",教它怎么回答 - RLHF:让人类给回答打分,它学哪种更受欢迎 - 结果:听话了——能按指令干活
3️⃣ ChatGPT + GPT-4 产品化(2022-2023) - 对话记忆(多轮上下文) - 安全护栏(有害内容过滤) - 工具调用(代码执行、网页浏览) - 大规模 RLHF 迭代
一句话总结: 大预训练(能力) + SFT(听话) + RLHF(对齐) + 对话记忆(场景) + 安全护栏(兜底) = ChatGPT
🔸 通往 AGI 的四大核心挑战(至今未解决!) 1. Scalability(可扩展性):数据/参数/性能 scaling law 2. Security(安全性):对抗攻击、隐私泄露、版权争议 3. Reasoning(推理能力):符号推理、多跳推理、跨模态 4. Cross-domain Generalization(跨域泛化):灾难性遗忘、小样本适应
🔸 不止文本 —— 三大模态 - 🖼️ 图像:有监督(ImageNet)→ 自监督(MAE)→ 图文对齐(CLIP)→ 统一分割(SAM) - 🕸️ 图:Graph AutoEncoder、GraphSage、对比学习(工业现状远不如 NLP/CV) - 🔀 多模态融合:从独立预训练 → 端到端联合(GPT-4V、Gemini)
🔧 工程落地 5 条启发 1. 模型选型:理解任务选 BERT 路线,生成任务选 GPT 路线,seq2seq 选 Encoder-Decoder 2. 微调策略:资源有限优先 LoRA/QLoRA,已能覆盖 80% 业务场景 3. 安全红线:对抗输入检测 + 输出过滤层 + 敏感字段脱敏 4. 评测优先:上线前在 MMLU + 领域专属数据集评估,避免盲目上线 5. 持续迭代:PFM 领域每季度重新评估最新模型,重新选基座
💡 为什么 2026 年还要读 2023 年的综述? - 153 次引用的基础参考——后续论文的"共同语境" - 分类法至今稳定——所有后续工作都在这框架内推进 - 四大挑战至今未解决——仍是 2026 年研究热点 - 一篇顶十篇——你想理解 LLM 生态,从这一篇开始
📎 论文 ID:2302.09419(被引 153 次) 📅 发布:2023-02(全文框架至今仍是后续工作的基础引用) 💬 评论区聊聊:你团队选基座时,BERT 路线 / GPT 路线 / Encoder-Decoder 怎么选?为什么?