从 GAN 到 ChatGPT,第一篇把 AIGC 完整历史串起来的综述到底说了什么

  • 关联论文:2303.04226

你有没有想过这种问题:

现在每天刷到的 AI 头像、AI 配音、AI 短文、AI 短视频……这些"AI 生成内容"是从什么时候开始爆发的? 2014 年的 GAN、2020 年的 Diffusion、2022 年的 ChatGPT——它们到底是什么关系?是接龙出现的,还是同时存在的? 为什么同一个"AI 生成"标签下,画图、写文章、做视频的底层技术完全不一样?

第一篇系统性回答这些问题的论文,出现在 2023 年 3 月。

标题很朴素:《A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT》。44 页,15 张图,把过去 10 年生成式 AI 的演进讲了一遍。

核心洞察:AIGC 不是单一技术,是三代范式接力

这篇综述最值钱的不是细节,而是它给出了一个清晰的三代演进框架——任何想理解"AI 怎么画出猫 / 写出文案 / 生成短视频"的人,都需要这个框架:

代际 核心技术 代表模型 核心局限
GAN 时代 生成对抗网络 DCGAN, StyleGAN, BigGAN 训练不稳定、模式崩溃、多样性差
Diffusion 时代 扩散模型 DALL-E 2, Stable Diffusion, Imagen 计算成本高、推理慢
LLM 时代 Transformer + RLHF + SFT GPT-3.5/4, ChatGPT, Claude, LLaMA 算力门槛极高、幻觉问题

为什么这个分代有用?

因为每一代都解决上一代的核心痛点

  • GAN 时代(2014–2019):生成对抗网络的"对抗训练"思路很美——一个造假画师 + 一个鉴画师,互相博弈、共同进步。但训练极不稳定,常常"模式崩溃"(模型只生成同一张脸)。
  • Diffusion 时代(2020–2022):换个思路——先给图片逐步加噪变成纯噪声,再训练神经网络"去噪"还原。训练稳定了,生成质量大幅提升(Stable Diffusion 出现),但推理要跑几十到几百步去噪,慢且贵。
  • LLM 时代(2022–至今):在文本领域,Transformer + 大数据 + RLHF 直接把生成质量推到了"过图灵测试"水平。ChatGPT 让全世界第一次感受到 AIGC 的威力。

这条线索不是线性的,而是"在各自领域登顶"——文本侧 LLM 最早突破,图像侧 Diffusion 最成熟,视频侧至今还在"GAN/Diffusion/LLM 谁能统一"的拉锯中。

单模态 vs 多模态:两条独立但交叉的线

综述把 AIGC 拆成两条平行主线:

单模态(一个模态生成同模态)

  • 文本生成:GPT 系列靠"Next Token Prediction"预训练,再用 SFT(监督微调)+ RLHF(人类反馈强化学习)把模型"对齐"到人类意图。涌现(Emergence) 是关键概念——模型规模突破临界点后,突然获得小模型不具备的能力(思维链推理、上下文学习)。
  • 图像生成:Diffusion 模型在 2020 年后成为主流。Latent Diffusion(Stable Diffusion 的核心)在潜空间而非像素空间运行,把计算成本砍掉一个数量级。Classifier-Free Guidance 让用户可以"用提示词的强度"控制生成质量。

多模态(跨模态生成)

  • 文本 → 图像:CLIP 把文本和图像塞进同一个隐空间,让"猫在草地上追蝴蝶"这样的描述能直接驱动图像生成(DALL-E 2 / Stable Diffusion 都是这条路线)。
  • 文本 → 视频:Make-A-Video、Gen-2 等开始尝试,但视频的时序一致性(前后帧不闪烁、人物不变形)是公认的硬骨头。
  • 图像/视频 → 文本:BLIP、LLaVA 等"多模态 LLM",让模型能"看懂"图再回答问题——这是 2026 年所有视觉问答、电商搜图、视频内容审核的底层技术。

为什么"涌现"被反复提到

涌现(Emergent Abilities) 是这篇综述的高频词,也是后来 2026 年所有关于"大模型为什么有效"的讨论起点:

  • In-context Learning(ICL):不更新模型参数,只在 prompt 里给几个示例,模型就能学会新任务。
  • Chain-of-Thought(思维链推理):在 prompt 里说"让我们一步步思考",模型准确率能从 30% 跳到 70%。
  • Instruction Following:通过 RLHF,模型学会"听懂"自然语言指令,而不是只接 prompt 工程。

关键点:这些能力在小模型上几乎不存在,在大模型上突然出现——不是渐进,是跳变。这就是"涌现"。

⚠️ 但要加个注脚:后来 Schaeffer 等人在 2023 年发表论文《Are Emergent Abilities of Large Language Models a Mirage?》指出——所谓"涌现"很可能是指标选择带来的假象。换一种评测指标,曲线就是平滑的。这篇 AIGC 综述写于这场争论之前,所以采用了"涌现是事实"的表述。今天读这篇综述,应该把"涌现"理解为"在某些指标下,大模型确实有质变",而不是"涌现已被完全解释"。

实际工程意义:2023 年的判断哪些仍成立,哪些已过时

读这篇综述最需要的是时间切片意识——它写于 2023 年 3 月,距今 3 年多:

仍成立的概念框架: - ✅ 三代演进(GAN / Diffusion / LLM)依然清晰 - ✅ 单模态 / 多模态的拆分依然是产品设计的核心思路 - ✅ "大规模 + 大数据 + 大算力"的范式依然主导

已过时的具体技术判断: - ❌ 综述说 GPT-3 在 SuperGLUE 上"接近人类"——实际 GPT-3 约 70-71%,人类约 89%,差 18pp。这条不要直接引用。 - ❌ 综述把 Stable Diffusion 2 列为图像 SOTA——2026 年的 Flux.1 / SD3 / DALL-E 3 已全面替代。 - ❌ 综述对视频生成"还在探索"——2024 年 Sora 出现后,视频生成已是独立赛道。 - ❌ 综述对版权和伦理"一笔带过"——2026 年 Getty Images v. Stability AI 等诉讼已让版权成为工程标配议题。

这篇综述的真正价值

不是技术教程——任何想做 AIGC 工程实现的人都不应该从这篇入手。

它是历史框架——如果你要: - 给团队做 AIGC 入门培训 ✅ 用它建立三代演进的认知锚点 - 评估"我们要不要做 AIGC 产品" ✅ 用它理解能力边界 - 写技术综述 / 写行业报告 ✅ 用它做骨架,补充 2024–2026 的进展

不是技术细节——任何要查具体 FID 分数、具体 prompt 工程技巧、具体模型选型,都要去翻 2024–2026 的细分方向顶会综述。

一句话给老板

"AIGC 不是单一技术,是 GAN → Diffusion → LLM 三代范式接力,外加单模态 / 多模态两条独立主线。这篇 2023 年的综述是建立这个认知的最好起点——但所有具体技术细节都已过时,工程决策要查 2024–2026 的最新工作。"

三个标题变体

  1. "AI 怎么画图、写文章、做视频?从 GAN 到 ChatGPT 的三代演进,一篇综述讲清楚"
  2. "为什么 Stable Diffusion 比 GAN 强?为什么 ChatGPT 比 GPT-3 强?AIGC 的三段式进化史"
  3. "第一篇系统性讲 AIGC 的论文,写于 ChatGPT 刚爆发的那个月——它现在还值得读吗?"

📱 小红书风格卡片文案

📚 今天被一篇 2023 年的综述震到了

它把过去 10 年的 AI 生成内容(AI 画图 / 写文章 / 做视频)讲成了一段三段式进化史

1️⃣ GAN 时代(2014–2019):让两个 AI 对抗训练(一个造假一个鉴假)—— 脑洞很美但训练极其不稳定,常常"模式崩溃"

2️⃣ Diffusion 时代(2020–2022):换思路—— 先把图加噪变雪花,再训练 AI 去噪还原 —— Stable Diffusion / DALL-E 2 都是这条路,生成质量直接起飞

3️⃣ LLM 时代(2022–至今):Transformer + 大数据 + RLHF —— ChatGPT 让全世界第一次感到"AI 真的在理解我"

关键洞察: - 不是技术接龙,是"各自领域登顶" - 单模态(文本 / 图像 / 视频独立生成)和多模态(跨模态)是两条平行主线 - "涌现"是大模型突破临界点后突然获得的推理能力(但 2023 年 Schaeffer 等人指出这可能是指标假象)

⚠️ 但要注意:这篇综述写于 2023 年 3 月,距今 3 年多。所有具体技术判断(SOTA 分数、模型能力)已过时 —— 读它的价值在于建立认知框架,工程决策要去翻 2024–2026 的最新工作。

📎 arXiv 2303.04226 · 第一篇系统性 AIGC 历史综述 · 44 页 15 图

#AI科普 #AIGC #生成式AI #StableDiffusion #ChatGPT #Diffusion模型 #GAN #LLM #多模态 #技术分享


📎 arXiv 2303.04226 · 2023-03 首发 · Semantic Scholar 被引 847 次 📅 2023 年 3 月发布,第一篇系统性梳理 AIGC 完整历史脉络的综述

💬 评论区聊聊:你工作中用过的 AIGC 工具是 GAN / Diffusion / LLM 哪一代的产物?有没有踩过"模型跟不上时代的坑"?

AI #AIGC #生成式AI #StableDiffusion #ChatGPT #Diffusion模型 #GAN #LLM #多模态 #人工智能 #技术科普 #论文分享 #机器学习 #深度学习