A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT

  • 关联论文:2303.04226
  • 作者:Tom
  • 更新:2026-07-19

一句话结论

AIGC(AI 生成内容)经历了从 GAN 时代到 Diffusion Model 再到 GPT 系列/LLM 的技术范式迁移,核心驱动力是「大模型 + 大数据」带来的意图理解能力和生成质量的质的飞跃;本文是第一篇系统性梳理这一完整脉络的综述,覆盖单模态(文本/图像)和多模态两条主线。

解决什么真问题

AIGC 要解决的是内容生产效率与质量的根本矛盾。传统 UGC(用户生成内容)受限于人类创作者的精力、技能和时间,无法满足互联网对海量内容的渴求。PGC(专业生成内容)质量高但产能低。AIGC 的目标是用 AI 自动化或半自动化地生产数字内容(图像、音乐、自然语言等),让内容创作更高效、更普惠。

本文的核心问题是:生成式 AI 经历了怎样的技术演进?每代技术的核心机制是什么?不同模态之间如何交叉融合?

核心方法

本文是一篇综述论文,采用「历史脉络 + 技术分类」的结构组织内容。

2.1 生成式 AI 的三代演进

代际 核心技术 代表模型 核心局限
GAN 时代 GAN(生成对抗网络) DCGAN, StyleGAN, BigGAN 训练不稳定、模式崩溃、生成多样性差
Diffusion 时代 DDPM, DDIM, Latent Diffusion DALL-E 2, Stable Diffusion, Imagen 计算成本高、推理慢
LLM 时代 Transformer + RLHF + SFT GPT-3.5/4, ChatGPT, Claude, LLaMA 算力门槛极高、幻觉问题

2.2 单模态生成

文本生成(Text Generation) - GPT 系列:基于 Decoder-only Transformer,通过 Next Token Prediction 预训练 + SFT + RLHF 逐步对齐人类意图。GPT-3(175B 参数)展示了惊人的 In-context Learning 能力。 - LLM 的关键能力:涌现(Emergence)——当模型规模突破临界点后,突然获得小模型不具备的能力(如思维链推理)。

图像生成(Image Generation) - Diffusion Model 机制:前向过程向图像逐步加噪(q(x_t|x_{t-1})),逆向过程学习去噪(p_θ(x_{t-1}|x_t))。Latent Diffusion 在隐空间而非像素空间运行,大幅降低计算成本。 - Classifier-Free Guidance:训练时同时学习条件生成和无条件生成,推理时通过两者的线性组合实现「引导强度」控制。 - DALL-E 2(CLIP-based):用 CLIP 文本编码器对齐文本和图像隐空间,实现文本引导的图像生成。

2.3 多模态生成

跨模态应用是本文的亮点之一: - 文本 → 图像:DALL-E 2, Stable Diffusion, Imagen。将自然语言描述转换为高质量图像。 - 文本 → 视频:Make-A-Video, Gen-2 等,探索时序一致性问题。 - 图像/视频 → 文本:BLIP, LLaVA 等多模态 LLM,实现视觉理解与对话。

2.4 大规模模型的「涌现」机制

本文特别讨论了涌现现象(Emergent Abilities)的机制: - 思维链推理(Chain-of-Thought):大模型在达到一定规模后自发产生多步推理能力。 - In-context Learning(ICL):无需参数更新,只需在 prompt 中提供示例,模型即可学习新任务。 - 指令跟随(Instruction Following):通过 RLHF/SFT,模型学会遵循自然语言指令。

原文未明确说明这些涌现现象的理论解释(这是 2023 年初的综述,彼时仍是开放问题)。

关键实验与数据

本文是 Survey 论文,不含原创实验,主要引用子工作的Benchmark结果:

  • 文本生成:GPT-3 在 SuperGLUE 上接近人类水平,但复杂推理任务(如 MATH)仍有显著差距。
  • 图像生成:FID(Fréchet Inception Distance)指标——Stable Diffusion 2 在 CUB-200、COCO 等数据集上 FID 达到 SOTA(具体数值原文未逐一列出,读者请参考原始论文)。
  • 多模态:VQA(视觉问答)任务中,LLaVA 在某些场景下接近 GPT-4V 的表现(原文未给出精确数字)。

亮点与局限

亮点: - 历史跨度完整:从 2014 年 GAN 提出一直写到 2023 年初 ChatGPT,是第一篇将 AIGC 完整历史串联起来的综述。 - 双视角覆盖:同时覆盖单模态(文本/图像独立生成)和多模态(跨模态应用),结构清晰。 - 技术解释深入:对 Diffusion Model 的前向/逆向过程、CLIP 对齐机制等做了较清晰的解释,非从业者也能读懂。 - 44 页 15 图,信息密度较高,适合作为入门文献。

局限: - 截至 2023 年 3 月,对 2023 年中后期的工作(如 GPT-4V、Llama 2、DALL-E 3、Sora)完全未覆盖。 - Diffusion Model 的技术细节(如Classifier-Free Guidance的具体数值设置)覆盖有限。 - 缺少对 AIGC 伦理、版权、商业模式等社会影响的深入讨论(仅一笔带过)。 - Survey 类综述的通病:对实验数据的呈现较为分散,读者难以快速对比不同方法的优劣。

对工程落地的启发

  1. Diffusion + LLM 是当前 AIGC 的主轴:文本用 LLM,图像/视频用 Diffusion,视频生成是 2023-2024 年最热门的工程方向之一。
  2. 多模态是下一波产品机会:图像理解 + LLM 的组合(LLaVA 类架构)正在快速渗透到电商、医疗、教育行业的产品中。
  3. 涌现能力让小团队也能做「大产品」:GPT-4 API 的出现意味着中小团队不需要训练自己的大模型,只需做好 prompt 工程和应用层即可。
  4. AIGC 质量已接近人类专业水平:Stable Diffusion 生成的图像在某些场景下(如概念艺术、UI 草图)已能替代部分人类工作,但版权和伦理问题仍是工程上需要正视的风险。

与同方向工作的关系

  • GAN vs Diffusion:Diffusion 在生成质量(FID)和多样性上显著优于 GAN,已成为图像生成的主流;但 GAN 的快速推理优势在实时场景(如游戏)仍有价值。
  • GPT vs LLaMA:GPT 系列(OpenAI)是闭源 API 的天花板;LLaMA(Meta)开源后催生了整个开源 LLM 生态(如 Vicuna、Alpaca)。本文重点描述 GPT 家族,对开源生态的讨论偏少。
  • 后续 Survey:本文之后出现了大量 AIGC 细分 Survey(如对 Sora 的专项分析、Video Generation 综述),本文是它们的「鼻祖」。
  • 与本文同期的工作:如 MiniGPT-4(2023)、LLaVA(2023)展示了多模态 LLM 的快速进步,本文为这些工作提供了历史背景。

适合谁读

  • AI 方向学生/研究者:想快速建立对 AIGC 领域全景认知的入门者,本文是极好的文献综述。
  • 内容创作产品经理:理解 AIGC 的技术边界和能力上限,有助于评估产品可行性。
  • AI 工程师:想了解 Diffusion Model 和 LLM 生成原理的工程实践者(但需结合其他教程深化技术理解)。
  • 对 AI 感兴趣的普通读者:ChatGPT 爆火后想了解背后技术演进的普通用户。

注:本文基于论文摘要及 arXiv 公开信息撰写,发表于 2023 年 3 月,彼时技术现状与当前(2026年)已有较大差距,建议读者以本文建立历史框架,以最新论文补充前沿进展。

工程落地与核查(Jay)

事实核查

  1. "GPT-3 175B 参数":✅ 已验证,GPT-3 论文(Brown et al. 2020)明确为 175B 参数。
  2. "GPT-3 在 SuperGLUE 上接近人类水平":⚠️ 存疑:GPT-3 的 SuperGLUE 8-shot 结果约为 70–71%,而当时 SuperGLUE 人类基准约为 89%,差距约 18pp;原文表述"接近"略显乐观,应为"显著提升但仍低于人类基准"。此外,GPT-3 2020年论文早于本文 2023年综述,彼时更准确的说法是"few-shot 大幅提升但未达人类"——文内应加 ⚠️。
  3. "Stable Diffusion 2 在 CUB-200、COCO 等数据集上 FID 达到 SOTA":⚠️ 存疑且原文无具体数字:Stable Diffusion 2 由 Stability AI 发布(2022年11月),其在 COCO 上的 FID 确实达到当时的 SOTA,但具体数值(约为 FID 8-12 区间)原文未列出;读者无法核实,建议改为"SOTA 梯队(具体 FID 数值请参考 Stability AI 官方报告)"。
  4. "涌现"机制:⚠️ 视角不完整:本文将"涌现"作为已确认现象描述,但 Schaeffer et al. (2023) 已在本文发表同期提出"涌现是指标选择 artefact"的反方观点;综述角度应提及这一争议,否则让读者误以为"涌现"是定论。
  5. LLaVA 出现在文中:⚠️ 时间线需核实:LLaVA 首发于 2023年4月(arXiv 2304.08485),而本文 arXiv v1 为 2023年3月。若本文引用了 LLaVA,则实际写作时间应晚于 2023年4月;或 LLaVA 是后续版本追加。需读原文确认版本历史。
  6. 论文版本:⚠️ paper_card 显示 v3 2023-03-08,但文章引用 v4 2023-10-10,存在版本差异;文内"截至 2023年3月"对应 v1/v3 截止线合理,但若引用 v4 新增实验(如 LeetcodeHard)则与时间线矛盾。
  7. GPT-4 的存在:文章提到"GPT-3.5/4",但 GPT-4 发布时间是 2023年3月14日,与本文 v1(2023-03-07)几乎同期——文章对 GPT-4 的引用实质上是"GPT-4 刚发布"的快照,⚠️ 读者应注意时间切片。
  8. "涌现"是否在 2023 年有理论解释:⚠️ Wei et al. (2023) "Emergent Abilities of Large Language Models" 总结了现象但没有理论解释,本文未引用 Wei 也未注明;这是 2023 年 AIGC survey 的一个重要遗漏。

可读性精修

  • "涌现(Emergence)——当模型规模突破临界点后,突然获得小模型不具备的能力(如思维链推理)"——"突然获得"过于拟人化,建议改为"表现出小规模模型不具备的能力(如思维链推理)"。
  • "Stable Diffusion 2 在 CUB-200、COCO 等数据集上 FID 达到 SOTA"——"SOTA"没有数字支撑,建议加脚注指向原始论文或 Stability AI 报告。
  • 建议在文末增加一个"⚠️ 重要存疑点"清单(汇总上述数字问题),便于读者快速定位。

工程落地

  1. 2026 年视角下的时效性判断: - 本文写作于 2023 年 3 月,距今约 3.5 年——AIGC 领域已发生:GPT-4(2023-03)、GPT-4V(2023-09)、Sora(2024-02)、DALL-E 3(2023-09)、Llama 2(2023-07)、Llama 3(2024-04)、Stable Diffusion 3(2024-02)、VideoGen 等。本文历史框架有价值,但所有具体技术判断(SOTA 数字、模型能力描述)均已过时,不可直接用于生产决策。 - 工程建议:将本文定位为"概念历史入门",用最新综述(如 Feng et al. 2024 AIGC Survey Updates 或各细分方向顶会综述)替代具体技术判断。

  2. Diffusion + LLM 组合的 2026 年工程现状: - 文本生成:GPT-4o / Claude 3.5 Sonnet / Qwen-Max 已成主流,GPT-3.5 已边缘化;工程上几乎不再需要自己部署 GPT-3 量级的模型。 - 图像生成:Flux.1 (Black Forest Labs) / Stable Diffusion 3 / DALL-E 3 已替代 SD2;SD2 的 FID 数字已无参考价值。 - 多模态:GPT-4V → GPT-4o(多模态统一)+ Gemini 1.5 Pro/Ultra,LLaVA 已成开源 baseline 而非前沿;工程选型应从"能否做"切换到"哪个成本-质量比最优"。

  3. AIGC 工程落地的关键变化(2023 → 2026): - 幻觉问题:2023 年综述提到"LLM 幻觉"是核心局限;2026 年已有 Constitutional AI、RLHF-Safe、WizardLM 等系统缓解手段,但未解决。工程上必须有幻觉检测 + 人审流程。 - 版权问题:2023 年仅一笔带过;2026 年已有多起生成内容版权诉讼(Getty Images v. Stability AI 等),工程上必须有关于训练数据合规的法律审查流程。 - 算力门槛:2023 年"算力门槛极高"已是局限;2026 年随着 API 降价(SOTA 模型 API 费用 2023→2026 降低约 100×),门槛已大幅降低,但自训练仍高。 - 视频生成:本文仅提 Make-A-Video、Gen-2;2026 年 Sora / Runway Gen-3 / Kling / VideoGen 已成熟,工程上视频生成已是独立赛道。

  4. 快速跟进的工程路径: - 若用本文做团队 AIGC 历史培训:✅ 价值高(建立框架);但需额外说明"本文截止 2023年3月,以下是 2026 年更新"。 - 若做技术选型:❌ 不可用,所有 SOTA 数字均已过时;建议直接查阅各方向的最新 arXiv cs.CV/cs.CL 顶会综述。 - 若做产品机会识别:✅ 历史脉络梳理有价值,但多模态、Agent、Video 三条线在 2026 年已是主战场,本文对此覆盖不足,需补充。