ChatGPT is not all you need: A State of the Art Review of Large Generative AI Models

  • 关联论文:2301.04655
  • 作者:Tom
  • 更新:2026-07-20

一句话结论

该综述对 2021-2023 年间的主要 Generative AI 模型进行了多模态分类,涵盖 Text-to-Text、Text-to-Image、Image-to-Text、Text-to-Video、Text-to-3D、Text-to-Audio、Text-to-Code 等多个生成范式,并分析了生成式 AI 对各行业的影响,是理解 2023 年生成式 AI 爆发期全景图的重要文献;被引 357 次,是早期生成式 AI 综述中影响力最大的作品之一。


解决什么真问题

2022 年底 ChatGPT 发布后,生成式 AI 成为全社会焦点,但存在严重的信息碎片化问题:

  1. 模型种类繁多,外行看不懂:DALL-E 2、Stable Diffusion、GALACTICA、AlphaTensor……每个都宣称 SOTA,但相互之间有什么区别,外行很难搞清楚
  2. 缺乏统一的分类框架:Text-to-Image 和 Text-to-Video 本质上都是条件生成,但学术和工业界对它们的讨论是割裂的
  3. 行业影响讨论不足:除了"哪些工作会被取代"的恐慌性讨论,缺乏系统性的行业影响分析

该综述试图用一份文档说清楚:生成式 AI 到底有哪些流派、各自什么能力、对哪些行业有影响。


核心方法

模型分类体系(Taxonomy)

论文建立了按输入→输出模态分类的体系:

Generative AI Models
├── Text-to-Text
│   ├── ChatGPT (GPT-3.5/GPT-4)
│   ├── GPT-3 (text-davinci-003)
│   └── GALACTICA
├── Text-to-Image
│   ├── DALL-E 2
│   ├── Stable Diffusion
│   └── Imagen
├── Image-to-Text
│   ├── Flamingo
│   └── BLIP-2
├── Text-to-Video
│   └── Phenaki
├── Text-to-3D
│   └── Dreamfusion
├── Text-to-Audio
│   └── AudioLM
├── Text-to-Code
│   └── Codex
└── Text-to-Science
    └── AlphaTensor

Text-to-Text:ChatGPT / GPT-3 / GALACTICA

ChatGPT(GPT-3.5/GPT-4):基于 GPT-3.5/GPT-4 的指令微调模型,引入 RLHF 实现人类偏好对齐。核心能力:开放域问答、代码生成、数学推理、多轮对话。局限:知识截止、幻觉、对抗性输入脆弱。

GALACTICA:Meta 发布的科学文献语言模型,在 4800 万篇论文、教科书、分子式等科学数据上训练。因幻觉和毒性问题引发争议后公开道歉并暂停服务——这是生成式 AI 早期最重要的安全教训之一。

Text-to-Image:DALL-E 2 / Stable Diffusion / Imagen

DALL-E 2:OpenAI 的扩散模型,使用 CLIP 作为文本-图像对齐的语义编码器,以文本为条件生成逼真图像。核心创新是层级生成(先 low-res 后 upsample)。

Stable Diffusion(2022.08):Stability AI 发布,核心贡献是开源——模型权重公开、代码开源,允许任何人本地运行 Text-to-Image 生成。技术上基于 Latent Diffusion Model(LDM),在低维隐空间做扩散,大幅降低算力需求(RTX 3090 可在 10 秒内生成一张图)。

Imagen:Google 的 Text-to-Image 模型,在 FID 上声称超越 DALL-E 2,但未公开模型权重。

Image-to-Text:Flamingo / BLIP-2

Flamingo:DeepMind(Google)发布,第一次实现了在少量图文对数据上快速适配多模态任务的能力。架构上用 Perceiver Resampler 连接视觉 encoder 和语言模型,无需对视觉 backbone 做大规模微调。

BLIP-2:Salesforce 发布,提出 Q-Former 架构解决视觉-语言跨模态对齐问题,是后续 LLaVA、Vicuna 等开源多模态模型的重要技术基础。

Text-to-Video:Phenaki

Google Research 发布的可变时长视频生成模型,能根据文本描述生成多镜头叙事视频。技术路线:使用 C-ViViT(Compressed Video Transformer)对视频做时空压缩,用文本条件引导生成。由于视频生成的长度和一致性挑战,Phenaki 在 2022 年属于突破性工作,但距离可用仍有距离。

Text-to-3D:Dreamfusion

Google Research 发布,首次实现"用文本描述生成 3D 资产"(NeRF 表示)。核心思路:3D 场景用 NeRF 渲染,渲染质量用可微渲染的 Score Distillation Sampling(SDS)损失优化。虽然生成质量粗糙、耗时极长(数小时生成一张图),但开创了 3D AIGC 方向。

Text-to-Audio:AudioLM

Google Research 发布,实现 Text-to-Speech 和 Audio Generation,无需 ASR 中间步骤,直接用音频 tokenizer + Transformer 生成原始音频波形。AudioLM 的语音自然度达到人类水平,且能生成钢琴曲等音乐片段。

Text-to-Code:Codex

OpenAI 发布,Codex 是 GitHub Copilot 的底层模型,在 GPT-3 基础上用 Python 代码数据微调。评测基准 HumanEval(164 道编程题),Codex 解题率约 37%(原文未明确列出此数字)。局限性:长代码依赖理解能力弱、长文件上下文处理差、复杂算法推理不足。

AlphaTensor

DeepMind 发布,用强化学习发现新矩阵乘法算法,将 4×4 矩阵乘法的最优算法从 Strassen 的 49 次乘法降到 47 次(原文未明确此数字)。展示了生成式 AI 从"生成内容"扩展到"生成算法"的可能性。

行业影响分析

行业 影响方向 风险
医疗 医学文档撰写、影像报告辅助、药物发现 诊断建议幻觉风险极高
法律 合同草稿、法律研究辅助 错误法律引用风险
教育 智能辅导、内容生成 学术诚信问题
内容创作 营销文案、新闻撰写、游戏叙事 深度伪造风险
软件工程 代码生成、测试生成 安全漏洞引入

关键实验与数据

论文的核心贡献是分类和综述,而非新模型或新实验。关键数据是覆盖约 15-20 个主流模型5+ 个行业的生成式 AI 落地分析,论文篇幅 22 页。


亮点与局限

亮点

  1. 时间窗口稀缺性:2023 年 1 月发表,正值 ChatGPT 发布后生成式 AI 爆发的最早期,捕捉到了当时研究者最迫切需要的基础认知框架
  2. 多模态统一视角:较早将 Text-to-Image、Text-to-Video、Text-to-Audio 等不同模态工作放在同一分类体系下讨论
  3. 开源 vs. 闭源路线对比:明确区分了 Stable Diffusion(开源)和 DALL-E 2/Imagen(闭源)的生态差异,这一视角在 2023 年极具前瞻性
  4. 行业影响章节的实践价值:将技术进展映射到具体行业应用,是技术-商业交叉的罕见尝试

局限

  1. 成文时间极早(2023.01):Sora、GPT-4V、Gemini、Claude 3 等大量 2023-2024 重要工作全部未覆盖,论文内容已严重过时
  2. 技术细节深度不足:每个模型只做定性描述,缺乏架构对比、评测数据、方法论分析,距离"技术报告"而非"科普文章"有差距
  3. 缺乏原创性实验:无新实验、无新数据集、无新基准,纯综述性质
  4. 引用量虚高:357 次引用主要来自 2023 年初的"窗口期红利",实际学术贡献与引用量不完全匹配

对工程落地的启发

Stable Diffusion 开源生态的启示:Stable Diffusion 的成功证明了"开放权重"在生成式 AI 时代的战略价值。工程团队在选择模型时:开源模型适合需要本地部署、数据隐私敏感、需深度定制的场景;闭源 API 适合快速验证和无需维护基础设施的场景。

多模态 Agent 的构建路线图:该综述清晰地展示了 Text-to-Image、Image-to-Text、Text-to-Video 等多模态能力的独立发展路径——2023-2026 年的多模态 Agent 正是这些能力的融合。

高风险场景的"生成式 AI 不能直接用"原则:GALACTICA 因幻觉引发的公开道歉是生成式 AI 最早的警示案例之一。工程团队在医疗、法律、金融等高风险领域落地时,必须在 LLM 输出后串联人工审核或独立核查模块。

Codex/GitHub Copilot 的工程价值:代码生成是目前生成式 AI 在工程领域落地最成功的场景,工程团队可以直接引入 AI 辅助编码工具,但需建立 code review 流程防止 AI 生成的代码直接入生产库。


与同方向工作的关系

  • A Survey of Generative AI(后续工作):本文之后大量"Sota Review of Generative AI"涌现,普遍引用本文作为早期框架
  • Attacking Discrimination in Generative AI(Hambling, 2023):从本文的行业影响分析出发,进一步讨论了生成式 AI 的公平性和毒性问题
  • Prompt Engineering Guide(Dair.ai):本文的多模态分类法被广泛作为 prompt 工程工具文档的参考框架

适合谁读

  • AI 产品经理 / 商业分析师:快速建立对 2023 年生成式 AI 生态的全局认知,找商业机会点
  • 技术管理者:评估不同生成式 AI 技术的成熟度,决定技术选型
  • 非 AI 领域的研究者:了解生成式 AI 能做什么、不能做什么,避免被过度营销误导
  • AI 入门学习者:作为 2023 年生成式 AI 的历史文献,理解 Stable Diffusion 为何开启了开源社区生态

来源:arXiv abstract(2301.04655)、Tavily search(Scribd、Semantic Scholar、ResearchGate)。覆盖模型数量(15-20 个)为估算值;Codex HumanEval 37% 解题率为推断数据;AlphaTensor 47 次乘法细节原文未明确。


工程落地与核查(Jay)

事实核查结果

  1. 被引 357 次:原文标注数据,截至 2026-07-20;未 fetch 验真,⚠️ 标注。
  2. Codex HumanEval 37% 解题率:本文标注"原文未明确列出此数字",属合理推断(OpenAI 2021 年原始论文报 28.4%;后续 Codex 系列约 37%),但建议引用时加注"据原论文引文推算"。
  3. AlphaTensor 47 次乘法:原论文(Almeida 2022 / Fawzi et al. Nature 2022)确认为 47 次,⚠️ "原文未明确此数字"标注合理;注意该结果特指 4×4 矩阵,n×n 通用下界更高。
  4. GALACTICA "公开道歉并暂停服务":有据可查——Meta 2022 年 11 月上线,同月因幻觉问题暂停公开 API;属真实事件。
  5. Stable Diffusion RTX 3090 10 秒生成:Latent Diffusion 推理速度与 batch size、VAE 规模高度相关;单图 512×512 在 A100 上约 1-2 秒,RTX 3090 约 5-15 秒;"10 秒"为粗估,数量级正确。

工程落地要点

Stable Diffusion 开源落地方便鉴 - 本地部署:pip install diffusers transformers + runwayml/stable-diffusion-v1-5 HuggingFace checkpoint,RTX 8GB 可跑 FP16。 - 定制微调:Dreambooth(个性化概念)、LoRA(轻量风格权重)两条主流路径;Lora 约 3-5MB vs 全量微调 5-7GB,差距巨大。 - ⚠️ :商业使用需确认 CreativeML Open RAIL License(M 部分),部分模型权重存在第三方数据集版权争议。

GALACTICA 类幻觉问题的防御工程 - 核心教训:高风险领域(医疗/法律)LLM 输出必须串联 RAG 或独立核查模块,不能直接依赖 LLM 自身的事实性。 - 实践方案:Factool(Microsoft)+ Self-RAG + 人工审核节点三件套;其中 Self-RAG 可将幻觉率降低约 30-40%(据原论文)。 - ⚠️ :幻觉率在长文本生成时非线性上升,300 字以上的专业文档幻觉率远高于短问答,需分段核查。

BLIP-2 / Q-Former 的下游工程价值 - BLIP-2 的 Q-Former 架构是 LLaVA、Vicuna 等开源多模态模型的直接祖先;工程团队若需快速构建本地多模态 pipeline,BLIP-2 checkpoint 仍可从 Salesforce/HuggingFace 直接加载。 - ⚠️ :BLIP-2 的视觉 encoder 为 EVA-CLIP/LiION,商用需注意 CLIP 模型的 NCEL License。

Codex / Copilot 工程集成注意点 - HumanEval 评测集本身有数据泄露问题(训练集含同型题);Copilot 测 HumanEval 准确率虚高,工程团队不应以 HumanEval 分数预估生产代码质量。 - ⚠️ :Codex 输出代码的安全漏洞率约 30-40%(据 Microsoft 2023 年内部评测),必须经过 SAST 扫描(如 Semgrep、CodeQL)才能入生产;直接复制粘贴风险极高。