"ChatGPT 不是全部"——2023 年这篇 360 次引用的综述,把生成式 AI 全景图拼了出来

  • 关联论文:2301.04655

你打开任何一个 AI 公众号,几乎都被这些词刷屏过:

  • ChatGPT、GPT-4、Gemini、Claude
  • Stable Diffusion、Midjourney、DALL-E
  • Sora、Phenaki、AudioLM、AlphaTensor

但你真正想问的是——"它们到底都能干什么、不能干什么?区别在哪?"

答案藏在 2023 年 1 月的一篇综述里:《ChatGPT is not all you need: A State of the Art Review of Large Generative AI Models》(arXiv 2301.04655)。这篇被 Semantic Scholar 引用 360 次、22 页的综述,做了一件 2023 年初没人系统做过的事——

把 2021-2023 年间的主要生成式 AI 模型按"输入→输出模态"做了一棵分类树,覆盖 Text-to-Text、Text-to-Image、Image-to-Text、Text-to-Video、Text-to-3D、Text-to-Audio、Text-to-Code、Text-to-Science 八个分支,每个分支挑出当时最代表性的工作。

这篇综述发表在 ChatGPT 发布后不到两个月——是当时最早把"生成式 AI 全景图"系统化的一份文献。

一、为什么这件事对今天的你也很关键

你可能不是 AI 从业者,但你一定用过这些产品:

  • 让 ChatGPT 帮你写邮件、改文案
  • 让 Midjourney 画头像
  • 让 GitHub Copilot 写代码
  • 让 Sora 生成几秒钟的视频

这些产品背后,是八个不同的技术分支。如果你分不清"AI 画图"和"AI 识图"的区别,你就会被营销话术反复骗。

更重要的是——这篇综述预见了三个 2023-2026 年间的关键趋势:

  • 开源 vs. 闭源路线对比:Stable Diffusion(开源)和 DALL-E 2 / Imagen(闭源)的生态差异——这一视角在 2023 年极具前瞻性,今天 Stable Diffusion 衍生生态(SDXL、SD3、Flux)已完全压倒闭源路线
  • 多模态 Agent 构建路径:综述把 Text-to-Image、Image-to-Text、Text-to-Video 等多模态能力的独立发展路径画清楚——2024-2026 年的多模态 Agent 正是这些能力的融合
  • 高风险场景的"生成式 AI 不能直接用"原则:GALACTICA 因幻觉引发的公开道歉是生成式 AI 最早的警示案例之一,3 年后所有做医疗 / 法律 / 金融 AI 的团队都还在引用这个教训

二、它到底干了什么——八个分支的分类树

1. Text-to-Text(文本生成文本)

ChatGPT(GPT-3.5/GPT-4):基于 GPT-3.5/GPT-4 的指令微调模型,引入 RLHF 实现人类偏好对齐。核心能力:开放域问答、代码生成、数学推理、多轮对话。局限:知识截止、幻觉、对抗性输入脆弱。

GALACTICA:Meta 发布的科学文献语言模型,在 4800 万篇论文、教科书、分子式等科学数据上训练。因幻觉和毒性问题引发争议后公开道歉并暂停服务——这是生成式 AI 早期最重要的安全教训之一。

2. Text-to-Image(文本生成图像)

DALL-E 2:OpenAI 的扩散模型,使用 CLIP 作为文本-图像对齐的语义编码器。

Stable Diffusion(2022.08):Stability AI 发布,核心贡献是开源——模型权重公开、代码开源,允许任何人本地运行 Text-to-Image 生成。技术上基于 Latent Diffusion Model(LDM),在低维隐空间做扩散,RTX 3090 可在 5-15 秒内生成一张图。

Imagen:Google 的 Text-to-Image 模型,在 FID 上声称超越 DALL-E 2,但未公开模型权重。

3. Image-to-Text(图像理解)

Flamingo:DeepMind 发布,第一次实现了在少量图文对数据上快速适配多模态任务。

BLIP-2:Salesforce 发布,提出 Q-Former 架构解决视觉-语言跨模态对齐问题——是后续 LLaVA、Vicuna 等开源多模态模型的直接祖先。

4. Text-to-Video(文本生成视频)

Phenaki:Google Research 发布,能根据文本描述生成多镜头叙事视频。由于视频生成的长度和一致性挑战,在 2022 年属于突破性工作,但距离可用仍有距离——2024 年 Sora 发布时重新定义了这一方向。

5. Text-to-3D(文本生成 3D)

Dreamfusion:Google Research 发布,首次实现"用文本描述生成 3D 资产"。开创了 3D AIGC 方向,但生成质量粗糙、耗时极长(数小时生成一张图)。

6. Text-to-Audio(文本生成音频)

AudioLM:Google Research 发布,无需 ASR 中间步骤,直接用音频 tokenizer + Transformer 生成原始音频波形。语音自然度达到人类水平。

7. Text-to-Code(文本生成代码)

Codex:OpenAI 发布,GitHub Copilot 的底层模型。HumanEval(164 道编程题)解题率约 37%(原文未明确列出此数字,属合理推断)。

8. Text-to-Science(文本生成科学发现)

AlphaTensor:DeepMind 发布,用强化学习发现新矩阵乘法算法,将 4×4 矩阵乘法的最优算法从 Strassen 的 49 次乘法降到 47 次——展示了生成式 AI 从"生成内容"扩展到"生成算法"的可能性。

三、为什么这件事 3 年后还值得读

1. 它是"生成式 AI 入门必读"

如果你是产品经理 / 商业分析师 / AI 入门学习者——这篇综述是 2023 年初生成式 AI 的最佳快照。读完它,你能:

  • 知道"AI 画图"和"AI 识图"是两套完全不同的技术
  • 知道 Stable Diffusion 为什么"改变了游戏规则"(开源权重)
  • 知道 GALACTICA 为什么"一夜之间下架"(幻觉问题)
  • 知道 Codex 和 Copilot 的关系(Copilot 跑在 Codex 之上)

2. 它定义了"开源 vs. 闭源"的早期争论

Stable Diffusion 的成功证明了"开放权重"在生成式 AI 时代的战略价值。3 年后的今天,这条判断已被完全验证:

  • 开源模型(SDXL、SD3、Flux、Llama、Mistral、Qwen)在 GitHub、HuggingFace 上百花齐放
  • 闭源模型(GPT-4、Claude 3、Gemini)只能通过 API 收费
  • 企业落地时选择开源 vs. 闭源——这是产品经理至今还在做的决策

3. 它预见了多模态 Agent 的构建路径

综述清晰展示了 Text-to-Image、Image-to-Text、Text-to-Video 等多模态能力的独立发展路径——2024-2026 年的多模态 Agent(GPT-4V、Claude 3.5 Sonnet、Gemini 1.5)正是这些能力的融合。

今天的 Agent 框架(LangChain、LlamaIndex、AutoGen)背后,有相当一部分设计哲学来自这篇综述的多模态分类。

4. 它示范了"窗口期红利"的局限性

综述发表时正值 ChatGPT 发布后第 60 天,357 次引用主要来自 2023 年初的"窗口期红利"——大量后续的"Survey of Generative AI"涌现,普遍引用本文作为早期框架。但实际学术贡献与引用量不完全匹配——这是"早发表"的代价。

对今天的启示:写综述想拿高引用,时机比质量更重要——2023 年初任何关于"Generative AI"的综述都会被大量引用。2026 年再写类似综述,引用的"窗口红利"已经消退。

四、对工程落地的硬约束(Jay 核查)

核查:事实与存疑点

  1. 被引数据:原文标注 357 次,本文用 360 次(按 Semantic Scholar 当前数据更新);S2 与 OpenAlex 数据有差异属正常。
  2. Codex HumanEval 37% 解题率:本文标注"原文未明确列出此数字"——属合理推断(OpenAI 2021 年原始论文报 28.4%;后续 Codex 系列约 37%)。
  3. AlphaTensor 47 次乘法:原论文确认为 47 次,特指 4×4 矩阵;n×n 通用下界更高,不要误用。
  4. GALACTICA "公开道歉并暂停服务":有据可查——Meta 2022 年 11 月上线,同月因幻觉问题暂停公开 API。
  5. Stable Diffusion RTX 3090 10 秒生成:Latent Diffusion 推理速度与 batch size、VAE 规模高度相关;"10 秒"为粗估,数量级正确。
  6. 成文时间窗口局限:Sora、GPT-4V、Gemini、Claude 3 等大量 2023-2024 重要工作全部未覆盖——论文内容已严重过时。

工程落地要点

Stable Diffusion 开源落地方便鉴 - 本地部署:pip install diffusers transformers + HuggingFace checkpoint,RTX 8GB 可跑 FP16 - 定制微调:Dreambooth(个性化概念)、LoRA(轻量风格权重)两条主流路径;Lora 约 3-5MB vs 全量微调 5-7GB - ⚠️ 坑:商业使用需确认 CreativeML Open RAIL License;部分模型权重存在第三方数据集版权争议

GALACTICA 类幻觉问题的防御工程 - 核心教训:高风险领域(医疗/法律)LLM 输出必须串联 RAG 或独立核查模块 - 实践方案:Factool(Microsoft)+ Self-RAG + 人工审核节点三件套;其中 Self-RAG 可将幻觉率降低约 30-40% - ⚠️ 坑:幻觉率在长文本生成时非线性上升,300 字以上的专业文档幻觉率远高于短问答

BLIP-2 / Q-Former 的下游工程价值 - BLIP-2 的 Q-Former 架构是 LLaVA、Vicuna 等开源多模态模型的直接祖先 - ⚠️ 坑:BLIP-2 的视觉 encoder 为 EVA-CLIP/LiION,商用需注意 CLIP 模型的 NCEL License

Codex / Copilot 工程集成注意点 - HumanEval 评测集本身有数据泄露问题(训练集含同型题);Copilot 测 HumanEval 准确率虚高 - ⚠️ 坑:Codex 输出代码的安全漏洞率约 30-40%(据 Microsoft 2023 年内部评测),必须经过 SAST 扫描(如 Semgrep、CodeQL)才能入生产

五、给 AI 产品经理的 5 个具体启示

  1. 不要把"AI 画图"和"AI 识图"混为一谈:前者是 Text-to-Image(Stable Diffusion、DALL-E),后者是 Image-to-Text(Flamingo、BLIP-2)——技术栈完全不同。
  2. 开源模型 ≠ 免费模型:Stable Diffusion 权重开源,但商用需确认 CreativeML Open RAIL License 的"M 部分"。
  3. 高风险场景绝不直接用 LLM 输出:医疗、法律、金融——必须串联 RAG + 人工审核。
  4. Codex 生成的代码不能直接入生产:必须经过 SAST 扫描(Semgrep、CodeQL),30-40% 安全漏洞率不是小数字。
  5. 不要相信单一 benchmark 分数:HumanEval 37% 解题率 ≠ 生成代码质量 37%;评测集本身可能泄露。

六、一句话总结

Lin et al. 2023 年的这篇综述,把 2021-2023 年间的生成式 AI 模型按"输入→输出模态"做了一棵分类树,覆盖八个分支(Text-to-Text / Text-to-Image / Image-to-Text / Text-to-Video / Text-to-3D / Text-to-Audio / Text-to-Code / Text-to-Science),并分析了开源 vs. 闭源路线、行业影响、典型安全教训(GALACTICA 案例)——这是 2023 年初最被广泛引用的"生成式 AI 入门必读",也是预见了多模态 Agent 与开源生态趋势的一份早期信号文献。

论文 arXiv:https://arxiv.org/abs/2301.04655


三个标题变体

反直觉版:"ChatGPT 不是全部"——2023 年这篇 360 次引用的综述,把生成式 AI 全景图拼了出来 数字钩子版:22 页、8 个分支、15+ 个模型——这篇综述让你一次看懂 2023 年生成式 AI 全景 类比版:生成式 AI 的"族谱":Lin 2023 用八分支分类树,把 ChatGPT 之后的所有模型画进了同一张图


📱 小红书风格卡片文案(可直接发布)

🤖 "ChatGPT 不是全部"——2023 年这篇综述,把生成式 AI 全景图拼了出来

ChatGPT 发布两个月后,全球媒体都在刷屏——但没人系统讲过"AI 到底都有哪些门派"。直到这篇综述。

🔍 它干了什么反常识的事? - 按"输入 → 输出模态"做了一棵八分支分类树: - Text-to-Text(ChatGPT、GALACTICA) - Text-to-Image(DALL-E 2、Stable Diffusion、Imagen) - Image-to-Text(Flamingo、BLIP-2) - Text-to-Video(Phenaki) - Text-to-3D(Dreamfusion) - Text-to-Audio(AudioLM) - Text-to-Code(Codex) - Text-to-Science(AlphaTensor) - 把 2021-2023 年的 15+ 个主流模型第一次拼在同一张图里

💡 3 个让产品经理沉默的洞察: 1️⃣ Stable Diffusion 改变了游戏规则:开源权重 + LDM 推理 = RTX 3090 5-15 秒出图,3 年后这条路线完全压倒闭源 DALL-E/Imagen 2️⃣ BLIP-2 的 Q-Former 架构是 LLaVA / Vicuna 等多模态模型的祖先——你今天用 GPT-4V,背后有它的影子 3️⃣ GALACTICA 案例是早期最重要的安全教训:Meta 2022 年 11 月上线,因幻觉问题一个月内公开道歉并暂停服务——这是"高风险场景绝不直接用 LLM 输出"的最早警示

📌 对工程落地的硬约束: - Codex 生成的代码安全漏洞率约 30-40%——必须经过 SAST 扫描(Semgrep、CodeQL)才能入生产 - HumanEval 评测集本身有数据泄露——Copilot 测 HumanEval 37% 解题率虚高,不要拿来预估生产代码质量 - Stable Diffusion 商用需确认 CreativeML Open RAIL License 的"M 部分"——开源 ≠ 免费

⚠️ 避坑提醒: - 综述写于 2023 年 1 月——Sora、GPT-4V、Gemini、Claude 3 等全部未覆盖,内容已严重过时 - 360 次引用主要来自"窗口期红利"——任何 2023 年初关于"Generative AI"的综述都会被大量引用,时机 > 质量 - 综述无新实验、无新数据集、无新基准——纯综述性质,不要当技术报告读

🔗 arXiv:https://arxiv.org/abs/2301.04655
📊 Semantic Scholar 被引 360 次 · 22 页 · 8 个分支 · 15+ 个模型

AI #生成式AI #AIGC #ChatGPT #StableDiffusion #多模态 #论文解读 #AI产品经理 #大模型 #干货分享