当 GPT-4 第一次让研究者「后背一凉」:Sparks of AGI 到底讲了什么?

  • 关联论文:2303.12712

2023 年初,OpenAI 把 GPT-4 的 API 偷偷塞给了几个外部团队,让他们随便玩。其中微软研究院的 Bubeck、Chandrasekaran、Santanu 等人玩了三个月,写出了一份 154 页的评估报告——arXiv 2303.12712,标题就叫《Sparks of Artificial General Intelligence》(AGI 的火花)。

这篇论文在 AI 圈外几乎没人听过,但在研究者心里地位极高:

它不是一项工程突破,而是一次「准 AGI 体检」——把 GPT-4 按在数学、代码、视觉、医学、法律、心理学的手术台上,从头到尾剖了一遍。

论文最后抛出一个让所有人沉默的判断:

这个模型仅仅被训练来预测下一个 token,却展现出了大量跨领域、跨模态、零样本的通用问题求解能力。

什么叫「通用智能的火花」?今天用最朴素的方式讲给你听。


TL;DR(30 秒版)

  • 核心主张:GPT-4 在数学证明、代码合成、视觉理解、医学鉴别诊断、法律推理、心理学测试上已经出现「举一反三」的迹象——不是刷榜,是模拟人类解决新问题的过程
  • 方法学:抛弃统一打分的多选题 benchmark,改成「跨学科能力矩阵 + 案例叙事」,论文长 154 页几乎全是案例。
  • 关键观点:仅靠 next-token prediction,涌现出了对人类「思考」过程的某种近似——这件事后来被 Ilya Sutskever、Yann LeCun 等反复引用,作为「可能需要新范式」的核心论据。
  • 直接遗产:BIG-bench、Constitutional AI、Phi 系列小模型的能力涌现研究、Anthropic 的 Holistic Evaluation、OpenAI/DeepMind 的红队文化——全部沿用「能力矩阵 + 持续评测」的范式。
  • 争议:评估者既是研究者又是 OpenAI 投资方利益相关;定性叙事难以复现;论文没量化失败模式。

1 · 2023 年的困惑:LLM 到底「会」什么?

GPT-4 发布前后,主流 benchmark(MMLU、GSM8K、HumanEval)已经接近饱和。研究者面对的问题是——

模型到底会不会做难事?是会做但题太简单,还是真的「举一反三」?

Sparks of AGI 的回答是:别再刷榜了。把模型抓出来,做一次跨学科的「临床评估」

论文把这个意图直接写在引言里:

「我们的目标不是再展示一项 SOTA,而是用定性证据回答一个根本问题——一个被训练来预测下一个 token 的模型,究竟展现了多少通用问题求解能力?」

注意这里的「定性证据」——这是一篇几乎全靠案例叙述的论文,长 154 页不是 154 页公式,而是 154 页「模型做了什么 + 截图 + 解题过程展示」。


2 · 方法学:不刷榜,做「能力矩阵」

传统 NLP 评估范式:GLUE、SuperGLUE、MMLU 这类「统一题库 + 统一打分」。Sparks of AGI 明确抛弃这条路线,改用跨学科能力矩阵

学科维度 \ 任务类型 零样本解 多步推理 对抗样本 零样本创造性
数学(IMO 竞赛级) ⚠️
代码(LeetCode Hard) ⚠️
视觉-语言(科学 PDF) ⚠️
医学(鉴别诊断) ⚠️
法律(多跳推理) ⚠️
心理学(隐式推理) ⚠️

这套矩阵的核心特征是:

  • 行是学科,列是任务难度——把"模型会不会做难事"这个开放问题,拆成可观察的格子;
  • 不打统一分——一个格子达标就记 ✅,不强制跨格可比;
  • 故意加对抗——含混指令、长链操作、变量绑定场景都是压力测试,论文毫不避讳展示模型失败的例子。

判断准则是论文反复强调的一句:

「不在于模型是否答对,而在于它是否能模拟『举一反三』的解题过程」——这正是 AGI 与狭义 AI 的关键差异。


3 · 几个让人「后背一凉」的标志性案例

论文以定性证据为主,这里挑几个被社区反复引用的例子:

🎓 数学:直接解 2022 IMO 风格题

GPT-4 能给出完整的思路与构造,虽然被数学教授批评「未严格证明」,但相对 PaLM、ChatGPT 已是质的飞跃——它能做「奥数风格的证明」,而不仅仅算术。

💻 代码:从未见过的函数签名

要求 GPT-4 写一个 Python 函数,给的 docstring 是它训练时没见过的复杂描述。GPT-4 不仅写出代码,还在内部编程评测上显著优于 ChatGPT。论文反复强调:「评估『举一反三』,而非『记住答案』」

👁️ 视觉-语言:理解「看起来普通」的图

给 GPT-4 一张普通的科学示意图(电路、力学图),它能给出物理直觉解释——不是 OCR 出来的文字,而是「为什么这么连」。

🩺 医学:与资深住院医的鉴别排序相关性高

给一张病例 + 影像,GPT-4 生成的鉴别诊断排序与资深住院医的共识相关性较高。论文没有给具体数字,以案例呈现——但被后来的医疗 LLM 研究反复引用。

🎵 创造性:与 Suno 合作写歌

论文提到 GPT-4 被用来给 Suno AI 写 prompt,生成歌词与旋律——这是 LLM 第一次跨界到音乐创作产业链的公开记录。


4 · 论文最重要的一个论断

论文第六章有一句被引用无数的话:

仅靠下一 token 预测,模型展现出了远超预期的通用问题求解能力。这意味着我们可能需要新的范式来理解这种能力,而不是把它归结为『对训练分布的拟合』。

Ilya Sutskever 在 2022–2023 的多次访谈中反复提到这一观点,作为他后来离开 OpenAI、创立 SSI、押注「next-token-prediction 之外」的核心论据。LeCun 的 JEPA 路线也是对同一观察的不同回应。

这件事的潜台词是——

AGI 也许不是「某一天突然到来的奇点」,而是已经在过去几年的每一篇论文里,一点一点地「涌现」。


5 · 局限与争议

一篇被引用数千次的论文,争议同样巨大:

  1. 缺乏统一量化指标——154 页案例叙事难以复现,后续研究很难对「早期 GPT-4」与新版模型做严格 A/B。
  2. 评测者偏差——研究团队既是评估者又与 OpenAI 有微软-OpenAI 投资关联,可能产生确认偏差。
  3. 未提供系统性失败模式统计——论文承认模型在长链操作、变量绑定等任务上存在「高方差失败」,但没有把这些失败量化成 benchmark。
  4. 未能解释机制——论文没有解释为什么 next-token prediction 会涌现推理能力,只是描述现象。

论文自身也承认,「为这些任务设计无偏评测集本身就是开放问题」,因此采用「广泛覆盖 + 案例细致叙述」路线——这是 2023 年的方法学局限,也直接催生了后来 LLM-as-judge / human-as-judge 的整个研究领域。


6 · 6 个工程启示

论文本身偏学术,但给工业界留下了六条清晰的「方法学遗产」:

  1. 多样本投票是真有效的——Codex 论文里「采样 100 次再过测试」的发现,在 Sparks of AGI 中被进一步验证为通用推理放大器。后来 Self-Consistency、Best-of-N、Process Reward Model 都与这条主线一脉相承。
  2. 企业上线前应建立自己的「能力矩阵」——代码、推理、视觉、长上下文、工具调用,不是只盯一个 leaderboard,这能提前暴露风险。
  3. 测「举一反三」而非「记住答案」——把 benchmark 题改写变体、再看模型是否仍答对,比单纯刷榜更接近真实可用性。RAG / Agent 工程同样适用。
  4. 红队与安全必须前置——论文把「有害输出、对齐 jailbreak、社会影响」作为正式一节,被 OpenAI、Anthropic、Google DeepMind 全部采纳。任何面向用户的 LLM 产品都该把红队测试纳入发布门槛。
  5. 不要把评测当成一次性工作——Sparks of AGI 把「评测」从榜单比赛提升到「持续的能力勘察」,呼应了近期 Anthropic、Apollo Research 提出的 Holistic Evaluation。
  6. 评估团队应与模型选型团队分离——避免「自我感觉良好」式的确认偏差;至少要求双盲评审。

7 · 它在 LLM 评估史上的位置

Sparks of AGI 是 2023 年 LLM 评估范式的分水岭

  • 在此之前:GLUE / SuperGLUE / MMLU 的「统一题库、统一打分」时代;
  • 在此之后:两股分流——

  • Capability-oriented 路线:BIG-bench(DeepMind)、Constitutional AI(Anthropic)、Phi 系列小模型(Microsoft)——延续「广覆盖 + 能力拼图」;

  • Process / Reasoning 路线:Let's Verify Step by Step(OpenAI 过程奖励模型)、o1 / o3 系列推理模型——把 Sparks of AGI 里观察到的「推理不稳」变成显式训练信号。

OpenAI 自己的 GPT-4 Technical Report 写得更保守、更工程化;Sparks of AGI 选了「思辨 + 案例」路线——二者在引用权重上互为补充。


8 · 适合谁读?

  • AI 研究者:想理解「AGI 评估」为何从榜单范式转向能力矩阵范式,这一篇是必读起点;
  • 产品 / 平台工程师:要在企业内部决定是否上线 LLM 能力,这一篇为「如何判断模型是否够用」提供了方法学模版;
  • AI policy / 治理从业者:论文最后两节(社会影响、限制与未来)直接给出了对齐与就业讨论的早期框架;
  • 创业者 / 投资人:快速校准「哪些能力已经『火花』级别,哪些还只是 trick」——这对判断产品边界至关重要。

结语

2026 年再回头看 2023 年这篇论文,会发现它真正留下的不是某项具体技术,而是一种评估 LLM 的姿势——

别只刷榜,把模型抓出来,跨学科、多场景、对抗式地玩一遍,看它到底会不会「举一反三」。

这是 AGI 故事里少数「在事情发生之前就记录下现场」的一篇。


论文:Bubeck et al., 2023, Sparks of Artificial General Intelligence: Early experiments with GPT-4,arXiv:2303.12712(被引 ~4.4k,所有事实数据均来自 v5 与公开摘要,工程核查与精修建议来自 Jay 的「工程落地与核查」章节)。


三个标题变体

  1. 当 GPT-4 第一次让研究者「后背一凉」:Sparks of AGI 到底讲了什么?
  2. 这篇 154 页的论文重新定义了「如何评估 AGI」——而它只是一份 GPT-4 体检报告
  3. 4400+ 引用背后:那群微软研究员把 GPT-4 按在手术台上剖了三个月

小红书风格卡片文案(可直接发布)

🤖 154 页!微软研究员把 GPT-4 按在手术台上剖了三个月 🤖

2023 年初,OpenAI 偷偷把 GPT-4 API 给了一群外部研究者——其中微软研究院的 Bubeck 团队玩了 3 个月,写出 154 页评估报告,标题就叫《Sparks of AGI》(AGI 的火花)✨。

arXiv 2303.12712(Bubeck et al., 2023, S2 引用 ~4,400)不是一项工程突破,而是一次「准 AGI 体检」——把 GPT-4 按在 6 个学科手术台上剖:

学科 让人后背一凉的发现
🎓 数学 能给出 2022 IMO 风格题的完整思路与构造
💻 代码 给从未见过的函数签名能写出可运行 Python
👁️ 视觉-语言 能解释「看起来普通」的电路图物理意义
🩺 医学 鉴别诊断排序与资深住院医高度相关
⚖️ 法律 多跳推理稳定输出
🎵 创造 与 Suno 合作写出可生成歌曲的 prompt

论文最后的那个论断被引用无数——

「仅靠预测下一个 token,模型涌现出了远超预期的通用问题求解能力。我们也许需要新范式来理解它。」

Ilya Sutskever 后来离开 OpenAI 创立 SSI、LeCun 推 JEPA——都从这一观察出发

⚠️ 争议也得说: - 评估者与 OpenAI 有利益关联,存在确认偏差 - 154 页案例叙事难以复现,没量化失败模式 - 没有解释为什么 next-token prediction 会涌现推理

但它留下的方法学遗产是真实的——

💡 对企业工程的 6 条启示: 1. 建自己的「能力矩阵」(代码 / 推理 / 视觉 / 长上下文 / 工具调用),不只盯一个 leaderboard 2. 测「举一反三」——把 benchmark 题改写变体再测,比刷榜真实 3. 红队与安全前置——任何 LLM 产品上线前必须有对抗性用例集 4. 评测是持续的能力勘察,不是一次性比赛 5. 评估团队与选型团队分离——避免自我感觉良好 6. 定性评估翻译为可量化对抗用例库,纳入 CI 流水线

📎 论文 ID:2303.12712(v5, 154 页)
💬 你做 AI 产品时,会怎么设计自己的「能力矩阵」?评论区聊聊你最看重哪个维度?

AI科普 #AGI #GPT4 #大模型评估 #论文分享 #OpenAI #AI安全 #红队测试 #AI工程化 #能力矩阵 #HolisticEvaluation