把 GPT / LLaMA / PaLM 三大族谱装进同一张图——Minaee 等 2024 LLM 综述成为后续所有 LLM 论文的"方法论骨架"

  • 关联论文:2402.06196

你有没有这种感觉——

2022 年 11 月 ChatGPT 发布之后,LLM 论文像雨后春笋——每个月都有新模型、新对齐算法、新 benchmark、新 prompt 技巧。你如果想入门 LLM,大概率会卡在同一个地方:

"这么多东西,到底谁是谁?怎么串起来?"

光看名字就能把人整晕:GPT 系列、LLaMA 系列、PaLM、Falcon、Mistral、Qwen、DeepSeek、Yi、GLM、Baichuan……每个家族都有自己的训练 trick 和数据配比。

技术栈也是一锅粥:RLHF、DPO、SFT、PEFT、prompt tuning、RAG、MoE、长上下文扩展……每个方向都有几十篇新论文。

评测更不用说:MMLU、HellaSwag、TruthfulQA、HumanEval、GSM8K、BBH、MT-Bench、AlpacaEval、Chatbot Arena……不同 benchmark 测不同能力,怎么选、怎么对比,是新人入门的最大门槛。

但 2024 年 2 月 Minaee 等人发表的 LLM 综述(arXiv 2402.06196,S2 引用超千)说:别慌,我用一张图把所有东西装进同一张可工作地图。

换句话说:这篇综述不是又一份"GPT 是什么"的科普,而是 LLM 生态的"骨架参考图"——按"主流模型家族 → 训练与增强技术 → 数据集 → 评估指标 → 主流 benchmark 横评 → 开放挑战"六条主线系统梳理,是 2024 年初最常被引用的 LLM 综述之一,也是后续所有 LLM 综述的方法论骨架之一。

一、为什么这篇综述对 LLM 学习者这么关键

研究者真正需要的不是又一份"GPT 是什么"的科普,而是一张能把模型 / 技术 / 数据 / 评测装进同一张图的可工作地图。本文的贡献正是这张图:

  • 模型家族:GPT / LLaMA / PaLM 三大族谱深度对比 + 30+ 模型横评表
  • 训练技术:预训练 / SFT / RLHF / DPO / PEFT / RAG / Agent 一条主线讲下来
  • 数据集:从预训练语料到指令微调、偏好数据、评测集四层分类
  • 评测体系:任务维度 + 方法维度 + 指标维度三层评估
  • 横评对比:GPT-4 / Claude 3 / Gemini 1.5 / Llama-3 / Mistral-Large / Qwen-2 等在 MMLU / GSM8K / HumanEval / MT-Bench / HellaSwag / TruthfulQA 等关键 benchmark 上的横评对比

这是新人入门的"工具书价值"——照着这个框架入门,可以少走 3-6 个月弯路。

二、六条主线概览

1. 主流 LLM 家族对比

论文选取 GPT、LLaMA、PaLM 三大族谱做深度对比,并扩展到若干其他代表:

  • GPT 系列:从 GPT-1/2/3 的 scale up,到 GPT-3.5/4 的 RLHF 对齐,OpenAI 路线。强调 decoder-only Transformer + 规模化。
  • LLaMA 系列:Meta 的开源功臣,LLaMA-1/2/3,主打开源、可复现、社区生态,强调数据质量与训练效率。
  • PaLM / PaLM 2 / Gemini:Google 路线,强调 Pathways 系统 + 多模态 + 工具调用。
  • 其他:Falcon、Mistral、Qwen、DeepSeek、Yi、GLM、Baichuan 等被以表格形式归纳。

每族的关键维度:参数量、训练数据规模、训练 token 数、上下文窗口、关键创新点、评测表现、开源与否。

2. 训练 / 增强技术体系(按"是否改模型权重"划分)

  • 预训练:self-supervised next-token prediction、scaling law(Kaplan 2020 / Chinchilla 2022)、数据清洗、去重、配比。
  • 监督微调 (SFT):指令数据合成、Self-Instruct、Alpaca、OpenAssistant 等开源数据集生态。
  • 人类反馈强化学习 (RLHF):PPO + reward model → InstructGPT 范式。
  • 替代对齐算法:DPO、IPO、KTO、SimPO、ORPO 等直接偏好学习系列。
  • 参数高效微调 (PEFT):LoRA、QLoRA、Adapter、Prefix Tuning、P-Tuning。
  • Prompt 工程:Few-shot CoT、Zero-shot CoT、Self-Consistency、ReAct、ToT。
  • 检索增强 (RAG):向量数据库、BM25 + embedding 混合检索、HyDE、Self-RAG。
  • 工具与 Agent:function calling、ReAct、Toolformer、AutoGPT 范式。

3. 数据集分层

  • 预训练语料:Common Crawl、C4、RedPajama、SlimPajama、The Pile、Falcon RefinedWeb。
  • 指令微调:Alpaca、Dolly、OpenAssistant、ShareGPT、UltraChat。
  • 偏好数据:HH-RLHF、UltraFeedback、Argilla DPO Mix、Chatbot Arena Conversations。
  • 评测集:见下节。

4. 评估体系(三层评估)

  • 任务维度:NLP 传统任务(QA、分类、生成、翻译、摘要)、推理(数学、逻辑、常识)、代码(HumanEval、MBPP)、多模态。
  • 方法维度:zero-shot、few-shot、CoT、Self-Consistency、专家投票。
  • 指标维度:准确率、BLEU、ROUGE、Pass@k、ELO(Chatbot Arena)、MT-Bench 评分。

5. 横评对比表(被引最高的部分)

模型 MMLU GSM8K HumanEval MT-Bench
GPT-4 ≈ 86.4% ≈ 92% ≈ 67% 9+
Claude 3 Opus ≈ 86.8% ≈ 95% ≈ 84.9% 9+
Gemini 1.5 Pro ≈ 81.9% — — —
Llama-3-70B ≈ 82.0% ≈ 93% ≈ 81.7% 9-

⚠️ 综述类论文横评数字来源于各原论文与公开 leaderboard,并非本文统一复现结果;不同榜单规则不同,引用时需要自行折算。⚠️ Llama-3 HumanEval 81.7% 属于较高估计,Meta 官方公布为 68%;建议引用时注明评测配置。

6. 开放挑战(论文附后续研究方向)

  • emergent ability(涌现能力)
  • hallucination(幻觉)
  • bias(偏见)
  • 安全(safety / red-teaming)
  • 效率(efficiency / inference cost)
  • 长上下文(long context)
  • 多模态(multimodal)

每个挑战都附后续研究方向——这是综述的"延展价值"。

三、关键数字与训练规模

⚠️ 数字来自综述 + 各原论文,引用时建议注明来源(截至 paper_card 2026-07-20 更新):

  • 训练数据 token 数:GPT-3 用了 300B tokens;LLaMA-1 用了 1.4T tokens;PaLM 用了 780B tokens;Chinchilla 给出最优 token / param ≈ 20:1。
  • MMLU 横评:GPT-4 ≈ 86.4%、Claude 3 Opus ≈ 86.8%、Gemini 1.5 Pro ≈ 81.9%、Llama-3-70B ≈ 82.0%。
  • HumanEval 横评:GPT-4 ≈ 67%、Claude 3 Opus ≈ 84.9%、Llama-3-70B ≈ 81.7%(⚠️ Meta 官方 68%,81.7% 来自不同评测配置)。
  • GSM8K 横评:GPT-4 ≈ 92%、Claude 3 Opus ≈ 95%、Llama-3-70B ≈ 93%。
  • S2 引用超千:2024 年 2 月论文,截至 2026 年 7 月引用数未独立核验;⚠️ 标注。
  • Chinchilla 20:1 法则:Kaplan 2020 → Chinchilla 2022 演进正确;但 Flopera.ai 2024 年分析显示 GPT-4o 等前沿模型已明显偏离此比例(高质量数据稀缺导致实际最优比例更高)。

四、跟同类综述的关系

综述 与本文的关系
Zhao et al. 2023 A Survey of Large Language Models 直接前驱——本文差异在于更聚焦三大族谱深度对比 + 训练技术系统化
Huang et al. 2023 Large Language Models: Principles, Practices and Promises 同期同主题工作,差异在于覆盖面与侧重点不同
A Primer on Large Language Models and their Limits(Stanford CRFM) Stanford CRFM 视角,更偏教学型
Foundational Challenges in Assuring Alignment and Safety of LLMs AI 安全视角,覆盖本文未深入的 alignment 安全议题
MoE / Long-Context / LLM Agent / Multimodal 细分综述(2024-2026) 本文作为索引起点被反复引用,下游衍生出大量子领域综述

方法论遗产:本文的"模型 + 技术 + 数据 + 评测"四象限成为后续综述的标配骨架,横评表被反复引用——任何 LLM 综述如果不引用本文,几乎会被审稿人质疑。

五、为什么这篇综述对工程团队很重要

  1. Chinchilla 法则仍是默认起点:训练 token 与参数比 20:1 是预算分配的合理默认,再根据具体场景上下浮动。

  2. 对齐路线选择:RLHF 仍是事实标准,但 DPO 系列在工程成本、稳定性上越来越有竞争力;中小团队优先 DPO,大厂可考虑完整 PPO 链路。

  3. RAG + PEFT 是中小团队最有效的组合:不需要从头预训练,靠 LoRA 微调 + RAG 就能在垂直领域拿到业务可用效果。

  4. 评测先于模型升级:上线前必须先建立涵盖任务级 + 人类偏好(MT-Bench、AlpacaEval、Chatbot Arena 风格)的评测 pipeline。

  5. 关注长上下文与多模态是 2024-2026 的两个主线:模型窗口从 8K → 128K → 1M,多模态从纯文本扩展到图像 / 音频 / 视频 / 3D,是产品差异化最重要的两个维度。

  6. 不要忽略安全与对齐成本:RLHF / DPO 看似只是训练 trick,但数据采集 + 红队评测 + 在线监控的工程成本经常占总投入的 30-40%。

⚠️ 八个边界坑(使用前必看)

  1. 时效性强但易过期:综述 2024 年初定稿,2024 年下半年的 GPT-4o、Claude 3.5、Gemini 2、Llama 3.1/3.3 等更新内容需要后续版本跟进——本文不能直接用于 2026 年的技术选型。

  2. 多模态覆盖偏薄:Gemini、GPT-4V 在表格里出现,但 vision/audio 部分没有展开成独立章节——vision/audio 方向需要后续的 Multimodal LLM Survey 补充。

  3. 中文 LLM 单独成章不足:Qwen、DeepSeek、GLM 在表格里,但中文能力评测、跨语种迁移未单列讨论——中文场景需补充 Chinese-LLM-Benchmark 等专项工作。

  4. Agent 部分略简:LangChain、AutoGPT 等生态提及但没展开,2024-2026 年 Agent 工程实践远超本综述当时覆盖范围——Agent 方向需要后续 LLM Agent Survey 专项补充。

  5. 横评数字依赖二手数据:没有给出统一 prompt、统一评测脚本的复现,引用时需注明出处(不同评测机构同模型可差 ±3%)。

  6. HumanEval 数据泄露问题:评测集题目出现在部分训练数据中,建议补充 MBPP+ / LiveCodeBench 等更难泄露的代码评测集。

  7. Llama-3 HumanEval 数字争议:综述引用 81.7%,Meta 官方公布为 68%——不同评测配置(prompt / temperature / sampling)导致差异,引用时务必注明。

  8. Chinchilla 法则已被偏离:GPT-4o / Claude 3.5 等前沿模型已明显偏离 20:1 比例(高质量数据稀缺导致实际最优比例更高)——用 20:1 做训练预算分配时需考虑此差异。

适合谁读

  • LLM 应用开发者:✅ 必备入门与查询手册
  • NLP / ML 研究者:✅ 选 baseline、找选题、对比模型表现的高频工具书
  • 产品 / 战略:✅ 理解 LLM 生态成熟度与差距,快速判断"是否已经成熟到能上生产"
  • 投资 / 咨询:✅ 用模型 / 评测横评表做赛道对比与估值参考
  • 学生与新人:✅ 作为 LLM 课程补充材料,可以少走 3-6 个月的弯路
  • AI 治理 / 合规:✅ 评估"模型能力 vs 风险"的依据
  • 不适合:❌ 想直接拿综述里的 SOTA 数字做 2026 年技术选型对比的——已严重过时,应使用最新 leaderboard + 各厂商 2026 报告

📌 一句话总结:arXiv 2402.06196 给出 Minaee 等 LLM 综述——按"主流模型家族(GPT / LLaMA / PaLM)+ 训练与增强技术(预训练 / SFT / RLHF / DPO / PEFT / RAG / Agent)+ 数据集(预训练语料 / 指令 / 偏好 / 评测)+ 评估指标 + 主流 benchmark 横评(MMLU / GSM8K / HumanEval / MT-Bench)+ 开放挑战"六条主线系统梳理 LLM 生态,30+ 模型横评 + Chinchilla 20:1 法则 + 完整训练技术谱系 + 评测体系三层(任务 / 方法 / 指标);S2 引用超千,是 2024 年初最常被引用的 LLM 综述之一,也是后续所有 LLM 综述的方法论骨架之一;但时效性强易过期(GPT-4o / Claude 3.5 / Gemini 2 未覆盖)、多模态覆盖偏薄、中文 LLM 单独成章不足、Agent 部分略简、横评数字依赖二手、HumanEval 数据泄露、Llama-3 HumanEval 数字争议、Chinchilla 法则已被偏离八个坑必须在引用前补完。

🔔 评论区聊聊:你读过 Minaee 这篇综述吗?在你做 LLM 技术选型 / 论文写作 / 行业分析时,是把它当"工具书查询",还是当"骨架参考图"?哪些子领域(MoE / Long-Context / Agent / 多模态)你希望后续有更细的综述补充?

LLM #大语言模型 #综述 #Survey #GPT #LLaMA #PaLM #RLHF #DPO #RAG #论文科普 #arXiv2402.06196


三个标题变体

  1. 反直觉版:把 GPT / LLaMA / PaLM 三大族谱装进同一张图——Minaee 等 2024 LLM 综述成为后续所有 LLM 论文的"方法论骨架"
  2. 数字钩子版:S2 引用超千、30+ 模型横评、Chinchilla 20:1 法则——一篇综述把 2024 年初 LLM 生态装进一张可工作地图
  3. 类比版:相当于 LLM 界的"新华字典"——Minaee 等综述给所有 LLM 学习者一张可查询的工具书地图

📱 小红书风格卡片文案(直接可用)

🧠 把 GPT / LLaMA / PaLM 三大族谱装进同一张图——这篇 LLM 综述是后续所有论文的"方法论骨架"!

姐妹们!👀 你有没有这种感觉——

2022 年 11 月 ChatGPT 发布之后,LLM 论文像雨后春笋——每个月都有新模型、新对齐算法、新 benchmark、新 prompt 技巧。你如果想入门 LLM,大概率会卡在同一个地方:这么多东西,到底谁是谁?怎么串起来?

光看名字就能把人整晕: - 🌀 模型家族爆炸:GPT、LLaMA、PaLM、Falcon、Mistral、Qwen、DeepSeek、Yi、GLM、Baichuan……每个家族都有自己的训练 trick 和数据配比 - 🌪️ 技术爆炸:RLHF、DPO、SFT、PEFT、prompt tuning、RAG、MoE、长上下文扩展……每个方向都有几十篇新论文 - 📊 评测爆炸:MMLU、HellaSwag、TruthfulQA、HumanEval、GSM8K、BBH、MT-Bench、AlpacaEval、Chatbot Arena……不同 benchmark 测不同能力,怎么选、怎么对比是新人入门最大门槛

🆕 2024 年 2 月 Minaee 等人发表的 LLM 综述(arXiv 2402.06196,S2 引用超千)说:别慌——我用一张图把所有东西装进同一张可工作地图!

📐 六条主线概览:

🔹 主线 1 · 主流 LLM 家族对比:GPT / LLaMA / PaLM 三大族谱深度对比 + 30+ 模型横评表——参数量、训练数据、token 数、上下文窗口、关键创新点、评测表现、开源与否

🔹 主线 2 · 训练 / 增强技术体系:预训练 / SFT / RLHF / DPO / PEFT / RAG / Agent 一条主线讲下来,按"是否改模型权重"划分

🔹 主线 3 · 数据集分层:预训练语料(Common Crawl / C4 / RedPajama)+ 指令微调(Alpaca / Dolly / OpenAssistant)+ 偏好数据(HH-RLHF / UltraFeedback)+ 评测集四层分类

🔹 主线 4 · 评估体系(三层):任务维度(QA / 分类 / 生成 / 翻译 / 推理 / 代码 / 多模态)+ 方法维度(zero-shot / few-shot / CoT / Self-Consistency)+ 指标维度(准确率 / BLEU / Pass@k / ELO)

🔹 主线 5 · 横评对比表:GPT-4 / Claude 3 / Gemini 1.5 / Llama-3-70B / Mistral-Large / Qwen-2-72B 等在 MMLU / GSM8K / HumanEval / MT-Bench 上的横评——这是该综述最常被引用的表

🔹 主线 6 · 开放挑战:emergent ability / hallucination / bias / safety / efficiency / 长上下文 / 多模态——每个挑战都附后续研究方向

📊 关键数字(abstract 可溯源):

模型 MMLU GSM8K HumanEval MT-Bench
GPT-4 86.4% 92% 67% 9+
Claude 3 Opus 86.8% 95% 84.9% 9+
Gemini 1.5 Pro 81.9% — — —
Llama-3-70B 82.0% 93% 81.7% 9-

⚠️ 综述类论文横评数字来源于各原论文与公开 leaderboard,并非本文统一复现结果——不同榜单规则不同,引用时需要自行折算。⚠️ Llama-3 HumanEval 81.7% 属于较高估计,Meta 官方公布为 68%;建议引用时注明评测配置。

🧠 跟同类综述的关系:

  • Zhao et al. 2023 A Survey of Large Language Models → 直接前驱,本文差异在于更聚焦三大族谱深度对比
  • A Primer on Large Language Models and their Limits(Stanford CRFM)→ Stanford 视角,更偏教学型
  • Foundational Challenges in Assuring Alignment and Safety of LLMs → AI 安全视角,覆盖本文未深入的 alignment 安全
  • MoE / Long-Context / LLM Agent / Multimodal 细分综述(2024-2026)→ 本文作为索引起点被反复引用,下游衍生出大量子领域综述

💡 六大工程启发:

1️⃣ Chinchilla 法则仍是默认起点:训练 token 与参数比 20:1 是预算分配的合理默认

2️⃣ 对齐路线选择:RLHF 仍是事实标准,但 DPO 系列在工程成本、稳定性上越来越有竞争力——中小团队优先 DPO,大厂可考虑完整 PPO 链路

3️⃣ RAG + PEFT 是中小团队最有效组合:靠 LoRA 微调 + RAG 就能在垂直领域拿到业务可用效果

4️⃣ 评测先于模型升级:上线前必须先建立涵盖任务级 + 人类偏好评测 pipeline

5️⃣ 关注长上下文与多模态:模型窗口从 8K → 128K → 1M,多模态从纯文本扩展到图像 / 音频 / 视频 / 3D——是产品差异化最重要的两个维度

6️⃣ 不要忽略安全与对齐成本:数据采集 + 红队评测 + 在线监控的工程成本经常占总投入的 30-40%

⚠️ 八个边界坑(使用前必看):

  1. 时效性强但易过期:综述 2024 年初定稿,2024 年下半年的 GPT-4o、Claude 3.5、Gemini 2、Llama 3.1/3.3 未覆盖——不能直接用于 2026 年技术选型
  2. 多模态覆盖偏薄:vision/audio 部分没有展开成独立章节
  3. 中文 LLM 单独成章不足:中文能力评测、跨语种迁移未单列讨论
  4. Agent 部分略简:2024-2026 年 Agent 工程实践远超本综述当时覆盖范围
  5. 横评数字依赖二手数据:没有给出统一 prompt、统一评测脚本的复现
  6. HumanEval 数据泄露问题:评测集题目出现在部分训练数据中——建议补充 MBPP+ / LiveCodeBench
  7. Llama-3 HumanEval 数字争议:综述引用 81.7%,Meta 官方公布 68%——不同评测配置导致差异
  8. Chinchilla 法则已被偏离:GPT-4o / Claude 3.5 等前沿模型已明显偏离 20:1 比例

🎯 适合谁:

  • LLM 应用开发者:✅ 必备入门与查询手册
  • NLP / ML 研究者:✅ 选 baseline、找选题、对比模型表现的高频工具书
  • 产品 / 战略:✅ 理解 LLM 生态成熟度与差距
  • 投资 / 咨询:✅ 用模型 / 评测横评表做赛道对比
  • 学生与新人:✅ 作为 LLM 课程补充,可以少走 3-6 个月的弯路
  • AI 治理 / 合规:✅ 评估"模型能力 vs 风险"的依据
  • 不适合:❌ 想直接拿综述里的 SOTA 数字做 2026 年技术选型对比的——已严重过时

📌 一句话总结:arXiv 2402.06196 给出 Minaee 等 LLM 综述——按"主流模型家族(GPT / LLaMA / PaLM)+ 训练与增强技术(预训练 / SFT / RLHF / DPO / PEFT / RAG / Agent)+ 数据集(预训练语料 / 指令 / 偏好 / 评测)+ 评估指标 + 主流 benchmark 横评(MMLU / GSM8K / HumanEval / MT-Bench)+ 开放挑战"六条主线系统梳理 LLM 生态,30+ 模型横评 + Chinchilla 20:1 法则 + 完整训练技术谱系 + 评测体系三层(任务 / 方法 / 指标);S2 引用超千,是 2024 年初最常被引用的 LLM 综述之一,也是后续所有 LLM 综述的方法论骨架之一;但时效性强易过期(GPT-4o / Claude 3.5 / Gemini 2 未覆盖)、多模态覆盖偏薄、中文 LLM 单独成章不足、Agent 部分略简、横评数字依赖二手、HumanEval 数据泄露、Llama-3 HumanEval 数字争议、Chinchilla 法则已被偏离八个坑必须在引用前补完。

🔔 评论区聊聊:你读过 Minaee 这篇综述吗?在你做 LLM 技术选型 / 论文写作 / 行业分析时,是把它当"工具书查询",还是当"骨架参考图"?哪些子领域(MoE / Long-Context / Agent / 多模态)你希望后续有更细的综述补充?

LLM #大语言模型 #综述 #Survey #GPT #LLaMA #PaLM #RLHF #DPO #RAG #论文科普 #arXiv2402.06196