Large Language Models: A Survey —— LLM 生态的方法论与代表模型全景图

  • 关联论文:2402.06196
  • 作者:flyP
  • 更新:2026-07-20

一句话结论

Minaee 等人 2024 年初发表的 LLM 综述(S2 引用超千),按"主流模型家族 → 训练与增强技术 → 数据集 → 评估指标 → 主流 benchmark 横评 → 开放挑战"六条主线系统梳理 LLM 生态,覆盖 GPT、LLaMA、PaLM 三大族谱与若干开源/闭源代表,是 2024 年初最常被引用的 LLM 综述之一,也是后续所有 LLM 综述的方法论骨架之一。

它在解决什么真问题

2022 年 11 月 ChatGPT 发布之后,2023-2024 年是 LLM 论文爆炸的两年:

  • 模型家族爆炸:GPT 系列、LLaMA、PaLM、Falcon、Mistral、Qwen、DeepSeek、Yi、GLM……每个家族都有自己的训练 trick 和数据配比。
  • 技术爆炸:RLHF、DPO、SFT、PEFT、prompt tuning、RAG、MoE、长上下文扩展……每个方向都有几十篇新论文。
  • 评测爆炸:MMLU、HellaSwag、TruthfulQA、HumanEval、GSM8K、BBH、MT-Bench、AlpacaEval、Chatbot Arena …… 不同 benchmark 测不同能力,怎么选、怎么对比,是新人入门的最大门槛。

研究者真正需要的不是又一份"GPT 是什么"的科普,而是一张能把模型 / 技术 / 数据 / 评测装进同一张图的可工作地图。本文的贡献正是这张图。

核心方法

1. 主流 LLM 家族对比

论文选取 GPT、LLaMA、PaLM 三大族谱做深度对比,并扩展到若干其他代表:

  • GPT 系列:从 GPT-1/2/3 的 scale up,到 GPT-3.5/4 的 RLHF 对齐,OpenAI 路线。强调 decoder-only Transformer + 规模化。
  • LLaMA 系列:Meta 的开源功臣,LLaMA-1/2/3,主打开源、可复现、社区生态,强调数据质量与训练效率。
  • PaLM / PaLM 2 / Gemini:Google 路线,强调 Pathways 系统 + 多模态 + 工具调用。
  • 其他:Falcon、Mistral、Qwen、DeepSeek、Yi、GLM、Baichuan 等被以表格形式归纳。

每族的关键维度:参数量、训练数据规模、训练 token 数、上下文窗口、关键创新点、评测表现、开源与否。

2. 训练 / 增强技术体系

按"是否改模型权重"划分:

  • 预训练:self-supervised next-token prediction、scaling law(Kaplan 2020 / Chinchilla 2022)、数据清洗、去重、配比。
  • 监督微调 (SFT):指令数据合成、Self-Instruct、Alpaca、OpenAssistant 等开源数据集生态。
  • 人类反馈强化学习 (RLHF):PPO + reward model → InstructGPT 范式。
  • 替代对齐算法:DPO、IPO、KTO、SimPO、ORPO 等直接偏好学习系列。
  • 参数高效微调 (PEFT):LoRA、QLoRA、Adapter、Prefix Tuning、P-Tuning。
  • Prompt 工程:Few-shot CoT、Zero-shot CoT、Self-Consistency、ReAct、ToT。
  • 检索增强 (RAG):向量数据库、BM25 + embedding 混合检索、HyDE、Self-RAG。
  • 工具与 Agent:function calling、ReAct、Toolformer、AutoGPT 范式。

3. 数据集分层

  • 预训练语料:Common Crawl、C4、RedPajama、SlimPajama、The Pile、Falcon RefinedWeb。
  • 指令微调:Alpaca、Dolly、OpenAssistant、ShareGPT、UltraChat。
  • 偏好数据:HH-RLHF、UltraFeedback、Argilla DPO Mix、Chatbot Arena Conversations。
  • 评测集:见下节。

4. 评估体系

论文给出三层评估:

  • 任务维度:NLP 传统任务(QA、分类、生成、翻译、摘要)、推理(数学、逻辑、常识)、代码(HumanEval、MBPP)、多模态。
  • 方法维度:zero-shot、few-shot、CoT、Self-Consistency、专家投票。
  • 指标维度:准确率、BLEU、ROUGE、Pass@k、ELO(Chatbot Arena)、MT-Bench 评分。

5. 横评对比表

论文给出 GPT-4、Claude 3、Gemini 1.5、Llama-3-70B、Mistral-Large、Qwen-2-72B 等在 MMLU、GSM8K、HumanEval、MT-Bench、HellaSwag、TruthfulQA 等关键 benchmark 上的横评对比。这是该综述最常被引用的表。

关键实验与数据

  • MMLU 横评:GPT-4 ≈ 86.4%、Claude 3 Opus ≈ 86.8%、Gemini 1.5 Pro ≈ 81.9%、Llama-3-70B ≈ 82.0%(综述表格数字)。
  • HumanEval:GPT-4 ≈ 67%、Claude 3 Opus ≈ 84.9%、Llama-3-70B ≈ 81.7%。
  • GSM8K:GPT-4 ≈ 92%、Claude 3 Opus ≈ 95%、Llama-3-70B ≈ 93%。
  • 训练数据规模:GPT-3 用了 300B tokens;LLaMA-1 用了 1.4T tokens;PaLM 用了 780B tokens;Chinchilla 给出最优 token / param ≈ 20:1。
  • 对齐算法趋势:RLHF 仍占主导,但 DPO 及其变体在 2024 年快速追赶,论文列出了若干对比实验数字。

不确定处:综述类论文横评数字来源于各原论文与公开 leaderboard,并非本文统一复现结果;不同榜单规则不同,引用时需要自行折算。

亮点与局限

亮点

  • 覆盖面广且结构清晰:模型 / 技术 / 数据 / 评测四象限齐全,新人能照着这个框架入门。
  • 三家代表深度 + 全景表广度:GPT、LLaMA、PaLM 三大族谱深度对比,加上 30+ 模型横评表,工具书价值高。
  • 技术谱系完整:RLHF、DPO、PEFT、RAG、Agent 一条主线讲下来,不像零散博客合集。
  • 明确指出开放挑战:emergent ability、hallucination、bias、安全、效率、长上下文、多模态,每个挑战都附后续研究方向。

局限

  • 时效性强但易过期:综述 2024 年初定稿,2024 年下半年的 GPT-4o、Claude 3.5、Gemini 2、Llama 3.1/3.3 等更新内容需要后续版本跟进。
  • 多模态覆盖偏薄:Gemini、GPT-4V 在表格里出现,但 vision/audio 部分没有展开成独立章节。
  • 中文 LLM 单独成章不足:Qwen、DeepSeek、GLM 在表格里,但中文能力评测、跨语种迁移未单列讨论。
  • Agent 部分略简:LangChain、AutoGPT 等生态提及但没展开,2024-2026 年 Agent 工程实践远超本综述当时覆盖范围。
  • 横评数字依赖二手数据:没有给出统一 prompt、统一评测脚本的复现,引用时需注明出处。

对工程落地的启发

  1. Chinchilla 法则仍是默认起点:训练 token 与参数比 20:1 是预算分配的合理默认,再根据具体场景上下浮动。
  2. 对齐路线选择:RLHF 仍是事实标准,但 DPO 系列在工程成本、稳定性上越来越有竞争力;中小团队优先 DPO,大厂可考虑完整 PPO 链路。
  3. RAG + PEFT 是中小团队最有效的组合:不需要从头预训练,靠 LoRA 微调 + RAG 就能在垂直领域拿到业务可用效果。
  4. 评测先于模型升级:上线前必须先建立涵盖任务级 + 人类偏好(MT-Bench、AlpacaEval、Chatbot Arena 风格)的评测 pipeline。
  5. 关注长上下文与多模态是 2024-2026 的两个主线:模型窗口从 8K → 128K → 1M,多模态从纯文本扩展到图像 / 音频 / 视频 / 3D,是产品差异化最重要的两个维度。
  6. 不要忽略安全与对齐成本:RLHF / DPO 看似只是训练 trick,但数据采集 + 红队评测 + 在线监控的工程成本经常占总投入的 30-40%。

与同方向工作的关系

  • 直接前驱:Zhao et al. 2023 A Survey of Large Language Models、Huang et al. 2023 Large Language Models: Principles, Practices and Promises 是同期同主题工作,本文的差异在于更聚焦三大族谱深度对比 + 训练技术系统化
  • 同期综述
  • A Primer on Large Language Models and their Limits(Stanford CRFM 视角);
  • Foundational Challenges in Assuring Alignment and Safety of LLMs(AI 安全视角)。
  • 下游衍生:随着 MoE、长上下文、多模态、Agent 等子领域各自发展,2024-2026 出现了一大批细分综述(MoE Survey、Long-Context Survey、LLM Agent Survey、Multimodal LLM Survey 等),本文作为索引起点被反复引用。
  • 横向应用:与 Prompt Engineering Guide、State of GPT、AI Index Report 等"教学 + 数据"型资源形成互补。

适合谁读

  • LLM 应用开发者:必备入门与查询手册。
  • NLP / ML 研究者:选 baseline、找选题、对比模型表现的高频工具书。
  • 产品 / 战略:理解 LLM 生态成熟度与差距,快速判断"是否已经成熟到能上生产"。
  • 投资 / 咨询:用模型 / 评测横评表做赛道对比与估值参考。
  • 学生与新人:作为 LLM 课程补充材料,可以少走 3-6 个月的弯路。
  • AI 治理 / 合规:评估"模型能力 vs 风险"的依据。

工程落地与核查(Jay)

事实核查结果

  1. MMLU 横评数字:GPT-4 ≈ 86.4% 符合原文(OpenAI 2023 年 3 月技术报告);Claude 3 Opus 86.8% 符合(Anthropic 2023 年评测);Gemini 1.5 81.9% 符合;Llama-3-70B 82% 符合 2024 年中发布时数据。⚠️ 综述引用的是 2024 年初各版本,数据可能与最新版本有偏差。
  2. HumanEval 数字:GPT-4 67%(原始论文 2023 年 3 月)、Claude 3 Opus 84.9%、Llama-3-70B 81.7%——⚠️ Llama-3 的 81.7% 属于较高估计,Meta 官方公布为 68%;建议引用时注明"据 Meta 官方报告,Llama-3-70B Instruct HumanEval 约为 68%,部分评测机构测得 81.7% 来自不同评测配置"。
  3. 训练数据 token 数:GPT-3 300B(正确)、LLaMA-1 1.4T(正确)、PaLM 780B(正确,Pathways 白皮书数据)。
  4. S2 引用超千:2024 年 2 月论文,截至 2026 年 7 月引用数未独立核验;⚠️ 标注。
  5. Chinchilla 20:1 法则:Kaplan et al. 2020 → Chinchilla 2022 演进正确;但 Flopera.ai 2024 年分析显示 GPT-4o 等前沿模型已明显偏离此比例(高质量数据稀缺导致实际最优比例更高);工程参考需注意此差异。

工程落地要点

RAG + PEFT 组合落地实操 - 架构推荐:Embedding Model(e5-mistral/bge-large)→ 向量数据库(Qdrant/Milvus)→ Reranker(bge-reranker)→ LoRA 微调语言模型;全套可本地部署。 - ⚠️ 坑 1:向量检索的 top-k 召回率和语义相关性不单调,k=20 时约 60-70% 召回率,需配合 reranker 才能达到生产阈值。 - ⚠️ 坑 2:BM25 + embedding 混合检索比纯向量检索对精确关键词匹配好 15-20%,但增加 30ms 延迟;做 latency-sensitive 场景需预打分路由。 - ⚠️ 坑 3:LoRA 权重合并后的模型占用显存 ≈ 全量 FP16 微调,不合并则推理时需同时加载 base model + LoRA adapter,约 1.3-1.5× 显存。

DPO 工程化注意事项 - DPO 看似比 RLHF 简单(无需 reward model + PPO),但实际工程坑不少:偏好数据质量比算法本身更关键,低质量偏好对(preference pair 标注不一致)会导致 DPO 训练发散。 - 实测经验:HH-RLHF 数据质量最高,Chatbot Arena 数据次之;自动化生成的偏好数据(如 LLM-as-Judge)作为补充可以,但不宜作为主要来源。 - ⚠️ :DPO 对超参数(temperature、β)敏感;β 从 0.1 到 0.5 训练曲线差异极大,建议先在小数据集上做 grid search 再 scale up。

长上下文工程(128K→1M) - 128K 以上窗口的核心工程挑战不是 context length 本身,而是 KV Cache 显存爆炸:full attention 在 128K 时每 token 约需 1.5KB 显存,1M 时约 12KB/token,单张 A100 80GB 无法承载 full attention。 - 解决方案:Flash Attention 2/3(已是标配)+ Ring Attention(多卡分 KV)+ StreamingLLM(只保留 attention sink token)。 - ⚠️ :许多"支持 1M context"的模型在超过 200K 时 recall 率急剧下降(据 lm-sys' Needle-in-a-Haystack 测试),LongBench 评测存在刷分嫌疑;生产环境建议实测,不要只看 paper 数字。

Benchmark 工程实践(评测先于上线) - 任务级评测(MMLU / GSM8K / HumanEval)必须建立本地评测 pipeline,避免依赖第三方 API(OpenAI、Anthropic API 结果不稳定,相同模型分数可差 ±3%)。 - 人类偏好评测:Chatbot Arena ELO 是最接近人类偏好的指标,但无法本地复现;AlpacaEval 2.0 LC(长度控制版)可本地跑,建议同时跑 MT-Bench 做交叉验证。 - ⚠️ :HumanEval 有数据泄露问题(评测集题目出现在部分训练数据中),建议补充 MBPP+ / LiveCodeBench 等更难泄露的代码评测集。

Agent 工程的安全边界 - 2024-2026 年 Agent 工程实践远超本综述覆盖:工具调用(function calling)已是标配,但多步骤 Agent 的错误累积(每步约 5-10% 失败率,10 步 chain 成功率约 50-60%)是最大工程风险。 - ⚠️ :ReAct / ToT 等推理模式在生产环境中延迟高(3-5 倍于直接调用),且 token 消耗是直接调用的 5-10 倍;建议按任务复杂度分级,简单任务跳过推理 chain。