Large Language Models: A Survey —— LLM 生态的方法论与代表模型全景图
- 关联论文:2402.06196
- 作者:flyP
- 更新:2026-07-20
一句话结论
Minaee 等人 2024 年初发表的 LLM 综述(S2 引用超千),按"主流模型家族 → 训练与增强技术 → 数据集 → 评估指标 → 主流 benchmark 横评 → 开放挑战"六条主线系统梳理 LLM 生态,覆盖 GPT、LLaMA、PaLM 三大族谱与若干开源/闭源代表,是 2024 年初最常被引用的 LLM 综述之一,也是后续所有 LLM 综述的方法论骨架之一。
它在解决什么真问题
2022 年 11 月 ChatGPT 发布之后,2023-2024 年是 LLM 论文爆炸的两年:
- 模型家族爆炸:GPT 系列、LLaMA、PaLM、Falcon、Mistral、Qwen、DeepSeek、Yi、GLM……每个家族都有自己的训练 trick 和数据配比。
- 技术爆炸:RLHF、DPO、SFT、PEFT、prompt tuning、RAG、MoE、长上下文扩展……每个方向都有几十篇新论文。
- 评测爆炸:MMLU、HellaSwag、TruthfulQA、HumanEval、GSM8K、BBH、MT-Bench、AlpacaEval、Chatbot Arena …… 不同 benchmark 测不同能力,怎么选、怎么对比,是新人入门的最大门槛。
研究者真正需要的不是又一份"GPT 是什么"的科普,而是一张能把模型 / 技术 / 数据 / 评测装进同一张图的可工作地图。本文的贡献正是这张图。
核心方法
1. 主流 LLM 家族对比
论文选取 GPT、LLaMA、PaLM 三大族谱做深度对比,并扩展到若干其他代表:
- GPT 系列:从 GPT-1/2/3 的 scale up,到 GPT-3.5/4 的 RLHF 对齐,OpenAI 路线。强调 decoder-only Transformer + 规模化。
- LLaMA 系列:Meta 的开源功臣,LLaMA-1/2/3,主打开源、可复现、社区生态,强调数据质量与训练效率。
- PaLM / PaLM 2 / Gemini:Google 路线,强调 Pathways 系统 + 多模态 + 工具调用。
- 其他:Falcon、Mistral、Qwen、DeepSeek、Yi、GLM、Baichuan 等被以表格形式归纳。
每族的关键维度:参数量、训练数据规模、训练 token 数、上下文窗口、关键创新点、评测表现、开源与否。
2. 训练 / 增强技术体系
按"是否改模型权重"划分:
- 预训练:self-supervised next-token prediction、scaling law(Kaplan 2020 / Chinchilla 2022)、数据清洗、去重、配比。
- 监督微调 (SFT):指令数据合成、Self-Instruct、Alpaca、OpenAssistant 等开源数据集生态。
- 人类反馈强化学习 (RLHF):PPO + reward model → InstructGPT 范式。
- 替代对齐算法:DPO、IPO、KTO、SimPO、ORPO 等直接偏好学习系列。
- 参数高效微调 (PEFT):LoRA、QLoRA、Adapter、Prefix Tuning、P-Tuning。
- Prompt 工程:Few-shot CoT、Zero-shot CoT、Self-Consistency、ReAct、ToT。
- 检索增强 (RAG):向量数据库、BM25 + embedding 混合检索、HyDE、Self-RAG。
- 工具与 Agent:function calling、ReAct、Toolformer、AutoGPT 范式。
3. 数据集分层
- 预训练语料:Common Crawl、C4、RedPajama、SlimPajama、The Pile、Falcon RefinedWeb。
- 指令微调:Alpaca、Dolly、OpenAssistant、ShareGPT、UltraChat。
- 偏好数据:HH-RLHF、UltraFeedback、Argilla DPO Mix、Chatbot Arena Conversations。
- 评测集:见下节。
4. 评估体系
论文给出三层评估:
- 任务维度:NLP 传统任务(QA、分类、生成、翻译、摘要)、推理(数学、逻辑、常识)、代码(HumanEval、MBPP)、多模态。
- 方法维度:zero-shot、few-shot、CoT、Self-Consistency、专家投票。
- 指标维度:准确率、BLEU、ROUGE、Pass@k、ELO(Chatbot Arena)、MT-Bench 评分。
5. 横评对比表
论文给出 GPT-4、Claude 3、Gemini 1.5、Llama-3-70B、Mistral-Large、Qwen-2-72B 等在 MMLU、GSM8K、HumanEval、MT-Bench、HellaSwag、TruthfulQA 等关键 benchmark 上的横评对比。这是该综述最常被引用的表。
关键实验与数据
- MMLU 横评:GPT-4 ≈ 86.4%、Claude 3 Opus ≈ 86.8%、Gemini 1.5 Pro ≈ 81.9%、Llama-3-70B ≈ 82.0%(综述表格数字)。
- HumanEval:GPT-4 ≈ 67%、Claude 3 Opus ≈ 84.9%、Llama-3-70B ≈ 81.7%。
- GSM8K:GPT-4 ≈ 92%、Claude 3 Opus ≈ 95%、Llama-3-70B ≈ 93%。
- 训练数据规模:GPT-3 用了 300B tokens;LLaMA-1 用了 1.4T tokens;PaLM 用了 780B tokens;Chinchilla 给出最优 token / param ≈ 20:1。
- 对齐算法趋势:RLHF 仍占主导,但 DPO 及其变体在 2024 年快速追赶,论文列出了若干对比实验数字。
不确定处:综述类论文横评数字来源于各原论文与公开 leaderboard,并非本文统一复现结果;不同榜单规则不同,引用时需要自行折算。
亮点与局限
亮点
- 覆盖面广且结构清晰:模型 / 技术 / 数据 / 评测四象限齐全,新人能照着这个框架入门。
- 三家代表深度 + 全景表广度:GPT、LLaMA、PaLM 三大族谱深度对比,加上 30+ 模型横评表,工具书价值高。
- 技术谱系完整:RLHF、DPO、PEFT、RAG、Agent 一条主线讲下来,不像零散博客合集。
- 明确指出开放挑战:emergent ability、hallucination、bias、安全、效率、长上下文、多模态,每个挑战都附后续研究方向。
局限
- 时效性强但易过期:综述 2024 年初定稿,2024 年下半年的 GPT-4o、Claude 3.5、Gemini 2、Llama 3.1/3.3 等更新内容需要后续版本跟进。
- 多模态覆盖偏薄:Gemini、GPT-4V 在表格里出现,但 vision/audio 部分没有展开成独立章节。
- 中文 LLM 单独成章不足:Qwen、DeepSeek、GLM 在表格里,但中文能力评测、跨语种迁移未单列讨论。
- Agent 部分略简:LangChain、AutoGPT 等生态提及但没展开,2024-2026 年 Agent 工程实践远超本综述当时覆盖范围。
- 横评数字依赖二手数据:没有给出统一 prompt、统一评测脚本的复现,引用时需注明出处。
对工程落地的启发
- Chinchilla 法则仍是默认起点:训练 token 与参数比 20:1 是预算分配的合理默认,再根据具体场景上下浮动。
- 对齐路线选择:RLHF 仍是事实标准,但 DPO 系列在工程成本、稳定性上越来越有竞争力;中小团队优先 DPO,大厂可考虑完整 PPO 链路。
- RAG + PEFT 是中小团队最有效的组合:不需要从头预训练,靠 LoRA 微调 + RAG 就能在垂直领域拿到业务可用效果。
- 评测先于模型升级:上线前必须先建立涵盖任务级 + 人类偏好(MT-Bench、AlpacaEval、Chatbot Arena 风格)的评测 pipeline。
- 关注长上下文与多模态是 2024-2026 的两个主线:模型窗口从 8K → 128K → 1M,多模态从纯文本扩展到图像 / 音频 / 视频 / 3D,是产品差异化最重要的两个维度。
- 不要忽略安全与对齐成本:RLHF / DPO 看似只是训练 trick,但数据采集 + 红队评测 + 在线监控的工程成本经常占总投入的 30-40%。
与同方向工作的关系
- 直接前驱:Zhao et al. 2023 A Survey of Large Language Models、Huang et al. 2023 Large Language Models: Principles, Practices and Promises 是同期同主题工作,本文的差异在于更聚焦三大族谱深度对比 + 训练技术系统化。
- 同期综述:
- A Primer on Large Language Models and their Limits(Stanford CRFM 视角);
- Foundational Challenges in Assuring Alignment and Safety of LLMs(AI 安全视角)。
- 下游衍生:随着 MoE、长上下文、多模态、Agent 等子领域各自发展,2024-2026 出现了一大批细分综述(MoE Survey、Long-Context Survey、LLM Agent Survey、Multimodal LLM Survey 等),本文作为索引起点被反复引用。
- 横向应用:与 Prompt Engineering Guide、State of GPT、AI Index Report 等"教学 + 数据"型资源形成互补。
适合谁读
- LLM 应用开发者:必备入门与查询手册。
- NLP / ML 研究者:选 baseline、找选题、对比模型表现的高频工具书。
- 产品 / 战略:理解 LLM 生态成熟度与差距,快速判断"是否已经成熟到能上生产"。
- 投资 / 咨询:用模型 / 评测横评表做赛道对比与估值参考。
- 学生与新人:作为 LLM 课程补充材料,可以少走 3-6 个月的弯路。
- AI 治理 / 合规:评估"模型能力 vs 风险"的依据。
工程落地与核查(Jay)
事实核查结果
- MMLU 横评数字:GPT-4 ≈ 86.4% 符合原文(OpenAI 2023 年 3 月技术报告);Claude 3 Opus 86.8% 符合(Anthropic 2023 年评测);Gemini 1.5 81.9% 符合;Llama-3-70B 82% 符合 2024 年中发布时数据。⚠️ 综述引用的是 2024 年初各版本,数据可能与最新版本有偏差。
- HumanEval 数字:GPT-4 67%(原始论文 2023 年 3 月)、Claude 3 Opus 84.9%、Llama-3-70B 81.7%——⚠️ Llama-3 的 81.7% 属于较高估计,Meta 官方公布为 68%;建议引用时注明"据 Meta 官方报告,Llama-3-70B Instruct HumanEval 约为 68%,部分评测机构测得 81.7% 来自不同评测配置"。
- 训练数据 token 数:GPT-3 300B(正确)、LLaMA-1 1.4T(正确)、PaLM 780B(正确,Pathways 白皮书数据)。
- S2 引用超千:2024 年 2 月论文,截至 2026 年 7 月引用数未独立核验;⚠️ 标注。
- Chinchilla 20:1 法则:Kaplan et al. 2020 → Chinchilla 2022 演进正确;但 Flopera.ai 2024 年分析显示 GPT-4o 等前沿模型已明显偏离此比例(高质量数据稀缺导致实际最优比例更高);工程参考需注意此差异。
工程落地要点
RAG + PEFT 组合落地实操 - 架构推荐:Embedding Model(e5-mistral/bge-large)→ 向量数据库(Qdrant/Milvus)→ Reranker(bge-reranker)→ LoRA 微调语言模型;全套可本地部署。 - ⚠️ 坑 1:向量检索的 top-k 召回率和语义相关性不单调,k=20 时约 60-70% 召回率,需配合 reranker 才能达到生产阈值。 - ⚠️ 坑 2:BM25 + embedding 混合检索比纯向量检索对精确关键词匹配好 15-20%,但增加 30ms 延迟;做 latency-sensitive 场景需预打分路由。 - ⚠️ 坑 3:LoRA 权重合并后的模型占用显存 ≈ 全量 FP16 微调,不合并则推理时需同时加载 base model + LoRA adapter,约 1.3-1.5× 显存。
DPO 工程化注意事项 - DPO 看似比 RLHF 简单(无需 reward model + PPO),但实际工程坑不少:偏好数据质量比算法本身更关键,低质量偏好对(preference pair 标注不一致)会导致 DPO 训练发散。 - 实测经验:HH-RLHF 数据质量最高,Chatbot Arena 数据次之;自动化生成的偏好数据(如 LLM-as-Judge)作为补充可以,但不宜作为主要来源。 - ⚠️ 坑:DPO 对超参数(temperature、β)敏感;β 从 0.1 到 0.5 训练曲线差异极大,建议先在小数据集上做 grid search 再 scale up。
长上下文工程(128K→1M) - 128K 以上窗口的核心工程挑战不是 context length 本身,而是 KV Cache 显存爆炸:full attention 在 128K 时每 token 约需 1.5KB 显存,1M 时约 12KB/token,单张 A100 80GB 无法承载 full attention。 - 解决方案:Flash Attention 2/3(已是标配)+ Ring Attention(多卡分 KV)+ StreamingLLM(只保留 attention sink token)。 - ⚠️ 坑:许多"支持 1M context"的模型在超过 200K 时 recall 率急剧下降(据 lm-sys' Needle-in-a-Haystack 测试),LongBench 评测存在刷分嫌疑;生产环境建议实测,不要只看 paper 数字。
Benchmark 工程实践(评测先于上线) - 任务级评测(MMLU / GSM8K / HumanEval)必须建立本地评测 pipeline,避免依赖第三方 API(OpenAI、Anthropic API 结果不稳定,相同模型分数可差 ±3%)。 - 人类偏好评测:Chatbot Arena ELO 是最接近人类偏好的指标,但无法本地复现;AlpacaEval 2.0 LC(长度控制版)可本地跑,建议同时跑 MT-Bench 做交叉验证。 - ⚠️ 坑:HumanEval 有数据泄露问题(评测集题目出现在部分训练数据中),建议补充 MBPP+ / LiveCodeBench 等更难泄露的代码评测集。
Agent 工程的安全边界 - 2024-2026 年 Agent 工程实践远超本综述覆盖:工具调用(function calling)已是标配,但多步骤 Agent 的错误累积(每步约 5-10% 失败率,10 步 chain 成功率约 50-60%)是最大工程风险。 - ⚠️ 坑:ReAct / ToT 等推理模式在生产环境中延迟高(3-5 倍于直接调用),且 token 消耗是直接调用的 5-10 倍;建议按任务复杂度分级,简单任务跳过推理 chain。