想让 LLM 落地?3 年前这篇综述给了你一张完整的「上手机械图纸」
- 关联论文:2307.10169
你有没有这种感觉 🤖?
你刚加入一家公司,团队要做 LLM 产品。你打开 Slack 看见满屏问题:"我们该不该 fine-tune?RLHF 和 DPO 哪个好?RAG 怎么做?Agent 是不是又是炒作?幻觉怎么治?上生产要踩哪些坑?"
同事扔过来 100 篇论文让你"先看看"。你打开第一篇,看 5 分钟关掉——全是术语。第二篇,更晕。三天过去,脑子里只剩"Prompt + RAG + Fine-tune + Agent"四个名词,对它们怎么选、怎么拼、用在哪个场景,依然一脸懵。
这不是你的问题。是 2023 年上半年,整个 LLM 领域都缺一份"给懂 ML 的人读的中等长度、能快速带走全貌"的综述。
2023 年 7 月,Kaddour 等人写了一篇 72 页的综述(v01, work in progress),专门填这个坑:
arXiv 2307.10169(Challenges and Applications of Large Language Models)——给 ML 研究员的 LLM 路线图:
把 2022 年末到 2023 年中期混乱的 LLM 文献,整理成 1)通用能力与改进方向的开放问题清单,2)真实工程应用领域的版图,3)落地时的实战踩坑提醒——让一个"懂 ML 但不熟 LLM"的人能少走半年弯路。
被引 517 次(Semantic Scholar 口径,截至 2026-09-30 快照)——是后续所有 LLM 工程综述、Andrew Karpathy 系列视频、Andrej Karpathy 公开课的"参考文献清单的清单"。
0 · TL;DR(30 秒版)
- 真问题:2023 年 Q2,所有 ML 团队都在赶着上 LLM,但市面上少了一份"中等长度、能快速 get 全貌"的综述。
- 核心答案:把"prompt engineer → RAG → fine-tune → RLHF → agent"摆成一条递进的难度阶梯,配决策树 + 实战清单 + 常见坑位。
- 关键遗产:作者反复强调的"小模型 + 数据 + 检索组合"经验,后来被无数工业 team 验证;"alignment ≠ safety"区分被 OpenAI/Anthropic 系统说明反复引用。
- 2026 年局限:v01 在 2023 年 7 月定稿,MoE 架构、Mamba 类状态空间模型、原生多模态 (GPT-4o/Gemini) 的细节、推理模型 (o1/o3) 全部不在视野——它是"2023 上半年切片",不是"2026 年百科全书"。
1 · 为什么这件事和大众有关
LLM 这两年的进化速度,已经远远超过普通人的消化速度:
- 📱 你手机里的 AI 助手——ChatGPT、Claude、文心、通义、豆包,背后都跑着 LLM。
- 🛒 电商客服——你问"这件衣服有没有大码",背后是 LLM 在实时生成回复。
- 💻 代码补全——Cursor、Copilot、Windsurf 把 LLM 集成进 IDE,几乎重写了软件开发的协作模式。
- 🔍 搜索——Perplexity、秘塔 AI 搜索,把 LLM 嫁接到传统搜索之上。
- 🏥 医疗/教育/法律——LLM 在垂直领域的应用,2024–2026 年全面铺开。
但这些应用是怎么搭起来的?技术决策是怎么做的?哪些坑是别人踩过的?——普通从业者想了解,全靠口口相传或 100 篇散论文。
Kaddour 这篇综述做的事情,就是把 2023 年上半年的最佳实践,整理成一份"上手机械图纸"——即便到 2026 年,它的决策框架仍然有效。
2 · 综述把 LLM 工程化拆成什么
Kaddour 这篇 72 页综述,主体分三块:
模块 1:开放问题清单(Open Problems)
- 模型层:长上下文、推理、数学逻辑、agentic planning;
- 数据/对齐层:RLHF/DPO 细节、reward hacking、red-teaming、refusal training;
- 系统层:prompt injection、jailbreak robustness、数据污染;
- 评估层:hallucination 检测、真实性、动态 benchmark 失真。
模块 2:应用领域版图(Applications)
- NLP 经典任务的 SOTA 横扫;
- 信息检索(RAG 与 retrieval-augmented LM);
- 多模态扩展(vision/audio LLM、speech LLM);
- Agent 与工具使用(tool-use、planning、memory)——2023 年 AutoGPT/BabyAGI 那一波炒作的"冷静版"梳理;
- 代码(code generation、program synthesis、code review);
- 科学/教育/医疗等垂直领域。
模块 3:实战踩坑提醒(Practical Tips)
- fine-tuning vs prompting 的决策树;
- 数据准备与评估;
- 部署(量化、蒸馏、KV cache、batching);
- 可观测性与持续评测。
这套三段式结构,恰好对应"调研→决策→落地"全流程——后来所有 LLM 工程综述都按这个套路写。
3 · 几个普通从业者最该记住的点
1️⃣ 「prompt → RAG → fine-tune → RLHF → agent」是递进阶梯
作者反复强调:不要跳步。
| 你在 LLM 工程阶梯上的位置 | 下一步该做的事 | 典型投入 |
|---|---|---|
| 还没上生产? | 先做 prompt engineering + RAG | 1–2 周 |
| 已经稳定调用 API? | 看是否需要 fine-tune | 1–2 月 + 1 万条数据 |
| 已经 fine-tune 过? | 看是否需要 RLHF | 3–6 月 |
| 已经上 RLHF? | 考虑 agent 化 | 持续投入 |
这条阶梯,到 2026 年仍是所有商业化 LLM 产品的默认进化顺序。
2️⃣ 「小模型 + 数据 + 检索」往往能干掉 70B+
综述反复出现一个反直觉的经验法则:很多落地任务,参数量在 1B–13B 范围 + 充分 fine-tune + RAG 已经能干掉昂贵的 70B+ 模型。
这条经验在 2023 年听起来激进,到 2026 年已被 Llama 3.1 8B / Qwen2.5-7B / Phi-3 等开源模型验证——"small models on your data"哲学。
3️⃣ RAG 的上限不取决于 LLM
作者把 RAG 拆成 retriever / index / reranker / reader 四段,指出:
- dense retrieval 在大多数域强于 BM25;
- rerank 是被严重低估的"性价比之王"——只在 top-k > 20 时 ROI 最高;
- chunking 和 metadata 决定上限,下游 LLM 只决定下限。
这条洞见在 2026 年的 RAG 最佳实践里仍是黄金法则。
4️⃣ Agent 的瓶颈不在模型
综述明确指出:Agent 的稳健性瓶颈往往不在模型,而在"工具错误传播"和"规划失败的可观测性"。
这一洞见和后来 SWE-Bench、InterCode 等基准的发现一致——你引入 Agent,就要配套"工具观测 + 长事务 trace + 重试机制",这是另一份工程预算。
5️⃣ "alignment ≠ safety"
作者反复强调这个区分:
- 能力型对齐(capability alignment):让模型听指令、写出符合格式的输出;
- 安全型对齐(safety alignment):让模型拒绝越界请求。
二者训练目标都是 RLHF,但 reward model 是大不相同的。
这一区分后来被 OpenAI/Anthropic 各自的系统说明里反复引用,用来解释"为什么 RLHF 不能两者同时处理"。
6️⃣ 静态 benchmark 不可信
综述明确提出:"静态 benchmark 不可信"。
这一判断极具前瞻性——到 2026 年,已有大量证据(MMMU 刷榜、GSM8K 饱和、LiveCodeBench 动态化)印证此判断。
4 · 一个常被忽视的边界
综述没告诉你的(Jay 在"工程落地与核查"里专门指出):
v01 在 2023 年 7 月定稿,许多重要方向未覆盖——MoE 架构、Mamba 类状态空间模型、原生多模态 (GPT-4V/Gemini) 的细节、Tool-Use-as-RL、推理模型 (o1/o3/DeepSeek-R1) 全部不在视野。
| 话题 | 2023 年 7 月结论 | 2026 年 9 月实际 |
|---|---|---|
| 模型规模 | 70B+ 仍是 SOTA | 405B+(Llama 3.1)/ GPT-4o / Claude 3.5 均已超越 |
| 长上下文 | 主流 4K–32K | 128K–1M 成为主流(Gemini 1M context) |
| RLHF vs DPO | DPO 是新方法,效果待验证 | DPO/SimPO 已是主流,PPO 仅头部厂商使用 |
| Agent | AutoGPT/BabyAGI 早期 | Claude Agent / GPT-4o Canvas / Cursor 已成熟 |
| 多模态 | GPT-4V 刚发布 | GPT-4o / Gemini 2.0 / Claude 3.5 多模态原生 |
| 代码模型 | 代码补全为主 | SWE-Bench 60%+ 已超越人类基线 |
也就是说:不是"Kaddour 这篇没用",而是"它是 2023 年切片,到 2026 年需要叠加新文献"——它的递进阶梯框架仍有效,具体数字需更新。
5 · 对普通人的意义
LLM 工程师 / 产品经理
把这篇当 onboarding 阅读。作者给的决策树(prompt → RAG → fine-tune → RLHF → agent)和实用 Tips 部分,到 2026 年仍是工程标准。
技术管理者
用它做"接下来做哪条线"的决策参考——避免过早 fine-tune(数据不足 1 万条仍做的常见错误)、避免过早 agent 化(没做 cost-benefit 分析就上)。
学术研究生
把每节小综述当作"必读论文清单"——作者引用了大量后续被引数百次的关键文献,它扮演了"literature roadmap"的角色。
跨领域研究者
把 LLM 当工具来看(化学/生物/教育)的领域专家——这篇综述给了你"懂 ML 但不熟 LLM"的快速过渡路径。
6 · 一个开放问题
"为什么 Kaddour 这篇综述能撑 3 年不过时?"
到 2026 年回头看,这篇综述作为坐标系的价值远大于作为结论:
- 它把"prompt engineer → RAG → fine-tune → RLHF → agent"摆成递进的难度阶梯——这恰好是今天所有商业化 LLM 产品的默认进化顺序;
- 它明确区分"alignment ≠ safety"——这一区分后来被头部厂商反复引用;
- 它强调"评估是持续流程"——这一观点和后来 EvalPlus、LiveCodeBench 的发现高度一致;
- 它承认"v01, work in progress"——为后续综述(2024/2025 系列)空出了位子。
在 LLM 这片"一年抵十年"的领域里,能在固定时间点给出认真、克制、承认未完成的全景图,本身就是一份学术贡献。
7 · 一句话总结
3 年前这篇综述,给了所有"懂 ML 但不熟 LLM"的工程师一张完整的「上手机械图纸」——把混乱的 LLM 文献整理成"调研→决策→落地"全流程的递进阶梯,到 2026 年仍是 LLM 工程化的标准参考。引用具体结论需注明"2023 年快照",引用决策框架则不受时间限制。
引用时建议明确:"2023 年 7 月 v01" + "72 页 work-in-progress 综述" + "递进阶梯框架至今有效,具体数字需更新"——避免把它当 2026 年百科全书。
标题变体(推广用)
- 「Prompt → RAG → Fine-tune → Agent」——2307.10169 这篇综述画了 LLM 落地的完整阶梯
- 想让 LLM 真正落地?先读懂 Kaddour 这篇 517 次被引的"上手机械图纸"
- 「不懂 LLM 的工程师必读」——2307.10169 把 2023 年混乱的 LLM 文献整理成一张地图
小红书风格卡片
🔥 想上 LLM 产品,但不知道从哪开始?
3 年前(2023.7)Kaddour 等人写了篇 72 页综述 arXiv 2307.10169,专门给"懂 ML 但不熟 LLM"的工程师画了一张完整的上手机械图纸:
✨ 核心贡献:把混乱的 LLM 文献整理成"prompt → RAG → fine-tune → RLHF → agent"五级递进阶梯,配决策树 + 实战清单 + 常见坑位。
💡 几个金句: - "小模型 + 数据 + 检索"往往能干掉 70B+ - "alignment ≠ safety"——RLHF 不是银弹 - "Agent 的瓶颈不在模型,而在工具错误传播" - "静态 benchmark 不可信"
📊 被引 517 次(Semantic Scholar)——是 LLM 工程综述、Karpathy 系列视频、公开课的"参考文献清单的清单"。
⚠️ 局限:v01 在 2023 年 7 月定稿,MoE、GPT-4o、推理模型 (o1/o3)、Mamba、Source-Free DA 都不在视野——递进阶梯框架仍有效,具体数字需更新。
📌 适合谁读:LLM 工程师、AI 产品经理、技术管理者、跨领域研究者。
LLM #AI论文 #大模型 #RAG #FineTuning #Agent #RLHF #AI工程化