LLM 基础设施 · 已策展

LLM 演进:从序列建模到对齐

RNN / Seq2Seq → Attention → Transformer → BERT / GPT → 指令对齐

以“上一代方法解决了什么、又留下什么问题”串起语言模型的核心转折。

适合读者
希望建立 LLM 技术史与概念骨架的读者
学习规模
4 阶段 · 7 节点 · 约 8 小时
更新
2026-08-12
  1. 2014–2016

    01 · 序列建模

    这一阶段要解决什么?

    如何把可变长输入压缩为可生成的序列表示?

    阶段结论

    Seq2Seq 建立了端到端序列转换范式,但固定长度状态形成信息瓶颈。

  2. 2014–2017

    02 · Attention 与 Transformer

    这一阶段要解决什么?

    如何绕过递归计算与长程依赖瓶颈?

    阶段结论

    Attention 允许按需读取上下文,Transformer 进一步用全注意力替代主干递归结构。

  3. 2018–2020

    03 · 预训练范式

    这一阶段要解决什么?

    如何让同一个模型从大规模语料获得可迁移能力?

    阶段结论

    BERT 强化理解任务,GPT 路线展示生成式规模效应。

  4. 2022–至今

    04 · 指令与偏好对齐

    这一阶段要解决什么?

    如何把基础生成能力变成稳定、可控、可交互的助手?

    阶段结论

    指令微调、RLHF 与偏好优化建立了当代对话模型的训练栈。