2014–2016
01 · 序列建模
这一阶段要解决什么?
如何把可变长输入压缩为可生成的序列表示?
Sequence to Sequence Learning with Neural Networks
确立编码器—解码器的序列转换框架。
阶段结论
Seq2Seq 建立了端到端序列转换范式,但固定长度状态形成信息瓶颈。
LLM 基础设施 · 已策展
RNN / Seq2Seq → Attention → Transformer → BERT / GPT → 指令对齐
以“上一代方法解决了什么、又留下什么问题”串起语言模型的核心转折。
2014–2016
如何把可变长输入压缩为可生成的序列表示?
确立编码器—解码器的序列转换框架。
Seq2Seq 建立了端到端序列转换范式,但固定长度状态形成信息瓶颈。
2014–2017
如何绕过递归计算与长程依赖瓶颈?
让解码器在每一步选择性读取输入。
建立 Transformer 主干架构。
Attention 允许按需读取上下文,Transformer 进一步用全注意力替代主干递归结构。
2018–2020
如何让同一个模型从大规模语料获得可迁移能力?
双向表征预训练的代表。
展示自回归模型的 in-context learning 能力。
BERT 强化理解任务,GPT 路线展示生成式规模效应。
2022–至今
如何把基础生成能力变成稳定、可控、可交互的助手?
InstructGPT 与 RLHF 管线的代表。
把核心论文转换为可执行的阅读次序。
指令微调、RLHF 与偏好优化建立了当代对话模型的训练栈。