2012–2015
01 · CNN 规模化
这一阶段要解决什么?
如何让深度网络在大规模图像上稳定学习?
ImageNet Classification with Deep Convolutional Neural Networks
深度 CNN 视觉范式的起点。
Deep Residual Learning for Image Recognition
残差学习解决深层网络优化问题。
阶段结论
AlexNet 确立深度 CNN 优势,ResNet 通过残差连接打开更深网络。
多模态 · 已策展
CNN → ResNet → ViT → CLIP → Diffusion
从局部归纳偏置、深层网络训练,一直走到视觉 Transformer 和文本条件生成。
2012–2015
如何让深度网络在大规模图像上稳定学习?
深度 CNN 视觉范式的起点。
残差学习解决深层网络优化问题。
AlexNet 确立深度 CNN 优势,ResNet 通过残差连接打开更深网络。
2020
视觉是否必须依赖卷积的局部归纳偏置?
将图像切成 patch 并直接使用 Transformer。
ViT 证明大数据与规模下,纯 Transformer 也能成为视觉主干。
2021
如何让视觉概念与开放文本语义对齐?
CLIP 用对比学习建立可迁移的图文表征。
2020–至今
如何同时提升生成质量、稳定性与文本可控性?
现代扩散模型的基础论文。
对照 CNN、ViT 与 Diffusion 的学习路径。
DDPM 与潜空间扩散成为现代图像生成的核心路线。