多模态 · 已策展

图像模型演进:从 CNN 到多模态生成

CNN → ResNet → ViT → CLIP → Diffusion

从局部归纳偏置、深层网络训练,一直走到视觉 Transformer 和文本条件生成。

适合读者
希望理解视觉架构为何从 CNN 走向 Transformer 与扩散模型的读者
学习规模
4 阶段 · 6 节点 · 约 7 小时
更新
2026-08-12
  1. 2012–2015

    01 · CNN 规模化

    这一阶段要解决什么?

    如何让深度网络在大规模图像上稳定学习?

    阶段结论

    AlexNet 确立深度 CNN 优势,ResNet 通过残差连接打开更深网络。

  2. 2020

    02 · Vision Transformer

    这一阶段要解决什么?

    视觉是否必须依赖卷积的局部归纳偏置?

    阶段结论

    ViT 证明大数据与规模下,纯 Transformer 也能成为视觉主干。

  3. 2021

    03 · 图文对齐

    这一阶段要解决什么?

    如何让视觉概念与开放文本语义对齐?

    阶段结论

    CLIP 用对比学习建立可迁移的图文表征。

  4. 2020–至今

    04 · 扩散生成

    这一阶段要解决什么?

    如何同时提升生成质量、稳定性与文本可控性?

    阶段结论

    DDPM 与潜空间扩散成为现代图像生成的核心路线。