1412.6632 · 小红书推广卡片文案

三个标题变体

  1. 2014 年那篇论文悄悄奠定了今天 GPT-4V 看图的底层 —— 11 年后读它依然震感拉满 ⚡
  2. 「看图说话」AI 的第一锹土,被这 56 页论文挖在了 2014 年冬 ❄️
  3. 做多模态的姐妹听我说:你今天用的所有 VLM,都得感谢这篇 11 年前的论文 🫶

小红书卡片文案(约 220 字)

做多模态的姐妹听我说 🫶

你今天用的 GPT-4V、LLaVA、Qwen-VL,看见图片能和你聊天 —— 这件事不是 2023 年才发明的,2014 年就有人挖了第一锹土

arXiv 1412.6632(m-RNN, Baidu + UCLA, 2014-12)是第一个让一个神经网络端到端"看着图写字"的工作 ——

❌ 错法:CV 模型先识别物体 → 再套模板填词 → 输出死板句子
✅ 真法:图像 CNN(看) + 词向量(读) + RNN(写) + 多模态层(融合) 全在一个概率目标下联合训练

它在 4 个数据集 + 双向图文检索上同时超 SOTA,11 年来被引 1285 次,至今仍然是 LLaVA "MLP projector"、Flamingo "Perceiver Resampler" 的祖先架构。

11 年前的设计思路,还在被今天的 SOTA 模型沿用 ✨

多模态 #VLM #ImageCaptioning #GPT-4V #LLaVA #CLIP #深度学习 #端到端 #arXiv #论文解读


关联论文:1412.6632(点格式)
科普版/shared/research-kb/organized/promo/popular/1412-6632.md