2023 年 Salesforce 干了一件「省钱大事」:让 AI 看图说话,只用 1% 的算力

  • 关联论文:2301.12597

你有没有用过这种 AI?

📷 上传一张照片,它能告诉你「图里有一只柯基在草地上追飞盘」 🖼️ 给一张菜单,它能帮你读出每道菜 📊 丢一张图表,它能告诉你 2025 年的趋势

这种「既会看图又会说话」的 AI,叫 VLM(Vision-Language Model,视觉语言模型)。

但问题是:训练这种 AI,以前贵得离谱

2023 年 DeepMind 训的 Flamingo 模型,800 亿参数,训练一次烧掉的钱够买一栋楼。

然后 2023 年 1 月,Salesforce 的 BLIP-2 站出来说:

「不用那么贵,我的方案只用 1% 的算力,效果还能比 Flamingo 还好。」

被引 8700+ 次,它是怎么办到的?


一句话告诉你 BLIP-2 干了什么

它用一个超轻量的「中间人」模块,把已经训好的「图像识别 AI」和「语言 AI」桥接起来——

两个大模型完全冻结不动,只训练中间那个小模块

结果:参数只用了 Flamingo 的 1/54,效果反而更好。


为什么这件事值得普通人关注

它直接决定了今天你用到的多模态 AI 有多便宜、多快、多灵活

💰 成本降 50 倍——以前大厂才玩得起的技术,现在中小公司甚至个人开发者都能复现 ⚡ 训练时间从月降到天——不用等几周训练,几天就能调通一个多模态 AI 🔌 模块化组合——「眼睛」坏了换眼睛,「嘴巴」不够聪明换嘴巴,不用重新训练整个系统 📱 消费级 GPU 也能跑——FlanT5XL 版本只要 16GB 显存,FlanT5XXL 要 30GB+,普通 RTX 3090/4090 也能跑

更关键的是:BLIP-2 的设计思想直接影响了后面所有的 VLM——今天 ChatGPT 能看图,Gemini 能看视频,底层都站在 BLIP-2 的肩膀上


它是怎么做到的?(去掉术语版)

以前的做法:「两个大家伙,一起从头学」

传统多模态 AI 训练: - 准备一个 80 亿参数的「图像识别 AI」 - 准备一个 800 亿参数的「语言 AI」 - 让它们从零开始一起学怎么配合

问题:超级贵、超级慢,而且大量参数浪费在「重新学视觉」上

BLIP-2 的做法:「别动它们,中间放个小翻译」

BLIP-2 的核心思路:

  1. 冻结图像 AI——已经训好的 ViT 图像识别模型,完全不动
  2. 冻结语言 AI——已经训好的 FlanT5 / OPT 大语言模型,完全不动
  3. 加一个「中间人」模块(叫 Q-Former)——这个模块只有几亿参数,专门负责把图像特征「翻译」成语言 AI 能听懂的信号

打个比方:

你想让一个法国大厨(语言 AI)和日本寿司师傅(图像 AI)合作做菜。 传统做法:让他们都从零学对方语言,耗时耗力。 BLIP-2 做法:雇一个双语翻译(Q-Former)站在中间,法国大厨和寿司师傅都不动,翻译负责传达意思。

结果:这个翻译小模块虽然只有 3 亿参数(相比语言 AI 的几十亿),但效果出奇地好——因为图像和语言 AI 都已经很聪明了,翻译只需要「精准传达」,不需要「自己也很聪明」。

训练这个「翻译」分两步

第一步:让翻译学会「看图」 - 给它看图,让它把图里的关键信息「摘」出来 - 用三种方式考核:这个图配这段文字合不合理?能不能生成对应文字?图和文字匹配不匹配?

第二步:让翻译和「语言 AI」对话 - 把翻译的输出当作语言 AI 的「提示词」 - 让语言 AI 根据翻译「看到」的内容,生成自然语言回答 - 训练目标:语言 AI 的回答越准越好

两步训完,翻译就成了一个「会精准描述图像」的高手


它打破了一个「常识」

以前的认知:「更大的模型 = 更好的效果」

BLIP-2 直接反驳:「不一定。你只需要一个聪明的小桥,就能把两个现成的大模型连起来用。」

具体数据:

模型 参数量 VQA 准确率
Flamingo 800 亿 56.3%
BLIP-2 (小) 16 亿 65.0%
BLIP-2 (中) 41 亿 67.6%

参数少 54 倍,准确率高 9 个百分点。

这是「参数效率」的胜利——也是今天几乎所有 VLM 的设计哲学起点。


谁该关注这件事?

🎯 AI 产品经理——以前想加「看图」功能,要重新训练一个 800 亿参数的多模态模型,周期长、成本高。现在直接复用 BLIP-2 范式,几周就能上线。

🎯 多模态研究者——Q-Former 的「信息瓶颈」设计,成了后续 InstructBLIP、miniGPT-4、LLaVA 等所有 VLM 的标准套路。

🎯 边缘部署工程师——小版本 BLIP-2 能在消费级显卡跑,让本地化多模态 AI 成为可能。

🎯 想入门 VLM 的学生——论文短小精悍,逻辑清晰,是理解「为什么需要桥接模块」的最佳入门读物。


它也有局限(不能无脑吹)

⚠️ 语言 AI 是天花板——翻译再准,如果连接的 LLM 本身弱,效果也不会好。Q-Former 不能「无中生有」。 ⚠️ 眼睛换不动——视觉骨干网络固定为 ViT,想换 CLIP、DINOv2 等其他视觉模型,得从头训练 Q-Former。 ⚠️ 量化会掉点——INT8 量化后准确率掉 2-4 个点,工程上建议用 BF16 而非 INT8。 ⚠️ 显存门槛——FlanT5XXL 版本要 30GB+ 显存,普通 16GB 显卡只能跑小版本。


一句话总结

BLIP-2 用一个 3 亿参数的「翻译官」桥接两个冻结的大模型,证明「多模态 AI 不需要重新训练,只需要聪明的桥」——把多模态训练成本砍到原来的 1/50,效果反而更好。

被引 8700+ 次不是偶然,它定义了整个 VLM 时代的玩法


三个标题变体

  1. Salesforce 用一个「翻译官」,把多模态 AI 的训练成本砍掉 98%(数字钩子)
  2. 为什么 ChatGPT 能看图?一切要从 2023 年这篇被引近 9000 次的论文说起(反问+权威)
  3. AI 看图说话,根本不需要大模型从头学——一个 3 亿参数的「小翻译」就够了(反直觉钩子)

小红书风格卡片文案(可直接发布)

🗣️ AI 是怎么「看图说话」的?

2023 年之前,训练这种 AI 要烧掉几百万美元💸 因为要把 800 亿参数的图像 AI 和语言 AI 一起从头训

然后 Salesforce 的 BLIP-2 站出来说: 「不用那么贵!」

💡 它怎么做到的? ✅ 冻结两个现成的大模型(图像+语言),完全不动 ✅ 只加一个 3 亿参数的「翻译官」模块(Q-Former) ✅ 让翻译官负责把图的内容「精准传达」给语言 AI

📊 效果如何? | 模型 | 参数量 | 准确率 | |---|---|---| | Flamingo | 800 亿 | 56.3% | | BLIP-2 小 | 16 亿 | 65.0% | | BLIP-2 中 | 41 亿 | 67.6% |

参数少 54 倍,准确率高 9 个点

🎯 现在的影响? 今天 ChatGPT 能看图、Gemini 能看视频、LLaVA 能对话 底层设计都站在 BLIP-2 肩膀上

一句话总结:多模态 AI 不需要大模型重训,只需要聪明的桥 🌉

你用过哪些「看图说话」的 AI?评论区聊聊 👇

AI科普 #多模态AI #BLIP2 #Salesforce #大模型 #视觉语言模型 #VLM #ChatGPT #深度学习 #AI日报 #开源AI #编程