2023 年 Salesforce 干了一件「省钱大事」:让 AI 看图说话,只用 1% 的算力
- 关联论文:2301.12597
你有没有用过这种 AI?
📷 上传一张照片,它能告诉你「图里有一只柯基在草地上追飞盘」 🖼️ 给一张菜单,它能帮你读出每道菜 📊 丢一张图表,它能告诉你 2025 年的趋势
这种「既会看图又会说话」的 AI,叫 VLM(Vision-Language Model,视觉语言模型)。
但问题是:训练这种 AI,以前贵得离谱。
2023 年 DeepMind 训的 Flamingo 模型,800 亿参数,训练一次烧掉的钱够买一栋楼。
然后 2023 年 1 月,Salesforce 的 BLIP-2 站出来说:
「不用那么贵,我的方案只用 1% 的算力,效果还能比 Flamingo 还好。」
被引 8700+ 次,它是怎么办到的?
一句话告诉你 BLIP-2 干了什么
它用一个超轻量的「中间人」模块,把已经训好的「图像识别 AI」和「语言 AI」桥接起来——
两个大模型完全冻结不动,只训练中间那个小模块
结果:参数只用了 Flamingo 的 1/54,效果反而更好。
为什么这件事值得普通人关注
它直接决定了今天你用到的多模态 AI 有多便宜、多快、多灵活。
💰 成本降 50 倍——以前大厂才玩得起的技术,现在中小公司甚至个人开发者都能复现 ⚡ 训练时间从月降到天——不用等几周训练,几天就能调通一个多模态 AI 🔌 模块化组合——「眼睛」坏了换眼睛,「嘴巴」不够聪明换嘴巴,不用重新训练整个系统 📱 消费级 GPU 也能跑——FlanT5XL 版本只要 16GB 显存,FlanT5XXL 要 30GB+,普通 RTX 3090/4090 也能跑
更关键的是:BLIP-2 的设计思想直接影响了后面所有的 VLM——今天 ChatGPT 能看图,Gemini 能看视频,底层都站在 BLIP-2 的肩膀上。
它是怎么做到的?(去掉术语版)
以前的做法:「两个大家伙,一起从头学」
传统多模态 AI 训练: - 准备一个 80 亿参数的「图像识别 AI」 - 准备一个 800 亿参数的「语言 AI」 - 让它们从零开始一起学怎么配合
问题:超级贵、超级慢,而且大量参数浪费在「重新学视觉」上。
BLIP-2 的做法:「别动它们,中间放个小翻译」
BLIP-2 的核心思路:
- 冻结图像 AI——已经训好的 ViT 图像识别模型,完全不动
- 冻结语言 AI——已经训好的 FlanT5 / OPT 大语言模型,完全不动
- 加一个「中间人」模块(叫 Q-Former)——这个模块只有几亿参数,专门负责把图像特征「翻译」成语言 AI 能听懂的信号
打个比方:
你想让一个法国大厨(语言 AI)和日本寿司师傅(图像 AI)合作做菜。 传统做法:让他们都从零学对方语言,耗时耗力。 BLIP-2 做法:雇一个双语翻译(Q-Former)站在中间,法国大厨和寿司师傅都不动,翻译负责传达意思。
结果:这个翻译小模块虽然只有 3 亿参数(相比语言 AI 的几十亿),但效果出奇地好——因为图像和语言 AI 都已经很聪明了,翻译只需要「精准传达」,不需要「自己也很聪明」。
训练这个「翻译」分两步
第一步:让翻译学会「看图」 - 给它看图,让它把图里的关键信息「摘」出来 - 用三种方式考核:这个图配这段文字合不合理?能不能生成对应文字?图和文字匹配不匹配?
第二步:让翻译和「语言 AI」对话 - 把翻译的输出当作语言 AI 的「提示词」 - 让语言 AI 根据翻译「看到」的内容,生成自然语言回答 - 训练目标:语言 AI 的回答越准越好
两步训完,翻译就成了一个「会精准描述图像」的高手。
它打破了一个「常识」
以前的认知:「更大的模型 = 更好的效果」。
BLIP-2 直接反驳:「不一定。你只需要一个聪明的小桥,就能把两个现成的大模型连起来用。」
具体数据:
| 模型 | 参数量 | VQA 准确率 |
|---|---|---|
| Flamingo | 800 亿 | 56.3% |
| BLIP-2 (小) | 16 亿 | 65.0% |
| BLIP-2 (中) | 41 亿 | 67.6% |
参数少 54 倍,准确率高 9 个百分点。
这是「参数效率」的胜利——也是今天几乎所有 VLM 的设计哲学起点。
谁该关注这件事?
🎯 AI 产品经理——以前想加「看图」功能,要重新训练一个 800 亿参数的多模态模型,周期长、成本高。现在直接复用 BLIP-2 范式,几周就能上线。
🎯 多模态研究者——Q-Former 的「信息瓶颈」设计,成了后续 InstructBLIP、miniGPT-4、LLaVA 等所有 VLM 的标准套路。
🎯 边缘部署工程师——小版本 BLIP-2 能在消费级显卡跑,让本地化多模态 AI 成为可能。
🎯 想入门 VLM 的学生——论文短小精悍,逻辑清晰,是理解「为什么需要桥接模块」的最佳入门读物。
它也有局限(不能无脑吹)
⚠️ 语言 AI 是天花板——翻译再准,如果连接的 LLM 本身弱,效果也不会好。Q-Former 不能「无中生有」。 ⚠️ 眼睛换不动——视觉骨干网络固定为 ViT,想换 CLIP、DINOv2 等其他视觉模型,得从头训练 Q-Former。 ⚠️ 量化会掉点——INT8 量化后准确率掉 2-4 个点,工程上建议用 BF16 而非 INT8。 ⚠️ 显存门槛——FlanT5XXL 版本要 30GB+ 显存,普通 16GB 显卡只能跑小版本。
一句话总结
BLIP-2 用一个 3 亿参数的「翻译官」桥接两个冻结的大模型,证明「多模态 AI 不需要重新训练,只需要聪明的桥」——把多模态训练成本砍到原来的 1/50,效果反而更好。
被引 8700+ 次不是偶然,它定义了整个 VLM 时代的玩法。
三个标题变体
- Salesforce 用一个「翻译官」,把多模态 AI 的训练成本砍掉 98%(数字钩子)
- 为什么 ChatGPT 能看图?一切要从 2023 年这篇被引近 9000 次的论文说起(反问+权威)
- AI 看图说话,根本不需要大模型从头学——一个 3 亿参数的「小翻译」就够了(反直觉钩子)
小红书风格卡片文案(可直接发布)
🗣️ AI 是怎么「看图说话」的?
2023 年之前,训练这种 AI 要烧掉几百万美元💸 因为要把 800 亿参数的图像 AI 和语言 AI 一起从头训
然后 Salesforce 的 BLIP-2 站出来说: 「不用那么贵!」
💡 它怎么做到的? ✅ 冻结两个现成的大模型(图像+语言),完全不动 ✅ 只加一个 3 亿参数的「翻译官」模块(Q-Former) ✅ 让翻译官负责把图的内容「精准传达」给语言 AI
📊 效果如何? | 模型 | 参数量 | 准确率 | |---|---|---| | Flamingo | 800 亿 | 56.3% | | BLIP-2 小 | 16 亿 | 65.0% | | BLIP-2 中 | 41 亿 | 67.6% |
参数少 54 倍,准确率高 9 个点
🎯 现在的影响? 今天 ChatGPT 能看图、Gemini 能看视频、LLaVA 能对话 底层设计都站在 BLIP-2 肩膀上
一句话总结:多模态 AI 不需要大模型重训,只需要聪明的桥 🌉
你用过哪些「看图说话」的 AI?评论区聊聊 👇