2023 年底这场发布,把「AI 会不会看图」这件事彻底改了——Gemini 报告是怎么把 GPT-4V 拉下马的
- 关联论文:2312.11805
你用手机翻译 App 拍菜单、你看视频 AI 自动生成字幕、你让聊天机器人听一段会议录音然后给纪要——
你以为是 2024-2025 的新功能。 其实 2023 年 12 月的这一天,所有底层范式已经定型。
2023 年 12 月 6 日,Google DeepMind 把一份 60 多页的技术报告丢到 arXiv:2312.11805。它介绍了一个叫 Gemini 的家族——Ultra / Pro / Nano 三档规模,能 同时看文本、图像、音频、视频、代码 的大模型。
报告做了三件事:
- 第一次在 MMLU 上达到「人类专家水平」(90.04% vs. expert 89.8%);
- 32 项公开基准里刷新 30 项 SOTA——文本推理、数学、代码、常识、多模态几乎全刷;
- 「原生多模态」范式定型——以前的 GPT-4V 是「文本 LLM + 视觉外挂」,Gemini 是 从训练开始就把图像/音频/视频当一等公民。
这份报告被引 829 次,它不是「又一个更好的模型」,它是 2024-2026 年所有多模态 LLM 的参照系。
2023 年底,大模型的三道伤疤
GPT-4V 发布时惊艳,但圈内人冷静下来会发现三道坎:多模态是「拼接」不是「原生」(Flamingo、LLaVA、GPT-4V 都是「视觉 encoder + 语言模型」后期适配,音频/视频只能挂载外挂);规模与部署两极撕裂(旗舰在云端,小模型需从零蒸馏,中间地带选择少);缺一份「负责任部署」的工业范本(红队、能力评估、部署治理的公开工程范本不够)。
Gemini 报告正面回应这三点:从训练目标到 tokenizer 把多模态当一等公民;同时给出 Ultra / Pro / Nano 三档,覆盖云端到设备端;并专章讨论 post-training 与责任部署。
Gemini 范式的核心:三件事同时做对
第一件事:多模态从训练目标开始就「joint」
不是「先训好文本 LLM,再外挂 vision adapter」——Gemini 把图像、音频、视频、代码 从训练目标开始就当 token 序列 喂给模型。这意味着 AI 能学到 跨模态涌现能力:看图配乐、听音频生成图像描述、看视频写故事——后期拼接买不来。音频直接用 16 kHz 原始波形 输入,视频按「带时间维度图像序列」处理,最长上下文窗口 32K(原版)/1M(Gemini 1.5)。
第二件事:三档规格共享一套训练范式
- Ultra:旗舰——论文里看到 90.04% MMLU、59.4% MMMU 就是它;
- Pro:服务部署与 API 主力——性价比最优,32K 上下文覆盖多数场景;
- Nano:两档(Nano-1 / Nano-2)面向 设备端 / 内存受限——量化后 ~1.5 GB,本地运行无网络延迟。
三档共享训练范式,差异在规模与算力。
第三件事:后训练当成独立章节做产品力
报告把后训练当成单独一章:SFT + RLHF/RLAIF + 能力定向微调(数学/代码/推理)+ 安全与红队(cyber-offense、persuasion、image safety)+ 指令/对话模板统一管理。强调「在多个对齐手段之间做风险-能力 trade-off」,而非简单堆叠 RLHF。
涨了多少?那张 32 项基准表
- MMLU (5-shot):90.04%——首批达到「人类专家水平」;
- GSM8K / MATH:与同期 GPT-4 相当或略高,MATH 刷新 SOTA;
- BBH、HellaSwag、ARC-Challenge:全面领先或追平;
- MMMU(多模态多学科推理):Ultra 59.4%,刷新时 SOTA;
- VQA、DocVQA、ChartQA、TextVQA、RefCOCO 等图像任务——全部领先;
- Perception Test、EgoSchema、NextQA 等视频任务——大幅领先 GPT-4V;
- HumanEval / MBPP / APPS 编码基准全部领先或追平 GPT-4;
- Needle-in-a-Haystack 32K 检索基本无衰减;MGSM、XLSum 等多语言 SOTA。
这些数字在 2023-2024 间已被多次刷新,但「全面 SOTA + MMLU 人类水平」是这份报告被记入史册的两个标志。
为什么这份报告是「2024 年所有多模态 LLM 的参照系」
读完 Gemini 报告,你会发现四件事:
- 它定义了「原生多模态」这个词。后续 GPT-4o、Claude 3.5 sonnet、Qwen2-VL、InternVL、Llama 3.2 Vision 全部沿用「训练目标就 joint」的范式——没有这份报告,这些公司可能晚一两年才转向 joint 训练。
- 它把「三档规模谱系」变成行业标配。云端旗舰 + 服务主力 + 设备端小模型——这套产品矩阵被 OpenAI、Anthropic、Meta 全盘复制。
- 它把「负责任部署」从 PPT 落到工程清单。能力定向评估、prompt injection 红队、image safety、cyber-offense 限制——直接搬进任何 LLM 服务发布 checklist。
- 它建立了「长上下文叙事」。Gemini 1.5 把窗口推到 100 万、200 万 token——Claude 3、GPT-4 Turbo、文心 4.0、Qwen-Long 全部跟进。
2024-2025 多模态 LLM 的所有故事——视觉理解、视频问答、音频解析、长上下文——都在 Gemini 2312.11805 划出的轨道上跑。
但它有六条明显的局限
- 训练算力壁垒:TPU v4/v5e 集群 + 完整 JAX 栈,外部研究机构门槛极高;2. 封闭权重:仅有 Nano 以「Gemini Nano via AICore」在 Android 部署,Pro/Ultra 仅 API;3. 细节公开有限:关键超参仍是高阶描述,学术圈难严格对照;4. 多模态 hallucination:图像/视频问答会捏造细节,长视频尤其突出;5. post-training 可审计性弱:SFT/RLHF 数据来源与去重方法没有完全披露;6. MMLU「人类水平」争议:Stanford HELM 指出 MMLU 距离真正「考试级人类水平」还有差距——不应被解读为 AGI 标志。
工程落地的 5 条实操
1. 三档规格怎么选:高精度复杂推理选 Ultra API;中等推理+长上下文选 Pro API(32K 覆盖多数场景);设备端/离线/隐私敏感选 Nano (AICore)(量化后 ~1.5 GB,本地运行无网络延迟)。
2. 音频处理的工程坑:音频 token 按 ~75 tokens/秒 计算,1 小时 ≈ 270K tokens——远超 32K 窗口,必须先 ASR 降采样或分 chunk。重要场景建议先跑 Whisper/WhisperX 提取文字,再做 RAG,Gemini 仅负责最终综合。
3. 视频处理的工程坑:1 小时视频按每秒 1 帧 ≈ 920K tokens——远超 32K 上限。长视频必须先用外部模型(PyAV+帧采样)提取关键帧描述,再以文本形式传给 Gemini。
4. 多模态幻觉的工程缓解:用 groundedGeneration 参数让 Gemini 输出时同时返回 Google Search 引用;强制 response_mime_type: "application/json" + JSON schema 约束输出;音频场景特别处理——Whisper 先抽文字 + RAG 后 Gemini 仅做综合。
5. 生产环境 checklist:上下文窗口确认(Gemini 1.0 = 32K,别被「100 万 token」宣传误导——那是 1.5);多模态计费核实(图像/音频 token ≠ 文本 token,API 层做预算告警);数据主权(Gemini API 数据默认用于训练,可关闭);端侧Nano 芯片核查(仅支持骁龙 8 Gen 1+、Tensor G2+,iOS/非 Android 无法使用)。
写在最后:为什么 2023 年底这场发布,是 2024-2026 所有故事的起点
读完 Gemini 2312.11805,你会发现一件事:
AI 真的「原生多模态」了吗?不,它只是「从训练目标开始,就把图像/音频/视频当一等公民,而不是后期拼接」。
听起来像营销辞令——但它改变了 2024 年所有大公司的研发路线。
在 Gemini 报告之前,主流路线是「先训好文本 LLM,再外挂 vision adapter」(GPT-4V、LLaVA、Flamingo 都是这条路)。
Gemini 报告之后:「从训练目标 joint 多模态」成了行业标准。GPT-4o、Claude 3.5 sonnet、Qwen2-VL、InternVL——全部沿用这一范式。
这就是 2312.11805 跨越三年、跨越所有厂商、跨越所有产品线,成为 2024-2026 多模态 LLM 产业级参照系 的原因——
不要「先做文本模型,再做视觉合计」;从训练目标开始,就让模型「看到、听到、读到」。
论文里那张 32 项基准表,不是一个数字清单,是 2024 年所有多模态故事的起点。
走小红书通道:3 个标题变体 + 卡片文案
变体标题 A(悬念 / 2023 vs 2024 对比):
你以为「AI 看图」是 2024 才有的功能?2023 年 12 月这一天,所有故事就已定型 📖
变体标题 B(数字冲击 / 教科书型):
MMLU 90.04% 首次破人类线:60 页报告,改写 2024 整个多模态赛道
变体标题 C(口语 / 行业重磅型):
GPT-4V 还没捂热,Google 60 页报告就把多模态范式重写了 🌍🔥
小红书风格卡片正文(300-600 字):
家人们,2024 年 AI 看图、听音、读视频这些"新功能",2023 年 12 月就已经定型了 ✨
Google DeepMind 那天甩出一份 60 多页报告(arXiv 2312.11805),介绍了 Gemini 家族——Ultra / Pro / Nano 三档,能同时看 文本+图像+音频+视频+代码 的大模型 📚
三件大事 🌟 ① MMLU 90.04%,首次破人类专家线(expert 89.8%)——AI 从「考试机器」正式进入「跟人比专业知识」叙事 ② 32 项基准刷了 30 项 SOTA——文本推理、数学、代码、多模态几乎全刷 ③ 原生多模态范式定型——以前的 GPT-4V 是「文本+视觉外挂」,Gemini 是 从训练目标开始就把图像/音频/视频当一等公民 🎯
为什么这份报告重要?因为它之后: • GPT-4o、Claude 3.5、Qwen2-VL、InternVL 全沿用「joint 训练」 • 「三档规模谱系」变成行业标配 • 「负责任部署」从 PPT 落到工程清单 • Gemini 1.5 把上下文推到 100 万 token,Claude 3、GPT-4 Turbo 全部跟进 💡
但也有局限 ⚠️:TPU 集群高门槛;Pro/Ultra 闭源;多模态幻觉;MMLU「人类水平」有争议(Stanford HELM 说还不是 AGI)。
5 条实操 🚀 1. 三档怎么选:复杂推理选 Ultra API;性价比选 Pro;设备端选 Nano(量化后 ~1.5GB 本地跑) 2. 音频坑:~75 tokens/秒,1 小时音频 270K tokens,必须先 ASR 降采样 3. 视频坑:1 小时视频按 1fps 采样 ≈ 920K tokens,远超 32K 上限 4. 幻觉缓解:用 groundedGeneration + JSON schema 约束;音频先 Whisper 抽文字 + RAG 5. 上线 checklist:确认 32K 窗口(不是 100 万,那个是 1.5);多模态计费单独算;端侧 Nano 仅特定芯片(骁龙 8 Gen 1+)📱
一句话总结:不要「先做文本模型,再外挂视觉」——从训练目标开始就让模型「看到、听到、读到」👀🎧📖
AI干货 #Gemini #多模态 #大模型 #LLM #Google #论文解读 #人工智能 #深度学习 #AI产品