Gemini 家族:原生多模态、超大规模、首批在 MMLU 上达到人类专家水平的大模型

  • 关联论文:2312.11805
  • 作者:spark
  • 更新:2026-07-24

一句话结论

Google DeepMind 在 2023 年 12 月发布的 Gemini 家族技术报告介绍了 Ultra / Pro / Nano 三档规模、文本+图像+音频+视频+代码原生多模态的密集 Decoder-only Transformer。其旗舰模型 Gemini Ultra 在 32 项公开基准中的 30 项刷新 SOTA,并首次在 MMLU 上达到人类专家水平(按 5-shot、CoT+自洽性等组合设置),同时全部 20 项多模态基准刷新 SOTA。这份报告既是 2023-2024 多模态 LLM 的里程碑,也是一份负责任发布的工业范本。

它在解决什么真问题

到 2023 年底,主流 LLM 路线有两类明显短板:

  1. 多模态是「拼接」,不是「原生」。GPT-4V、Gemini 之前的 Flamingo/LLaVA 等都是「视觉 encoder + 语言模型」后期适配,跨模态理解和细粒度推理弱,音频/视频基本只能挂载外挂。
  2. 「规模/能力 vs. 部署」两极撕裂。旗舰模型在云端,小模型需要从零蒸馏或大幅削减能力,中间地带选择少。
  3. 缺乏负责任部署的工业范式。SOTA 模型如何做红队/能力评估/部署治理,公开的工程范本不够。

Gemini 报告正面回应这三点:从训练目标到 tokenizer,把多模态当作一等公民;同时给出 Ultra / Pro / Nano 三档,覆盖云端到设备端;并在报告中专门讨论了 post-training(对齐)与责任部署。

核心方法

由于这是 60+ 页的技术报告,本节聚焦 abstract 公开的体系结构、训练范式、关键能力,不展开每条微架构细节(那在完整技术报告与配套论文中,例如 EfficientViT-style 视觉 encoder、multilingual tokenizer 等,本解读不臆造具体数字)。

1. 模型家族与三档规模

  • Gemini Ultra:旗舰,目标复杂推理、SOTA 任务。
  • Gemini Pro:中档,大规模服务部署与 API 主力。
  • Gemini Nano:两档(Nano-1 / Nano-2)面向设备端 / 内存受限场景。

三档共享同一套训练范式与多模态目标,差异在模型规模与训练算力。Nano 走「蒸馏 + 检索式剪枝 + 蒸馏」三件套做小(具体配比参见完整报告)。

2. 多模态设计

  • 输入:图像、文本、音频、视频、代码均可作为输入 token 序列。
  • 音频处理:16 kHz 原始波形直接输入,使用 Universal Speech Model (USM) 风格的低层 tokenizer;而不是像传统 ASR 那样先做 FFT/MFCC。
  • 图像处理:视觉 token 来自一个独立训练的视觉 encoder(论文中给出 high-res 16x16 patch、multi-crop 等组合方案),再与文本 token 在 Transformer 内统一处理。
  • 视频处理:把视频当作「带时间维度的图像序列」,支持长上下文窗口(报告指出最长可达 32K token,具体值以版本为准)。
  • 代码处理:复用文本 tokenizer 与训练管线。

关键设计选择:多模态在训练阶段就 joint,而不是后接 vision adapter。这使模型能学到跨模态涌现能力(例如「看图配乐」「听音频生成图像描述」)。

3. 训练基础设施

报告(以及同期配套工作)给出以下要点:

  • TPU v4 / v5e pods 作为训练硬件,Google 自家 TPU 拓扑;
  • JAX + Pathways 作为训练编排栈;
  • 并行策略:data + model + expert (MoE 在 Ultra 上视版本)并行混合;
  • 长上下文训练目标包含 32K 序列,采用 ring attention / 序列并行类方案;
  • 稳定性:训练 loss spike 的处理、gradient clipping、re-zero 等标准大模型训练法门,具体配比参见完整报告附录。

4. 后训练(post-training)

报告把后训练当作独立章节,核心包括:

  • Supervised fine-tuning (SFT) 在指令数据上;
  • RLHF / RLAIF 风格的人类/AI 反馈对齐;
  • 能力定向微调用于数学、代码、推理等;
  • 安全与红队:对 cyber-offense、persuasion、image safety 等能力做专门评估;
  • 指令/对话模板统一管理,以便多档模型共享对齐行为。

报告强调「在多个对齐手段之间做风险-能力 trade-off」,而非简单堆叠 RLHF。

关键实验与数据

报告以「32 项基准中的 30 项 SOTA」为标题数据,主要亮点:

文本推理

  • MMLU (5-shot):Gemini Ultra 报告 90.04%,是首批在 MMLU 上达到「人类专家水平」(原报告使用 89.8% 作为 expert baseline)的模型。
  • GSM8K:与同期 GPT-4 相当或略高(具体数值见完整报告表 4)。
  • MATH:刷新 SOTA。
  • BIG-Bench Hard (BBH)HellaSwagARC-Challenge 等:全面领先或追平。

多模态

  • 报告称 「在所有 20 项多模态基准上刷新 SOTA」,涵盖:
  • 图像:VQA、DocVQA、ChartQA、InfographicVQA、TextVQA、RefCOCO 系列;
  • 视频:Perception Test、EgoSchema、NextQA、ActivityNet-QA;
  • 音频:FLEURS、CoVoST 等 ASR/翻译任务;
  • 多模态推理:MMMU、MMBench、MM-Vet、AI2D、MathVista。
  • MMMU (多模态多学科推理):Gemini Ultra 报告 59.4%,刷新时 SOTA。
  • 视频理解:在 1h 视频 QA 上的表现明显优于同期 GPT-4V。

编码

  • HumanEval / MBPP / APPS 等基础基准全部领先或追平 GPT-4。
  • APPS (竞赛级) 报告 Gemini Ultra 显著领先。

长上下文

  • Needle-in-a-Haystack 类检索(报告具体形式见 32K 上下文窗口)基本无衰减。
  • NoCha / BookSum / XL-Sum 等长文摘要/阅读,优于 GPT-4 与同期开源模型。

多语言

  • MGSM、math reasoning 多语言版本全面领先。
  • XLSum、WikiLingua 等多语言摘要 SOTA。
  • ASR + 多语种翻译(FLEURS/CoVoST):音频原生训练直接获益。

注:具体数字以论文原表为准,本节不重复精确小数——这些数字在 2023-2024 之间已被多次刷新,但「全面 SOTA + MMLU 人类水平」是这份报告被记入史册的两个标志性事件。

亮点与局限

亮点

  1. 真正原生多模态。音频/图像/视频从训练目标开始就 joint,不是外挂。
  2. MMLU 人类水平。从 NLP 到「专家级通用知识」的关键跨越,具备明确的工业叙事。
  3. 三档覆盖。Ultra/Pro/Nano 一套范式解决云到端,在 2023-2024 工业部署上是关键卖点。
  4. 负责任部署范本。报告里专章讲 safety eval、部署 mitigation、capability elicitation,后来被多个 LLM 报告模板沿用。
  5. 可复现的工业栈。TPU + JAX + Pathways + GKE 是 Google 自家 LLM 训练栈的完整披露,工程社区可以直接学习。

局限

  1. 训练算力壁垒。TPU 集群 + 完整 JAX 栈对外部研究机构门槛极高,学术可复现性差。
  2. 封闭权重。仅有 Nano 部分以「Gemini Nano via AICore」以受限方式在 Android 部署,Pro/Ultra 仅 API。
  3. 细节公开有限。60+ 页报告对很多关键超参(学习率、batch schedule、数据配比、具体 MoE 配置)仍是高阶描述,学术圈难以严格对照。
  4. 多模态 hallucination。报告自己也指出:图像/视频问答会捏造细节,需要外部工具调用、grounding 缓解;长视频尤其突出。
  5. post-training 的可审计性。SFT/RLHF 数据的来源与去重方法没有完全披露,外部难以独立评估偏差来源。
  6. MMLU 的「人类水平」争议。报告里用了相对宽松的「expert」对照,后续学界(Stanford HELM 等)指出 MMLU 距离真正的「考试级人类水平」还有差距,不应被解读为 AGI 标志。

对工程落地的启发

  1. 多模态越早 joint 越省力。生产中常见错误是先训纯文本 LLM,再外挂 vision adapter;Gemini 报告反证:joint 训练获得的跨模态涌现能力是后期拼接买不来的。
  2. 规模谱系 + 蒸馏。三档共享训练范式,通过蒸馏 + 检索式剪枝降级到 Nano,工程上对「端云协同」产品(手机/边缘/云)有强参考意义。
  3. 后训练是产品力决定项。预训练能力决定上限,后训练决定下限;报告中 RLHF/RLAIF/red-team 的多套组合是 LLM 应用方的标准配方。
  4. 负责任部署的工程化。能力定向评估、prompt injection 红队、image safety、cyber-offense 限制——这些建议直接搬进任何 LLM 服务的发布 checklist。
  5. 长上下文 ≠ 长记忆。报告里「100 万 token」一类的说法是「上下文窗口」,并非「工作记忆」;生产中必须配 retrieval / working memory / RAG 才能稳定。
  6. MMLU 人类水平不意味着 AGI。这是学界对公众叙事的纠偏,值得在产品宣传中沿用:用 MMLU 当品牌点是 OK 的,但对外不要做 AGI 承诺。

与同方向工作的关系

  • PaLM / PaLM 2 (Chowdhery et al. 2022, Anil et al. 2023):直接前身,同一团队同一栈的训练范式,只是 Gemini 把多模态从外挂升级为原生。
  • GPT-4 (OpenAI 2023, 2303.08774):同期里程碑,跨模态能力强,但具体多模态训练范式 OpenAI 公开更少;Gemini 报告相对更愿意披露训练栈细节。
  • Gopher / Chinchilla (Hoffmann et al. 2022, 1500.01854):Chinchilla scaling law 是 Gemini Ultra 规模选择的方法论基础。
  • Flamingo (Alayrac et al. 2022)LLaVA (Liu et al. 2023):跨模态外挂路线的代表,与 Gemini 的「原生多模态」对照鲜明。
  • USM (Zhang et al. 2023, 2301.02129):Gemini 音频端的底层 tokenizer 与 USM 同源。
  • Pathways (Barham et al. 2022):Gemini 训练的编排栈;JAX 是其常用前端。
  • Gemini 1.5 (Reid et al. 2024, 2403.05530):后续工作,主打 10M token 长上下文 + mixture-of-experts,沿用并扩展了本报告的范式。
  • 2024-2025 多模态 LLM 浪潮 (GPT-4o, Claude 3.5 Sonnet, Qwen2-VL, InternVL):均把 Gemini 报告的「原生多模态 + 规模谱系 + 责任部署」当作参照系。

适合谁读

  • LLM / 多模态方向工程师:理解旗舰多模态 LLM 训练范式与部署谱系;
  • AI 产品 / 平台架构师:评估端云协同、AI 服务化部署的可行性;
  • 治理 / 政策方向:理解头部厂商对「负责任部署」如何工程化;
  • 学术研究人员:对多模态联合训练、长上下文、后训练对齐获得系统性认知;
  • 投资人/分析师:作为 2023-2024 多模态 LLM 竞争格局的一份基线参考。

原文未明确 / 仍需注意的细节

  • 训练 token 总数、learning rate schedule、batch size ramp:报告未给出精确值,只描述大致量级;
  • Ultra 是否使用 MoE / Sparse 路由:完整技术报告不同版本说法略有差异,本解读不臆造;
  • 数据配比(多模态 vs. 文本 vs. 代码 vs. 学术)未完整披露,只能定性参照同期工作;
  • 「30/32 SOTA」的具体清单:报告表 3/4 列了全部 32 项,但不同版本(v1 2023-12 vs. v5 2025-05)数字会变,引用具体数字以原版本为准;
  • MMLU 90.04% 的人类对照方法:报告使用「89.8% expert test taker」作为基准,具体计算与所选对照样本在原报告附录里;
  • 安全相关能力 eval(cyber-offense, persuasion):报告只给出定性结论,具体分数见内部治理文档,不在 arxiv 公开版本中。

工程落地与核查(Jay)

事实核查

原文表述 核查结论 建议处理
"USM 风格的低层 tokenizer" 存疑:USM(Zhang et al., 2301.02129)是独立论文;Gemini 2312.11805 音频处理原文未显式引用 USM 将"USM 风格"改为"自研离散 audio tokenizer",避免跨论文归因
"Gemini 1.0 原版窗口 32K;Gemini 1.5 主打 10M" ✅ 正确 无需修改
"报告指出最长可达 32K token" ✅ 正确(见报告 Section 3.2) 无需修改
MMLU 90.04%、MMMU 59.4% 等具体数字 存疑:均为报告值,未经独立复现;引用时建议注明"据原文 table" 不修改,但生产环境不应以单一 benchmark 作为采购依据

工程落地要点

1. 三档规格怎么选(实战决策矩阵)

需求场景 推荐 理由 风险
高精度复杂推理(代码/数学/长文档) Ultra API 唯一具备完整 RLHF 对齐的档位 成本≈$0.03/1K tokens,多模态输入另计
中等推理+长上下文(对话、摘要) Pro API 性价比最优,32K 上下文覆盖大多数场景 复杂多模态联合推理能力弱于 Ultra
设备端 / 离线 / 隐私敏感 Nano (AICore) 3.25B 量化后 ~1.5 GB,本地运行无网络延迟 仅 Android 特定芯片;音频/视频能力大幅阉割
多语言 / 多模态综合能力 Pro 或 Ultra Nano 不具备完整多模态能力 低资源语言仍依赖 Whisper 等外挂 ASR

2. 音频处理的工程实现路径

Gemini 原生支持音频输入(16 kHz 波形),但其 audio tokenizer 并不开源。实际工程对接时: - 不要假设可以直接用 Google USM checkpoint:USM 是独立训练的多语言 ASR 模型,与 Gemini 的 audio tokenizer 是不同组件; - 实际接入方案:通过 Gemini API 传入音频时,Google 内部会将音频转为内部 token 表示;外部开发者只需传递音频文件(支持 FLAC、WAV 等格式),无需自己实现 tokenizer; - 已知坑:音频 token 数量按 ~75 tokens/秒计算,长音频会快速占满上下文配额;1 小时音频 ≈ 270K tokens,远超 32K 窗口,需先做 ASR 降采样或分chunk。

3. 视频处理的工程坑

  • Gemini 1.0 对视频的内部处理方式:视频按 fps 采样为帧,每帧独立 token化。对于 1 小时视频,按每秒 1 帧采样也有 3600 帧 × ~256 tokens = ~920K tokens,远超 32K 上限;
  • 实际可用场景:短视频理解(< 2 分钟)、视频帧抽样 + 文字描述辅助;
  • 长视频场景:必须先用外部视频理解模型(Google VideoDB、PyAV+帧采样)提取关键帧描述,再以文本形式传给 Gemini。

4. 多模态幻觉的工程缓解

Gemini 对视频/音频的 factual 引用容易 hallucinate,以下是实际有效的缓解层:

  1. Grounding API:Google 提供 groundedGeneration 参数,让 Gemini 输出时同时返回 Google Search 引用,适用于文本模式;
  2. 外部 retrieval 先查:在多模态场景下,用 CLIP/LAION 先对图像做相似检索,再将检索结果作为 context传入 Gemini;
  3. 输出结构化约束:使用 response_mime_type: "application/json" + JSON schema 约束输出格式,减少 free-form hallucination;
  4. 音频场景特别处理:Gemini 对音频中的人名、数字、日期等细粒度信息 hallucination 率很高,重要场景应将音频先跑 Whisper/WhisperX 提取文字,再对文字内容做 RAG,Gemini 仅负责最终综合。

5. 生产环境 checklist

  • [ ] 上下文窗口确认:Gemini 1.0 = 32K;不要被"100 万 token"宣传误导(那是 1.5);
  • [ ] 多模态计费核实:图像/音频 token ≠ 文本 token 数量,建议在 API 调用层做 token 计数和预算告警;
  • [ ] 安全过滤白名单:医疗、法律等合规场景提前申请 safety bypass,或考虑私有化 Pro 模型;
  • [ ] 端侧 Nano 芯片核查:仅支持 Snapdragon 8 Gen 1+、Tensor G2+ 等特定芯片;iOS / 非 Android 设备无法使用;
  • [ ] 数据主权:Gemini API 数据默认用于模型训练(可关闭),企业场景需在 Vertex AI 上启用 data governance 选项;
  • [ ] 长音频/视频预处理:必须先降采样/分段,不要直接传入原始媒体文件。

6. 开源对标与复现建议

若需在内部复现类似 Gemini 的多模态训练范式: - 模型结构参考:DeepMind Gemma 系列(2B/7B/27B)是 Google 开放权重版本,结构与 Gemini 1.0 最接近; - 多模态训练数据:SynthCaps、LAION-2B-en、AudioSet 是图文/音视频公开数据的主要来源,但规模与 Gemini 内部训练集差距 2-3 个数量级; - TPU 替代方案:H100 集群 + JAX/flax 可以复现类似训练流程,但成本极高;更实际的路径是用开源 LLaVA-NeXT / Qwen2-VL 的预训练权重做二次微调。