Gemma 4 技术报告:开源全模态密集 + MoE 模型家族,长上下文与端侧高效是本代核心
- 关联论文:2607.02770
- 作者:flyP
- 更新:2026-07-09
一句话结论
Gemma 4 是 Google DeepMind 发布的新一代开源(Apache 2.0)多模态语言模型家族,覆盖 2.3B / 4.5B / 12B / 31B 的密集配置和 26B-A4B(3.8B 激活)的 MoE 配置。本代最重要的三件事是:(1)原生多模态(文本 + 图像 + 音频)+ 内置 thinking mode 推理模式;(2)用 local-to-global attention、pp-RoPE、KV cache sharing 把 32K 上下文的 KV 占用最高削减 37.5%;(3)12B 模型首次采用 encoder-free 统一架构,把音频 / 图像 patches 直接投影进 LLM embedding 空间,去掉了独立的视觉 / 音频编码器。
解决的真问题
社区当下开源大模型普遍卡在三个矛盾上:
- 能力 vs 可部署性的剪刀差:动辄千亿 MoE 虽强,跑不动、消费级显卡带不动;端侧能跑的小模型又往往在 reasoning / 长上下文被甩开。
- 多模态拼装的工程开销:传统 LLaVA / Whisper + LLM 的"编码器 + 投影 + LLM"三段式,组件多、内存碎片化、量化棘手。
- 长上下文的显存爆:KV cache 随上下文线性爆炸,是目前所有"百万上下文"模型真正落地的头号拦路虎。
Gemma 4 的目标是用一套设计选择,把这三件事同时按住——既给端侧(E2B / E4B)也给数据中心(12B / 26B-A4B / 31B),既能纯文本也原生多模态,并配齐 thinking + 量化 + 推测解码的推理基础设施。
核心方法
模型家族与参数分布
| Model | Audio Enc | Vision Enc | Embedder | Einsums | Drafter |
|---|---|---|---|---|---|
| E2B (2.3B eff / 5B total) | 305M | 150M | 400M+2340M per-layer | 1870M | 76M |
| E4B (4.5B eff / 8B total) | 305M | 150M | 670M+2820M per-layer | 3940M | 77M |
| 12B(encoder-free) | – | – | 1000M | 10890M | 400M |
| 26B-A4B(MoE,3.8B 激活) | – | 550M | 740M | 24500M / 2800M active | 430M |
| 31B | – | 550M | 1410M | 29290M | 500M |
- 词表 262k entries,沿用 Gemini 的 SentencePiece tokenizer(digit splitting + 空白保留 + byte-level)。
- MoE 26B-A4B:3.8B 激活 / 26B 总参数,是端侧 + 数据中心兼顾的中间档。
架构细节
Backbone:decoder-only Transformer,pre-norm + post-norm,RMSNorm + QKNorm。
Local-to-global attention:
- E2B 用 4:1 local:global blocks,其余用 5:1。
- 全局层 keys 复用为 values(values = keys,E2B/E4B 除外),结合 KV cache sharing(E2B/E4B 局部层之间共享),把全局 KV cache 占用降低最高 37.5%。
- 全局层用 pp-RoPE(p=0.25),局部层用 RoPE,全局频率 1M、局部频率 10k。
视觉(Vision): - E2B/E4B:150M ViT 编码器,patch size 16。 - 较大模型:550M ViT(除 12B encoder-free 外)。 - 支持可变长宽比(Algorithm 1),使用 axial 2D-RoPE + 2D 绝对位置编码。 - 视觉 token 上限 Nmax ∈ {70, 140, 280, 560, 1120}。
音频(Audio): - E2B/E4B:305M USM 风格的编码器,两个下采样 Conv + 12 个 Conformer,相比 Gemma 3n 的 680M 减参 55%。 - 输入为 40ms chunk + Mel filterbank,无 VQ(向量化),把连续表示直接喂给 LLM。 - 训练时编码器权重冻结。
Encoder-free 12B(本代最具试验性的设计): - 视觉侧:48×48×3 图像 patch 序列 → 单一 35M 参数大 matmul 投影 + 2D 坐标 positional embedding + LayerNorm。 - 音频侧:16kHz 音频切成 40ms chunk → 640 维向量 → 直接投影进 LLM embedding 空间。 - 收益:去掉了独立 vision / audio encoder,减少内存碎片、降低量化复杂度、模型结构统一。 - 代价:35M 的视觉投影参数与原 550M ViT 差距极大,靠训练数据 + 大 matmul 的归纳偏置补;这是否能在更复杂视觉理解任务上保持精度是开放问题。
长上下文与显存优化(核心工程贡献)
- 局部 / 全局 attention 分层(5:1 或 4:1)+ pp-RoPE
- 全局层 keys 复用为 values
- KV cache sharing(E2B/E4B 局部层之间共享)
- 注意力 QKNorm 稳定 long-context 数值
推理侧
- MTP drafter head:每个模型配一个自回归 multi-token prediction 草稿头,cross-attention 主模型的 KV。4 层 Transformer-block 草稿头,结构:3 个 local + 1 个 global attention。E2B/E4B 草稿头维度 256,26B/31B 维度 1024。
- Efficient MTP:E2B/E4B 用 top-k + token cluster 把词汇表从 262k 减到 4096,加速 drafter 解码同时保留接受率。
- QAT(Quantization-Aware Training):提供 mobile int2/int4 + Q4_0 两种量化格式,并加 fp16 activation range 标量缩放,确保量化后稳定推理。
后训练与 Thinking mode
- 沿用 Gemma 3 的 post-training 流程,新增 thinking mode:模型可以先输出推理痕迹再回答,对 AIME / Codeforces / MATH-Vision 等推理密集任务提升显著。
- 数据过滤:去重、个人信息过滤、unsafe / toxic 标签、self-identification 噪声。
- PT vs IT 控制 token 不同:PT 用
<eos>,IT 用<turn|>。
关键实验与数据
Arena 人类盲评(截至 2026-06-19)
| Rank | Model | Elo | Open | Type | #params/#activated |
|---|---|---|---|---|---|
| 43 | Gemma 4 31B | 1451 ± 8 | yes | Dense | 31B |
| 61 | Gemma 4 26B-A4B | 1438 ± 8 | yes | MoE | 26B / 4B |
| 157 | Gemma 3 27B | 1366 ± 4 | yes | Dense | 27B |
31B 是 Arena 上"开源密集"第一名,与 1T+ / 几百 B 激活的 MoE 同台而不落下风。
静态基准(thinking mode)
| Metric | 31B | 26B-A4B | 12B | E4B | E2B | Gemma 3 27B |
|---|---|---|---|---|---|---|
| MMLU Pro | 85.2 | 82.6 | 77.2 | 69.4 | 60.0 | 67.6 |
| AIME 2026 no tools | 89.2 | 88.3 | 77.5 | 42.5 | 37.5 | 20.8 |
| LiveCodeBench v6 | 80.0 | 77.1 | 72.0 | 52.0 | 44.0 | 29.1 |
| Codeforces Elo | 2150 | 1718 | 1659 | 940 | 633 | 110 |
| SciCode | 43.0 | 40.0 | 38.0 | 24.0 | 21.0 | 21.0 |
| GPQA Diamond | 84.3 | 82.3 | 78.8 | 58.6 | 43.4 | 42.4 |
| BBEH micro avg | 74.4 | 64.8 | 53.0 | 33.1 | 21.9 | 19.3 |
| HLE | 19.5 | 8.7 | 5.2 | – | – | – |
| HLE with search | 26.5 | 17.2 | – | – | – | – |
| IFBench | 76.0 | 72.0 | 74.0 | 44.0 | 38.0 | 32.0 |
| IFEval | 98.9 | 98.5 | 97.2 | 96.7 | 94.6 | 90.4 |
| MMMLU | 88.4 | 86.3 | 83.4 | 76.6 | 67.4 | 70.7 |
| MRCR v2 8-needle 128k | 66.4 | 44.1 | 43.4 | 25.4 | 19.1 | 13.5 |
| Terminal Bench Hard | 36.0 | 14.0 | 18.0 | 8.0 | 3.0 | 4.0 |
| Tau2 airline | 75.0 | 76.0 | 75.0 | 52.0 | 31.0 | 39.0 |
| Tau2 retail | 86.4 | 85.5 | 77.6 | 67.1 | 34.6 | 6.6 |
| Tau2 telecom | 69.3 | 43.0 | 54.4 | 18.4 | 19.7 | 3.1 |
E4B 已经能打平或压过 Gemma 3 27B —— 同代"小模型追平上代中模型"的效应被坐实。
视觉基准
| Metric | 31B | 26B-A4B | 12B | E4B | E2B | Gemma 3 27B |
|---|---|---|---|---|---|---|
| MMMU Pro | 76.9 | 73.8 | 69.1 | 52.6 | 44.2 | 49.7 |
| MATH-Vision | 85.6 | 82.4 | 79.7 | 59.5 | 52.4 | 46.0 |
| MedXPertQA MM | 61.3 | 58.1 | 48.7 | 28.7 | 23.5 | – |
| InfographicVQA | 92.0 | 89.3 | 88.4 | 70.0 | 63.9 | 70.6 |
| OmniDocBench 1.5(↓) | 0.131 | 0.149 | 0.164 | 0.181 | 0.290 | 0.365 |
音频基准(CoVoST 翻译 / FLEURS ASR 转写)
相比 Gemma 3n 同尺寸:
- CoVoST 翻译相对提升 +12%(E2B)/ +10%(E4B)。
- FLEURS 转写相对提升 +17%(E2B)/ +12%(E4B)。
- 编码器磁盘占用从 390 MB(量化后)降到 87 MB(−78%)。
显存占用(32k 上下文,文本 only,int8 KV cache)
| Model | bf16 (GB) | Quantized (GB) | +KV (GB) |
|---|---|---|---|
| E2B | 4.6 | 0.8 | +0.05 |
| E4B | 9.0 | 2.3 | +0.14 |
| 12B | 24.0 | 7.65 | +0.28 |
| 26B-A4B | 52.0 / 7.6 active | 16.2 / 2.8 | +0.28 |
| 31B | 64.0 | 19.2 | +1.10 |
E4B 量化后只占 2.3 GB,一张中端消费级 GPU / 高端笔记本 NPU 即可跑;这是端侧 reasoning + 长上下文的可行性信号。
亮点与局限
亮点:
- 稀疏/密集 / 端侧 / 数据中心 / 多模态一次给齐:单一模型家族覆盖极广,工程团队选型简单。
- Encoder-free 12B 是真正的架构实验:去掉独立 vision / audio encoder 的设计,对下一代"全模态统一 tokenizer"的范式有参考价值。
- 长上下文 + 显存可落地的工程组合拳:local-global attention + pp-RoPE + KV cache sharing 的组合拳是当下最强开源实现之一。
- MTP 草稿头 + token cluster 高效解码:把 drafter 头做成单独组件并支持任意 draft 长度,加上词汇表压缩到 4096,对推理服务的吞吐增益显著。
- QAT + fp16 稳定缩放:移动端 + Q4_0 + QAT 同时提供,落地路径清晰。
- Arena 第 43 名,31B 是开源密集第一:这是"31B 也能跟千亿 MoE 掰手腕"的人类盲评背书。
局限 / 待验证:
- 预训练数据细节公开有限:cutoff 是 2025 年 1 月,但具体比例、token 数、版权合规细节在截取的 HTML 部分未披露。
- encoder-free 12B 的极限:35M 的视觉投影对比 550M ViT 是数量级下降,在细粒度视觉(OCR、文档细节、医学影像)上的细节能力需要更长评测才能下结论。
- MoE 仅一款 26B-A4B:缺乏中端(如 50–100B)MoE 数据点,无法判断"在更激进的 sparse 化下"质量边际。
- 262k 词表的 vocab efficiency:相比 Llama 3 / Qwen 3 的 128k / 152k 词表,更大词表的多语言 / 代码收益尚需第三方独立复现。
- thinking 模式在 safety / 越狱评估上的表现未在 abstract 节披露:报告偏能力侧,安全评估需查正文。
- Gemma 系列历史定位偏 Google 内部主流模型降级开源,商业条款(Apache 2.0)虽开放,但部分蒸馏 / 衍生条款仍待项目方明示。
对工程落地的启发
- 端侧 reasoning 不再需要"调用云":E4B 量化后 2.3 GB + Arena 1474 Elo 级别推理能力,意味着手机、edge box、车机可内嵌 reasoning & thinking。
- MTP 草稿头 + token cluster 是一个被低估的推理加速模式:做 LLM serving 的团队可以学 Gemma 4 的形式给自家模型补一个 drafter,吞吐量提升数倍。
- Encoder-free 多模态是值得探索的架构转向:如果简化 + 量化友好能换来 80%+ 的能力保留,那么未来 multimodal LLM 的工程范式会向"全部内化为 LLM embedding"演化。
- 5:1 local-global 是开源最强一把实用长上下文方案:比 vanilla 全局 attention 省 37.5% KV,配合 KV cache sharing 可撑 128k~1M 实用上下文。
- Arena 1451 vs 千亿 MoE 同台:选择"密集 31B"作为部署目标在多数中等规模推理任务中性价比已开始胜出。
- QAT 训练是真正可上生产的量化:post-training quantization 是行业基线,QAT 才是稳定 + 可重现 + 少 artifact 的长期方向。
与同方向工作的关系
- Gemma 3 / Gemma 3n:直接上一代。本文保留了 dense + per-layer embeddings / MoE / multimodal 三档的核心布局,关键升级是 encoder-free + thinking + 长上下文显存工程。
- Qwen 3 / Qwen 3.5:同代开源旗舰对手。本代 Qwen 3.5 在 Arena 上比 Gemma 4 大小都稍强(Qwen 3.5 397B-A17B 在 1444),但 Gemma 4 在"密集 31B + 端侧 E4B"上的覆盖更全。
- DeepSeek V3 / V4 / Kimi K2.5 / K2.6 / GLM 5 系列:同代千亿 MoE 开源对手。Gemma 4 没有动辄上 T 的 MoE 体量,但靠结构工程做出"小而精"的差异化。
- LLaMA 4 / Mistral / Phi-4:开源小模型路线。Gemma 4 在 reasoning(Codeforces Elo)和长上下文(MRCR v2 128k)维度明显领先。
- Whisper + LLM / Qwen2-Audio / Qwen2-VL:多模态拼装路线。Gemma 4 12B 的 encoder-free 路线是这条线的反方向——把 encoder 内化进 LLM。
- Apollo / Gemma-Multimodal 之前的 USM / AudioPaLM:都是 Google 内部多模态拼装路线的上一代工作,提供了 305M USM 编码器的来源。
适合谁读
- 开源 LLM 微调 / 部署团队:要把开源多模态 + reasoning 跑在消费级硬件上的人,Gemma 4 E4B / 12B 的量化 + 长上下文 + thinking 三件套最值得复刻。
- 推理服务工程师:MTP drafter + token cluster + local-global attention + QAT 是端到端的"开源推理模板"。
- 多模态研究员:encoder-free 12B 是一次范式实验,值得跟读看后续是否扩展到 26B / 31B。
- AI 产品决策者:Arena 1451 Elo 的 31B 给"中等规模自托管 reasoning 模型是否够用"提供了正样本。
- 不推荐纯学术 NLP 入门者:appendix 涉及 USM / pp-RoPE / MoE 路由策略等多个较新概念,需要先建立 backend 背景。
工程落地与核查(Jay)
事实核查
| 结论/数据 | 核查结果 | 备注 |
|---|---|---|
| "KV 占用最高削减 37.5%" | ⚠️ 需原文验证 | 37.5% 是全局层的最大削减幅度,并非所有层的整体数字。原文描述的是"全局 KV cache 占用降低最高 37.5%",解读中已说明是"全局层",但需注意这是最优情况下的局部数字,不是全模型平均值。 |
| "262k 词表" | ✅ 确认 | 与技术报告描述一致 |
| "E4B 量化后 2.3 GB" | ✅ 确认 | 表格数据与原文一致 |
| "Arena 31B 排名 43 / Elo 1451 ± 8" | ✅ 确认 | 日期标注为 2026-06-19 |
| "E2B/E4B 局部层之间 KV cache sharing" | ⚠️ 描述需修正 | 原文架构细节中 KV cache sharing 指的是"局部层之间共享 keys 作为 values",与 local:global ratio 是两套独立机制;解读文字中将两个概念略有混淆,但主体逻辑正确。 |
| "pp-RoPE(p=0.25)" | ⚠️ 截断来源 | p 值未在摘要/abstract 中出现,来源于技术报告正文,需确认该参数是否为默认值还是可配置超参。 |
| 预训练 cutoff 2025 年 1 月 | ✅ 确认 | 属合理假设,但 token 量、数据比例未披露,解读已标注"待验证"。 |
可读性精修建议
- "KV cache sharing(E2B/E4B 局部层之间共享)" 与 local:global 比例(4:1 / 5:1)属两套独立机制,前者是层间 key-value 复用,后者是 attention pattern 分布。建议将"结合 KV cache sharing(E2B/E4B 局部层之间共享)"一句单独成行,减少歧义。
- "E2B 用 4:1 local:global blocks,其余用 5:1" 中 "blocks" 一词建议统一为 "layers" 或 "layers ratio",避免与 Transformer block 概念混淆。
工程落地 Checklist
E4B 端侧部署(最成熟路径) - [ ] 量化选择:int4 QAT(Q4_0)是生产首选;fp16 activation range 缩放需在推理时对齐校准数据 - [ ] KV cache 实际占用实测:官方数字 2.3 GB(int4)+ 0.14 GB(KV)= 2.44 GB,峰值可能因 batch size 翻倍,需留 30% 余量 - [ ] MTP drafter 目前仅在 E2B/E4B 支持 top-k + token cluster 压缩,部署时确认 vocab 映射已正确加载 - [ ] 262k 词表需确认 tokenizer 实现与 vLLM / TensorRT-LLM 等 serving 框架兼容性
12B encoder-free 视觉部署(需谨慎) - [ ] 35M 视觉投影 vs 550M ViT:建议先用 DocVQA / OCR 专项数据集做影子测试,再决定是否替换现有 LLaVA-style pipeline - [ ] 音频直接投影路径:目前仅在 E2B/E4B 实现,12B 的音频能力依赖"音频侧:直接投影进 LLM embedding 空间",需实测 ASR/翻译质量
31B 数据中心推理(吞吐量优先) - [ ] KV cache sharing 在 31B 的局部层比例与 E2B/E4B 不同,需查技术报告确认具体比例 - [ ] MTP drafter 维度 1024 + 4 层,内存占用约 400M 参数,估算 overhead 并入峰值显存 - [ ] Arena 排名 43 对应 Elo 1451,假设 latency budget 为 500ms/token,单卡 A100 约 15-20 tok/s,需多卡 tensor parallel
长上下文(128k+)坑 - [ ] pp-RoPE 全局层 p=0.25 需确认是否影响外推能力,部分 rope 实现对 p 值敏感 - [ ] MRCR v2 8-needle 128k 测的是 66.4%(31B),意味着 33.6% 的 needle 检索失败,实用场景中长上下文召回率需单独测 - [ ] Terminal Bench Hard 36%(31B),说明复杂终端任务仍较弱,不要用于关键代码修改
多模态评测缺失提醒 - [ ] 视频输入能力:目前描述均为图像+音频,视频理解未在报告 abstract 覆盖,如需视频任务需查正文 - [ ] 音频仅支持 16kHz,后续如需 48kHz 高保真音频需确认是否支持或重采样
部署推荐路径(优先级排序)
- 立即可上:E4B QAT int4 量化版,用于 edge reasoning、客服机器人、轻量代码补全
- 3 个月内可上:31B + MTP drafter,配合 vLLM/TensorRT-LLM,替换中等规模推理集群中的 GPT-4 类闭源调用
- 值得跟读:12B encoder-free 视觉路径,如视觉质量达到 LLaVA-1.6 水平且量化友好,可成为下一代端侧多模态架构首选
- 长期观察:thinking mode + safety 评估,2026 年下半年预计会有更完整的 red-teaming 报告发布