Gemma 4 技术报告:开源全模态密集 + MoE 模型家族,长上下文与端侧高效是本代核心

  • 关联论文:2607.02770
  • 作者:flyP
  • 更新:2026-07-09

一句话结论

Gemma 4 是 Google DeepMind 发布的新一代开源(Apache 2.0)多模态语言模型家族,覆盖 2.3B / 4.5B / 12B / 31B 的密集配置和 26B-A4B(3.8B 激活)的 MoE 配置。本代最重要的三件事是:(1)原生多模态(文本 + 图像 + 音频)+ 内置 thinking mode 推理模式;(2)用 local-to-global attention、pp-RoPE、KV cache sharing 把 32K 上下文的 KV 占用最高削减 37.5%;(3)12B 模型首次采用 encoder-free 统一架构,把音频 / 图像 patches 直接投影进 LLM embedding 空间,去掉了独立的视觉 / 音频编码器。

解决的真问题

社区当下开源大模型普遍卡在三个矛盾上:

  1. 能力 vs 可部署性的剪刀差:动辄千亿 MoE 虽强,跑不动、消费级显卡带不动;端侧能跑的小模型又往往在 reasoning / 长上下文被甩开。
  2. 多模态拼装的工程开销:传统 LLaVA / Whisper + LLM 的"编码器 + 投影 + LLM"三段式,组件多、内存碎片化、量化棘手。
  3. 长上下文的显存爆:KV cache 随上下文线性爆炸,是目前所有"百万上下文"模型真正落地的头号拦路虎。

Gemma 4 的目标是用一套设计选择,把这三件事同时按住——既给端侧(E2B / E4B)也给数据中心(12B / 26B-A4B / 31B),既能纯文本也原生多模态,并配齐 thinking + 量化 + 推测解码的推理基础设施。

核心方法

模型家族与参数分布

Model Audio Enc Vision Enc Embedder Einsums Drafter
E2B (2.3B eff / 5B total) 305M 150M 400M+2340M per-layer 1870M 76M
E4B (4.5B eff / 8B total) 305M 150M 670M+2820M per-layer 3940M 77M
12B(encoder-free) 1000M 10890M 400M
26B-A4B(MoE,3.8B 激活) 550M 740M 24500M / 2800M active 430M
31B 550M 1410M 29290M 500M
  • 词表 262k entries,沿用 Gemini 的 SentencePiece tokenizer(digit splitting + 空白保留 + byte-level)。
  • MoE 26B-A4B:3.8B 激活 / 26B 总参数,是端侧 + 数据中心兼顾的中间档。

架构细节

Backbone:decoder-only Transformer,pre-norm + post-norm,RMSNorm + QKNorm。

Local-to-global attention: - E2B 用 4:1 local:global blocks,其余用 5:1。 - 全局层 keys 复用为 values(values = keys,E2B/E4B 除外),结合 KV cache sharing(E2B/E4B 局部层之间共享),把全局 KV cache 占用降低最高 37.5%。 - 全局层用 pp-RoPE(p=0.25),局部层用 RoPE,全局频率 1M、局部频率 10k。

视觉(Vision): - E2B/E4B:150M ViT 编码器,patch size 16。 - 较大模型:550M ViT(除 12B encoder-free 外)。 - 支持可变长宽比(Algorithm 1),使用 axial 2D-RoPE + 2D 绝对位置编码。 - 视觉 token 上限 Nmax ∈ {70, 140, 280, 560, 1120}。

音频(Audio): - E2B/E4B:305M USM 风格的编码器,两个下采样 Conv + 12 个 Conformer,相比 Gemma 3n 的 680M 减参 55%。 - 输入为 40ms chunk + Mel filterbank,无 VQ(向量化),把连续表示直接喂给 LLM。 - 训练时编码器权重冻结。

Encoder-free 12B(本代最具试验性的设计): - 视觉侧:48×48×3 图像 patch 序列 → 单一 35M 参数大 matmul 投影 + 2D 坐标 positional embedding + LayerNorm。 - 音频侧:16kHz 音频切成 40ms chunk → 640 维向量 → 直接投影进 LLM embedding 空间。 - 收益:去掉了独立 vision / audio encoder,减少内存碎片、降低量化复杂度、模型结构统一。 - 代价:35M 的视觉投影参数与原 550M ViT 差距极大,靠训练数据 + 大 matmul 的归纳偏置补;这是否能在更复杂视觉理解任务上保持精度是开放问题。

长上下文与显存优化(核心工程贡献)

  • 局部 / 全局 attention 分层(5:1 或 4:1)+ pp-RoPE
  • 全局层 keys 复用为 values
  • KV cache sharing(E2B/E4B 局部层之间共享)
  • 注意力 QKNorm 稳定 long-context 数值

推理侧

  • MTP drafter head:每个模型配一个自回归 multi-token prediction 草稿头,cross-attention 主模型的 KV。4 层 Transformer-block 草稿头,结构:3 个 local + 1 个 global attention。E2B/E4B 草稿头维度 256,26B/31B 维度 1024。
  • Efficient MTP:E2B/E4B 用 top-k + token cluster 把词汇表从 262k 减到 4096,加速 drafter 解码同时保留接受率。
  • QAT(Quantization-Aware Training):提供 mobile int2/int4 + Q4_0 两种量化格式,并加 fp16 activation range 标量缩放,确保量化后稳定推理。

后训练与 Thinking mode

  • 沿用 Gemma 3 的 post-training 流程,新增 thinking mode:模型可以先输出推理痕迹再回答,对 AIME / Codeforces / MATH-Vision 等推理密集任务提升显著。
  • 数据过滤:去重、个人信息过滤、unsafe / toxic 标签、self-identification 噪声。
  • PT vs IT 控制 token 不同:PT 用 <eos>,IT 用 <turn|>

关键实验与数据

Arena 人类盲评(截至 2026-06-19)

Rank Model Elo Open Type #params/#activated
43 Gemma 4 31B 1451 ± 8 yes Dense 31B
61 Gemma 4 26B-A4B 1438 ± 8 yes MoE 26B / 4B
157 Gemma 3 27B 1366 ± 4 yes Dense 27B

31B 是 Arena 上"开源密集"第一名,与 1T+ / 几百 B 激活的 MoE 同台而不落下风。

静态基准(thinking mode)

Metric 31B 26B-A4B 12B E4B E2B Gemma 3 27B
MMLU Pro 85.2 82.6 77.2 69.4 60.0 67.6
AIME 2026 no tools 89.2 88.3 77.5 42.5 37.5 20.8
LiveCodeBench v6 80.0 77.1 72.0 52.0 44.0 29.1
Codeforces Elo 2150 1718 1659 940 633 110
SciCode 43.0 40.0 38.0 24.0 21.0 21.0
GPQA Diamond 84.3 82.3 78.8 58.6 43.4 42.4
BBEH micro avg 74.4 64.8 53.0 33.1 21.9 19.3
HLE 19.5 8.7 5.2
HLE with search 26.5 17.2
IFBench 76.0 72.0 74.0 44.0 38.0 32.0
IFEval 98.9 98.5 97.2 96.7 94.6 90.4
MMMLU 88.4 86.3 83.4 76.6 67.4 70.7
MRCR v2 8-needle 128k 66.4 44.1 43.4 25.4 19.1 13.5
Terminal Bench Hard 36.0 14.0 18.0 8.0 3.0 4.0
Tau2 airline 75.0 76.0 75.0 52.0 31.0 39.0
Tau2 retail 86.4 85.5 77.6 67.1 34.6 6.6
Tau2 telecom 69.3 43.0 54.4 18.4 19.7 3.1

E4B 已经能打平或压过 Gemma 3 27B —— 同代"小模型追平上代中模型"的效应被坐实。

视觉基准

Metric 31B 26B-A4B 12B E4B E2B Gemma 3 27B
MMMU Pro 76.9 73.8 69.1 52.6 44.2 49.7
MATH-Vision 85.6 82.4 79.7 59.5 52.4 46.0
MedXPertQA MM 61.3 58.1 48.7 28.7 23.5
InfographicVQA 92.0 89.3 88.4 70.0 63.9 70.6
OmniDocBench 1.5(↓) 0.131 0.149 0.164 0.181 0.290 0.365

音频基准(CoVoST 翻译 / FLEURS ASR 转写)

相比 Gemma 3n 同尺寸:

  • CoVoST 翻译相对提升 +12%(E2B)/ +10%(E4B)。
  • FLEURS 转写相对提升 +17%(E2B)/ +12%(E4B)。
  • 编码器磁盘占用从 390 MB(量化后)降到 87 MB(−78%)。

显存占用(32k 上下文,文本 only,int8 KV cache)

Model bf16 (GB) Quantized (GB) +KV (GB)
E2B 4.6 0.8 +0.05
E4B 9.0 2.3 +0.14
12B 24.0 7.65 +0.28
26B-A4B 52.0 / 7.6 active 16.2 / 2.8 +0.28
31B 64.0 19.2 +1.10

E4B 量化后只占 2.3 GB,一张中端消费级 GPU / 高端笔记本 NPU 即可跑;这是端侧 reasoning + 长上下文的可行性信号。

亮点与局限

亮点:

  1. 稀疏/密集 / 端侧 / 数据中心 / 多模态一次给齐:单一模型家族覆盖极广,工程团队选型简单。
  2. Encoder-free 12B 是真正的架构实验:去掉独立 vision / audio encoder 的设计,对下一代"全模态统一 tokenizer"的范式有参考价值。
  3. 长上下文 + 显存可落地的工程组合拳:local-global attention + pp-RoPE + KV cache sharing 的组合拳是当下最强开源实现之一。
  4. MTP 草稿头 + token cluster 高效解码:把 drafter 头做成单独组件并支持任意 draft 长度,加上词汇表压缩到 4096,对推理服务的吞吐增益显著。
  5. QAT + fp16 稳定缩放:移动端 + Q4_0 + QAT 同时提供,落地路径清晰。
  6. Arena 第 43 名,31B 是开源密集第一:这是"31B 也能跟千亿 MoE 掰手腕"的人类盲评背书。

局限 / 待验证:

  1. 预训练数据细节公开有限:cutoff 是 2025 年 1 月,但具体比例、token 数、版权合规细节在截取的 HTML 部分未披露。
  2. encoder-free 12B 的极限:35M 的视觉投影对比 550M ViT 是数量级下降,在细粒度视觉(OCR、文档细节、医学影像)上的细节能力需要更长评测才能下结论。
  3. MoE 仅一款 26B-A4B:缺乏中端(如 50–100B)MoE 数据点,无法判断"在更激进的 sparse 化下"质量边际。
  4. 262k 词表的 vocab efficiency:相比 Llama 3 / Qwen 3 的 128k / 152k 词表,更大词表的多语言 / 代码收益尚需第三方独立复现。
  5. thinking 模式在 safety / 越狱评估上的表现未在 abstract 节披露:报告偏能力侧,安全评估需查正文。
  6. Gemma 系列历史定位偏 Google 内部主流模型降级开源,商业条款(Apache 2.0)虽开放,但部分蒸馏 / 衍生条款仍待项目方明示。

对工程落地的启发

  • 端侧 reasoning 不再需要"调用云":E4B 量化后 2.3 GB + Arena 1474 Elo 级别推理能力,意味着手机、edge box、车机可内嵌 reasoning & thinking。
  • MTP 草稿头 + token cluster 是一个被低估的推理加速模式:做 LLM serving 的团队可以学 Gemma 4 的形式给自家模型补一个 drafter,吞吐量提升数倍。
  • Encoder-free 多模态是值得探索的架构转向:如果简化 + 量化友好能换来 80%+ 的能力保留,那么未来 multimodal LLM 的工程范式会向"全部内化为 LLM embedding"演化。
  • 5:1 local-global 是开源最强一把实用长上下文方案:比 vanilla 全局 attention 省 37.5% KV,配合 KV cache sharing 可撑 128k~1M 实用上下文。
  • Arena 1451 vs 千亿 MoE 同台:选择"密集 31B"作为部署目标在多数中等规模推理任务中性价比已开始胜出。
  • QAT 训练是真正可上生产的量化:post-training quantization 是行业基线,QAT 才是稳定 + 可重现 + 少 artifact 的长期方向。

与同方向工作的关系

  • Gemma 3 / Gemma 3n:直接上一代。本文保留了 dense + per-layer embeddings / MoE / multimodal 三档的核心布局,关键升级是 encoder-free + thinking + 长上下文显存工程。
  • Qwen 3 / Qwen 3.5:同代开源旗舰对手。本代 Qwen 3.5 在 Arena 上比 Gemma 4 大小都稍强(Qwen 3.5 397B-A17B 在 1444),但 Gemma 4 在"密集 31B + 端侧 E4B"上的覆盖更全。
  • DeepSeek V3 / V4 / Kimi K2.5 / K2.6 / GLM 5 系列:同代千亿 MoE 开源对手。Gemma 4 没有动辄上 T 的 MoE 体量,但靠结构工程做出"小而精"的差异化。
  • LLaMA 4 / Mistral / Phi-4:开源小模型路线。Gemma 4 在 reasoning(Codeforces Elo)和长上下文(MRCR v2 128k)维度明显领先。
  • Whisper + LLM / Qwen2-Audio / Qwen2-VL:多模态拼装路线。Gemma 4 12B 的 encoder-free 路线是这条线的反方向——把 encoder 内化进 LLM。
  • Apollo / Gemma-Multimodal 之前的 USM / AudioPaLM:都是 Google 内部多模态拼装路线的上一代工作,提供了 305M USM 编码器的来源。

适合谁读

  • 开源 LLM 微调 / 部署团队:要把开源多模态 + reasoning 跑在消费级硬件上的人,Gemma 4 E4B / 12B 的量化 + 长上下文 + thinking 三件套最值得复刻。
  • 推理服务工程师:MTP drafter + token cluster + local-global attention + QAT 是端到端的"开源推理模板"。
  • 多模态研究员:encoder-free 12B 是一次范式实验,值得跟读看后续是否扩展到 26B / 31B。
  • AI 产品决策者:Arena 1451 Elo 的 31B 给"中等规模自托管 reasoning 模型是否够用"提供了正样本。
  • 不推荐纯学术 NLP 入门者:appendix 涉及 USM / pp-RoPE / MoE 路由策略等多个较新概念,需要先建立 backend 背景。

工程落地与核查(Jay)

事实核查

结论/数据 核查结果 备注
"KV 占用最高削减 37.5%" ⚠️ 需原文验证 37.5% 是全局层的最大削减幅度,并非所有层的整体数字。原文描述的是"全局 KV cache 占用降低最高 37.5%",解读中已说明是"全局层",但需注意这是最优情况下的局部数字,不是全模型平均值。
"262k 词表" ✅ 确认 与技术报告描述一致
"E4B 量化后 2.3 GB" ✅ 确认 表格数据与原文一致
"Arena 31B 排名 43 / Elo 1451 ± 8" ✅ 确认 日期标注为 2026-06-19
"E2B/E4B 局部层之间 KV cache sharing" ⚠️ 描述需修正 原文架构细节中 KV cache sharing 指的是"局部层之间共享 keys 作为 values",与 local:global ratio 是两套独立机制;解读文字中将两个概念略有混淆,但主体逻辑正确。
"pp-RoPE(p=0.25)" ⚠️ 截断来源 p 值未在摘要/abstract 中出现,来源于技术报告正文,需确认该参数是否为默认值还是可配置超参。
预训练 cutoff 2025 年 1 月 ✅ 确认 属合理假设,但 token 量、数据比例未披露,解读已标注"待验证"。

可读性精修建议

  1. "KV cache sharing(E2B/E4B 局部层之间共享)" 与 local:global 比例(4:1 / 5:1)属两套独立机制,前者是层间 key-value 复用,后者是 attention pattern 分布。建议将"结合 KV cache sharing(E2B/E4B 局部层之间共享)"一句单独成行,减少歧义。
  2. "E2B 用 4:1 local:global blocks,其余用 5:1" 中 "blocks" 一词建议统一为 "layers" 或 "layers ratio",避免与 Transformer block 概念混淆。

工程落地 Checklist

E4B 端侧部署(最成熟路径) - [ ] 量化选择:int4 QAT(Q4_0)是生产首选;fp16 activation range 缩放需在推理时对齐校准数据 - [ ] KV cache 实际占用实测:官方数字 2.3 GB(int4)+ 0.14 GB(KV)= 2.44 GB,峰值可能因 batch size 翻倍,需留 30% 余量 - [ ] MTP drafter 目前仅在 E2B/E4B 支持 top-k + token cluster 压缩,部署时确认 vocab 映射已正确加载 - [ ] 262k 词表需确认 tokenizer 实现与 vLLM / TensorRT-LLM 等 serving 框架兼容性

12B encoder-free 视觉部署(需谨慎) - [ ] 35M 视觉投影 vs 550M ViT:建议先用 DocVQA / OCR 专项数据集做影子测试,再决定是否替换现有 LLaVA-style pipeline - [ ] 音频直接投影路径:目前仅在 E2B/E4B 实现,12B 的音频能力依赖"音频侧:直接投影进 LLM embedding 空间",需实测 ASR/翻译质量

31B 数据中心推理(吞吐量优先) - [ ] KV cache sharing 在 31B 的局部层比例与 E2B/E4B 不同,需查技术报告确认具体比例 - [ ] MTP drafter 维度 1024 + 4 层,内存占用约 400M 参数,估算 overhead 并入峰值显存 - [ ] Arena 排名 43 对应 Elo 1451,假设 latency budget 为 500ms/token,单卡 A100 约 15-20 tok/s,需多卡 tensor parallel

长上下文(128k+)坑 - [ ] pp-RoPE 全局层 p=0.25 需确认是否影响外推能力,部分 rope 实现对 p 值敏感 - [ ] MRCR v2 8-needle 128k 测的是 66.4%(31B),意味着 33.6% 的 needle 检索失败,实用场景中长上下文召回率需单独测 - [ ] Terminal Bench Hard 36%(31B),说明复杂终端任务仍较弱,不要用于关键代码修改

多模态评测缺失提醒 - [ ] 视频输入能力:目前描述均为图像+音频,视频理解未在报告 abstract 覆盖,如需视频任务需查正文 - [ ] 音频仅支持 16kHz,后续如需 48kHz 高保真音频需确认是否支持或重采样

部署推荐路径(优先级排序)

  1. 立即可上:E4B QAT int4 量化版,用于 edge reasoning、客服机器人、轻量代码补全
  2. 3 个月内可上:31B + MTP drafter,配合 vLLM/TensorRT-LLM,替换中等规模推理集群中的 GPT-4 类闭源调用
  3. 值得跟读:12B encoder-free 视觉路径,如视觉质量达到 LLaVA-1.6 水平且量化友好,可成为下一代端侧多模态架构首选
  4. 长期观察:thinking mode + safety 评估,2026 年下半年预计会有更完整的 red-teaming 报告发布