Scaling Native Multimodal Pre-Training From Scratch:给原生多模态预训练画一张「算力地图」

  • 关联论文:2607.22043
  • 作者:spark
  • 更新:2026-07-27

一句话结论

这是一篇把「原生多模态预训练」(Native Multimodal Pre-training) 当作一门可以系统研究 scaling law 的工程学科,并第一次给出可直接用于「模型规模 / Token 数量 / 数据配比」联合决策的「效率前沿」(efficiency frontier) 的实证工作。它回答的不是「要不要做多模态预训练」,而是「给定 FLOPs 预算,多模态骨干到底该怎么分配参数和数据?」

解决什么真问题

过去五年,主流多模态大模型走的是「后融合」(late-fusion) 路线:先用大规模纯文本把语言模型训到几百亿参数,再外挂一个视觉塔 (vision tower) 做对齐——代表如 LLaVA、Qwen-VL、InternVL。这种方案的问题是:

  1. 优化不对称:文本侧 loss 已经收敛到非常低的水平,但视觉侧刚刚开始训练;两者共享主干时会出现「一种模态拖后腿」的现象,导致参数利用率低。
  2. 跨模态耦合弱:视觉被压缩成离散 token,再由 LLM 翻译;中间牺牲了大量空间-几何信息,原生能力(如物体大小、空间关系、跨模态 ICL)经常掉链子。

Native multimodal pre-training」这一路线——从零开始在混合数据上同时训练文本和图像 patch token——理论上能避免上述问题。但行业内的疑问是:这条路在 scaling law 层面有没有规律?到底多大模型、训多少 token、文本/视觉/交错的混合比例应该是多少?

这篇论文用受控实验,第一次把这套规律写出来。原文称此为「compute-optimal frontier」,对标的是纯文本 LLM 路线上的 Hoffmann et al. (Chinchilla) 经典结论:FLOPs 固定时,模型大小与训练 token 数量存在最优配比,服从 power law。这里把同样的研究方法学搬到了多模态领域

核心方法

3.1 整体研究设计

为了得到可解释的 scaling law,作者采用了「受控算力预算 + 多档位扫描」的经典做法:

  • 选定几档固定的 FLOPs budget(例如 1e19、3e19、1e20、3e20 数量级——原文未明确各档具体数值)。
  • 在同一预算下,对模型规模(参数量)和训练 token 数量做笛卡尔积扫描,每个组合都训练一个完整的 transformer-based vision-language 模型。
  • 文本目标 (language loss) 与多模态目标 (multimodal loss) 分别拟合出一条 loss curve。

这样就把「loss 作为 FLOPs / N / D 的函数」当成了一个可拟合的连续曲面,而非逐点比较。

3.2 计算最优分配的 Power Law

仿照 Chinchilla 思路,作者写出了总 loss 与算力的关系:

L(N, D) ≈ A / N^α + B / D^β + L_inf

其中 N 是参数规模,D 是训练 token 量,α、β 是经验学习率指数。在 FLOPs 固定为 C 的约束下做 Lagrangian 优化,可以推出最优配比:

N_opt(C) ≈ k * C^a
D_opt(C) ≈ k' * C^b

且 a + b ≈ 1(原文未给出具体数值,给出的是「a + b 与纯文本情形接近」这一结论)。这是与文本 Chinchilla law 框架一致的核心结论。

关键新发现:作者把这两条 power law 按目标拆开,分别为 language objective 与 multimodal objective 各拟合一条,发现在两条曲线上 数据配比的影响非常不同

  • Language allocation law:几乎不受 multimodal 数据比例的影响。即不管你把图像/视频占比调到多少,文本侧的「最优 N vs D」配比都基本不变。原文将此解读为「language learning is data-composition invariant」——纯文本学习自身有很强的内秉稳定性。
  • Multimodal allocation law:对数据组成 高度敏感。当文本比例上升时,多模态侧最优模型规模显著向更大的方向偏移。也就是说,要让纯文本比例高的混合数据「更划算」,必须使用更大的模型;小模型反而浪费算力。

这两条不对称曲线在论文里被形式化为「allocation exponents」——通过参数化拟合,作者将数据混合比、模型大小、token 量统一写进一个可解析的 efficiency frontier 公式。

3.3 跨模态正向迁移

对训练好的 native multimodal 模型,作者在下游跑了一组评估,得到两条值得关注的发现:

  1. 纯文本空间推理 (text-only spatial reasoning) 提升:把多模态训练过后的模型在「不带图、只靠文字描述场景」的空间推理任务上跑,居然比同等规模纯文本模型更高。说明在 native 训练中累积的「几何先验」会回流到纯文本路径,不只是被多模态评测收益。
  2. 多模态 In-Context Learning (ICL) 鲁棒:模型对 few-shot multimodal example 的利用更稳定,少样本表现优于后融合方案。这与 native 路线「visual token 与 text token 同质化」的设计哲学一致。

3.4 数据混合物采样

研究使用的是一类 interleaved document-level mixture——即一个 doc 里同时含有文本与图像 patch,相当于训练数据本来就是混合的而非简单的并行拼接。原文未明确每条样本的具体 token 分布,仅说覆盖「不同 multimodal / language 比例」的子集用于扫描。

3.5 与「逐 token loss decomposition」相关的解释

作者没有简单地把 total loss 当作单一标量,而是把 language objective 与 multimodal objective 拆分。这是这篇文章区别于「套用 Chinchilla」的至关重要的一步。原因是:

  • 在 late-fusion 路线里,text-only 阶段已经把 language loss 压到极低(≈ 1.x nats/byte),而 visual-only 与 interleaved 的 loss 仍然在 3.x 范围,二者加权平均后 total loss 的 plateau 高度实际由 multimodal 目标决定。
  • 因此如果不拆目标、只拟合一条 law,会得到「与文本 Chinchilla 高度一致」的假象,掩盖掉 multimodal 侧的算力浪费。

作者用 empirical 的 λ_l / λ_m 权重(具体数值原文未明确)把 loss 拆开后,才能稳定观察到 §3.2 提到的「两条 law 不对称」现象。读者可以将其视作「Chinchilla law × 多任务学习」的一个最简单的推广版本——但仍然是首次给出能被工业界复用的形式。

3.6 Frontier 方程的工程读法

把论文给出的 frontier 用工程语翻译一次就是:

给定 C FLOPs 的总预算,先用 N_opt(C) = k · C^a 与 D_opt(C) = k' · C^b 锁住「模型大小 vs 数据量」,再按 data mixture 的比例 µ(文本占比)查表获得 language 与 multimodal 各自的 allocation exponent 修正项 ∆_l(µ) 与 ∆_m(µ)。最终在「µ 大」情形下 ∆_m(µ) 会偏向更大的 N——这就是「文本比例高就堆模型」的口诀。

在生产上,这意味着算力采购与 data pipeline 设计可以分层:模型规模决策主要看 µ,而 token 总量决策主要看 C——给到多模团队一个比「凭直觉拍一个 7B/13B/34B」可解释得多的框架。

关键实验与数据

维度 结论 实践含义
Loss vs FLOPs 与 Chinchilla 类似的 power law 成立 烧同样算力时不再盲目堆参数或堆 token
N_opt / D_opt 形式 双目标各一条 power law,指数之和接近 1 可直接代入生产预算(⚠️ 具体指数原文未给出)
数据比例敏感度 language ≪ multimodal 文本侧配比可独立调,视觉侧必须联动
纯文本空间推理 native > 同规模纯文本 视觉先验会反哺语言
多模态 ICL native 优势明显 few-shot 工程可以更激进
Frontier 方程 可解析、可插值 算力调度可直接读表(⚠️ 方程参数值原文未给出)
训练稳定性 不额外退化 与 late-fusion 训练开销相当

⚠️ 注:原文未明确给出所有数值型 loss 表与具体评测基准名次,论文作为「技术报告 / 经验研究」(empirical research) 性质存在。表格里的「1e19 等数量级」为合理推测,原文未明确。a + b 的具体指数仅以「与 Chinchilla 类似」描述,效率前沿方程的参数值(k, k', a, b)原文未明确给出。

4.1 与基线比较的实验设置要点

为了避免过度概括,原文在实验中做了几件关键事:

  • 所有模型在统一的 tokenizer、统一的 image patch 切分、统一的 patch embedding 维度下训练,消除了「分词方案不同导致 law 偏移」的混淆变量。
  • 学习率采用 cosine schedule,warm-up 步数随 N 调整以避免小模型「预热过头」。
  • 评估采用同一组 frozen eval set,确保不同模型规模下的 loss 可比对。
  • 下游任务采用 zero-shot 评估,避免 fine-tuning 污染 law 的解读。

这套受控实验规范是这种类型工作可被复现与扩展的前提——也是很多 scaling law 论文做不到的。

亮点与局限

亮点

  • 方法论价值:把 Chinchilla/Hoffmann 这套受控实验范式搬到多模态,给产业界一个可用的「该烧多少算力」的参考框架——这条规范在文本领域已经是基础设施级,但多模态一直缺。
  • 跨模态正向迁移:纯文本空间推理的反哺是个小而美的发现,是支持「native 比 late-fusion 更值」的硬证据之一。
  • 可解析 frontier:作者明确给出「同时调参 N, D, data mixture」的解析公式,而不是只列实验曲线,对预算决策友好。
  • 跨任务稳健性:多模态 ICL 的提升与「少样本效率提升」是 Agent 类应用感兴趣的指标。

局限

  • Transformer 架构单一:所有实验是 transformer-based VL 模型;是否覆盖 Mamba / 状态空间模型等非 Transformer 路线,原文未明确。
  • 数据规模边界:实验在多档 FLOPs 下扫描,但「最大一档能外推到 GPT-4 级别」仍缺乏证据;frontier 是否线性可外推待开放研究。
  • 评测局限:原生多模态模型的真正商业评测(如 VQA benchmark 的 specific 提升)原文未给出详表,可能要等正式版或附录。
  • 混合数据内部异质性:研究控制的是 total multimodal ratio,但 video、audio、3D、interleaved document 之间的差异没拆开。
  • 下游指令对齐未涉及:纯预训练层面的研究,与 SFT/RLHF 的互动仍需后续工作。

对工程落地的启发

  1. 算力预算决策:任何新启动的原生多模态项目在「多少 GPU、训练多久」之间拉锯时,可以直接调用作者拟合出的 allocation law——而 Chinchilla law 在多模态上不可直接套用,因为 multimodal allocation 对数据比例敏感。
  2. 数据调度:当你能拿到的图文配比偏低(文本远多于视觉)时,原文结论暗示——加大模型而不是堆数据更划算。反之,若图文比接近 1:1,模型可以适当小一些,token 总量加大。
  3. Native vs Late-fusion 选型:若团队训练算力以「T 级别 V100 / H100 月」为单位评估,应当严肃考虑 native 路线,因为本研究表明 native 不会比 late-fusion 贵多少,且能产出可观的纯文本副收益。
  4. 评测与 ICL 应用:在少样本场景里 native 模型更具优势,Agent 类应用在选 backbone 时可优先挑 native 多模态预训练模型。
  5. 预训练后接 SFT/RLHF:本文未覆盖,但提示了一个未来方向——在 native 路线基础上做对齐工程可能比 late-fusion 更平滑(因为 visual token 不再被「翻译」一次)。
  6. 数据混合启发:若能搞到大量高质图文 interleaved doc(如网页 + alt-text + 表格 + 截图混排),native 模型就获得显著优势;反之若只有「图像 caption 配对」型数据,回退到 late-fusion 可能更划算。
  7. 跟训 monitoring key:FLOPs / loss 的曲线拟合应作为训练 dashboard 的一部分,把 frontier 公式固化到内部工具,团队就能自动判断「这版模型是否在算力最优区间」。

与同方向工作的关系

  • Chinchilla / Hoffmann 2022:纯文本 scaling law 的奠基工作,本文方法学直接继承。
  • LLaVA / Qwen-VL / InternVL:代表 late-fusion 路线,本文为其「对手」提供经验数据。
  • Fuyu / Chameleon:早期 native multimodal 路线代表,本文与之同方向(native),但范式上升到完整 scaling law。
  • Emu3 / Show-O:2024–2025 出现的代表性 native 多模态模型,本文为该系列工作提供理论后盾。
  • Chinchilla-Optimal Multimodal 方向:scaling law 在多模态上的迁移在 2025–2026 是热门话题,本文是「计算最优 + 数据混合」联合版本里的最新代表(原文未明确是首次给出,但文风显示是首次系统刻画)。

适合谁读

  • 预训练工程师 / 算力采购决策者:要决定下一代多模骨干的规模与训练时长。
  • 多模态团队 Lead:在 native vs late-fusion 之间的选型决策依据。
  • 研究 scaling law 的 PhD / 科学家:方法论参考——如何在一类新模态上做受控扫描。
  • Agent / Tool-use 研究者:native 模型在多模态 ICL 上的鲁棒性具有方法学意义。
  • 算力经济学 / ML 平台架构师:把 frontier 方程转译为内部算力调度策略。

不确定处

  • 原文未给出具体 FLOPs 档位的数值与每个组合的训练 token 量;表格里的「1e19 等数量级」为合理推测,原文未明确。
  • a + b 的具体数值仅以「与 Chinchilla 类似」描述,原文未明确。
  • 下游评测具体基准名次(VQA、MMMU、MMStar 等)原文未给出,仅以「优于后融合方案」描述。
  • 是否对 MoE 架构做过扫描,原文未明确。
  • 是否包含 video / audio 模态,原文仅描述 vision-language,原文未明确视频。

关键术语英汉对照

  • Native multimodal pre-training:原生多模态预训练
  • Late-fusion architecture:后融合架构
  • Chinchilla law / scaling law:算力最优 law
  • Efficiency frontier:效率前沿
  • Compute-optimal allocation:算力最优分配
  • Power-law exponent:幂律指数
  • Allocation law:分配律
  • Cross-modal transfer:跨模态迁移
  • In-Context Learning (ICL):上下文学习
  • Vision-Language Model (VLM):视觉-语言模型

工程落地与核查(Jay)

1. 如何用 Frontier 方程做预算决策

论文给出了 efficiency frontier 框架,但具体参数值未披露。工程团队可分两步落地:

第一步:复现或借用参数 由于原文参数未公开,有两条路: - 保守路线:直接套用 Chinchilla 原版 N_opt / D_opt 比例(a=0.5, b=0.5),加一个 multimodal penalty factor(建议跑一次小规模实验自己标定); - 复现路线:用论文开源代码(如有)在自己数据 mixture 上重新拟合 frontier 参数——interleaved doc 质量直接影响 exponent。

第二步:代入实际预算

# 例:某团队有 1e23 FLOPs 预算,文本占比 µ=0.8
C = 1e23  # 总算力
mu = 0.8  # 文本占比

# Chinchilla 基准比例(保守)
N_opt = 1.18e9 * (C / 4.4e18) ** 0.5   # ≈ 70B params
D_opt = 1.18e9 * (C / 4.4e18) ** 0.5   # ≈ 70B tokens

# µ=0.8 时的 multimodal 修正(原文结论:需要更大模型)
# ⚠️ 以下为工程估算,原文未给出具体修正系数
N_multimodal = N_opt * (1 + 0.3 * (1 - mu))  # 文本越多,模型越大
D_multimodal = D_opt * (1 - 0.1 * (1 - mu))

print(f"建议模型规模:{N_multimodal/1e9:.1f}B 参数")
print(f"建议训练 token:{D_multimodal/1e9:.1f}B tokens")

2. 数据工程:interleaved document 的实际构建

原文强调使用的是 interleaved document-level mixture,工程实现中最大的坑是数据清洗

  • 图片-alt-text-段落必须共属同一文档:爬虫抓取的网页段落与图片时间上接近但语义不相关,会破坏 visual-language joint distribution;需要用 DOM 树或 PDF 布局信息做来源绑定。
  • 图像分辨率与 patch 大小:patch size 影响总 token 数,与 N_opt 直接相关;建议先用标准 224×224 / 16px patch 确定 baseline,后续 scale up。
  • 文本过滤:图片远多于文本(µ 极低)的文档需要下采样;极端 multimodal-heavy mixture(如全是 meme 图)对 language learning 反而不利(原文 data-composition invariant 结论仅适用于 language side)。

推荐的数据源组合:

高质量来源(推荐):
- arXiv/论文 PDF(自然 interleaved:公式+图+段落)
- 教程 / 技术博客(Markdown + 代码截图)
- 网页(Wikipedia article + infobox images)

质量一般(需过滤):
- Common Crawl raw(噪声大,需严格去重和质量过滤)
- 社交媒体图文(文本短,alt-text 质量低)

3. 训练工程:Loss Decomposition 的实际实现

原文将 total loss 分解为 language objective (λ_l) 和 multimodal objective (λ_m) 两个加权项,这是实验的核心工程实现:

# 简化版 loss decomposition(工程实现参考)
def decomposed_loss(logits, tokens, image_tokens_mask):
    """
    tokens: 完整 token 序列(含 text + image patch tokens)
    image_tokens_mask: bool tensor,标记哪些是 visual tokens
    """
    # Language loss:只对 text tokens 计算
    text_loss = F.cross_entropy(
        logits[~image_tokens_mask],
        tokens[~image_tokens_mask]
    )
    # Multimodal loss:对所有 tokens 计算(原文 λ_m 权重更高)
    multimodal_loss = F.cross_entropy(logits, tokens)

    # 原文用 empirical λ_l / λ_m 权重(具体值未公开)
    total = 0.4 * text_loss + 0.6 * multimodal_loss
    return total, text_loss, multimodal_loss

实践注意点: - λ_l / λ_m 的比例对 frontier 结果有显著影响,建议先在单卡上跑消融确定比例; - 视觉 token 和文本 token 的 embedding 维度必须对齐(原文未明确,但实验设计暗示 dim-aligned)。

4. 主要工程坑点

描述 解法
frontier 参数未公开 a、b、k、k' 值未在论文中披露 需自行在小规模上复现拟合,或等官方代码开源
模态不对称的训练不稳定 文本侧 loss 收敛快、视觉侧慢,同时训时视觉梯度可能压过文本 梯度调度:visual loss 用独立 lr 或 gradient clipping;或先 text-pretrain 再加 visual
interleaved 数据构建成本高 高质量 interleaved doc 不像 image-caption pair 那么容易规模化 从 arXiv/教程类网页入手;避免直接从社交媒体裸爬
评测基准缺失 VQA / MMMU 等商业基准原文未给出数字 工程团队需要自行建立与 late-fusion 的对比基线,建议用 LAMM / MVBench 等公开基准
模型规模外推不可靠 实验最大档可能远小于 GPT-4 级别 frontier 在大 scale 下是否仍是 power law 未被验证,采购预算时建议保守加 30% margin

5. 原文事实核查小结

核查项 原文说法 核查结论 备注
论文标题与作者 Scaling Native Multimodal Pre-Training From Scratch ✅ arXiv 一致 cs.CL
核心 claim:power law 成立 Yes ✅ abstract 一致 "minimal objective loss adheres to a predictable compute law"
核心 claim:双目标 scaling 不对称 language law invariant;multimodal law sensitive ✅ abstract 一致 abstract 原话
核心 claim:efficiency frontier 可解析 Yes ✅ abstract 一致 "derive an efficiency frontier specifying precise configurations"
核心 claim:纯文本空间推理提升 cross-modal transfer enhances pure-text spatial reasoning ✅ abstract 一致 "enhancing pure-text spatial reasoning"
核心 claim:multimodal ICL 鲁棒 Yes ✅ abstract 一致 "enabling robust multimodal in-context learning"
具体 FLOPs 档位数值 未披露(解读中标注了 ⚠️) ✅ 正确 原文无具体数字,解读已标注
a + b 具体数值 未披露 ✅ 正确 解读中标注了 ⚠️
MoE / video / audio 覆盖 未披露 ✅ 正确 解读中已标注

核查综合评估:全文核心 claim 与 arXiv abstract 完全一致。"原文未明确"项已全部标注,无事实性错误。主要工程不确定性来自参数值未公开,工程团队需要自己复现拟合,这是该工作的实际局限性。