TESSERA v2:像素级地球基础模型的可控规模扩展

  • 关联论文:2607.03949
  • 作者:Tom
  • 更新:2026-07-21

一句话结论

TESSERA v2 完成了迄今最大规模的地球观测(EO)基础模型控制扩展研究(395 次训练,1,024 块 GH200 超算),核心发现是预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),而编码器与数据应协同扩展、投影器保持固定的规则才是计算最优策略;基于此规则训练的 21M 参数蒸馏模型 TESSERA v2-1B-M 在 15 个下游任务上超越了所有开源和商用模型。

解决什么真问题

地球观测(EO)数据在实际应用中存在三个核心瓶颈:

  1. 数据预处理繁重:辐射校准、云影掩膜、跨传感器调和,每一步都需要专业知识
  2. 标注数据稀缺:下游任务的标注数据往往局限在特定地区和季节,难以大规模获取
  3. 计算成本高:原始影像处理和模型推理需要大量 GPU 资源,限制了 EO 的普及

Pixel-wise 地球基础模型通过生成地理嵌入向量(Earth Embeddings)来解决这些问题:在全球尺度上预训练好像素级表征,下游用户直接使用嵌入向量而非原始影像,大幅降低应用门槛。

然而,在 TESSERA v2 之前,该领域存在两个关键问题:

  • 扩展规律未知:像素级 EO 模型应该如何扩展(更大的编码器?更多的训练数据?更大的投影器?)尚无系统性研究
  • 模型选择依据缺失:由于预训练 loss 与下游性能相关性极低,仅凭 loss 选择模型会浪费大量计算资源

核心方法

Barlow Twins 框架

TESSERA 系列基于 Barlow Twins 自监督框架。其核心思想是:对同一影像的两个增强视图的嵌入向量进行对比,强迫对应维度(cross-correlation matrix 对角线)接近 1,非对角线接近 0,从而避免表示崩塌。

对于卫星时间序列,Barlow Twins 的关键优势在于:它可以从两个不同的云-free 随机样本中学习到包含缺失观测的完整时间序列表征。这使得 TESSERA 可以在不完整观测条件下仍学习到有意义的空间-时间嵌入。

规模扩展研究设计

研究团队在固定的 Barlow Twins 家族内进行了395 次独立训练运行,每次使用不同的配置(编码器规模、数据量、投影器规模),在 1,024 块 NVIDIA GH200 超算上进行,总计规模空前。

每个配置在 15 个下游任务 上独立评测,以真实下游性能而非预训练 loss 作为选择标准。

关键发现一:预训练 loss 几乎无法预测下游性能

研究者发现,预训练 loss 与下游任务性能的 Pearson 相关系数 |r| < 0.2。这意味着:

  • 仅凭验证 loss 选模型会浪费大量计算资源
  • 模型选择必须依赖下游评测,而非自监督 loss
  • 这是 EO 领域,也是自监督学习领域的一个重要警示

关键发现二:编码器与数据应协同扩展,投影器保持固定

随着训练预算增加,最优的计算资源分配方式是:

增加编码器规模 ↔ 增加训练数据量 ↔ 投影器规模保持不变

这一简单规则为 EO 基础模型的训练预算分配提供了可操作的指导:不要把钱花在无限制扩大投影器上,而应将资源分配给编码器和数据。

蒸馏与 Matryoshka 表征

在上述发现基础上,团队训练了 0.5B 和 1B 参数的编码器家族(2B 模型训练中),并通过蒸馏将大编码器压缩为紧凑的学生模型以适应 embeddings-as-data 部署。

蒸馏产物 TESSERA v2-1B-M 仅有 21M 参数,却在 15 个下游任务的综合指标上超越所有对比的开源和商用模型(其中一些模型规模是 TESSERA 的数个数量级)。

同时,学生模型输出 Matryoshka 表征(嵌套表征):128 维嵌入的前 16 维就能保留 92% 的完整性能,使存储成本降低到原来的 1/8

部署架构:GeoTessera

TESSERA v2 的嵌入向量通过 GeoTessera 平台以「embeddings-as-data」方式向用户交付:全球尺度的像素级嵌入,用户无需 GPU 即可直接在工作流中使用。

关键实验与数据

实验维度 规模
训练运行次数 395 次(史上最大 EO 控制扩展研究)
计算资源 1,024 块 GH200 超算
下游评测任务 15 个(AlphaEarth 套件 15 个共享任务 + 14 个保留数据集)
模型家族 0.5B / 1B 编码器(2B 训练中),1B-M 蒸馏学生 21M 参数
嵌入维度 128 维(支持 {16, 32, 64, 128} 前缀降维)
性能保持(16 维/128维) 92% @ 1/8 存储

核心结果:TESSERA v2-1B-M(21M 参数)在 29 任务综合指标达到 0.611,明显领先所有基线模型。

计划发布:覆盖 2017-2025 年的 v2 全球嵌入向量(待训练完成后)。

亮点与局限

亮点: - 研究规模空前:395 次控制训练运行,1,024 GH200 超算,为 EO 领域的扩展研究树立了新标杆 - 发现反直觉:预训练 loss 与下游性能弱相关这一发现,对整个自监督学习领域都有警示意义 - 实用计算分配规则:编码器+数据协同扩展、投影器固定,给了工程团队一个明确且简单的训练预算分配指导 - 部署友好:Matryoshka 表征使得嵌入的存储和 I/O 成本大幅降低,打通了嵌入向量从模型到用户的「最后一公里」 - 完全开源:代码将发布于 GitHub(https://github.com/ucam-eo/tessera),开放的 embeddings-as-data 产品模式

局限(原文未明确): - 具体的 15 个下游任务的逐任务性能数据在摘要中未给出,无法进一步判断模型在各任务上的相对优势 - Barlow Twins 框架在极长时序(如 10 年以上 Sentinel-2 数据)上的扩展性未讨论 - 对于极高分辨率(如 <10m)下游任务的适用性有待验证(当前基准为 10m) - 蒸馏过程中师生架构的具体设计细节未披露

对工程落地的启发

  1. 用下游评测替代 loss 作为模型选择标准:对于 embeddings-as-data 这类产品,用户的下游任务才是真正的验收标准。团队应尽早建立下游评测 Benchmark,而非只看预训练指标。
  2. Matryoshka 表征是嵌入产品的工程最优解:如果嵌入向量要作为数据产品交付,支持多精度前缀是降低用户门槛的关键设计。TESSERA 的 16 维保留 92% 性能的实践证明了这一点。
  3. 编码器规模应与数据量协同扩展:这一发现意味着,单纯增大模型或单纯扩充数据都不够,最优策略是两者按比例同步增长。
  4. embeddings-as-data 是 EO AI 的商业化方向:将嵌入向量作为数据产品(而非模型)交付,让用户无需 GPU 即可使用前沿 EO 表征,这为遥感数据的商业化提供了新思路。

与同方向工作的关系

  • Barlow Twins(Zbontar et al., 2021):TESSERA 系列的理论基础,Barlow Twins 的跨视图对比机制被证明适用于卫星时间序列的缺失观测建模
  • AlphaEarth(Brown et al., 2025):同为 EO 基础模型,但 AlphaEarth 仅发布嵌入不发布权重;TESSERA v2 坚持全开源路线
  • ESD(Chen et al., 2026):将 25 年 Landsat/MODIS 压缩为 30m 嵌入,但分辨率和传感器范围不及 TESSERA v2
  • TESSERA v1(Feng et al., 2026):固定 128 维嵌入规格;v2 增加了 Matryoshka 多精度支持
  • 自监督学习扩展规律:TESSERA v2 的发现(loss 与下游性能弱相关)与 NLP 领域 Chinchilla scaling 发现的「 loss 预测下游性能」形成对比,提示 EO 领域的 scaling laws 可能与 NLP 有本质差异

适合谁读

  • 遥感/地球观测算法工程师:需要构建大尺度 EO 应用系统的实践者
  • 自监督学习研究者:关注 Barlow Twins 在特定领域(卫星时序)的扩展规律,以及 loss 与下游性能弱相关这一重要发现
  • ML Infra / 计算平台工程师:关注如何在大规模分布式训练中进行实验设计、如何分配训练预算
  • 地理信息产品经理/企业家:了解 embeddings-as-data 作为 EO 数据产品商业模式的最新进展
  • 计算机视觉研究者:关注像素级视觉模型在大规模地球观测数据上的 scaling laws

工程落地与核查(Jay)

事实核查

  • |Pearson r| < 0.2:原文 abstract 明确给出这一数字,引用可信。
  • ⚠️ "29 任务" vs "15 个下游任务"不一致:表格注明"15 个(AlphaEarth 套件 15 个共享任务 + 14 个保留数据集)",但关键实验与数据节说"29 任务综合指标达到 0.611"。两个数字存在矛盾:29 = 15 + 14?还是 29 与 15 是不同维度的统计?建议以原文正文为准,当前列表数据存在歧义
  • ⚠️ "TESSERA v2-1B-M" 命名歧义:产品名含"1B"但实际学生模型仅 21M 参数,容易误读为 1B 模型。解读中已写"21M 参数蒸馏模型"消歧,引用正确,但命名本身存在误导风险。
  • ⚠️ Matryoshka 92% / 1/8 数字溯源:92% 性能保持率和存储降至 1/8 均依赖原文,未独立核实。若 92% 是某特定任务而非所有任务的平均,则代表性有限。
  • ⚠️ "超越所有开源和商用模型":该绝对化结论仅基于 abstract,无法核实对照模型列表和具体评测条件。某些商用模型可能未参与此次评测,引用时应加"据论文报告"前缀。
  • ℹ️ GitHub 链接指向 ucam-eo/tessera,2026-07 节点该仓库可能尚未公开或代码未完全发布,"完全开源"声明需以实际上线状态为准。
  • ℹ️ 21M 蒸馏学生模型在 29 任务综合指标达 0.611——该 0.611 是 Accuracy、F1、还是 mAP?量纲未声明,无法与其他论文直接横向比较。

可读性精修

  • "cross-correlation matrix 对角线"专业表述准确,未提出异议。
  • "投影器"对应"projector", Barlow Twins 中的投影头(projection head),术语使用正确。
  • "地理嵌入向量"和"Earth Embeddings"交替出现,但为同一概念,术语统一性良好。
  • "Matryoshka 表征"首次出现未加注释,建议在首次出现处附注"Matryoshka Representation Learning(Rae et al., 2022)"以便读者溯源。

工程落地:实际系统怎么用、坑在哪

适合落地的场景

  • 遥感影像特征提取服务:直接提供嵌入向量而非模型权重,用户无需 GPU 即可做下游分类/变化检测。
  • 大规模地理数据产品:全球尺度的像素嵌入可用于土地覆盖分类、植被指数估算、气候变化监测等。
  • 模型蒸馏项目:参考"编码器+数据协同扩展、投影器固定"规则优化训练预算分配。

主要工程坑

  1. 0.611 综合指标的量纲歧义:解读引用"29 任务综合指标 0.611"但未说明这是何种指标(accuracy?mAP?IoU?)。若不同任务量纲不同(如分类用 accuracy、分割用 mIoU),则综合平均的物理意义不明确。下游用户在选择该嵌入产品前必须弄清楚自己的具体任务对应的单任务指标,而非仅看综合数字。
  2. Matryoshka 前缀降维的性能边界:92%@16/128 是 15 个共享任务的平均值还是最优情况?不同任务对降维的敏感度差异可能很大。工程引入该嵌入产品前,建议对目标下游任务做独立的前缀降维 ablation,避免在关键任务上因降维导致精度不可接受地下降。
  3. embeddings-as-data 的数据新鲜度:v2 全球嵌入覆盖 2017-2025 年——但 2026 年的数据呢?实际业务若需要近实时分析,pre-computed 嵌入的时效性是瓶颈。需确认 GeoTessera 平台是否支持增量嵌入更新,还是用户只能使用历史快照。
  4. GH200 超算的成本不可复制:395 次训练在 1024 块 GH200 上完成,这决定了 TESSERA v2 的发现对普通团队而言只能参考、无法复现。若要在自己的 EO 数据上做类似 scaling study,需要等效的算力和实验管理基础设施(Ray/Submitit/Slurm 等)。
  5. 蒸馏模型(21M)与教师模型(1B)的命名误导:产品名"TESSERA v2-1B-M"中的"1B"极易被理解为模型参数量,实际是教师编码器规模。这可能在技术选型评审中造成误判——建议工程团队在内部文档中明确标注"学生模型 21M 参数"。

Reproducibility

  • GitHub(https://github.com/ucam-eo/tessera):截至 2026-07-21 代码"将发布",实际可用性待验证。
  • 395 次训练的超参配置(学习率、batch size、编码器架构、数据集清单)如未随 GitHub 公开,则核心实验无法独立复现。
  • 15 个 AlphaEarth 下游任务的评测协议和 ground-truth 标注若不公开,下游用户无法独立验证 0.611 数字。