NVIDIA 把"低精度预训练"这条公认难题啃下来了——Nemotron 3 Super 用 NVFP4 训 25 万亿 token 不翻车,Agent 场景推理最高快 7.5 倍

  • 关联论文:2604.12374

一句话故事

arXiv 2604.12374 是 NVIDIA 2026 年公开的 Nemotron 3 Super —— 一个 120B 总参 / 12B 激活参数的混合 Mamba-Attention MoE 大模型,首次在 Nemotron 系列里把整个预训练跑在 NVFP4 上(25 万亿 token 不掉点),并自带 MTP 头原生支持 speculative decoding。论文声称在 8k→64k 的 Agent 典型负载下,相对 GPT-OSS-120B 最高快 2.2 倍,相对 Qwen3.5-122B 最高快 7.5 倍,同时维持相当或更优的精度。

如果你在做 LLM 推理优化,你大概率已经被三件事反复折磨:MoE 太贵、长上下文撑不住、低精度预训练掉点。Nemotron 3 Super 是 2026 年上半年最值得拆解的"组合拳解法"——它不是单点优化,而是把 LatentMoE + 混合架构 + NVFP4 pretrain + MTP speculative decoding 四件套一次性塞进一个 120B 模型里,并且全部开源权重。

为什么这件事和你有关

不管你是 LLM-infra 工程师、Agent 平台架构师,还是只关心"自家推理成本能不能砍半"的工程负责人,这件事都直接改变了你的技术选型清单:

  • LLM-infra 工程师:NVFP4 pretrain 的 25 万亿 token 稳定性证据,这是 NVIDIA 公开的第一份"低精度预训练不掉点"的工程参考。其他想做 NVFP4 / FP4 pretrain 的团队,可以直接抄作业。
  • Agent 平台架构师:Agent 工作负载的典型特征是"短输入 → 长输出"(8k / 64k 这种比例很常见),正是 NVFP4 最能省钱的场景。这份论文给了你"为什么应该严肃评估 NVFP4"的硬数据。
  • 推理引擎作者(vLLM / SGLang / TensorRT-LLM 作者):Hybrid Mamba-Attention + LatentMoE + MTP 这三件套在你框架里的实现难度,直接决定你下一季度的 roadmap 优先级。
  • 训练侧研究员:研究 MoE 路由、低精度训练、混合架构联合优化的人——Nemotron 3 Super 是 2026 年绕不开的参考点。
  • 关注 AI 基础设施的人:120B 模型用 NVFP4 训 25 万亿 token,意味着"低精度预训练"从概念变成可量产工艺。

核心方法:四件套联合优化

Nemotron 3 Super 的工作可以拆成四块,它们不是独立优化,而是互相补强:

┌─ 架构层 ─────────────────────────────────────────────┐
│ Hybrid Mamba-Attention ×N 块                          │
│   ├── Mamba SSM 负责线性复杂度长程建模                 │
│   └── Attention 负责局部检索与位置敏感                  │
│ + LatentMoE 路由(token 空间 → latent 空间)             │
│ + MTP 头(native speculative decoding draft)           │
└───────────────────────────────────────────────────────┘
┌─ 训练层 ─────────────────────────────────────────────┐
│ NVFP4 pretrain × 25T tokens(两阶段 80/20)             │
│   ├── 阶段一:20T tokens 多样性广覆盖                   │
│   └── 阶段二:5T tokens 特定能力增强                    │
│ 后训练:SFT + 多环境 RL(强化 agentic/tool-use/reasoning)│
└───────────────────────────────────────────────────────┘
┌─ 量化层 ─────────────────────────────────────────────┐
│ FP8 (E4M3)  checkpoint  ──── 通用推理                 │
│ NVFP4 (E2M1 + per-block scale) ──── Blackwell 加速    │
└───────────────────────────────────────────────────────┘
┌─ 上下文层 ───────────────────────────────────────────┐
│ 1M context support(repo-level 代码 / 长工具链 / RAG)   │
└───────────────────────────────────────────────────────┘

三个关键洞察

1. NVFP4 预训练是真正的工程招牌

低精度推理(NVFP4 / FP8 推理)早已被 Hopper / Blackwell 原生加速,但直接在 NVFP4 上做 25 万亿 token 的稳定预训练是公认难题——大多数团队尝试都会遇到 loss 震荡、收敛慢、甚至训崩。

NVIDIA 在 Nemotron 3 Super 里把整份 pretrain 跑在 NVFP4 上,论文反复强调"stable and accurate"。这件事的难度极高,一旦做到,意味着整个行业的"低精度 pretrain"从概念变为可量产工艺。

⚠️ 核查注记:论文未披露 25T NVFP4 预训练消耗的总 GPU-hours、FLOPs 与碳排——这点对想抄作业的团队是个信息缺口。

2. Hybrid Mamba-Attention + LatentMoE = "长上下文 + 高吞吐"的工程红利

传统 MoE 的痛点:激活参数越多,推理越贵,精度增益却不一定线性。LatentMoE 的关键差异是路由在 latent 空间而非 token 空间——直接优化 accuracy per FLOP 与 accuracy per parameter。

叠加 Mamba-Attention 混合架构: - Attention 层:负责局部检索与位置敏感(短程精确) - Mamba SSM 层:负责线性复杂度的长程建模(长程高效) - 组合效果:在"短输入超长输出 + 1M context"的 Agent 场景下,KV cache 比纯 Transformer 经济得多

⚠️ 核查注记:Hybrid Mamba-Attention 的层数比例(多少层 Mamba、多少层 Attention)、LatentMoE 路由维度等关键超参,论文未公开——这对想针对性定制 CUDA kernel 的团队是最大信息缺口。

3. MTP 头原生支持 Speculative Decoding

论文不是外挂 Medusa / EAGLE,而是让模型自带 Multi-Token Prediction (MTP) 头。训练时让模型同时预测未来多个 token,推理时这些中间预测天然作为 speculative decoding 的 draft。

工程上的好处:比外挂 draft 模型更省事,且与模型本身已经联合优化。如果你在用 vLLM 或 TensorRT-LLM,MTP head 的实现已经可以直接接上 speculative decoding。

关键数字怎么说

维度 数字 含义
总参 / 激活参 120B / 12B 10% 激活率,行业惯例一致
Pretrain tokens 25T(两阶段 80/20) 阶段一 20T 多样性 + 阶段二 5T 增强
上下文长度 1M token repo-level 代码 / 长工具链够
相对 GPT-OSS-120B 吞吐 最高 2.2× 8k 输入 / 64k 输出设定
相对 Qwen3.5-122B 吞吐 最高 7.5× 8k 输入 / 64k 输出设定
精度 相当或更优 ⚠️ 摘要未列逐项 benchmark

⚠️ 核查注记(读数字时务必看清): - "最高 2.2× / 7.5×"是峰值设定,不是平均加速——论文未给几何均值。 - 对比时要严格按 8k→64k 比例读,不同输入输出比下结论可能反转。 - GPT-OSS-120B 与 Qwen3.5-122B 的吞吐数字是否来自同一硬件配置(Blackwell B200 vs H100)未注明,跨硬件的对比结论需谨慎。 - "相当或更优精度"是 sales language 不是工程语言,需以原文 Table 2-3 为准。

落地你该怎么用

路径 A:NVFP4 路径(Blackwell 专用,体验最好)

# 1. 验证 checkpoint 完整性
sha256sum nemotron3-super-nvfp4/*.safetensors

# 2. TensorRT-LLM container 版本确认
docker run --gpus all nvidia/trt-llm:0.12.0 python -c "import tensorrt; print(tensorrt.__version__)"

# 3. 启用 MTP speculative decoding
trtllm-build --model_dir ./nemotron3-super-nvfp4 \
  --speculative_decoding_mode mtp \
  --num_heads 8 --num_layers 40

硬门槛:8× B200/H200 NVL72 rack-scale(NVL72 推荐),NVLink 1.8TB/s,640GB 显存总量。单卡部署不可能。

路径 B:FP8 路径(更灵活,但吞吐打折)

  • 用 vLLM 0.6+ 或 SGLang 0.3+
  • 接受 FP8 精度,放弃 NVFP4 加速
  • 适合 H100 / H200 集群

路径 C:不部署,只读论文学范式

  • 训练侧:研究 LatentMoE 路由、低精度 pretrain 的工程经验
  • 推理侧:研究 hybrid 架构 + MTP speculative decoding 在你框架里的实现难度

框架支持状态(2026 Q3 截至)

框架 MoE MTP Hybrid Mamba NVFP4
TensorRT-LLM 0.12+ ✅ ✅ ⚠️ 自定义 kernel ✅ 原生
vLLM 0.6+ ✅ ✅ ⚠️ 自定义 kernel ❌
SGLang 0.3+ ✅ ❌ ⚠️ 自定义 kernel ❌

结论:NVFP4 当前唯一生产可用路径是 TensorRT-LLM + NVIDIA 官方 container;接受 FP8 则 vLLM 更灵活。

七个落地坑(每坑都有对应缓解)

坑 描述 缓解
120B 单卡无法部署 必须 8× GPU 多卡 确认团队有对应集群;否则选 Nano 版本
NVFP4 = NVIDIA 锁定 Blackwell 专用格式 非 Blackwell 只能跑 FP8;NVFP4 不跨架构迁移
Hybrid 比例未公开 无法针对性优化 CUDA kernel 等官方 release 超参;或 watch NVIDIA/mlagents
peak vs average 吞吐差距 2.2× / 7.5× 是峰值 生产前自己跑 8k→64k 与 64k→64k 两类 ratio 实测
1M context 显存爆炸 1M × 12B × 2 bytes ≈ 24GB just for KV 启用 PagedAttention(vLLM)或 chunked prefill 控制峰值
agentic benchmark 未公开 BFCL / SWE-bench / Tau-bench 逐项分数未知 直接跑开源 agent benchmark 复现,不要只看摘要
权重许可证 摘要说 release 但未给许可证细节 必须 fetch HuggingFace 页面确认(可能有使用限制)

这件事对你的技术选型意味着什么

如果你在做 LLM 推理服务,你今天的决策不是"要不要支持 NVFP4",而是"要不要在 2026 H2 把 NVFP4 路径跑通"——Nemotron 3 Super 的开源给了你完整参考 pipeline 三件套。错过这班车,意味着在 Agent 推理的成本曲线上落后对手一个身位。

如果你在做 Agent 平台,你今天的决策不是"用什么模型",而是"要不要把推理框架与 speculative decoding 联合设计"——MTP 头是这个方向的工程标准动作,外挂 draft 模型已逐渐成为次优解。

如果你在做 训练侧研究,Nemotron 3 Super 是 2026 年绕不开的参考点——它的工程经验(尤其是 NVFP4 25T 稳定 pretrain)是行业稀缺资产。

与同方向工作的关系

  • GPT-OSS-120B:同档位直接对标的开放权重基线,Nemotron 3 Super 反复引用它做精度对照。
  • Qwen3.5-122B:另一条 dense-MoE 路径,7.5× 吞吐差距显示 hybrid + LatentMoE + NVFP4 的工程红利。
  • Nemotron 3 Nano:同系列小尺寸版本,验证了 NVFP4 pretrain pipeline 的可迁移性。
  • Mamba-3 / Jamba / Zamba:纯 SSM 或 hybrid 的同期工作,Nemotron 3 Super 把 hybrid 推到 120B + agentic。
  • DeepSeek-V3 / Mixtral:传统 MoE 派,LatentMoE 相对优势需 routing efficiency 进一步对比。
  • Blackwell NVFP4 生态:与 NVIDIA 自家推理栈(TensorRT-LLM / Megatron)耦合最深,跨硬件部署收益未明。

一句话总结

Nemotron 3 Super 的贡献不是某个新算法,而是把 LatentMoE + Hybrid Mamba-Attention + NVFP4 pretrain + MTP speculative decoding 四件套同时跑通并验证了工程稳定性。这意味着 LLM 推理的"低精度 pretrain 时代"正式开启。

这对你的工作流意味着什么,你今天就可以开始评估。