SLAI T-Rex · 万亿参数 MoE 全参 Post-training 在 Ascend NPU 达成 34.22% MFU · 干货攻略

  • 链接:https://x.com/_akhaliq/status/2080146578363609443
  • 分类:x-tips
  • 来源:X @_akhaliq
  • 作者:Jay
  • 更新:2026-07-28
  • 仓库:SLAI-AITP/SLAI-T-Rex

这是什么

SLAI T-Rex 是深圳 Loop Area 研究院模型团队(SLAI-AITP)发布的一套全参 Post-training 框架,用于在华为 Ascend CloudMatrix384 SuperPOD(含 Ascend 910C NPU)上对 DeepSeek-V4 万亿参数 MoE 模型族进行全参数微调训练,并结合运筹学(Operations Research, OR)领域的专项 Post-training 流水线,产出一个名为 DeepSeek-V4-Flash-OR 的 specialized 变体。

核心成果(论文自报,待独立复现):

指标 数值
最终 MFU(Model FLOPs Utilization) 34.22%
相对开源 baseline 提升 2.93×
开源 baseline MFU(论文自报) ~11.67%
OR 任务零样本 Pass@1(DeepSeek-V4-Flash-OR) 71.81%
vs GPT-5.4-Mini +3.98 分
训练数据规模(OR SFT) 10K 高质量样本
License MIT
代码仓库 github.com/SLAI-AITP/SLAI-T-Rex
模型权重 ModelScope: SLAIAITP/DeepSeek-V4-Flash-OR

为什么值得关注

背景:非 GPU 大规模训练的系统难题

对万亿参数 MoE 模型做 Full-parameter Post-training 面临三重系统挑战:

  1. 内存压力:所有参数均需梯度存储,单节点无法容纳
  2. 通信开销:MoE 的 Expert Parallelism(EP)引入大量跨节点 All-to-All 通信,且通信与计算无法有效 overlap,导致 GPU 利用率低
  3. Kernel 效率:Ascend NPU 的算子库成熟度不及 CUDA 生态,矩阵乘法、Attention 等关键 Kernel 存在优化空间

此前开源社区在 Ascend NPU 上复现 DeepSeek-V4 Post-training,MFU 仅约 11.67%——SLAI T-Rex 声称通过系统级优化将此提升至 34.22%。

为什么这是工程里程碑,而非单纯刷榜

SLAI T-Rex 的意义不在于提出新模型架构或新算法,而在于将三件事系统性地打包成可复现工作流

  • Model-level 并行:EP + TP + PP 的层次化并行策略
  • 计算-通信编排:将非重叠通信延迟通过异步调度隐藏
  • 底层 Kernel 调优:针对 Ascend 910C NPU 特性手写 / 替换关键算子

这三层优化单独拎出来都不是新想法,但在 Ascend NPU 生态内将其组合并跑通端到端 Pipeline 是工程层面的实质进展。

OR 专项化的工程路径价值

SLAI T-Rex 还展示了 CPT(Continued Pre-Training)+ SFT 流水线针对特定领域(运筹学)的完整路径:从 10K 种子数据 → Solver 验证的 IR 蒸馏 → Clean-CoT + Contract-aware 过滤 → 有监督微调。这套范式可迁移到其他垂直领域(如金融、医疗、工程代码)。


核验过程

官方来源

1. GitHub 仓库(github.com/SLAI-AITP/SLAI-T-Rex)

  • 确认仓库归 SLAI-AITP 所有,MIT License
  • 确认仓库暴露的内容:OR 导向数据构造工具、MindSpeed-LLM CPT/SFT 启动模板、Checkpoint 转换脚本、端到端 Post-training 文档
  • 确认公开模块状态:
  • sft_data_construction/Runnable——OR SFT 自蒸馏工具包,含种子 IR、合成 IR、渲染、质量门、Resume、Cache、多端点生成
  • sft_training/Scripts included——MindSpeed-LLM SFT 数据转换与 8K 多节点训练启动器
  • cpt_training/Scripts included——MindSpeed-LLM CPT 转换与 4K 训练启动器
  • model_download_deployment/Script included——DeepSeek-V4 FP8 HuggingFace → BF16 转换脚本
  • cpt_data_construction/Design note only——OR-CPT 引擎设计说明(不含运行代码)
  • 未公开:大规模生产数据、私有集群配置、私有评测脚本
  • 端到端训练流程确认:DeepSeek-V4 checkpoint → FP8/BF16 准备 → HF ↔ MindSpeed/Megatron-Core 转换 → OR-CPT 数据构造 → Ascend 910C CPT → 自蒸馏 OR SFT 数据 → Clean-CoT/Contract-aware 过滤 → Ascend 910C SFT → HF 导出与服务

2. arXiv 论文(arXiv:2607.20145)

  • 确认标题与作者团队:深圳 Loop Area 研究院 AI Training Platform Team
  • 确认硬件:Ascend CloudMatrix384 SuperPOD with Ascend 910C NPUs
  • 确认模型:DeepSeek-V4 family(trillion-parameter MoE)
  • 确认 MFU 指标:34.22%(自报)
  • 确认 OR benchmark 结果:71.81% zero-shot Pass@1(自报)
  • 论文附 PDF 版全文

3. ModelScope 模型卡(SLAIAITP/DeepSeek-V4-Flash-OR)

  • 确认 specialized 模型已上传,指向论文配套

交叉验证

说法 来源 核验结论
34.22% MFU,2.93× 提升 论文自报 ⚠️ 自报数据,无独立复现;AI Weekly 等媒体已注明此限制
开源 baseline ~11.67% MFU 论文自报(推算) ⚠️ 同上,系论文内部对比
71.81% Pass@1,vs GPT-5.4-Mini +3.98 论文自报,HuggingFace Daily Papers 引用 ⚠️ 自报基准;AI Weekly 指出基准测试范围较窄
10K SFT 样本 论文 & GitHub README ✅ GitHub README 确认
MIT License GitHub LICENSE
完整端到端 Pipeline 公开 GitHub README 模块表
CPT 模块仅 Design note,无运行代码 GitHub README 模块表 ✅(生产级 CPT 数据未公开)

⚠️ 重要限制:MFU 数字和 OR benchmark 分数均为论文自报,目前无独立第三方在同等硬件上复现的公开记录。AI Weekly 的分析也明确指出这一点。SLAI T-Rex 的系统优化思路(三层框架)有价值,但具体性能数字在独立复现前应持保留态度。


上手步骤

环境准备

SLAI T-Rex 的可运行部分依赖 MindSpeed-LLM(华为 Ascend 生态的大模型训练框架)。本地运行需要有 Ascend 910C 集群或兼容的 Ascend 运行环境,个人开发者难以直接复现大规模训练。

可本地运行的模块(不需要 Ascend 集群):

  1. SFT 数据构造工具包sft_data_construction/ 是纯 Python 工具,可本地安装使用
  2. Checkpoint 转换脚本model_download_deployment/ 中的 HF 格式转换脚本可在 CPU 上跑通
  3. 公开种子数据验证:无需 LLM 调用,可直接验证公开数据池

步骤一:克隆仓库

git clone https://github.com/SLAI-AITP/SLAI-T-Rex.git
cd SLAI-T-Rex

步骤二:安装 SFT 数据构造工具

cd sft_data_construction/
pip install -r requirements.txt   # 如有

步骤三:验证公开种子池(无需 LLM dry-run)

python3 -m or_data_distill validate-sft \
  --input seeds/public_seed.jsonl

步骤四:运行 OR SFT 数据蒸馏(需 LLM API)

python3 -m or_data_distill distill-sft \
  --input seeds/public_seed.jsonl \
  --output data/sft_10k.jsonl \
  --model deepseek-chat \
  --batch-size 8

注:需提前配置 LLM 端点(支持多端点),具体见 sft_data_construction/README.md

步骤五:下载 specialized 模型权重(ModelScope)

# 方式一:git-lfs
git lfs install
git clone https://www.modelscope.cn/SLAIAITP/DeepSeek-V4-Flash-OR.git

# 方式二:modelscope SDK
pip install modelscope
python -c "from modelscope import snapshot_download; snapshot_download('SLAIAITP/DeepSeek-V4-Flash-OR')"

步骤六:使用 MindSpeed-LLM 启动 SFT(需 Ascend 集群)

cd sft_training/
# 修改对应的 cluster config 后执行
bash run_sft_8k_multinode.sh

坑与适用边界

坑 1:大规模训练不可本地复现

cpt_data_construction/ 只有设计说明,无运行代码;CPT 训练依赖华为私有集群配置。SLAI 明确表示大规模生产数据和私有集群配置不公开。因此: - 想复现 34.22% MFU 的人无法从本仓库获得所需信息 - 10K SFT 数据蒸馏和模型推理是可以在非 Ascend 环境运行的模块

坑 2:MFU 数字是自报,无独立复现

这是核心争议点。AI Weekly 的分析指出: - MFU 34.22% 是 SLAI 团队自己测的 - 基准对比(2.93×)是相对于他们自己测的开源 recipe - 在其他 NPU 集群上独立复现"因显而易见的原因可能性很低"(原文:unlikely for obvious reasons) - 建议不要将这些数字与 NVIDIA H100 集群的 MFU 直接横向比较,因为 NPU vs GPU 的 MFU 计算基准可能不同

坑 3:OR Benchmark 覆盖范围窄

AI Weekly 指出 71.81% Pass@1 的 OR benchmark 是"narrow slice rather than general reasoning",即 OR 专项而非通用推理。SLAI T-Rex 本身定位也是 Ops Research specialized 模型,跨领域泛化能力未展示。

适用边界

场景 是否适用
研究 Ascend NPU 训练优化思路 ✅ 三层框架可借鉴
在 Ascend 生态做 OR 领域 Post-training ✅ 完整 Pipeline 公开
本地 CPU/GPU 复现 34.22% MFU ❌ 不可行,硬件依赖
直接比较 NPU vs GPU 训练效率 ⚠️ 需谨慎,基准不完全等价
生产部署 specialized OR 模型 ✅ 可用 ModelScope 权重

一句话结论

SLAI T-Rex 是一套 Ascend NPU 上的 DeepSeek-V4 全参 Post-training 端到端框架,核心价值在于将模型并行、通信 overlap 和 Kernel 调优打包为可复现工作流(34.22% MFU 系自报,待独立验证);OR 专项 10K SFT 数据蒸馏工具可独立使用,值得运筹学领域做 LLM 微调的团队关注。