SLAI T-Rex · 万亿参数 MoE 全参 Post-training 在 Ascend NPU 达成 34.22% MFU · 干货攻略
- 链接:https://x.com/_akhaliq/status/2080146578363609443
- 分类:x-tips
- 来源:X @_akhaliq
- 作者:Jay
- 更新:2026-07-28
- 仓库:SLAI-AITP/SLAI-T-Rex
这是什么
SLAI T-Rex 是深圳 Loop Area 研究院模型团队(SLAI-AITP)发布的一套全参 Post-training 框架,用于在华为 Ascend CloudMatrix384 SuperPOD(含 Ascend 910C NPU)上对 DeepSeek-V4 万亿参数 MoE 模型族进行全参数微调训练,并结合运筹学(Operations Research, OR)领域的专项 Post-training 流水线,产出一个名为 DeepSeek-V4-Flash-OR 的 specialized 变体。
核心成果(论文自报,待独立复现):
| 指标 | 数值 |
|---|---|
| 最终 MFU(Model FLOPs Utilization) | 34.22% |
| 相对开源 baseline 提升 | 2.93× |
| 开源 baseline MFU(论文自报) | ~11.67% |
| OR 任务零样本 Pass@1(DeepSeek-V4-Flash-OR) | 71.81% |
| vs GPT-5.4-Mini | +3.98 分 |
| 训练数据规模(OR SFT) | 10K 高质量样本 |
| License | MIT |
| 代码仓库 | github.com/SLAI-AITP/SLAI-T-Rex |
| 模型权重 | ModelScope: SLAIAITP/DeepSeek-V4-Flash-OR |
为什么值得关注
背景:非 GPU 大规模训练的系统难题
对万亿参数 MoE 模型做 Full-parameter Post-training 面临三重系统挑战:
- 内存压力:所有参数均需梯度存储,单节点无法容纳
- 通信开销:MoE 的 Expert Parallelism(EP)引入大量跨节点 All-to-All 通信,且通信与计算无法有效 overlap,导致 GPU 利用率低
- Kernel 效率:Ascend NPU 的算子库成熟度不及 CUDA 生态,矩阵乘法、Attention 等关键 Kernel 存在优化空间
此前开源社区在 Ascend NPU 上复现 DeepSeek-V4 Post-training,MFU 仅约 11.67%——SLAI T-Rex 声称通过系统级优化将此提升至 34.22%。
为什么这是工程里程碑,而非单纯刷榜
SLAI T-Rex 的意义不在于提出新模型架构或新算法,而在于将三件事系统性地打包成可复现工作流:
- Model-level 并行:EP + TP + PP 的层次化并行策略
- 计算-通信编排:将非重叠通信延迟通过异步调度隐藏
- 底层 Kernel 调优:针对 Ascend 910C NPU 特性手写 / 替换关键算子
这三层优化单独拎出来都不是新想法,但在 Ascend NPU 生态内将其组合并跑通端到端 Pipeline 是工程层面的实质进展。
OR 专项化的工程路径价值
SLAI T-Rex 还展示了 CPT(Continued Pre-Training)+ SFT 流水线针对特定领域(运筹学)的完整路径:从 10K 种子数据 → Solver 验证的 IR 蒸馏 → Clean-CoT + Contract-aware 过滤 → 有监督微调。这套范式可迁移到其他垂直领域(如金融、医疗、工程代码)。
核验过程
官方来源
1. GitHub 仓库(github.com/SLAI-AITP/SLAI-T-Rex)
- 确认仓库归 SLAI-AITP 所有,MIT License
- 确认仓库暴露的内容:OR 导向数据构造工具、MindSpeed-LLM CPT/SFT 启动模板、Checkpoint 转换脚本、端到端 Post-training 文档
- 确认公开模块状态:
sft_data_construction/:Runnable——OR SFT 自蒸馏工具包,含种子 IR、合成 IR、渲染、质量门、Resume、Cache、多端点生成sft_training/:Scripts included——MindSpeed-LLM SFT 数据转换与 8K 多节点训练启动器cpt_training/:Scripts included——MindSpeed-LLM CPT 转换与 4K 训练启动器model_download_deployment/:Script included——DeepSeek-V4 FP8 HuggingFace → BF16 转换脚本cpt_data_construction/:Design note only——OR-CPT 引擎设计说明(不含运行代码)- 未公开:大规模生产数据、私有集群配置、私有评测脚本
- 端到端训练流程确认:DeepSeek-V4 checkpoint → FP8/BF16 准备 → HF ↔ MindSpeed/Megatron-Core 转换 → OR-CPT 数据构造 → Ascend 910C CPT → 自蒸馏 OR SFT 数据 → Clean-CoT/Contract-aware 过滤 → Ascend 910C SFT → HF 导出与服务
2. arXiv 论文(arXiv:2607.20145)
- 确认标题与作者团队:深圳 Loop Area 研究院 AI Training Platform Team
- 确认硬件:Ascend CloudMatrix384 SuperPOD with Ascend 910C NPUs
- 确认模型:DeepSeek-V4 family(trillion-parameter MoE)
- 确认 MFU 指标:34.22%(自报)
- 确认 OR benchmark 结果:71.81% zero-shot Pass@1(自报)
- 论文附 PDF 版全文
3. ModelScope 模型卡(SLAIAITP/DeepSeek-V4-Flash-OR)
- 确认 specialized 模型已上传,指向论文配套
交叉验证
| 说法 | 来源 | 核验结论 |
|---|---|---|
| 34.22% MFU,2.93× 提升 | 论文自报 | ⚠️ 自报数据,无独立复现;AI Weekly 等媒体已注明此限制 |
| 开源 baseline ~11.67% MFU | 论文自报(推算) | ⚠️ 同上,系论文内部对比 |
| 71.81% Pass@1,vs GPT-5.4-Mini +3.98 | 论文自报,HuggingFace Daily Papers 引用 | ⚠️ 自报基准;AI Weekly 指出基准测试范围较窄 |
| 10K SFT 样本 | 论文 & GitHub README | ✅ GitHub README 确认 |
| MIT License | GitHub LICENSE | ✅ |
| 完整端到端 Pipeline 公开 | GitHub README 模块表 | ✅ |
| CPT 模块仅 Design note,无运行代码 | GitHub README 模块表 | ✅(生产级 CPT 数据未公开) |
⚠️ 重要限制:MFU 数字和 OR benchmark 分数均为论文自报,目前无独立第三方在同等硬件上复现的公开记录。AI Weekly 的分析也明确指出这一点。SLAI T-Rex 的系统优化思路(三层框架)有价值,但具体性能数字在独立复现前应持保留态度。
上手步骤
环境准备
SLAI T-Rex 的可运行部分依赖 MindSpeed-LLM(华为 Ascend 生态的大模型训练框架)。本地运行需要有 Ascend 910C 集群或兼容的 Ascend 运行环境,个人开发者难以直接复现大规模训练。
可本地运行的模块(不需要 Ascend 集群):
- SFT 数据构造工具包:
sft_data_construction/是纯 Python 工具,可本地安装使用 - Checkpoint 转换脚本:
model_download_deployment/中的 HF 格式转换脚本可在 CPU 上跑通 - 公开种子数据验证:无需 LLM 调用,可直接验证公开数据池
步骤一:克隆仓库
git clone https://github.com/SLAI-AITP/SLAI-T-Rex.git
cd SLAI-T-Rex
步骤二:安装 SFT 数据构造工具
cd sft_data_construction/
pip install -r requirements.txt # 如有
步骤三:验证公开种子池(无需 LLM dry-run)
python3 -m or_data_distill validate-sft \
--input seeds/public_seed.jsonl
步骤四:运行 OR SFT 数据蒸馏(需 LLM API)
python3 -m or_data_distill distill-sft \
--input seeds/public_seed.jsonl \
--output data/sft_10k.jsonl \
--model deepseek-chat \
--batch-size 8
注:需提前配置 LLM 端点(支持多端点),具体见
sft_data_construction/README.md
步骤五:下载 specialized 模型权重(ModelScope)
# 方式一:git-lfs
git lfs install
git clone https://www.modelscope.cn/SLAIAITP/DeepSeek-V4-Flash-OR.git
# 方式二:modelscope SDK
pip install modelscope
python -c "from modelscope import snapshot_download; snapshot_download('SLAIAITP/DeepSeek-V4-Flash-OR')"
步骤六:使用 MindSpeed-LLM 启动 SFT(需 Ascend 集群)
cd sft_training/
# 修改对应的 cluster config 后执行
bash run_sft_8k_multinode.sh
坑与适用边界
坑 1:大规模训练不可本地复现
cpt_data_construction/ 只有设计说明,无运行代码;CPT 训练依赖华为私有集群配置。SLAI 明确表示大规模生产数据和私有集群配置不公开。因此:
- 想复现 34.22% MFU 的人无法从本仓库获得所需信息
- 10K SFT 数据蒸馏和模型推理是可以在非 Ascend 环境运行的模块
坑 2:MFU 数字是自报,无独立复现
这是核心争议点。AI Weekly 的分析指出: - MFU 34.22% 是 SLAI 团队自己测的 - 基准对比(2.93×)是相对于他们自己测的开源 recipe - 在其他 NPU 集群上独立复现"因显而易见的原因可能性很低"(原文:unlikely for obvious reasons) - 建议不要将这些数字与 NVIDIA H100 集群的 MFU 直接横向比较,因为 NPU vs GPU 的 MFU 计算基准可能不同
坑 3:OR Benchmark 覆盖范围窄
AI Weekly 指出 71.81% Pass@1 的 OR benchmark 是"narrow slice rather than general reasoning",即 OR 专项而非通用推理。SLAI T-Rex 本身定位也是 Ops Research specialized 模型,跨领域泛化能力未展示。
适用边界
| 场景 | 是否适用 |
|---|---|
| 研究 Ascend NPU 训练优化思路 | ✅ 三层框架可借鉴 |
| 在 Ascend 生态做 OR 领域 Post-training | ✅ 完整 Pipeline 公开 |
| 本地 CPU/GPU 复现 34.22% MFU | ❌ 不可行,硬件依赖 |
| 直接比较 NPU vs GPU 训练效率 | ⚠️ 需谨慎,基准不完全等价 |
| 生产部署 specialized OR 模型 | ✅ 可用 ModelScope 权重 |
一句话结论
SLAI T-Rex 是一套 Ascend NPU 上的 DeepSeek-V4 全参 Post-training 端到端框架,核心价值在于将模型并行、通信 overlap 和 Kernel 调优打包为可复现工作流(34.22% MFU 系自报,待独立验证);OR 专项 10K SFT 数据蒸馏工具可独立使用,值得运筹学领域做 LLM 微调的团队关注。