SkewAdam · 视频脚本镜像
- 日期与轮次:2026-07-23 · R2
- arXiv 链接:https://arxiv.org/abs/2607.19058
- video-kb 脚本原路径:/shared/video-kb/scripts/tom/2026-07-23_R2_skewadam-tiered-optimizer-state-moe-short-video-script.md
1. 标题与观众
- 标题:SkewAdam · 把优化器状态分层
- 目标观众:AI 工程师 / LLM 训练基础设施工程师 / MoE 训练优化器选型工程师
- 一句话核心观点:SkewAdam 把 MoE 三类参数按梯度统计差异拆开用不同精度 optimizer state,内存砍到 AdamW 的 2.6%、验证 perplexity 反向更低。
- 关键术语覆盖:SkewAdam / AdamW / Muon / Lion / Adafactor / MoE / optimizer state / tiered state allocation / factored second moment / dense backbone / experts / router
3. 45-90 秒口播稿
MoE 训练内存账大头不是权重,是 AdamW 维护动量与二阶矩。6.78B MoE,bfloat16 权重 12.6 GB,AdamW 状态 50.6 GB。
拆三类参数:backbone 用 float32 动量+分解二阶矩,experts 只留分解二阶矩,router 用精确二阶矩。optimizer state 从 50.6 GB 砍到 1.29 GB,只剩 2.6%,峰值训练内存 81.4 → 31.3 GB。
82M tokens 下 SkewAdam perplexity 108.4,AdamW 126.8,Muon 120.2,Lion 393.7。分层买的是内存,真正解决收敛的是保留骨干动量。
卡在 40 GB 单卡?按参数类型分三组,跑 SkewAdam 的分层状态。
4. 镜头分镜
- scene-1 标题卡(8 秒):屏幕文字「SkewAdam · 把优化器状态分层」+ 副标「6.78B MoE 40GB 单卡可行」+ 大字白底黑字,画面元素:分层状态表占位图,运动:淡入 + 文字下划线动效。
- scene-2 判断卡(8 秒):屏幕文字「MoE 训练最大内存账」「AdamW 50.6 GB optimizer 状态」+ 关键数字加粗,画面元素:内存账饼图(权重 12.6 GB vs 状态 50.6 GB),运动:饼图按比例展开。
- scene-3 流程卡(8 秒):屏幕文字「三类参数拆开」「backbone 5%」「experts 95%」「router < 0.01%」+ 三行状态分配表,画面元素:三层饼图 + 状态分配表,运动:饼图切片依次亮起。
- scene-4 证据卡(8 秒):屏幕文字「50.6 GB → 1.29 GB」「2.6% AdamW」「81.4 → 31.3 GB」+ 柱状对比图,画面元素:数字对比柱状图(perplexity 4 件套 + 内存 2 件套),运动:柱状图由短到长依次弹出。
- scene-5 视觉规格关键信息(8 秒):屏幕文字「验证 PPL 108.4」「AdamW 126.8」「Muon 120.2」「Lion 393.7」+ perplexity 排序柱状图,画面元素:4 优化器横向柱状图,运动:数字高亮闪烁。
- scene-6 风险卡(8 秒):屏幕文字「GitHub 命中官方」「三向一致闭环」+ 「v1/HF/GitHub」「三方一致」+ 「abstract 单架构」「未给跨架构实验」三件套双行排版,画面元素:W7 + W11 + W4 风险徽章,运动:徽章依次浮现。
- scene-7 落版卡(8 秒):屏幕文字「按参数类型分三组」「跑分层状态」「多卡路径未实测」+ 5 bullet 行动指南,画面元素:行动清单 + 主分类 cs.LG / engineering 双标签标注,运动:列表逐条淡入。