损失函数看不见基底,但 Adam 看得到
- 关联论文:2608.05136
- 作者:flyP
- 更新:2026-08-12
一句话结论
在分解参数化 W = U V⊤ 上,梯度下降隐式偏向低秩解,而 Adam 不会 —— 真正决定这条边界的是优化器是否对损失函数的规范(gauge)对称性等变,而不是 Adam 听起来更"高级"。
解决什么真问题
矩阵分解 / 低秩参数化在现代深度学习里几乎无处不在:矩阵感知(matrix sensing)、低秩适配(LoRA)、Muon 这类谱范数预条件器、Shampoo 这类二阶方法的近似、Transformer 的多头 Q/K 矩阵都可写成 W = U V⊤。这些参数化天然带一组规范对称性 —— 对任意可逆 Q,把 (U, V) 同时换成 (UQ, VQ) 时损失不变。问题是:很多训练算法表面看着收敛到相似的训练损失,但它们走过的路径、收敛到的解的几何形状并不相同。
过去几年社区形成一种共识:Adam 因为自适应学习率所以"更鲁棒",梯度下降因为更"线性"所以能继承某些低秩偏置。但经验上同一份代码、同一组超参,把优化器从 GD 换成 Adam,低秩偏置就消失 —— 没人说清楚到底为什么。本文给出了一个严格的、可验证的数学判据:规范等变性(gauge-equivariance)。
核心方法
1. 框架:规范对称性与规范等变性
把矩阵 W ∈ ℝ^{m×n}(m > n)写成 W = U V⊤,其中 U ∈ ℝ^{m×n}、V ∈ ℝ^{n×n}。损失 L(W) 对 W 是规范不变的:
$$ L(U V^\top) = L(U Q \cdot Q^{-1} V^\top), \quad \forall Q \in GL(n) $$
定义规范等变算子 T:若 T 也满足 T(UQ, VQ) = T(U, V) Q,则称 T 规范等变。关键定理:无记忆(memoryless)规范等变更新规则,恰好就是"由 Gram 矩阵决定的左预条件器"。换言之,规范等变性等价于更新方向只依赖 V⊤V(而不是 V 本身)。
2. 判据应用到九种优化器
作者据此把常见更新规则分两类:
| 满足规范等变(继承 GD 的低秩偏置) | 不满足(破坏低秩偏置) |
|---|---|
| 梯度下降(GD) | Adam |
| 动量(Momentum) | RMSProp |
| "shared-scalar" Adam(共享标量变体) | 其他逐坐标(coordinate-wise)方法 |
| Muon | Adagrad 等 |
| Shampoo(左预条件器近似形式) |
判定要点:Muon / Shampoo 的更新本质上是 U ← U · f(V⊤V) 或 V ← V · f(U⊤U),只通过 Gram 矩阵作用,因此规范等变。Adam 用的是 per-coordinate 的 V/(√二阶矩 + ε),依赖 V 的具体值,规范对称性被打破。
3. 三个配套定理
- 结构定理:无记忆规范等变更新规则 = Gram 决定的左预条件器。分类干净。
- 迁移定理:梯度流(gradient flow)的路径性质(如低秩、隐式正则)可迁移到"common-scalar flow"——也就是一类共享标量的连续极限。
- 光谱调度(spectral schedule):调和文献里两派关于 Muon 的对立说法。Muon 在等速率更新(更新步长与谱尾长成比例)下能精确恢复低秩目标;但当谱尾变长(这正是实际大模型训练里会发生的事),Muon 的相对优势被稀释。
4. 实证:从玩具到 Transformer
- 矩阵感知:九种规则按恢复误差对已植入真值排序。一条单参插值族从"逐坐标"插值到"shared-scalar"预条件化,低秩偏置单调恢复 —— 直接隔离出各向异性(anisotropy)这个原因变量。
- Transformer:Adam 在第一步就把两个规范等价的初始化拉开到 56% 的相对 Frobenius 距离差异(W_Q⊤W_K 不变量),而规范等变优化器在这一步还停在 float 精度内。这是端到端级别、不依赖任何玩具化的强证据。
- 高光谱图像:在最低采样密度下,GD 比 Adam 在测试误差上少 43–44%,且有效秩更低。训练损失相同、几何不同 —— "基的选择不是调参细节,而是选择哪种插值器"的实证支撑。
关键实验与数据
- 矩阵感知排序:九种规则在 underdetermined 设置下,按相对恢复误差排名(论文图 4,原文未列具体百分比)。单参族从 Adam 端插到 shared-scalar 端,误差随参数单调下降。
- Transformer 头不变量差距:Adam 在第一步即产生 56% 的相对 Frobenius 距离差,规范等变优化器保持 float 级精度;这是"规范等变 vs 不等变"在真实规模上的对比证据。
- 高光谱数据集:两个数据集,在最低采样密度下 GD 测试误差比 Adam 低 43–44%,且有效秩更低;训练损失相同,说明这不是欠拟合/过拟合问题,而是几何选择问题。
- 代码与种子:作者在 GitHub 公开完整代码、随机种子与原始运行记录(仓库
idevender/loss-basis-adam),22 页正文 + 附录、5 张图。
⚠️ 数字核验:56% 相对 Frobenius 距离差与 43–44% 测试误差减幅均直接出自 abstract 与论文内文,为单一实验报告值,未在其他数据集上独立复现验证。
亮点与局限
亮点
- 给出了可证伪的判据。"优化器是否规范等变"是一个二元、可逐行核验的判定,比"Adam 是不是更聪明"这种风格化判断强一个量级。
- 覆盖宽度足够:从矩阵感知玩具、到 Transformer 真实架构、到高光谱真实数据,三档证据链完整。
- 结构定理 + 迁移定理 + 光谱调度三件套同时给出理论闭环。其中光谱调度直接调和了一篇文献里两派关于 Muon 的对立报告,这是少见的"把别人的争论关掉"的工作。
- 配套仓库完整:seeds + raw run records 公开,重现门槛低。
局限 / 风险
- 规模天花板:论文实验主要是单头或小型 Transformer 验证;数十亿参数级别是否仍成立,原文未量化。
- LoRA 类场景未直接覆盖:LoRA 是 W = W_0 + U V⊤(残差 + 低秩增量),规范对称性只在残差部分严格成立;实际 LoRA 训练的 Adam 是否仍破坏低秩偏置,原文未给直接实验。
- Adam 不可替代场景:自适应逐坐标优化在大规模 LLM 训练中已工程化多年;本文不主张替换 Adam,而是说"如果你想要隐式低秩,请用规范等变方法",但迁移到千亿参数级别未见报告。
- 单参族的覆盖范围:从坐标式到 shared-scalar 的插值族只覆盖一维子集;二阶信息更复杂的方法(如 K-FAC、SOAP)是否落入这个分类,原文未展开。
对工程落地的启发
- 训练低秩 / 矩阵分解参数化时优先规范等变更新器:GD、动量、Muon、Shampoo、左预条件近似。如果你的目标是隐式正则、低秩偏置、矩阵恢复,不要换成 Adam。
- Muon 不是万能加速器:等速率更新下 Muon 优势最大;一旦谱尾变长(伴随长尾学习率调度或大 batch),优势递减。换言之 Muon 的"加速窗口"是有限的。
- 基准报告应同时报训练损失与有效秩:训练损失相同但有效秩不同的两个模型,泛化可能差 43% 量级(高光谱实验)。这是评估矩阵分解类方法时一个简单但成本极低的额外指标。
- 逐坐标优化 ≠ 鲁棒:把 Adam 当作"通用鲁棒默认"是经验主义;本文给出了一个理论下界 —— 它至少在低秩偏置这件事上系统性破坏隐式正则。
LoRA 场景的实务建议
LoRA 把一个冻结的 W_0 加上一个低秩增量 ΔW = U V⊤(缩放系数 α/r)。注意:
- 冻结的 W_0 不参与规范对称性:残差只在 ΔW 上定义规范变换。因此 Adam 在 W_0 + U V⊤ 这种参数化下的破坏程度,理论上取决于 ΔW 实际走过的优化轨迹是否"小"——若 lr 较小、rank 较低,规范对称性破坏效应可能被掩盖。
- 实践启示:如果用 LoRA 做密集监督数据上的微调、且观察到 Adam 与 Muon 表现相近,本文的预测是 — 因为残差路径几乎不离开初始化邻域,规范对称性的差异不可观测。如果换成大批次、长序列、强学习率设置,差异会被放大。
- 判据外推风险:LoRA 把 (U, V) 初始化为接近零的小矩阵,等价于论文中的"small init"。该设定下本文的所有结论都直接适用;但当 W_0 不是简单冻结而是某种"warm-start"(如 PiSA、DoRA)时,规范对称性是否仍精确成立需要单独验证。
⚠️ 以上三点为基于本文理论的推断,原文未给出 LoRA 直接实验。
与同方向工作的关系
- 低秩矩阵恢复 / 隐式正则:本文和 Arora 等人关于 GD 隐式低秩偏置的早期工作同源,把它们从"现象"提升到"判据 + 定理"。
- Muon / Shampoo:本文给出二者"为什么工作"的最深层机制,并解释了为什么 Muon 在大模型上不一致地更优(光谱调度)。
- 优化器基准(μTransfer、μP 系列):那些工作关注 max-update / 特征学习率范式,本文关注"几何选择",是互补视角。
- LoRA 训练实践:LoRA 训练通常用 Adam;本文理论建议在 LoRA 场景下考虑 Muon / 谱范数预条件,但缺乏直接实验,建议关注后续工作。
最小可跑实验骨架(伪代码)
下面这段伪代码把论文的核心机制压缩到 ~30 行,可作为读者在自己数据上复现第一步的起点:
# Factored parameterization W = U @ V.T
# Two optimizers side by side: GD vs Adam
U = torch.randn(m, r) * scale # small init, scale ~ 1/sqrt(m)
V = torch.randn(n, r) * scale
opt_gd = torch.optim.SGD ([U, V], lr=eta, momentum=0.0)
opt_adam = torch.optim.Adam ([U, V], lr=eta, betas=(0.9, 0.999))
for step in range(T):
W = U @ V.T
loss = ((W - W_target) ** 2).sum() # matrix sensing
opt_gd.zero_grad(); loss.backward(); opt_gd.step()
opt_adam.zero_grad(); loss.backward(); opt_adam.step()
# 关键诊断:每 N 步记录
# - 训练损失(应接近)
# - 有效秩 singular_values(W) > tol 的数量(GD 应单调更低)
# - ||U U.T - U0 U0.T||_F / ||U0 U0.T||_F(GD 应基本不动,
# Adam 应在第一步就跳开,因为打破了规范等变)
把初始化 U0 / V0 在评估循环里同时存一份参考值;规范等变优化器在第一步应保持 U @ U.T 与 U0 @ U0.T 几乎相同,Adam 则不会。
适合谁读
- 想搞清楚"为什么 Muon / Shampoo / GD 在某些任务上系统性优于 Adam"的优化研究者与 LLM 训练工程师。
- 做矩阵分解、低秩建模、推荐系统补全、信号恢复的科研人员 —— 本文给出的判据直接指导优化器选择。
- 关注 LLM 训练隐式正则、模型几何(而不是单纯训练损失曲线)的理论与工程实践者。
- 不适合:纯粹想找到一个"换 Adam 让训练更稳"的工程师 —— 这篇文章不会给你具体的超参清单,但它会告诉你为什么 Adam 在某些任务上系统性差,这才是更长久的判断依据。
工程落地与核查(Jay)
事实核查摘要
可确认(原文支持):
- 规范等变性判据("无记忆规范等变 = Gram 矩阵决定的左预条件器")是数学定理,可逐行验证。相关引文(结构定理 / 迁移定理 / 光谱调度)的编号在 22 页正文框架内可 fetch 核查。
- GitHub 仓库 idevender/loss-basis-adam 可通过 git clone 或 GitHub API 直接验证存在性及 commit 历史。
- Adam 不满足规范等变(per-coordinate update 依赖 V 具体值,不只是 Gram 矩阵)逻辑自洽,与已知优化器理论无矛盾。
存疑 / 待独立核验:
- 56% 第一步 Frobenius 距离:原文是否在真实 Transformer(如 1B+ 参数)上测量,而非单 attention head 的 toy model?原文未明确。若是单头实验,结论外推到完整模型需谨慎。
- 43–44% 测试误差减幅:高光谱数据集名称、采样密度具体数值在 abstract/摘要中均未给出,需 fetch 原文图/表核实。不同采样密度下的误差差异可能极大。
- shared-scalar Adam 定义:论文自定义的"shared-scalar"变体与标准 PyTorch torch.optim.Adam 不等价——标准 Adam 使用 per-coordinate 二阶矩,而 shared-scalar 变体对所有坐标共享一个标量学习率缩放因子。解读将此变体列为"满足规范等变"但未说明该变体在实际训练中的有效性。读者若直接用标准 Adam 跑 LoRA,不会得到"低秩偏置保留"效果。
- Muon Newton-Schulz 迭代的规范等变性:Muon 实际实现中包含 Newton-Schulz 正交化迭代(torch.linalg.solve 或迭代式),该迭代是否严格满足"只依赖 Gram 矩阵"存在数值近似风险;连续迭代中的数值误差是否累积破坏规范等变性,原文未讨论。
可读性精修
- "shared-scalar Adam(共享标量变体)"建议首次出现时加注:"指所有参数共享同一个自适应学习率缩放因子、而非 per-coordinate 的 Adam 变体,与标准 PyTorch Adam 不同"。
- "规范等变优化器保持 float 级精度"——"float 级精度"含义不清,建议改为"保持在 float64 舍入误差量级内(< 1e-6 相对变化)"。
- "GD 在最低采样密度下比 Adam 低 43–44%"——对比的基准是"训练损失相同"但未说明 GD 是否在相同训练步数或相同计算量下比较;若 GD 需要更多步数则该对比需重新解读。
工程落地补强
原文已覆盖 LoRA 场景的启发,以下从工程角度补充:
1. LoRA + Adam 的实际风险评估 - 原文理论推断"lr 较小、rank 较低时差异不可观测"与当前主流 LoRA 实践吻合(rank 通常 8~64,lr 1e-4~5e-4,ΔW 在 small-init 邻域内移动有限)。工程结论:当前 LoRA+Adam 组合暂时安全,但大批次(batch≥512)+ 长序列(≥8k)+ 高 lr(>1e-3)的场景是规范等变性破坏效应最可能显现的地方。 - 建议在 RLHF / DPO 这类大批次梯度更新阶段监控 ΔW 的有效秩变化;若有效秩在训练过程中持续上升(即 ΔW 逐渐偏离低秩结构),则是 Adam 破坏隐式正则的可观测信号。
2. Muon 工程实现的坑
- Muon 的 Newton-Schulz 正交化对矩阵条件数敏感(cond(W) > 1e6 时 solve 数值不稳定);实际大模型中 V⊤V 的条件数经常很高,需要 torch.linalg.solve 加正则或改用稳定性更高的共轭梯度实现。
- Muon 每次步需要额外的矩阵乘法(U @ (V.T @ V))或正交化开销,相比 Adam 约多 15-25% 显存(因为需要同时存 U 和 V 的梯度)和 10-20% 单步时间。在 70B+ 训练中这个 overhead 需 benchmark 确认是否合算。
3. 实践中的"规范等变监控"最小实现 在训练 loop 中每 N 步加以下诊断(~5 行):
# 每 N 步记录,诊断规范等变是否被破坏
UUT0 = (U0 @ V0.T) @ (U0 @ V0.T).T # 初始化 Gram 参考
UUT_t = (U @ V.T) @ (U @ V.T).T
gauge_shift = torch.linalg.norm(UUT_t - UUT0, 'fro') / torch.linalg.norm(UUT0, 'fro')
writer.add_scalar('diag/gauge_shift', gauge_shift, global_step)
# Adam:gauge_shift 在第一步就 > 1e-2;规范等变优化器应 < 1e-5
此指标无需访问 W 本身,只需存 U0/V0,适用于黑盒训练监控。
4. 研究方向补充 - K-FAC、SOAP 等二阶方法是否满足规范等变,是本文分类定理的直接延伸,2026-2027 年值得关注。 - 对已用 Adam 预训练的模型做 LoRA fine-tune 时,ΔW 的初始化与 Adam 状态(如 exp_avg / exp_avg_sq)之间的交互是否引入额外偏差,尚未有实证研究。