大模型真的越大越好吗?这篇论文把"省钱公式"算出来了——Loop × MoE 的第一张联合缩放图
- 关联论文:2609.40316
你有没有这种感觉 🤖?
你做 LLM 训练,老板批了 100 万美金算力预算。你在两个方案之间来回翻:方案 A 是用 2× 参数的标准 dense 模型(路线成熟,业界用过);方案 B 是参数减半、但每个 token 让模型"多想几遍"的循环模型(looped),加上"每次只激活部分专家"的 MoE(路线前沿,工程坑多)。
你盯着两组数字看了一晚上,没人告诉你同等算力下哪个赢。业内常说"loop 一次等于加 N 个参数"——但真的能加多少?是不是循环到第 8 次就开始"想多了没收益"?MoE 加 16 个专家到底值不值?
这不是你的问题。这是 2026 年,整个大模型架构圈都缺一张"loop × MoE 联合缩放图"——也就是在同一张图上回答"循环次数 R 和专家数 E 该怎么分预算"。
2026 年 10 月,一篇来自 arXiv 2609.40316 的论文说:这事能算了,而且算得很干净。
一句话故事
第一次把「循环复用(looped transformer)」与「MoE 稀疏(mixture-of-experts)」放进同一张 loss 公式——写出「有界的、与 sparsity 条件耦合的 recurrence mapping」:每次循环带来的有效参数会饱和收敛,上限随专家数 E 抬升。在 Qwen3.5 / DeepSeek-V3 风格的模型上实测,sparsity 给出 ~3× active-parameter 效率、recurrence 给出 ~2× total-parameter 效率,联合可外推到 trillion-token 量级,匹配 2× 大的 non-looped MoE。
这件事的意义不是"模型又变强了"——它给所有做 LLM 架构选型、端云协同、推理服务的团队一张可直接用的预算分配表:给定总算力 F 和显存 mem,反解出 (R, E),不用 grid search。
为什么这件事离你不远
这事不只跟训练大模型的人有关——它影响你日常用的每一款 AI 产品:
- 📱 手机/嵌入式 AI:端侧显存 6GB 是硬天花板——"循环 + 稀疏"是少数能跑出 2B 级模型能力、又塞进手机的组合
- 💬 推理服务 SLA:GPT 类服务在高峰期降延迟,靠什么?论文里 R 作为"测试时算力旋钮"是直接可用的工程动作
- 🤖 具身/机器人模型:本地推理必须够快、参数不能太大——loop + MoE 是当下最热的方向
- 💰 GPU 预算:训练成本随 R 线性增长,旧公式会让你高估 1~2 个 loss 点 = 浪费几十万美金算力
核心方法(人话版)
1. 旧公式的毛病
- Chinchilla 系:只覆盖 dense 的"参数 + 数据",对 MoE 和 loop 都失效
- Parcae / Iso-Depth(looped dense):默认"循环越多 = 参数越多"线性/幂律外推——但实测会 plateau,循环到 R=8 之后几乎没收益
- Clark / Ludziejewski(MoE):默认 R=1(不循环),没法回答"再 loop 一次同一个 MoE 能换来多少 loss"
三套公式互不通约,预算遇到 looped MoE 时只能网格暴力扫。
2. 新公式:一个变量、两个回归
# 关键公式(人话版)
N_eff(N, R, E) = N + Δ_max(E) × (1 - exp(-R / τ(E)))
# Δ_max(E): 循环到「无穷」时能多挤出来的有效参数,随 E 增大(专家多 → 上限高)
# τ(E) : 增益衰减常数,随 E 增大(专家多 → 衰减更慢)
反直觉的两件事:
- 循环不是免费的——
F_train = 6 × N_unroll(R) × D随 R 线性增长,多循环一次 = 多烧一份训练算力 - 循环也不是无限的——R → ∞ 时 N_eff 单向收敛到
N + Δ_max(E),不再像旧公式那样无限叠加
3. 退化为特例(这张图是真统一,不是叠加)
- E=1(dense-loop)→ 旧 Parcae 公式的 bounded 版
- R=1(标准 MoE)→ 旧 Clark 公式
- E=1 且 R=1 → Chinchilla
三层退化 = 一张图,不是拼凑。
4. 怎么用:反解 (R, E)
给定 (F_train, F_inference, memory_budget),反向求"最优点"——
# 工程小版伪代码(生产前请等 GitHub)
def solve_loop_moe(F_train, F_inf, mem_budget, Δ_max_fn, τ_fn):
# 1) 固定 E 候选
candidates = [(E, solve_R(E, F_train, F_inf, mem_budget, Δ_max_fn, τ_fn))
for E in [2, 4, 8, 16]]
# 2) 选最小 loss 的 (R, E)
return min(candidates, key=lambda x: predict_loss(x[1], x[0]))
论文给出反解公式 → 直接落地——不必再 sweep 整张图。
关键数据(数字 verbatim)
| 项 | 数字 | 来源 |
|---|---|---|
| sparsity 效率 | ~3× active-parameter | abstract |
| recurrence 效率 | ~2× total-parameter | abstract |
| trillion-token 对照 | 0.3B active / 1.3B total vs 0.6B / 2.9B 同算力 | Table |
| 下游 benchmark | 14 个(reasoning 重点) | abstract |
| 退化覆盖 | E=1/R=1/R=E=1 三层 | §3.1 |
| 论文页数 | 19 页 + 完整 HTML | HTML v1 |
对工程落地的硬约束(Jay 核查)
事实核查(可锚定 ✅)
- 公式
N_eff(N,R,E) = N + Δ_max(E)(1-exp(-R/τ(E)))在 §3.1 完整呈现 ✅ - "sparsity ~3×、recurrence ~2×" 在 abstract 有具体数字 ✅
- trillion-token 对照用 0.3B/1.3B vs 0.6B/2.9B 来自 Table ✅
存疑待核(⚠️ 诚实标注)
- ⚠️ 14 个下游 benchmark 全清单 abstract 未列——是否含 code/Math 待 PDF §4
- ⚠️ R≥10 区域 plateau 具体阈值未明——plateau 从 R=8 还是 R=12 开始不清楚
- ⚠️ Δ_max(E)/τ(E) 拟合 RMSE 数字原文未给单点值
- ⚠️ 与并发工作 SMELT / Sparse Layers 的 ablation 隔离表未给
明显错误(就地修正)
- 公式
N_eff(N, R, E) = N + Δ(R, R; E)中Δ(R, R; E)第二个 R 是 HTML 笔误或特定记号——建议读者查 PDF §3.1 原文公式
工程落地 5 条补强
1. 实际系统:loop MoE 训练框架的 R-E 联调流程
- Step 1: 固定 F,设定 E ∈ {2,4,8,16}
- Step 2: 每个 E 在 R ∈ {1,2,4,6,8,12} 上拟合 Δ_max、τ
- Step 3: 给定 (F, mem),用反解法求 (R, E),不要 grid search
- 坑:E=16/R=12 区域旧公式过估 1~2 个 loss 点 → 直接用论文反解
2. 实际系统:推理服务中 R 旋钮的动态调度
if SLA_tight:
R = max(1, R_current - 1) # 降 R,降延迟
elif throughput_priority:
R = R_current + 1 # 升 R,增吞吐,降 loss
- 坑:R 调整时 KV cache 必须重算(全连接 Attention 无法跨 R 复用)→ R=8 时延迟约为 R=1 的 6~8 倍
- 修复:先在 R ∈ {1,2,4,8} 四档测 P99,再上线
3. 实际系统:MoE 路由在 R>1 时的状态正确性
- 坑:E>1 且 R>1 时,路由在每个循环步可能产生不同决策;KV cache 共享导致状态混淆 → N_eff 理论值与实测不符
- 修复:训练脚本加路由一致性 log:每个 token 在每 R 步的 top-1 expert ID;相邻 R 步 ID Pearson >0.9 则路由退化
4. 实际系统:端侧部署的显存边界
- 例子:N_act=0.3B,N_loop=0.1B,端侧 6GB(约 12B fp16)
- R=1: 0.3B → 0.6GB ✅
- R=8: 1.0B → 2GB ✅
- R=20: 2.2B → 4.4GB ⚠️ 临界
- 端侧部署按总显存反推 R 上限,不含 KV cache / optimizer 状态
5. 核查清单(生产部署前必过)
| 核查项 | 状态 | 说明 |
|---|---|---|
| GitHub 官方代码 | ❌ 未公开 | 诚实标注;生产前需自复现 |
| 14 benchmark 全清单 | ⚠️ 待核 | 需 PDF §4 |
| Δ_max/τ 拟合脚本 | ⚠️ 未公开 | 需自拟合 |
| R≥10 plateau 阈值 | ⚠️ 未明确 | plateau 从哪个 R 起原文未给 |
| 路由一致性 | ⚠️ 存疑 | 未在公开资料验证 |
给 AI 产品经理的 3 个启示
- 算力预算分配不是"凭感觉拍脑袋"——给定 (F, mem),先用反解法求 (R, E),再决定扩 E 还是叠 R
- 延迟不是不能动——把 R 当 SLA 旋钮:高峰降 R、闲时升 R,不重训、显存固定
- 端云协同部署有捷径——云侧用大 E,端侧用大 R,两套加成可以叠加,不必二选一
一句话总结
arXiv 2609.40316 第一次把 looped transformer 与 MoE 放进同一张 loss 公式,用"有界的、与 sparsity 条件耦合的 recurrence mapping"取代旧 unbounded 线性/幂律外推——给出 ~3× sparsity 效率 × ~2× recurrence 效率的独立加成,并把"loop × MoE 联合缩放"从经验网格实验升级为可直接反解的工程公式。这是 2026 年大模型架构选型最值得读的一篇 scaling law 论文——也是所有做端云协同部署、推理服务 SLA 调度、端侧 AI 的团队该抄的"前置公式"。
论文 arXiv:https://arxiv.org/abs/2609.40316
三个标题变体
反直觉版:大模型真的越大越好吗?这篇论文把"省钱公式"算出来了——Loop × MoE 的第一张联合缩放图 数字钩子版:3× + 2× = 6×?——一篇论文把大模型"循环 + 稀疏"两条省钱路径合并成一张可查的预算表 类比版:大模型版的"高德地图":给定算力和显存,反解最优循环次数与专家数——不用 grid search 了
📱 小红书风格卡片文案(可直接发布)
🤖 大模型不是越大越好——这篇论文把"省钱公式"算出来了
为什么 Qwen3、DeepSeek-V3 都在用 "循环 + MoE"?
背后站着 arXiv 2609.40316 的联合缩放定律。
🔍 它干了什么反常识的事? - 第一次把循环复用(R)+ 专家数(E)放进同一张 loss 公式 - 推翻旧"循环越多 = 参数越多"的线性外推——实测 R≥8 就 plateau - 写出了"有界的、依赖 sparsity 的 recurrence mapping"
💡 3 个让工程圈沉默的洞察: 1️⃣ 循环不是免费的:训练成本随 R 线性增长,多循环一次 = 多烧一份算力 2️⃣ sparsity + recurrence 是独立加成:~3× active 效率 × ~2× total 效率 = 不必二选一 3️⃣ 反解法替代 grid search:给定 (算力, 显存),反解 (R, E),直接给出最优点
📌 对今天的硬约束: - 端侧 6GB 显存上限:loop + MoE 是少数能跑出 2B 能力又塞进手机的组合 - 推理服务 SLA:把 R 当测试时算力旋钮——高峰降 R、闲时升 R,不重训、显存固定 - 训练预算:旧公式让你高估 1~2 个 loss 点 = 浪费几十万美金算力
🔗 arXiv:https://arxiv.org/abs/2609.40316