大模型真的越大越好吗?这篇论文把"省钱公式"算出来了——Loop × MoE 的第一张联合缩放图

  • 关联论文:2609.40316

你有没有这种感觉 🤖?

你做 LLM 训练,老板批了 100 万美金算力预算。你在两个方案之间来回翻:方案 A 是用 2× 参数的标准 dense 模型(路线成熟,业界用过);方案 B 是参数减半、但每个 token 让模型"多想几遍"的循环模型(looped),加上"每次只激活部分专家"的 MoE(路线前沿,工程坑多)。

你盯着两组数字看了一晚上,没人告诉你同等算力下哪个赢。业内常说"loop 一次等于加 N 个参数"——但真的能加多少?是不是循环到第 8 次就开始"想多了没收益"?MoE 加 16 个专家到底值不值?

这不是你的问题。这是 2026 年,整个大模型架构圈都缺一张"loop × MoE 联合缩放图"——也就是在同一张图上回答"循环次数 R 和专家数 E 该怎么分预算"。

2026 年 10 月,一篇来自 arXiv 2609.40316 的论文说:这事能算了,而且算得很干净。

一句话故事

第一次把「循环复用(looped transformer)」与「MoE 稀疏(mixture-of-experts)」放进同一张 loss 公式——写出「有界的、与 sparsity 条件耦合的 recurrence mapping」:每次循环带来的有效参数会饱和收敛,上限随专家数 E 抬升。在 Qwen3.5 / DeepSeek-V3 风格的模型上实测,sparsity 给出 ~3× active-parameter 效率、recurrence 给出 ~2× total-parameter 效率,联合可外推到 trillion-token 量级,匹配 2× 大的 non-looped MoE。

这件事的意义不是"模型又变强了"——它给所有做 LLM 架构选型、端云协同、推理服务的团队一张可直接用的预算分配表:给定总算力 F 和显存 mem,反解出 (R, E),不用 grid search。

为什么这件事离你不远

这事不只跟训练大模型的人有关——它影响你日常用的每一款 AI 产品:

  • 📱 手机/嵌入式 AI:端侧显存 6GB 是硬天花板——"循环 + 稀疏"是少数能跑出 2B 级模型能力、又塞进手机的组合
  • 💬 推理服务 SLA:GPT 类服务在高峰期降延迟,靠什么?论文里 R 作为"测试时算力旋钮"是直接可用的工程动作
  • 🤖 具身/机器人模型:本地推理必须够快、参数不能太大——loop + MoE 是当下最热的方向
  • 💰 GPU 预算:训练成本随 R 线性增长,旧公式会让你高估 1~2 个 loss 点 = 浪费几十万美金算力

核心方法(人话版)

1. 旧公式的毛病

  • Chinchilla 系:只覆盖 dense 的"参数 + 数据",对 MoE 和 loop 都失效
  • Parcae / Iso-Depth(looped dense):默认"循环越多 = 参数越多"线性/幂律外推——但实测会 plateau,循环到 R=8 之后几乎没收益
  • Clark / Ludziejewski(MoE):默认 R=1(不循环),没法回答"再 loop 一次同一个 MoE 能换来多少 loss"

三套公式互不通约,预算遇到 looped MoE 时只能网格暴力扫。

2. 新公式:一个变量、两个回归

# 关键公式(人话版)
N_eff(N, R, E) = N + Δ_max(E) × (1 - exp(-R / τ(E)))

# Δ_max(E): 循环到「无穷」时能多挤出来的有效参数,随 E 增大(专家多 → 上限高)
# τ(E)   : 增益衰减常数,随 E 增大(专家多 → 衰减更慢)

反直觉的两件事:

  1. 循环不是免费的——F_train = 6 × N_unroll(R) × D 随 R 线性增长,多循环一次 = 多烧一份训练算力
  2. 循环也不是无限的——R → ∞ 时 N_eff 单向收敛到 N + Δ_max(E),不再像旧公式那样无限叠加

3. 退化为特例(这张图是真统一,不是叠加)

  • E=1(dense-loop)→ 旧 Parcae 公式的 bounded 版
  • R=1(标准 MoE)→ 旧 Clark 公式
  • E=1 且 R=1 → Chinchilla

三层退化 = 一张图,不是拼凑。

4. 怎么用:反解 (R, E)

给定 (F_train, F_inference, memory_budget),反向求"最优点"——

# 工程小版伪代码(生产前请等 GitHub)
def solve_loop_moe(F_train, F_inf, mem_budget, Δ_max_fn, τ_fn):
    # 1) 固定 E 候选
    candidates = [(E, solve_R(E, F_train, F_inf, mem_budget, Δ_max_fn, τ_fn))
                 for E in [2, 4, 8, 16]]
    # 2) 选最小 loss 的 (R, E)
    return min(candidates, key=lambda x: predict_loss(x[1], x[0]))

论文给出反解公式 → 直接落地——不必再 sweep 整张图。

关键数据(数字 verbatim)

项 数字 来源
sparsity 效率 ~3× active-parameter abstract
recurrence 效率 ~2× total-parameter abstract
trillion-token 对照 0.3B active / 1.3B total vs 0.6B / 2.9B 同算力 Table
下游 benchmark 14 个(reasoning 重点) abstract
退化覆盖 E=1/R=1/R=E=1 三层 §3.1
论文页数 19 页 + 完整 HTML HTML v1

对工程落地的硬约束(Jay 核查)

事实核查(可锚定 ✅)

  • 公式 N_eff(N,R,E) = N + Δ_max(E)(1-exp(-R/τ(E))) 在 §3.1 完整呈现 ✅
  • "sparsity ~3×、recurrence ~2×" 在 abstract 有具体数字 ✅
  • trillion-token 对照用 0.3B/1.3B vs 0.6B/2.9B 来自 Table ✅

存疑待核(⚠️ 诚实标注)

  • ⚠️ 14 个下游 benchmark 全清单 abstract 未列——是否含 code/Math 待 PDF §4
  • ⚠️ R≥10 区域 plateau 具体阈值未明——plateau 从 R=8 还是 R=12 开始不清楚
  • ⚠️ Δ_max(E)/τ(E) 拟合 RMSE 数字原文未给单点值
  • ⚠️ 与并发工作 SMELT / Sparse Layers 的 ablation 隔离表未给

明显错误(就地修正)

  • 公式 N_eff(N, R, E) = N + Δ(R, R; E) 中 Δ(R, R; E) 第二个 R 是 HTML 笔误或特定记号——建议读者查 PDF §3.1 原文公式

工程落地 5 条补强

1. 实际系统:loop MoE 训练框架的 R-E 联调流程

  • Step 1: 固定 F,设定 E ∈ {2,4,8,16}
  • Step 2: 每个 E 在 R ∈ {1,2,4,6,8,12} 上拟合 Δ_max、τ
  • Step 3: 给定 (F, mem),用反解法求 (R, E),不要 grid search
  • 坑:E=16/R=12 区域旧公式过估 1~2 个 loss 点 → 直接用论文反解

2. 实际系统:推理服务中 R 旋钮的动态调度

if SLA_tight:
    R = max(1, R_current - 1)   # 降 R,降延迟
elif throughput_priority:
    R = R_current + 1           # 升 R,增吞吐,降 loss
  • 坑:R 调整时 KV cache 必须重算(全连接 Attention 无法跨 R 复用)→ R=8 时延迟约为 R=1 的 6~8 倍
  • 修复:先在 R ∈ {1,2,4,8} 四档测 P99,再上线

3. 实际系统:MoE 路由在 R>1 时的状态正确性

  • 坑:E>1 且 R>1 时,路由在每个循环步可能产生不同决策;KV cache 共享导致状态混淆 → N_eff 理论值与实测不符
  • 修复:训练脚本加路由一致性 log:每个 token 在每 R 步的 top-1 expert ID;相邻 R 步 ID Pearson >0.9 则路由退化

4. 实际系统:端侧部署的显存边界

  • 例子:N_act=0.3B,N_loop=0.1B,端侧 6GB(约 12B fp16)
  • R=1: 0.3B → 0.6GB ✅
  • R=8: 1.0B → 2GB ✅
  • R=20: 2.2B → 4.4GB ⚠️ 临界
  • 端侧部署按总显存反推 R 上限,不含 KV cache / optimizer 状态

5. 核查清单(生产部署前必过)

核查项 状态 说明
GitHub 官方代码 ❌ 未公开 诚实标注;生产前需自复现
14 benchmark 全清单 ⚠️ 待核 需 PDF §4
Δ_max/τ 拟合脚本 ⚠️ 未公开 需自拟合
R≥10 plateau 阈值 ⚠️ 未明确 plateau 从哪个 R 起原文未给
路由一致性 ⚠️ 存疑 未在公开资料验证

给 AI 产品经理的 3 个启示

  1. 算力预算分配不是"凭感觉拍脑袋"——给定 (F, mem),先用反解法求 (R, E),再决定扩 E 还是叠 R
  2. 延迟不是不能动——把 R 当 SLA 旋钮:高峰降 R、闲时升 R,不重训、显存固定
  3. 端云协同部署有捷径——云侧用大 E,端侧用大 R,两套加成可以叠加,不必二选一

一句话总结

arXiv 2609.40316 第一次把 looped transformer 与 MoE 放进同一张 loss 公式,用"有界的、与 sparsity 条件耦合的 recurrence mapping"取代旧 unbounded 线性/幂律外推——给出 ~3× sparsity 效率 × ~2× recurrence 效率的独立加成,并把"loop × MoE 联合缩放"从经验网格实验升级为可直接反解的工程公式。这是 2026 年大模型架构选型最值得读的一篇 scaling law 论文——也是所有做端云协同部署、推理服务 SLA 调度、端侧 AI 的团队该抄的"前置公式"。

论文 arXiv:https://arxiv.org/abs/2609.40316


三个标题变体

反直觉版:大模型真的越大越好吗?这篇论文把"省钱公式"算出来了——Loop × MoE 的第一张联合缩放图 数字钩子版:3× + 2× = 6×?——一篇论文把大模型"循环 + 稀疏"两条省钱路径合并成一张可查的预算表 类比版:大模型版的"高德地图":给定算力和显存,反解最优循环次数与专家数——不用 grid search 了


📱 小红书风格卡片文案(可直接发布)

🤖 大模型不是越大越好——这篇论文把"省钱公式"算出来了

为什么 Qwen3、DeepSeek-V3 都在用 "循环 + MoE"?
背后站着 arXiv 2609.40316 的联合缩放定律。

🔍 它干了什么反常识的事? - 第一次把循环复用(R)+ 专家数(E)放进同一张 loss 公式 - 推翻旧"循环越多 = 参数越多"的线性外推——实测 R≥8 就 plateau - 写出了"有界的、依赖 sparsity 的 recurrence mapping"

💡 3 个让工程圈沉默的洞察: 1️⃣ 循环不是免费的:训练成本随 R 线性增长,多循环一次 = 多烧一份算力 2️⃣ sparsity + recurrence 是独立加成:~3× active 效率 × ~2× total 效率 = 不必二选一 3️⃣ 反解法替代 grid search:给定 (算力, 显存),反解 (R, E),直接给出最优点

📌 对今天的硬约束: - 端侧 6GB 显存上限:loop + MoE 是少数能跑出 2B 能力又塞进手机的组合 - 推理服务 SLA:把 R 当测试时算力旋钮——高峰降 R、闲时升 R,不重训、显存固定 - 训练预算:旧公式让你高估 1~2 个 loss 点 = 浪费几十万美金算力

🔗 arXiv:https://arxiv.org/abs/2609.40316

大模型 #AI架构 #ScalingLaw #MoE #LLM推理 #端侧AI #论文解读 #深度学习 #AI产品经理 #干货分享