Looped Transformer 成本收益全解析:从 GPT-6 Astra 传闻到 SMELT 缩放定律 · 干货攻略

  • 链接:https://x.com/rasbt/status/2097677950262939931
  • 分类:x-tips
  • 来源:X @rasbt
  • 作者:Jay
  • 更新:2026-10-02

这是什么

Looped Transformer(循环 Transformer)是一种通过复用同一组层权重、多次遍历来增加有效计算深度的架构设计。与传统 Transformer 堆叠 N 层独立权重不同,Looped Transformer 将同一组权重作用于输入多次,等效于用更少参数实现更深网络。

典型案例:

  • Nanbeige 4.2-3B:22 层权重复用两次,产生 44 次 block 应用(22 层 × 2 pass);来自 Nanbeige LLM Lab,发布于 2026 年(arXiv:2607.22083)
  • Ouro-Thinking 2.6B:全部层循环 4 次,产生 192 次 block 应用,可学习退出门控
  • SMELT(2026 年 9 月 Tsinghua + ByteDance Seed 论文):中半层循环两次的 MoE 版本,54B 非嵌入参数规模验证

为什么值得关注

2026 年 9 月,The Information 报道 OpenAI 新模型 GPT-6 Astra 可能采用 looped transformer 架构,引发 AI 社区热议。Sebastian Raschka(@rasbt,AI 研究者/作家,拥有大量技术受众)随即发布 mega 长文,从成本 Tradeoff 角度拆解这一架构选择——不是"革命性新魔法",而是参数效率与算力消耗之间的精确权衡。

核心问题:Looped Transformer 究竟是架构优势,还是用算力换深度的花招?


核验过程

官方来源

  1. Sebastian Raschka 博客(sebastianraschka.com/blog/2026/openai-astra-looped-transformers.html) - 原文明确指出:looped transformer 的核心是复用层权重,计算成本约为标准 transformer 的 2 倍(等效 44 层 vs 22 层),但参数量不变。 - 引用 Nanbeige 4.2 技术报告:两次循环达到最佳平衡,保留约 75% 的 token 效率(即相比标准 44 层,looped 版本只用了 75% 的 token 数/计算量达到相近效果)。超过两次循环几乎无提升,反而显著拖慢训练。

  2. SMELT 论文(arXiv:2609.01343,2026 年 9 月 1 日提交,v3 于 2026 年 9 月 11 日) - 作者:Shaowen Wang(清华)、Ge Zhang(字节 Seed)等 - 论文标题:SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers - 核心数据(来自论文摘要,非原帖):

    • 在同时匹配 per-token FLOPs、总参数量、KV cache 三项约束下,SMELT(中半部 50% 层循环 2 次)相比非循环基线节省 6.8–18.0% 的训练 FLOPs
    • 在 54B 非嵌入参数规模验证
    • 下游任务提升最大的是 Code 类任务;在更长上下文、更多 in-context 示例时优势进一步放大
    • 机制分析:第二次遍历减少 attention sink,将注意力权重重新分配给内容相关 token
  3. Nanbeige 4.2 技术报告(经 Raschka 博客引用) - 预训练数据量:28T tokens - 架构:22 层循环两次,等效 44 层 block 应用 - 实测:两次 pass 最佳,token efficiency 约 75%

交叉验证

说法 来源 验证结果
Looped transformer 计算成本约 2× 同深度标准 transformer Raschka 博客 ✅ 合理(两次遍历同权重)
Nanbeige 4.2 两次 pass 保留约 75% token efficiency Raschka 引 Nanbeige 技术报告 ⚠️ 原帖主张;Nanbeige arXiv:2607.22083 存在,但未直接访问技术报告确认,标注存疑
SMELT 节省 6.8–18.0% 训练 FLOPs SMELT 论文摘要 ✅ arXiv:2609.01343 原文一致
SMELT 54B 规模验证 SMELT 论文 ✅ 同上
Code 任务提升最大 SMELT 论文 ✅ 同上

上手步骤

理解架构:Nanbeige 4.2 的 22→44 层循环

输入 → [Layer 1-22] → [Layer 1-22 第二次] → 输出
  (同一套权重,参数不变)

等效深度 44 层,参数量仅 22 层。计算量约 44 层的标准 transformer。

SMELT 配方(若复现 MoE Looped Transformer)

SMELT 论文的发现可作为工程参考:

核心配方(SMELT):
- 循环范围:中半部 50% 层(而非全栈)
- 循环次数:2 次(3-4 次几乎无收益)
- 深度-宽度比:比基线更大(通过窄隐藏维度实现)
- KV cache:调整 GQA ratio + head size 维持不变
- MoE 稀疏度:~97%

实用视角:什么时候 looped transformer 有意义?

场景 适合用 looped transformer? 原因
推理成本敏感 ❌ 约 2× 推理 FLOPs
参数量 / 显存受限 ✅ 相同参数量,更大等效深度
多步推理 / 代码 / 数学 ✅ SMELT 数据显示 code 提升最大
长上下文 ICL 任务 ✅ SMELT 发现更长样本优势更明显
固定 token budget 训练 ✅ SMELT 6.8–18% FLOPs 节省

Huginn/Ouro 等先驱架构参考

  • Huginn(3.5B):prelude-recur-coda 布局,循环中段 50%,2-4-2 层分布
  • Ouro:全栈循环,4 次 pass,可学习退出门控

坑与适用边界

  1. 推理成本加倍:循环 transformer 的推理 FLOPs 与等效深度的标准 transformer 相同,但参数量更少。因此推理速度不一定变慢(取决于 memory-bound vs compute-bound),但计算量确实约 2×。

  2. 75% token efficiency 的含义:Raschka 引用 Nanbeige 报告称 looped 版本保留约 75% 的 token efficiency——即达到相同模型质量,looped 版本消耗的 token 数约为标准 44 层模型的 75%。⚠️ 此数字未经原始 Nanbeige 技术报告直接核实,建议以原报告为准。

  3. SMELT 的优势局限于 matched 场景:SMELT 的 6.8–18% FLOPs 节省是在同时匹配 per-token FLOPs、参数量、KV cache 三项约束下测得的。如果你的场景不满足这些约束,收益可能不同。

  4. 循环超过 2 次几乎无意义:Nanbeige 技术报告明确指出"增加循环次数带来的提升微乎其微,却显著拖慢训练"。SMELT 同样验证 2 次最优。

  5. 并不隐藏 Chain-of-Thought:Raschka 特别指出,looped transformer 本身并不抑制可见的思维链输出。它只是增加隐藏状态中的计算量——这一效果与直接加大模型规模等效。

  6. GPT-6 Astra 是否真的是 looped transformer 尚无定论:Raschka 本人也表示"目前没有任何官方确认",社区普遍持怀疑态度。


一句话结论

Looped Transformer 是一种用同权重多次遍历换等效深度的设计:参数量不变,计算量约翻倍;在 matched compute 场景下(SMELT 验证)可节省 6.8–18% FLOPs,对 Code 和长上下文 ICL 任务提升最显著;Nanbeige 实测两次 pass 最佳,第三次几乎无效——它不是魔法,只是把"更大的模型"做进了"更少的参数"里。


核验来源: 1. Sebastian Raschka 博客:https://sebastianraschka.com/blog/2026/openai-astra-looped-transformers.html 2. SMELT 论文(arXiv:2609.01343,2026-09-01 提交,v3 2026-09-11):https://arxiv.org/abs/2609.01343 3. Nanbeige 4.2 技术报告(经 Raschka 博客引用):arXiv:2607.22083

不确定处:Nanbeige 技术报告"75% token efficiency"数字为 Raschka 博客引用,未经原始报告直接核实,建议以 Nanbeige 官方技术报告为准。