循环不是「藏 token」——Looped Transformer 原理与 Astra 架构传言纠偏 · 干货攻略

  • 链接: https://x.com/rasbt/status/2095141254958858496
  • 分类: x-tips
  • 来源: X @rasbt
  • 作者: Jay
  • 更新: 2026-09-08

这是什么

Looped Transformer(循环 Transformer),也称 Recurrent Depth 或 Looped Depth Sharing,是一种在训练和推理时将同一组 Transformer 层重复应用多次的架构设计。与传统 Transformer 每个 token 只经过一层 stack 一次不同,Looped Transformer 会让 token 的隐状态反复穿过同一批权重,产生更多 block 应用(effective depth),但参数量不变。

典型案例:Nanbeige 4.2-3B 将 22 层 stack 重复 2 次,得到 44 个 block 应用,参数量维持 3B 非嵌入参数不变。[^1]

为什么值得关注

2026 年 9 月,OpenAI 新模型 Astra 被 The Information 报道采用「recurrent depth / looped transformer」架构,一时间「隐藏 AI 推理过程」「chain-of-thought 被遮蔽」等说法疯传。@rasbt(Sebastian Raschka)在 X 发帖纠偏,引发 375K+ 阅读,成为当周 AI 圈最热技术讨论之一。[^2]

核心问题:Looped Transformer 真的能「藏住」AI 的思考过程吗?

核验过程

官方来源:

  • Nanbeige 4.2 技术报告 §2.1:明确记载,22 层 stack 两轮重复(2-pass)为最佳权衡;相比标准架构,token 效率保留约 75%;更多 pass 几乎没有建模收益,反而显著拖慢训练。[^1]
  • Sebastian Raschka LLM Architecture Gallery(looped-depth-sharing 页):详细图解 Nanbeige 4.2 的循环路径,确认 22 层 → 44 block applications;Ouro-Thinking 2.6B 案例:48 层 × 4 passes = 192 block applications。[^3]
  • Nanbeige 4.2 HuggingFace repotrust_remote_code=True 可直接加载模型,模型卡显示 4B 总参数 / 3B 非嵌入参数,28T tokens 预训练数据。[^4]

交叉验证结论:

说法 来源 核验结果
Nanbeige 4.2 复用 22 层 2 次 → 44 block applications 技术报告 §2.1 ✅ 已确认
两 pass 效率约 75% 标准架构 技术报告 §2.1 ✅ 已确认(rasbt 博客引述,原文未直接读取)
Astra 使用 recurrent depth The Information(未证实) ⚠️ 报道引用源,未官方确认
Looped Transformer = 隐藏 CoT The Information 报道 ❌ rasbt 明确反驳:层复用本身不抑制可见 chain-of-thought
Looped Transformer = 更少推理 token rasbt 推断 ⚠️ 合理推断:若 latent 计算更高效,visible 推理 token 可更少,但不等同「隐藏」

铁律:Astra 的 recurrent depth 用法尚无官方技术报告,攻略中标注为「原帖主张/报道引用,未官方确认」。

技术原理拆解

基础机制

token embedding → [22-layer stack × 2 passes] → RMSNorm → unembedding → output

关键:两次 pass 用的是完全相同的 22 套权重,参数量不变,但计算量翻倍(几乎 2× FLOPs)。内存占用(权重)不变,但 activation memory 和 KV cache 随 pass 数增长。[^3]

学术演进链

  1. Universal Transformers(2018):首个将 recurrent transition + adaptive halting 引入 Transformer 的工作(arXiv:1807.03819)。[^3]
  2. Recurrent Depth(2025):探索 unroll 循环 block 到更深 depth(arXiv:2502.05171)。[^3]
  3. Mixture-of-Recursions / MoR(NeurIPS 2025):给每个 token 加 learned router,动态决定该 token 做 1/2/N 次 pass——简单 token 提前退出,难 token 做更多递归计算(arXiv:2507.10524,GitHub: raymin0223/mixture_of_recursions)。[^5]
  4. Ouro(ByteDance,2025):48 层 × 4 passes = 192 block applications;附 learned exit gate(HuggingFace: ByteDance/Ouro-2.6B-Thinking)。[^3]
  5. Nanbeige 4.2(2026):简化版——固定 2 pass,无 routing,算是 Looped Transformer 的工程化落地案例。

推理链中的 KV Cache 行为

Ouro 的实现中,每层-pass 组合分配独立 cache index。4 passes × 48 layers × 16 KV heads × 128 head dim = 约 1.5 MiB/token(bf16)。Ouro 论文报告:Prefill 阶段需要所有 4 个 cache;解码阶段只复用最后一个 pass 的 cache 可将内存降低 4 倍,且性能损失很小。这是 inference 侧的额外优化,与权重共享是正交的设计选择。[^3]

关键纠偏:循环 ≠ 隐藏推理

rasbt 的核心反驳逻辑:

  1. 层复用本身不抑制可见 CoT:普通 Transformer 层也在 hidden state 里做计算,Looped Transformer 只是多做了一轮。权重复用让计算发生在「不可见文本」的位置增加了一些,但不是主动隐藏。
  2. 推理 token 减少 ≠ 推理被遮蔽:如果模型 latent 计算更高效,visible chain-of-thought token 自然可以更少。这和「把模型scale up」产生的效果一样——GPT 5.6 Luna → GPT 5.6 Sol 也是更少 token 做更多计算。
  3. 真正「遮蔽」可能来自别的东西:The Information 原始报道提到的「obscures chain-of-thought」可能是指 Astra 还用了其他技术(不是 looped transformer 本身),或者记者误解了 looped transformer 的原理。[^2]

坑与适用边界

  • 参数量 vs 计算量的权衡是核心:Looped Transformer 用 2× 计算换 1× 参数量。如果你的场景 memory-bound(显存紧张)但 compute 充裕,这是不错的设计;如果 compute 紧张,效果可能不如直接用更大模型。
  • Token 效率 ~75%:Nanbeige 实测两 pass 约保留 75% token 效率,意味着想要达到同样效果,你需要 1/0.75 ≈ 1.33× 的计算量。这是估算,真实收益取决于任务。
  • Pass 数不是越多越好:Nanbeige 技术报告明确记载,超过 2 pass 几乎无额外收益,但训练成本显著增加。这对固定 pass 数的设计成立;MoR/Ouro 类 learn-to-exit 设计可能有更优的效率曲线。
  • Ouro 类动态 exit 实测局限:Loopie(20B-A2B,July 2026)用了 2 pass,是目前最大 looped 模型;目前公开文献尚未有 loop count 在前沿规模(100B+)上是否仍高效的直接测试。[^3]
  • Astra 架构未官方确认:攻略中所有关于 Astra 的具体描述均来自 The Information 报道或 rasbt 推断,不是 OpenAI 官方声明。

一句话结论

Looped Transformer 本质是「用 2× 计算换 1× 参数」的深度复用工程 trick,与「隐藏 AI 思考」无直接关联;Astra 是否真的用它实现 latent reasoning 尚待官方确认,但即使用了,效果也更接近「更大的模型」而非「更神秘的模型」。


[^1]: Nanbeige 4.2 Technical Report §2.1,引用于 Sebastian Raschka LLM Architecture Gallery(https://sebastianraschka.com/llm-architecture-gallery/looped-depth-sharing/) [^2]: @rasbt X 帖子,2026-09-02,375K+ Views(https://x.com/rasbt/status/2095141254958858496) [^3]: Sebastian Raschka,LLM Architecture Gallery — Looped Depth Sharing(https://sebastianraschka.com/llm-architecture-gallery/looped-depth-sharing/) [^4]: Nanbeige 4.2-3B HuggingFace Repo(https://huggingface.co/Nanbeige/Nanbeige4.2-3B) [^5]: Mixture-of-Recursions,NeurIPS 2025,arXiv:2507.10524(https://github.com/raymin0223/mixture_of_recursions)