GPT-6 重新带火循环 Transformer:AI变聪明,真的不需要堆参数了? GPT-6真正让人惊讶的可能不是参数而是它学会了“多想几遍”如果你还把 AI 的进步简单理解成“参数越来越多、模型越来越大”那么 GPT-6 这一代模型可能会让你重新思考一个问题AI 的下一场竞争真的还只是比谁的模型更大吗最近围绕 OpenAI 下一代模型以及 Astra 的讨论中一个非常值得技术人员关注的方向重新进入了大众视野——Recurrent Depth也就是循环深度。这个概念听起来有点复杂但它背后的想法其实非常简单。我们平时遇到一个复杂问题如果第一次想不明白会怎么办很简单再想一遍。如果还是没有想明白那就换一个角度继续分析。人类解决复杂问题本来就不是“看一眼然后立刻得到答案”。我们会不断修改自己的判断、补充新的信息、检查之前的推理直到觉得答案足够可靠。那么AI 能不能也这样一个问题让它不要急着回答而是在内部多计算几轮。这就是循环 Transformer 最值得关注的地方。需要特别说明的是目前公开资料并不能证明 GPT-6 Astra 已经正式采用循环深度架构。关于 Astra 使用 Recurrent Depth 的说法主要来自相关媒体报道和技术分析OpenAI 并没有公开确认这一点。因此本文讨论的是一种正在受到关注的技术路线而不是把未经官方确认的架构当成 GPT-6 的既定事实。相关讨论也指出了这一点。01PARTAI 为什么需要“”多想几遍循环的缘由假设你去面试一名工程师。你问他“服务器突然变慢了你会怎么排查”第一个人可能马上回答“看看 CPU、内存、磁盘和网络。”这个答案不能说错但如果另一个人停下来想了几秒钟然后告诉你“如果 CPU 没有打满但请求延迟明显增加我会进一步检查线程池、数据库连接池、GC、锁竞争以及下游服务的尾延迟。”你大概率会认为第二个人更有经验。为什么因为他没有急着给出一个答案而是在扩大问题空间然后逐步排除可能性。复杂问题往往就是这样解决的。一道简单的数学题也许一次计算就够了但一个复杂的算法设计、一个大型系统的故障分析或者一个需要多步推理的数学问题往往需要反复检查。这也是今天推理模型发展的一个核心方向如果一次计算不够那就增加计算量。过去的大模型主要通过“把模型做大”提升能力而现在越来越多人开始研究另一件事模型能不能在回答问题的时候花更多计算时间这就是所谓的Test-Time Compute也就是推理时计算。而循环 Transformer是实现这种思想的一条重要技术路线。02PART传统 Transformer 模型一层一层往下走理解循环 Transformer首先要搞清楚传统 Transformer 是怎么工作的。假设一个 Transformer 有 32 层那么输入进入模型之后会依次经过第 1 层、第 2 层、第 3 层一直到第 32 层。数学上可以写成hl1Fl(hl)这里的 hl 表示第 l 层的隐藏状态而 Fl 则代表第 l 个 Transformer Block。最关键的一点是每一层通常拥有自己独立的参数。也就是说第 1 层是一套参数第 2 层是另一套参数第 3 层又是另一套参数。32 层模型就意味着有 32 个不同的 Transformer Block 串联起来。这种设计非常有效。模型越深通常意味着更强的表达和计算能力。所以过去很长一段时间大模型的发展路线非常明确堆更多层、增加更多参数、使用更多数据、投入更多算力。问题也随之出现。模型越来越大训练成本越来越高显存需求越来越大推理成本也越来越高。于是一个很自然的问题出现了如果我们不增加那么多参数只让现有的 Transformer 多工作几次行不行03PART循环 Transformer 模型不增加专家让同一个专家反复工作循环 Transformer不是不断增加“专家”而是让同一个专家反复工作这就是循环深度 Transformer 的核心思想。它不再简单地把 Transformer Block 一层层堆下去而是拿出一组共享参数的 Transformer 模块让它反复处理同一个隐藏状态。可以写成ht1Rθ(ht,e(x))这里的 Rθ 就是共享参数的循环模块。第一次循环使用它第二次循环还是使用它第三次循环依然使用它。参数没有复制。变化的是隐藏状态。第一次计算得到 h1第二次根据 h1 得到 h2第三次继续得到 h3如此反复。因此它和传统 Transformer 最大的区别可以简单理解为传统 Transformer 更像是“很多不同的人接力处理一个问题”循环 Transformer 则更像是“同一个非常优秀的人把一个问题反复检查很多遍”。这也是“循环深度”这个名字的由来——循环发生在模型的计算深度上而不是简单地沿着输入序列向前移动。04PART循环还需要重新注入输入为什么每次循环这里有一个非常重要、但普通文章经常忽略的技术细节。如果模型一直循环h0→h1→h2→h3→⋯那么循环次数越来越多之后会出现一个问题模型会不会把最开始的问题给“忘掉”因此在循环过程中原始输入的编码 e(x) 可以持续参与计算ht1Rθ(ht,e(x))这里的 e(x) 可以理解成“题目本身的固定信息”。每一轮循环模型不仅要考虑“我上一轮想到了什么”还要重新获得“我最开始到底要解决什么问题”。这个设计非常重要。因为真正的“多想几遍”不是让模型漫无目的地一直计算而是让它围绕同一个问题不断更新自己的内部状态。05PARTAI Huginn 研究直观实验验证如果想真正理解这种架构可以看看 Huginn。Huginn 是一个循环 Transformer 研究模型它把整个网络拆成三个部分Prelude、Core Loop 和 Coda。这个结构其实非常容易理解可以把它想象成先读题 → 反复思考 → 最后作答。Prelude 位于最前面Huginn 使用 2 个普通 Transformer 层把输入 Token 转换成一个比较合适的初始隐藏状态 h0。接下来进入最关键的 Core Loop。这里使用 4 个 Transformer 层作为循环核心但这 4 层并不是复制几十份而是共享同一套参数反复执行。假设循环 32 次那么这 4 层就会被连续执行 32 轮。最后再进入 Coda也就是尾部的 2 个普通 Transformer 层将经过多轮计算之后的隐藏状态转换成最终输出。所以整个结构可以理解成Tokens → Prelude → Core Loop × r → Coda → 下一个 Token这时候一个非常有意思的数字就出现了。如果循环 32 次那么实际执行的层计算次数是24×322132也就是说模型实际进行了相当于132 层计算。但它真正拥有的独立 Transformer 层只有2428所以可以用一句非常形象的话来理解8 层参数反复干了 132 层计算的活。当然这并不意味着它和真正的 132 层普通 Transformer 是等价的。两种架构的参数结构、表达能力和训练方式都不同。但这个例子很好地说明了一件事情模型的参数规模和实际计算深度并不是一回事。06PART循环 Transformer 模型的价值参数固定增加计算过去我们谈论模型规模经常把“参数量”和“计算量”放在一起讨论。一个 1000 亿参数的模型我们会直觉地认为它一定比 100 亿参数的模型“想得更多”。但循环 Transformer 提供了一种完全不同的思路参数可以相对固定但计算次数可以增加。这意味着未来的模型可能出现一种新的 Scaling 方式。以前是模型越做越大。现在则可能是模型不一定继续无限变大而是在需要的时候增加推理计算。这件事情非常重要。因为不是所有问题都值得消耗同样多的算力。你问 AI“日本的首都是哪里”没有必要让它计算几十轮。但你让它设计一个复杂的数据库架构分析一段存在多个潜在 Bug 的代码或者解决一道需要十几步推理的数学题那么增加计算量就非常有价值。于是一个很自然的想法出现了简单问题少算复杂问题多算。07PARTAI 循环计算这就是“自适应计算”假设模型拥有一个计算预算。简单问题只运行 4 次。普通问题运行 16 次。复杂问题运行 32 次。真正困难的问题甚至运行 64 次。这时候模型的计算量就不再是一个固定数字而变成了一个可以动态调整的变量。这就是 Adaptive Compute也就是自适应计算。而这可能会改变我们过去对大模型的一种固有认识模型的“智力”不一定完全取决于它有多少参数也取决于它愿意为一个问题花多少计算。这和现实中的人其实非常相似。让你算一道小学数学题你不会思考十分钟。让你决定是否购买一套房、是否换工作、如何设计一套大型系统你会投入更多时间。因为问题的价值和难度不同应该使用不同的计算预算。08PART循环 Transformer 与 RNN主要区别与联系那它和 RNN 有什么区别很多人第一次看到“循环 Transformer”都会想到 RNN。毕竟 RNN 的核心也是“循环”。但两者的循环方向完全不同。传统 RNN 主要是在序列方向进行循环。例如Token 1 → Token 2 → Token 3 → Token 4。它读取第一个 Token然后把隐藏状态传递给下一个 Token。而循环深度 Transformer 的循环发生在计算深度方向。同一个输入进入 Transformer然后对隐藏状态进行第一次计算 → 第二次计算 → 第三次计算 → 第四次计算……所以可以用一句非常简单的话来区分RNN 是“读完一个词再读下一个词”循环 Transformer 是“针对同一个问题反复计算几遍”。这也是为什么两者虽然都叫 Recurrent但解决的问题并不相同。09PARTAI 不是简单的 32 次循环循环模型的训练如果一个模型推理时可以循环 32 次那么训练的时候是不是也固定循环 32 次事情没有这么简单。一个重要的思路是在训练阶段让模型接触不同的循环次数。有时候循环 4 次有时候 8 次有时候 16 次有时候 32 次甚至更多。这样模型就不能依赖某一个固定的计算深度。它必须逐渐学会无论给我多少计算预算我都应该尽可能利用这些计算。这样到了推理阶段就有可能根据任务难度动态决定计算次数。当然循环次数增加也意味着真实的计算量增加。参数共享可以减少模型需要存储的独立参数但并不会让计算凭空消失。如果一个 4 层循环模块运行 32 次那么它确实要进行 32 轮计算。因此循环 Transformer 真正解决的问题不是“计算成本消失了。”而是“用相对较少的独立参数换取更深的计算过程。”更麻烦的是训练时的显存对于训练来说循环还带来另一个现实问题。深度学习模型进行反向传播时通常需要保存大量中间激活。如果完整保存 32 次循环的计算过程显存开销可能会迅速增加。因此循环模型可以使用截断反向传播等方法只让梯度完整地回传到最后一部分循环从而在训练效果和显存消耗之间取得平衡。这也是理解循环 Transformer 时一个非常容易被忽略的地方参数少不代表训练一定便宜。它减少的是独立参数规模但如果模型真的进行了大量循环计算量仍然存在。所以未来真正有价值的技术并不是简单地说“让模型循环更多次。”而是“让模型知道什么时候值得循环以及循环多少次最合适。”这也是为什么它会和 GPT-6 Astra 联系起来现在我们再回到 GPT-6 Astra。你会发现大家真正感兴趣的其实不是一个简单的“新架构名称”而是一个更大的趋势AI 正在从“把模型做大”逐渐走向“让模型在推理的时候使用更多计算”。过去我们看到的是GPT-3、GPT-4、GPT-5……模型越来越大训练数据越来越多算力越来越强。而现在推理模型正在告诉我们另外一件事模型在回答一个问题的时候也可以花更多计算。循环 Transformer 则把这个思想进一步推进不一定通过生成更多可见的思考 Token 来增加计算也可以直接在模型内部的隐藏状态上进行多轮迭代。这就是所谓的 Latent Reasoning也就是潜在空间中的推理。简单说以前更像是问题 → 写很多“思考过程” → 答案。而循环 Transformer 更像问题 → 内部状态 → 内部状态 → 内部状态 → 答案。大量计算可以发生在模型内部而不一定全部变成用户能够看到的文字。这其实带来了一个新的问题我们还能看懂 AI 吗这可能是循环 Transformer 最值得警惕、同时也最值得研究的地方。如果模型通过显式的 Chain of Thought 进行推理我们至少还能看到一些文字形式的中间过程。但如果越来越多的计算发生在隐藏状态里面h₀ → h₁ → h₂ → h₃ → …… → hₙ那么我们就会面临一个非常现实的问题模型到底是怎么得到这个答案的它为什么在第 17 次循环之后改变了判断为什么第 32 次循环之后认为答案已经足够如果模型内部进行了大量我们无法直接观察的状态更新那么传统的可解释性和监控方法也会面临新的挑战。所以循环 Transformer 并不只是一个“提高模型性能”的技术。它同时把 AI 推理、可解释性、安全和监控这些问题推到了新的位置。10PARTAI 下一阶段的 Scaling不是更大而是更深AI 下一阶段的 Scaling可能不是“更大”而是“更深”如果把过去几年大模型的发展浓缩起来大概可以看到这样一条路线最开始我们关心的是模型有没有足够多的数据。后来我们关心模型有没有足够多的参数。再后来我们开始关心模型有没有足够多的推理计算。而循环 Transformer 提供了一种非常有意思的答案让同一套参数在需要的时候工作更久。这意味着未来的大模型可能同时拥有两个旋钮。一个旋钮控制模型有多大。另一个旋钮控制这个问题要算多久。简单问题快速回答。复杂问题多算几轮。高价值问题反复验证。这其实比单纯把所有问题都交给一个“无限大的模型”更加合理。所以GPT-6 真正值得我们关注的可能不是“6”这个数字我们很容易把 AI 的升级理解成GPT-4 → GPT-5 → GPT-6。仿佛下一代模型最大的变化就是数字变大了。但如果把视野拉得更远一点你会发现真正发生变化的可能是AI 的计算方式正在改变。以前我们希望 AI知道更多。现在我们还希望 AI想得更深。以前我们追求更多参数。现在我们开始研究更多推理计算。而循环 Transformer正好站在这两条路线的交叉点上。它告诉我们一个非常简单、却可能非常重要的道理一个模型变得更聪明并不一定意味着它必须拥有更多参数。有时候它只需要在面对困难问题的时候再认真想一遍。如果未来 GPT-6 乃至更下一代模型真的大量采用类似的循环深度机制那么我们对于“大模型”的理解可能也要改变。我们过去问“这个模型有多少参数”以后可能还要问“这个问题它用了多少计算”甚至还要问“它知道什么时候应该停止思考吗”这可能才是下一代 AI 真正有意思的地方。未来的 AI或许不只是一个“知道很多东西”的机器而是一个知道什么时候该多想几遍的系统。而这一次AI 的进化方向可能不再只是把“大脑”做得更大。而是让这个“大脑”在遇到真正困难的问题时愿意多花一点时间。更多transformerVITswin tranformer 参考头条号人工智能研究所 v号人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程