让 Transformer 学会“回头“:LIFT 架构如何用教师监督打通深层到浅层的信息回流 从今天觉醒,技术赋予每一个人数字生命让 Transformer 学会回头:LIFT 架构如何用教师监督打通深层到浅层的信息回流① 技术背景:为什么单向高速公路成了瓶颈如果你写过一段简单的 Transformer 推理代码,会发现它有个很固执的特性:信息只会从浅层往深层流动。第 3 层的表示永远不会回传给第 2 层,第 10 层算完的结果也不会影响第 5 层。跨生成步(step)传递信息的唯一通道,就是那个被采样出来的 token。这意味着什么?模型每一步都在重新计算。它想记住我正在写一个关于递归的故事,只能靠把这句话编码进已经生成的 token 里;而它在中间层算出的、那些还没被说出口的备选续写方向,全部被丢掉了。作者把这个现象称为窄通道(narrow channel):信息密度极高的内部状态,被迫压缩成离散的、一次一个的 token。这个问题的价值在于:如果模型能在预训练阶段就学会把深层状态反馈给浅层,那么推理时就可以像 RNN 一样携带状态,却又保留了 Transformer 的并行训练优势。LIFT(Latent Information Feedback Transformer)正是冲着这个目标去的。② 主流方案盘点:三条技术路线要理解 LIFT 的位置,先看它周围的方案。标准 Transformer(基线)。职责清晰:自回归预测下一个 token,完全前馈。代表就是当前主流的 GPT-5.5、Qwen3.6 Max、GLM 5.1 这类 decoder-only 架构。优点是训练完全并行,缺点是上面说的窄通道。循环/状态类架构。如早期的 RNN、近年的状态空间模型(Mamba 系列)、以及各种 recurrent transformer 变体。它们的核心思路是显式维护一个隐藏状态并跨步传递。问题是训练时难以并行,或者状态容量受限。LIFT(本文方案)。它的巧妙之处在于:把循环状态学习转化成一个教师强制的预测问题。具体做法是:每个输入 token 都配对一个信息稠密的状态,这个状态来自一个现成的预训练 LM 的下一 token 分布。模型被扩展少量参数,同时预测下一个 token和下一个状态。因为输入状态是预计算好的,预训练依然完全并行;推理时才把自己的预测状态反馈回去。关键抽象是:状态是监督信号,不是架构约束。这跟纯粹改架构的思路完全不同。③ 对比与优劣维度标准 Transformer循环/SSM 类LIFT训练并行性完全并行受限/需特殊处理完全并行(状态预计算)推理开销无额外状态更新开销轻微,随模型增大而摊薄信息下行通道仅 token显式状态显式状态(学习得到)额外参数—状态模块少量代表规模135M–1B视实现135M–1B(论文验证)论文的实验结论值得注意:在 token 匹配预算下,LIFT 在语言建模、下游推理和程序性任务上稳定优于标准 Transformer 和基线;在 compute 匹配下也能持平或领先。更狠的是一个状态追踪任务的对照实验:一个很小的 LIFT,即使是用一个任务失败的 Transformer 的状态来训练,也能打败用 8 倍数据训练的同等大小 Transformer。这里容易误判的地方是:别以为教师状态必须来自强模型。实验表明,教师本身失败也不致命——模型学到的是如何利用反馈这个能力,而不是照抄教师答案。④ 选型建议场景一:学生做课程项目/作品集。如果你想展示对超越标准 Transformer的理解,可以从复现 LIFT 的最小版本入手:选一个 135M 级别的小模型,用它的下一 token 分布构造状态监督,训练一个带状态预测头的变体。这段经历写进作品集,比我 fine-tune 了一个 GPT有辨识度得多。场景二:需要长程状态追踪的任务(如代码执行模拟、多步推理)。LIFT 的状态反馈天然适合这类需要记住中间结论的场景,值得优先尝试。场景三:纯追求推理吞吐的生产部署。如果你的瓶颈在延迟而非质量,标准 Transformer 依然简单可靠;LIFT 的额外开销虽小,但引入状态管理会复杂化工程链路。面试常被追问的点:“状态预计算为什么能保证并行?”答案在于状态来自固定的教师模型,与当前模型参数无关,所以每个位置的状态可以离线算好,训练时直接查表。⑤ 未来展望LIFT 打开的方向是用可扩展的教师监督教会模型利用反馈。已经出现的趋势是:状态监督可能从单一教师扩展到多教师集成,甚至自蒸馏。仍未解决的问题包括:推理时误差累积如何控制(预测状态喂回去会漂移)、状态维度如何随模型规模自适应、以及这种反馈能力能否迁移到多模态。对学习者来说,这是一个很好的切入点:它把架构创新和训练目标创新缝在了一起,理解它,你就同时摸到了两条主线。