
一、文章主要内容和创新点主要内容本文提出了一种名为Lizard(Linearizing Softmax Attention with Recurrent Gate Dynamics)的线性化框架,旨在解决基于Transformer的大型语言模型(LLMs)在长上下文生成中面临的内存和计算瓶颈(因softmax注意力的二次复杂度和键值缓存(KV cache)增长导致)。Lizard通过构建亚二次注意力机制,在逼近softmax注意力输出质量的同时,实现高效的长上下文处理。其核心是结合门控线性注意力(Gated Linear Attention, GLA)和带元记忆的滑动窗口注意力(Sliding Window Attention with Meta Memory, SWA)形成混合机制:GLA用于压缩全局上下文,SWA保留局部精细交互。训练分为两个阶段:注意力逼近阶段:训练亚二次模块模仿softmax注意力输出;微调阶段:将线性化模型适配下游语言建模目标。实验表明,Lizard在标准语言建模任务上接近教师模型(原始预训练模型)的性能,在5-shot MMLU基准上比现有线性化方法提升18个点,在联想回忆任务中表现显著,且支持恒定内存推理,适用于无限上下文生成。创新点引入可学习门控模块:不同于现有固定结构的线性化方法,门控模块实现自适应内存控制,支持恒定内存推理