Muon 优化器深度解析:从 Newton-Schulz 正交化更新到 MuonClip/QK-Clip 稳定万亿参数训练的矩阵优化新范式

发布时间:2026/7/24 6:14:36
Muon 优化器深度解析:从 Newton-Schulz 正交化更新到 MuonClip/QK-Clip 稳定万亿参数训练的矩阵优化新范式 Muon 优化器深度解析:从 Newton-Schulz 正交化更新到 MuonClip/QK-Clip 稳定万亿参数训练的矩阵优化新范式核心痛点:AdamW 统治大模型训练近十年,但其逐元素自适应学习率忽略了权重矩阵的"矩阵结构",导致更新方向被少数主奇异值主导、样本效率触及天花板;而历史上号称超越 AdamW 的二阶优化器(Shampoo、K-FAC 等)要么显存翻倍、要么算力开销过大、要么在大规模训练下数值不稳定,始终无法真正落地。Muon 优化器首次以低于 1% 的算力开销、bf16 数值稳定的 Newton-Schulz 迭代实现更新矩阵正交化,并经 Moonlight 与 Kimi K2 验证可稳定扩展到万亿参数、15.5T token 的工业级训练适配人群:大模型预训练工程师、深度学习框架与优化器研发者、分布式训练基础设施架构师、AI 算法研究者、对二阶/矩阵优化与训练稳定性有深入需求的高级从业者收获能力:系统掌握 Muon 的数学本质(更新矩阵的最近半正交投影U V m a t h r m T UV^{mathrm{T}}UVmathrmT)、Newton-Schulz 五次多项式迭代的收敛原理与系数调优、Muon 与 Shampoo 的等价关系推导、Moonlight 规模化两大关键改造(权重衰减 + 一致更新 RMS)、分布式 ZeRO-1 版 Muon 的通信设计、MuonClip 的 QK-Clip 机制如何根治注意力 logit 爆炸,并能在 PyTorch 中从零实现并部署一套生产级 Muon 训练流水线技术背景与演进逻辑AdamW 的统治与结构盲区现状:自 2017 年 Adam 提出、2019 年 AdamW 解耦权重衰减以来,几乎所有主流大模型(GPT 系列、Llama、Qwen 等)均以 AdamW 为默认优化器,其核心是对每个标量参数维护一阶动量m mm与二阶动量v vv,逐元素归一化梯度 - 天然对稀疏梯度与不同尺度参数鲁棒结构盲区 - 倒逼新范式AdamW 把权重矩阵W i n m a t h b b R n × m W in mathbb{R}^{n × m}WinmathbbRn×m拉平成n m nmnm个独立标量处理 - 完全忽略行列之间的相关性与矩阵的奇异值谱结构经验观察:Transformer 中 2D 参数的 SGD-momentum 与 Adam 更新矩阵普遍具有极高条件数(接近低秩),少数几个奇异方向主导了全部更新 - 大量"稀有方向"虽幅度小却对学习至关重要,却被淹没二阶动量v vv使显存占用为参数量的 2 倍(m mm与v vv各一份)- 万亿参数模型的优化器状态成为显存与通信瓶颈结论:需要一种"看见矩阵结构"、又不显著增加算力与显存的优化器深入理解条件数与低秩:把一个n × m n × mn×m更新矩阵做奇异值分解G = U S i g m a V m a t h r m T G = U Sigma V^{mathrm{T}}G=USigmaVmathrmT,条件数定义为最大奇异值与最小非零奇异值之比s i g m a m a x / s i g m a m i n sigma_{max} / sigma_{min}sigmamax​/sigmamin​。经验上 Transformer 权重的梯度/动量矩阵条件数常达到数百甚至上千,意味着能量高度集中在前几个奇异方向 - AdamW 的逐元素归一化虽能拉平"标量维度"上的尺度,却无法改变矩阵在奇异谱上的极端不均衡,反而可能把主方向的噪声一并放大为什么逐元素方法看不见谱结构:Adam 的二阶动量v vv估计的是每个标量位置梯度平方的滑动平均,本质是一个对角预条件子(diagonal preconditioner);而矩阵的奇异结构是行列耦合的全局性质,对角预条件子在数学上无法捕捉行列之间的旋转与相关,这正是"结构盲区"的根源AdamW 更新的数学骨架(便于对比)一阶动量:m t = β 1 m t − 1 + ( 1 − β 1 ) g t m_t = β_1 m_{t-1} + (1-β_1) g_tmt​=β1​mt−1​+(1−β1​)gt​,二阶动量:v t = β 2 v t − 1 + ( 1 − β 2 ) g t 2 v_t = β_2 v_{t-1} + (1-β_2) g_t^2vt​=β2​vt−1​+(1−β2​)gt2​(逐元素平方)偏差校正后更新:W t = W t − 1 − e t a , ( h a t m t / ( s q r t h a t v t + e p s i l o n ) + l a m b d a W t − 1 ) W_t = W_{t-1} - eta,(hat m_t / (sqrt{hat v_t} + epsilon) + lambda W_{t-1})Wt​=Wt−1​−eta,(hatmt​/(sqrthatvt​+epsilon)+lambdaWt−1​)关键性质:AdamW 的更新 RMS(均方根幅度)在训练中稳定在约0.2 0.20.2到0.4 0.40.4,这一"自归一化"特性是它易于调参、跨层稳定的核心,后文可见 Muon 的规模化改造正是为了复现这一性质二阶与矩阵优化的复兴与困境Shampoo(2018):为每个矩阵参数维护左右预条件子L , R L, RL,R,更新形如L − 1 / 4 G R − 1 / 4 L^{-1/4} G R^{-1/4}L−1/4GR−1/4- 理论上逼近全矩阵二阶信息,但预条件子累积与求逆四次方根开销巨大,且需 float32 保证数值稳定K-FAC、SOAP、CASPR 等:沿二阶方向持续演进,但普遍受限于"显存翻倍 + 求逆开销 + 分布式实现复杂"三座大山优化器研究的信任危机:Keller Jordan 指出,学术界充斥着"号称大幅超越 AdamW 却从未被采用"的死亡优化器,根因往往是 AdamW 基线未充分调优 - 他提出应以"竞速任务(NanoGPT speedrun)"作为可自我纠错的证据标准演进时间线(text 树):Muon 及矩阵优化演进时间线 ├── 2015 - Carlson et al.: 随机谱下降 SSD/RMSspectral(SVD 正交化 + 核范数缩放) ├── 2018 - Gupta et al.: Shampoo 预条件张量优化奠基 ├── 2022 - Tuddenham et al.: Orthogonal-SGDM(SVD 正交化梯度) ├── 2024.09 - Bernstein Newhouse: Old Optimizer New Norm(谱范数最速下降 + NS 迭代建议) ├── 2024.10.04 - Keller Jordan: Muon 正式公开(MomentUm Orthogonalized by Newton-Schulz) ├── 2024.10.15 - Muon 刷新 NanoGPT speedrun 记录(提速 35%) ├── 2024.12 - Muon 扩展至 774M/1.5B 参数持续领先 AdamW ├── 2025.02 - Kimi Team: Moonlight(Muon is Scalable,3B/16B MoE,5.7T token,~2x 算力效率) ├── 2025.07 - Moonshot: Kimi K2(1T MoE,15.5T token)以 MuonClip 实现零 loss spike └── 2026 - Gram Newton-Schulz 等硬件感知加速与理论理解持续深化演进必然性:随着模型规模突破万亿参数、训练 token 突破 10T,算力成本成为核心约束,"每 FLOP 训练效率"取代"每步收敛"成为第一优先级。Muon 以近乎免费的算力开销换取约 2 倍的样本效率与更强的训练稳定性,恰好击中规模化时代的核心痛点,从 speedrun 玩具走向工业级基础设施核心原理深度解析Muon 的定义与直觉一句话本质Muon = MomentUm Orthogonalized by Newton-Schulz:先用 SGD-momentum(默认 Nesterov)算出更新矩阵,再用 Newton-Schulz 迭代把它"正交化",最后施加到 2D 隐藏层参数上正交化的语义:把更新矩阵G GG替换成离它最近的半正交矩阵,即m a t h r m O r t h o ( G ) = a r g m i n O , ∣ O − G ∣ F : O m a t h r m T O = I m a t h r m o r O O m a t h r m T = I , mathrm{Ortho}(G) = argmin_{O} {, | O - G |_F : O^{mathrm{T}}O = I mathrm{or} OO^{mathrm{T}} = I ,}mathrmOrtho(G)=argminO​,∣O−G∣F​:OmathrmTO=ImathrmorO