Muon 优化器:矩阵正交化如何让大模型训练效率翻倍

Muon 优化器通过对权重矩阵的 momentum 做近似正交化,让更新能量均衡分布在所有方向,相比 AdamW 节省约 48% 的训练 FLOPs。Kimi K2 的增强版 MuonClip 在 1 万亿参数、15.5T tokens 训练中实现零损失尖峰,标志着 Muon 从学术研究走向工业级应用。
2026 年 7 月,Kimi K2、DeepSeek V4 等万亿参数模型先后披露使用了 Muon 优化器。这个由 Keller Jordan 等人在 2024 年提出的新型优化器,正在重塑大模型训练的工程经济学——用更少的算力,达到更好的训练效果。
一、AdamW 的瓶颈:逐元素自适应的局限
自 2014 年 Adam 问世以来,它一直是深度学习的事实标准优化器。AdamW(带解耦权重衰减的 Adam)为每个参数维护两个动量:一阶动量 m(方向)和二阶动量 v(波动)。更新时按 m / sqrt(v) 逐元素自适应调整学习率。
这种逐元素(element-wise)的自适应在中小模型上效果显著,但存在根本局限:它把权重矩阵当成"一堆独立的数字"处理,完全忽略了矩阵的二维结构。研究表明,AdamW 生成的更新矩阵往往是高条件数的(condition number 高),即更新能量集中在少数几个主方向,大部分维度几乎没被有效更新。
图1:AdamW 与 Muon 更新矩阵的奇异值分布对比
二、Muon 的核心:Newton-Schulz 正交化
Muon 的核心创新是:对 momentum 矩阵做近似正交化。给定一个 momentum 矩阵 M,Muon 用 Newton-Schulz 迭代把它近似正交化为 M',使得 M' 的所有奇异值都接近 1。这样更新能量被强制均衡分布到所有方向。
正交化的几何意义:把矩阵的列向量想象成空间中的箭头,正交化让这些箭头互相垂直且长度相等。原本"一个方向占主导"的更新,被重塑为"所有方向均衡发力"。这种均衡探索对逃离高维空间中的鞍点至关重要——鞍点处大多数方向梯度接近零,只有少数方向有真实下降信号,Muon 的正交化确保这些"少数真实方向"不被"多数噪声方向"淹没。
从内存角度看,Muon 还有一个隐藏优势:只需要 2 copies 显存(参数 + momentum),而 AdamW 需要 3 copies(参数 + 一阶动量 + 二阶动量)。对 7B 模型,Muon 节省约 28GB 显存;对万亿参数模型,这个节省是决定性的。
三、Moonlight 实证:52% FLOPs 达到同等 loss
Moonshot 与 UCLA 的论文《Muon is Scalable for LLM Training》给出了量化证据。在 scaling-law 实验中,Muon 达到 AdamW 同等 validation loss 大约只需要 52% 的训练 FLOPs。换句话说,如果 AdamW 需要 100 单位训练计算量到达某个 loss,Muon 大约 52 单位就能到。
这个数字的工业意义巨大。Kimi/Moonlight 模型(3B/16B 参数的 MoE)用 Muon 训练了 5.7T tokens,在更少的训练 FLOPs 下实现了更好的性能,改进了当前的帕累托前沿。Kimi K2 进一步把 Muon 扩展到 1.04 万亿参数、15.5T tokens 训练,这是 Muon 系列优化器首次在万亿参数级别的工业应用。
四、MuonClip:从 Muon 到工业级稳定
纯 Muon 在万亿参数级别遇到了一个严重问题:注意力 logits 爆炸。Muon 的更新允许 Query/Key 权重矩阵的谱范数更自由地增长(尤其在高学习率下),加剧 logits 爆炸。在中等规模(9B 激活/53B 总参数)的 MoE 模型训练中,注意力 logits 快速超过 1000 的量级,导致数值不稳定甚至训练发散。
为了解决这个问题,Moonshot 团队提出了 MuonClip,在 Muon 基础上集成三个关键改进:权重衰减控制权重增长;RMS 一致性匹配确保更新规模在所有层间一致;QK-Clip 是核心创新——每次优化器步骤后检查 Q/K 权重矩阵的注意力 logits,超过阈值(通常 100)就缩放权重,从源头预防 logits 爆炸。
效果是惊人的:Kimi K2 在 15.5T tokens 训练过程中实现零损失尖峰,损失曲线完全平滑稳定。这在大规模 LLM 训练中极为罕见——通常万亿参数训练会出现多次 loss spike,每次都可能导致整个 run 报废。MuonClip 让工程师可以更激进地配置学习率和 batch size,进一步提升训练效率。
五、Muon 的边界与未来
Muon 并非万能。它只适用于二维权重矩阵(即 Transformer 中的线性层),对 embedding、LayerNorm、bias 等一维参数无能为力——这些仍需 AdamW 处理。因此实践中通常是"Muon 优化 2D 矩阵 + AdamW 优化 1D 参数"的混合策略。
未来的方向包括:AdaMuon(在 Muon 的结构化更新上添加逐元素自适应)、Gluon(优化 LMO 理论与实践的桥梁)、以及多模态扩展和 RLHF 适配。Kimi K2 和 MuonClip 的开源,为社区提供了宝贵的工业级实践参考,预期会看到更多研究机构和公司采用 Muon 系列优化器。
关联推荐
- 斯坦福 AUTOMEM:AI 学会"记笔记",小模型追平大模型 — 训练效率的另一条路径
- 康奈尔哈佛联合:AI 大模型分工合作效率飙升 2.6 倍 — 模型协作提升效率
- Bonsai 27B:27B级AI模型首次在手机上运行 — 训练效率决定部署可行性
评论 (0)
加载评论中…