SheepNav
新上线今天0 投票

Muon优化器加速“顿悟”的关键成分:正交化动量而非谱范数约束

近日,一篇来自arXiv的论文(2607.20512)对Muon优化器在模算术任务上更快达到“顿悟”(grokking)的原因进行了深入剖析。此前研究认为,Muon的优势源于“谱范数约束加正交化动量”,但并未区分哪个机制真正起作用。该研究通过多种子、多学习率的消融实验和机制分析,揭示了关键成分:正交化(即Newton-Schulz迭代) 才是加速的根源,而谱范数约束不仅没有贡献,甚至可能带来不稳定性。

消融实验:正交化是核心

研究者将Muon拆解为“仅谱范数约束”和“仅正交化”两个变体,与完整的Muon及AdamW进行对比。结果显示:

  • 仅正交化的优化器在达到grokking阈值的时间上与完整Muon几乎一致;
  • 仅谱范数约束的优化器不仅速度与AdamW相当,而且在某些学习率下表现不可靠;
  • 该结论在不同学习率下均成立。

这说明,Muon的加速效果完全来自正交化步骤,而非谱范数约束。

机制分析:更低谱范数的解

进一步研究发现,正交化优化器达到泛化时,模型的谱范数比AdamW低了约3倍。在控制嵌入更新量的前提下,正交化优化器倾向于收敛到更低范数的解,而不是简单地减少嵌入的扰动幅度。这解释了为何正交化能促进泛化——它引导模型走向更简洁、更稳定的表示。

迭代次数的影响与稳定性权衡

论文还考察了Newton-Schulz迭代次数的影响。将迭代次数从默认的5次减少到1次,虽然能更快达到grokking阈值,但得到的解非常脆弱,容易发生瞬时的性能崩溃(transient collapse)。这种脆弱性随学习率增大而加剧:单次迭代仅在低学习率下快速且稳定,而5次迭代则在各种学习率下都表现稳健。因此,标准配置的5次迭代是更鲁棒的选择。

此外,研究者发现,在正交化优化器中完全去掉谱范数缩放(spectral scaling)并不会造成性能损失,这进一步简化了Muon的实现。

方法论贡献:稳定性感知的评估指标

一个贯穿全文的方法论亮点是:研究者提出了稳定性感知的度量——同时报告首次达到grokking的时间(first-crossing time)和持续泛化的时间(sustained-grok time)。他们指出,仅看首次穿越时间可能会对优化器性能产生误导,因为某些快速达到的泛化可能很快崩塌。使用双指标评估,能更全面地反映优化器的实际表现。

结论与启示

这项研究清晰地分离了Muon优化器中的两个组件,证明正交化动量是加速grokking的有效成分,而谱范数约束并非必要。结果不仅深化了对优化器设计原理的理解,也为实际应用提供了指导:若想加速模型的“顿悟”过程,应优先考虑引入正交化机制,同时注意迭代次数与学习率的平衡,以避免泛化的不稳定性。

论文代码已开源,便于社区复现和进一步探索。

延伸阅读

  1. PhantomFill:当表单要求答案,语言模型便自行编造
  2. 多模态CoLRAG-TF:三重过滤检索破解复杂PDF文档难题
  3. 循环Transformer中的自适应深度:诊断学习型停止门与轨迹读出机制
查看原文