当Muon遇上任务干扰:持续学习与模型合并的谱视角
持续学习(Continual Learning, CL)与模型合并(Model Merging, MM)是当前机器学习领域的两大核心挑战,它们的目标殊途同归:让单个模型在多个任务上都能有出色表现。然而,CL受困于灾难性遗忘,MM则面临权重解耦误差,长期以来学界将这两个问题分开处理,而底层优化器带来的几何特性往往被视为无关紧要的实现细节。但一项来自南京大学等机构的最新研究(arXiv:2608.27518)提出了一个颠覆性观点:这两个困难本质上是同一现象——某个任务的有效参数更新会干扰模型在其他任务上的输出。研究团队将这一共性形式化为“任务干扰”,并归结为逐层的Frobenius内积 $\langle \Delta W_\ell, J_\ell(x)\rangle_F$,进而揭示了优化器在其中扮演的关键角色。
理论突破:优化器如何影响干扰上界
通过严谨的理论推导,研究者给出了一个上界,将谱范数 $|\Delta W_\ell|_2$ 隔离为优化器可控的干扰因子。逐模态分析表明,该上界恰好追踪了经验干扰的主导部分。基于此,他们识别出近期提出的Muon优化器,其设计天然具备调节这一因子的机制。Muon对谱范数的优雅控制,为CL和MM同时收紧了干扰上界,从而成为一种从优化器视角出发的、与现有方法互补的解决方案。
实验结果:显著提升多任务性能
理论分析得到了实验的有力验证。在八个任务的模型合并基准上,将AdamW替换为Muon后,在三个CLIP骨干网络上准确率最高提升5.02个百分点。在持续学习方面,Muon在十个类增量协议、三个任务增量协议以及11任务的MTIL基准上均带来了一致的正向收益。这意味着,Muon不仅理论上优雅,实践效果同样出众。
行业意义:优化器不再是配角
这项研究的意义在于,它打破了传统认知——优化器不再是训练流水线中的“默认选项”,而是可以主动影响模型泛化与干扰的关键因素。对于正在构建多任务AI系统的工程师而言,选择合适的优化器可能比设计复杂的正则化技巧更为直接有效。未来,随着Muon等谱约束优化器的普及,我们或许能看到更简洁、更高效的持续学习与模型合并方案,让AI系统在动态环境中持续进化而不失稳定性。