背景:Muon优化器的局限性
在大型语言模型训练中,优化器是关键组件之一。Muon作为DeepSeek V4、GLM-5等前沿模型广泛采用的优化器,虽曾推动性能提升,但近期研究发现其存在严重缺陷:在训练早期,Muon会导致超过25%的MLP层神经元陷入失活状态(Dead Neurons),严重阻碍模型潜力释放。
问题根源:神经元死亡影响训练效率
神经元死亡是指网络中的部分神经元在训练过程中梯度始终为零,无法更新权重,从而永久失效。Muon优化器因更新方式不均匀,破坏了正交性约束,使得大量神经元在初始阶段便丧失活性,造成计算资源浪费和训练效率下降。这一问题在DeepSeek V4和GLM-5等模型中尤为突出。
Aurora:精准修复,效率飞跃
Tilde Research团队最新推出的Aurora优化器,针对Muon的缺陷进行了根本性改进。Aurora通过保证均匀更新和维持正交性,有效消除了神经元死亡现象。在保持与Muon相同收敛质量的前提下,Aurora仅增加6%的计算开销,却实现了100倍训练效率提升。这意味着相同计算预算下,模型可以更快收敛或达到更优性能。
基准测试创下新纪录
在多项标准基准测试中,Aurora优化器取得了新的最先进(State-of-the-Art)成绩,验证了其在实际场景中的卓越效果。团队表示,Aurora无需额外超参数调优即可直接替换Muon,极大降低了迁移成本。
全面开源,赋能社区
为了推动AI研究社区的发展,Tilde Research已将Aurora优化器及其配套的1.1B参数预训练模型完全开源。开发者可自由下载、修改和集成,进一步探索其在大规模训练中的潜力。此举有望加速下一代高效训练框架的演进。

