Tilde Research发布Aurora优化器:解决Muon神经元死亡问题,训练效率提升100倍

Tilde Research发布Aurora优化器:解决Muon神经元死亡问题,训练效率提升100倍

N
News Editor 01
2026-07-10 23:00:13
Tilde Research推出Aurora优化器,修复DeepSeek V4等模型使用的Muon优化器中超25%神经元失活缺陷,仅增6%开销即实现100倍训练效率提升,并开源优化器及1.1B预训练模型。
Aurora优化器Muon神经元死亡训练效率开源AI

背景:Muon优化器的局限性

在大型语言模型训练中,优化器是关键组件之一。Muon作为DeepSeek V4、GLM-5等前沿模型广泛采用的优化器,虽曾推动性能提升,但近期研究发现其存在严重缺陷:在训练早期,Muon会导致超过25%的MLP层神经元陷入失活状态(Dead Neurons),严重阻碍模型潜力释放。

问题根源:神经元死亡影响训练效率

神经元死亡是指网络中的部分神经元在训练过程中梯度始终为零,无法更新权重,从而永久失效。Muon优化器因更新方式不均匀,破坏了正交性约束,使得大量神经元在初始阶段便丧失活性,造成计算资源浪费和训练效率下降。这一问题在DeepSeek V4GLM-5等模型中尤为突出。

Aurora:精准修复,效率飞跃

Tilde Research团队最新推出的Aurora优化器,针对Muon的缺陷进行了根本性改进。Aurora通过保证均匀更新维持正交性,有效消除了神经元死亡现象。在保持与Muon相同收敛质量的前提下,Aurora仅增加6%的计算开销,却实现了100倍训练效率提升。这意味着相同计算预算下,模型可以更快收敛或达到更优性能。

基准测试创下新纪录

在多项标准基准测试中,Aurora优化器取得了新的最先进(State-of-the-Art)成绩,验证了其在实际场景中的卓越效果。团队表示,Aurora无需额外超参数调优即可直接替换Muon,极大降低了迁移成本。

全面开源,赋能社区

为了推动AI研究社区的发展,Tilde Research已将Aurora优化器及其配套的1.1B参数预训练模型完全开源。开发者可自由下载、修改和集成,进一步探索其在大规模训练中的潜力。此举有望加速下一代高效训练框架的演进。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。