小米 MiMo 负责人罗福莉在 MiMo-V2.6 发布后,进一步解释了这一轮强化学习方案。她表示,自己曾参与 DeepSeek R1,而在她看来,MiMo-V2.6 背后的研究创新和工程挑战已经超过 R1。
罗福莉还说明了 MiMo 同时使用 MixRL 和 MOPD 的原因。她称,MixRL 是把代码、通用 Agent、视觉和网络安全等可验证任务,放在同一轮强化学习中一起训练。
MOPD 则用于处理超长、难验证或奖励较主观的任务。这类任务会先单独训练,随后再把相关能力整合回主模型。
她举例称,游戏和 3D 任务单次运行时间较长,也不容易自动判断结果对错。如果把这类任务与代码等任务放在同一轮 RL 里,会明显拖慢训练。基于这一点,MiMo 将这类任务拆开单独训练,再通过 MOPD 把学到的能力合回主模型。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

