罗福莉称 MiMo-V2.6 研发挑战已超过其参与的 DeepSeek R1

罗福莉称 MiMo-V2.6 研发挑战已超过其参与的 DeepSeek R1

N
News Editor
2026-09-22 03:57:17
小米 MiMo 负责人罗福莉在 MiMo-V2.6 发布后解释称,这一版本背后的研究创新和工程挑战已超过她曾参与的 DeepSeek R1。她同时说明了 MiMo 采用 MixRL 与 MOPD 的原因:前者将代码、通用 Agent、视觉和网络安全等可验证任务混合训练,后者则单独处理超长、难验证或奖励主观的任务,再将能力整合回主模型。

小米 MiMo 负责人罗福莉在 MiMo-V2.6 发布后,进一步解释了这一轮强化学习方案。她表示,自己曾参与 DeepSeek R1,而在她看来,MiMo-V2.6 背后的研究创新和工程挑战已经超过 R1。

罗福莉还说明了 MiMo 同时使用 MixRL 和 MOPD 的原因。她称,MixRL 是把代码、通用 Agent、视觉和网络安全等可验证任务,放在同一轮强化学习中一起训练。

MOPD 则用于处理超长、难验证或奖励较主观的任务。这类任务会先单独训练,随后再把相关能力整合回主模型。

她举例称,游戏和 3D 任务单次运行时间较长,也不容易自动判断结果对错。如果把这类任务与代码等任务放在同一轮 RL 里,会明显拖慢训练。基于这一点,MiMo 将这类任务拆开单独训练,再通过 MOPD 把学到的能力合回主模型。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。