小米承认 MiMo-V2.6 存在重复调用问题,称 9 万美元完成修复

小米承认 MiMo-V2.6 存在重复调用问题,称 9 万美元完成修复

N
News Editor
2026-09-28 07:53:13
小米 MiMo 团队复盘称,MiMo-V2.6 上线后曾出现反复调用相同或相似工具的问题,导致上下文被持续消耗但任务没有推进。团队将原因归结为强化学习奖励设计对低效过程惩罚不足。小米没有采用预计需 231 万美元的完整重训方案,而是训练专门纠正重复调用的 RL teacher,并通过 MOPD 合回 Pro 和 Flash,整轮修复成本约 9 万美元。修复后的权重已开放,API 也已切换到新版。

小米 MiMo 团队复盘了 MiMo-V2.6 上线后的工具调用重复问题。团队表示,模型有时会反复调用相同或高度相似的工具,持续消耗上下文,但任务没有进展。

在 OpenCode 中,Flash 和 Pro 出现重复工具调用的回复占比一度分别达到 1.02% 和 0.54%。

问题出在强化学习奖励设计

小米称,问题根源在于强化学习的奖励设计。训练主要奖励「最后有没有把任务做对」,但没有充分惩罚过程中的低效行为。

原来的规则是,只有单轮工具调用超过 32 次才会处罚,32 次以下的重复调用完全不扣分。随着 RL 规模扩大,这种坏习惯反而被不断强化。

小米回放训练 checkpoint 后发现,Flash 中单轮调用超过 10 次的异常样本比例,从 step 0 的 11.1% 增至 step 20 的 24.6%。

完整重训预计需 231 万美元

团队提到,最直接的修复办法,是把惩罚阈值从 32 次降到 8 次,再重跑约 20 个 MixRL step,但预计要花 231 万美元。

最终采用 RL teacher 修复方案

小米最终没有选择完整重训,而是只训练了一个专门纠正重复调用的 RL teacher,跑 12 个 step、约 7000 个样本,再通过 MOPD 把这项能力合回 Pro 和 Flash。

整轮修复约花 9 万美元,只有完整重训方案的约 4%,其他主要 benchmark 基本保持不变。

新版权重和 API 已上线

小米表示,修复后的 MiMo-V2.6-Pro-MOPD 和 Flash-MOPD 权重已经开放,API 也已经切到新版,调用名称不变。

团队还表示,会重置 MiMo Desktop 用户当前周期的剩余额度。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。