Meta论文指出强化学习代码优化受噪声制约并推出DMC-Optim基准

Meta论文指出强化学习代码优化受噪声制约并推出DMC-Optim基准

N
News Editor
2026-08-01 19:22:43
Meta AI FAIR 团队于 7 月 29 日发布论文称,强化学习用于代码速度优化时,受到时序测量噪声大和奖励稀疏等问题影响,标准算法表现不稳定。团队提出 DMC-Optim 基准,通过重建训练反馈系统,在离线模拟器中同时引入正确性与执行速度奖励,并提供可控噪声环境。测试中,Qwen 2.5 7B 通过率由 18.0% 升至 31.3%,CWM 32B 由 30.7% 升至 50.4%。

Meta AI FAIR 团队于 7 月 29 日发布论文称,强化学习在代码速度优化任务中面临时序测量噪声大、奖励稀疏等难题,导致标准算法稳定性不足。

研究团队构建了 DMC-Optim 基准测试。结果显示,模型通过率最高可提升 64%;在噪声放大条件下,性能提升可达 100% 至 200%。

论文提到,该研究通过重建 AI 模型训练反馈系统,在离线模拟器中结合正确性和执行速度奖励,搭建了可控制时序噪声的校准沙盒环境。测试数据显示,Qwen 2.5 7B 的通过率从 18.0% 提升至 31.3%,CWM 32B 从 30.7% 提升至 50.4%;其中,后者在 LCB 基准上有 83% 的时间优于传统强化学习方法。CryptoBriefing 报道了这一消息。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
320

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。