Meta AI FAIR 团队于 7 月 29 日发布论文称,强化学习在代码速度优化任务中面临时序测量噪声大、奖励稀疏等难题,导致标准算法稳定性不足。
研究团队构建了 DMC-Optim 基准测试。结果显示,模型通过率最高可提升 64%;在噪声放大条件下,性能提升可达 100% 至 200%。
论文提到,该研究通过重建 AI 模型训练反馈系统,在离线模拟器中结合正确性和执行速度奖励,搭建了可控制时序噪声的校准沙盒环境。测试数据显示,Qwen 2.5 7B 的通过率从 18.0% 提升至 31.3%,CWM 32B 从 30.7% 提升至 50.4%;其中,后者在 LCB 基准上有 83% 的时间优于传统强化学习方法。CryptoBriefing 报道了这一消息。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

