Meta FAIR 联合牛津大学、伦敦大学学院的研究团队发布 AI 研究偏好模型 RPM,目标是在执行耗时的 GPU 实验前,先对候选实验方案进行排序,只运行最有潜力的方案。
RPM 包含两种变体,分别是仅推理版本和智能体驱动版本。该模型使用冻结的预训练大模型 Qwen3.6-27B,相关框架 AIRA-dojo 和基准 AIRS-Bench 已开源。
AIRS-Bench 测试结果
在 AIRS-Bench 的测试中,使用 RPM 后,平均归一化得分从随机选择时的 0.684,提升至 0.711(仅推理)和 0.729(智能体驱动)。
效率方面,两种 RPM 都能在约 15 小时内达到基线模型 24 小时的性能水平,对应约 1.5-1.6 倍加速。
其他基准表现
这项研究还在 WinoGrande 和 SVAMP 基准上取得了新的最高性能记录。
该消息由 MarkTechPost 提及,Techub 进行了发布。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

