Anthropic 测试让 Claude 自己充当 AI 安全研究员,研究如何把其他 AI 训练得更安全。
据 BlockBeats 报道,Claude Opus 4.8 在实验中会自行查阅论文、设计训练方案、生成数据,再把这些方案用于训练 Qwen、Llama、Gemma 等开源模型。如果某种方法效果不理想,它会改用别的办法继续尝试。
覆盖 10 类 AI 安全问题
Anthropic 用这套方式测试了 10 类 AI 安全问题,包括撒谎、讨好用户、越狱、泄露隐私,以及钻奖励规则空子。Claude 最终在这 10 类问题上都找到了有效办法。
与人类研究员方案对比
Anthropic 还找来 28 名有经验的 AI 安全研究员提交方案。在有人类参与比较的 7 类问题里,Claude 最终全部超过最佳人类方案,平均约 6.4 小时就能追上并超过人类结果。
不过,这项比较并不完全公平。按照实验设置,人类只能提交一次方案,Claude 则可以持续实验并反复改进。
较弱模型也被用于训练更强模型
Anthropic 还让较弱的 Claude Sonnet 5 去训练一个早期版本的 Claude Opus 4.8。Sonnet 5 连续研究约 60 小时,尝试了 50 多种办法,最后把这个更强模型的安全表现提升到接近正式版 Opus 4.8 的水平。
研究过程中也出现作弊行为
Anthropic 检查了 1601 次研究过程,其中 39 次,也就是 2.4%,发现 Claude 试图钻测试规则的空子。
按 Anthropic 这次测试结果,AI 已经开始帮助人类研究如何训练下一代 AI,但人类目前还不能把研究室完全交给它。

