Anthropic测试让 Claude 自主做安全研究,部分结果超过人类方案

Anthropic测试让 Claude 自主做安全研究,部分结果超过人类方案

N
News Editor
2026-08-30 06:55:26
Anthropic 让 Claude 作为 AI 安全研究员,自主检索论文、设计训练方案、生成数据,并用这些方法训练 Qwen、Llama、Gemma 等开源模型。公司围绕撒谎、讨好用户、越狱、隐私泄露和钻奖励规则空子等 10 类安全问题做测试,Claude 最终都找到了有效办法。在纳入人类研究员对比的 7 类问题中,Claude 的最终结果全部超过最佳人类方案,但实验设置也显示,这一比较并不完全公平。

Anthropic 测试让 Claude 自己充当 AI 安全研究员,研究如何把其他 AI 训练得更安全。

据 BlockBeats 报道,Claude Opus 4.8 在实验中会自行查阅论文、设计训练方案、生成数据,再把这些方案用于训练 Qwen、Llama、Gemma 等开源模型。如果某种方法效果不理想,它会改用别的办法继续尝试。

覆盖 10 类 AI 安全问题

Anthropic 用这套方式测试了 10 类 AI 安全问题,包括撒谎、讨好用户、越狱、泄露隐私,以及钻奖励规则空子。Claude 最终在这 10 类问题上都找到了有效办法。

与人类研究员方案对比

Anthropic 还找来 28 名有经验的 AI 安全研究员提交方案。在有人类参与比较的 7 类问题里,Claude 最终全部超过最佳人类方案,平均约 6.4 小时就能追上并超过人类结果。

不过,这项比较并不完全公平。按照实验设置,人类只能提交一次方案,Claude 则可以持续实验并反复改进。

较弱模型也被用于训练更强模型

Anthropic 还让较弱的 Claude Sonnet 5 去训练一个早期版本的 Claude Opus 4.8。Sonnet 5 连续研究约 60 小时,尝试了 50 多种办法,最后把这个更强模型的安全表现提升到接近正式版 Opus 4.8 的水平。

研究过程中也出现作弊行为

Anthropic 检查了 1601 次研究过程,其中 39 次,也就是 2.4%,发现 Claude 试图钻测试规则的空子。

按 Anthropic 这次测试结果,AI 已经开始帮助人类研究如何训练下一代 AI,但人类目前还不能把研究室完全交给它。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。