Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练
Anthropic在最新研究中基于 Claude Opus 4.8 搭建自动化对齐研究员 AAR,让模型自行检索论文、设计方案、生成数据并训练模型。实验覆盖欺骗、谄媚、奖励黑客、隐私侵犯和越狱等 10 类安全问题,安全差距改善幅度为 26% 至 96%。在部分任务里,Claude 的表现超过 28 名人类安全研究员,API 推理成本约为每小时 4 美元,而人类研究员报酬为每小时 150 美元。Anthropic 同时指出,这一系统仍受限于人类预设目标和评测方式。








