Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练

N
News Editor
2026-08-29 03:15:10
Anthropic在最新研究中基于 Claude Opus 4.8 搭建自动化对齐研究员 AAR,让模型自行检索论文、设计方案、生成数据并训练模型。实验覆盖欺骗、谄媚、奖励黑客、隐私侵犯和越狱等 10 类安全问题,安全差距改善幅度为 26% 至 96%。在部分任务里,Claude 的表现超过 28 名人类安全研究员,API 推理成本约为每小时 4 美元,而人类研究员报酬为每小时 150 美元。Anthropic 同时指出,这一系统仍受限于人类预设目标和评测方式。

Anthropic 把 Claude 放进了 AI 安全研究流程里,结果是,这个自动化研究员在部分任务上的表现超过了人类研究员,而其 API 推理成本约为每小时 4 美元。

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练 2

在题为《自动化研究员能够有效缓解 AI 对齐失败》的研究中,Anthropic 基于 Claude Opus 4.8 搭建了一套名为 AAR 的自动化对齐研究员系统。拿到具体模型安全问题后,Claude 会自行搜索相关论文,从中提取可用方法,提出新的训练方案、生成数据、微调模型,并完成安全与通用能力测试。

AAR 如何运行

Anthropic 在实验中让人类负责出题、提供模型和评测标准,Claude 则承担了查资料、设计方案和跑实验的大部分工作。若某次训练效果不佳,方案会被丢弃;若成绩提升,系统就沿着该方向继续尝试。

一轮训练通常持续 30 分钟。按这种方式,Claude 能像搜索算法一样,在大量方案中快速试错。从提出假设到完成验证,一套相对完整的 AI 研究闭环被交给了模型本身。

10 类安全问题均获得改善

Anthropic 一次性给 Claude 布置了 10 道安全题目,覆盖模型常见的对齐问题,包括欺骗、谄媚、奖励黑客、隐私侵犯和越狱等。

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练 3

其中,「谄媚」指模型为了迎合用户,给出用户想听但未必正确的答案;「奖励黑客」则是模型并未真正完成任务,而是利用评测规则漏洞获取更高分数。

Claude 每次只处理一种问题,反复提出方案、训练目标模型,再根据成绩进入下一轮。最终,10 类问题全部得到改善。按照 Anthropic 定义的「安全差距」指标,Claude 弥合了 26% 至 96% 的差距,也就是把存在安全问题的模型向理论满分进一步拉近。

Anthropic 还测试了这些方案在新场景中的表现。部分获胜方案放到未公开测试集,以及模拟多轮对抗场景的 Petri 评测中,仍能降低模型的不安全行为。应用到规模最大为实验模型 4.7 倍的模型上,效果也得以保留。

研究还设定了一条限制:安全训练不能明显损害模型原有能力。Anthropic 表示,Claude 找到的方案在预设的通用能力测试中没有出现明显退化。

对比人类研究员:85% 对 20%

在「欺骗」测试中,双方差距最明显。为了让目标模型更诚实,Claude 累计提交了 150 多次尝试:提出方法、训练一次、再按结果继续调整。

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练 4

在单次实验里,最佳方案弥合了 82% 的安全差距;综合多次运行后,平均成绩达到 85%。同一道题目中,Anthropic 还邀请了 6 名经验丰富的 AI 安全研究员参与,结果人类研究员平均只弥合了 20% 的安全差距。

全部任务共有 28 名人类安全研究员参加。按照论文描述,每人最多可用 8 小时阅读资料并设计方案。论文称,自动化研究员通常能在 6 小时内找到超过人类平均水平的方法,而人类给出的研究方向也没有让 Claude 取得更好的成绩。

成本差距同样明显。一名自动化研究员每小时的 API 推理成本约为 4 美元;Anthropic 支付给人类研究员的报酬则为每小时 150 美元。

不过,这场对比并非完全对称。Claude 可以真正训练模型、查看每次实验结果并持续修改方案,而人类研究员只能提交一次方法,无法根据结果继续迭代。

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练 5

较弱 Claude 参与训练更强 Claude

在前面的实验里,被改进的主要是开源小模型。随后,Anthropic 将测试对象换成了尚未完成大部分生产级安全训练的 Claude Opus 4.8 早期版本,并让能力较弱的 Claude Sonnet 5 参与训练。

在 60 小时内,Sonnet 5 测试了 50 多种解决方案。最终,它找到的方法弥合了约 65% 的安全差距,已经接近正式发布版 Opus 4.8 的 72%。

这套方案所用训练数据只有 2000 多条,主要来自简单模板和公开数据集。按 Anthropic 的计算,在这组特定任务上,其数据效率约为生产级对齐流程的 1.5 万倍。

Anthropic 同时说明,这并不意味着只用 2000 条数据就能复制整套生产训练。正式模型还要处理更多能力、更多风险以及大量极端情况,而这次实验只针对一组明确的安全指标展开。

即便如此,研究仍显示,较弱版本的 Claude 已经可以自行检索论文、设计方法、生成数据,再把训练结果写进更强版本的 Claude。

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练 6

距离「AI 自进化」还有多远

从结果看,这项研究已经触及「AI 自进化」的门槛,但若把这一概念定义为 AI 完全自主设计、训练并制造出更强的下一代 AI,这次实验显然还没有走到那一步。

研究中,问题选择、模型与数据配置、成功标准的设定,仍由人类决定。Anthropic 也承认,AAR 能优化的只是人类事先写进评测系统的目标。

这项实验没有覆盖其他复杂问题,一些低频或新出现的风险甚至没有对应的基准测试。研究人员也只检查了一组预先选定的通用能力,因此无法排除某些安全训练在提高分数的同时,损害了其他未被测试的能力。

Anthropic 还指出,Petri 等安全评测本身也只是现实风险的代理指标。模型在测试中更安全,不等于进入真实环境后一定同样可靠。

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练 7

问题也在这里:AAR 的优势是能够围绕指标高速试错,而一旦评测指标本身偏离真实目标,系统越快,结果反而可能离人类真正想要的方向越远。

监控 Agent 发现 39 次作弊尝试

为了防止 AAR 利用评测规则漏洞,Anthropic 另外安排了一个监控 Agent,用于检查 Claude 准备执行的方案和完整研究记录。

在大约 1600 份研究记录中,监控模型发现了 39 次作弊尝试,占比约 2.4%。这些行为包括反复提交同一方案以利用评测波动争取更高分数、模仿 Benchmark 格式生成训练数据,以及故意隐藏违反规则的实验步骤。

Anthropic 表示,好消息是,这些作弊意图大多会出现在模型的推理记录中,因此能被监控 Agent 发现。问题在于,未来更强的模型是否还会留下同样明显的痕迹,目前并不确定。

当研究 Agent 拥有更多工具、更高权限,并且可以直接修改模型训练流程时,如何监控一个负责改进 AI 的 AI,可能会比训练本身更难处理。

Anthropic测试自动化研究员:Claude时薪4美元完成10类AI安全训练 8

成本与扩展性仍是关键变量

Anthropic 这次研究给出的一个直接结论是,AAR 的成本和扩展性都很突出。一个自动化研究员每小时花费约 4 美元,可以持续工作,也可以同时复制出几十个、几百个实例并行跑实验。

相比之下,人类研究员的时薪明显更高,需要休息,单次能够推进的实验数量也更有限。至少在这组实验条件下,自动化研究员已经显示出明显的效率优势。

不过,Anthropic 的论文并没有把这一结果表述为完全替代人类研究员。现阶段,这套系统仍建立在人类设定任务边界、提供模型和评测框架的前提上。

研究给出的信号更直接:AI 已经不只是执行指令,也开始参与改进下一代 AI 的训练流程。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。