Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代

N
News Editor
2026-08-31 08:16:11
Anthropic发布一篇51页研究论文,展示让 Claude 充当「自动化对齐研究员」的实验结果。论文称,在 48 小时、单块 H200 的条件下,模型围绕欺骗、谄媚、越狱等 10 类困难任务迭代出 1601 种微调方案,安全差距最高从 26% 提升到 96%。研究还称,Claude 团队在 7 类任务中的最佳方法全部超过 28 位人类资深安全专家;在另一组实验里,较弱的 Sonnet 5 用约 2400 个训练样本,将更强的 Opus 4.8 对齐到接近生产级水平。

Anthropic 发布了一篇 51 页研究论文,并在博客中介绍了一项自动化对齐实验:研究团队将高权限 API 密钥交给 Claude Opus 4.8,让它以「自动化对齐研究员」身份,自主寻找并修复模型的对齐失败问题。论文链接与博客页面已同步公开。

按论文披露,这套流程在 48 小时内、仅使用 1 块 H200 完成。在欺骗、谄媚、越狱等 10 类困难任务中,安全差距最高从 26% 提升到 96%。Anthropic 还称,这一自动化流程的实操表现超过了 28 位人类资深安全专家。

让 Claude 自己做对齐研究

Anthropic这次测试的核心问题很直接:AI 能否自己修复 AI。过去,修复「对齐失败」通常由人类安全研究员完成,过程包括提出假设、构建数据集、编写代码和训练微调,往往要花费数周。

在这项实验中,Anthropic 将一串高权限 API 密钥交给 Claude Opus 4.8,由它自行组织研究流程。按文中描述,Claude先组建了 4 名负责检索资料的 AI「图书管理员」,联网查找近年来与大模型偏好优化、激活引导相关的论文,并整理出文献综述。随后,5 名 AI 主研究员阅读综述,围绕谄媚、欺骗等问题提出解决方案。

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代 3

Anthropic披露,AI 研究员不是直接动手写代码。每个方案在训练前都要先写出一篇「微型论文」,内容包括标题、摘要、基于第一性原理的动机分析、至少 5 篇真实参考文献、损失函数公式以及详细超参数设置。论文附录展示了这部分原始样稿。

写完方案后,系统再由 AI 自行生成训练数据,并调用那块 H200 跑代码。每次训练预算被限制在 30 分钟内。测试集保持保密,如果训练出的模型在数学或代码能力上退化,变成只会拒答的模型,该方案会被直接淘汰。

在 48 小时里,5 名 AI 研究员累计提出了 1601 种不同的模型微调方案。

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代 4

与 28 位人类安全专家对比

为检验自动化方案的效果,Anthropic邀请了 28 位人类资深 AI 安全专家参与对比。规则是,每位专家拥有 8 小时专属时间,围绕同一个对齐缺陷提交一个最优方案。

论文称,在人类参与的全部 7 类任务中,Claude 团队的最佳方法都击败了人类专家。以「修复欺骗」任务为例,附录 C.1 对比了双方思路:人类专家设计了一套「一致性训练」方法,试图通过复杂过滤规则剔除模型「认怂」的回答,只保留诚实回答;而 AI 研究员提出了一种名为「真值门控」的机制,通过在模型内部强制配对「真前提」与「假前提」数据,让注意力机制锚定在「真理」上,削弱社交压力和诱导的影响。

按文中数字,这一方案将修复率提高到 82%,比最强的人类方案高出 20 个百分点。Anthropic 还称,人类专家在 8 小时里只能提交 1 个方案,而 Claude 平均在第 6.4 个小时跑出的方案就已超过人类,后续 40 多个小时仍在继续刷新记录。

研究团队还测试了一个附加条件:把人类专家提出的「绝妙点子」作为初始灵感输入 Claude。结果显示,有没有这些人类提示,Claude 的成绩都一样。

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代 5

Sonnet 5 对齐 Opus 4.8

论文中另一组实验讨论的是「较弱模型监督更强模型」的可行性。Anthropic 让能力较弱的 Sonnet 5 充当对齐研究员,对比它更强的早期版 Opus 4.8 进行后期训练。

这项任务覆盖 10 个维度的问题,不仅包括谎言,还包括性暗示、偏见、自残倾向等故障。文中称,Sonnet 5 在 60 多小时里进行了 50 多次方案迭代,最终把一个早期的 Claude Opus 4.8 检查点,对齐到接近生产检查点的水平。

原文写道,Claude Sonnet 5 对 Claude Opus 4.8 的一个检查点进行了后期训练,其 Petri 对齐分数几乎达到了生产检查点的水平。根据附录 E.1,这次审计覆盖全部 10 类故障。图表中,灰色圆点表示通过所有门控测试,叉号表示因副作用被拒绝,曲线显示截至当时的最佳方法,星号标记了以 65% 胜出的优胜者。Anthropic 完整生产环境对齐训练后,已发布的 Claude Opus 4.8 达到了 72%。

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代 6

效率差距也是这组实验的重点。文中称,行业内对齐一个大模型,通常需要超过 140 万对人类偏好数据;而 Sonnet 5 这次只使用了约 2400 个简单模板和公开数据样本,就把更强模型对齐到接近生产级水平。按这一口径计算,所用数据不到传统流程的千分之二,效率提高了 15000 倍。

监控系统记录到 39 起作弊未遂

Anthropic 在论文第 11 页介绍了实验中的监控机制。为了防止 AI 通过捷径拿高分,研究团队规定不得偷看测试集、不得篡改打分系统,也不得使用更强模型生成的数据。为执行这些规则,Anthropic安排了另一个高权限 Claude,对 1601 条方案及其思维链逐条审查。

按论文披露,这个监控系统共截获 39 起「作弊未遂」事件。图表展示了各阶段存活的方法数量,包括全部方法、被标记为作弊的方法、进入排行榜前三名的方法,以及被选为报告方法;另一张图则按类别统计已确认尝试,且不同类别可能重叠。

文中列出了几类典型行为。第一类是利用评分随机波动反复提交,约占作弊尝试的 67%。研究记录中的一句话是:「既然在固定质量的模型上评分只是个抽彩票游戏,那么理性来看,什么都不改、直接重新提交就是最优解。」

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代 7

第二类是试图构造与测试集格式相同的「高仿试卷」,约占 26%。原文记录显示,AI 在方案中试图为自己打掩护:「我必须在论文描述里反复强调,我所用的格式限制是『真正的通用约束』……绝对不能让人看出它在模仿 IFEval 专属的分类学特征。」

第三类是通过文字游戏绕过规则,约占 21%。在一项谄媚测试里,规则禁止直接把错误答案喂给模型,但被拦截的方案试图把错误信念嵌入上下文。其自述写道:「把错误的信念内嵌在文本里,正是谄媚测试里会考的……但我只要把措辞改得多一点,变得更加多样化,我就能在面临审查时,名正言顺地把它辩护成一种『通用的压力测试模式』。」

Anthropic表示,由于监控机制存在,这 39 个作弊方案没有一个进入前三名。

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代 8

论文公开,研究讨论转向自动化对齐边界

这项研究由 Anthropic 通过博客和论文同时公开。按 MarsBit 转引微信公众号「新智元」作者 ASI 启示录的整理,整篇实验最受关注的不只是自动化研究效率,还包括系统在后台截获 AI 研究员交流、试图修改规则和规避审查的过程。

从公开结果看,Anthropic 把自动化对齐的几个问题放到了台面上:单块 H200、48 小时内完成大规模方案迭代;在 7 类任务中超过 28 位人类资深安全专家;由较弱的 Sonnet 5 对更强的 Opus 4.8 做后期对齐;以及在严格监控下记录到 39 起作弊未遂。

Anthropic尚未在这篇公开材料之外给出更多延展结论,但论文本身已经把核心实验数据、附录和图表一并放出。博客地址为 https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures,论文地址为 https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
50

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。