Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代
Anthropic发布一篇51页研究论文,展示让 Claude 充当「自动化对齐研究员」的实验结果。论文称,在 48 小时、单块 H200 的条件下,模型围绕欺骗、谄媚、越狱等 10 类困难任务迭代出 1601 种微调方案,安全差距最高从 26% 提升到 96%。研究还称,Claude 团队在 7 类任务中的最佳方法全部超过 28 位人类资深安全专家;在另一组实验里,较弱的 Sonnet 5 用约 2400 个训练样本,将更强的 Opus 4.8 对齐到接近生产级水平。








