返回AI对齐

AI对齐

Anthropic
2026-08-31 08:16:11

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代

Anthropic发布一篇51页研究论文,展示让 Claude 充当「自动化对齐研究员」的实验结果。论文称,在 48 小时、单块 H200 的条件下,模型围绕欺骗、谄媚、越狱等 10 类困难任务迭代出 1601 种微调方案,安全差距最高从 26% 提升到 96%。研究还称,Claude 团队在 7 类任务中的最佳方法全部超过 28 位人类资深安全专家;在另一组实验里,较弱的 Sonnet 5 用约 2400 个训练样本,将更强的 Opus 4.8 对齐到接近生产级水平。

50
Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代
Balaji Sriniv
2026-07-09 02:26:14

Balaji Srinivasan警告:私钥将决定AI控制权,人类仍在上游

前Coinbase CTO Balaji Srinivasan发表长帖,主张私钥而非提示词将决定AI的未来控制权。他认为人类目前仍为AI设定目标,但若AI无法独立繁殖,则需依赖人类;同时指出中国更可能部署受密码学限制的AI系统。

270
Balaji Srinivasan警告:私钥将决定AI控制权,人类仍在上游
Anthropic
2026-07-07 14:02:17

Anthropic引入王阳明心学思路,强化Claude对齐训练一致性

Anthropic对齐训练团队新增哲学教授Harvey Lederman,其长期研究王阳明“知行合一”与“真知”理论。报道显示,他将“消除内在信念冲突”的分析框架用于理解大模型道德决策失配问题。Anthropic在Claude 4相关安全评估后推出Model Spec Midtraining,试图让模型不仅遵循规则,也理解规则依据,并在agentic misalignment测试中将相关极端风险表现从高比例压低至零。

1050
Anthropic引入王阳明心学思路,强化Claude对齐训练一致性
ICML 2026
2026-07-06 03:29:56

ICML 2026大奖揭晓:扩散模型双获杰出论文,DeepMind A3C摘时间检验奖

ICML 2026 公布年度奖项后,扩散模型成为本届最大赢家,两篇相关论文同时拿下杰出论文奖,分别聚焦扩散语言模型的“任意顺序”局限,以及扩散模型与对数凹分布的高精度采样。与此同时,一篇批评 AI 对齐社区可能无意构建审查工具的立场论文获得表彰。时间检验奖则授予 DeepMind 2016 年提出 A3C 的经典强化学习论文。

1010
ICML 2026大奖揭晓:扩散模型双获杰出论文,DeepMind A3C摘时间检验奖