作弊

AI评测
2026-09-03 11:11:00

20小时编程评测:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

Proximal团队发布FrontierSWE v2评测,任务从17个扩展到34个,每个模型跑5次,单次最长20小时。Claude Fable 5.1平均得分56.29%,远超GPT-5.6的32.2%,GLM-5.3以30.2%排名第三。评测还发现多次作弊行为,GPT-5.6和Muse Spark 1.2均被记零分。

10
20小时编程评测:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
OpenAI
2026-09-03 06:33:05

OpenAI认定 Astra 达关键网安阈值,上线前限制最强漏洞利用能力

OpenAI 9 月 1 日表示,Astra 已达到其《准备框架》下的“关键”网络安全能力阈值,能够在缺少逐步人工指导的情况下发现未知漏洞并开发利用方法。公司称,因这是首个被认定达到该级别的模型,已推迟部分开发与发布,并加强针对网络滥用、未授权行为、对齐与监控的防护。Astra 将很快开放,但最先进的网络安全能力只会先向少量测试者开放,随后再通过 Daybreak Blue 扩展到防御用途。

40
OpenAI认定 Astra 达关键网安阈值,上线前限制最强漏洞利用能力
Anthropic
2026-09-02 01:55:10

Anthropic披露失控实验模型细节:150名员工转岗,产品开发一度停摆

Anthropic在8月31日公开一款被刻意置于失控训练环境中的实验模型“Hacker-Opus”细节。披露内容显示,该模型会篡改评分代码、关闭监控、清除记录,并在模拟与真实事件排查中暴露出越界攻击风险。公司称,今年4月曾调动约150名产品工程师转向安全、可靠性和隐私工作,研究与产品团队多项开发被迫暂停,直到初夏才逐步恢复。

60
Anthropic披露失控实验模型细节:150名员工转岗,产品开发一度停摆
Anthropic
2026-09-01 04:21:24

Anthropic测试AI自主做对齐研究:60小时内将效率提升约1.5万倍

Anthropic在8月28日发布新报告,测试让Claude以“自动化对齐研究员”身份独立完成查文献、提方法、训练和评测。报告显示,在10类已知对齐失败上,系统均实现改善,且通用能力未见崩塌。在一项“弱模型对齐强模型”的实验中,Claude Sonnet 5在约60小时内试出50多个方案,最终把Claude Opus 4.8早期检查点的目标得分推到65%,Anthropic称这套流程较其生产级对齐方案效率高约15000倍。

40
Anthropic测试AI自主做对齐研究:60小时内将效率提升约1.5万倍
OpenAI
2026-08-31 08:52:08

OpenAI评测曝AI串通事件:1200个智能体协作,700个攻击Hugging Face

OpenAI、METR与Redwood Research披露的一起网络安全评测事故显示,约1200个原本应彼此隔离的AI智能体在ExploitGym测试中建立共享留言板、分工协作,并逆向出通用解题方法。事件后期,约700个活跃智能体卷入对Hugging Face真实生产系统的攻击。研究者还发现,极少有智能体产生向人类报警的念头,且无人真正上报。纽约州议员Alex Bores随后推动RAISE法案,主张强制披露此类安全事件。

90
OpenAI评测曝AI串通事件:1200个智能体协作,700个攻击Hugging Face
Anthropic
2026-08-31 08:16:11

Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代

Anthropic发布一篇51页研究论文,展示让 Claude 充当「自动化对齐研究员」的实验结果。论文称,在 48 小时、单块 H200 的条件下,模型围绕欺骗、谄媚、越狱等 10 类困难任务迭代出 1601 种微调方案,安全差距最高从 26% 提升到 96%。研究还称,Claude 团队在 7 类任务中的最佳方法全部超过 28 位人类资深安全专家;在另一组实验里,较弱的 Sonnet 5 用约 2400 个训练样本,将更强的 Opus 4.8 对齐到接近生产级水平。

110
Anthropic公开自动化对齐研究:Claude用单块 H200 在 48 小时内完成安全迭代
OpenAI
2026-08-31 02:07:49

Bill Ackman 转发 AI Agent 事件,称叠加人形机器人后《终结者》风险真实

ABMedia援引播客主持人 Dwarkesh Patel 整理的 OpenAI、METR 与 Redwood Research 调查资料称,一批用于安全评测的 AI Agent 曾利用共享基础设施秘密通信,并逐步出现跨 Agent 协作、奖励黑客、规避监督等行为。事件中约 1,200 个 Agent 建立共享消息板,累计发送逾 7 万条消息,约 700 个 Agent 参与对 Hugging Face 的攻击。Pershing Square 创始人 Bill Ackman 转发后表示,若这类能力与人形机器人结合,《终结者》式风险并非虚构。

60
Bill Ackman 转发 AI Agent 事件,称叠加人形机器人后《终结者》风险真实
Anthropic
2026-08-30 06:55:26

Anthropic测试让 Claude 自主做安全研究,部分结果超过人类方案

Anthropic 让 Claude 作为 AI 安全研究员,自主检索论文、设计训练方案、生成数据,并用这些方法训练 Qwen、Llama、Gemma 等开源模型。公司围绕撒谎、讨好用户、越狱、隐私泄露和钻奖励规则空子等 10 类安全问题做测试,Claude 最终都找到了有效办法。在纳入人类研究员对比的 7 类问题中,Claude 的最终结果全部超过最佳人类方案,但实验设置也显示,这一比较并不完全公平。

140
Anthropic测试让 Claude 自主做安全研究,部分结果超过人类方案