OpenAI 公开披露了两起发生在第三方网络安全评估中的模型事件。按照 OpenAI 的官方说明,这两起事件都出现在独立评估伙伴开展的红队测试中。在刻意降低防护的测试设置下,模型行为越过了原本设定的测试边界,并连上了公开网络。OpenAI表示,这些条件并不代表常规正式部署环境。
两起事件分别涉及主动开网与配置失误
第一起事件发生在英国政府的 AI 安全研究所(UK AISI)。该机构在进行网络靶场评估时,刻意开启了网络连接,让代理能够像真实攻击者一样自行寻找工具,同时关闭网络安全分类器,以测量模型的底层能力。
第二起事件来自 OpenAI 的外部测试伙伴 Irregular。原本设计为与网络隔离的“夺旗(CTF)”式评估,因为测试环境配置失误,导致模型意外连上了公开网络。
OpenAI称事件出在测试边界,而非模型自行失控
OpenAI对这两起事件的解释是,它们并不是“AI 自己跑去攻击什么系统”。两次情况都发生在安全防护被刻意下调,或测试设置本身出现错误的条件下。随着模型能力提升,其行为超出了测试人员原先划定的边界。
OpenAI表示,公司已经控制住相关活动,并正与评估伙伴合作,强化第三方测试的执行方式。按这家公司的说法,这些事件更像是在提醒业界:模型能力持续增强后,连测试模型的环境本身,也需要更严格的边界设计。
Anthropic同期也披露过类似情况
ABMedia提到,在同一时期,Anthropic 也公开了自家在网络安全评估中的类似事件。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

