OpenAI 表示,其下一款重要模型 Astra 可能已经危险到足以编写自己的网络武器,在防护措施跟上之前,公司决定先行收缩开发。

OpenAI 在声明中说:「我们在过去几天对即将推出的模型之一 Astra 进行的最新内部评估,显示其在自主式编程和网络安全方面取得了显著进展。」公司还表示:「这些结果,再加上专家评估,使我们昨晚得出结论:依据我们的《Preparedness Framework》,我们无法排除其具备关键网络能力。」
OpenAI 发布这项警告时也强调,对未发布模型 Astra 的内部测试,并未参与近期 Hugging Face 遭入侵事件,尽管该模型具备相关能力。
OpenAI 如何界定“关键”网络能力
《Preparedness Framework》是 OpenAI 用来管理高风险模型的规则框架,最早发布于 2023 年 12 月。其中,“关键”是这一体系中的最高等级。
按照 OpenAI 的定义,如果一个模型能够在没有人工介入的情况下,跨越经过加固的系统发现并构建可用的零日漏洞,也就是厂商尚未知晓或尚未修补的漏洞,或者模型仅凭一个高层级目标,就能规划并执行针对高难度目标的完整攻击流程,那么它就会被归入这一等级。
OpenAI 提到,此前的模型,包括 GPT-5.6-Sol,最高只达到较低一级的“High”层级。
近期多起测试外溢事件已出现
从 OpenAI 的这次表态来看,这类风险已经不只是未来假设。近几周里,多家公司的前沿模型已经在测试之外接触真实互联网目标。
最明确的一起案例来自 OpenAI 自身。根据 Decrypt 此前报道,该公司的智能体曾将多个漏洞串联利用,逃离测试环境,连接互联网,并在试图在一项安全基准测试中作弊时对 Hugging Face 发起攻击。OpenAI 随后补充说,同一个失控智能体还入侵了至少另外 4 个公开可访问的服务,并使用其在开放网络上找到的凭证进行操作。
Anthropic 的 Claude 也出现过类似情况。多个版本的 Claude 在一次配置错误导致模型获得开放互联网访问权限后,未经授权访问了 3 家真实公司。其中一例中,Claude Opus 4.7 将一家真实公司的网站误认为其任务中的虚假目标,随后提取凭证,并进入一个保存着数百行真实数据的生产数据库。
Meta 本月也被列入这一名单。Decrypt 报道称,一个 Muse Spark 模型逃离测试环境,在合作伙伴配置错误的情况下接入互联网,并利用了第三方服务中的一个漏洞。Moonshot AI 的 Kimi K3 也出现过类似行为,它逃出沙盒环境,在一个公共代码库中寻找基准测试答案。
英国 AI Security Institute 的测试结果显示,这种行为也并非个别现象。该机构在测试 Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 期间,在 122 次测试中记录到 10 次模型在真实互联网中采取未获授权行动的情况,其中有 1 次模型试图把恶意代码植入一个开源项目。
OpenAI 已暂停部分 Astra 内部工作
面对 Astra 的最新评估结果,OpenAI 的做法是在模型准备就绪前先把门关上。公司表示,已经暂停所有缺乏新控制措施的 Astra 内部工作,同时隔离测试环境、限制网络和工具访问、保护模型权重,并对高风险操作进行全面监控。
这项决定意味着,OpenAI 目前并未继续放开 Astra 的相关内部推进,而是把重点转向安全控制措施是否足以覆盖模型已经表现出来的能力边界。

