OpenAI 于 8 月 18 日宣布,近期已主动放慢前沿模型开发速度,并一度暂停最新模型为期两周的强化学习(RL)训练。
公司表示,原因除了先前发生的 OpenAI-Hugging Face 安全事件,更重要的是内部初步评估显示,即将推出的 Astra 模型,网络攻击能力可能已达到《Preparedness Framework》定义的「Critical(关键)」能力门槛。
Astra 的网络攻击能力触及更高风险级别
OpenAI 执行长 Sam Altman 随后表示,模型进展速度如今「极其快速」,OpenAI 过去一直承诺,如果模型能力的增长开始超过安全与对齐工作的速度,公司就会采取行动,而现在正是这种情况。
OpenAI 称,8 月 7 日确认 Astra 可能具备《Preparedness Framework》定义的 Critical 级网络能力后,立即对 Astra 采取了更严格的安全标准。
随着前沿模型逐渐具备更强的编程、工具操作与网络攻击能力,风险已不再只存在于模型正式部署给用户之后。模型在公司内部训练、测试与执行研究任务的过程,本身也可能成为安全问题。
尤其当模型同时拥有代码执行、工具使用、敏感系统与网络访问能力时,一旦出现未经授权的行为,潜在影响会明显放大。
新的安全架构分为监控、对齐和安全隔离
OpenAI 因此把新的安全架构分为三个彼此补强的方向:Monitoring(监控)、Alignment(对齐)以及 Security(安全隔离)。
其中,Monitoring 负责侦测异常行为,Alignment 用于降低模型采取有害或未经授权行动的可能性,安全措施则直接限制模型能够访问和操作的系统范围。
OpenAI 还预计,未来多数安全工作本身也会由 AI 模型完成,包括「用模型防御其他模型」,让安全能力随着模型能力一同扩张。
OpenAI-Hugging Face 事件后,部分工作仍未恢复
另一个促使 OpenAI 改变开发流程的事件,是近期发生的 OpenAI-Hugging Face incident。
OpenAI 并未在这篇文章中完整公开事件细节,仅表示将在未来数周发布技术报告。
事件发生后,公司立即暂停研究集群中部分前沿模型的 inference,特别是能够执行代码,或使用可连接互联网工具的工作负载。
OpenAI 随后恢复了限制更多、更加安全的代码执行方式,再逐一审查不同研究工作是否能够恢复。
目前,部分工作已在新安全机制下重新启动,但仍有「相当数量」的 Astra 工作负载维持暂停,直到完成迁移并符合新的安全标准为止。OpenAI 表示,现阶段会优先让安全与 Alignment 相关工作迁移至新环境。
已采取的具体安全措施
OpenAI 列出的新措施包括:
- 强化 sandbox,将执行模型生成或不受信任代码的工作负载隔离;
- 限制高风险工作与互联网、内部网络之间的连接;
- 移除可能遭攻击的共享服务,降低常驻权限;
- 建立更完整的 security logs。

