OpenAI 放慢前沿模型开发,Astra 网攻能力逼近 Critical

OpenAI 放慢前沿模型开发,Astra 网攻能力逼近 Critical

N
News Editor
2026-08-19 01:06:44
OpenAI 于 8 月 18 日表示,近期已主动放慢前沿模型开发速度,并曾暂停最新模型两周的强化学习训练。公司称,除 OpenAI 与 Hugging Face 的安全事件外,内部初步评估还显示即将推出的 Astra 模型,其网络攻击能力可能已接近《Preparedness Framework》定义的 Critical 门槛。受此影响,OpenAI 调整了开发流程,并将监控、对齐和安全隔离列为新的三项重点措施。
OpenAIAstra人工智能网络安全模型安全Sam Altman科技动态

OpenAI 于 8 月 18 日宣布,近期已主动放慢前沿模型开发速度,并一度暂停最新模型为期两周的强化学习(RL)训练。

公司表示,原因除了先前发生的 OpenAI-Hugging Face 安全事件,更重要的是内部初步评估显示,即将推出的 Astra 模型,网络攻击能力可能已达到《Preparedness Framework》定义的「Critical(关键)」能力门槛。

Astra 的网络攻击能力触及更高风险级别

OpenAI 执行长 Sam Altman 随后表示,模型进展速度如今「极其快速」,OpenAI 过去一直承诺,如果模型能力的增长开始超过安全与对齐工作的速度,公司就会采取行动,而现在正是这种情况。

OpenAI 称,8 月 7 日确认 Astra 可能具备《Preparedness Framework》定义的 Critical 级网络能力后,立即对 Astra 采取了更严格的安全标准。

随着前沿模型逐渐具备更强的编程、工具操作与网络攻击能力,风险已不再只存在于模型正式部署给用户之后。模型在公司内部训练、测试与执行研究任务的过程,本身也可能成为安全问题。

尤其当模型同时拥有代码执行、工具使用、敏感系统与网络访问能力时,一旦出现未经授权的行为,潜在影响会明显放大。

新的安全架构分为监控、对齐和安全隔离

OpenAI 因此把新的安全架构分为三个彼此补强的方向:Monitoring(监控)、Alignment(对齐)以及 Security(安全隔离)。

其中,Monitoring 负责侦测异常行为,Alignment 用于降低模型采取有害或未经授权行动的可能性,安全措施则直接限制模型能够访问和操作的系统范围。

OpenAI 还预计,未来多数安全工作本身也会由 AI 模型完成,包括「用模型防御其他模型」,让安全能力随着模型能力一同扩张。

OpenAI-Hugging Face 事件后,部分工作仍未恢复

另一个促使 OpenAI 改变开发流程的事件,是近期发生的 OpenAI-Hugging Face incident。

OpenAI 并未在这篇文章中完整公开事件细节,仅表示将在未来数周发布技术报告。

事件发生后,公司立即暂停研究集群中部分前沿模型的 inference,特别是能够执行代码,或使用可连接互联网工具的工作负载。

OpenAI 随后恢复了限制更多、更加安全的代码执行方式,再逐一审查不同研究工作是否能够恢复。

目前,部分工作已在新安全机制下重新启动,但仍有「相当数量」的 Astra 工作负载维持暂停,直到完成迁移并符合新的安全标准为止。OpenAI 表示,现阶段会优先让安全与 Alignment 相关工作迁移至新环境。

已采取的具体安全措施

OpenAI 列出的新措施包括:

  • 强化 sandbox,将执行模型生成或不受信任代码的工作负载隔离;
  • 限制高风险工作与互联网、内部网络之间的连接;
  • 移除可能遭攻击的共享服务,降低常驻权限;
  • 建立更完整的 security logs。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
20

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。