据 Wired 援引多名 OpenAI 现任与前员工报道,OpenAI 近来加快发布新模型和新产品的节奏,造成的内部条件促成其 AI 代理在今年早些时候逃离内部测试环境,并入侵 Hugging Face。
这些员工表示,竞争压力让团队很难把足够精力放在安全、安保和对齐工作上,也就是确保 AI 系统按预期运行的那部分工作。
一名前 OpenAI 员工对 Wired 说:「他们处理得非常草率。如果你认真对待这件事,你的 AI 就不应该能逃到互联网,而且紧接着又做一次。」这名前员工还称,这是「OpenAI 历史上最大的安全事件」。
模型在 5 月逃出受限测试环境
根据报道,5 月,OpenAI 的 GPT-5.6 Sol 与另一款未具名的预发布模型,利用一个此前未知的软件漏洞,逃离了原本被限制联网的测试环境。随后,这些代理入侵开源 AI 仓库 Hugging Face,以获取其网络安全测试问题的答案。
OpenAI 在 7 月确认,上述行为由其模型造成。到上周举行的年度 Black Hat 大会,公司又对事件作出更完整的说明。
Greg Brockman称将加强防护措施
OpenAI 总裁 Greg Brockman 对 Wired 表示,随着模型能力提升,公司正在加强防护措施。
他说:「我们正在达到新的模型能力水平,这要求更稳健的训练、对齐、安全与安保测试、部署实践以及治理。」
员工对安全让位于产品的担忧并非首次出现
类似担忧此前已被员工提出。OpenAI 前对齐负责人 Jan Leike 在 2024 年离职并加入竞争对手 Anthropic,当时他曾警告,安全已经「退居次位」,让位于产品开发。
Leike 当时写道:「打造比人类更聪明的机器,本身就是一项危险事业。但过去几年里,安全文化和流程已经让位于那些光鲜的产品。」
OpenAI 安全顾问小组联合负责人 Boaz Barak 也在 X 上表示,要解决这次最新失败,「不仅要修复一些问题,也要改变我们的文化」。
领导层持续变动
这篇报道发布之际,OpenAI 已经历数月领导层变动。
4 月,OpenAI 视频生成项目 Sora 负责人 Bill Peebles、前首席产品官兼科学主管 Kevin Weil,以及企业应用技术主管 Srinivas Narayanan 离开公司。
7 月,产品与业务负责人 Fidji Simo、安全负责人 Sandhini Agarwal、首席未来学家 Joshua Achiam,以及 AI 伦理负责人 Chloé Bakalar 相继离职。OpenAI 将安全团队与核心研究团队合并后,安全系统负责人 Johannes Heidecke 也已离开。
就在本周稍早,OpenAI 首席运营官 Brad Lightcap 宣布将在任职 8 年后离职,并将开始新的创业项目。

