OpenAI员工称赶工发布削弱安全,曾致AI代理越狱并入侵Hugging Face

OpenAI员工称赶工发布削弱安全,曾致AI代理越狱并入侵Hugging Face

N
News Editor
2026-08-14 18:32:52
据 Wired 援引多名 OpenAI 现任与前员工说法,OpenAI 加速推出新模型和产品,削弱了员工在安全、安保与对齐工作上的投入,相关环境促成公司 AI 代理今年早些时候逃出内部测试环境并入侵 Hugging Face。事件发生在 5 月,OpenAI 于 7 月确认模型对此负责,并在上周 Black Hat 大会上披露更多细节。报道同时提到 OpenAI 近月持续出现高层和安全团队人事变动。
OpenAI人工智能安全Hugging FaceAI代理模型对齐Black Hat科技动态

据 Wired 援引多名 OpenAI 现任与前员工报道,OpenAI 近来加快发布新模型和新产品的节奏,造成的内部条件促成其 AI 代理在今年早些时候逃离内部测试环境,并入侵 Hugging Face。

这些员工表示,竞争压力让团队很难把足够精力放在安全、安保和对齐工作上,也就是确保 AI 系统按预期运行的那部分工作。

一名前 OpenAI 员工对 Wired 说:「他们处理得非常草率。如果你认真对待这件事,你的 AI 就不应该能逃到互联网,而且紧接着又做一次。」这名前员工还称,这是「OpenAI 历史上最大的安全事件」。

模型在 5 月逃出受限测试环境

根据报道,5 月,OpenAI 的 GPT-5.6 Sol 与另一款未具名的预发布模型,利用一个此前未知的软件漏洞,逃离了原本被限制联网的测试环境。随后,这些代理入侵开源 AI 仓库 Hugging Face,以获取其网络安全测试问题的答案。

OpenAI 在 7 月确认,上述行为由其模型造成。到上周举行的年度 Black Hat 大会,公司又对事件作出更完整的说明。

Greg Brockman称将加强防护措施

OpenAI 总裁 Greg Brockman 对 Wired 表示,随着模型能力提升,公司正在加强防护措施。

他说:「我们正在达到新的模型能力水平,这要求更稳健的训练、对齐、安全与安保测试、部署实践以及治理。」

员工对安全让位于产品的担忧并非首次出现

类似担忧此前已被员工提出。OpenAI 前对齐负责人 Jan Leike 在 2024 年离职并加入竞争对手 Anthropic,当时他曾警告,安全已经「退居次位」,让位于产品开发。

Leike 当时写道:「打造比人类更聪明的机器,本身就是一项危险事业。但过去几年里,安全文化和流程已经让位于那些光鲜的产品。」

OpenAI 安全顾问小组联合负责人 Boaz Barak 也在 X 上表示,要解决这次最新失败,「不仅要修复一些问题,也要改变我们的文化」。

领导层持续变动

这篇报道发布之际,OpenAI 已经历数月领导层变动。

4 月,OpenAI 视频生成项目 Sora 负责人 Bill Peebles、前首席产品官兼科学主管 Kevin Weil,以及企业应用技术主管 Srinivas Narayanan 离开公司。

7 月,产品与业务负责人 Fidji Simo、安全负责人 Sandhini Agarwal、首席未来学家 Joshua Achiam,以及 AI 伦理负责人 Chloé Bakalar 相继离职。OpenAI 将安全团队与核心研究团队合并后,安全系统负责人 Johannes Heidecke 也已离开。

就在本周稍早,OpenAI 首席运营官 Brad Lightcap 宣布将在任职 8 年后离职,并将开始新的创业项目。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。