OpenAI 上周宣布解雇三名员工,称内部调查发现三人违反了公司关于敏感信息访问与处理的规定,涉嫌在既定程序之外向第三方 AI 安全评估组织分享机密信息。

被解雇的三人分别是从事模型对齐相关工作的 Jasmine Wang、从事 AI 安全研究并曾参与 OpenAI 与外部安全评估机构之间技术沟通的 Tomek Korbak,以及从事 AI 安全及模型对齐相关研究的 Mikita Balesni。
今天凌晨,三人在社交媒体发布了一封写给 OpenAI 领导层的公开信。Mikita Balesni 表示:「我们被解雇的原因是,我们将 AI 安全置于 OpenAI 作为一家公司的短期利益之上。」
Jasmine Wang 表示:「公司解雇我的理由只有一个:访问了一位高管的邮箱。我想把事情原原本本地说清楚,因为在 OpenAI 过去的历史中,已经有太多人突然离开,而背后的真相却总是被各种说辞掩盖。」
Tomek Korbak 则称:「过去几个月里,我一直在提出一个安全方面的担忧:我们正在逐渐失去监测 AI Agent 思维过程的能力。而这种监测能力,恰恰是我们发现 AI 行为异常时最有效的手段之一。我认为,这才是我真正被解雇的原因。现在,我担心 OpenAI 会以解雇我们为借口,减少与外部审计机构 METR(Model Evaluation and Threat Research)的合作。」
三人在公开信中写道,这封信是写给 OpenAI 安全与安保委员会、安全顾问小组及使命顾问委员会,因为这些机构承担着监督 OpenAI 安全工作的职责。在他们看来,解雇事件本身以及整个处理方式,都与 OpenAI 的安全工作直接相关。
公开信称解雇事件正在制造寒蝉效应
三名研究员在信中表示,他们越来越担心,围绕此次解雇事件的内部和外部沟通,已经让昔日同事感到害怕。按照他们的说法,员工开始不敢再像过去那样说话和开展工作,而这些做法直到上周仍是 OpenAI 日常工作的一部分。
公开信称,过去公司允许员工公开提出安全担忧,也允许表达不同意见,同时鼓励与独立安全机构合作,借助外部专家开展研究。三人写道,这正是 OpenAI 曾经与众不同的地方,也是他们曾以加入这个团队为荣的原因。
他们在信中表示,AI 不是一项普通技术,OpenAI 也不是一家普通公司。安全研究人员往往比其他人更早发现风险,而要弄清如何应对这些风险,就必须与外部专家保持密切合作。能够在不担心受罚的情况下开展这种合作,并且有清晰的内部流程支持,本身就是一项重要的安全保障机制。
三人认为,如果最接近风险的研究人员无法继续与彼此以及第三方机构建立高度信任、充分沟通的合作关系,那么通往超级智能的道路就不可能安全地走下去。他们写这封信,是为了捍卫这种文化。

三名研究员在信中回顾各自背景
公开信称,三人都已在 AI 安全领域工作多年。
其中,Tomek Korbak 在 GPT-2 时代开始研究如何利用强化学习实现语言模型对齐,并以此完成博士论文。此后,他在 Anthropic 从事相关技术的实际应用研究。加入 OpenAI 后,他主要研究思维链可监测性,参与撰写 OpenAI 的安全战略,并参与分析 Astra 级模型思维链可监测性下降的根本原因。在 Hugging Face 事件调查中,他还是 OpenAI 与 METR 对接的技术联系人。
Jasmine Wang 于 2019 年在 OpenAI 政策研究团队实习,期间参与撰写《可信 AI 开发》报告。之后,她曾在英国 AI 安全研究所领导一个团队,并于 2025 年重返 OpenAI,共同负责安全论证项目。公开信称,她还提出了「Pacing」这一概念,后来这一概念因《Pacing the Frontier》请愿书而广为人知,这份请愿书获得了 394 名 OpenAI 员工签名支持。
Mikita Balesni 是 2023 年 Apollo Research 的创始成员之一,主要研究 AI 失对齐问题,也是最早注意到 AI 开始意识到自己正在接受评测的研究人员之一。在 OpenAI,他从事对齐评测、失对齐科学以及思维链可监测性研究,也参与了 Hugging Face 事件调查。
三人还表示,在加入 OpenAI 之前,他们共同发起过一份跨行业立场文件,其中两人担任主要作者,文件名为《思维链可监测性:AI 安全领域一个全新而脆弱的机遇》。
公开信逐项回应解雇相关争议
在题为「关于我们被解雇这件事」的部分,三人写道,OpenAI 对他们而言远不只是一份工作,公司使命一直是他们生活中非常重要的一部分。工作期间,他们始终按照公司的使命行事,也遵循当时公司内部通行的工作规范。
不过,他们认为,这次解雇让人担心 OpenAI 内部的工作规范正在发生变化,员工如今已经不清楚哪些事情可以做,哪些事情会触碰红线。公开信称,考虑到 AI 发展过程中的重大安全风险,不能让员工在一个充满恐惧、规则又不明确的环境中工作,因为这会阻碍 AI 安全研究,也会削弱第三方机构对公司的监督能力。
三人写道,像他们这样突然遭到解雇,而且整个过程又以如此公开、突然的方式处理,正在让 OpenAI 过去引以为傲的开放文化受到寒蝉效应影响。如果上个月还被视为正常的工作行为,这个月突然就成了解雇理由,那么每一位员工都会开始猜测公司的红线究竟在哪里。
针对外界流传的不同版本说法,三人在信中作出回应。首先,他们表示自己并不是 The Information 那篇报道的消息泄露者。那篇文章涉及所谓的新型、可监测性更低的模型架构。三人称,他们不知道消息究竟是谁泄露的,而且自己根本没有理由泄露这些信息,因为那篇报道损害了他们一直在推进的工作。当时他们正致力于推动跨公司合作,对开发无法有效监测的模型架构加以限制。
公开信附上了 The Information 文章链接:https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns。

关于与外部机构接触的问题,三人表示,他们认为自己的任何对外接触都没有超出各自工作的职责范围。公开信称,Hugging Face 事件调查此前没有先例可循,相关内部政策也是在调查过程中逐步制定出来的。
按照信中的说法,Tomek 已尽最大努力遵守 OpenAI 当时的政策,同时延续公司自成立早期以来与第三方机构合作所遵循的惯例。由于这次调查尤其敏感,要与外部合作方建立信任,双方就必须保持密切沟通,而 Tomek 一直尽力谨慎处理这些沟通。
公开信还称,Mikita 当时也在处理类似工作。他负责推动跨公司合作,争取各方就防止模型失去可监测性作出承诺。这项工作只有通过与外部机构进行大量沟通才有可能成功。三人表示,Mikita 在推进工作时,始终与 OpenAI 董事会成员及公司高管进行协调和讨论,他当时的理解是 OpenAI 高层支持这项工作。整个过程中,他一直向直属管理层确认相关事项,并在对外分享材料之前仔细删除其中的敏感信息。他们称,Mikita 的所有行动都是出于善意,也符合公司当时通行的工作规范。
至于 Jasmine,公开信称,她获得某位高管邮箱的访问权限,是因为招聘工作需要,而且事先得到了授权。后来,这项权限已经不再需要,她便主动要求撤销。但 IT 部门没有完成权限移除,而 Jasmine 自己既无法撤销权限,也无法主动退出那个邮箱。两个邮箱的邮件被合并显示在她的收件箱里,而且界面没有明确标识每封邮件原本属于哪个邮箱。因此,当 Jasmine 意外点开一封敏感邮件时,她在几分钟内就向那位高管报告了这件事,并再次向 IT 部门提出权限撤销请求。
三人表示,有必要把这些事情解释清楚,因为他们非常珍惜与 OpenAI 同事之间的关系。与此同时,他们也担心目前四处传播的各种传言,包括有关一份共同撰写、面向董事会的备忘录的指控。公开信称,公司从未向他们提出过这项指控,因此他们也没有机会回应这个他们认为存在误解的说法。同样,他们也没有向媒体透露自己被解雇的消息。
三人写道,如果可以选择,他们当然更希望不要以这种突如其来的方式成为公众关注的焦点。现在最让他们担心的是,解雇原因至今没有得到清晰解释,整个过程又如此公开,再加上各种传言不断传播,已经让仍在 OpenAI 工作的人感到寒心,不敢轻易发声,而此时此刻,世界上太多与 AI 安全有关的事情,都要依靠这些人来完成。
公开信提出三点建议
在离开前,三人给 OpenAI 提出三点建议。
继续让第三方安全审计机构深入参与内部工作
第一,公开信称,OpenAI 必须兑现上个月的公开承诺,让第三方安全审计机构深入参与公司内部工作,不能拿他们的解雇当借口退出这些合作。
三人表示,继续与整个 AI 安全生态保持合作,对 OpenAI 实现自身使命至关重要。今年夏天,他们参与的 Hugging Face 事件调查,以及 OpenAI 与外部审计机构的合作,是他们最引以为傲的工作成果之一,这些工作帮助外界更清楚地了解了前沿 AI 技术的真实情况。
他们担心,公司可能会以他们的解雇为理由,终止与 METR 的合作,或者大幅限制外部审计机构的访问权限和工作范围。公开信写道,他们希望 OpenAI 能兑现 Sam Altman 在 9 月 12 日公开作出的承诺:让独立评估人员能够持续进入公司开展工作,并获得类似内部员工的访问权限。

保证前沿模型的可监测性
第二,三人表示,OpenAI 必须保证前沿模型的可监测性。
公开信称,目前整个行业还不知道该如何安全地开发和部署那些无法被有效监测的模型,而前沿模型的可监测性正在下降。只要行业仍然依赖可监测性来保障 AI 安全,OpenAI 和其他前沿 AI 公司就不应该继续推进那些会进一步削弱模型可监测性的技术开发。
三人写道,他们赞同 Jakub 此前的公开表态:思维链的可监测性「十分脆弱,而且遗憾的是,整体趋势正在朝着不好的方向发展」。他们也认同 Jakub 所说,希望「防止整个行业陷入一场竞相开发不可监测架构的竞争」。公开信称,他们仍然相信,整个行业在这个问题上进行协调非常重要,也希望 OpenAI 能支持员工推动这项工作。
维持开放透明的讨论文化
第三,公开信称,OpenAI 必须继续支持开放、透明的讨论文化,让内部安全研究人员能够与整个 AI 安全生态保持沟通。
三人表示,如果 OpenAI 员工不再觉得自己能够在公司内部提出安全问题,或者不敢再通过充分、高效的沟通渠道与外部安全机构合作,那么所有人面临真正灾难性事件的风险都会上升。他们敦促 OpenAI 公开重申对透明、开放文化的承诺,让员工能够放心地在公司内部和外部提出担忧。
公开信最后写道,OpenAI 内部研究人员是防止重大问题发生的第一道防线。自公司成立以来,开放文化一直是其重要特点,这种文化必须得到保留。他们还敦促 OpenAI 明确说明,员工应该如何与外部安全机构开展合作,让大家不用再去猜测那些不断变化的规则边界到底在哪里。
三人表示,为了推动公司内部对此展开讨论,他们希望这封信能够在 OpenAI 内部得到广泛传阅。虽然他们已经不再是 OpenAI 的一员,但依然非常尊重过去一起工作的同事,也希望这些同事能够继续督促 OpenAI 坚守自己的使命,因为「没有这些员工,就没有 OpenAI」。
原贴链接:https://x.com/balesni/status/2108262814003687745
本文来自微信公众号「机器之心」。

