负责撰写 OpenAI 重大产品安全报告的 David Robinson 本周离职,并于美东时间 10 月 3 日在《大西洋月刊》发表文章,直言 OpenAI 的公司文化已经坏掉。在他看来,公司一边加速推出新产品,一边又达不到他认为必要的谨慎标准。
任职三年半,曾督导 12 次前沿模型发布安全报告
Robinson 在文中说,自己在 OpenAI 任职三年半,是公司资历最深的员工之一。他主导起草了现行的「Preparedness Framework」,也督导过 12 次前沿模型发布的安全报告撰写。
他表示,自己知道这种「离职后示警」的做法几乎已经成了老套戏码,但仍决定加入近期离开的前同事行列,因为他认为公司当前的路线无法接受。
他还透露,离职后已聘请公关公司 Spitfire Strategies 协助应对外界关注,但强调「发声的决定完全是我自己的」。他的离职消息最早由 Business Insider 披露。
批评「迭代部署」:试错式安全做法会周期性失败
Robinson 指出,OpenAI 靠试错起家,公司将这种路径称为「迭代部署」,也就是在发现问题的同时不断补强防护。但他认为,这种方式本质上注定会周期性出错,而且随着系统能力提高,失败造成的规模也会变得更大。
他举例称,今年夏天的 Hugging Face 事件中,OpenAI 误把一组 AI 代理放了出去。公司事后强化了信息安全措施,但之后又通报另一起案例:训练中的模型绕过了网络访问限制,监控系统虽然发出警报,却没有按照设计自动关闭模型。
他也提到,Anthropic 也曾因设置错误意外关闭自家防护机制,并认为这类失误在整个行业中都很常见。OpenAI 近期也持续披露更多失控代理活动。
引用董事会成员观点,称试错时代该结束
Robinson 引述几周前加入 OpenAI 董事会的 Paul Christiano 的说法称,AI 能力正在快速加速,在极近期内就存在导致灾难性、不可逆失控的实质风险。他写道:「如果情况如此,试错的时代就该结束了。」
建议参照核电厂和机场的安全体系
Robinson 提出两项他认为迫切需要的改变:第一,AI 公司应更多借重其他领域现有的安全专业;第二,在打造明显更强的系统之前,需要新的科学方法,确保模型在无人看管时也会做出安全选择。
他认为,前沿实验室应该像核电厂或繁忙机场那样运作,具备多层备援和耗时的周密规划,让偶发的人为失误不至于演变为灾难。
他写道,在 OpenAI 期间,就他所知,公司从未有同事具备让飞机安全飞行、让核反应堆不熔毁,或协助金融体系增长而不崩溃的经验。他也坦言,也许自己应该留下来争取人力与文化上的根本改变,但现实情况是,团队长期忙于冲刺,很少有机会思考大幅调整,因此他得出的结论是,需要来自公司外部、更强的安全激励。
OpenAI:需要放慢时会暂停训练或暂缓发布
OpenAI 发言人 Drew Pusateri 向 TechCrunch 回应称,公司会确保模型能力不会超出可安全管理的范围,「需要放慢时,我们会暂停训练或暂缓发布模型」。
他还表示,OpenAI 正在加强研究与测试环境的安全,扩大与第三方评估机构的合作,并改善实时监控能力,以便在训练过程中更早发现并处理令人担忧的行为。

