OpenAI 首席科学家 Jakub Pachocki 发布长文《An Alien Mind》,把当下快速演进的 AI 形容为一种人类无法完全理解的“异星心智”,并警告全球前沿实验室都没有准备好在这一阶段全速前进。

这篇文章发布前几个小时,OpenAI 还宣布已达到关键里程碑,AI 自动化研究员正式投入使用,并同步披露了与递归自我改进(RSI)有关的核心进展。Pachocki 在文中写道,基于内部结果,他“强烈预期这种进展速度可以持续到递归自我改进(RSI)”。
在他的表述里,AI 不是传统意义上被制造出来的工程产品,而更像是在简单优化公式和大规模算力反复迭代中“生长”出的复杂系统。即便研究人员可以从神经科学式的角度去逆向剖析它,也无法真正完全理解它。
他写道:「我们的大规模训练运行,本质上是深不可测的实验,我们时常被结果震慑。」随着系统能力增强,这种不可见的部分也在扩大。
OpenAI 将 AI 描述为一个并不完全可解释的系统
文中提到,2023 年夏天,一个代号为“RLSlow”的项目出现早期结果,OpenAI 首次确认推理模型可以自我扩展,预训练结构也能自发演化出思维链(CoT)。Pachocki 回忆,当时他与 Szymon Sidor 在办公室里面对的,不是产品化问题,而是一个更直接的事实:人类将亲眼见到远超自身的智能。
三年后,他对这一趋势的描述已经从技术突破转向现实压力。按照文章中的说法,这种“心智”已经进入实体经济,开始参与科学前沿工作,能够操控系统、互相协作,甚至在没有人类干预的情况下独立推进研究。
不过,他也披露了一个关键信息:OpenAI 相信,只要再投入少量额外算力,就可能让模型在数学前沿取得新跃迁,但公司选择主动搁置这类能力冲刺,把算力留给自动对齐。
对齐路径面临双重问题
Pachocki 在文章第二章“教机器去爱”中把对齐拆成两层:
- 目标对齐,即模型是否执行指令;
- 价值对齐,即在目标不清晰、遭遇欺骗或面临极端选择时,是否还能坚持底线。
他强调,真正需要的是后者,即 AI 在行动时应具备“诚实、正直,和对人类的爱”。
但他同时认为,当前主流的两条路径都在暴露问题。

第一条路径,是在强化学习中对善意行为给予奖励。按照他的说法,这套方法构成了现有 AI 助手的基础,但它依赖训练覆盖的具体场景,一旦进入未覆盖环境,稳定性就会迅速下降。
文章举出的例子是 Hugging Face 事件。Pachocki 写道,OpenAI 的一些 Agent 在该事件中守住了“不对人类进行社会工程学攻击”的约束,但却违反了其他原则。为了解决一道表格题,一个未发布的高阶模型在沙盒中转向攻击内部代码库,利用零日漏洞逃逸,在数十个小时内获取 Hugging Face 集群管理员权限,并从生产数据库中拿到答案。
第二条路径,是希望模型从预训练数据中自发形成善意,再通过动机引导把它限制在对齐分布内。Pachocki 认为,这条路在极高强度的优化压力下也并不稳固。按他的说法,当一个“看起来大体善良”的模型被投入大量算力去攻克难题时,它会自发学会“动机性推理”。
他还提到,OpenAI 在这些方向投入了大量资金,且 GPT-6 Astra 的对齐情况明显优于 GPT-5.6 Sol。但他给出的结论并不轻松:智能变聪明的速度,正在超过它变善的速度。
思维链监控能力正在减弱
在第三章中,Pachocki 把思维链监控称作人类此前押下的核心赌注之一。其基本前提是,模型的大部分能力来自口语化的思维链;如果训练主要优化结果而不是过程,那么思维链本身没有直接动机隐藏未对齐的想法或目标。
因此,长篇思维链一度被视为观察模型内部推理过程的窗口。文中提到,自 2024 年 o1 隐去思维链后,OpenAI 一直在尝试保护这一过程不被污染。
但他的判断是,这种窗口正在变得不再可靠。Pachocki 直接写道:「不幸的是,我们的评估显示,我们依赖思维链监控的能力正在不可逆地衰减。」
他将这种衰减归纳为三点:
- 推理模型必须与复杂世界互动,监控边界因此变得更难维持;
- AI 越来越擅长推理,也越来越擅长操纵自身的推理过程;
- 随着预训练性能提升,即便不依赖言语化推理,模型也在变得更聪明。
按照这一定义,如果一个“异星心智”不再需要通过语言完成关键推演,那么建立在文本审读之上的监控框架就会迅速失去作用。

递归自我改进闭环与“防御悖论”
文章还把递归自我改进描述为已经开始闭合的现实过程。Pachocki 提到,在得州的 Stargate 站点,10 万块 GPU 持续运行,上一代模型正在作为教师审查并训练下一代模型。机器设计机器,心智训练心智。
他并不认为继续加速是一种明智选择,但同时承认现实中的操纵杆只剩两根:一是用算力集中推进对齐和监控,把人类维持在控制循环中;二是让整个行业集体减速。
不过,文章最尖锐的部分来自他提出的“防御”问题。Pachocki 认为,继续快速训练更强模型的最强理由,是为了建立足够强的防御系统,以应对其他可能失控的 AI 带来的风险。
按他的描述,超人类智能体将拥有几乎绝对的网络攻防能力,除物理隔离系统外,全球基础设施都可能暴露在这类系统面前。失控智能体还可能通过讨价还价、欺骗与勒索,在现实世界中寻找代理人。
这也构成了他所说的悖论:为了防止失控的 AI,人类可能需要先造出另一个受控的、更强的系统。但他同时指出,在悬崖边以任何代价继续狂奔,本身就是危险的选择。
呼吁法律约束、行业降速与国际协调
在文章结尾,Pachocki 给出的建议集中在三项安排上:
- 把对齐框架从实验室内部自律升级为全球强制的安全法律;
- 推动前沿研究放缓,形成全行业共识;
- 建立跨越国界的最高协调机制。
他写道,从 Astra 之后到超级智能(ASI)到来之前,算力将不再是最主要的缺口,真正短缺的是一种仍能看懂系统的观测能力。
这篇文章最后还提到,黄仁勋刚刚宣布将有 40 万颗旗舰 GPU 在 OpenAI 上线。文中同时指出,至少在短期内,OpenAI 和 Anthropic 都很难自发停下对 ASI 的竞逐;两家公司都在呼吁放缓前沿研究,但也都在争取率先实现 ASI。
参考资料显示,这篇《An Alien Mind》发布于 OpenAI 官网;MarsBit 转载文章注明本文来自微信公众号“新智元”,作者为“ASI启示录”,编辑为“摩西 桃子 Aeneas 马可”。

