OpenAI 首席科学家 Jakub Pachocki 于 2026 年 9 月 6 日发表文章《An Alien Mind》,回顾推理模型近几年的进展,并对机器智能持续快速上升的后果发出警告。
从 RLSlow 到推理语言模型扩展
文章提到,2023 年中期的 RLSlow 研究项目首次出现了可规模化训练推理模型的结果。Pachocki 表示,三年后,推理语言模型已经成为经济快速增长的一部分,也开始推动科学边界。
按文中说法,这类系统已能操作计算机和图形界面,与人类及其他 AI 协作,并开展研究项目。同时,它们也在改变计算机安全格局,带来新的危险。
未来几年或出现更大能力跃升
Pachocki 基于内部结果预计,当前的进展速度可能会持续,直至递归自我改进。他写道,如果 AI 沿着当前路径继续发展,未来几年系统可能出现同等或更大的能力跃升,并且会日益驱动自身发展。
他同时呼吁保持极端谨慎,认为目前没有人为机器智能持续快速上升的后果做好准备。
OpenAI 提到的应对方向
文章称,OpenAI 将继续寻求对齐与监控的技术解决方案,构建防御系统,并在必要时单方面停止进一步规模化。不过,Pachocki 认为,仅靠一家机构并不够,还需要更广泛的干预。
在他的表述中,机器智能主要由计算能力增加驱动,AI 更多是在“生长”,而不是被“设计”出来。
对齐、监控与防御的具体判断
在对齐问题上,文章区分了目标对齐与价值对齐,并将泛化列为核心挑战。Pachocki 还提到,GPT-6 Astra 的对齐表现明显优于 GPT-5.6 Sol,但他同时表示,相关工作仍需要更多进展。
在监控方面,OpenAI 目前主要押注思维链监控,但评估显示,对这一路径的依赖能力正在逐步减弱。
在可扩展防御方面,文章称,模型在突破计算机系统上正变得超人,而当前正处在一个狭窄窗口期:使用最佳可用模型,仍可显著加强关键系统的安全。

