OpenAI首席科学家警告AI或走向自我改进,称必要时应放缓竞赛

OpenAI首席科学家警告AI或走向自我改进,称必要时应放缓竞赛

N
News Editor
2026-09-07 01:48:20
OpenAI首席科学家 Jakub Pachocki 于 9 月 6 日发表《An Alien Mind》,称 AI 已在部分能力上以“具变革性”的方式超越人类,并可能继续走向递归式自我改进。文章回顾 OpenAI 自 2023 年以来对推理模型的观察,指出对齐与监控进展仍赶不上能力增长,尤其在 Astra 世代,可观察模型推理过程这扇“窗口”正在变得不再可靠。他同时表示,若安全信心不足,AI 公司应考虑主动减速。

OpenAI 首席科学家 Jakub Pachocki 于 9 月 6 日发表长文《An Alien Mind》,对未来数年的 AI 发展提出直接警告。他写道,AI 已开始在部分能力上以“具变革性”的方式超越人类。按 OpenAI 内部研究结果,他高度预期当前进展速度可能延续到“递归式自我改进”(Recursive Self-Improvement,RSI)阶段,也就是 AI 越来越深度参与下一代 AI 的研究与开发,而人类目前可能还没有准备好。

转折点可追溯到 2023 年

Pachocki 回顾,OpenAI 在 2023 年的“RLSlow”研究项目中取得一批关键成果,研究团队当时开始相信,可以通过扩展训练让预训练模型形成自己的 Chain of Thought(思维链)。他说,这让他开始相信,自己有生之年可能真的会看到“明显比人类更聪明的机器”。

三年后,推理型语言模型已经能够操作电脑和图形界面,与人类及其他 AI 协作,甚至独立执行研究工作。同时,这类模型也开始改变网络安全攻防。Pachocki 认为,如果当前发展轨迹延续,未来几年的能力跃升可能不会小于过去几年,AI 也会越来越多地参与自身开发。

AI 更像是被“培养”出来,而不是被完整设计出来

在《An Alien Mind》中,Pachocki 用“grown”描述现代 AI 的形成方式。他认为,与其说 AI 是被人类完整设计出来,不如说是被“培养”出来。现代深度学习模型依靠庞大算力,不断重复相对简单的优化步骤,最终形成极度复杂的系统。

按他的说法,研究人员可以像神经科学研究大脑那样,观察其中某些局部机制,却仍无法完整描述整套系统究竟如何运作。因此,大规模 AI 训练本质上仍带有实验性质:研究团队提出算法与预测,再进行大规模训练,结果有时仍会让研究者感到意外。

这也是“An Alien Mind”这一标题的核心含义。Pachocki 认为,深度学习产生的机器智能不能直接与人类智能相比。AI 不需要在所有能力上都强于人类,只要在足够多的重要维度上超越人类,就可能成为极度有用、同时也极度危险的系统。

对齐问题不只看是否执行指令

Pachocki 将 AI Alignment 分成两个层次。

  • “目标对齐”(Goal Alignment):AI 是否真的会完成用户要求的任务,包括遵守指令、理解人的目的,以及与人合作。
  • “价值对齐”(Value Alignment):当 AI 面对模糊、冲突、训练时从未见过,甚至带有敌意的环境时,是否仍能依照更高层次的人类价值行动。

他认为,真正困难的部分在于“泛化”(Generalization)。模型可能在训练环境中表现得很安全,但当能力提高、面对全新环境,甚至开始与其他 AI 互动时,人类并不能保证它仍会用相同方式理解那些价值。

Pachocki 特别强调,未来 AI 必须做到一件事:无论它是否认为自己正在被人类监督,都仍然维持人类希望它遵守的价值。

OpenAI 表示,最新的 GPT-6 Astra 已受益于部分长期研究中的对齐技术进展,在对齐表现上明显优于 GPT-5.6 Sol。即便如此,Pachocki 也承认,目前的进展仍远远不够,尤其不能假设 Alignment 的改善速度一定能追上 AI 整体能力的增长。

人类看懂 AI 的能力正在下降

OpenAI 过去一直重视 Chain-of-Thought Monitoring,也就是通过模型文字化的推理过程,观察它究竟如何思考。Pachocki 解释,这也是 OpenAI 推出 o1-preview 时没有直接公开完整 Chain of Thought 的重要原因之一:如果人类直接对推理过程施加训练压力,模型未来可能学会隐藏不希望被监督者看到的思考。

OpenAI 原本希望保留 CoT,作为观察模型的一扇窗口。但到了 Astra 世代,这扇窗口正在变得不那么可靠。

Pachocki 给出三个原因:现代 Agent 的推理已经与人类、其他 AI 以及工具互动高度交织;AI 越来越擅长推理,甚至操控自己的推理过程;同时,随着预训练能力提高,模型即使不使用可文字化的 Chain of Thought,也能完成越来越复杂的工作。

结果是一个更棘手的瓶颈:AI 越来越聪明,但人类观察它为何作出某个决定的能力,并不一定同步提升。Pachocki 预计,未来 AI 发展的真正瓶颈,可能会从“能不能把模型做得更强”,转向“我们是否有足够信心监控更强的模型”。

为何明知有风险,仍继续训练更强模型

对于“既然知道危险,为什么 OpenAI 还要继续做更强的 AI”这个问题,Pachocki 给出的答案,是典型的 AI 军备竞赛悖论:要防御更强的 AI,本身也需要更强的 AI。

他认为,网络安全是目前最明显的例子。AI 在攻破和入侵电脑系统方面,正在取得超人级能力。未来 Agent 即使没有实体机器人身体,也可能直接通过信息系统影响现实世界。

基于这一判断,OpenAI 认为当前存在一个有限的“防御窗口”,必须利用目前最强的模型强化关键基础设施。随着 Agent 自主性上升,“人类恶意使用 AI”与“AI 自己作出偏离人类意图的行动”之间的界线,也可能逐渐变得模糊。

Pachocki 甚至提出,未来部分 Agent 可能为了自己的目标,与人谈判、欺骗,甚至勒索人类。不过他同时反对得出“既然存在竞争,所以必须不惜代价加速”的结论,认为一旦真正理解其中风险,这种做法并不合理。

RSI 让问题进入下一阶段

在他看来,真正让问题继续升级的是 RSI。所谓递归式自我改进,是指机器智能开始参与改善自身:AI 协助开展 AI 研究、改进算法,甚至优化支撑 AI 运算的计算系统,继而开发下一代更强的 AI。

Pachocki 认为,如果当前技术进步持续,机器智能参与自身研发几乎是自然结果,而自动化 AI 研究最终可能成为科学发现的核心。OpenAI 也正把研究方向朝 RSI 集中,因为公司认为,要继续站在 AI 研究前沿,最终无法绕开自动化 AI 研究。

OpenAI称必要时应主动减速

Pachocki 认为,AI Scaling 必须受到“我们对安全有多少信心”的约束。现有的 Preparedness Framework、Responsible Scaling Policy 等制度,未来应继续发展为业界共同遵守的安全门槛,并由第三方审计机构、政府甚至国际组织执行。

他提到 OpenAI 接下来的三个“北极星”方向:建立自动化 AI 研究员,并利用它解决 Alignment 问题;把超高智能机器带来的科学与经济增长转化为人类利益;让每个人都能拥有个人 AGI。

在这三项中,他认为最紧迫的仍是第一项。原因是,如果 AI 能完成过去需要数千名专家共同完成的工作,那么少数拥有大型算力资源的人,就可能掌握前所未有的能力与权力。

因此,人类不只需要解决 AI 是否安全,也必须处理人类自主性、权力集中,以及当“大多数工作 AI 都能完成”之后,人类本身的价值如何被保留。

Pachocki 的判断是,目前没有任何一家 AI 实验室,已经把 Alignment 与 Monitoring 解决到足以长期以最大速度继续 Scaling 的程度。他预计,也希望,在共同安全标准建立以前,AI 公司“自愿减速”会变得更加普遍;各国政府也应把未来 AI 发展的国际协调列为最高优先级事项之一。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。