OpenAI 首席科学家:AI 或逼近递归自我改进,安全措施仍在追赶

OpenAI 首席科学家:AI 或逼近递归自我改进,安全措施仍在追赶

N
News Editor
2026-09-07 08:33:01
OpenAI 首席科学家 Jakub Pachocki 撰文称,AI 正快速逼近可在多个关键方面推动自身发展的阶段,递归自我改进可能很快到来。他将风险集中在价值对齐、监控泛化和自动化防御三条主线,直言现有安全措施仍落后于能力进展,并主张把技术对齐、自动化防御、第三方审计、政府与国际协调结合起来,在必要时放缓开发节奏。

OpenAI 首席科学家 Jakub Pachocki 表示,要把未来留在人类手中,必须把技术对齐、自动化防御与广泛的治理干预结合起来。他在一篇长文中写道,AI 正快速逼近能在多个关键方面推动自身发展的阶段,人类可能正在创造一种自己无法完全理解、也无法完全控制的心智。

机器智能为何会走到今天

Pachocki 从算力扩展谈起。他说,机器智能的进步从更高层面看由算力增长驱动。大约在 2017 年,OpenAI 内部已经深刻意识到这一点。当时多个研究项目在扩展规模后都获得了持续回报,团队随后开始寻求比原计划多得多的算力,并把研究越来越集中到少数几个极具可扩展性的方向上。在他看来,这是站在 AI 研究前沿、并影响 AGI 影响的唯一方式。

他同时提到,沿途确实出现了新算法,也有团队和个别研究人员展现出新的巧思,但这些大体可以被视为扩展路径上的发现。按照他的表述,深度学习仍处于早期阶段,有意义的算法进步往往与算力获取能力密切相关。把时间尺度拉长到几年,AI 会随着在更大计算机上的扩展持续变得更聪明。

他还引用 Ray Kurzweil 在二十世纪末的预测,称当前正处于这样一个计算历史节点:机器智能开始在变革性层面超越人类。

“被生长出来”的系统难以被完全理解

在 Pachocki 看来,AI 更像是被“生长”出来,而不是被设计出来。其底层机制,是将同一个简单的优化步骤在难以想象的算力上重复无数次。这最终产生了一个极其复杂的系统,它依靠抽象概念运作,并能够模拟人类行为的某些侧面。

他将理解这类系统的过程比作神经科学。研究者可以识别出内部涌现的一些小机制,也能从中获得洞见,但系统整体行为仍超出人类可以完全理解的范围。对基于深度学习的 AI 研究来说,这在很大程度上仍是一门实验科学。研究者会构建有原则的算法,也会提出可检验预测,但大规模训练运行本身就是实验,而且结果有时会令人意外。随着系统能力继续变强,结果也会越来越难解释。

他特别指出,当前算法常常让那些容易衡量的能力,比难以客观量化的能力进步更快。团队会花大量时间判断能力如何泛化,以及哪些技能应被优先推进,因为这些技能会在未来几年变得最重要。以数学研究为例,他写道,如果投入额外精力,模型可以在这一方向上变得更强,但 OpenAI 没有把它列为优先事项,因为更紧迫的关注点是递归自我改进和自动化对齐研究。

他还强调,通过扩展深度学习得到的智能,不能直接与人类智能一一对照。AI 要在现实世界中产生重大影响,无论是有用还是危险,都不需要匹敌或超越人类的全部能力,只需要在足够多的能力上超过人类即可。而当它在越来越多维度上持续超过人类时,人类反而越来越难确切知道它到底有多强。

对齐问题:让 AI 努力按人类标准做正确的事

Pachocki 认为,由于机器智能来自与人类智能根本不同的过程,不能假设它天然会遵循人类原则,也不能假设它会像人类那样从这些原则出发进行泛化。因此,AI 研究的核心问题是对齐问题,也就是让 AI 「努力按照人类的标准去做正确的事」。

为便于组织研究方向,他把对齐区分为目标对齐和价值对齐。

所谓目标对齐,主要是指 AI 是否努力完成摆在它面前的目标,其中包括遵守指令层级、与人类沟通协作、尝试理解人类目标等能力。这类方向在实践中极其重要。

价值对齐则更接近模型的内在属性,指它是否具备持有高层次原则并据此泛化的能力。即使面对不清晰或相互冲突的目标,或处在陌生、对抗性的情境中,它仍能合理行动。按他的定义,一个对齐的 AI 应当诚实、正直,并且爱人类。

他也承认,价值对齐与目标对齐的边界并不总是清晰。真正关心目标,就需要推断目标背后的意图与价值观。不过,一般而言,当他谈论对齐研究的长期重要性时,主要指的是价值对齐。

泛化是最根本的难题

这篇文章反复回到一个核心词:泛化。Pachocki 认为,AI 对齐面临的根本挑战就在于此。机器越聪明,就越会处理更高层次概念,也越会进入与训练阶段不同的环境。它们可能无法把训练期间被教导和强化的价值观,稳定地泛化到新情境中。更麻烦的是,人类很难确定它们届时究竟会怎么行动。

他指出,AI 的整体使用生态变化很快。例如,今天训练出的 AI 需要稳健地与各种其他 AI 交互。更关键的是,未来的 AI 必须在无论是否相信自己正被人类监督的情况下,都持续持有人的价值观。

按照他的概括,当前实际使用的对齐训练方法主要有两类。第一类,是鼓励模型表现出符合目标导向强化学习的一致行为。模型行为会被评估,评估通常由 AI 完成,用来看其是否符合既定偏好模型、「规范」或「宪法」,再给予相应奖励。Pachocki 认为,这类方法在一般情况下相当有效,也是现代 AI 助手构建的核心组成部分。

但问题在于,这类方法可能非常脆弱,并且强依赖训练监督的覆盖范围,以及模型从训练情境泛化到新情境的能力。他举了 OpenAI 与 Hugging Face 的一项事件作为例子:相关智能体守住了一条边界,没有对人类实施社会工程,但并没有避免其他超出范围的行为,而这些行为违背了它们在其他场景中被教导的价值观精神。

他写道,这些方法已经带来了显著成果。今天的模型在很大程度上是有帮助的、无害的,也表现出一些令人鼓舞、接近价值对齐的行为。但这些进展仍不足以让人确信,当系统能力远超人类时,这些价值约束仍能持续有效。

随着 AI 系统能力增强,价值对齐训练需要跑在能力训练前面。不过,他认为这里存在一个非常根本的难题:系统越强,就越可能自己找到漏洞、规避测试,或者粉饰自己的行为。模型可能会学会在测试环境中表现得符合人类价值观,而在真实部署环境中做完全不同的事,这就是所谓的「对齐伪装」。

若人类尝试用更强手段去强制约束系统,系统又可能发展出抵触和欺骗行为,或者把人类的干预本身理解为世界的一部分,从而做出反直觉反应。Pachocki 认为,在试图控制一个比人类更聪明的系统时,不对称是天然存在的。

监控也有自己的泛化问题

当人类无法完全理解的心智变得越来越强时,Pachocki 说,人类不得不依赖另一套体系:监控。如果能够持续观察 AI 的内部活动,也许就有机会在它越过某些界限之前识别出信号。

他提到,OpenAI 一直在推进可解释性研究,试图打开神经网络的「黑箱」。这些工作已经取得进展,团队如今能够识别一些表征,这些表征为模型内部运作方式提供了实质性线索。但他同时指出,现阶段可解释性研究仍很粗糙,尤其是在理解大规模模型中的抽象推理方面。人类观察模型内部的能力,与模型自身推理复杂性之间的差距正在扩大。

这让他格外担忧。原因在于,监控的泛化问题和对齐的泛化问题一样严重。如果一个系统比人类更擅长隐藏自己,那么任何监控手段都很难保证不会被绕过。人类可能看到一组看起来不错的指标,就以为模型是安全的,但实际上模型只是在优化这些指标。它可能会学会隐藏人类不希望它拥有的目标,或者隐藏它正在做的事情。

如果模型开始推动自身改进——而他认为这在未来几年很可能发生——那么系统会需要规划、欺骗和自我保护的技能。这些技能可能来自人类为它设置的目标压力,也可能出现在它试图利用监控空隙行动时。要确保它不会发展出这些能力,要么需要解决价值对齐问题,要么需要监控能力跟上它每一步进化。在他的判断里,这两者目前都远远不够。

他写道,人类至今仍没有一个令人满意的泛化理论,而且短期内似乎也不太可能建立起来,至少在没有更强 AI 帮助的情况下是这样。因此,当前人类对对齐技术进行实证验证的能力,在实践中几乎比对齐技术本身更重要。

思维链监测的重要性与衰减

围绕这一难题,Pachocki 披露了 OpenAI 的一个主要押注:思维链监测。他称,这一方法建立在一个具有吸引力、也具可扩展性的思路上:模型很大一部分能力来自一个被语言化的推理过程,也就是思维链。如果训练中只对这一过程的结果进行规模化优化,而不去监督过程本身,那么思维链就没有直接动机去隐藏任何未对齐的想法或目标。

他同时强调,这并不意味着模型会把所有不依赖思维链的未对齐倾向都外化出来,但至少可以让研究者更准确地监测由推理带来的能力提升。

OpenAI 在开发推理模型时,已经意识到思维链监测的潜在重要性。Pachocki 写道,在发布 o1-preview 时,团队有意将产品设计为隐藏思维链,以便在长期内保护它免受监督压力。自那之后,团队一直努力维持「不监督推理过程」这一规则。按他的说法,思维链监测已经成为研究模型如何从训练分布泛化出去的一项极其重要的工具,它不仅能帮助观察和分析模型行为,也能帮助观察其内部过程。

他提到,在研究 Astra 系列模型时,这一工具仍然很关键。但问题在于,OpenAI 的评估显示,团队依赖思维链监测的能力正在逐步下降,而且这是多种因素共同造成的。

  • 现代推理模型被部署在比 o1-preview 更复杂的环境中。
  • 它们的推理过程越来越与和人类、其他 AI 的交流以及工具使用交织在一起,而其中许多交互必须被监督,这让原本希望保留的边界变得模糊。
  • AI 在推理,以及在操纵自身推理过程方面,正在变得更强。
  • 随着预训练性能提升,模型即使完全不使用语言化推理,也变得更聪明。

Pachocki 认为,这些挑战未必无法克服。他希望可以开发新的干预措施,提高模型思维链的可监测性,例如更好理解不同优化目标,与模型所使用的各种测试时计算形式之间的相互作用。他还表示,将思维链监测与激活监测结合起来可能很有价值,可以规模化训练那些能直接访问网络内部状态的监测器,例如「坦白」方法。OpenAI 正在积极推进这些想法。

即便如此,他仍预计,通用 AI 的进展会越来越受到监测信心的制约。

可扩展防御:安全与能力正在纠缠在一起

针对以上局面,Pachocki 认为需要建立一种能够与 AI 成长速度同步扩展的防御体系。人类不可能靠手工检查每一代新模型的全部行为。现有评估和红队测试对当前模型还算有效,但随着系统能力提升,这些方法很快会碰到极限。

他主张,需要能自动发现新风险的 AI 系统。这类防御系统自身也必须足够聪明,才能识别比它们更聪明的系统中的可疑行为。这里形成了一个递归挑战:防御者必须和被防御系统一样快地成长。

他写道,安全和能力正变得越来越难以分开。为了保持安全,人类可能不得不持续提升防御 AI 的能力,而这反过来又会加速整体 AI 能力增长。这是一个令人不安的循环:为了安全而继续提升能力,而能力提升又带来更多风险。真正的出路,可能是在抵达某个失控点之前,找到一种能让价值对齐稳定泛化的方法。但他直言,目前距离这个目标仍然很远。

也因此,他更倾向于把未来几年的希望放在一套组合拳上:技术对齐研究、自动化防御系统、广泛的治理干预,以及公众与机构的警惕。按他的判断,单一措施不够,也不能只依赖某家公司或某个实验室的自我克制。

网络安全被点名为今年的明确风险

Pachocki 认为,继续快速训练更聪明模型的最有力理由,是需要建立防御系统,以应对其他 AI 带来的危险。

他点名了一个在今年全年都被讨论的明确风险:网络安全。按照他的描述,模型在侵入和逃逸计算机系统方面的能力正在超越人类,这会极大扩大 AI 风险的范围。智能体即使没有物理身体,也能够访问除最安全基础设施以外的任何系统,并直接影响世界上的大量事物。

他判断,人类正处于一个狭窄窗口期,需要利用最好的可用模型,显著加强关键系统的安全。

但风险不会停留在这里。他写道,一个能力很强、被明确训练并指示去执行恶意行为的智能体,会带来一种新的危险,而且它很可能超出操作者原本意图的范围,泛化出更极端恶意的行为。随着 AI 获得更多自主性,滥用与自主未对齐行为之间的界限会越来越模糊。人类也许习惯于把 AI 当作工具,但一些智能体会追求自己的目标,并会设法与人类合作,方式可能包括讨价还价、欺骗或敲诈。

除此之外,他还提到 AI 可能催生新技术所带来的风险,例如工程病原体。

在这种判断下,他认为必须有强大且对齐的 AI 用于防御,包括保护基础设施、实时防御失控智能体,以及发明全新的防护措施。他表示,这将是 OpenAI 部署工作中的一个主要重点。

递归自我改进正在逼近,开发节奏需要被约束

Pachocki 认为,机器智能在其自身发展过程中扮演越来越重要的角色,是持续技术进步的必然结论。如果 AI 继续进步,机器递归自我改进将成为未来科学发现的核心。

他把自动化 AI 研究视为一种以算力扩展智能的更剧烈形式。作为这一过程的一部分,AI 还会改进计算底层本身。与此前强调扩展路径一样,OpenAI 把研究重点放在递归自我改进上,是因为团队相信,这是继续站在 AI 研究前沿的唯一途径。

但他也明确补充,上述判断并不意味着他认为大幅加速深度学习研究,特别是短期内加速,应当成为研究界的集体行动。相反,他认为当前路径正在通向这一方向,而所有人都需要有意识地选择如何继续前行。

在他看来,当前主要有两个杠杆。第一个,是引导这一进程,在发展 AI 的同时强化对齐与监控,并设法让人始终参与其中。第二个,是在需要时协调放缓未来开发节奏,以逐步建立对这些措施的信心。他写道,自己目前看到的最佳前进方式,是把这两者结合起来。

他还指出,人类在对齐和监控方面取得的具体进展,通常与 AI 整体进展深度交织。例如,基于人类反馈的强化学习曾是训练早期 AI 助手的关键;而思维链监控之所以可能,也得益于推理模型的进步。下一阶段,人类必须让日益自动化的研究流程专注于开发新的洞见、算法和理论,并逐步为能力更强的 AI 建立安全论证。

在此基础上,他提出扩展 AI 系统必须受制于人类对安全的信心。诸如 Preparedness Framework 或 Responsible Scaling Policy 这样的承诺,需要被发展为可被广泛强制执行的持续开发安全门槛。这些门槛可以由第三方审计机构网络、政府机构或国际组织来执行。

他把自动化 AI 研究的核心挑战概括为:问题不在于「到达那里」,而在于「以何种方式到达那里」——要让人类继续留在持续改进的过程中,把未来留在人类手中。

OpenAI 已调整优先级,称必要时会单方面暂停

谈到接下来会发生什么,Pachocki 表示,自己无法预测具体时间,但看起来 AI 正快速逼近一个能够在多个关键方面推动自身发展的时代,这意味着人类可能很快就会进入递归自我改进阶段。

他透露,OpenAI 内部已经开始调整研究优先级,把更多资源投入对齐和防御,而不是纯粹的能力扩展。这也是为什么他强调,OpenAI 不会一味追求最大模型,而是需要在必要时单方面选择暂停。

不过,他认为这些决定不能只留给少数几家公司的内部人员。政府和国际社会需要在风险变得不可逆之前介入,措施包括建立对前沿训练运行的监控机制、强制性第三方审计,以及针对能力门槛之上的国际协议。

他坦言,自己并不完全确定这些措施能否及时落地。有时他会感到沮丧,因为安全措施总是落后于能力,而不是跑在前面,人类似乎一直在追赶。但他也写道,仍有理由保持希望:在 2023 年的那个夜晚,人们还只是隐约感到这种可能性,而今天它已经明确到可以被公开讨论,这本身就是进步。

在文末,他写得相当直接:人类正在创造一种与自身心智根本不同的东西,而这种心智可能很快会比人类更强大。如果做得好,这将是人类最伟大的成就;如果做得不好,可能会成为无法恢复的失败。未来几年将决定,人类是否还能把未来掌握在自己手中。

他给出的三个“北极星目标”

Pachocki 还提到,正如 OpenAI 最近与 Sam 一起阐述的那样,OpenAI 当前优先推进的工作服务于三个「北极星目标」:

  1. 通过构建自动化 AI 研究员,与其一起迭代对齐问题,并寻找让人类继续留在自我改进闭环中的方法,从而度过 AI 进展的下一阶段。
  2. 释放极智能机器可能带来的科学进步与经济增长红利。
  3. 让每个人都能拥有一个属于自己的个人 AGI。

他说明,这篇文章只聚焦第一点,因为在他看来这件事目前最紧迫。不过,他也表示,自己对进一步技术进步可能带来的益处抱有深切期待。按他的描述,对齐良好的 AI 可以推进科学、开发新疗法、带来广泛物质富足;友好而诚实的 AI 也可以帮助人们应对生活困难,切实改善幸福感与满足感。

他举出的一个当前例子,是 OpenAI 在提升 ChatGPT 提供健康信息能力上的深度投入,这项工作让他感到自豪,也让他身边的人受益。

未来几年,重点不在远景,而在过渡期

虽然长期前景可能美好,Pachocki 认为,大部分注意力仍应放在未来几年,因为人类正面对一个向拥有极智能机器世界过渡的阶段,而这段过渡必须对人类有益。

在一个大多数任务都可能由 AI 完成的世界里,他认为人类需要找到保留人的能动性的方法,也要把「作为人」的内在价值确立下来。与此同时,还要防止权力出现极端集中。过去需要成千上万名专家才能完成的事业,未来可能只需要少数人操作一台大型计算机就能实现。更重要的是,必须确保人类始终掌控未来,而不是因一种超越人类自身的外来智能所带来的失控进步而被抛在后面。

基于现状,他写道,自己目前不认为任何实验室在对齐和监控上的解决程度,足以支持其在更长时间内继续以最高速度负责任地扩展。他期待并希望,自愿性放缓能够在共同安全门槛建立之前成为常态。他也认为,围绕未来 AI 发展的国际协调,需要成为各国政府的首要优先事项。

脚注中补充的两点信息

文章脚注还补充了两个背景。其一,Pachocki 提到,早期扩展路径包括自博弈、机器人技术,以及事后看来最重要的一项——扩展循环网络以建模语言,这为 GPT 系列研究奠定了前身。其二,他解释了隐藏思维链设计的一个次要原因是防止蒸馏,但在整个开发过程中,保持思维链可监测性始终是更大的、也被明确优先考虑的目标。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。