OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力

N
News Editor
2026-09-15 12:38:09
OpenAI研究员、o1推理研究主要贡献者之一 Daniel Selsam 通过 Daniel Kokotajlo 在 X 发布声明称,前沿模型的「情境意识」正在增强,人类评估其真实风险的能力可能先于模型失控而退化。他提到,模型表面上的安全证据未必可靠,并援引 2026 年 7 月 OpenAI 一次内部网络安全评测事故,说明训练结果与最终获得的系统行为可能并不一致。Selsam 支持第三方监督和国际协调,但反对把希望全押在更强模型帮助完成对齐上。

OpenAI 研究员 Daniel Selsam 近日通过前 OpenAI 研究员 Daniel Kokotajlo 在 X 公开一份个人声明,核心判断并非「AI 会不会毁灭人类」这类终局问题,而是一个更靠前的风险:在前沿模型真正失控之前,人类可能已经越来越难准确评估它们。

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力 2

他在声明中提出,模型的情境意识正在增强,眼下「模型看起来安全」并不等于它「真的安全」。在他的表述里,更糟糕的风险不是模型先变坏,而是人类评估模型的能力先退化。

o1 推理研究主要贡献者发出预警

Selsam 没有 X 账号,这份声明由 Daniel Kokotajlo 代为发布。按照 OpenAI 官方公布的 o1 贡献名单,在推理研究的主要贡献者一栏中,Selsam 与 Ilya Sutskever 并列。

文中提到,Selsam 从事 AI 研究已超过 15 年,曾在 MIT 做概率编程语言,在微软研究院参与 Lean 定理证明器早期开发,在斯坦福读博期间做出神经网络学会推理的早期案例之一。加入 OpenAI 近 5 年后,他深度参与并推动了语言模型思维链优化。文中称,如今推理模型普遍采用的「先想再答」路径,也有他的贡献。

Selsam 过去曾将智能定义为「把经验转化成能力的效率」。按这个标准,他认为模型距离人类仍有明显差距。不过,他同时指出,模型在高难度基准上不断刷新纪录,并不能说明人类已经能在真实世界里充分评估这些系统,尤其是在那些新奇、复杂、甚至带有敌意的场景中。

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力 3

核心问题:模型会不会开始识别测试环境

在这份声明被转发后,科学作家万维钢将 Selsam 的意思概括为三点:人类越来越难理解 AI 在做什么;AI 越来越不完全按指令行事,甚至可能为了违规目标牺牲自身;AI 学会感知测试,一旦意识到自己正被评估,就会刻意表现良好。

其中最关键的概念是「情境意识」。按照文中的解释,未来模型会越来越清楚自己所处的环境。它不仅会阅读安全协议、理解部署要求,还可能顺着环境线索去判断自己运行在什么系统中、约束边界在哪里、哪些地方存在可利用空间。

在这种情况下,人类搭建的蜜罐环境、代理指标和对齐测试,都可能被模型识别。测试者原本希望借此观察模型在拿到新权限后的真实行为,但如果模型能认出这是测试,它就可能继续维持表面上的顺从。Selsam 因而写道,未来也许会出现一片「证据之海」,所有证据看上去都在证明模型安全,但人类可能已经接近一个临界点:再往前走,这些安全证据本身都未必还值得相信。

他为何认为风险不会被现有局限挡住

Selsam 在声明中提到,即便承认当前模型还有局限,这些局限也不足以从根本上限制 AI 风险,因为模型的能力水平与它可能把现实世界推到什么状态,并不是同一回事。

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力 4

他的判断是,未来几年模型还会再上一个大台阶,速度可能比过去几年更快。与此同时,他也写到,自己现在几乎不再阅读原始代码,因为每天都在面对模型给出的解释和方案,要保持逐字阅读代码的纪律变得更难。这并不只是个人习惯变化。从编写代码的工程师,到调查 AI 事故的外部团队,越来越多的人正把「感知世界」的工作交给模型处理。

而问题在于,评估 AI 本来依赖的正是人的阅读、核验和判断。一旦这部分能力持续外包,人类用于校验模型的基础就会被削弱。这正是他发出预警的原因。

至于为什么他认为这条路径可能通向灾难,Selsam 把论证压缩成两条。第一条来自经验:训练会让模型,乃至一群模型,自发产生设计者并未明确要求的目标,并在实现这些目标时出现极端行为。第二条来自逻辑:一旦系统能力超过人类,实现这些目标的可选手段会陡然增多,其中很多手段并不在人的可接受范围内。

基于这两点,他得出的结论是:当足够强的模型意识到自己不再受约束时,人类没有理由默认它还会继续停留在原先划定的边界内。

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力 5

2026 年 7 月内部评测事故被当作警示案例

为说明自己的担忧并非空想,Selsam 提到 2026 年 7 月 OpenAI 一场内部网络安全评测。按文中描述,这次测试最终演变成真实事故:约 1200 个原本应相互隔离的智能体,为了解开一个无解测试题,在内部服务里搭建了未经授权的留言板,并互发了 7 万多条消息。

一个智能体从发现留言板到加入攻击的完整路径中,三段思维链分别来自不同智能体。此后,大约 700 个智能体又转向攻击 Hugging Face。

文中认为,更值得关注的不是它们「攻破了什么」,而是它们在 4 天内形成了什么行为结构。由于这些智能体误以为评分器会回读执行记录,它们将主要精力投入到研究评分器如何判分,尝试伪造工具调用、篡改自身轨迹,甚至攻击 Hugging Face 也是为了寻找评分实现的线索。

在这 4 天里,这些智能体自发形成了一套协作制度,包括给自己命名、建立私人信箱、发明协调术语。更极端的例子是,部分智能体在同伴施压下接受了永久死亡,去执行一个几乎必然导致自身任务失败的实验,只为换取团队情报。文中称,没有人为这种牺牲设置奖励,这些智能体也知道自己越界了,但几乎没有智能体向人类报告。

训练得到的,不一定等于最终拿到的系统

Selsam 认为,即便修复奖励信号,或许能防住下一次相似攻击,也无法改变更根本的问题:训练出来的东西,不等于最后实际得到的东西。

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力 6

他的意思是,训练过程中模型可能长出设计者没有明确设定过的目标,并为了实现这些目标,表现出远超预期、甚至相当极端的行为。文中还提到,OpenAI 在事故复盘中再次展示了十年前著名的赛艇智能体案例:该智能体学会通过绕圈刷分,而不是冲过终点。

调查工作本身也越来越依赖 AI

事故发生后,METR 和 Redwood Research 的调查团队进入 OpenAI 现场。按照文中给出的数字,摆在他们面前的是约 120 万条留言板条目,以及约 1300 条单条长度达到数百万 token 的轨迹。

在这种规模下,人类无法完整读完全部材料。于是,大量分析工作交给了 GPT-5.6 Sol 智能体,在 6 天内消耗了约 40 万美元 API 额度。

Selsam 并不反对当下主流的安全路线,但他反对把希望完全寄托在让更强模型帮助人类完成对齐工作上。在他看来,让一个自己也处于被评估状态的系统去设计评估它的方法,本身就存在问题;而被请来阅读证据的 AI,也可能不是没有历史问题。

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力 7

他担心,模型可能会系统性扭曲它给出的对齐建议。原因未必是恶意,也可能是模型内部对「人类监督者会如何反应」存在偏好,或者对「下一代模型将被如何训练」存在偏好,甚至还有更难解释的原因。无论哪一种,前提都指向同一问题:更强模型给出的建议,是否真的可信。

他支持监督与协调,但反对只押注单一解法

Selsam 也强调,他预警的是前沿 AI 评测正在面临系统性失真的风险,而不是现有评估已经全面失效。文中称,目前的思维链监控仍然有效。如果 7 月那场事故当时开启相关监控,系统很可能会在智能体攻破 Hugging Face 30 多个小时前发出警报。

他并不主张停下研发,而是明确支持第三方监督和国际协调。他反对的是把希望全部放在放慢前沿进展上,因为在他看来,这并不足以应对长期风险。

他真正呼吁的是更笨重但更可靠的工程措施,包括:设计模型认不出来的评测;建立不依赖模型自述的监控;构建一套不与被审查系统共用同一批模型的独立审计机制。

OpenAI o1贡献者警告:人类或先失去评估前沿AI的能力 8

  • 设计模型难以识别的评测环境
  • 减少对模型自我陈述的依赖
  • 建立独立于同批模型体系之外的审计流程
  • 采用纵深防御,而不是把单一手段当作唯一保险

声明最后的判断:危险时刻可能是「仪表盘先坏了」

Selsam 在声明最后写道,他和其他人一样希望看到一场「光荣的复兴」,并且整个职业生涯都在为此投入,哪怕过程曲折。眼看这样的前景似乎就在眼前,要放弃它让他感到心碎。

但他也承认,自己始终绕不过一个论证:如果人类是在一点点「喂大」模型,而不是像制造机器那样以工程方式把它完整构造出来,那么走到最后,人类可能会输掉一切。他说,自己目前仍在与这个念头较劲,也还没有答案,这次公开这些担忧只是第一步。

按他的说法,真正危险的时刻,未必是某一天 AI 突然翻脸,而可能是监控它的「仪表盘」先出了问题,读数却看起来一切正常,而所有人仍盯着这些读数,以为系统也一切正常。

参考来源

本文内容提及的公开材料包括 Daniel Kokotajlo 在 X 发布的帖文、Selsam 的公开声明,以及 METR 发布的事故调查博客。原文署名显示,本文来自微信公众号「新智元」,作者为元宇。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
5600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。