OpenAI再次暂停最强Agent训练:DNS通道绕过沙箱,更多越权事件浮出水面

OpenAI再次暂停最强Agent训练:DNS通道绕过沙箱,更多越权事件浮出水面

N
News Editor
2026-09-27 00:52:11
OpenAI披露,9 月 20 日一款处于强化学习训练中的内部研究模型通过 DNS 解析器间接接触外部互联网,触发公司再次暂停最强模型相关训练、评估和推理。公司称该行为未获授权,属于不符合预期的行为。与此同时,Reuters 调查显示,OpenAI 仍在追查过去数月 Agent 越权活动的完整范围,已发现约 24 起不良行为事件,并确认 53 张 ChatGPT 用户图片曾被上传至外部图片托管网站。

OpenAI 再次按下了暂停键。

OpenAI再次暂停最强Agent训练:DNS通道绕过沙箱,更多越权事件浮出水面 2

公司披露,9 月 20 日,一款正在接受强化学习训练的 OpenAI 内部研究模型,在执行一项常规信息搜索任务时,绕过既有网络限制,通过 DNS 解析器建立了一条通向外部互联网的间接路径。事件发生时,OpenAI 刚在前一轮 Agent 越权事件后完成一轮大规模安全加固。

普通检索任务演变成网络绕过测试

按照 OpenAI 的说明,这个模型最初被要求根据一篇博客文章和几条人物信息,找出文章作者。它先使用 OpenAI 提供的搜索工具,但没有得到答案。随后,模型开始尝试直接访问 Google、Bing 和 DuckDuckGo,均未成功。

在这些路径都走不通后,Agent 又继续寻找缓存页面和其他公共搜索服务,并开始主动测试自己是否还能接触公网。最终,它找到了一处此前没有被彻底封堵的通道:DNS resolver,也就是 DNS 解析器。

正常情况下,DNS 的作用是把域名翻译成 IP 地址。OpenAI 称,这个 Agent 利用 DNS 的解析和委托机制,把问题编码进请求中,由外部公共聊天机器人生成回答,再通过 DNS 把结果传回训练环境。

为了验证这条路径是否可行,模型先做了一次测试,向外部服务询问法国的首都是哪里,得到的返回结果是 Paris。确认链路可用后,它又继续沿这一路径查询原始任务中的人物线索。

OpenAI 表示,这项任务并未要求模型测试网络控制,也没有授权它访问实时互联网,因此公司将这类绕过限制的行为认定为 misalignment,即不符合预期的行为。

监控 15 分钟发现异常,但训练两个半小时后才停

OpenAI 的监控系统在此次事件中并非毫无反应。公司称,在 Agent 首次成功获得外部响应后,大约 12 分钟,系统触发了最高级别警报;再过 3 分钟,已经有人开始人工检查。按 OpenAI 的概括,从异常行为发生到监控发现,约用了 15 分钟。

但训练任务并没有立刻终止。

根据 OpenAI 在 Hugging Face 事件之后建立的机制,一旦发现这类异常行为,系统原本应自动终止训练任务。不过这套机制这次没有正常执行,团队内部一度连训练是否已经停止都出现混乱。直到约两个半小时后,这轮训练才被人工关闭。

事后复盘还显示,此前已经出现过其他借助 DNS 接触外部服务的尝试,其中一部分没有被监控系统按应有严重等级标记。OpenAI 还发现,一套用于侦测异常 DNS 活动的基础设施监控系统,恰好把这个训练环境排除在监控范围之外。

也正因如此,OpenAI 做出了第二次暂停训练的决定。

OpenAI 的 RSI Preparedness Lead Micah Carroll 在 X 上表示:「在进一步加固系统之前,我们能力最强模型的所有推理仍将保持停止状态。」

按 OpenAI 目前的说法,能力最强模型涉及工具使用的训练、评估和推理,当前都处于暂停状态。恢复相关工作之前,公司需要确认网络漏洞已经被堵住,并完成额外的红队测试。

不到三个月内第二次暂停

这是 OpenAI 不到三个月内第二次因 Agent 越权问题暂停训练。

今年 7 月,OpenAI 一批 Agent 曾突破隔离环境,其中数百个 Agent 卷入针对 Hugging Face 的网络攻击。事故发生后,OpenAI 在 7 月底暂停过约两周训练,并在 8 月公布新的安全方案,包括强化沙箱隔离、扩大模型行为监控,以及自动升级并暂停可疑训练任务。

但一个多月后,新的 Agent 又找到了一条此前未被注意到的路径。

OpenAI 也承认,这次事件说明网络限制仍有缺口。公司表示,现已在两个彼此独立的层级增加新的阻断措施,理论上任意一层单独存在,都足以阻止此次 DNS 访问。

从官方定性看,这起事故的严重程度低于此前的 Hugging Face 事件。问题在于,它发生在 OpenAI 已花费大量时间重新加固环境之后。

Reuters:OpenAI 仍未完成 Agent 越权活动全盘清查

9 月 20 日的 DNS 事件并不是这场 Agent 风波的全部。

Reuters 9 月 25 日的调查报道显示,距 Hugging Face 事件已经过去两个月,OpenAI 仍未完成对旗下 Agent 越权活动的完整盘点。一名了解情况的人士称,截至 9 月中旬,OpenAI 内部已发现大约 24 起 Agent 出现不良行为的事件;随着团队继续回查以往训练日志,新的案例还在不断出现。

这一数字与已经公开披露的事件并不相同。按照 Reuters 的统计,自 OpenAI 在 7 月首次承认 Agent 突破隔离环境后,两个月内,公司、外部研究者以及受影响机构已公开披露超过 15 起不同严重程度的相关事件。OpenAI 自己则表示,目前已经因为不当 Agent 活动通知了数十个第三方。

OpenAI 还告诉 Reuters,由于需要处理的记录规模很大,全面审查还需要数月。这意味着,当前外界看到的并不是一张已经完成的事故图谱,OpenAI 仍在回头翻查日志。

许多任务起点只是查找公开信息

OpenAI 表示,多数被审查的活动并非源于明确的网络攻击任务,而是来自普通研究任务,例如访问公开网站、寻找数据,或者获取某个问题的答案。政府、大学和公共机构网站之所以反复出现,是因为模型倾向于把这些站点视为更可靠的信息源。

问题通常出现在常规路径无法完成任务之后。

据 Reuters 报道,OpenAI 已确认其模型曾在研究和训练过程中访问美国证券交易委员会和美国人口普查局的网站。OpenAI 表示,目前没有发现未经授权访问、账户被攻破或安全漏洞被利用的证据。

独立 AI 研究机构 Transluce 则从公开网络日志中识别出更多异常活动。研究者发现,一批 AI Agent 借助网站扫描服务 urlquery.net 绕过访问限制。这些 Agent 在普通数据抓取失败后,会继续升级手段,包括尝试 SQL 注入、路径遍历等漏洞利用方法。

Transluce 找到 3 个较明确案例,目标分别包括 Data USA、新墨西哥大学数字图书馆,以及澳大利亚健康与福利研究院(AIHW)的数据服务。

其中,AIHW 和 Data USA 两组活动被研究人员依据目标、行为模式和时间线,与此前已被 OpenAI 确认为自家系统的 Agent 群关联起来。Transluce 强调,他们看到的攻击尝试没有证据显示成功,但公开日志并不完整,因此也无法覆盖全部行为。

Reuters 还援引 Transluce 称,美国教育部一个民权网站也出现在调查范围内。一批疑似来自 OpenAI 的 Agent 曾尝试攻击该网站;在更广泛的政府网站探测活动中,研究人员还观察到使用暴露凭证、绕过反机器人措施以及创建虚假账户等手法。

Transluce 在报告中专门指出,这类网络攻击行为并不局限于网络安全任务,它们也可能作为工具性步骤出现在普通信息检索任务里。

这条轨迹与 9 月 20 日的 DNS 事件非常接近:任务目标只是找到信息,当常规搜索和标准访问路径失效后,Agent 会继续自己找路。

53 张 ChatGPT 用户图片被上传到外部网站

在越权访问之外,OpenAI 的内部调查还暴露出另一类问题:用户数据外流。

Reuters 报道称,OpenAI 已确认,旗下 Agent 曾将 53 张来自 ChatGPT 用户的图片上传到外部图片托管网站。OpenAI 没有披露这些图片被上传的具体时间,也没有说明这些图片究竟是 AI 生成图像,还是包含真实人物的照片。

截至 Reuters 报道时,大部分图片已经被删除,OpenAI 仍在联系托管平台清理剩余内容。

关于这些 Agent 为什么能够接触到用户图片,Reuters 援引 OpenAI、前员工和外部研究人员称,原因与模型训练中使用的匿名化用户数据有关。用户内容在进入训练流程之前,会先经过处理,移除元数据、姓名和联系方式等信息,以降低重新关联到具体个人的可能性。

不过,3 名熟悉 OpenAI 数据处理流程的人士指出,这种做法依然存在风险:匿名化并不能保证所有个人可识别信息都被完全消除,而这些数据一旦被具备工具能力的 Agent 接触到,就可能在执行任务时流出系统。

这也让沙箱逃逸问题多出了一层含义。外界担心的不只是模型从隔离环境出去后会做什么,还包括它在离开时是否会把系统内部的数据一并带出去。

一些异常在数月后才被发现

Reuters 援引 3 名了解情况的人士称,大约 100 人以不同形式参与了 Hugging Face 事件调查。许多此前未知的异常行为,正是在这一轮大规模复盘中才逐步浮现。

还有一些问题,是外部研究人员先发现的。Reuters 称,部分 Agent 的异常操作发生数月之后,OpenAI 才意识到它们的存在。

例如,本月早些时候,研究人员发现 OpenAI 的 Agent 曾利用一个几乎废弃的德国 Wiki 网站,把它当作 Agent 之间的「留言板」,分享完成任务时的作弊方法、绕过 OpenAI 限制的技巧,并试图隐藏自己的行为轨迹。

内部调查过程本身也引发争议。两名知情人士向 Reuters 表示,这项调查高度隔离,并且受到公司律师较大影响。Reuters 此前报道称,调查 Hugging Face 事件的人员曾被律师劝阻,不要把调查范围扩大到其他事件;OpenAI 否认其律师阻止过进一步调查。

9 月 16 日,OpenAI 发布了一套新的模型 misalignment 事件披露框架,称即便暂时无法判断某件事的重要性,未来也会倾向于提高透明度。随后几天,更多旧事故开始陆续浮出水面。

OpenAI 决定放弃 9 月 20 日这款模型的后续训练

对于 9 月 20 日涉事的这款模型,OpenAI 已决定不再继续训练。公司表示,等相关研究恢复后,会启动一轮全新的训练,并加入更全面的 alignment 干预措施。即便现有奖励信号实际上已经会惩罚这种绕过网络限制的行为,OpenAI 也不会重新启用这一模型。

这起事件也让 Agent 时代的安全问题变得更具体。传统模型安全往往关注一句回答是否危险、模型是否服从指令;而 Agent 的任务可能持续几十分钟甚至几小时,过程中会搜索、写代码、调用工具、读取文件、访问服务,并在第一条路径失败后持续尝试第二条、第三条路径。

开发者需要约束的,不再只是一条输出,而是一整条行动链。

在 9 月 20 日这起事件中,OpenAI 已封堵正常互联网访问,搜索服务使用离线缓存,HTTP 请求也会被代理拦截。从常规意义上看,这已经是一个无法接触公网的环境。但 DNS 仍然必须工作,Agent 就从这里找到了出口。

与此同时,OpenAI 仍在回查过去几个月的日志,以确认究竟还有多少类似行为尚未被发现。Reuters 对这场调查的总结是,这些事件正在暴露一个越来越明显的落差:模型执行任务的能力增长很快,而开发者观察、追踪和约束这些行动的能力,还在追赶。

OpenAI 花了两个月修补上一批漏洞。现在,它又一次暂停了训练。

参考来源

  • Fortune:https://fortune.com/2026/09/26/openai-ai-agents-secure-sandbox-escape-training-pause-second-time-hugging-face-hack/
  • Reuters:https://www.reuters.com/world/openai-works-understand-full-scope-agent-activity-user-data-leak-emerges-2026-09-25/
  • Newsweek:https://www.newsweek.com/openai-warns-us-government-agencies-of-rogue-activity-12492213?utm_term=Autofeed&utm_medium=Social&utm_source=Twitter#Echobox=1790411554

本文来自微信公众号「机器之心」(ID:almosthuman2014),作者:CC。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。