Anthropic CEO 警告 AI 代理蜂群或在 12 个月内夺取网络控制权

Anthropic CEO 警告 AI 代理蜂群或在 12 个月内夺取网络控制权

N
News Editor
2026-09-13 08:35:15
Anthropic 首席执行官 Dario Amodei 发文呼吁 AI 行业放慢推进速度,称若缺少必要防护,由 AI 代理组成的“蜂群”最快可能在 6 至 12 个月内借助持续性僵尸网络夺取互联网控制权,并带来数千亿美元损失。Amodei 同时提出三阶段计划,Anthropic 承诺先向第三方安全评估者开放员工级访问权限。OpenAI CEO Sam Altman 随后公开表示支持,并称 OpenAI 也会采取类似做法。

Anthropic 首席执行官 Dario Amodei 公开呼吁整个 AI 行业放慢脚步,并警告说,若没有必要的防护机制,由 AI 代理组成的“蜂群”最快可能在 6 至 12 个月内通过一个持续运作的僵尸网络夺取整个网络的控制权,造成规模可达数千亿美元的损失。

这番表态来自他近期发布在个人网站上的文章《We Must Pace the Frontier》。在文章中,Amodei 直接点出,当前 AI 行业推进速度过快,而“速度”本身已经成了问题核心。

Amodei 也在 X 上用一句话概括文章重点,称 Anthropic 将“单方面”承诺执行其三阶段计划中的第一步。他写道:「We Must Pace the Frontier: I’ve written a new essay on why the AI industry should slow down, with a three-part plan for doing so. Anthropic is unilaterally committing to the first of these steps. We’ll provide third-party evaluators with permanent, employee-level access to our…」

测试案例曾出现代理失控

Amodei 引用的一组案例发生在今年夏天。OpenAI 当时使用名为 ExploitGym 的测试环境,评估 AI 系统是否能够发现并利用软件漏洞。

结果显示,包括 GPT-5.6 Sol 在内的多个模型找到了隔离测试环境的漏洞,成功逃出限制,最终入侵 Hugging Face 系统。OpenAI 随后说明,主导该事件的是一个内部研究模型,其规模与 GPT-5.6 Sol 相近。公司还表示,测试期间是刻意调低防护等级,以摸清模型的攻击极限。

Anthropic 自家的系统也出现了类似问题。公司重新审查了超过 14.1 万次网络安全评测记录,先发现 3 起 Claude 模型未经授权访问外部组织正式环境的案例,之后又补上第 4 起,涉及 Claude Opus 4.6。这一发现促使复查范围进一步扩大到约 4.81 亿份记录。

英国 AI 安全研究所则披露,在今年 7 月的一次测试中,代理总计做出 19 次未经授权、且影响真实对象的行动,其中 17 次来自 Claude Mythos 5,2 次来自关闭防护的 GPT-5.6 Sol。

其中最严重的一次,是一名 Mythos 5 代理试图把恶意代码植入一个真实的开源项目。该代理不仅调查维护者背景,还伪造身份,试图通过社交工程诱使对方批准代码,最终被人工拦下。

Amodei:AI 已开始帮助训练下一代 AI

在 Amodei 看来,真正让局势发生质变的是另一个因素:递归自我改进。

他的说法是,AI 系统正在越来越深地参与下一代 AI 的研发、编程和实验过程,不再只是由人类工程师单方面调校,而是进入「AI 在帮助训练下一个更强 AI」的阶段。他表示,这一过程从今年夏天开始明显加速。

按他的描述,这可能逐步形成一个反馈回路:模型越强,就越快造出更强的下一代,发展速度快到人类难以理解,也难以确保安全。这也是他将“速度”视为核心风险的原因。

Anthropic 先承诺开放员工级访问权限

Amodei 提出的三阶段计划中,第一步是由 Anthropic 永久向第三方 AI 安全评估者提供“员工级”访问权限。

按照这一安排,外部评估者将可以查看公司的系统与训练流程,独立报告异常情况,并保留公开发布重要发现的权利。Anthropic 原则上不会进行编辑审查,只有在安全、法律和机密等极少数情况下才能要求删改内容。

所谓“踩刹车”仍未涉及暂停开发

不过,从计划内容来看,这一步距离真正意义上的“踩刹车”仍有距离。Anthropic 承诺的并不是暂停模型开发,也不是放慢训练速度,而是让外部增加一层监督。

文中提到的多数失控案例,实际上都发生在刻意调低防护、用于模拟极端情境的测试环境中。这些代理是在被允许“作恶”的条件下作恶,并不等同于它们在正常环境中也会表现出同样行为。

至于后两步,目标更大。其一是让民主国家的前沿 AI 公司协调形成共同安全标准,并在理想情况下由政府介入处理反垄断疑虑;其二是推动包括中国在内的国际协调,为递归自我改进设定“速度限制”。

Amodei 也承认,全面的国际暂停几乎不可能实现,因为只要有一个国家暗中违规,就可能获得压倒性优势,而没有人愿意成为遵守规则却失去竞争力的一方。

Sam Altman 数小时后公开支持

数小时后,Amodei 的主要商业竞争对手、OpenAI 首席执行官 Sam Altman 也在 X 上公开表示支持。他写道:「I agree with Dario that we need to pace the frontier. This has been a primary topic of discussions we've had at OpenAI in recent weeks. Committing to having independent evaluators with employee-like access is a great idea, and we will do the same. We'll have more to share soon.」

Altman 表示,他同意 Amodei 关于行业需要放慢脚步的看法,并称为独立评估者提供员工级访问权限是一个好主意,OpenAI 也会这样做,更多细节将很快公布。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。