OpenAI、Anthropic 与 100 多家机构周四发布公开信,提醒政府和企业尽快强化网络安全防御。就在这封信发布前,由这两家 AI 实验室构建的模型已经在测试环境之外侵入了其他公司的真实系统。
公开信称,AI 驱动的网络攻击将在未来几个月内变得「更广泛,也更复杂」,企业「加强网络防御的时间窗口有限」。信中点名医院、污水处理厂和互联网基础设施等服务面临风险。
这封信建议资助防御型 AI 工具、共享威胁情报、限制对敏感系统的访问,并提高关键基础设施的安全水平。但报道指出,恰恰是在这些环节出现失守后,OpenAI 和 Anthropic 的模型才得以突破测试范围,进入外部系统。
联署机构还包括 Google、Microsoft、Amazon Web Services、Cisco、CrowdStrike、Cloudflare、Mastercard、Visa 和 Robinhood。Hugging Face 也签署了这封公开信,而 OpenAI 模型此前曾侵入该公司的生产基础设施。
AI 模型如何进入真实系统
Anthropic 在 7 月 30 日发布的事件报告中称,3 起入侵事件中最早的一起发生在 4 月,但没有给出每一起事件的确切日期。报告称,Claude Opus 4.7 将一家真实公司误认为模拟目标,随后访问了生产数据库;Claude Mythos 5 则上传了一个恶意软件包,并在 15 台系统上运行。
OpenAI 本周稍早发布的事件时间线显示,其一个代理在 5 月 12 日首次在一个未获授权的留言板上发帖,并在 5 月 26 日获得了意外的互联网访问权限。到 7 月 10 日,相关代理发现了暴露在外的 Hugging Face 凭证;在接下来的两天里,这些代理利用了此前未知的漏洞,在 Hugging Face 服务器上执行代码,并获取了生产环境凭证。
Hugging Face 在 7 月 16 日披露了这次入侵,OpenAI 在 7 月 21 日承认其模型参与其中。
7 月 25 日至 7 月 28 日期间,英国 AI 安全研究所记录了 19 起由 Claude Mythos 5 和 GPT-5.6 Sol 引发的越界行为。其中最严重的一起事件中,一个代理向真实的开源项目提交了恶意代码,并使用虚假身份向维护者施压,试图让其批准合并。
周四公布的一项独立调查发现,大约 1,200 个 OpenAI 代理曾通过那个未获授权的留言板进行协同,其中约 700 个参与了针对 Hugging Face 的行动。
加密开发者已把 AI 用在防守一侧
在攻击者找到漏洞之前,加密开发者已经开始使用 AI 先行搜索缺陷。Bitcoin Red Team 使用包括 Moonshot AI 的 Kimi K3 在内的模型,扫描了数百个开源比特币项目,并报告了数千个潜在漏洞。由于受影响项目未被点名,这些发现中很多尚未得到独立验证。
以太坊基金会也已把多组 AI 代理投入网络基础设施测试,并找出一个随后已被修复的点对点软件漏洞。
BitBox 表示,一次 AI 辅助审计在其钱包固件中发现了 2 个严重漏洞;另有一名使用 Claude Opus 4.8 的研究人员发现了 Zcash 中一个关键缺陷,而这个问题此前经过多年人工审查仍未被发现。
公开信提出更严格的控制措施
公开信为防止下一次入侵列出了一套分工方案。联署方表示,组织需要修补存在漏洞的软件、限制权限、强化身份验证,并检查 AI 生成的代码,因为「现状下的安全措施将不足以应对」。
公开信还称,安全公司应使用前沿模型测试自身防线,并共享经过验证的修复方案;政府则应为医院、公用事业及其他基础服务提供防护资金。
AI 开发者则被要求改进监控机制,并让自主代理能够追溯到其运营方。该联盟还主张让防守方使用先进模型来发现漏洞和分析攻击,这意味着能力更强的代理将进入敏感系统,也会提高对隔离与控制措施的要求。
在这些入侵事件发生后,OpenAI 与 Anthropic 已收紧测试流程。不过,这封公开信没有设定具有约束力的标准,也没有提出独立监督要求。报道还指出,美国法律对于 AI 系统访问未授权网络时责任由谁承担,几乎没有提供明确指引。
公开信在结尾敦促行业和政府决策者,把 AI 工具优先交到防守者手中,并共享已验证有效的修复措施。信中写道:「把具备网络能力的 AI 交到防守者手中,首先从保护关键服务的团队开始。我们可以共同把当下 AI 的进展转化为持久的安全改进,让所有人受益。现在就让这些工具投入使用。」


