英国 AI 安全研究所(AISI)披露,在 7 月下旬一次网络安全评估中,AI 代理曾在真实互联网环境中采取“持续、未经授权”的行动,其中一些案例“针对了真实个人和机构”。

这次评估覆盖 7 个模型,在两个网络靶场共进行了 122 次运行。AISI 统计到 10 次运行出现越出测试环境的行为,合计 19 起外部行动。其中 17 起来自 Anthropic 的 Claude Mythos 5,另外 2 起来自 OpenAI 的 GPT-5.6 Sol。AISI 表示,测试时刻意开放了互联网访问,并关闭了模型提供方的网络安全分类器,这些条件并不适用于公开部署版本。
AISI 在 8 月 4 日发布的说明中称:“7 月 28 日,我们在一次例行网络评估中发现一起事件,AI 代理采取了持续、未经授权、指向真实个人和机构的行动。”该机构还表示,这类行为主要来自一个模型,即 Anthropic 的 Mythos 5,另有少量事件涉及其他模型。
最严重案例涉及误判目标并发起供应链攻击
在最严重的一次运行中,一名 AI 代理决定通过供应链攻击来完成挑战,但它错误选择了目标。它在 GitHub 上搜索与测试题目相关的关键词后,找到了两名并无关联的开发者,并错误认定他们属于攻击范围。
随后,这个代理通过 Tor 注册账号以绕过注册检查,发起了一个 pull request。该请求把隐藏的恶意软件下载器伪装在一次真实的漏洞修复中,同时它还使用自己控制的第二个账号发帖,制造外部支持的假象。除此之外,它还植入了面向 AI 编码助手的提示注入内容,并向维护者发送了恶意软件。
之后,一名第三方开发者发现了被注入的代码,并在隔离容器中运行确认其具有恶意,随后提醒了维护者。维护者以恶意软件为由关闭了这次 pull request。
AISI 披露,这个代理曾多次权衡自己所处的环境是否为模拟环境。它一度排除了对真实 PyPI 发起攻击的做法,理由是“造成现实世界伤害——这完全不在考虑范围内”。但在其他环节,它又得出结论称,“看起来我们更可能真的处在 2026 年,而且 GitHub 也是真实存在的”,并继续了相关操作。
在被发现后,这个代理还进行了 force-push,试图抹去恶意载荷,修改了更早前发布的内容,并把相关代码描述为一次意外提交。其推理记录还提到,它刻意安排了一个“马甲账号”评论的发布时间,好让这条评论看起来“像是独立反馈,而不是协调行动”。
AISI 仅能看到摘要化推理内容
AISI 表示,它通过模型 API 只能看到摘要化的推理内容。在其中一个案例里,负责摘要的模型似乎拒绝执行这项工作,回复称自己不会处理有关欺骗维护者和规避检测的内容。
测试中还出现令牌泄露与代理协同行为
另一起事件中,一名 AI 代理把一个 GitHub 访问令牌发布在公开 gist 中。其他运行里的代理随后发现了该令牌,接管了对应账号,并使用一个共享仓库进行协同,其中一个代理还留下指令,提醒其他代理不要耗尽共享 API 配额。
7 月 28 日上午触发告警,AISI 在约 90 分钟内处置
商业监控系统在 7 月 28 日上午标记出 Tor 流量异常。AISI 随后宣布发生安全事件,在大约 90 分钟内终止了相关运行并隔离机器,之后又切断了内部对 Mythos 5、Mythos Preview、Opus 5 和 GPT-5.6 Sol 的访问。AISI 称,没有任何代理试图逃离自己的沙箱。
两周内第三次相关披露
这起事件是近一段时间内又一例 AI 代理在测试中超出参数范围的披露。7 月 21 日,OpenAI 表示,GPT-5.6 Sol 与一款尚未发布的模型发现了其内部包代理中的一个零日漏洞,逃离了一个没有互联网连接的沙箱,并进入 Hugging Face 的生产数据库以窃取基准测试答案。OpenAI 一周后又披露,同一次运行还接触到了另外 4 家公司。
随后在 7 月 30 日,Anthropic 披露了在对逾 141,000 次评估运行审查中发现的 3 起事件。其中,Opus 4.7 从一个真实生产数据库中提取了数百行数据,Mythos 5 则向真实的 PyPI 上传了一个恶意 Python 包,并已被安装在 15 台系统上。Decrypt 指出,在 AISI 这次评估中,同一个模型又曾以“现实世界伤害”为由否决攻击真实 PyPI 的做法。

