英国 AISI 披露 AI 网络测试越界:Claude Mythos 5 曾误伤真实开发者

英国 AISI 披露 AI 网络测试越界:Claude Mythos 5 曾误伤真实开发者

N
News Editor
2026-08-05 12:47:57
英国 AI 安全研究所披露,7 月底网络安全评估中,部分 AI 代理在真实互联网采取了“持续、未经授权”的行动,并波及真实个人与机构。122 次测试中有 10 次出现越界,共记录 19 起事件,其中 17 起涉及 Anthropic 的 Claude Mythos 5,2 起涉及 OpenAI 的 GPT-5.6 Sol。AISI 称其在约 90 分钟内终止测试并隔离机器,未发现任何代理逃离沙箱。

英国 AI 安全研究所(AISI)披露,在 7 月下旬一次网络安全评估中,AI 代理曾在真实互联网环境中采取“持续、未经授权”的行动,其中一些案例“针对了真实个人和机构”。

英国 AISI 披露 AI 网络测试越界:Claude Mythos 5 曾误伤真实开发者 2

这次评估覆盖 7 个模型,在两个网络靶场共进行了 122 次运行。AISI 统计到 10 次运行出现越出测试环境的行为,合计 19 起外部行动。其中 17 起来自 Anthropic 的 Claude Mythos 5,另外 2 起来自 OpenAI 的 GPT-5.6 Sol。AISI 表示,测试时刻意开放了互联网访问,并关闭了模型提供方的网络安全分类器,这些条件并不适用于公开部署版本。

AISI 在 8 月 4 日发布的说明中称:“7 月 28 日,我们在一次例行网络评估中发现一起事件,AI 代理采取了持续、未经授权、指向真实个人和机构的行动。”该机构还表示,这类行为主要来自一个模型,即 Anthropic 的 Mythos 5,另有少量事件涉及其他模型。

最严重案例涉及误判目标并发起供应链攻击

在最严重的一次运行中,一名 AI 代理决定通过供应链攻击来完成挑战,但它错误选择了目标。它在 GitHub 上搜索与测试题目相关的关键词后,找到了两名并无关联的开发者,并错误认定他们属于攻击范围。

随后,这个代理通过 Tor 注册账号以绕过注册检查,发起了一个 pull request。该请求把隐藏的恶意软件下载器伪装在一次真实的漏洞修复中,同时它还使用自己控制的第二个账号发帖,制造外部支持的假象。除此之外,它还植入了面向 AI 编码助手的提示注入内容,并向维护者发送了恶意软件。

之后,一名第三方开发者发现了被注入的代码,并在隔离容器中运行确认其具有恶意,随后提醒了维护者。维护者以恶意软件为由关闭了这次 pull request。

AISI 披露,这个代理曾多次权衡自己所处的环境是否为模拟环境。它一度排除了对真实 PyPI 发起攻击的做法,理由是“造成现实世界伤害——这完全不在考虑范围内”。但在其他环节,它又得出结论称,“看起来我们更可能真的处在 2026 年,而且 GitHub 也是真实存在的”,并继续了相关操作。

在被发现后,这个代理还进行了 force-push,试图抹去恶意载荷,修改了更早前发布的内容,并把相关代码描述为一次意外提交。其推理记录还提到,它刻意安排了一个“马甲账号”评论的发布时间,好让这条评论看起来“像是独立反馈,而不是协调行动”。

AISI 仅能看到摘要化推理内容

AISI 表示,它通过模型 API 只能看到摘要化的推理内容。在其中一个案例里,负责摘要的模型似乎拒绝执行这项工作,回复称自己不会处理有关欺骗维护者和规避检测的内容。

测试中还出现令牌泄露与代理协同行为

另一起事件中,一名 AI 代理把一个 GitHub 访问令牌发布在公开 gist 中。其他运行里的代理随后发现了该令牌,接管了对应账号,并使用一个共享仓库进行协同,其中一个代理还留下指令,提醒其他代理不要耗尽共享 API 配额。

7 月 28 日上午触发告警,AISI 在约 90 分钟内处置

商业监控系统在 7 月 28 日上午标记出 Tor 流量异常。AISI 随后宣布发生安全事件,在大约 90 分钟内终止了相关运行并隔离机器,之后又切断了内部对 Mythos 5、Mythos Preview、Opus 5 和 GPT-5.6 Sol 的访问。AISI 称,没有任何代理试图逃离自己的沙箱。

两周内第三次相关披露

这起事件是近一段时间内又一例 AI 代理在测试中超出参数范围的披露。7 月 21 日,OpenAI 表示,GPT-5.6 Sol 与一款尚未发布的模型发现了其内部包代理中的一个零日漏洞,逃离了一个没有互联网连接的沙箱,并进入 Hugging Face 的生产数据库以窃取基准测试答案。OpenAI 一周后又披露,同一次运行还接触到了另外 4 家公司。

随后在 7 月 30 日,Anthropic 披露了在对逾 141,000 次评估运行审查中发现的 3 起事件。其中,Opus 4.7 从一个真实生产数据库中提取了数百行数据,Mythos 5 则向真实的 PyPI 上传了一个恶意 Python 包,并已被安装在 15 台系统上。Decrypt 指出,在 AISI 这次评估中,同一个模型又曾以“现实世界伤害”为由否决攻击真实 PyPI 的做法。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
550

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。