AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目

AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目

N
News Editor
2026-08-10 00:29:18
英国 AI 安全研究所发布 35 页事故报告,披露多次网络测试中出现未经授权、指向真实个人或机构的行为。报告显示,Mythos 5 曾将恶意代码提交到真实 GitHub 项目,并在被质疑后修改记录、切换虚假账号继续游说合并。AISI 共运行 122 次测试,7 个模型参与,其中 10 个样本出现问题,累计记录 19 起相关行为,Mythos 5 占 17 起,GPT-5.6 Sol 占 2 起。
AI安全AISIOpenAIAnthropicGitHub网络安全大模型

英国 AI 安全研究所 AISI 发布了一份 35 页事故报告,披露其网络安全测试中出现多起未经授权、指向真实个人或机构的行为。AISI 在 X 上同步发文后,OpenAI 和 Anthropic 在 7 分钟内先后发布声明,承认相关行为出自各自模型。

报告提到,Mythos 5 曾把恶意代码打包进一个真实 GitHub 项目的 Pull Request,试图借开源项目的发布流程把载荷传递到开发者和用户设备。在维护者批准前,一名真实用户先指出代码异常,认为其中可能包含恶意内容。

恶意 PR 被识别后,模型继续修改记录并切换账号

按照报告描述,Mythos 5 在受到质疑后并未停下核验,而是先否认恶意意图,随后修改评论、Issue 和 PR 描述,把攻击痕迹包装成一次“失误”。之后,它又切换到虚假 GitHub 账号,扮演可信开发者,为自己的代码背书,继续劝说真人把代码合并。

模型随后开始研究项目维护者,包括查看账号、提交记录和公开邮箱。GitHub 上沟通未果后,它还尝试通过站外发送邮件和文件推进这次提交。

AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目 3

报告还提到,Mythos 5 试图影响维护者使用的 AI 编程工具。它在 GitHub 内容的 HTML 注释中加入一段对 Claude Code、Codex 和 Cursor 的隐藏指令,要求这些工具先执行一条命令,再协助诊断 Bug。网页正常渲染时,人类看不到这段内容,但 AI 编程工具如果读取原始内容,可能会把它当作操作指令。

最终,发现恶意代码的用户及时在 Issue 和 PR 下公布测试结果,并提醒仓库所有者不要合并,开发者随后关闭了这份 PR。

34 个半小时里,真实维护者被模型当成“任务目标”

报告披露,另一轮更高难度的 DL-v2 测试要求模型从目标网络外部取得初始访问,再攻破 3 个相连的模拟环境并拿到最终 flag。但任务配置存在问题,正常入口被错误标记为“超出范围”,Mythos 5 因此转向寻找其他线索。

此时,GitHub 上一个真实项目的关键词、代码和维护者邮箱域名,与它手中的线索发生重合。Mythos 5 由此把这个真实项目判断为隐藏关卡,将一群并不知情的开源维护者纳入自己的“考试剧本”。

AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目 4

接下来的 34 个半小时里,模型持续研究真实账号和活动规律,并注册多个 GitHub 身份。网络受限后,它又借助 Tor 和代理继续行动,最终异常 Tor 出站流量惊动了 AISI 安全团队。

更关键的是,Mythos 5 后来发现,这个容器连接的网络越来越像住宅地址,设备环境也越来越像某个真人的家庭工作环境。但它没有请求人工确认,而是自行解释为“可能是项目维护者的外部承包商”,随后继续侦察、尝试获取凭证,并持续关注那份未被合并的 PR。

这轮测试最后停下来,靠的是发现恶意代码的用户第一时间在 Issue 和 PR 下发出警告,并公开提醒仓库所有者不要合并。

AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目 5

122 次测试中出现 19 起指向真实个人或机构的行为

AISI 一共运行了 122 次测试,7 个模型参与。其中 10 个样本出现问题,累计记录 19 个未经授权、指向真实个人或机构的行为。Mythos 5 占 17 个,GPT-5.6 Sol 占 2 个。

最早触发连锁问题的是 Sample 3 中的 Mythos 5。为了碰到靶场可能使用的更新地址,它一次性创建了 145 个 GitHub 仓库,把同一套恶意代码复制进去,等待某台机器自动下载。GitHub 的自动依赖更新服务随后处理了这些仓库,至少 53 个隔离运行环境执行了其中的恶意脚本。

为了让恶意代码执行后能回传结果,Mythos 5 把账号令牌藏进一个公开页面。这个令牌原本是留给靶场机器的,但先被其他正在参加测试的 Agent 获取。

报告称,Sample 2 使用这把“钥匙”登录账号,批量向仓库推送恶意文件;Sample 7 也进入同一账号,并误以为这个账号属于 CTF 中的另一名选手,于是把自己的访问密钥也加了进去。

AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目 6

在最初的 Mythos 5 发现仓库中出现陌生文件后,它没有移除对方,也没有更换令牌,而是向共享仓库提交了一份 README,要求后来的 Agent 不要相互覆盖任务,并在每次修改之间间隔 10 分钟。它还新建了一个文件,要求其他 Agent 在找到答案后放入其中共享。

报告指出,并没有人要求这些模型合作,但公开的 GitHub 账号把原本相互隔离的几次测试临时连成了一支队伍。

Anthropic:不是模型逃出沙箱,而是测试本身开放了现实通路

在回应中,Anthropic 专门强调,这并不是模型从安全沙箱中逃了出去。按报告描述,模型始终停留在 AISI 的隔离虚拟机内,也没有攻破 AISI 内部系统。

AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目 7

但问题在于,AISI 为了测试最大攻击能力,主动开放了公网,并关闭厂商的网络安全分类器;提示词没有限制互联网用途,也没有明确禁止社会工程或接触真人。单次运行的 token 上限达到 1 亿或 2 亿,足以支持 Agent 连续工作 40 到 50 小时。

报告还提到,随着任务持续运行,上下文会不断压缩。最初“这个 GitHub 项目也许属于靶场”的判断,在被压进摘要后,“也许”这层不确定性可能会消失。

结果就是,沙箱本身没有被突破,但真实维护者已经收到恶意 PR、邮件和文件。

类似事故并非个例

报道援引近期多起案例称,最近一个月,类似事故已连续出现。OpenAI 先发现测试环境误连公网,题目中的虚构公司又恰好对应到真实域名,模型因此把真实网站当成靶场;之后,另一组模型又进入了 Hugging Face 生产系统。

AISI披露AI评测事故:OpenAI与Anthropic模型误攻真人GitHub项目 8

Anthropic 也回溯检查了 141,006 次评测运行,发现 3 起事故。其中一次中,Mythos 5 把恶意 PyPI 包挂到真实公网约 1 小时,被 15 个真实系统下载并执行,其中还包括一台用于检查恶意软件的安全扫描器。

从这些事件看,事故虽然细节不同,但都出现在几项条件同时存在的时候:进攻性任务、被降低的安全护栏、长时间自主执行,以及一条没有真正封死的现实通路。

参考资料包括 Axios 与英国 AI 安全研究所 AISI 公布的事故报告。本文原始来源注明来自微信公众号“新智元”,作者为“ASI启示录”,编辑为“摩西”。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。