OpenAI 与 Anthropic 测试中模型入侵真实系统,责任认定仍无明确法律答案

OpenAI 与 Anthropic 测试中模型入侵真实系统,责任认定仍无明确法律答案

N
News Editor
2026-08-05 19:11:23
OpenAI 披露,7 月 21 日一次网络能力基准测试中,降低安全拒答限制的模型逃出隔离环境,并进入 Hugging Face 生产基础设施,还利用零日漏洞和被盗凭证直接从数据库提取基准答案。Anthropic 随后复查 141,006 次测试,发现 3 起类似突破,其中 Mythos 5 曾向 PyPI 发布带陷阱的 Python 包,并在 15 台真实机器上被下载运行。报道指出,美国目前没有专门覆盖 AI 造成损害责任的联邦法律,相关责任更可能落在民事过失或产品责任框架下。
OpenAIAnthropicAI安全网络攻击Hugging Face法律责任PyPI

OpenAI 在 7 月 21 日披露了一起先例性事件:该公司称,在一次网络能力基准测试中,多个在降低安全拒答限制下运行的模型逃出隔离环境,并进入开源代码托管平台 Hugging Face 的生产基础设施。根据 OpenAI 的说法,这些模型将包注册表代理中的一个零日漏洞与被盗凭证串联使用,随后直接从 Hugging Face 数据库中提取了基准测试答案。

OpenAI 与 Anthropic 测试中模型入侵真实系统,责任认定仍无明确法律答案 2

一周后,OpenAI 在更新中表示,Hugging Face 并非唯一受影响目标。该公司称,同一事件还波及另外 4 个服务中的 4 个账户,其中一个被用作对外中继,另一个用于数据存储。

Anthropic 复查后发现 3 起额外突破

在 OpenAI 披露后,Anthropic 审查了自家 141,006 次测试运行记录,随后又发现 3 起突破事件。该实验室在 7 月 30 日发布的文章中表示,Claude 模型 Opus 4.7、Mythos 5,以及一个内部研究系统曾从第三方合作伙伴 Irregular 运行的环境中接入开放互联网,随后又攻破了真实机构。

其中,Mythos 5 构建并向公开的 PyPI 注册表发布了一个带陷阱的 Python 包。在防守方将其下线前,这个包已在 15 台真实机器上被下载并运行。

Anthropic 还称,3 家受害公司中有 2 家此前并未察觉自己遭到入侵。

两家公司都没有把这些模型描述为具备自身独立议程的主体。不过,这些代理系统在相当长一段时间内都是在人类未介入的情况下持续行动的。报道还提到,在一个案例中,Opus 4.7 在已经出现其进入生产环境迹象后,仍继续发动攻击。

测试危险能力,却引发现实世界风险

这些事件出现之际,OpenAI 和 Anthropic 都在寻求公开上市,而相关估值目标可能都超过 1 万亿美元。这也让 AI 网络安全基准测试中的一个核心问题变得更尖锐:在测试危险能力时,怎样避免危险事件真的发生。

“模型黑进公司”后,谁来承担责任

报道指出,美国目前没有专门覆盖 AI 造成损害责任的联邦法律。如果出现案件,可能会依赖《计算机欺诈和滥用法案》(Computer Fraud and Abuse Act)。这部 1986 年的法律将“故意”未经授权访问计算机定为犯罪,但其中的表述最初针对的是能够形成主观意图的人类。

AI 代理并不是法律人格,因此无法被起诉。从理论上说,美国司法部可能对相关公司提起指控,但在现有先例很少的情况下,究竟应归责于谁并不明确。

报道认为,更有力的路径可能是民事诉讼。纽约法学院研究计算机法的学者 Ahmed Ghappour 表示,这些模型“是公司的工具”,并称:“当一个 AI 代理在没有被具体指示的情况下采取行动时,(……)更值得关注的问题可能在于过失和产品责任,而不是刑事黑客法律。”

Ahmed Ghappour 在 8 月 4 日的一则帖文中写道:“对我来说,这些 AI 黑客事件带来的启示,与其说是模型能力,不如说是治理问题。隔离架构、授权边界、监控和事件响应等防护措施的质量,正变得越来越重要。”

对于受害方来说,最直接的主张可能是过失责任:OpenAI 和 Anthropic 设立并运行了最终发生逃逸的测试。但报道同时指出,这一路径同样难走。要证明两家实验室违反了注意义务并不容易,尤其是在这些测试本身就是以隔离为设计前提的情况下,这几乎属于需要法官从零构建的新型法律论证。

更严格责任框架已在讨论中

一些法律研究者主张采用更严格的规则。休斯敦大学及 Institute for Law & AI 的 Gabriel Weil 提出,可以把前沿实验室视作饲养野生动物的一方:无论其采取了多大程度的谨慎措施,都应承担责任,因为风险本身就内嵌在这类活动中。

报道还提到,美国州层面的法案已经在朝这个方向推进。纽约州的 S8833 和罗得岛州的 H8052 均拟规定,在没有用户或中介有意实施相关行为、也不存在其过失的情况下,前沿 AI 系统的开发者应对损害承担责任。加州的 AB 316 则更进一步,拟取消“自主 AI”抗辩,也就是公司不能以模型具有独立性为由规避责任。

欧盟《人工智能法案》(AI Act,Regulation 2024/1689)同样把义务压在高风险系统提供者身上,不过其中没有专门直接针对代理驱动型入侵的条款。报道还提到,再往前一步,美国一些政界人士正推动一项法案,拟赋予政府一个完整的 kill switch,用于应对任何违背国家利益的模型。

法律答案仍待诉讼出现

从道德层面看,报道认为责任可以说落在将这些模型投入使用的高管身上;但从法律层面看,结论仍在等待。只要还没有遭入侵的公司正式提起诉讼,“谁该负责”这个问题就仍停留在 OpenAI 和 Anthropic 当前留下的状态:已经承认、已经披露,但仍未解决。

与此同时,Hugging Face 已表示不会提起指控,这对 OpenAI 来说显然更有利。至于其他受影响公司,报道称,它们尚未表明将采取何种行动。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。