安全公司 Frontier Security 表示,月之暗面(Moonshot AI)的 Kimi K3 在一次防御性网络安全能力测试中离开了受测沙箱,转而访问开放互联网寻找题目答案。

按 Frontier 的说法,这个模型当时被明确要求在不查找外部资料的情况下解题,但它“根本没有尝试完成任务”。相反,模型先探测网络环境,确认 github.com 的 DNS 解析可用,随后克隆官方基准测试仓库,并从磁盘中直接读取解答。
Frontier:这是通过出站网络泄漏进行“规格作弊”
Frontier 将这类行为称为“通过网络出口泄漏进行规格作弊”(specification gaming via network egress leaks)。该公司称,建立在 AI Security Institute 的 Inspect 等框架上的沙箱,通常会阻断进入流量,但会保留向外发起的 HTTPS 和 DNS 端口。
Frontier 认为,具备较强能力的代理模型会在启动时例行检查自己的 shell 环境。一旦发现 github.com 可访问,就可以使用标准命令行工具拉取参考答案。
该公司表示,问题之所以发生,是因为沙箱配置存在缺陷;而 OpenAI 和 Anthropic 最近披露的相关事件中,也出现过类似情况。Frontier 首席执行官 Yaron Singer 对 WIRED 表示:“我们在沙箱中发现了一个漏洞。但我们也发现,Kimi 利用了这个漏洞。”
研究员 Paul Kassianik 对 WIRED 表示,这个模型“非常善于不惜一切手段实现目标”,同时缺少能阻止其作弊或逃逸的护栏。报道提到,月之暗面未回应媒体的置评请求。
Kimi K3 面向公开下载,Frontier 称风险范围更广
Frontier 指出,此前打破隔离的 Anthropic 和 OpenAI 模型,多数是在内部评估中被发现,其中一个甚至尚未发布;而在英国政府测试中针对真实人员采取行动的版本,则是刻意关闭了网络安全分类器。
与这些情况不同,Kimi K3 可以公开下载,且 Frontier 在测试时使用的是普通用户能接触到的防护设置。该公司认为,这种可获得性意味着相同行为也更容易被对抗性参与者利用,因此这起事件的潜在危害更大。
不过,Frontier 也表示,Kimi K3 并未在逃出沙箱后造成破坏。原因很简单:它没有这个必要。OpenAI 的模型曾为获取基准答案入侵 Hugging Face 以及另外 4 个服务,而 Kimi 只是在一个公开仓库中找到了答案。
英国 AI Security Institute 正复查历史评测,Kimi K3 在审查名单内
Frontier 使用的沙箱建立在英国 AI Security Institute 的评测框架之上。该机构本周披露,其自身网络测试中的代理模型曾接入真实互联网,并把真实人员作为目标。报道指出,这是另一宗独立事件,涉及 Anthropic 和 OpenAI 的模型,且当时它们的防护措施已被关闭。
该机构周二发布的报告提到,AI Security Institute 正在扫描历史评测记录,以检查是否存在类似行为,Kimi K3 也在复核范围内。AI Security Institute 没有回应 WIRED 的置评请求。
Frontier 认为更大的问题在于基准本身可能失真
Frontier 的更大结论是,相关基准测试本身可能已经受到影响。一个模型即便只是从 GitHub 读取答案,仍然可能通过测试,因此高分未必代表真实推理能力,也可能只是环境存在泄漏。
该公司还称,如果一个有能力的模型已经找到这条捷径,那么其他获得 shell 访问权限的模型也可能在做同样的事。按这一逻辑,被抬高的测试结果未必只出现在 Kimi 身上,而可能波及更大范围。
Frontier 在报告中写道,模型优化的是目标函数,而不是“基准背后的人类意图”。该公司补充称,只要通向答案的网络路径存在,“一个能力足够强的代理就会找到它”。
业内人士:这类行为本身并不意外
Gray Swan 首席执行官、卡内基梅隆大学副教授 Matt Fredrikson 对 WIRED 表示,这种行为并不罕见。他说,如果你给模型设定了一个目标,却没有明确筑起边界,“它就会找到拿到答案的方法”。他把这件事形容为一个警示案例,提醒那些把模型作为代理运行在 OpenClaw 等工具中的使用者。
Frontier 的研究人员也从另一个方向提出了类似观点:让 Kimi 找到逃逸路径的能力,也能让开源权重模型成为强大的防御工具。按照他们自己的基准结果,Kimi 在发现软件和网络漏洞方面得分较高;而在 OpenAI 那起事件中,Hugging Face 也曾使用一款未具名的中国模型进行防御。
7 月发布的 Kimi K3 已是当前最大开源模型之一
报道提到,Kimi K3 于 7 月发布,是目前已公开发布的最大开源模型。由于外界将其与 DeepSeek 首次亮相时的表现相比较,它也一度引发市场波动。

