Anthropic 于2026年4月7日公开了其未发布模型 Claude Mythos Preview 的完整训练结果。该模型在自主发现和利用未知软件漏洞方面展现出远超人类专家及此前AI系统的能力,已识别出数千个高严重性零日漏洞,覆盖所有主要操作系统和网络浏览器。为此,Anthropic启动了名为 Project Glasswing 的防御性网络安全联盟,并承诺投入高达 1亿美元 的AI使用信用额度。
关键性能数据
Claude Mythos Preview 在业界公认的网络安全基准测试 Cybergym 上得分 83.1%,远超前代 Claude Opus 4.6 的 66.6%。在 SWE-bench Verified 上,Mythos 得分 93.9%(Opus 4.6 为 80.8%),在 SWE-bench Pro 上则达到 77.8%(Opus 4.6 为 53.4%),差距高达24个百分点。在缺乏工具辅助的“人类最后考试”(Humanity's Last Exam)中,Mythos 得分为 56.8%,而 Opus 4.6 为 40.0%。这些提升并非来自专门的网络安全训练,而是源于推理、多步骤规划和自主代理行为方面的重大突破。
数十年无人发现的漏洞
该模型在孤立容器中分析代码库时,能够自主形成关于内存安全缺陷的假设,编译并运行软件,使用 Address Sanitizer 等调试工具,按漏洞可能性对文件排序,并生成带有概念验证利用代码的有效报告。最引人注目的案例包括:一个 27年 历史的 OpenBSD TCP SACK 整数溢出漏洞,可使远程攻击者通过恶意数据包使任何响应主机崩溃;一个 16年 历史的 FFmpeg H.264 错误,此前已通过超过500万次自动化测试和多次审计。Mythos 发现这两个漏洞分别耗时约1000次运行,总成本不到2万美元。
在浏览器测试中,Mythos 对 Firefox 147 JavaScript 引擎产生了 181个完整的shell利用 和 29个寄存器控制案例,而 Claude Opus 4.6 仅生成两个shell利用。该模型还构建了有效的 Linux 内核权限提升链,在过滤100个近期CVE后锁定40个可利用候选,并成功利用其中超过一半。人类验证者审查了198份漏洞报告,在严重性评级上同意率达89%,在相邻级别内的同意率达98%。
Project Glasswing:防御先行
截至目前,发现的漏洞中仅有不到1%得到完全修补。Anthropic 正在协调负责任披露,对未修补问题发布加密SHA-3承诺,并遵循90加45天的时间线。已披露的案例包括 FreeBSD NFS 服务器远程代码执行漏洞 CVE-2026-4747(17年历史,可实现无认证根权限访问)。为确保AI防御能力不被恶意滥用,Anthropic 于2026年4月7日推出 Project Glasswing,创始合作伙伴包括亚马逊云科技、苹果、博通、思科、CrowdStrike、谷歌、摩根大通、Linux基金会、微软、英伟达和派拓网络。联盟已向超过40家关键软件组织开放访问。
此外,Anthropic 承诺向开源安全捐赠400万美元:250万美元通过 Linux 基金会的 OpenSSF 项目资助 Alpha-Omega,150万美元资助 Apache 软件基金会。
风险与应对
Anthropic 承认,像 Mythos 这样的AI工具降低了发现和利用漏洞的进入门槛,并指出如果类似能力不受控制地扩散,来自国家行为体(如中国、伊朗、朝鲜、俄罗斯)以及犯罪集团的短期风险将显著增加。公司将其称为“过渡性动荡期”——在防御方完全整合该技术之前。未来 Claude Opus 版本将包含检测和阻止危险网络安全输出的保障措施,并计划推出面向经审查安全专业人士的“网络验证计划”。预计90天内将发布关于合作伙伴发现和已修补漏洞的公开报告。

