DeepSeek R1 Matches Mythos as Low-Cost Models Reshape AI Security Competition

DeepSeek R1 Matches Mythos as Low-Cost Models Reshape AI Security Competition

N
News Editor 01
2026-07-08 02:30:12
AISLE found that DeepSeek R1 matches Anthropic’s Mythos in critical bug detection, while several cheaper models also performed strongly. The results suggest AI security may depend more on workflow integration and system design than model price alone.

AI安全领域近日出现一项引发广泛关注的测试结果。安全公司AISLE在最新实验中指出,DeepSeek R1在关键漏洞检测能力上已可比肩Anthropic的Mythos,而且不止是它,一批成本更低、体量更小的模型同样能够识别高风险安全缺陷。这一发现正在挑战市场对“最贵模型=最强安全能力”的既有认知,也为AI安全产业的商业模式和技术路线带来新的讨论。

此前,Anthropic发布Mythos Preview后迅速震动安全社区。根据公开演示,Mythos自主发现了一个存在于FreeBSD中长达17年的远程代码执行漏洞,以及一个潜伏于OpenBSD TCP协议实现中27年的缺陷,并能够进一步生成可运行的利用代码。随后,Anthropic宣布启动Project Glasswing,并联合多家科技公司提供1亿美元额度用于修复开源软件漏洞。这些动作一度强化了外界对顶级AI模型在网络安全上“代差领先”的印象。

低成本模型也能找到同类高危漏洞

不过,AISLE的复测结果给出了更复杂的答案。AISLE是一家专注AI安全的创业公司,自2025年年中起便使用AI系统识别并修复开源软件漏洞,累计发现和修复了180多个被开源社区认可的安全问题,其中一些隐藏时间超过25年。在Mythos发布后,AISLE将其演示中的漏洞样本交由多款更便宜的模型重新测试。

结果显示,Anthropic用于展示能力的核心漏洞,在AISLE测试的8个模型中全部被成功识别。更值得注意的是,其中一款模型的成本仅为每百万token 0.11美元,约为Mythos价格的二十分之一。在准确性方面,DeepSeek R1表现尤为突出,其对实际堆栈布局的描述与公开利用文档高度一致。多数模型不仅找到了漏洞,还正确判断其可被远程利用,并给出了合理的风险分级。

对于另一个隐藏了27年的复杂漏洞,AISLE表示,GPT-OSS-120b首次尝试便复现了完整攻击路径,并提出了与实际修复方案极为接近的补丁。Kimi K2也展现出较强能力,在后续漏洞分析流程中,仅通过三次简单API调用就得出了与Mythos官方描述接近的攻击逻辑。

最贵模型未必在所有场景都更可靠

比“谁答对了”更值得关注的,是“谁答错了”。AISLE设计了一道类似安全行业“毕业题”的测试:一段代码表面上似乎存在漏洞,但关键危险数据在中途已被丢弃,因此最终并不构成真实风险。这个问题考查的是模型对安全语境和执行路径的细致理解,而不是简单的模式匹配。

AISLE称,一些当前最昂贵、最先进的模型在这一基础问题上却给出了错误结论。包括Claude Sonnet 4.5,以及GPT-4.1、GPT-5.4系列均未通过;相反,DeepSeek R1在4次测试中全部识别正确,GPT-OSS-20b和OpenAI o3也能成功区分真实风险与“虚晃一枪”的代码设计缺陷。

这说明,AI在安全任务上的能力并非线性增长,也不是参数更大、价格更高就必然更稳定。AISLE因此提出了“锯齿状边界”的概念,即模型在不同安全任务上的表现具有明显波动:它可能在复杂漏洞分析中得高分,却在基础判断题上失误;也可能在某类漏洞上极其准确,在另一类任务中却自信地给出错误答案。

决定AI安全上限的,或是系统而非单一模型

AISLE认为,Mythos真正令人印象深刻的地方,并不只是“发现漏洞”本身,而是其高度自治能力——它可以在海量代码文件中自主锁定可疑区域、提出假设、验证问题并生成利用代码。但AISLE同时强调,这种“全自动”价值主要来自工程设计和流程编排,而不完全是模型本身的智能水平。

在现实工作流中,AI找漏洞通常包括多个环节:大范围扫描代码库、识别可疑片段、验证是否真实存在漏洞、评估严重程度、生成补丁并推动修复。AISLE指出,较便宜的模型已经能够胜任“识别问题”的部分,真正困难的是如何将各步骤串联成一个可靠管线,减少误报、动态切换合适模型,并把安全专家经验嵌入系统中。

也正因此,AISLE采用的是多模型并行方案,根据不同任务动态切换表现最佳的模型。该公司强调,建立可信的漏洞报告和修复协作机制,与其说取决于某一个顶级模型,不如说取决于整体系统设计、响应速度、成本控制及团队的安全专业能力。OpenSSL相关技术负责人也对其“高质量报告与建设性协作”给予正面评价。

对市场和加密行业意味着什么

这一测试结果的影响并不限于AI安全圈本身。对于更广泛的科技与加密市场而言,它释放出一个明确信号:AI能力的商业化护城河,正从“拥有最强模型”转向“构建最优工作流”。如果低成本模型已经足够承担漏洞筛查等关键步骤,那么企业可以选择部署大量低价模型进行广覆盖扫描,而非仅依赖单一昂贵模型逐点排查。这将压低AI安全服务的进入门槛,也可能推动安全自动化工具在开源软件、区块链基础设施和交易系统中更快普及。

对于加密行业而言,这一趋势尤其值得关注。交易所、钱包、DeFi协议、跨链桥和底层客户端长期面临复杂的开源代码审计压力。若更具性价比的AI模型能够承担初筛、风险标注和补丁建议工作,安全团队将有机会以更低成本提高审计频率和覆盖范围,从而降低智能合约漏洞、节点软件缺陷和基础设施攻击的潜在风险。

此外,在欧盟MiCA等监管框架持续推进的背景下,市场对技术稳健性与合规能力的要求同步提升。无论是中心化平台还是链上协议,安全事件都可能快速传导至流动性、用户信心乃至代币价格层面。AISLE的测试表明,未来行业竞争焦点可能不再只是采购最贵的AI模型,而是如何将多模型能力、人工审核、修复流程和合规要求有效整合。

总体来看,DeepSeek R1追平Mythos的消息,并不意味着顶级模型优势消失,而是提示市场重新审视AI安全的核心价值。Mythos证明了高度自治的可行性,而AISLE则进一步说明:AI安全的真正护城河,也许不在模型本身,而在系统工程能力。这对整个技术产业,包括加密资产市场,都是一个值得持续追踪的重要变化。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.