微软发布首个网络安全模型,称 MDASH 测试成绩超过 Claude Mythos 与 GPT-5.6 Sol

微软发布首个网络安全模型,称 MDASH 测试成绩超过 Claude Mythos 与 GPT-5.6 Sol

N
News Editor
2026-07-27 19:01:04
微软发布首个专用网络安全模型 MAI-Cyber-1-Flash,并将其接入漏洞发现系统 MDASH。微软称,这套组合在 CyberGym 基准上拿到 95.95%,高于 GPT-5.5 Cyber、Mythos 5、GPT-5.6 Sol 和 Gemini 3.5 Flash Cyber,同时成本比微软当前最佳 MDASH 配置低 50%。该系统已通过 Defender 门户进入私有预览,当前单个仓库大小约限 256MB,每个租户仅支持 1 个并发扫描。
微软网络安全人工智能漏洞扫描MDASHMAI-Cyber-1-FlashCyberGym

微软发布了首个专用网络安全模型 MAI-Cyber-1-Flash,并将其接入 MDASH 漏洞发现系统。微软称,这套组合在 CyberGym 基准测试中的表现超过 Anthropic 的 Mythos 5、OpenAI 的 GPT-5.6 Sol,成本则比微软当前最佳 MDASH 配置低 50%。

微软发布首个网络安全模型,称 MDASH 测试成绩超过 Claude Mythos 与 GPT-5.6 Sol 2

CyberGym 得分 95.95%,高于多款同类系统

按照微软说法,MDASH 与 MAI-Cyber-1-Flash 的组合在 CyberGym 上获得了 95.95% 的成绩。CyberGym 是一项用于评估 AI 智能体漏洞复现能力的基准,要求系统在 188 个开源项目中复现 1,507 个已知漏洞,再按受控环境下成功复现的比例评分。

微软给出的对比数据显示,这一成绩高于 GPT-5.5 Cyber 的 85.6%、Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6%,以及 Gemini 3.5 Flash Cyber 的 83.2%。不过,这一结果由微软自行披露,截至发稿时,尚未出现在 CyberGym 的公开排行榜上。微软同时提到,该基准使用公开测试集,并采用明确的成功判定标准。

MAI-Cyber-1-Flash 负责大部分任务,难题交给 GPT-5.4

微软表示,MAI-Cyber-1-Flash 并不是单独运行。该模型最多处理 90% 的任务,MDASH 会把最困难的 10% 转给 GPT-5.4。微软强调,这种分工与成本直接相关,因为模型每次读取代码或生成答案都要消耗 token,而 token 会带来费用。

微软 CEO 萨提亚·纳德拉在社交平台写道:“这是微软首次由效率导向构建的模型,能够击败一款以通用能力为目标构建的密集型最先进模型。”他还表示:“当与 MDASH 结合时,MAI-Cyber-1-Flash 以领先模型 50% 的成本提供世界级性能。”

模型负责推理,MDASH 负责代理、校验与工作流

微软对这套系统作了区分。MAI-Cyber-1-Flash 是负责对代码进行推理的模型;MDASH 则是围绕模型运行的整套机制,包括智能体、工具、检查流程和工作流,用来决定从哪里开始检查、对可疑发现进行质疑、去重,并证明漏洞确实可以被触发。

微软称,MDASH 使用了 100 多个专用智能体,分别负责审计代码、讨论某个发现是否真实,以及构建概念验证,也就是可以实际演示漏洞存在的 PoC。

微软发布首个网络安全模型,称 MDASH 测试成绩超过 Claude Mythos 与 GPT-5.6 Sol 3

微软称传统补漏洞方式正在过时

微软表示,随着 AI 降低漏洞发现成本,偶发式扫描和延迟打补丁正在变得过时。该公司认为,自己积累了数十年的安全数据,因此具备优势,并称:“没有人能够制造这样的历史。”

自 Claude Mythos 发布以来,网络安全研究人员一直在尝试追平或超过它的能力。研究人员曾用公开模型复现类似 Mythos 风格的漏洞发现流程,单次扫描成本低于 30 美元。参与相关研究的 Dawid Moczadło 说:“护城河正在从模型访问转向验证。”

报道提到,真正稀缺的部分,正在变成能够证明发现结果成立、同时又不让开发者被大量误报警淹没的系统。

微软成绩比 GPT-5.5 Cyber 高约 10 个百分点

Decrypt 此前报道,GPT-5.5 Cyber 最近曾以 85.6% 登上 CyberGym 公开榜首,略微领先 Mythos。按文中给出的数据,微软这次的 95.95% 比 GPT-5.5 Cyber 高约 10 个百分点,也比 MDASH 之前的成绩高出 7.5 个百分点。不过,这次评估针对的是完整系统,而不是单独测试 MAI-Cyber-1-Flash。

已进入 Defender 私有预览,仓库大小与并发数有限制

微软正通过 Defender 门户中的 Microsoft Security Exposure Management 提供 MDASH 私有预览。客户可以扫描 Git 仓库,查看按“从不太可能到已证实”排序的发现结果,也可以使用 Defender CLI 生成建议代码修复方案,交由开发者审查。

当前预览版将单个仓库限制在约 256MB,并且每个租户只允许 1 个并发扫描。微软还表示,Project Perception 预计会把同样的多智能体方法,从代码扫描扩展到更广泛的威胁监测与修复工作流。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。