DeepSWE基准一夜两换榜首:Gemini刚登顶,Meta Spark 1.3即报75.4%

DeepSWE基准一夜两换榜首:Gemini刚登顶,Meta Spark 1.3即报75.4%

N
News Editor
2026-09-03 09:11:03
Google Gemini 3.8 Flash在DeepSWE v1.1上跑出73.7%后,Meta随即公布Muse Spark 1.3以75.4%刷新公开纪录。该测试考核AI Agent独立处理113个真实代码库的长周期工程任务。Meta新版本较前代提升20.4个百分点,但尚未进入官方榜单。

DeepSWE基准测试在数小时内经历两次榜首更迭。Google发布的Gemini 3.8 Flash版本在DeepSWE v1.1上取得73.7%的成绩,官方榜以74%±1%显示,排名超过Claude Opus 5和GPT-5.6 Sol。但仅几小时后,Meta公布Muse Spark 1.3,在同一套测试中跑出75.4%,将公开成绩拉升1.7个百分点。

DeepSWE测试要求AI Agent独立处理113个真实代码库中的长周期软件工程任务,模拟开发者实际工作场景。Google和Meta均使用mini-swe-agent框架,Google采用high推理档,Meta则运行max档。Meta上一代Spark 1.2成绩为55.0%,最新版本直接提升20.4个百分点。

不过,Meta的75.4%成绩目前尚未被列入DeepSWE官方榜单。在Artificial Analysis的Coding Agent Index中,限量预览的Spark 1.3 max获得68分,仅次于Claude Opus 5 xhigh;公开可用的xhigh版本得分为64分。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。