DeepSWE基准测试在数小时内经历两次榜首更迭。Google发布的Gemini 3.8 Flash版本在DeepSWE v1.1上取得73.7%的成绩,官方榜以74%±1%显示,排名超过Claude Opus 5和GPT-5.6 Sol。但仅几小时后,Meta公布Muse Spark 1.3,在同一套测试中跑出75.4%,将公开成绩拉升1.7个百分点。
DeepSWE测试要求AI Agent独立处理113个真实代码库中的长周期软件工程任务,模拟开发者实际工作场景。Google和Meta均使用mini-swe-agent框架,Google采用high推理档,Meta则运行max档。Meta上一代Spark 1.2成绩为55.0%,最新版本直接提升20.4个百分点。
不过,Meta的75.4%成绩目前尚未被列入DeepSWE官方榜单。在Artificial Analysis的Coding Agent Index中,限量预览的Spark 1.3 max获得68分,仅次于Claude Opus 5 xhigh;公开可用的xhigh版本得分为64分。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

