Cognition发布SWE-2,编程评测逼近Astra且成本约为四分之一

Cognition发布SWE-2,编程评测逼近Astra且成本约为四分之一

N
News Editor
2026-09-11 00:00:44
Coding Agent Devin 母公司 Cognition 推出新编程模型 SWE-2,基于月之暗面 2.8T 参数的 Kimi K3 继续进行强化学习训练。该模型在多项编程评测中较此前提升约 5 到 6 个百分点,在 FrontierCode 1.1 Main 上拿到 50.0%,接近 GPT-6 Astra 的 53.3%。Cognition 称,SWE-2 成本约为 Astra 的四分之一,中等推理强度下交互轮数减少 58%,平均成本下降 81%,目前已上线 Devin Desktop 和 CLI。

Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。该模型直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测提高约 5 到 6 个百分点。

SWE-2 在 FrontierCode 1.1 Main 的成绩

在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。

与 Fable 5.1 相比,SWE-2 仅少 0.9 个百分点,后者得分为 50.9%。Cognition 给出的对比还显示,SWE-2 的成本低 64%。

GPT-6 Astra 在这一评测中的得分为 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为其四分之一。

交互轮数与成本变化

Cognition 表示,SWE-2 相比上一代少走了很多弯路。在中等推理强度下,模型完成任务的交互轮数减少 58%,平均成本下降 81%。

更高难度评测仍有差距

不过,在更难的 Terminal-Bench 4 上,SWE-2 得分只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,暂时还谈不上全面追平前沿模型。

上线范围

SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。