Coding Agent Devin 母公司 Cognition 发布新编程模型 SWE-2。该模型直接基于月之暗面 2.8T 参数的 Kimi K3 继续做强化学习,进一步训练后,多项编程评测提高约 5 到 6 个百分点。
SWE-2 在 FrontierCode 1.1 Main 的成绩
在 Cognition 自家的 FrontierCode 1.1 Main 上,SWE-2 得分 50.0%,超过 GPT-5.6 Sol 的 47.5% 和 Grok 4.6 的 48.0%。
与 Fable 5.1 相比,SWE-2 仅少 0.9 个百分点,后者得分为 50.9%。Cognition 给出的对比还显示,SWE-2 的成本低 64%。
GPT-6 Astra 在这一评测中的得分为 53.3%,SWE-2 与其相差 3.3 个百分点,成本约为其四分之一。
交互轮数与成本变化
Cognition 表示,SWE-2 相比上一代少走了很多弯路。在中等推理强度下,模型完成任务的交互轮数减少 58%,平均成本下降 81%。
更高难度评测仍有差距
不过,在更难的 Terminal-Bench 4 上,SWE-2 得分只有 27.3%,明显低于 Astra 的 57.9% 和 Fable 5.1 的 55.8%,暂时还谈不上全面追平前沿模型。
上线范围
SWE-2 已上线 Devin Desktop 和 CLI,并开始推向 Devin Web 和 Fusion。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

