xAI
2026-07-11 20:57:41xAI 的 Grok 4.5 在 APEX-SWE 编程测试中排名第二
xAI 旗下 Grok 4.5 在 Mercor APEX-SWE 编程基准测试中排名第二,Pass@1 准确率为 51.2%,低于 Anthropic Claude Fable 5 的 65.5%。该模型于 2026 年 7 月初推出,并在 AutomationBench-AA 自动化能力测试中以 51% 的准确率位列第一。xAI 称,Grok 4.5 在性能可比的情况下,任务成本较竞争对手低 4 至 17 倍。
1080

