SpaceXAI 于 9 月 21 日发布 Grok 4.7,并表示这是旗下目前在写代码与知识工作方面能力最强的模型。公司称,新版本的价格与速度维持在 Grok 4.6 水准,即日起可在 Cursor、Grok Build 与 Grok API 使用。
Grok 4.7 维持与前代相同定价
根据 SpaceXAI 官方说明,Grok 4.7 改用比 Grok 4.6 更大的新基础模型,强化学习训练时间更长,题目组合也更难,重点放在需要数小时才能完成的任务。公司称,新模型更擅长检查自己的结果、处理更长上下文,也针对自家常驻代理 Grok Bot 的运行框架做了训练。
定价方面,Grok 4.7 每百万 token 输入 2 美元、输出 6 美元,与 Grok 4.6 相同;另有一个输出速度翻倍、价格也翻倍的快速版。
SpaceXAI 介绍称,SpaceXAI 是马斯克旗下的 AI 部门,今年 2 月由 xAI 并入 SpaceX,6 月再收购 Cursor。链新闻此前也曾整理其沿革。
官方公布多项评测成绩
SpaceXAI 公布的对比数据显示,Grok 4.7 采用 xHigh 推理设置,GPT-5.6 Sol 与 Fable 5.1 采用 Max,Grok 4.6 为 High。各模型输入与输出价格,以及多项评测结果如下:
| 评测/价格 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| 输入/输出价格(每百万 token) | 2/6 美元 | 2/6 美元 | 4/20 美元 | 10/50 美元 |
| CursorBench 4.0(软件工程) | 46.3% | 40.4% | 41.7% | 51.8% |
| Terminal-Bench 4.0(长时间终端机作业) | 38.0% | 20.3% | 37.3% | 57.9% |
| EEBench(电机工程) | 64.0% | 53.0% | 39.4% | 56.4% |
| Harvey 法律代理评测 | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional(临床推理) | 56.7% | 48.5% | 60.5% | 62.1% |
按 SpaceXAI 自行公布的数据,Grok 4.7 在电机工程与法律两项评测中领先;在软件工程与长时间终端机作业上仍落后 Fable 5.1;临床推理成绩则低于另外两家。
安全评测与红队测试安排
安全方面,SpaceXAI 表示,Grok 4.7 换上了全新的防护机制。在公司自家评测 HackerBench v0.3 中,模型仅放行 3.3% 有风险的双重用途网络安全请求;在 LatchBio 生物安全评测中拿到 62.4%,位居第一。
公司也表示,已开始让特定网络安全合作伙伴通过邀请制使用 Grok 4.7 的红队测试能力,用于防御研究。
另一份《星海争霸:母巢之战》评测引发讨论
在 Grok 4.7 发布前一天,一份让 AI 代理互相操作《星海争霸:母巢之战》的评测在 X 上流传。该评测名为 Brood War Bench,由开发者 Ben Swerdlow 发布,并于 9 月 20 日被 OpenClaw 开发者 Peter Steinberger 转贴,引发讨论。
Swerdlow 制作了一个只能通过 AI 代理操作的《星海争霸:母巢之战》环境,让 Codex、Claude 与 Grok 共 19 组模型与推理强度设置两两对战,总计进行了 171 场比赛。
结果显示,Codex Astra 最高推理设置 18 战全胜,Claude Fable 取得 15 胜 3 败,排名第三,Claude Opus 5 为 12 胜 6 败。Grok 4.6 的三种设置输给了所有 Codex 与 Claude 设置,只赢过 Claude Haiku 或彼此,表现最好的一组在 18 场中仅拿到 2 胜。
Grok 4.6 在部分对局中长时间推理但很少下指令
Swerdlow 记录称,Grok 4.6 经常花很长时间推理,但实际发出的指令很少。其中一场对局中,最高推理设置用了 11,138 个推理 token,在 43 分钟内只送出 6 批指令,且始终没有派出任何战斗单位。
他在报告中写道,Grok 模型还不够聪明,玩不了《母巢之战》;较旧的模型常把即时战略游戏当成回合制来玩,还在思考时就已被对手摧毁。
Swerdlow 也强调,所有参赛模型都没有超过新手水平。即便是 Codex Astra 与 Claude Fable,也无法组成复杂部队、守住简单进攻,一个会用光子炮快攻的新手玩家就能赢下全部对局。
这份评测测试的是 Grok 4.6,目前排行榜上还没有 Grok 4.7 的成绩。

