Grok 4.7 上线维持原价,前代在 AI《星海争霸》评测中接近垫底

Grok 4.7 上线维持原价,前代在 AI《星海争霸》评测中接近垫底

N
News Editor
2026-09-21 18:31:52
SpaceXAI 于 9 月 21 日推出 Grok 4.7,称其为当前写代码与知识工作能力最强的模型,价格和速度维持 Grok 4.6 水准,并已接入 Cursor、Grok Build 与 Grok API。官方公布的基准测试显示,Grok 4.7 在电机工程与法律评测中领先,但软件工程、长时间终端机任务和临床推理并非全面第一。与此同时,一份 9 月 20 日在 X 上流传的《星海争霸:母巢之战》AI 对战评测显示,前代 Grok 4.6 在 19 组参赛设置中表现接近垫底。

SpaceXAI 于 9 月 21 日发布 Grok 4.7,并表示这是旗下目前在写代码与知识工作方面能力最强的模型。公司称,新版本的价格与速度维持在 Grok 4.6 水准,即日起可在 Cursor、Grok Build 与 Grok API 使用。

Grok 4.7 维持与前代相同定价

根据 SpaceXAI 官方说明,Grok 4.7 改用比 Grok 4.6 更大的新基础模型,强化学习训练时间更长,题目组合也更难,重点放在需要数小时才能完成的任务。公司称,新模型更擅长检查自己的结果、处理更长上下文,也针对自家常驻代理 Grok Bot 的运行框架做了训练。

定价方面,Grok 4.7 每百万 token 输入 2 美元、输出 6 美元,与 Grok 4.6 相同;另有一个输出速度翻倍、价格也翻倍的快速版。

SpaceXAI 介绍称,SpaceXAI 是马斯克旗下的 AI 部门,今年 2 月由 xAI 并入 SpaceX,6 月再收购 Cursor。链新闻此前也曾整理其沿革。

官方公布多项评测成绩

SpaceXAI 公布的对比数据显示,Grok 4.7 采用 xHigh 推理设置,GPT-5.6 Sol 与 Fable 5.1 采用 Max,Grok 4.6 为 High。各模型输入与输出价格,以及多项评测结果如下:

评测/价格Grok 4.7Grok 4.6GPT-5.6 SolFable 5.1
输入/输出价格(每百万 token)2/6 美元2/6 美元4/20 美元10/50 美元
CursorBench 4.0(软件工程)46.3%40.4%41.7%51.8%
Terminal-Bench 4.0(长时间终端机作业)38.0%20.3%37.3%57.9%
EEBench(电机工程)64.0%53.0%39.4%56.4%
Harvey 法律代理评测19.6%15.8%2.5%6.7%
HealthBench Professional(临床推理)56.7%48.5%60.5%62.1%

按 SpaceXAI 自行公布的数据,Grok 4.7 在电机工程与法律两项评测中领先;在软件工程与长时间终端机作业上仍落后 Fable 5.1;临床推理成绩则低于另外两家。

安全评测与红队测试安排

安全方面,SpaceXAI 表示,Grok 4.7 换上了全新的防护机制。在公司自家评测 HackerBench v0.3 中,模型仅放行 3.3% 有风险的双重用途网络安全请求;在 LatchBio 生物安全评测中拿到 62.4%,位居第一。

公司也表示,已开始让特定网络安全合作伙伴通过邀请制使用 Grok 4.7 的红队测试能力,用于防御研究。

另一份《星海争霸:母巢之战》评测引发讨论

在 Grok 4.7 发布前一天,一份让 AI 代理互相操作《星海争霸:母巢之战》的评测在 X 上流传。该评测名为 Brood War Bench,由开发者 Ben Swerdlow 发布,并于 9 月 20 日被 OpenClaw 开发者 Peter Steinberger 转贴,引发讨论。

Swerdlow 制作了一个只能通过 AI 代理操作的《星海争霸:母巢之战》环境,让 Codex、Claude 与 Grok 共 19 组模型与推理强度设置两两对战,总计进行了 171 场比赛。

结果显示,Codex Astra 最高推理设置 18 战全胜,Claude Fable 取得 15 胜 3 败,排名第三,Claude Opus 5 为 12 胜 6 败。Grok 4.6 的三种设置输给了所有 Codex 与 Claude 设置,只赢过 Claude Haiku 或彼此,表现最好的一组在 18 场中仅拿到 2 胜。

Grok 4.6 在部分对局中长时间推理但很少下指令

Swerdlow 记录称,Grok 4.6 经常花很长时间推理,但实际发出的指令很少。其中一场对局中,最高推理设置用了 11,138 个推理 token,在 43 分钟内只送出 6 批指令,且始终没有派出任何战斗单位。

他在报告中写道,Grok 模型还不够聪明,玩不了《母巢之战》;较旧的模型常把即时战略游戏当成回合制来玩,还在思考时就已被对手摧毁。

Swerdlow 也强调,所有参赛模型都没有超过新手水平。即便是 Codex Astra 与 Claude Fable,也无法组成复杂部队、守住简单进攻,一个会用光子炮快攻的新手玩家就能赢下全部对局。

这份评测测试的是 Grok 4.6,目前排行榜上还没有 Grok 4.7 的成绩。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。