xAI 发布 Grok 4.7:参数增至 2.1 万亿,性能仍落后头部模型

xAI 发布 Grok 4.7:参数增至 2.1 万亿,性能仍落后头部模型

N
News Editor
2026-09-21 17:16:03
xAI 于周一下午发布 Grok 4.7,并称其是在相同价格和速度下较 Grok 4.6 的一次明显升级。新模型参数规模从 1.5 万亿增至 2.1 万亿,定价为每百万输入 token 2 美元、每百万输出 token 6 美元,已在 Grok 应用、Cursor、Grok Build 和 xAI API 上线。尽管 xAI 强调其推理、复核和安全护栏能力提升,文中列举的 GDPval、AA-Briefcase 和 CursorBench 4.0 成绩显示,Grok 4.7 仍落后于 Claude Fable 5.1。

xAI 于周一下午发布 Grok 4.7,并将其称为迄今表现最好的模型。公司表示,这一版本「在相同价格和速度下,相比 Grok 4.6 有明显提升」。

xAI 发布 Grok 4.7:参数增至 2.1 万亿,性能仍落后头部模型 2

这次发布前已出现数次明显延期。自 7 月下旬以来,马斯克至少 5 次调整时间表,先后给出「还要 4 周」「还要几周」「3 到 4 周」「9 月 1 日时称还要 10 天」,以及 9 月 11 日所说的「还需要再多几天打磨」。

参数规模扩大,已直接上线

xAI 表示,Grok 4.7 在处理复杂问题时会花更长时间推演,并且比 Grok 4.6 更频繁地复核自己的答案,同时配备了公司所称迄今最强的安全护栏。

马斯克随后也在 X 上发文,称 Grok 4.7 是「智能、速度和低成本的强力组合」。这次没有等待名单,模型已经在 Grok 应用、Cursor、Grok Build 和 xAI API 中上线。

根据 xAI 披露,Grok 4.7 的参数规模达到 2.1 万亿,较 Grok 4.6 的 1.5 万亿增加 40%。而 Grok 4.6 本身则是对 Grok 4.5 的一次改进。价格方面,Grok 4.7 的收费为每百万输入 token 2 美元、每百万输出 token 6 美元。

文中解释称,参数是模型在训练过程中调整的内部变量,参数更多通常意味着更强的模式学习能力;token 则是 AI 模型接收或生成信息的基本单位。

引入 SpaceX 补充训练数据

xAI 还将来自 SpaceX 的补充训练数据纳入模型,包括 Starlink 卫星遥测数据、制造记录以及工程故障日志。xAI 给出的卖点是,相比仅用互联网文本训练的模型,这一版本在硬件和物理系统相关推理上会更强。

基准测试成绩仍落后 Claude Fable 5.1

不过,基准测试结果延续了市场熟悉的格局。

GDPval 用于衡量模型在真实、具有经济价值的知识工作中的表现,覆盖法律备忘录、电子表格和演示文稿等任务,这些任务由各领域在职专业人士审核,并以 Elo 评级方式计分,和国际象棋使用的是同一种对战排名体系。

xAI 发布 Grok 4.7:参数增至 2.1 万亿,性能仍落后头部模型 3

在 GDPval 中,Grok 4.7 得分为 1695,Claude Fable 5.1 以 1735 位居榜首。

由 Artificial Analysis 构建的 AA-Briefcase 测试多小时连续办公任务,把研究、分析和文档产出串成一个长任务,同样采用 Elo 评分。Grok 4.7 的成绩为 1657,Fable 5.1 为 1678,结果与前一项测试一致。

在 Cursor 自家的真实编程任务基准 CursorBench 4.0 中,图表比较的是准确率与每项任务消耗的成本和 token 数量。Grok 4.7 处于中间位置:单项任务成本高于 GPT-5.6 Sol 的后继模型 GPT-6 Astra 和 Claude Sonnet 5,但整体仍落后于 Fable 5.1,后者在图表中的各个价格区间都占优。

xAI 的既有路线:价格更低,但能力未居前列

报道指出,这并不是 xAI 第一次出现这种情况。Grok 4.5 于 7 月发布时,使用了行业内规模最大的训练集群,但测试成绩排在 Claude 和 OpenAI 模型之后,位列第三。更早之前,Grok 4.20 以可靠性换取速度和个性化表现;Grok 4.6 在编程自主性方面也落后于最前沿模型。

这并不意味着 Grok 4.7 对通过 X、独立应用或特斯拉车载仪表盘与其交互的数百万用户来说是一个糟糕产品。文中的意思更接近于:最有可能回答用户问题、或驱动车载语音助手的模型,其制造商自己给出的基准结果显示,它仍比最顶尖的一档低一个台阶。

也正因如此,价格标签对多数用户的重要性高于排行榜名次。报道称,xAI 一直在每 token 成本上压低价格,低于 Anthropic 和 OpenAI,尽管其原始能力仍落后于这两家公司。其押注方向是,「足够好、便宜、而且无处不在」会比「最好、但更贵」更适合大多数日常使用场景。

马斯克已提前下调预期,并预告后续版本

在发布前几天,马斯克已经降低了外界预期。他写道,Grok 4.7 的水平应当会「大致与」Anthropic 的 Claude Opus 5.0 相当,而不是更新的 Opus 5.1;多模态表现也仍需改进。

在同一篇帖子中,他还勾勒了接下来的 3 个模型:Grok 4.8 将是一次有意义的升级,Grok 4.9 将进入「Astra/Fable 级别」,而 Grok 5 则可能成为前沿领先模型。这些升级目前都没有公布发布日期。马斯克写道:「We shall see。」

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。