xAI 发布了 Grok 4.6。该版本基于 Grok 4.5 构建,主攻长时间运行的智能体,以及更复杂的交互和视觉工作。按 xAI 的说法,Grok 4.6 可以在多个步骤中持续处理复杂任务,包括研究主题、分析信息、跨代码库工作,以及把想法做成完整的应用程序或作品。

xAI 表示,Grok 4.6 在多项智能体编码和知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。该指数为 9 项基准的综合评分。
已上线 Cursor 和 Grok Build
Grok 4.6 已于今日在 Cursor 和 Grok Build 中可用。xAI 称,首周在 Grok Build 和 Cursor 中提供 2 倍包含用量,方便用户试用 4.6。
训练方式延续 Grok 4.5,并补强推理与工程数据
xAI 称,Grok 4.6 相比 Grok 4.5 进行了更长时间的补充训练,使用了经过筛选的模型生成数据,覆盖推理和高级技术概念,以及高质量工程数据,同时改进了优化器和训练配方。这些调整被用于为后续的 SFT 和 RL 阶段打基础。
在后续阶段,xAI 使用 Grok 4.5 重新生成 SFT 轨迹,覆盖推理工作、智能体框架,以及 STEM、软件工程和知识工作等领域,并通过基于模型的检查过滤有问题的轨迹。xAI 表示,由此得到的 SFT 检查点表现出更强性能和更好的行为。
Grok 4.6 还在广泛的智能体强化学习任务上进行了训练,涵盖知识工作、通用编码,以及面向内核优化、网页开发、计算机辅助设计等领域的特定环境。
面向项目生成,长任务中会自查结果
xAI 表示,在用于测试其范围扩展和长时间工作能力的项目中,Grok 4.6 特别擅长把宽泛的产品想法转成可用的初版。模型可以研究陌生领域、搭建应用结构、实现核心交互,并在多轮反馈中持续优化结果。
在更长的任务轨迹中,xAI 观察到 Grok 4.6 出现了更多自测和验证行为,模型会在继续之前检查自己的工作。
在视觉和交互项目上,xAI 称 Grok 4.6 的首次产出强于通常在 Grok 4.5 上看到的结果。给定一个具体的产品想法,该模型可以一次性为应用建立结构和视觉语言。xAI 认为,这让它在那些先做出实质内容、再循环迭代的项目中更有用。

安全防护随能力扩展同步调整
xAI 表示,Grok 4.6 的安全防护已根据模型能力进行了改进和校准。其安全栈的目标是在合法用例中同时提升实用性和安全性,使 Grok 4.6 可用于漏洞修补、加速工程设计周期和增强 AI 研究等场景。
xAI 还称,其安全防护评估工作反映了 Grok 4.6 能力的扩展,包括迄今最广泛的能力与安全防护校准部署前测试,以及广泛的部署后和第三方测试。
基准分数:部分项目追平或超过 GPT-5.6 Sol Max
根据公开数据,Grok 4.6 在部分基准上追平或超过 GPT-5.6 Sol Max,但并非全面领先。文中列出的成绩包括:
- CursorBench v3.2:69.9%
- GDPVal-AA v2:1753
- AA-Briefcase:1577
- APEX-Agents:57.5%
- Terminal-Bench v3.0:26%
- DeepSWE v1.1:65.9%
xAI 给出的对比显示,Grok 4.6 在 CursorBench v3.2、GDPVal-AA v2、AA-Briefcase 和 APEX-Agents 上追平或超过 GPT-5.6 Sol Max,但在 Terminal-Bench v3.0 和 DeepSWE v1.1 上仍有差距。文中同时提到,Fable 5 Max 在多数项目中保持微弱领先。
API 已开放,输入代币每百万 2 美元起
xAI 表示,除 Cursor 和 Grok Build 外,Grok 4.6 也可通过 API 以及 OpenRouter、Vercel 和 Cloudflare 等合作伙伴使用。
API 定价为每百万输入代币 2 美元起,每百万输出代币 6 美元起。xAI 还提供一个快速版本,价格为标准版的两倍。
xAI 在原文中还给出 API 密钥创建、文档接入以及通过 Grok Build 免费试用的入口信息。

