马斯克的 AI 助手,开始直接调用外部模型。
10 月 7 日,马斯克在 X 上表示,Grok Bot 会根据具体任务选择最合适的后端模型,并点名 Claude Opus 5.5、Midjourney、Suno 以及「其他领先的 API」。他给出的标准很直接:「哪个最有可能给你带来最好的结果,就用哪个。」
这意味着,用户把任务交给 Grok Bot 后,背后实际处理部分工作的,可能并不是 xAI 自家的模型。
据 9to5Mac 同日报道,Grok Bot 已经可以使用 Claude Opus 5.5。也就是说,Claude 已经进入这套助手系统的可调用名单。
围绕这次点名,外界也注意到一个细节。网友 ExiledonMoon 调侃,连马斯克的 AI 助手也开始找 Claude 帮忙干活。另一位网友 Token Maxxer 则提醒,马斯克列出的不只有 Claude、Midjourney 和 Suno,还包括「其他领先的 API」。OpenAI 没有被点名,但也没有被明确排除。
接入对手模型,先解决任务完成度
从马斯克强调的「最佳结果」来看,这套思路并不复杂:先把用户交办的任务完成好,而不是要求单一模型包办所有环节。
如果某项任务借助 Claude 能做得更好,Grok Bot 直接接入该模型,就有机会减少用户因为体验不佳而转去别的产品。即便背后部分能力来自 Anthropic,用户提出需求、连接工具、跟进任务和接收结果的入口,仍然可以留在 Grok Bot 内。
换句话说,Anthropic 提供部分模型能力,Grok Bot 负责把这些能力组织起来并交付结果。只要任务完成得顺手,用户下次仍可能优先打开 Grok Bot。
Grok Bot 争夺的不是一次问答,而是一整件事
马斯克此次提到的 Grok Bot,在 8 月 11 日推出 Beta 版。按照官方介绍,这款智能助手自带云电脑,可以替用户执行任务,也支持使用工具、登录应用、跨软件处理工作。多个 Bot 之间还能相互沟通、共享任务背景并分工协作,用户离开电脑后,任务也能继续推进。
这次提到 Grok Bot,并不等于 X 上的 Grok 聊天功能会全面改用 Claude。马斯克点名的名单里,除了 Claude,还有图像生成工具 Midjourney 和音乐生成工具 Suno,覆盖文字、图像和音乐几类能力。
这一组合对应的是更现实的场景:完成一项工作,往往不只需要一个模型。比如制作一条短视频,可能要先写文案,再准备封面,还要配一段音乐。单看每个环节,找几个不同的 AI 工具并不难,麻烦往往出现在解释需求、搬运文件和协调修改上。
如果 Grok Bot 能按照任务自动调用合适的模型,再把这些步骤衔接起来,它承担的就不只是生成内容,而是部分协调工作。对用户来说,最直接的需求也很简单:少在几个模型和工具之间来回切换,同一个要求不用反复解释。
模型选择由平台完成,用户可查看实际调用和费用
模型接得越多,一个问题也随之出现:如果候选项越来越多,用户会不会反而更难决定该用哪一个。
Grok Bot 的官方文档已经给出答案。文档显示,模型选择由平台管理,没有面向用户的模型选择菜单,实际采用的模型组合也可能随时间变化。
这意味着,用户提交任务后,由系统负责挑选模型。写代码时不必先判断 Claude 还是 Grok 更适合,做图时也不用逐个比较工具能力。
不过,官方文档也提到,用户并非完全看不到调用情况。用量分析会显示实际用了哪个模型,费用也会按所用模型计算。这些信息可以帮助用户判断,这次任务的钱花在了哪里,以及结果是否值得对应成本。
让 AI 代选模型,并不是全新的做法
把模型分配工作交给系统,本身已有先例。
2023 年,HuggingGPT 就尝试让 ChatGPT 先拆解用户任务,再根据 Hugging Face 上的模型介绍挑选合适模型,由系统调用这些模型执行任务并汇总结果。
OpenAI 最近开放公测的 Decisions API,也为类似选择提供了工具。开发者给出任务信息和候选选项,由 GPT-6 Luna 返回判断,应用再根据判断执行下一步。在多模型助手里,这类机制可以用来辅助决定当前任务应交给哪个模型。
自动分配的价值,尤其体现在一项工作需要反复调用模型的时候。信息整理、复杂推理、最终润色,对模型能力的要求并不相同。系统如果能逐步判断,就有机会把更强、也更贵的模型放到真正需要它的环节。
已有研究显示成本收益,但不能直接等同于 Grok Bot 表现
这类路由方式在研究层面已有成本上的验证。
2024 年的 RouteLLM 研究显示,在 MT-Bench 评测中,系统通过在 GPT-4 和 Mixtral 之间分配请求,在达到约 95% 的 GPT-4 评测表现时,相比全部使用 GPT-4,可降低超过 85% 的成本。
不过,这项结果比较的是自动分配与固定使用 GPT-4 的差异,不能直接证明 AI 一定比人更会选模型,也不能直接等同于 Grok Bot 的实测成绩。Grok Bot 具体如何选择模型,目前仍需要更多公开信息才能判断。
「合适」取决于时间、成本和结果要求
对不同用户来说,「合适」并没有统一答案。
有人更在意速度,有人优先考虑成本,也有人愿意花更多时间和费用换取更好的结果。即便是同样的图片生成需求,一张临时配图和一组可直接发布的海报,对完成标准的要求也不一样。
因此,AI 助手不仅要调用模型,还得先弄清用户到底想要什么。否则,模型本身再强,也未必能交出用户真正需要的结果。对用户而言,自动选择是否真的省心,也不能只看生成过程,还要把检查、修改和返工所花的时间算进去。
Grok Bot 与 OpenAI Dots 指向同一类助手竞争
这场竞争中,OpenAI 也是参与者之一。9 月 29 日,OpenAI 发布全天候智能体 Dots,同样配有云电脑,可以连接应用,并在用户离开后继续推进工作。
Dots 与 Grok Bot 争夺的是同一个位置:成为用户愿意长期把任务交给它的 AI 助手。
但助手之间的竞争,不排除与模型层面的合作同时存在。按照文中的推演,如果未来 Grok Bot 接入 OpenAI 模型,用户可能把任务交给马斯克的助手,再由 OpenAI 的模型完成其中一部分工作。不过截至目前,这仍只是可能性。马斯克这次明确点名的是 Claude,尚未确认是否会接入 OpenAI 模型。
用户会把下一次任务交给谁,取决于连续体验
当不同助手都可能调用相近甚至相同的模型时,影响用户选择的关键,可能不只是谁接入了哪个模型,还包括谁更理解用户,谁能接着完成上一次没做完的工作。
如果一个助手已经知道用户的文案偏好、图片风格,也能找到此前的文件,下一次有任务时,用户更容易先想到它。反过来,切换到其他助手,往往意味着重新说明背景、重新连接工具,再重新磨合工作方式。
接入 Claude,确实为 Grok Bot 增加了可调用的模型能力。但这些能力最后能否转化为用户感受到的便利,还要看它能否在需求变化后继续修改、在任务中断后继续推进,以及交付的结果还需要用户投入多少额外精力收尾。
这些体验,会影响用户下一次把任务交给谁。

