马斯克在 X 上给出一张时间表:中国大模型可能在 2027 年第一季度追上 Anthropic 的 Fable 水平。这条回应很快引来智谱 AI 创始人唐杰表态,他直接回了一句:“用不了那么久。”
这场讨论源于外界对中美大模型差距的追问。马斯克先是给出 2027 年第一季度这个节点,随后又补充��若只看基准测试,时间判断大致如此;但若按“真正的实用性”衡量,即便到那时仍会是很令人印象深刻的进展。话锋一转,讨论焦点也从跑分转到落地能力。
马斯克把比较标准从跑分拉到收入
马斯克随后强调,Anthropic 正在把重点放在“实用智慧”的最大化上。在他看来,这种能力未必会完整体现在 benchmark 的分数里,却会直接反映在收入表现中。也就是说,模型在榜单上领先,并不自动等于商业化层面的胜出;能否让用户持续付费使用,是另一套更硬的标准。
他的这番说法,也让这场交锋不只是时间预测,而是牵出一条更具体的分界线:一边是基准测试上的追赶速度,另一边是实际产品能力与变现效率。两者不一定同步。
Claude Fable 5 与 GLM-5.2 成为讨论背景
引发这轮讨论的背景,是中美两侧近期都有新模型发布。Anthropic 于 6 月 9 日公开 Claude Fable 5。按原文介绍,这属于该公司最前沿的 Mythos 级系列,几乎在各项 AI 基准测试中领先;在衡量真实工程能力的 SWE-bench Pro 上突破 80%,成为当前被频繁对标的模型之一。
中国这边,智谱在 6 月 17 日发布旗舰模型 GLM-5.2,主打100 万 token 无损长上下文、强化编程能力,并支持国产算力平台 Day0 上线。唐杰在马斯克评论下回应“用不了那么久”,也被外界视为对智谱当前进展的直接表态。
从这次隔空交锋看,双方并没有围绕同一个单一指标展开争论。马斯克给出的是一个偏向 benchmark 的追赶时间判断,同时强调实用性才会落到收入上;唐杰则用更短的一句话,表达了对中国模型提速的信心。讨论还在继续,比较标准已经先变了。

