智谱 AI 创始人唐杰:参数规模不再单独决定模型强弱

智谱 AI 创始人唐杰:参数规模不再单独决定模型强弱

N
News Editor
2026-08-19 07:28:20
智谱 AI 创始人、清华大学教授唐杰表示,单独讨论大模型参数量已越来越难判断模型能力。回顾从 GPT-3、Chinchilla 到 MoE 的 Scaling Law 演变后,他提出模型能力还取决于训练数据、训练与推理阶段的算力分配,以及后训练与单次推理的有效深度。智谱最新的 GLM-5.3 被他视为一次控制实验:在不增加参数的前提下,集中扩展长程任务训练与强化学习。

每当一家 AI 公司发布新模型,市场最常追问的问题之一,仍然是「它有多少参数?」但清华大学教授、智谱 AI(Z.ai)创始人唐杰认为,只看参数规模,这个问题本身已经越来越难说明模型到底有多强。

在他看来,从 GPT-3、Chinchilla 到混合专家模型(MoE)的发展过程已经表明,决定模型能力的并不只有参数量,还包括训练数据规模、算力投入在哪个阶段,以及模型最终由谁在什么条件下使用。随着 AI 从「训练一次、测试一次」走向每天数十亿次推理,Scaling Law 的最优解也在持续变化。

唐杰认为,当模型参数达到足以「容纳世界知识」的门槛后,继续堆高总参数,未必还是提升能力的最好办法。下一阶段更值得扩展的方向,可能是单次推理的有效深度(effective depth)以及后训练(post-training)。他说,智谱最新的 GLM-5.3,正是围绕这一假设做出的控制实验。

从 GPT-3 到 Chinchilla,行业曾走过一段「兆参数弯路」

唐杰先回顾了 Scaling Law 的演变。2020 年,OpenAI 研究团队 Kaplan 等人发表《Scaling Laws for Neural Language Models》后,业内一度将其理解为:随着算力增加,模型参数应比训练数据增长得更快,两者扩展速度大约为 2.7:1。

这套结论深刻影响了当时的大模型路线。GPT-3、DeepMind Gopher、微软 MT-NLG 等模型都朝更大的参数规模推进,「模型越大越好」也逐渐成为主流思路。

不过,这种认知在 2022 年被 DeepMind 的 Chinchilla 论文明显修正。Hoffmann 等研究人员基于约 400 个模型重新实验后提出,如果目标是在固定训练算力下取得最佳效果,模型参数与训练数据应该更均衡地同步增长。经典经验值约为每个参数对应 20 个训练 token。

按这个结论看,当年的很多大型模型不一定是参数还不够多,反而可能是模型做得过大、数据投入不足。唐杰指出,Kaplan Scaling Law 的估计误差会随着算力规模放大,因此那个阶段规模最大的模型,反而可能也是资源配置偏离最优点最严重的模型。他将那场兆参数竞赛形容为整个领域一起走过、最后又一起折返的一条弯路。

Chinchilla 解决的是训练最优,不是全生命周期最优

在唐杰看来,Chinchilla 主要解决的仍然是训练算力如何最优化的问题。它的基本假设更接近模型训练完成后再进行评估,但如今的商用 AI 模型,可能每天会被调用数十亿次。

一旦把模型部署后的推理成本(inference cost)也纳入整个生命周期的优化目标,最优配置就会再次变化。唐杰说,若把推理成本一起计算,合理策略反而可能变成把模型做得更小,但训练得更久,也就是有意进行「过度训练」(Over-training)。

他举例称,Meta 的 Llama-2-7B 与 Google 的 Gemma-2-9B,训练量分别达到约 290 tokens per parameter(TPP)和 889 TPP,显著高于 Chinchilla 经典的 20 TPP。这不只是单纯多花训练算力,而是在模型会被大量部署、反复推理的前提下,提前投入更多训练成本,以换取更小、推理更便宜的模型。

MoE 普及后,「多少参数」变得更难回答

混合专家模型普及后,单纯用「模型有多少参数」来衡量能力,变得更加困难。唐杰认为,至少需要把两个概念分开看。

  • 总参数量(Total Parameters)大致决定模型能装下多少内容,包括知识、事实和大量长尾信息。
  • 启动参数量(Activated Parameters)与有效深度(Effective Depth),更接近模型单次推理时到底能进行多复杂的计算,以及能否维持更长的因果推理链。

在这种情况下,把 Dense Model 的「20 tokens per parameter」直接套用到 MoE 模型,本身就可能存在问题。

唐杰还引用 Roberts 等人在 2025 年的研究称,最优的 tokens-per-parameter 并不是固定常数,而是与任务类型有关:记忆型任务更偏向增加参数,推理型任务则更受益于增加数据。后续 MoE 研究甚至观察到,在固定 TPP 条件下,一味提高模型总参数,反而可能让推理能力下降;相比之下,提高实际参与计算的 Experts 数量,改善推理表现的效果更稳定。

这也意味着,「这个模型有几兆参数」越来越难单独回答一款 AI 模型究竟有多强。

漏洞发现不是记住更多资料,而是完成长推理链

为说明「知道很多」与「推理很深」的差别,唐杰特别举了安全漏洞的例子。他说,如果模型要发现一个新的软件漏洞,关键能力并不是背下更多 CVE 漏洞资料,而是能否沿着一条可能长达 20 个步骤的推理链一路推演到最后,并在过程中持续维持正确的上下文与因果关系。

换句话说,模型能记住多少世界知识,与模型能把一个问题想多深,可能对应的是两种不同的 Scaling 问题。

唐杰认为,总参数量可能只在某个门槛之前格外重要,模型首先必须「大到足以容纳世界」;跨过这个门槛后,新增能力可能更多来自其他扩展维度,包括单次 forward pass 的有效深度,以及后训练。

GLM-5.3 作为控制实验:不加参数,只扩展后训练

唐杰表示,GLM-5.3 可以看作智谱围绕这套 Scaling 假设做的一次控制实验。GLM-5.3 与 GLM-5.2 使用相同的 Base Model、相同架构,并维持相同的总参数与启动参数。

这次团队没有继续扩大模型规模,而是投入一个月时间,扩展 Long-horizon Environments 和强化学习(RL)。也就是说,这次实验刻意控制住模型大小,只调整「Post-training Scaling」这一个变量。

按唐杰的说法,最终带来的能力提升并不是边际改进,而是相当显著。基于这项结果,他得出的结论是,Scaling 并没有失效,真正需要重新理解的是,AI 行业究竟在扩展什么。

不过,他并不认为这意味着模型参数已经不重要,也没有宣布 Pre-training Scaling 已经走到尽头。相反,他表示,包括 Base Model Size、Pre-training Data,以及每次 Forward Pass 投入的 Compute,未来仍然存在扩展空间,智谱也计划重新回到这些方向。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
30

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。