中国 AI 实验室 Z.ai 于周四发布 GLM-5.3。这是一款面向编程场景的大模型,Z.ai 在发布文章中将其称为市场上最强的开源权重编程模型。

目前,GLM-5.3 已通过 GLM Coding Plan 订阅方案和 ZCode 提供服务。API 接入以及可下载模型权重尚未立即开放,Z.ai 表示,这两部分会在完成安全审查后分阶段推出。
Z.ai 在发布文章中写道:「我们对 GLM-5.3 所做的,全部都是扩大后训练规模。借助 GLM-5.2,我们搭建了整套技术栈……在过去一个月里,我们持续在这套技术栈上扩展:更多环境、更多样的任务,以及投入更多算力进行训练。」
参数规模扩大,重点放在 token 效率
这次迭代的重点并不只是追求绝对性能。报道显示,Z.ai 团队把更多精力放在 token 效率上,而不是单纯冲击更高分数。GLM-5.3 的参数规模为 7430 亿,相比前代在单个任务上的 token 消耗明显下降。
文中同时解释,参数可以理解为模型在处理信息时使用的调节单元,而 token 是模型可消耗或生成的信息基本单位。
按照 Z.ai 披露的数据,在其自研基准 Z.ai Code Bench 的 Max effort 模式下,GLM-5.3 得分为 34.5%,单任务大约消耗 75000 个输出 token;作为对比,GLM-5.2 的成绩为 23.4%,输出 token 消耗为 96000。
对比闭源模型时,Z.ai 在博客中称,GLM-5.3 在 token 经济性上优于 Claude Opus 4.8,但「仍落后于 Claude Fable 5,后者在 Max effort 模式下达到 39.5%。」
编程基准表现:强于前代和部分开源对手,头部榜单仍落后闭源模型
在编程能力上,文中称 GLM-5.3 表现很强,并在最相关的基准测试中超过了另一款中国模型 Kimi K3。
在 Terminal Bench 3.0 上,这项测试用于评估模型在真实 Linux 环境中的自主 shell 与工具使用能力,GLM-5.3 得分为 28.3,略低于闭源模型 Fable 5 的 33.7 和 GPT-5.6 Sol 的 34.6。
在 DeepSWE v1.1 上,这项基准用于评估端到端修复真实 GitHub 问题的能力,开源竞争对手 Kimi K3 取得 67.5,Fable 5 为 69.7,均高于 GLM-5.3 的 66.9。

报道将整体格局概括为:GLM-5.3 超过了自己的前代版本,也超过了一些开源竞争者,但在最受关注的编程榜单上,美国闭源模型仍然领先。
网络安全基准提升明显
网络安全测试是另一个提升更明显的方向。报道称,GLM-5.3 在 CyberGym 上以 84.5% 领先,并且在漏洞利用相关基准上,相比 GLM-5.2 的成绩提升超过一倍。
Z.ai 表示,GLM-5.3 在 269 个开源项目中标记出 2436 个漏洞,其中 1097 个属于中等到高严重级别。
Z.ai 还在 X 平台发文称:「GLM-5.3 将代理式编程提升到新阶段,在显著优于 GLM-5.2 的同时,以更少的输出 token 取得了更好的结果。GLM-5.3 现已通过 GLM Coding Plan 和 ZCode 提供。API 接入与开放权重将在严格安全评估后分阶段发布。」
价格与开放权重仍是主要卖点
在定价层面,报道认为,Z.ai 与美国前沿模型之间的差异,主要体现在开源权重和更低价格。Z.ai 的 GLM Coding Plan 采用积分配额机制,离峰时段调用成本减半;智谱 API 的定价大约是美国前沿模型每 token 费率的十分之一。
文中给出的参考价格是,GLM-5.2 官方费率为每百万 token 输入 1.40 美元、输出 4.40 美元。作为对比,GPT-5.3-Codex 的价格为 1.75 美元 / 14 美元,Claude Opus 4.8 也处于 Anthropic 定价梯队的高位。
公开权重尚未上线,预计约两周后发布
Z.ai 是一家位于北京的实验室,被列入美国实体清单,这意味着美国企业不能向其出口受控技术。尽管如此,报道指出,GLM 仍然是非常受欢迎的模型,中国开源权重模型在 OpenRouter token 使用量上已经超过美国模型。
根据发布文章,GLM-5.3 的模型权重预计将在大约两周后公开发布。因此,这次所说的「开源权重」指向的是即将到来的公开版本,而不是今天就可以下载的文件。

