返回编码基准

编码基准

Z.ai
2026-08-14 05:52:45

Z.ai发布GLM-5.3:编码基准提升50%,网络安全测试84.5%

Z.ai 发布 GLM-5.3,新模型基于与 GLM-5.2 相同的基础模型,靠扩大后训练实现能力提升。官方称,其内部编码基准 Z.ai Code Bench 得分较 GLM-5.2 提升 50%,在 Terminal Bench 3、Agents' Last Exam 等公开基准中达到开放模型领先水平。网络安全方面,GLM-5.3 在 CyberGym 漏洞发现测试中取得 84.5% 的成绩,并大幅领先前代。

220
Z.ai发布GLM-5.3:编码基准提升50%,网络安全测试84.5%
智谱
2026-08-14 06:02:48

智谱发布GLM-5.3:编码能力提升50%,权重两周后开放

8 月 14 日,Z.ai 发布 GLM-5.3。新模型沿用 GLM-5.2 基础架构,通过扩大后训练提升能力,在内部编码基准 Z.ai Code Bench 上较前代提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准中达到开放模型领先水平。安全评测方面,CyberGym 漏洞发现成绩为 84.5%,利用链相关测试较前代明显改进。模型权重两周后开放,API 不再支持关闭思考模式,提供 low、high、max 三档推理强度。

250
智谱发布GLM-5.3:编码能力提升50%,权重两周后开放
Moonshot AI
2026-07-19 15:50:28

Moonshot AI拟于2026年下半年赴港递交IPO申请

Moonshot AI计划在2026年下半年向港交所提交IPO申请。消息称,公司估值已由2025年底的40亿美元升至200亿至300亿美元,最新一轮融资约20亿美元。7月17日,Moonshot AI发布2.8万亿参数开源编程模型Kimi K3,并计划拆除开曼群岛注册的VIE架构,改为合资模式以保留外资股东权益。

240
Moonshot AI拟于2026年下半年赴港递交IPO申请
OpenAI
2026-07-18 15:21:03

GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负

OpenAI 这次没有推出带“思考档位”的单一模型,而是将 GPT-5.6 拆分为 Sol、Terra 和 Luna 三个独立模型。Decrypt 的对比把焦点放在 Sol 与 Anthropic 当前最强公开模型 Claude Fable 5 身上:Sol 在多项编码基准、速度和成本上占优,Fable 5 在创意写作与单次生成浏览器游戏的主观测试中更出色。文章还指出,Fable 5 在 6 月被美国政府禁用、7 月 1 日恢复后,多次临时延长订阅访问期限,最新截止日期为 7 月 19 日。

790
GPT-5.6 三模型对决 Fable 5:价格、基准与实测分出不同胜负