Z.ai发布GLM-5.3:编码基准提升50%,网络安全测试84.5%
Z.ai 发布 GLM-5.3,新模型基于与 GLM-5.2 相同的基础模型,靠扩大后训练实现能力提升。官方称,其内部编码基准 Z.ai Code Bench 得分较 GLM-5.2 提升 50%,在 Terminal Bench 3、Agents' Last Exam 等公开基准中达到开放模型领先水平。网络安全方面,GLM-5.3 在 CyberGym 漏洞发现测试中取得 84.5% 的成绩,并大幅领先前代。

Z.ai 发布 GLM-5.3,新模型基于与 GLM-5.2 相同的基础模型,靠扩大后训练实现能力提升。官方称,其内部编码基准 Z.ai Code Bench 得分较 GLM-5.2 提升 50%,在 Terminal Bench 3、Agents' Last Exam 等公开基准中达到开放模型领先水平。网络安全方面,GLM-5.3 在 CyberGym 漏洞发现测试中取得 84.5% 的成绩,并大幅领先前代。

8 月 14 日,Z.ai 发布 GLM-5.3。新模型沿用 GLM-5.2 基础架构,通过扩大后训练提升能力,在内部编码基准 Z.ai Code Bench 上较前代提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准中达到开放模型领先水平。安全评测方面,CyberGym 漏洞发现成绩为 84.5%,利用链相关测试较前代明显改进。模型权重两周后开放,API 不再支持关闭思考模式,提供 low、high、max 三档推理强度。

Moonshot AI计划在2026年下半年向港交所提交IPO申请。消息称,公司估值已由2025年底的40亿美元升至200亿至300亿美元,最新一轮融资约20亿美元。7月17日,Moonshot AI发布2.8万亿参数开源编程模型Kimi K3,并计划拆除开曼群岛注册的VIE架构,改为合资模式以保留外资股东权益。

OpenAI 这次没有推出带“思考档位”的单一模型,而是将 GPT-5.6 拆分为 Sol、Terra 和 Luna 三个独立模型。Decrypt 的对比把焦点放在 Sol 与 Anthropic 当前最强公开模型 Claude Fable 5 身上:Sol 在多项编码基准、速度和成本上占优,Fable 5 在创意写作与单次生成浏览器游戏的主观测试中更出色。文章还指出,Fable 5 在 6 月被美国政府禁用、7 月 1 日恢复后,多次临时延长订阅访问期限,最新截止日期为 7 月 19 日。

本周AI行业迎来密集变局:微软或就OpenAI与AWS合作采取法律行动,英伟达披露至2027年芯片订单达1万亿美元,美国电网则因AI数据中心扩张承压。

本周AI行业多项重磅消息:微软考虑起诉OpenAI与AWS合作;英伟达GTC大会宣布订单总额突破1万亿美元;OpenAI、Mistral等发布新模型;AI数据中心导致美国居民电价飙升36%,比特币矿工加速转向AI。

本周AI行业动荡:微软因OpenAI与亚马逊云合作拟诉;英伟达GTC宣布万亿芯片订单;新模型发布;电网因数据中心承压;主权AI兴起。比特币矿工转投AI。

Anthropic推出Claude Opus 4.7,在编码和推理基准上大幅领先,但token消耗量惊人,单个会话即用尽配额,对依赖AI的加密项目开发成本构成压力。
