Terminal-Bench 4.0发布:GLM-5.3升至第三,反超GPT-5.6 Sol
Terminal-Bench 发布 4.0,重新校准 Agent 执行任务的时间、CPU 与内存,并调整任务集。最新榜单中,GLM-5.3 + Claude Code 以 41.8% 升至第三,超过 GPT-5.6 Sol + Codex 的 37.3%,成为前三名中唯一的非 Anthropic 模型。相比 3.0 的第四名,GLM-5.3 反超 Sol 4.5 个百分点。

Terminal-Bench 发布 4.0,重新校准 Agent 执行任务的时间、CPU 与内存,并调整任务集。最新榜单中,GLM-5.3 + Claude Code 以 41.8% 升至第三,超过 GPT-5.6 Sol + Codex 的 37.3%,成为前三名中唯一的非 Anthropic 模型。相比 3.0 的第四名,GLM-5.3 反超 Sol 4.5 个百分点。

B.AI 平台昨日宣布,其免费模型阵容已全面就绪,覆盖 GLM-5.3-Flash、DeepSeek-V4-Flash、DeepSeek-V4-Flash-Vision-Exp、Hy3、MiMo-V2.5 和 Qwen3.8-Flash。平台称,上述模型均已向用户零门槛免费开放,适用于纯文本、多模态、代码生成和 Agent 调度等场景。

腾讯混元 Hy4 preview 将底层架构从 Hy3 的全注意力改为 Gated DSA(DeepSeek 稀疏注意力的门控版),并叠加智谱 IndexCache,减少超长文本下的重复计算。腾讯称设计受 DeepSeek 和 GLM 启发。残差结构用 iHC 扩成 4 条信息主干,MoE 专家从 192 个增至 256 个路由专家+1 个共享专家,每 Token 选 8 个路由专家。

据证券时报消息,8月27日,商汤方面表示,商汤大装置已为智谱近日上线并开源的 GLM-5.3-Flash 提供国产算力支持与 Token 服务。相关表述称,这被认为是国产算力规模化商用的又一个标杆。商汤还透露,其大装置 7 月日均 Token 服务量已达 2.42 万亿,预计到 2026 年年底突破日均 10 万亿。

腾讯公布Hy4 preview真实工程盲测:163名内部专家在203个任务中给出2.99/4均分,高于GLM-5.3的2.92/4与Kimi K3的2.94/4。价格方面,每百万Token输出18元,比GLM-5.3便宜约36%、比Kimi K3便宜82%,缓存命中价也低85%。

TechFlow 当日信息汇总显示,AI 与硬件赛道消息密集。英伟达 Q2 营收 962 亿美元,同比增长 106%,并传出约 130 亿美元收购 Hugging Face;阿里 Qwen3.8-Flash 与 GLM 5.3 Flash 则分别在训练成本和国产芯片集群部署上给出新进展。加密市场方面,Glassnode 提到比特币在 83,000 美元上方正接受真实需求检验,Polymarket 新增霍尔木兹海峡军舰相关押注。与此同时,苹果首款折叠 iPhone 被指将于 9 月 10 日发布。

美国7月PCE高于预期,市场对9月和12月加息的押注升温,美债收益率与美元同步走高,黄金与原油承压。与此同时,黑海港口遇袭、化肥供应受阻和极端天气,正把粮食与食品价格重新推回通胀主线。盘后英伟达交出超预期财报并给出2028财年约70%的营收增长指引,带动AI板块回暖,软件、存储、光通信与网络安全股跟随走强。

智谱表示,旗舰模型 GLM-5.3 将于北京时间 8 月 28 日上午 10 点开源并开放权重下载。该模型已于 8 月 14 日上线 Coding Plan,随后开放 API。智谱称,因后训练阶段网络安全能力增长「超出预期」,官方先进行了安全评估和加固。评测显示,GLM-5.3 在 CyberGym 得分 84.5%,在 ExploitBench 上较 GLM-5.2 从 24.4% 升至 54.4%。
