腾讯混元极限量化Hy4 preview:1.5TB压至214GB,异构推理提速6倍

腾讯混元极限量化Hy4 preview:1.5TB压至214GB,异构推理提速6倍

N
News Editor
2026-09-01 04:22:52
腾讯混元对刚开源的Hy4 preview模型实施极限量化,原始1.5TB权重压缩至约214GB。通过分层量化策略,平均仅2.38 bpw,评测分数下降0.2-1.6分。同时与prima.cpp测试异构设备联合推理,RTX 4090笔记本加四卡A4000服务器以80GB显存+64GB内存跑出1.02 token/s,比单机快6倍。

腾讯混元团队近日发布了Hy4 preview模型的极限量化版本。原始模型权重约1.5TB,而新推出的GGUF格式量化版仅约214GB,大幅降低了这款770B MoE模型的本地部署门槛。

分层量化策略

该量化版本并非简单地将整个模型压缩至1.25-bit。腾讯根据模型不同层对精度的敏感程度分别处理:耐受度高的部分最低压至约1.31-bit,敏感部分保留2-bit甚至更高精度,最终整个文件平均约2.38 bpw。在腾讯给出的四项评测中,相比BF16原版性能下降仅为0.2到1.6分,损失极小。

异构设备联合推理

压缩后,腾讯还与prima.cpp合作测试了异构设备联合推理方案。一台配备RTX 4090的笔记本加一台四卡A4000服务器,总显存80GB、内存64GB,成功将模型运行至1.02 token/s,速度比笔记本单机offload快约6倍。这意味着不同配置的设备可以协同分担模型推理任务,进一步降低本地部署成本。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。