腾讯混元团队近日发布了Hy4 preview模型的极限量化版本。原始模型权重约1.5TB,而新推出的GGUF格式量化版仅约214GB,大幅降低了这款770B MoE模型的本地部署门槛。
分层量化策略
该量化版本并非简单地将整个模型压缩至1.25-bit。腾讯根据模型不同层对精度的敏感程度分别处理:耐受度高的部分最低压至约1.31-bit,敏感部分保留2-bit甚至更高精度,最终整个文件平均约2.38 bpw。在腾讯给出的四项评测中,相比BF16原版性能下降仅为0.2到1.6分,损失极小。
异构设备联合推理
压缩后,腾讯还与prima.cpp合作测试了异构设备联合推理方案。一台配备RTX 4090的笔记本加一台四卡A4000服务器,总显存80GB、内存64GB,成功将模型运行至1.02 token/s,速度比笔记本单机offload快约6倍。这意味着不同配置的设备可以协同分担模型推理任务,进一步降低本地部署成本。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

