腾讯开源混元 Hy4 preview:770B 参数与 100 万上下文

腾讯开源混元 Hy4 preview:770B 参数与 100 万上下文

N
News Editor
2026-09-11 16:32:27
腾讯混元于 8 月 28 日发布并开源新一代大语言模型 Hy4 preview,模型总参数 770B、每个 token 激活 49B,上下文长度达到 100 万 token,权重以 Apache 2.0 许可证发布在 Hugging Face。模型采用 78 层混合专家架构,已上线腾讯云 Tokenhub 与 OpenRouter,并接入 WorkBuddy 和 CodeBuddy。腾讯披露的模型卡与内部盲测数据显示,Hy4 preview 在多项工程与基准测试中取得成绩,但相关数据尚未完成第三方独立验证。

腾讯混元于 8 月 28 日发布并开源新一代大型语言模型 Hy4 preview。该模型总参数为 770B,每个 token 激活 49B,上下文长度突破 100 万 token,模型权重以 Apache 2.0 许可证发布在 Hugging Face。

据新华网报道,腾讯将 Hy4 preview 定位为「为生产力而生」的模型,目标场景包括软件工程、办公分析、游戏开发和科学研究。这也是继智谱 GLM-5.3、DeepSeek V4 系列之后,中国大型科技公司再次开源前沿模型。

78 层混合专家架构

根据模型卡,Hy4 preview 采用混合专家(MoE)架构,共 78 层。第一层为稠密前馈网络,其余 77 层为 MoE 层。每层包含 256 个路由专家和 1 个共享专家,每个 token 会选择前 8 个路由专家参与计算。

模型内置多 token 预测层,用于支持推测解码,同时提供 FP8 量化版本以降低内存需求。部署示例使用 8 张 GPU 进行张量并行。腾讯也在模型卡中注明,Hy4 preview 仍是 Hy4 的早期版本,推理效率存在已知限制。

模型卡与内部盲测数据

模型卡列出的成绩包括:GPQA Diamond 92.3、SWE-bench Multilingual 82.9、SWE-bench Pro 65.7、Terminal-Bench 2.1 为 85.4。

新华网还引述腾讯内部评测结果称,163 名内部专家围绕 203 个工程任务进行了盲测,Hy4 preview 平均得分为 2.99 分,满分 4 分,略高于 GLM 5.3 的 2.92 分,以及 Kimi K3 的 2.94 分。

上述成绩均由腾讯自行公布,第三方独立验证尚未完成。

参与自身优化,推理吞吐提升 31.8%

报道提到,Hy4 preview 还参与了自身优化,涉及训练方法、数据策略、评测体系和推理基础设施。其中,推理端到端吞吐量提升 31.8%。

链新闻此前报道称,智谱在 8 月底推出可在国产芯片上运行的 GLM-5.3-Flash,DeepSeek 则在 9 月 10 日开源 V4.1-Flash,三家公司在两周内连续更新模型。

API 定价与接入渠道

据新华网报道,Hy4 preview 的 API 定价为输入每百万 token 6 元人民币、输出 18 元、缓存命中 0.3 元。模型目前已在腾讯云 Tokenhub 和 OpenRouter 提供,并已整合进腾讯自家的 WorkBuddy 与 CodeBuddy。

按 9 月 11 日汇率换算,输入价格约为 0.83 美元,输出价格约为 2.5 美元。报道称,这一定价介于 DeepSeek V4.1-Flash 的离峰价格与美国闭源模型之间。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。