腾讯近日低调发布并开源新一代大模型混元Hy3 Preview,但其公开的性能数据迅速引发市场关注。作为腾讯在完成基础设施重构后的首个模型,Hy3 Preview已同步登陆GitHub、Hugging Face和ModelScope,并在腾讯云提供付费API服务。从参数规模、推理效率到应用落地,这款模型都显示出腾讯试图重新定义“大模型性价比”的战略意图。
以MoE架构降低成本,2950亿参数仅激活210亿
Hy3 Preview采用Mixture-of-Experts(专家混合)架构,总参数量达到2950亿,但单次推理仅激活210亿参数。这种设计意味着模型无需在每次任务中调用全部参数,而是将请求分配给更适合的“专家子网络”,从而在维持输出质量的同时显著降低计算消耗。
腾讯给出的思路非常明确:不再单纯追求参数规模,而是寻求能力广度、评测真实性和成本效率之间的平衡。其上一代旗舰Hy2参数规模超过4000亿,而Hy3则回调至2950亿参数。腾讯认为,这一规模已接近推理能力成熟的“甜蜜点”,继续堆叠参数带来的边际收益正在下降。
此外,Hy3 Preview支持最高256,000 tokens上下文窗口,足以一次性处理超长文本,这对长文档分析、多轮Agent任务和复杂代码仓库理解等场景尤为关键。
代码与Agent能力大幅跃升
从已披露的基准测试看,Hy3 Preview最突出的提升集中在代码修复与智能体任务执行能力。其在SWE-bench Verified上的成绩从Hy2的53.0%提升至74.4%,增幅约40%。该测试并非简单编程题,而是要求模型修复真实GitHub仓库中的生产级Bug,因此被视为衡量代码Agent能力的重要指标。
在Terminal-Bench 2.0中,Hy3 Preview成绩从23.2%升至54.4%,显示其在真实命令行环境中的自主任务执行能力显著增强。对于当前AI行业高度关注的Agent应用来说,这类能力十分关键,因为智能体通常需要同时处理记忆、工具调用、步骤编排与错误恢复,一旦遗漏环节,整个工作流可能失效。
腾讯还披露,Hy3 Preview已经接入Openclaw,这也表明其希望尽快进入Agent开发者生态,争夺新一轮智能体平台化竞争的入口。
搜索、推理与真实场景评估表现亮眼
除代码能力外,Hy3 Preview在网页搜索与信息整合任务中的表现也有明显改善。在BrowseComp测试中,其得分达到67.1%,较Hy2的28.7%大幅提升;在WideSearch中则取得70.2%。根据原始材料,这一成绩超过GLM-5和Kimi-K2.5,但仍落后于Claude Opus 4.6的77.2%。
在推理层面,Hy3 Preview在清华大学2026年春季数学博士资格考试评测中,以三次运行平均88.4分位列中国竞品前列;在CHSBO 2025中国高中生物学奥赛相关测试中,得分为87.8,同样是中国模型中的领先成绩。腾讯强调,真实考试类评估比经过精心筛选的数据集更能反映模型实际能力,也有助于避免“刷榜式优化”。
三个月从训练到开源,腾讯加快AI基础设施节奏
值得注意的是,Hy3 Preview从2026年1月底启动训练,到本次发布开源,用时不到3个月。对于前沿级大模型而言,这一节奏相当罕见。腾讯将速度提升归因于2月完成的一次基础设施升级,该升级由其首席AI科学家姚顺雨主导,涉及预训练与强化学习栈的全面重建。
这一变化也反映出中国大模型竞争逻辑正在调整。过去市场更多围绕“更大参数、更高融资、更强算力”展开竞争,而在DeepSeek以高性价比路径震动行业后,越来越多厂商开始转向效率导向。Hy3 Preview正是这一趋势下的代表产品:不是绝对参数最大,却在规模、性能和部署成本之间寻求最优解。
已落地QQ、腾讯文档,API价格具备竞争力
腾讯表示,混元系列模型已部署至元宝、CodeBuddy、WorkBuddy、QQ、腾讯文档等产品。以CodeBuddy和WorkBuddy为例,接入后首Token延迟下降54%,端到端生成时间减少47%,并成功运行长达495步的Agent工作流。这意味着Hy3并非只停留在实验室指标上,而是已经进入高频真实业务场景。
商业化层面,腾讯云提供的API价格约为每百万输入tokens0.18美元、每百万输出tokens0.59美元,个人Token套餐起步价约4.10美元/月。在当前企业愈发关注模型调用成本的背景下,这一定价有望增强其在开发者和中小企业中的吸引力。
市场影响:腾讯或强化中国AI开源与云服务竞争
从市场影响看,Hy3 Preview的意义不仅在于一次模型更新,更在于腾讯重新加入中国大模型主流竞争的信号。首先,开源策略有助于其扩大开发者触达面,提升生态渗透率;其次,较低的推理成本和较快的落地节奏,有望推动腾讯云在AI API市场获得更多增量客户;再次,QQ、腾讯文档等超级应用的内部部署,为模型能力验证和后续商业化提供了天然场景。
当然,腾讯也明确承认,Hy3 Preview整体仍落后于OpenAI和Google DeepMind的旗舰模型。但若从参数规模与性能比观察,Hy3已经展示出较强竞争力。对于AI基础设施、云计算、企业服务以及Agent应用赛道而言,这类高效率模型的出现,可能进一步压缩“单纯拼规模”的叙事空间,并促使行业竞争焦点转向真实任务完成率、推理成本与应用转化效率。
整体来看,Hy3 Preview并非一款仅靠参数吸睛的产品,而更像是腾讯在AI竞赛中重新校准方向后的阶段性答卷。它能否持续缩小与全球顶级模型的差距,接下来仍要看实际开发者采用情况、企业客户反馈以及后续版本迭代速度,但至少在当前,中国大模型市场又多了一个不能忽视的强力选手。

