腾讯近日低调发布了旗下新一代大模型混元Hy3预览版,并同步在 GitHub、Hugging Face 与 ModelScope 开源。作为腾讯完成基础设施重构后的首个模型,Hy3不仅延续了混元系列在中文场景中的竞争力,还试图用更低的推理成本和更强的Agent能力,在日益拥挤的大模型赛道中重新定义效率与性能的平衡点。
从架构上看,Hy3采用Mixture-of-Experts(MoE,混合专家)设计,总参数规模达到2950亿,但单次推理仅激活210亿参数。这意味着模型不必在每次请求中调动全部计算资源,而是根据任务将请求路由到对应的“专家”子网络,从而在维持输出质量的同时降低推理成本。腾讯给出的配置还显示,Hy3支持最高256,000 tokens上下文窗口,足以处理超长文档、复杂代码仓库说明或多轮Agent任务。
代码与Agent能力显著跃升
Hy3最引人关注的进步来自编码与自主任务执行能力。在SWE-bench Verified这一面向真实 GitHub Bug 修复任务的基准测试中,Hy3预览版得分达到74.4%,相比上一代Hy2的53.0%实现大幅跃升,增幅约40%。这一成绩已接近Claude Opus 4.6的80.8%,并高于文中提到的GLM-5和Kimi-K2.5相关分数。
在Terminal-Bench 2.0测试中,Hy3从Hy2的23.2%提升至54.4%。该测试强调模型在真实命令行环境中的自主执行能力,能够更贴近Agent系统在开发、运维和自动化流程中的实际表现。对于正在构建AI Agent产品的开发者而言,这类能力提升比传统问答分数更具商业价值,因为复杂工作流往往依赖模型持续调用工具、处理记忆并遵循长链条指令。
腾讯还提到,Hy3已经上线Openclaw,这进一步表明其目标用户不仅是通用聊天场景,也包括Agent开发者和工作流自动化平台。
搜索、推理与真实考试评测表现提升
在搜索与浏览型Agent任务中,Hy3同样表现出明显进步。BrowseComp测试成绩达到67.1%,高于Hy2的28.7%;WideSearch测试中则取得70.2%。这些指标反映模型在开放网络环境中执行信息检索、筛选与整合任务的能力,对于搜索增强生成、研究助手、企业知识管理等应用方向具有现实意义。
推理方面,Hy3在清华大学2026年春季数学博士资格考试评测中,三次平均成绩达到88.4,腾讯称其在中国模型中位居前列。与此同时,该模型在CHSBO 2025中国高中生物学奥林匹克相关评测中获得87.8。与只依赖标准化数据集不同,这类真实考试型评测更能体现模型在高难度知识迁移和复杂问题求解上的稳定性,也契合当前行业对于“防止刷榜”的关注。
参数更少,不代表性能更弱
值得注意的是,腾讯在Hy3上主动收缩了参数规模。上一代旗舰Hy2参数规模超过4000亿,而Hy3降至2950亿。腾讯的判断是,当模型推理能力发展到一定阶段后,继续堆叠参数带来的收益会逐渐递减,而训练质量、架构设计和强化学习流程反而更重要。这个思路与近一年行业从“盲目拼参数”转向“追求高性价比”的趋势基本一致。
根据报道,Hy3于2026年1月底开始训练,并在不到三个月内完成从冷启动到开源发布。腾讯将这一速度归因于今年2月进行的基础设施重构,包括预训练和强化学习技术栈的全面升级。这说明,当前大模型竞争已不只是模型本身的竞争,更是底层算力调度、训练框架和工程效率的系统性竞争。
已接入腾讯生态,API价格主打低门槛
商业化落地方面,Hy3已部署至腾讯多个产品与服务中,包括Yuanbao、CodeBuddy、WorkBuddy、QQ和腾讯文档。腾讯披露,在CodeBuddy和WorkBuddy场景中,模型的首Token延迟下降54%,端到端生成时间缩短47%,并成功运行最长达495步的Agent工作流。
同时,腾讯云已提供Hy3 API服务,价格约为每百万输入Token0.18美元、每百万输出Token0.59美元,个人Token套餐起步价约4.10美元/月。从定价看,腾讯显然希望借助成本优势吸引开发者与企业客户,尤其是在智能客服、文档处理、代码辅助和企业Agent场景中扩大使用规模。
市场影响:AI基础设施竞争或外溢至加密与算力板块
虽然这则消息本身聚焦人工智能,但其市场影响并不限于AI软件层。首先,Hy3强化了中国科技巨头在高性能开源模型上的竞争态势,可能进一步推动云计算、推理服务和企业级Agent平台的价格战。其次,低成本高性能模型的出现,有望加速AI应用普及,从而带动对GPU、数据中心和云资源调度平台的持续需求。
对于加密市场观察者而言,AI模型效率提升也可能间接影响去中心化算力、AI代理协议和数据基础设施叙事。过去一段时间,部分加密项目一直试图将AI推理、Agent协作和去中心化资源市场结合。若主流科技公司不断压低中心化模型服务成本,相关加密赛道项目将面临更激烈的性价比考验;但另一方面,随着Agent应用爆发,链上身份、支付结算和可验证执行等方向也可能获得新的叙事空间。
整体来看,Hy3并未宣称全面超越OpenAI或Google DeepMind的旗舰模型,但在参数规模、性能表现与成本控制三者之间,腾讯给出了一个更具工程实用性的答案。对于开发者和企业用户来说,这类“足够强、足够便宜、接入方便”的模型,往往比单纯追逐榜单第一更具吸引力。Hy3能否真正改写中国大模型竞争格局,接下来还要看其开源生态、开发者采用率以及在真实商业场景中的持续表现。

