腾讯混元Hy4重做底层:DeepSeek稀疏注意力配智谱IndexCache

腾讯混元Hy4重做底层:DeepSeek稀疏注意力配智谱IndexCache

N
News Editor
2026-08-28 07:32:42
腾讯混元 Hy4 preview 将底层架构从 Hy3 的全注意力改为 Gated DSA(DeepSeek 稀疏注意力的门控版),并叠加智谱 IndexCache,减少超长文本下的重复计算。腾讯称设计受 DeepSeek 和 GLM 启发。残差结构用 iHC 扩成 4 条信息主干,MoE 专家从 192 个增至 256 个路由专家+1 个共享专家,每 Token 选 8 个路由专家。

8 月 28 日消息,腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。据动察 Beating AI 快讯,上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。

注意力与缓存:Gated DSA + 智谱 IndexCache

Hy4 还给 DSA 加上了智谱 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。

残差与 MoE:iHC 与专家扩容

另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。