8 月 28 日消息,腾讯混元 Hy4 preview 这次除了把模型做大,底层架构也大改了一轮。据动察 Beating AI 快讯,上一代 Hy3 使用传统全注意力,Hy4 改成了 Gated DSA,也就是 DeepSeek Sparse Attention 的门控版本。模型面对超长文本时,不再把前面所有内容都重新算一遍,而是先挑出最相关的部分重点处理。
注意力与缓存:Gated DSA + 智谱 IndexCache
Hy4 还给 DSA 加上了智谱 IndexCache。模型每一层原本都要重新判断「哪些内容最重要」,现在部分层可以直接复用前面已经挑好的结果,少做很多重复计算。腾讯明确表示,这套设计受到 DeepSeek 和 GLM 启发。
残差与 MoE:iHC 与专家扩容
另一处变化是残差结构。传统 Transformer 可以粗略理解成只有一条信息主干,Hy4 用 iHC 把它扩成了 4 条,让模型在很深的网络里能同时保留更多信息。MoE 专家数量也从 Hy3 的 192 个增加到 256 个路由专家 + 1 个共享专家,每个 Token 选择 8 个路由专家,同时始终经过共享专家。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

