DeepSeek V4 规格疑泄露:1.6万亿参数、百万上下文,仅支持纯文本

DeepSeek V4 规格疑泄露:1.6万亿参数、百万上下文,仅支持纯文本

N
News Editor 01
2026-07-22 15:05:13
普林斯顿研究员 Yifan Zhang 在 X 披露疑似 DeepSeek V4 规格:旗舰版 1.6 万亿参数、支持 100 万 Token 上下文,并推出 2850 亿参数 Lite 版,但爆料称新模型仅支持纯文本。
DeepSeek大模型人工智能AI模型多模态

DeepSeek 下一代旗舰模型 V4 的技术规格疑似提前流出。普林斯顿大学 AI 实验室研究员 Yifan Zhang 7 月 22 日在 X 发布一份详细配置表,外界普遍将其视为 DeepSeek 即将推出的 V4 内部信息。按爆料内容,旗舰版总参数达到 1.6T,同时还会推出一个 285B 的轻量版本 V4-Lite;更受关注的是,模型在强化学习阶段处理后,最长上下文可达 1M Token

V4 家族被指新增 Lite 版本

素材显示,Yifan Zhang 目前并未在 DeepSeek 任职,但曾在字节跳动 Seed 团队工作。他在 7 月 19 日曾发文预告“V4, next week.”,这也让 22 日公开的技术清单迅速引发讨论。按照这份爆料,V4 家族将包含两名成员:一是 1.6 万亿参数的旗舰版 V4,二是参数规模为 2850 亿的 V4-Lite。

在架构设计上,V4 被指采用 MoE(混合专家)方案,共配置 384 个 experts,每次激活 6 个,活跃参数约为 25B。底层还采用 Fused MoE Mega-Kernel,以提升计算效率。注意力机制部分则包括 DSA2、head-dim 512,以及 Sparse MQA 配合 SWA 滑动窗口注意力。

训练方案指向更长上下文

这份泄露信息还给出多项训练细节。其一,优化器据称由常见方案切换为矩阵级优化器 Muon;其二,残差连接采用 Hyper-Connections。爆料称,模型预训练阶段的上下文长度为 32K,在引入带 KL 散度校正的 GRPO 强化学习后,最终可将上下文窗口扩展至 100 万 Token

这类参数组合在当前大模型竞赛里相当醒目。尤其是 1M 上下文和 Lite 版本同时出现,显示出其设计目标不仅是提升旗舰能力,也覆盖更轻量的部署需求。不过,这些内容截至目前仍未得到 DeepSeek 官方确认。

“仅支持纯文本”引发争议

比参数规模更受关注的,是爆料中对模型模态的描述:Text only。也就是说,V4 可能只支持纯文本,而不包含视觉、语音或视频等多模态能力。这个方向与 GPT-4o、Gemini 等主流模型的推进路径并不一致,社交平台上的反应也明显分化。

部分用户认为,这套规格已经具备 SOTA 级别竞争力;也有人直接质疑,在多模态已经成为行业重点的阶段,继续押注纯文本是否过于保守。还有开发者对这份清单的真实性表示怀疑,原因在于内容过于细致,而 DeepSeek 官方尚未回应。

不过,素材提到,清单中�� Muon 优化器、KL 散度校正等技术点,与 DeepSeek 过去强调算法效率和成本优化的风格较为贴近。V4 是否会如预告所示在下周发布,目前还没有官方说法。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。