DeepSeek 在周三完成了旗舰模型 V4 Pro 的正式版本更新,但没有发布博客文章,也没有单独公告。外界最先捕捉到这次更新的信号,来自其 API 定价页面上的一处表格变动:“deepseek-v4-pro” 对应的模型版本已显示为 DeepSeek-V4-Pro-0813。

该模型的调用价格没有变化,输入和输出每百万 token 的费用分别约为 0.435 美元和 0.87 美元。token 是模型处理信息的基本单位。也就是说,这次变化不在定价结构,而在底层权重。
DeepSeek V4 Pro 自 4 月起已对外提供,价格较 GPT-5 Pro 低 98%。但此前各家独立实验室测试的,都是预览版本。DeepSeek 自己也在 7 月 31 日说明过这一点:当时公司宣布 V4-Flash 正式开放普遍可用,并提到 Pro API “未变化”,正式版本“将很快跟进”。Hugging Face 上的模型卡片目前仍将 V4 系列描述为“预览版本”。
这意味着,市场上广泛流传的成绩,描述的仍是 DeepSeek 认为尚未完成的构建版本。截至目前,0813 版本还没有公司外部的独立基准测试结果。
DeepSeek 公布的对比结果
DeepSeek 公布了一份涵盖 10 项智能体基准测试的对比表。按该公司给出的数据,在 Claude Fable 5 或其他模型占优的 8 个项目中,分差整体并不大。
如果把 Fable 5 在这些基准中的相对领先幅度做平均,结果约为 5.3%。如果剔除“Humanity’s Last Exam without tools”这一项——在这项测试里,DeepSeek 得分 42.7,Fable 5 得分 53.3,差距为 10.6%,明显拉高了整体均值——其余项目的平均分差约为 2.8%。
价格差距更大
双方价格均为公开信息,而成本对比从这里开始明显拉开。Fable 5 的输入价格为每百万 token 10 美元,输出价格为每百万 token 50 美元。V4 Pro 则分别为 0.435 美元和 0.87 美元,缓存输入价格为 0.003625 美元。
按综合费率计算,Fable 5 约为每百万 token 30 美元,V4 Pro 约为 0.65 美元,前者大约是后者的 46 倍,成本相当于后者的约 4600%。对于大规模部署 AI 工具的企业来说,这类价差具有直接意义。

若按每项完成任务的成本衡量,差距还会更大,因为 Fable 5 思考时间更长、输出内容也更多。Artificial Analysis 的测算显示,Fable 5 每项基准任务成本为 3.15 美元,而 V4-Flash 为 0.03 美元,后者便宜约 105 倍。Hugging Face 首席执行官 Clément Delangue 给出的口径是,每项任务成本相差超过 31 美元,对应另一侧约为 0.04 美元。至于 0813 版本,目前还没有按任务计费的对应数据。
Anthropic 自家产品线也拉低了溢价合理性
Anthropic 自身的产品阵列,也让 Fable 5 的高溢价显得更复杂。文中提到,Claude Opus 5 在多数基准测试中的得分高于 Fable 5,但价格只有后者的一半。
现有分数仍缺少外部验证
DeepSeek 的这组成绩由公司自行测得,运行所依赖的基础设施也尚未发布。其 7 月说明指出,DeepSeek Harness minimal mode “to be released soon”,运行设置为最大 effort 和高 creativity。
10 项基准中还有 2 项是内部测试集,分别为 DSBench-FullStack 和 DSBench-Hard,这两项都没有公开排行榜,外部无法据此交叉验证。
低价追近前沿模型的趋势仍在延续
尽管 0813 尚未经过独立跑分验证,文中认为,大方向并没有偏离:多家中国开放权重实验室正以远低于美国前沿模型的价格,把性能差距压缩到几个百分点。报道举例称,Kimi K3 在发布时击败了 Fable 5 和 GPT-5.6 Sol;DeepSeek 和小米也一直在压低前沿模型成本,而美国实验室则走向相反方向。
DeepSeek 的权重采用 MIT 许可,并已发布在 Hugging Face。对于外部研究者来说,独立验证所需的材料已经可以直接下载。

