DeepSeek悄然更新 V4 Pro,称与 Claude Fable 5 分差有限但成本低近 46 倍

DeepSeek悄然更新 V4 Pro,称与 Claude Fable 5 分差有限但成本低近 46 倍

N
News Editor
2026-08-12 20:02:51
DeepSeek 于周三低调上线旗舰模型 DeepSeek-V4-Pro-0813,未发布博客或公告,仅在 API 定价页更新版本号。按其公布的 10 项智能体基准对比,Claude Fable 5 在部分项目上领先,但平均优势约为 5.3%,剔除一项拉大差距的测试后降至 2.8%。价格方面,Fable 5 的综合费率约为 V4 Pro 的 46 倍。由于 0813 版本尚未被公司外部独立评测,现有分数仍主要对应此前的预览版本。

DeepSeek 在周三完成了旗舰模型 V4 Pro 的正式版本更新,但没有发布博客文章,也没有单独公告。外界最先捕捉到这次更新的信号,来自其 API 定价页面上的一处表格变动:“deepseek-v4-pro” 对应的模型版本已显示为 DeepSeek-V4-Pro-0813。

DeepSeek悄然更新 V4 Pro,称与 Claude Fable 5 分差有限但成本低近 46 倍 2

该模型的调用价格没有变化,输入和输出每百万 token 的费用分别约为 0.435 美元和 0.87 美元。token 是模型处理信息的基本单位。也就是说,这次变化不在定价结构,而在底层权重。

DeepSeek V4 Pro 自 4 月起已对外提供,价格较 GPT-5 Pro 低 98%。但此前各家独立实验室测试的,都是预览版本。DeepSeek 自己也在 7 月 31 日说明过这一点:当时公司宣布 V4-Flash 正式开放普遍可用,并提到 Pro API “未变化”,正式版本“将很快跟进”。Hugging Face 上的模型卡片目前仍将 V4 系列描述为“预览版本”。

这意味着,市场上广泛流传的成绩,描述的仍是 DeepSeek 认为尚未完成的构建版本。截至目前,0813 版本还没有公司外部的独立基准测试结果。

DeepSeek 公布的对比结果

DeepSeek 公布了一份涵盖 10 项智能体基准测试的对比表。按该公司给出的数据,在 Claude Fable 5 或其他模型占优的 8 个项目中,分差整体并不大。

如果把 Fable 5 在这些基准中的相对领先幅度做平均,结果约为 5.3%。如果剔除“Humanity’s Last Exam without tools”这一项——在这项测试里,DeepSeek 得分 42.7,Fable 5 得分 53.3,差距为 10.6%,明显拉高了整体均值——其余项目的平均分差约为 2.8%。

价格差距更大

双方价格均为公开信息,而成本对比从这里开始明显拉开。Fable 5 的输入价格为每百万 token 10 美元,输出价格为每百万 token 50 美元。V4 Pro 则分别为 0.435 美元和 0.87 美元,缓存输入价格为 0.003625 美元。

按综合费率计算,Fable 5 约为每百万 token 30 美元,V4 Pro 约为 0.65 美元,前者大约是后者的 46 倍,成本相当于后者的约 4600%。对于大规模部署 AI 工具的企业来说,这类价差具有直接意义。

DeepSeek悄然更新 V4 Pro,称与 Claude Fable 5 分差有限但成本低近 46 倍 3

若按每项完成任务的成本衡量,差距还会更大,因为 Fable 5 思考时间更长、输出内容也更多。Artificial Analysis 的测算显示,Fable 5 每项基准任务成本为 3.15 美元,而 V4-Flash 为 0.03 美元,后者便宜约 105 倍。Hugging Face 首席执行官 Clément Delangue 给出的口径是,每项任务成本相差超过 31 美元,对应另一侧约为 0.04 美元。至于 0813 版本,目前还没有按任务计费的对应数据。

Anthropic 自家产品线也拉低了溢价合理性

Anthropic 自身的产品阵列,也让 Fable 5 的高溢价显得更复杂。文中提到,Claude Opus 5 在多数基准测试中的得分高于 Fable 5,但价格只有后者的一半。

现有分数仍缺少外部验证

DeepSeek 的这组成绩由公司自行测得,运行所依赖的基础设施也尚未发布。其 7 月说明指出,DeepSeek Harness minimal mode “to be released soon”,运行设置为最大 effort 和高 creativity。

10 项基准中还有 2 项是内部测试集,分别为 DSBench-FullStack 和 DSBench-Hard,这两项都没有公开排行榜,外部无法据此交叉验证。

低价追近前沿模型的趋势仍在延续

尽管 0813 尚未经过独立跑分验证,文中认为,大方向并没有偏离:多家中国开放权重实验室正以远低于美国前沿模型的价格,把性能差距压缩到几个百分点。报道举例称,Kimi K3 在发布时击败了 Fable 5 和 GPT-5.6 Sol;DeepSeek 和小米也一直在压低前沿模型成本,而美国实验室则走向相反方向。

DeepSeek 的权重采用 MIT 许可,并已发布在 Hugging Face。对于外部研究者来说,独立验证所需的材料已经可以直接下载。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
470

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。