美机构称中国顶尖AI落后8个月,DeepSeek评估方法引发争议

美机构称中国顶尖AI落后8个月,DeepSeek评估方法引发争议

N
News Editor 01
2026-07-05 21:44:13
美国政府旗下机构称DeepSeek V4 Pro较美国前沿模型落后约8个月,但因评测依赖非公开基准与筛选口径,该结论遭到业界质疑。公开榜单显示中美AI性能差距正明显收窄。

美国政府旗下评估机构近日对中国大模型能力作出最新判断:DeepSeek V4 Pro较美国前沿模型“落后约8个月”。不过,这一结论并未获得一致认可。随着评测方法细节被外界审视,关于样本选择、非公开数据集以及成本比较口径的争议迅速升温,也让中美AI竞赛的真实差距再次成为市场关注焦点。

官方评估:DeepSeek被认定落后约8个月

此次评估来自美国国家标准与技术研究院(NIST)内部的人工智能标准与创新中心(CAISI)。该机构于5月1日发布对DeepSeek V4 Pro的测评,称这是其迄今评估过的最强中国AI模型,但同时认为其整体能力仍落后美国技术前沿约8个月。

与常见的平均分评测不同,CAISI采用了项目反应理论(IRT)来估算模型的“潜在能力”。评估覆盖9项基准测试、5个领域,包括网络安全、软件工程、自然科学、抽象推理和数学。按照其给出的IRT估算Elo分数,GPT-5.5为1260分Claude Opus 4.6为999分,而DeepSeek V4 Pro约为800分(±28),接近GPT-5.4 mini的749分

从这一评分体系看,DeepSeek与美国顶级闭源模型仍存在明显距离,且更接近美国上一代轻量化模型,而非第一梯队旗舰模型。这也是“落后8个月”结论的主要依据。

争议焦点:两项非公开测试难以复现

问题在于,CAISI并非完全基于可公开验证的数据得出上述判断。9项测试中有2项属于非公开基准,外界无法独立复现全部结果,而偏偏在这两项测试中,DeepSeek与美国模型的差距最为明显。

例如,在网络安全测试CTF-Archive-Diamond中,GPT-5.5得分71%,而DeepSeek约为32%。由于这类数据并不公开,市场很难判断测试难度、题目结构以及评分标准是否对不同模型存在特定偏向。对投资者和产业观察者而言,这意味着结论虽然具备官方背书,却仍缺少足够透明度来支撑广泛共识。

而在公开基准上,形势则没有那么悬殊。博士级科学推理测试GPQA-Diamond中,DeepSeek得分90%,仅落后Claude Opus 4.6的91%一个百分点;数学奥赛类测试OTIS-AIME-2025、PUMaC 2024、SMT 2025中,DeepSeek分别达到97%、96%、96%;在真实GitHub缺陷修复测试SWE-Bench Verified中,DeepSeek为74%,而GPT-5.5为81%

这些公开成绩显示,DeepSeek在数学、科学推理和软件工程等关键能力上,已与国际头部模型形成贴身竞争,而非大幅落后。

成本比较同样引发质疑

除了能力评分,CAISI还进行了成本对比,但其筛选逻辑同样被外界批评为过于狭窄。报告中,凡是“性能显著更弱”或“每token成本显著更高”的美国模型都被剔除,最终仅剩GPT-5.4 mini一个样本作为对照。

即便在这样的筛选条件下,DeepSeek在7项基准中的5项上仍比GPT-5.4 mini更便宜。这一结果令不少观察人士认为,若从性价比角度而非绝对性能出发,中国模型的竞争力可能被低估。尤其在企业部署和开发者生态中,成本往往比理论最强性能更具现实意义。

换言之,CAISI报告虽然强调美国仍保持领先,但在价格效率层面,DeepSeek已经能够与美国轻量化主力产品正面竞争,这对全球AI商业化格局具有直接影响。

业界反驳:真实差距可能在缩小

针对“8个月差距”的说法,部分AI开发者和分析人士并不买账。化名Ex0bit的开发者直接表示,所谓“差距”并不成立,认为外界长期被美国闭源模型的发布节奏和营销叙事所影响。

从第三方追踪指标来看,中美模型差距也确有缩小迹象。Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型得分接近60分,DeepSeek处于50分出头,与一年前相比差距明显压缩。

更值得关注的是斯坦福大学发布的2026 AI Index。该报告指出,在Arena榜单上,美国的Claude Opus 4.6与中国的Dola-Seed-2.0 Preview之间,性能差距已缩小至2.7%。这一数据与“明显落后”的官方叙事并不完全一致,也说明公开排行榜正在呈现另一幅图景:中美前沿模型能力正逐步靠拢。

对市场与加密行业的潜在影响

这场争议不仅关乎AI技术排名,也可能影响资本市场、算力产业链以及加密领域的AI叙事。首先,如果市场逐步接受“中美模型差距显著缩小”的判断,那么与开源模型、低成本推理、国产算力替代相关的资产估值逻辑可能得到强化。

其次,DeepSeek这类高性价比模型若持续进步,将推动更多开发者和企业转向更开放、更低成本的AI基础设施。这一趋势与去中心化AI、链上算力调度、AI Agent及数据市场等加密赛道存在天然联动,可能进一步提升市场对“AI+Crypto”融合叙事的关注度。

最后,从监管和地缘科技竞争角度看,美国官方机构的评估结论可能被政策制定者用作产业扶持、出口管制或技术标准制定的参考依据。但如果评测方法透明度不足,反而可能削弱其公信力,令市场更依赖第三方公开基准来判断技术真实水平。

总体来看,CAISI的报告释放了一个清晰信号:美国官方仍认为本国在前沿AI上保持优势。但围绕评测方法、样本选择和成本口径的争议同样说明,“领先多少”正在成为比“是否领先”更复杂的问题。随着更多公开基准和后续方法说明发布,全球市场对中美AI竞争格局的判断,仍可能继续修正。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。