美国政府旗下评估机构近日对中国大模型能力作出最新判断:DeepSeek V4 Pro较美国前沿模型“落后约8个月”。不过,这一结论并未获得一致认可。随着评测方法细节被外界审视,关于样本选择、非公开数据集以及成本比较口径的争议迅速升温,也让中美AI竞赛的真实差距再次成为市场关注焦点。
官方评估:DeepSeek被认定落后约8个月
此次评估来自美国国家标准与技术研究院(NIST)内部的人工智能标准与创新中心(CAISI)。该机构于5月1日发布对DeepSeek V4 Pro的测评,称这是其迄今评估过的最强中国AI模型,但同时认为其整体能力仍落后美国技术前沿约8个月。
与常见的平均分评测不同,CAISI采用了项目反应理论(IRT)来估算模型的“潜在能力”。评估覆盖9项基准测试、5个领域,包括网络安全、软件工程、自然科学、抽象推理和数学。按照其给出的IRT估算Elo分数,GPT-5.5为1260分,Claude Opus 4.6为999分,而DeepSeek V4 Pro约为800分(±28),接近GPT-5.4 mini的749分。
从这一评分体系看,DeepSeek与美国顶级闭源模型仍存在明显距离,且更接近美国上一代轻量化模型,而非第一梯队旗舰模型。这也是“落后8个月”结论的主要依据。
争议焦点:两项非公开测试难以复现
问题在于,CAISI并非完全基于可公开验证的数据得出上述判断。9项测试中有2项属于非公开基准,外界无法独立复现全部结果,而偏偏在这两项测试中,DeepSeek与美国模型的差距最为明显。
例如,在网络安全测试CTF-Archive-Diamond中,GPT-5.5得分71%,而DeepSeek约为32%。由于这类数据并不公开,市场很难判断测试难度、题目结构以及评分标准是否对不同模型存在特定偏向。对投资者和产业观察者而言,这意味着结论虽然具备官方背书,却仍缺少足够透明度来支撑广泛共识。
而在公开基准上,形势则没有那么悬殊。博士级科学推理测试GPQA-Diamond中,DeepSeek得分90%,仅落后Claude Opus 4.6的91%一个百分点;数学奥赛类测试OTIS-AIME-2025、PUMaC 2024、SMT 2025中,DeepSeek分别达到97%、96%、96%;在真实GitHub缺陷修复测试SWE-Bench Verified中,DeepSeek为74%,而GPT-5.5为81%。
这些公开成绩显示,DeepSeek在数学、科学推理和软件工程等关键能力上,已与国际头部模型形成贴身竞争,而非大幅落后。
成本比较同样引发质疑
除了能力评分,CAISI还进行了成本对比,但其筛选逻辑同样被外界批评为过于狭窄。报告中,凡是“性能显著更弱”或“每token成本显著更高”的美国模型都被剔除,最终仅剩GPT-5.4 mini一个样本作为对照。
即便在这样的筛选条件下,DeepSeek在7项基准中的5项上仍比GPT-5.4 mini更便宜。这一结果令不少观察人士认为,若从性价比角度而非绝对性能出发,中国模型的竞争力可能被低估。尤其在企业部署和开发者生态中,成本往往比理论最强性能更具现实意义。
换言之,CAISI报告虽然强调美国仍保持领先,但在价格效率层面,DeepSeek已经能够与美国轻量化主力产品正面竞争,这对全球AI商业化格局具有直接影响。
业界反驳:真实差距可能在缩小
针对“8个月差距”的说法,部分AI开发者和分析人士并不买账。化名Ex0bit的开发者直接表示,所谓“差距”并不成立,认为外界长期被美国闭源模型的发布节奏和营销叙事所影响。
从第三方追踪指标来看,中美模型差距也确有缩小迹象。Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型得分接近60分,DeepSeek处于50分出头,与一年前相比差距明显压缩。
更值得关注的是斯坦福大学发布的2026 AI Index。该报告指出,在Arena榜单上,美国的Claude Opus 4.6与中国的Dola-Seed-2.0 Preview之间,性能差距已缩小至2.7%。这一数据与“明显落后”的官方叙事并不完全一致,也说明公开排行榜正在呈现另一幅图景:中美前沿模型能力正逐步靠拢。
对市场与加密行业的潜在影响
这场争议不仅关乎AI技术排名,也可能影响资本市场、算力产业链以及加密领域的AI叙事。首先,如果市场逐步接受“中美模型差距显著缩小”的判断,那么与开源模型、低成本推理、国产算力替代相关的资产估值逻辑可能得到强化。
其次,DeepSeek这类高性价比模型若持续进步,将推动更多开发者和企业转向更开放、更低成本的AI基础设施。这一趋势与去中心化AI、链上算力调度、AI Agent及数据市场等加密赛道存在天然联动,可能进一步提升市场对“AI+Crypto”融合叙事的关注度。
最后,从监管和地缘科技竞争角度看,美国官方机构的评估结论可能被政策制定者用作产业扶持、出口管制或技术标准制定的参考依据。但如果评测方法透明度不足,反而可能削弱其公信力,令市场更依赖第三方公开基准来判断技术真实水平。
总体来看,CAISI的报告释放了一个清晰信号:美国官方仍认为本国在前沿AI上保持优势。但围绕评测方法、样本选择和成本口径的争议同样说明,“领先多少”正在成为比“是否领先”更复杂的问题。随着更多公开基准和后续方法说明发布,全球市场对中美AI竞争格局的判断,仍可能继续修正。

