美方称中国顶尖AI落后8个月,DeepSeek评测方法引发争议

美方称中国顶尖AI落后8个月,DeepSeek评测方法引发争议

N
News Editor 01
2026-07-05 21:45:12
美国政府下属机构称DeepSeek V4 Pro落后美国前沿模型约8个月,但因评测依赖不可公开数据集、成本比较样本有限,这一结论遭到业内质疑。公开榜单显示中美AI差距或已明显收窄。

美国政府下属的人工智能评测机构近日抛出一项颇具争议的结论:中国AI模型DeepSeek V4 Pro落后美国前沿模型约8个月。这一说法来自美国国家标准与技术研究院(NIST)内部的人工智能标准与创新中心(CAISI)于5月1日发布的评估报告。报告同时指出,DeepSeek V4 Pro是该机构迄今测评过能力最强的中国模型。

不过,报告发布后,市场和技术社区并未照单全收。争议的核心并不只在于“8个月落后”这一结论本身,更在于CAISI采用的评分方法、样本筛选标准,以及部分关键测试数据无法被外界独立验证。对于关注AI赛道、科技股以及加密市场AI叙事的投资者而言,这场争论反映的并非单一模型的输赢,而是全球AI竞争格局正在进入更加胶着的阶段。

CAISI如何得出“落后8个月”结论

与多数机构直接对各项基准测试成绩取平均值不同,CAISI此次采用了项目反应理论(IRT)进行建模。这一统计方法常见于标准化考试,用于通过题目难度与答题表现推断被测对象的“潜在能力”。CAISI据此在网络安全、软件工程、自然科学、抽象推理和数学五大领域、共九项基准测试中,对模型能力进行了综合估计。

按照CAISI公布的IRT估算Elo分数,GPT-5.5为1260分Claude Opus 4.6为999分,而DeepSeek V4 Pro约为800分(±28),与GPT-5.4 mini的749分较为接近。从这一评分体系看,DeepSeek更接近美国上一代轻量模型,而不是最前沿的旗舰模型。

但需要注意的是,这种分数并非传统意义上的“正确率”,而是依赖同一组测试中不同模型之间的相对表现。因此,分数高低在很大程度上取决于题库选择、难度设定以及参与比较的模型范围。

争议焦点:两项私有数据集无法复现

外界质疑CAISI的重要原因之一,在于九项基准测试中有两项并未公开。而恰恰是在这两项不可验证的测试中,DeepSeek与美国模型之间的差距被拉得最开。例如,在名为CTF-Archive-Diamond的网络安全测试里,GPT-5.5得分71%,而DeepSeek约为32%

由于相关测试集不公开,研究者和开发者无法独立复现结果,也难以判断这些题目是否对某类模型结构、训练方式或工具调用能力存在偏向。这使得“8个月差距”的结论虽然看起来明确,却缺乏足够的外部可验证性。

相比之下,在公开基准上,DeepSeek的表现并不显著落后。比如在博士级科学推理测试GPQA-Diamond中,DeepSeek得分90%,仅比Claude Opus 4.6的91%低1个百分点。数学奥赛类测试中,DeepSeek在OTIS-AIME-2025、PUMaC 2024和SMT 2025上的成绩分别达到97%、96%和96%。在真实GitHub缺陷修复任务SWE-Bench Verified上,DeepSeek得分74%,而GPT-5.5为81%

从这些公开成绩看,DeepSeek与美国头部模型在若干关键能力上的差距并没有“断层式”拉开。DeepSeek在其技术报告中甚至表示,V4 Pro可比肩Opus 4.6和GPT-5.4。

成本比较也引发筛选偏差质疑

除能力评估外,CAISI还进行了成本对比。但其筛选标准同样备受争议。报告中,凡是性能明显更弱每token成本显著更高的美国模型,均被排除在比较之外。最终,能够进入对照组的美国模型只剩下GPT-5.4 mini一款。

在这种设定下,DeepSeek在7项测试中的5项成本更低。这意味着,即便按照CAISI自己的标准,DeepSeek在性价比层面仍具备竞争力,甚至优于OpenAI的轻量化产品。问题在于,若样本只剩单一参照物,那么“美国前沿”的整体成本画像也会被大幅简化,难以全面反映市场现实。

另一种观察:中美AI差距可能在缩小

对于CAISI结论,业界并非一致认同。化名Ex0bit的AI开发者公开表示,不存在所谓“8个月落后”的绝对差距,并批评外界长期以封闭模型发布节奏制造心理优势。

从第三方跟踪数据看,差距缩小的说法并非没有依据。Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型得分接近60分,DeepSeek处于50分出头,两者间距较一年前明显压缩。斯坦福大学于4月13日发布的2026 AI Index也指出,在公开Arena排行榜上,Claude Opus 4.6与中国模型Dola-Seed-2.0 Preview之间的差距已缩小至2.7%

这意味着,如果观察公开榜单和标准化评测,中美顶级模型间的差距更可能呈现“收敛”而非“扩大”的趋势。CAISI则表示,后续将公布更完整的IRT方法说明,以回应外界对评测框架的关注。

对市场与加密AI叙事的影响

这场围绕DeepSeek的争论,不只是技术圈内部的学术分歧,也会影响资本市场对AI产业链和相关加密叙事的定价逻辑。若美国机构的结论被广泛接受,市场可能继续强化“美国模型保持绝对领先”的预期,从而利好美国大型AI公司、算力基础设施以及相关科技股估值。

但如果越来越多公开评测显示中国与美国顶尖模型差距已收窄到个位数百分比,那么全球AI竞争的叙事将发生变化:开源模型、低成本推理、跨国算力调度以及AI代理基础设施的重要性都可能上升。对于加密市场而言,这会进一步刺激AI概念代币、去中心化算力网络、数据标注与模型分发协议等板块获得关注。

更重要的是,DeepSeek在成本效率上的表现,可能强化市场对“高性能不必然对应高成本”的认知。在当前AI与加密融合不断加深的背景下,资本更关注的或许不只是“谁最强”,而是谁能以更低成本实现足够强的能力,并完成大规模部署

总体来看,CAISI的报告为“中美AI差距”提供了一种偏保守、偏官方的解读,但其方法论争议也意味着结论尚难一锤定音。对于投资者来说,比单一报告更重要的是持续跟踪公开基准、产品落地能力与成本曲线变化,因为这三者才是决定AI竞争格局和相关资产表现的关键变量。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。