美国政府下属AI评测机构近日抛出一项引发广泛讨论的结论:中国最强AI模型之一DeepSeek V4 Pro,较美国前沿模型大约落后8个月。不过,这一判断并未获得一致认可。围绕评测方法、样本选择以及成本比较口径的争议,正迅速把这份报告推向舆论中心。
发布报告的是美国国家标准与技术研究院(NIST)旗下的CAISI,即人工智能标准与创新中心。该机构在5月1日公布对DeepSeek V4 Pro的评估结果,称其是迄今测过的能力最强中国AI模型,但整体仍“落后前沿约8个月”。在美国AI竞争叙事持续升温的背景下,这一结论很快被市场和技术圈放大解读。
CAISI如何得出“落后8个月”的结论
与多数机构直接平均各项基准测试分数不同,CAISI采用了项目反应理论(IRT)来估算模型的“潜在能力”。这种方法常见于标准化考试评分,核心逻辑不是只看答对多少题,而是更关注模型解出了哪些难题、错过了哪些题目,再综合九项基准测试、五个能力领域进行能力映射。
报告显示,在CAISI的IRT-Elo评分体系中,GPT-5.5得分1260,Anthropic的Claude Opus 4.6得分999,而DeepSeek V4 Pro约为800(±28),与GPT-5.4 mini的749分较为接近。按照这一框架,DeepSeek更接近美国“小型模型”梯队,而非最顶级前沿模型。
但争议也正是从这里开始。由于九项测试中有两项为非公开数据集,外部研究者无法完整复现结果,而偏偏在这两项测试中,DeepSeek与美国模型的差距最为明显。以网络安全测试CTF-Archive-Diamond为例,GPT-5.5得分71%,而DeepSeek约为32%。这种“关键差距主要来自不可验证数据”的情况,使不少专家对最终结论的稳健性产生疑问。
公开榜单上的差距并没有那么大
如果只看公开可验证的基准,情况则明显不同。比如在博士级科学推理测试GPQA-Diamond中,DeepSeek得分90%,仅比Claude Opus 4.6低1个百分点。在数学竞赛类基准OTIS-AIME-2025、PUMaC 2024和SMT 2025中,DeepSeek分别取得97%、96%和96%。在真实GitHub缺陷修复任务SWE-Bench Verified上,DeepSeek得分74%,对比GPT-5.5的81%,虽然存在差距,但并非代际级落后。
DeepSeek自身技术报告则声称,V4 Pro已能匹配Claude Opus 4.6与GPT-5.4的能力表现。尽管厂商自述天然带有立场,但公开基准所呈现出的结果,确实与“显著落后”的单一叙事不完全一致。
成本比较同样引发质疑
除了性能,CAISI还尝试比较中美模型的性价比。不过其筛选规则排除了所有“明显更弱”或“明显更贵”的美国模型,最终只保留了GPT-5.4 mini作为对照对象。也就是说,在其成本分析框架里,美国可比样本只剩下一个模型。
即便如此,DeepSeek仍在7项基准中的5项上显示出更低成本。这一结果让不少观察者认为,若扩大样本或调整筛选逻辑,所谓美国模型全面领先的结论可能还会进一步被削弱。
业内反驳:中美AI差距或在缩小
针对CAISI的结论,AI开发者Ex0bit公开反驳称,“不存在所谓差距,也没人落后8个月”。虽然这一说法带有鲜明立场,但其他第三方数据也表明,中美前沿模型间的距离可能正在缩小,而不是扩大。
Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型评分接近60分,DeepSeek位于50分出头区间,相比一年前差距已明显压缩。斯坦福大学于2026年4月13日发布的AI Index也指出,在公开Arena排行榜中,Claude Opus 4.6与中国模型Dola-Seed-2.0 Preview之间的差距已缩小至仅2.7%。
这些数据至少说明,在公开测试环境下,中国头部模型对美国前沿模型的追赶速度并不慢。至于“8个月落后”的说法,更像是建立在特定评测框架和特定样本选择之上的结论,而非无可争议的行业共识。
对科技与加密市场意味着什么
这场争议的影响并不局限于AI圈。对科技投资者而言,中美AI差距的认知将直接影响对算力、云服务、芯片、模型商业化以及开源生态的估值判断。若市场接受“中国模型已逼近美国前沿”的叙事,相关亚洲科技资产、开源AI基础设施以及低成本推理服务提供商,可能获得更多关注。
对加密行业而言,AI模型性能与成本的变化同样重要。当前越来越多Web3项目将AI代理、链上数据分析、智能合约审计和去中心化算力网络作为增长方向。若像DeepSeek这类模型在性能接近、成本更低的条件下持续扩张,将利好AI+Crypto叙事,尤其是与去中心化GPU、AI推理网络、数据市场相关的赛道。
总体来看,CAISI报告并未终结关于中美AI实力对比的争论,反而暴露了一个更现实的问题:当评测方法、数据集透明度和对照样本选择都会影响最终结论时,任何“绝对领先”或“明显落后”的判断都需要谨慎解读。CAISI表示,未来将发布更完整的IRT方法说明。届时,这场关于AI实力、国家竞争与市场叙事的争论,或许才会进入下一阶段。

