US Government Says China’s Best AI Lags by 8 Months, but Experts Question the Methodology

US Government Says China’s Best AI Lags by 8 Months, but Experts Question the Methodology

N
News Editor 01
2026-07-05 21:44:13
A U.S. government AI institute said DeepSeek V4 Pro trails the American frontier by about eight months, but critics argue the conclusion relies on non-public benchmarks and selective comparisons, while public leaderboards show a much narrower gap.

美国政府下属AI评测机构近日抛出一项引发广泛讨论的结论:中国最强AI模型之一DeepSeek V4 Pro,较美国前沿模型大约落后8个月。不过,这一判断并未获得一致认可。围绕评测方法、样本选择以及成本比较口径的争议,正迅速把这份报告推向舆论中心。

发布报告的是美国国家标准与技术研究院(NIST)旗下的CAISI,即人工智能标准与创新中心。该机构在5月1日公布对DeepSeek V4 Pro的评估结果,称其是迄今测过的能力最强中国AI模型,但整体仍“落后前沿约8个月”。在美国AI竞争叙事持续升温的背景下,这一结论很快被市场和技术圈放大解读。

CAISI如何得出“落后8个月”的结论

与多数机构直接平均各项基准测试分数不同,CAISI采用了项目反应理论(IRT)来估算模型的“潜在能力”。这种方法常见于标准化考试评分,核心逻辑不是只看答对多少题,而是更关注模型解出了哪些难题、错过了哪些题目,再综合九项基准测试、五个能力领域进行能力映射。

报告显示,在CAISI的IRT-Elo评分体系中,GPT-5.5得分1260,Anthropic的Claude Opus 4.6得分999,而DeepSeek V4 Pro约为800(±28),与GPT-5.4 mini的749分较为接近。按照这一框架,DeepSeek更接近美国“小型模型”梯队,而非最顶级前沿模型。

但争议也正是从这里开始。由于九项测试中有两项为非公开数据集,外部研究者无法完整复现结果,而偏偏在这两项测试中,DeepSeek与美国模型的差距最为明显。以网络安全测试CTF-Archive-Diamond为例,GPT-5.5得分71%,而DeepSeek约为32%。这种“关键差距主要来自不可验证数据”的情况,使不少专家对最终结论的稳健性产生疑问。

公开榜单上的差距并没有那么大

如果只看公开可验证的基准,情况则明显不同。比如在博士级科学推理测试GPQA-Diamond中,DeepSeek得分90%,仅比Claude Opus 4.6低1个百分点。在数学竞赛类基准OTIS-AIME-2025、PUMaC 2024和SMT 2025中,DeepSeek分别取得97%、96%和96%。在真实GitHub缺陷修复任务SWE-Bench Verified上,DeepSeek得分74%,对比GPT-5.5的81%,虽然存在差距,但并非代际级落后。

DeepSeek自身技术报告则声称,V4 Pro已能匹配Claude Opus 4.6与GPT-5.4的能力表现。尽管厂商自述天然带有立场,但公开基准所呈现出的结果,确实与“显著落后”的单一叙事不完全一致。

成本比较同样引发质疑

除了性能,CAISI还尝试比较中美模型的性价比。不过其筛选规则排除了所有“明显更弱”或“明显更贵”的美国模型,最终只保留了GPT-5.4 mini作为对照对象。也就是说,在其成本分析框架里,美国可比样本只剩下一个模型。

即便如此,DeepSeek仍在7项基准中的5项上显示出更低成本。这一结果让不少观察者认为,若扩大样本或调整筛选逻辑,所谓美国模型全面领先的结论可能还会进一步被削弱。

业内反驳:中美AI差距或在缩小

针对CAISI的结论,AI开发者Ex0bit公开反驳称,“不存在所谓差距,也没人落后8个月”。虽然这一说法带有鲜明立场,但其他第三方数据也表明,中美前沿模型间的距离可能正在缩小,而不是扩大。

Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型评分接近60分,DeepSeek位于50分出头区间,相比一年前差距已明显压缩。斯坦福大学于2026年4月13日发布的AI Index也指出,在公开Arena排行榜中,Claude Opus 4.6与中国模型Dola-Seed-2.0 Preview之间的差距已缩小至仅2.7%

这些数据至少说明,在公开测试环境下,中国头部模型对美国前沿模型的追赶速度并不慢。至于“8个月落后”的说法,更像是建立在特定评测框架和特定样本选择之上的结论,而非无可争议的行业共识。

对科技与加密市场意味着什么

这场争议的影响并不局限于AI圈。对科技投资者而言,中美AI差距的认知将直接影响对算力、云服务、芯片、模型商业化以及开源生态的估值判断。若市场接受“中国模型已逼近美国前沿”的叙事,相关亚洲科技资产、开源AI基础设施以及低成本推理服务提供商,可能获得更多关注。

对加密行业而言,AI模型性能与成本的变化同样重要。当前越来越多Web3项目将AI代理、链上数据分析、智能合约审计和去中心化算力网络作为增长方向。若像DeepSeek这类模型在性能接近、成本更低的条件下持续扩张,将利好AI+Crypto叙事,尤其是与去中心化GPU、AI推理网络、数据市场相关的赛道。

总体来看,CAISI报告并未终结关于中美AI实力对比的争论,反而暴露了一个更现实的问题:当评测方法、数据集透明度和对照样本选择都会影响最终结论时,任何“绝对领先”或“明显落后”的判断都需要谨慎解读。CAISI表示,未来将发布更完整的IRT方法说明。届时,这场关于AI实力、国家竞争与市场叙事的争论,或许才会进入下一阶段。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
200

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.