U.S. Agency Says China’s Top AI Trails by 8 Months, but DeepSeek Review Faces Scrutiny

U.S. Agency Says China’s Top AI Trails by 8 Months, but DeepSeek Review Faces Scrutiny

N
News Editor 01
2026-07-05 21:44:13
A U.S. government-linked institute said DeepSeek V4 Pro trails the U.S. AI frontier by about eight months, but critics question the methodology, citing private benchmarks and narrow cost comparisons. Public leaderboards suggest the U.S.-China AI gap is narrowing quickly.

美国政府旗下评估机构近日对中国大模型能力作出最新判断:DeepSeek V4 Pro较美国前沿模型“落后约8个月”。不过,这一结论并未获得一致认可。随着评测方法细节被外界审视,关于样本选择、非公开数据集以及成本比较口径的争议迅速升温,也让中美AI竞赛的真实差距再次成为市场关注焦点。

官方评估:DeepSeek被认定落后约8个月

此次评估来自美国国家标准与技术研究院(NIST)内部的人工智能标准与创新中心(CAISI)。该机构于5月1日发布对DeepSeek V4 Pro的测评,称这是其迄今评估过的最强中国AI模型,但同时认为其整体能力仍落后美国技术前沿约8个月。

与常见的平均分评测不同,CAISI采用了项目反应理论(IRT)来估算模型的“潜在能力”。评估覆盖9项基准测试、5个领域,包括网络安全、软件工程、自然科学、抽象推理和数学。按照其给出的IRT估算Elo分数,GPT-5.5为1260分Claude Opus 4.6为999分,而DeepSeek V4 Pro约为800分(±28),接近GPT-5.4 mini的749分

从这一评分体系看,DeepSeek与美国顶级闭源模型仍存在明显距离,且更接近美国上一代轻量化模型,而非第一梯队旗舰模型。这也是“落后8个月”结论的主要依据。

争议焦点:两项非公开测试难以复现

问题在于,CAISI并非完全基于可公开验证的数据得出上述判断。9项测试中有2项属于非公开基准,外界无法独立复现全部结果,而偏偏在这两项测试中,DeepSeek与美国模型的差距最为明显。

例如,在网络安全测试CTF-Archive-Diamond中,GPT-5.5得分71%,而DeepSeek约为32%。由于这类数据并不公开,市场很难判断测试难度、题目结构以及评分标准是否对不同模型存在特定偏向。对投资者和产业观察者而言,这意味着结论虽然具备官方背书,却仍缺少足够透明度来支撑广泛共识。

而在公开基准上,形势则没有那么悬殊。博士级科学推理测试GPQA-Diamond中,DeepSeek得分90%,仅落后Claude Opus 4.6的91%一个百分点;数学奥赛类测试OTIS-AIME-2025、PUMaC 2024、SMT 2025中,DeepSeek分别达到97%、96%、96%;在真实GitHub缺陷修复测试SWE-Bench Verified中,DeepSeek为74%,而GPT-5.5为81%

这些公开成绩显示,DeepSeek在数学、科学推理和软件工程等关键能力上,已与国际头部模型形成贴身竞争,而非大幅落后。

成本比较同样引发质疑

除了能力评分,CAISI还进行了成本对比,但其筛选逻辑同样被外界批评为过于狭窄。报告中,凡是“性能显著更弱”或“每token成本显著更高”的美国模型都被剔除,最终仅剩GPT-5.4 mini一个样本作为对照。

即便在这样的筛选条件下,DeepSeek在7项基准中的5项上仍比GPT-5.4 mini更便宜。这一结果令不少观察人士认为,若从性价比角度而非绝对性能出发,中国模型的竞争力可能被低估。尤其在企业部署和开发者生态中,成本往往比理论最强性能更具现实意义。

换言之,CAISI报告虽然强调美国仍保持领先,但在价格效率层面,DeepSeek已经能够与美国轻量化主力产品正面竞争,这对全球AI商业化格局具有直接影响。

业界反驳:真实差距可能在缩小

针对“8个月差距”的说法,部分AI开发者和分析人士并不买账。化名Ex0bit的开发者直接表示,所谓“差距”并不成立,认为外界长期被美国闭源模型的发布节奏和营销叙事所影响。

从第三方追踪指标来看,中美模型差距也确有缩小迹象。Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型得分接近60分,DeepSeek处于50分出头,与一年前相比差距明显压缩。

更值得关注的是斯坦福大学发布的2026 AI Index。该报告指出,在Arena榜单上,美国的Claude Opus 4.6与中国的Dola-Seed-2.0 Preview之间,性能差距已缩小至2.7%。这一数据与“明显落后”的官方叙事并不完全一致,也说明公开排行榜正在呈现另一幅图景:中美前沿模型能力正逐步靠拢。

对市场与加密行业的潜在影响

这场争议不仅关乎AI技术排名,也可能影响资本市场、算力产业链以及加密领域的AI叙事。首先,如果市场逐步接受“中美模型差距显著缩小”的判断,那么与开源模型、低成本推理、国产算力替代相关的资产估值逻辑可能得到强化。

其次,DeepSeek这类高性价比模型若持续进步,将推动更多开发者和企业转向更开放、更低成本的AI基础设施。这一趋势与去中心化AI、链上算力调度、AI Agent及数据市场等加密赛道存在天然联动,可能进一步提升市场对“AI+Crypto”融合叙事的关注度。

最后,从监管和地缘科技竞争角度看,美国官方机构的评估结论可能被政策制定者用作产业扶持、出口管制或技术标准制定的参考依据。但如果评测方法透明度不足,反而可能削弱其公信力,令市场更依赖第三方公开基准来判断技术真实水平。

总体来看,CAISI的报告释放了一个清晰信号:美国官方仍认为本国在前沿AI上保持优势。但围绕评测方法、样本选择和成本口径的争议同样说明,“领先多少”正在成为比“是否领先”更复杂的问题。随着更多公开基准和后续方法说明发布,全球市场对中美AI竞争格局的判断,仍可能继续修正。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
200

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.