U.S. Agency Says China’s Top AI Trails by Eight Months, but DeepSeek Evaluation Sparks Doubts

U.S. Agency Says China’s Top AI Trails by Eight Months, but DeepSeek Evaluation Sparks Doubts

N
News Editor 01
2026-07-05 21:44:13
A U.S. institute said DeepSeek V4 Pro trails the American AI frontier by about eight months, but critics questioned the methodology due to unverifiable private benchmarks. Public leaderboards suggest the U.S.-China AI gap may be narrowing instead.

美国政府旗下人工智能评估机构近期发布的一份报告,将中国头部大模型再次推上舆论焦点。隶属于美国国家标准与技术研究院(NIST)的CAISI表示,中国目前评估过的最强模型之一DeepSeek V4 Pro“约落后美国前沿8个月”。不过,这一结论在发布后迅速引发业内质疑,争议核心并不只是DeepSeek的真实水平,更在于CAISI使用的打分框架是否足够透明、可复现。

CAISI如何得出“落后8个月”结论

与多数机构直接比较各项基准测试平均分不同,CAISI此次采用了项目反应理论(IRT)进行评估。这一方法原本常见于标准化考试,通过分析模型“解对了哪些题、错了哪些题”,进一步推算其“潜在能力值”。CAISI据此对模型在网络安全、软件工程、自然科学、抽象推理和数学五大领域、共九项基准上的表现进行综合估计。

在其给出的IRT估算Elo分数中,GPT-5.5为1260分Claude Opus 4.6为999分,而DeepSeek V4 Pro约为800分(±28),与GPT-5.4 mini的749分较为接近。按照CAISI的解释,DeepSeek更接近美国上一代轻量级模型,而非最前沿闭源旗舰模型。

但问题在于,这套结果目前难以被外部独立复现。九项基准中有两项属于非公开数据集,而恰恰是在这两项中,DeepSeek与美国模型的差距最为明显。例如在网络安全测试CTF-Archive-Diamond中,GPT-5.5得分71%,而DeepSeek约为32%。由于数据集本身并不公开,外界无法确认测试样本构成、评分标准以及题目是否存在偏向性。

公开基准上的差距并没有那么大

如果把视线转回公开可验证的榜单,情况则显得更加复杂。CAISI列出的公开测试中,DeepSeek并未表现出明显“断层式落后”。在博士级科学推理基准GPQA-Diamond上,DeepSeek达到90%,仅落后Claude Opus 4.6的91%一个百分点。在数学奥赛相关测试OTIS-AIME-2025、PUMaC 2024、SMT 2025中,DeepSeek分别取得97%、96%、96%。在面向真实GitHub缺陷修复的SWE-Bench Verified上,DeepSeek为74%,而GPT-5.5为81%

从这些公开成绩看,DeepSeek至少在数学、科学推理和部分工程任务上,仍处于全球第一梯队附近。也正因如此,外界对于“8个月差距”的说法保持谨慎态度。DeepSeek在其技术报告中甚至声称,V4 Pro已可对标Claude Opus 4.6和GPT-5.4。

成本比较同样存在筛选争议

除了性能,CAISI还对成本进行了比较。但其方法也受到批评。报告显示,CAISI先剔除了所有“明显更弱”或“单token成本显著更高”的美国模型,最终只有GPT-5.4 mini进入对照组。换言之,美国模型中真正被拿来与DeepSeek比性价比的,只有一个样本。

即便是在这样的筛选规则下,DeepSeek仍在7项测试中的5项里表现出更低成本。这意味着,若单从部署价格和任务效率的角度观察,DeepSeek依然具备较强竞争力,尤其对预算敏感的企业客户和开发者群体而言,这种优势可能比单纯追逐最强性能更具现实吸引力。

业内反驳:中美AI差距或在缩小

对于CAISI的结论,部分行业人士直接提出反驳。化名Ex0bit的AI开发者公开表示,并不存在所谓“8个月差距”,并批评外界长期以美国闭源模型发布节奏为参照,对开源权重模型形成了叙事偏见。

从第三方追踪数据来看,这一反驳并非毫无依据。Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型综合评分接近60分,而DeepSeek处于50分出头,两者差距较一年前已显著压缩。斯坦福大学于2026年4月发布的AI Index也指出,在公开Arena排行榜上,Claude Opus 4.6与中国模型Dola-Seed-2.0 Preview之间的差距已缩小至2.7%

这意味着,若以公开基准和第三方榜单为观察窗口,中美头部模型之间的性能差距更可能是在收窄,而不是持续扩大。CAISI的“8个月”说法,更像是特定评估框架下的一个定量结论,而非业内已达成共识的客观事实。

对科技与加密市场意味着什么

虽然这则消息本身聚焦AI,但它对科技投资与加密市场同样具有参考意义。首先,围绕AI模型能力、开源生态和推理成本的竞争,正进一步影响算力、数据中心、GPU租赁以及AI代理类项目的估值逻辑。若中国模型在成本效率上持续保持优势,市场可能重新评估开源AI基础设施、分布式算力网络以及与AI服务相关的代币叙事。

其次,监管机构发布的技术评估正在越来越多地影响市场预期。若投资者单纯依据官方报告判断技术差距,可能高估美国闭源模型的领先幅度;而若结合公开榜单和商业落地成本综合分析,则会发现竞争格局远比“谁领先、谁落后”更复杂。对于关注AI+Crypto交叉赛道的投资者来说,真正值得追踪的并非一句“落后几个月”,而是模型能力、开源可获得性、推理成本和生态扩张速度四项核心指标。

目前,CAISI已表示将很快公布更完整的IRT方法说明。届时,这场围绕DeepSeek真实水平的争论,或许才会进入更具可验证性的下一阶段。在那之前,关于中国AI是否明显落后美国,市场恐怕仍难形成统一答案。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
100

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.