美国政府旗下人工智能评估机构近期发布的一份报告,将中国头部大模型再次推上舆论焦点。隶属于美国国家标准与技术研究院(NIST)的CAISI表示,中国目前评估过的最强模型之一DeepSeek V4 Pro“约落后美国前沿8个月”。不过,这一结论在发布后迅速引发业内质疑,争议核心并不只是DeepSeek的真实水平,更在于CAISI使用的打分框架是否足够透明、可复现。
CAISI如何得出“落后8个月”结论
与多数机构直接比较各项基准测试平均分不同,CAISI此次采用了项目反应理论(IRT)进行评估。这一方法原本常见于标准化考试,通过分析模型“解对了哪些题、错了哪些题”,进一步推算其“潜在能力值”。CAISI据此对模型在网络安全、软件工程、自然科学、抽象推理和数学五大领域、共九项基准上的表现进行综合估计。
在其给出的IRT估算Elo分数中,GPT-5.5为1260分,Claude Opus 4.6为999分,而DeepSeek V4 Pro约为800分(±28),与GPT-5.4 mini的749分较为接近。按照CAISI的解释,DeepSeek更接近美国上一代轻量级模型,而非最前沿闭源旗舰模型。
但问题在于,这套结果目前难以被外部独立复现。九项基准中有两项属于非公开数据集,而恰恰是在这两项中,DeepSeek与美国模型的差距最为明显。例如在网络安全测试CTF-Archive-Diamond中,GPT-5.5得分71%,而DeepSeek约为32%。由于数据集本身并不公开,外界无法确认测试样本构成、评分标准以及题目是否存在偏向性。
公开基准上的差距并没有那么大
如果把视线转回公开可验证的榜单,情况则显得更加复杂。CAISI列出的公开测试中,DeepSeek并未表现出明显“断层式落后”。在博士级科学推理基准GPQA-Diamond上,DeepSeek达到90%,仅落后Claude Opus 4.6的91%一个百分点。在数学奥赛相关测试OTIS-AIME-2025、PUMaC 2024、SMT 2025中,DeepSeek分别取得97%、96%、96%。在面向真实GitHub缺陷修复的SWE-Bench Verified上,DeepSeek为74%,而GPT-5.5为81%。
从这些公开成绩看,DeepSeek至少在数学、科学推理和部分工程任务上,仍处于全球第一梯队附近。也正因如此,外界对于“8个月差距”的说法保持谨慎态度。DeepSeek在其技术报告中甚至声称,V4 Pro已可对标Claude Opus 4.6和GPT-5.4。
成本比较同样存在筛选争议
除了性能,CAISI还对成本进行了比较。但其方法也受到批评。报告显示,CAISI先剔除了所有“明显更弱”或“单token成本显著更高”的美国模型,最终只有GPT-5.4 mini进入对照组。换言之,美国模型中真正被拿来与DeepSeek比性价比的,只有一个样本。
即便是在这样的筛选规则下,DeepSeek仍在7项测试中的5项里表现出更低成本。这意味着,若单从部署价格和任务效率的角度观察,DeepSeek依然具备较强竞争力,尤其对预算敏感的企业客户和开发者群体而言,这种优势可能比单纯追逐最强性能更具现实吸引力。
业内反驳:中美AI差距或在缩小
对于CAISI的结论,部分行业人士直接提出反驳。化名Ex0bit的AI开发者公开表示,并不存在所谓“8个月差距”,并批评外界长期以美国闭源模型发布节奏为参照,对开源权重模型形成了叙事偏见。
从第三方追踪数据来看,这一反驳并非毫无依据。Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型综合评分接近60分,而DeepSeek处于50分出头,两者差距较一年前已显著压缩。斯坦福大学于2026年4月发布的AI Index也指出,在公开Arena排行榜上,Claude Opus 4.6与中国模型Dola-Seed-2.0 Preview之间的差距已缩小至2.7%。
这意味着,若以公开基准和第三方榜单为观察窗口,中美头部模型之间的性能差距更可能是在收窄,而不是持续扩大。CAISI的“8个月”说法,更像是特定评估框架下的一个定量结论,而非业内已达成共识的客观事实。
对科技与加密市场意味着什么
虽然这则消息本身聚焦AI,但它对科技投资与加密市场同样具有参考意义。首先,围绕AI模型能力、开源生态和推理成本的竞争,正进一步影响算力、数据中心、GPU租赁以及AI代理类项目的估值逻辑。若中国模型在成本效率上持续保持优势,市场可能重新评估开源AI基础设施、分布式算力网络以及与AI服务相关的代币叙事。
其次,监管机构发布的技术评估正在越来越多地影响市场预期。若投资者单纯依据官方报告判断技术差距,可能高估美国闭源模型的领先幅度;而若结合公开榜单和商业落地成本综合分析,则会发现竞争格局远比“谁领先、谁落后”更复杂。对于关注AI+Crypto交叉赛道的投资者来说,真正值得追踪的并非一句“落后几个月”,而是模型能力、开源可获得性、推理成本和生态扩张速度四项核心指标。
目前,CAISI已表示将很快公布更完整的IRT方法说明。届时,这场围绕DeepSeek真实水平的争论,或许才会进入更具可验证性的下一阶段。在那之前,关于中国AI是否明显落后美国,市场恐怕仍难形成统一答案。

