美方称中国顶尖AI落后8个月,DeepSeek评估方法引发争议

美方称中国顶尖AI落后8个月,DeepSeek评估方法引发争议

N
News Editor 01
2026-07-05 21:44:13
美国机构CAISI称DeepSeek V4 Pro较美国前沿模型落后约8个月,但其评估方法因采用不可公开复核的数据集而遭质疑。公开榜单显示,中美顶级AI性能差距正在迅速收窄。

美国政府旗下人工智能评估机构近期发布的一份报告,将中国头部大模型再次推上舆论焦点。隶属于美国国家标准与技术研究院(NIST)的CAISI表示,中国目前评估过的最强模型之一DeepSeek V4 Pro“约落后美国前沿8个月”。不过,这一结论在发布后迅速引发业内质疑,争议核心并不只是DeepSeek的真实水平,更在于CAISI使用的打分框架是否足够透明、可复现。

CAISI如何得出“落后8个月”结论

与多数机构直接比较各项基准测试平均分不同,CAISI此次采用了项目反应理论(IRT)进行评估。这一方法原本常见于标准化考试,通过分析模型“解对了哪些题、错了哪些题”,进一步推算其“潜在能力值”。CAISI据此对模型在网络安全、软件工程、自然科学、抽象推理和数学五大领域、共九项基准上的表现进行综合估计。

在其给出的IRT估算Elo分数中,GPT-5.5为1260分Claude Opus 4.6为999分,而DeepSeek V4 Pro约为800分(±28),与GPT-5.4 mini的749分较为接近。按照CAISI的解释,DeepSeek更接近美国上一代轻量级模型,而非最前沿闭源旗舰模型。

但问题在于,这套结果目前难以被外部独立复现。九项基准中有两项属于非公开数据集,而恰恰是在这两项中,DeepSeek与美国模型的差距最为明显。例如在网络安全测试CTF-Archive-Diamond中,GPT-5.5得分71%,而DeepSeek约为32%。由于数据集本身并不公开,外界无法确认测试样本构成、评分标准以及题目是否存在偏向性。

公开基准上的差距并没有那么大

如果把视线转回公开可验证的榜单,情况则显得更加复杂。CAISI列出的公开测试中,DeepSeek并未表现出明显“断层式落后”。在博士级科学推理基准GPQA-Diamond上,DeepSeek达到90%,仅落后Claude Opus 4.6的91%一个百分点。在数学奥赛相关测试OTIS-AIME-2025、PUMaC 2024、SMT 2025中,DeepSeek分别取得97%、96%、96%。在面向真实GitHub缺陷修复的SWE-Bench Verified上,DeepSeek为74%,而GPT-5.5为81%

从这些公开成绩看,DeepSeek至少在数学、科学推理和部分工程任务上,仍处于全球第一梯队附近。也正因如此,外界对于“8个月差距”的说法保持谨慎态度。DeepSeek在其技术报告中甚至声称,V4 Pro已可对标Claude Opus 4.6和GPT-5.4。

成本比较同样存在筛选争议

除了性能,CAISI还对成本进行了比较。但其方法也受到批评。报告显示,CAISI先剔除了所有“明显更弱”或“单token成本显著更高”的美国模型,最终只有GPT-5.4 mini进入对照组。换言之,美国模型中真正被拿来与DeepSeek比性价比的,只有一个样本。

即便是在这样的筛选规则下,DeepSeek仍在7项测试中的5项里表现出更低成本。这意味着,若单从部署价格和任务效率的角度观察,DeepSeek依然具备较强竞争力,尤其对预算敏感的企业客户和开发者群体而言,这种优势可能比单纯追逐最强性能更具现实吸引力。

业内反驳:中美AI差距或在缩小

对于CAISI的结论,部分行业人士直接提出反驳。化名Ex0bit的AI开发者公开表示,并不存在所谓“8个月差距”,并批评外界长期以美国闭源模型发布节奏为参照,对开源权重模型形成了叙事偏见。

从第三方追踪数据来看,这一反驳并非毫无依据。Artificial Analysis Intelligence Index v4.0显示,截至2026年5月,OpenAI模型综合评分接近60分,而DeepSeek处于50分出头,两者差距较一年前已显著压缩。斯坦福大学于2026年4月发布的AI Index也指出,在公开Arena排行榜上,Claude Opus 4.6与中国模型Dola-Seed-2.0 Preview之间的差距已缩小至2.7%

这意味着,若以公开基准和第三方榜单为观察窗口,中美头部模型之间的性能差距更可能是在收窄,而不是持续扩大。CAISI的“8个月”说法,更像是特定评估框架下的一个定量结论,而非业内已达成共识的客观事实。

对科技与加密市场意味着什么

虽然这则消息本身聚焦AI,但它对科技投资与加密市场同样具有参考意义。首先,围绕AI模型能力、开源生态和推理成本的竞争,正进一步影响算力、数据中心、GPU租赁以及AI代理类项目的估值逻辑。若中国模型在成本效率上持续保持优势,市场可能重新评估开源AI基础设施、分布式算力网络以及与AI服务相关的代币叙事。

其次,监管机构发布的技术评估正在越来越多地影响市场预期。若投资者单纯依据官方报告判断技术差距,可能高估美国闭源模型的领先幅度;而若结合公开榜单和商业落地成本综合分析,则会发现竞争格局远比“谁领先、谁落后”更复杂。对于关注AI+Crypto交叉赛道的投资者来说,真正值得追踪的并非一句“落后几个月”,而是模型能力、开源可获得性、推理成本和生态扩张速度四项核心指标。

目前,CAISI已表示将很快公布更完整的IRT方法说明。届时,这场围绕DeepSeek真实水平的争论,或许才会进入更具可验证性的下一阶段。在那之前,关于中国AI是否明显落后美国,市场恐怕仍难形成统一答案。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。