Google于7月13日发布Gemini 3 Deep Think重大升级。按Google披露的数据,该模型在ARC-AGI-2测试中取得84.6%,明显高于Claude Opus 4.6(Thinking Max模式)的68.8%和GPT-5.2(Thinking xhigh模式)的52.9%,也超过约60%的人类平均水平。在原版ARC-AGI-1上,Deep Think的成绩达到96%。
目前,Deep Think已向Google AI Ultra订阅用户开放,API则面向企业提供早期访问。Google把这次更新的重点放在推理和科学相关能力,而不只是通用聊天或基础问答。
基准测试成绩刷新多项纪录
ARC-AGI-2被描述为一项强调归纳与推理能力的测试,目标是减少模型依赖题库记忆的空间。除ARC系列外,Gemini 3 Deep Think在“Humanity’s Last Exam”这一由多领域专家设计的高难度基准中,获得48.4%的无工具成绩,Google称其创下新纪录。
编程与竞赛题表现也被一并披露。Google表示,Deep Think在Codeforces上的Elo评分达到3,455,对应“传奇宗师”等级;在2025年国际物理奥林匹克和化学奥林匹克的笔试部分,模型达到金牌水平。
Google举出数学论文审阅案例
除跑分外,Google还提到一个更接近真实科研流程的案例:Deep Think在审阅一篇已经过人类同行评审的数学论文时,发现了此前��稿人未指出的逻辑漏洞,这一点得到罗格斯大学数学家的确认。素材没有披露论文名称,也没有给出更多技术细节。
这类案例被Google用来说明模型在开放式科学任务中的潜力。与标准化测试不同,论文审阅更接近研究场景,对逻辑一致性和问题定位的要求也更高。
市场竞争转向推理与分发能力
素材显示,AI市场格局也在变化。ChatGPT市占率已从高峰时的87%降至约68%,Gemini则从不足5%升至超过18%,Claude持续扩大企业级市场份额。Google的优势不只在模型本身,还在分发渠道:Gemini已嵌入Android、Chrome、Google Workspace和搜索引擎。
渠道覆盖广,带来的不只是新增用户,也意味着产品体验会被更大范围检验。素材提到,若Gemini体验不足,用户信任流失也可能更快,因为很多用户属于被动接触,而非主动付费选择。
AI升级外溢至加密算力叙事
这轮模型竞赛也被认为会推高算力基础设施需求。素材称,训练���沿模型所需GPU集群成本,已从2024年的数亿美元级别扩大到2026年的数十亿美元级别。对加密行业来说,最直接的影响之一是矿企转型。
在比特币挖矿利润承压的情况下,拥有大规模算力基础设施的矿工正加快转向AI算力服务。素材援引摩根大通本周估算称,BTC生产成本降至7.7万美元,而币价在6.6万美元附近。另一条外溢路径则是AI代币叙事升温,但素材也指出,去中心化算力协议在延迟和吞吐量上,距离企业级AI训练需求仍有明显差距。

