谷歌发布Gemini 3.1 Pro:推理分数翻倍,API价格维持不变

谷歌发布Gemini 3.1 Pro:推理分数翻倍,API价格维持不变

N
News Editor 01
2026-07-24 03:45:15
谷歌推出 Gemini 3.1 Pro 预览版,ARC-AGI-2 分数升至 77.1%,在 16 项基准中拿下 13 项第一,同时维持 API 定价不变,显示其正借助 TPU 和云基础设施成本优势争夺开发者市场。

谷歌已发布 Gemini 3.1 Pro 预览版。按官方披露,这一版本在 ARC-AGI-2 上拿到 77.1%,比前代 Gemini 3 Pro 高出一倍以上;在列出的 16 项基准测试 中,Gemini 3.1 Pro 拿下了 13 项第一

其余几项关键成绩也被一并公布:GPQA Diamond 为 94.3%,SWE-Bench Verified 为 80.6%,Humanity’s Last Exam 为 44.4%,MMMLU 为 92.6%。在衡量多步骤工具调用流程的 MCP Atlas 上,Gemini 3.1 Pro 达到 69.2%,领先 Claude 和 GPT-5.2 近 10 个百分点。

三级推理深度开放给开发者调节

这次更新里,更受开发者关注的是 thinking level,也就是三级思考深度系统。用户可在 low、medium、high 三档之间切换推理预算:处理简单 API 调用时可降低延迟和成本,复杂调试场景则可切到更高档位。短句说,就是把模型“想多久”交给开发者自己决定。

当设为 high 时,Gemini 3.1 Pro 的行为被描述为接近 Gemini Deep Think 的迷你版本。VentureBeat 将其称为“按需启动的 Deep Think Mini”。在衡量 AI 代理自主网页搜索能力的 BrowseComp 上,该模型从前代的 59.2% 升至 85.9%,提升幅度相当明显。

性能提升,但每百万Token定价不变

价格层面,Gemini 3.1 Pro 维持与 Gemini 3 Pro 相同的 API 定价:每百万输入 token 2 美元,每百万输出 token 12 美元。按文中给出的对比,Gemini 3.1 Pro 的输入成本比 Claude Opus 4.6 低 60%,输出成本低 52%

模型上下文窗口继续维持在 100 万 token,文中称这相当于 Claude 的 5 倍、GPT-5 的 2.5 倍;输出上限则扩展到 65,000 token。单次 API 上传限制也从 20MB 提高到 100MB,并支持直接传入 YouTube URL,让模型处理视频内容。报道认为,谷歌能在性能上行的同时保持不涨价,与其自研 TPU 芯片及云基础设施带来的成本优势有关。

三家竞争重点不同,模型排名持续轮换

Gemini 3.1 Pro 并未在所有任务中全面领先。报道提到,Claude Sonnet 4.6 在 Thinking Max 模式下,与 Gemini 3.1 Pro 在长上下文记忆测试 MRCR v2 打平;在 GDPval-AA Elo 专家任务上,Claude 以 1633 领先 Gemini 的 1317

OpenAI 的 GPT-5.3-Codex 则在终端编程任务 Terminal-Bench 2.0 上拿到 77.3%,高于 Gemini 3.1 Pro 的 68.5%。同时,报道还提到 Claude 系列的幻觉率约为 3%,低于 Gemini 和 GPT 的平均约 6%。从现有基准看,谷歌在推理与代理任务上冲得很快,Anthropic 在精度和安全性上保持优势,OpenAI 则继续守住代码生成和生态位置,而模型竞争的更新频率也在缩短。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。