Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期

N
News Editor
2026-09-27 08:18:12
开发者近日发现 Gemini 4 Pro 两个新检查点,内部代号为「barium-b」或 Checkpoint 2。多组公开测试显示,该模型在 3D 物理模拟、代码生成、长文本推理和网页构建上表现突出。Google DeepMind 新任负责人 Koray Kavukcuoglu 也首次确认,Gemini 4 已进入后训练早期,并称其预训练自 7 月启动后约两个月已基本完成早期阶段。

Gemini 4 Pro 最近再次出现新检查点。根据公开流传的信息,开发者发现了两个全新检查点,内部代号为「barium-b」或 Checkpoint 2。多名测试者在实测后给出的结论相当直接:Gemini 4 Pro 在多项任务上的表现已经明显拉高了外界预期。

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期 2

有开发者表示,在长时间使用 Opus 5.5 和 GPT-6 之后,Gemini 4 Pro 依然让他感到震撼。围绕这批新检查点流出的演示,重点集中在 3D 物理模拟、代码生成和长文本推理能力上。

公开测试集中在 3D 生成、物理模拟和长文本代码构建

从开发者和测评者晒出的 Demo 来看,Gemini 4 Pro 在 3D 生成、物理引擎模拟和长文本代码构建上的表现最受关注。文中提到,孔雀 SVG 测试也已经出现,结果显示模型能力有明显跃升。

水上飞机起飞测试

测评博主 @AI_Screening 要求 Gemini 4 Pro 和 Opus 5.5 分别用代码生成一个 3D 浮筒飞机在水面滑行并起飞的物理模拟。对比结果显示,Opus 5.5 生成的飞机虽然能够运动,但机身晃动较大,水面物理反馈也显得生硬;Gemini 4 Pro 生成的版本则加速更平稳,水面反射更清晰,对溅水效果的渲染也更自然。

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期 3

16 分钟生成 3D 国际空间站

开发者 @thtbee_ 的测试显示,在没有导入任何 3D 模型的情况下,Gemini 4 Pro 用 16 分钟通过纯代码生成了一个可交互的 3D 国际空间站绕地球运行模拟程序。按照文中描述,它不仅使用 Three.js 搭建了空间站模型,还从网上抓取了地球贴图,以保证经纬度和颜色准确。

不过,这个演示也并非没有问题。测试反馈提到,生成的 UI 界面不够美观,背面仍存在透视 bug。

灯塔变火箭发射

网友 @HarshithLucky3 给出的指令是:「用 Three.js 将一个灯塔变成火箭发射,不要包含任何 UI 元素。」文中称,Gemini 4 Pro 完整遵循了这条指令,测试者尤其提到其生成画面的纹理质感和整体 3D 输出质量。

3D Wii 遥控器建模

开发者 @LuminaBench 用 3D 任天堂 Wii 遥控器测试其工业设计建模能力。结果显示,Gemini 4 Pro 对 3D 物体细节的把握较强,生成速度也很快。测试中也提到一个特点:模型在处理提示词时有时会过度丰富细节,即便用户没有明确提出要求。

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期 4

同一组反馈还指出,它在不同部件上的设计审美并不完全稳定,有些部分表现很好,有些部分则略显违和。按照测试说法,Checkpoint 2 的细节密度和精确度都很突出,同时也是目前速度最快的前沿模型。

机械蜂鸟测试

博主 @TimJayas 使用其长期沿用的机械蜂鸟提示词,测试模型对复杂机械结构和动态行为的理解。文中给出的结论是,Gemini 4 Pro 的输出质量与 Fable 旗鼓相当,但明显好于 GPT-6 Sol。不过,文中也提到,它有时会被 GPT-6 Astra 压过。

14 分钟生成完整网站,单提示词生成游戏

除 3D 和模拟任务外,Gemini 4 Pro 的工程能力也被反复提及。文中称,一位开发者仅用 14 分钟就生成了一个完整的产品展示网站,覆盖前后端。另有多人反馈,只需输入一个 Prompt,模型就能直接生成一个完整可交互的网页游戏。

流传参数包括 1000 万 Token 上下文和 256k 输出上限

虽然这批新检查点是近期才被发现,但文中称,Gemini 4 Pro 的部分参数此前已经流出。相关说法包括:模型拥有 1000 万 Token 的上下文窗口,以及 256k 的输出上限。

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期 5

如果这些参数属实,文中认为,这将明显缓解长代码生成过程中中途截断的问题。流传信息还提到,Gemini 4 Pro 支持永久跨会话记忆、无需 API 即可联网,并具备 AI Agent 能力;甚至还被描述为具备机器人控制能力,可以作为控制现实物理世界机器人的「大脑」。

此前一张基准测试图还显示,Gemini 4 Pro 在编程、智能体和推理任务上超过 GPT-6 Astra 和 Claude Fable 5.1。其中,在 AI 智能体编程测试 DeepSWE v1.1 中得分 88%,在编码能力测试 Terminal-bench 2.1 中达到 95.3%。

Google DeepMind 负责人:Gemini 4 已进入后训练早期

Gemini 4 Pro 之所以突然引发集中关注,文中将原因指向谷歌内部研发节奏的变化。

根据 The Information 的爆料,Google DeepMind 新任负责人 Koray Kavukcuoglu 首次公开确认,Gemini 4 自 7 月启动「有史以来最具野心的预训练」后,仅用约两个月就基本完成了早期预训练,目前已经进入关键的后训练阶段。

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期 6

Koray 表示:「我们的意图是尽可能快地发布一个早期的后训练版本。」他还说:「因为我们看到了结果,我们感到非常激动!」

文中据此认为,这也是为什么竞技场中会突然出现这个仍处于早期、但已经表现很强的测试节点。

报道还提到,在发现 Gemini 3.5 Pro 的性能不足以压过对手后,谷歌将算力集中投入 Gemini 4。当被问及是否担心谷歌已经落后于同行时,Koray 的回应是:「我对我的团队有百分之百的信心,我们注定永远要站在技术的最前沿。」

内部使用、TPU 设计与发布时间表

Koray 还透露,Gemini 4 目前正被谷歌内部工程师用于 Antigravity AI。文中将这一表态视为对「谷歌员工用 Claude 写代码」传闻的回应。

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期 7

在研发方向上,他表示团队不再执着于 AGI 概念,而是把问题放在「我们是否有能力构建出我们可以完全信任的智能体」上。

他同时提到,Gemini 4 的研发已经帮助谷歌硬件工程师设计「未来两到三代的 TPU」。

关于发布时间,Koray 给出的说法是,希望 Gemini 4 的正式发布时间能「远早于年底」。文中另有消息称,Gemini 4 Pro 可能会在十一期间发布。

泄露定价与谷歌太空计划

除性能外,文中还提到一组流传的 Gemini 4 Pro 定价信息:

Gemini 4 Pro 新检查点曝光,谷歌高层确认已进入后训练早期 8

  • 输入:$2.25 / 100 万 Tokens
  • 输出:$11.25 / 100 万 Tokens

文中称,这一定价策略具有较强攻击性。

另一个被提及的消息是,下周谷歌将搭乘 SpaceX 的猎鹰 9 号,把装有 4 颗 TPU 芯片的卫星送入太空。文中据此提到,未来可能出现由卫星组成的 AI 数据中心网络。

文章最后援引测试者的说法称,第二个检查点相比第一个检查点已经出现「肉眼可见的巨大飞跃」。至于 Gemini 4 Pro 的加入是否会改变 OpenAI 和 Anthropic 的竞争格局,原文并未给出进一步答案。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。