谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相

N
News Editor
2026-09-02 12:27:11
谷歌被曝将在明日推出 Gemini 3.8 Flash,相关报道还称 Gemini 3.5 Pro 已被取消,Gemini 4.0 仍在预训练评估和后训练阶段。发布前,谷歌先上线了 Gemini 的智能体视频理解能力,适用于 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。谷歌称,在标准视频分析基准中,该功能可将 token 消耗最多降低 88%,分析成本最多降低 66%,准确率最多提升 7%。

在 Claude 5.1 发布、OpenAI Astra 临近亮相之际,谷歌也传出新进展。最新爆料称,Gemini 3.8 Flash 将在明日登场。

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相 2

比起 3.8 Flash 的发布时间,外界此前更关心 Gemini 3.5 Pro 何时推出。不过,报道给出的信息是,谷歌已放弃这一版本,下一代大版本将转向 Gemini 4.0。

Gemini 3.5 Pro 被取消,4.0 仍在推进

文中提到,自今年 5 月 I/O 大会预告以来,至今已过去近 4 个月,Gemini 3.5 Pro 的进化程度甚至不及 Flash 版本,谷歌因此选择放弃这一产品线。

报道援引《华尔街日报》的独家爆料称,Gemini 4.0 在预训练阶段评估表现优秀,后训练工作仍在顺利进行。与此同时,Gemini 3.8 Flash 的代号为「Skimaki」,其编程能力被列为这次更新的重点之一。

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相 3

据称,在谷歌内部编码工具 Jetski 的对比测试中,3.8 Flash 的表现超过了 Opus 模型。这款模型已研发数月,启动时间还早于谷歌领导层发生重大调整之前。

原文还提到,Hassabis 让位、首席科学家 Jeff Dean 离职,一度让外界对 Gemini 的后续路线感到不安;但从目前情况看,相关项目仍在内部持续推进。

谷歌计划先推出 Gemini 3.8 Flash,一个直接原因是这款模型参数更小、所需计算资源更少,更容易尽快落地。报道称,从今年初开始,谷歌投入了更多人力与算力,专门提升 Gemini 的代码生成能力,尤其加大了对强化学习的投入,希望让模型通过反复试错获得新能力。

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相 4

同时,谷歌 DeepMind 与其他实验室在并行推进多个项目,以降低单一路线失利带来的影响。眼下的局面是,Gemini 3.5 Pro 不及预期,而 Gemini 4.0 还未正式推出。

谷歌先给 Gemini 加上视频理解能力

在新模型正式亮相前,谷歌先对 Gemini 做了一次预热,新增能力为智能体视频理解(Agentic Video Understanding)。

谷歌在官方博客中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 已支持这项能力,入口位于 Google AI Studio 和 Gemini Enterprise Agent Platform。

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相 5

按照谷歌披露的数据,在标准视频分析基准中启用这一功能后,token 消耗最多可下降 88%,分析成本最多可下降 66%,准确率最多可提升 7%。该功能不额外收费,仍按标准 API 的 token 定价执行。

文章将这一变化概括为,Gemini 学会了自己「拖进度条」。以往的处理方式属于静态处理,模型被动接收固定帧率的视频流,帧率由 API 参数预设,模型本身不能决定采样方式。现在则改为由模型自行判断看哪一段、以多快速度看,以及优先分析画面、音频还是转录文本。

报道还将其与此前的 agentic vision 做了对比。后者把代码执行与 Gemini 原生图像理解结合起来,模型可以围绕单张图片自行编写代码,完成放大、裁剪和比对。此次谷歌把类似思路扩展到了视频场景,只是把工具换成了原生视频工具。

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相 6

官方博客列出四类应用场景

根据官方博客,这项能力覆盖几类此前难度较高的视频任务。

  • 亚秒级片段检索:过去模型处理视频时,可能一秒只截取一张图,短于 1 秒的瞬间容易被遗漏。现在可以定位到不足 1 秒的片段。
  • 长视频检索复杂问题:面对数小时素材时,无需把几百万 token 全部消耗一遍再回答问题。
  • 异常检测:模型可以先锁定某个时间窗口,再对该片段提高帧率重新采样,以识别快速运动或细微画面缺陷。文中提到,这对产线质检和安防监控尤其重要,因为异常往往只出现在少数几秒内。
  • 计数任务:例如统计某个动作重复多少次,或画面中有多少个不同物体。此前模型在这类问题上经常出错,原因之一就是关键帧没有被采到。

视频成本下降后,Agent 的能力边界被重新讨论

文章认为,视频一直是多模态任务里成本最高的一类输入。文字成本较低,图片居中,而视频体量大、时长长,一分钟素材就可能消耗大量 token。

这也是为什么过去两年谈论 Agent 时,焦点更多落在阅读、写作和工具调用上。一个主要依赖文字理解世界的 Agent,本质上看到的是经过人转述后的信息。摄像头拍下的画面、会议录像、生产线上的视频,只要没有被转成文字,它就难以直接处理。

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相 7

报道据此判断,随着视频理解成本大幅下降,如果 Agent 能自行浏览数小时监控、几十小时课程,或处理上百条视频素材,又不至于迅速耗尽预算,其接触外部世界的方式也会发生变化。文中将谷歌描述为率先在这一方向上破局的一方。

AI 模型发布节奏继续加快

从文中列举的节奏看,近期多家 AI 公司正密集更新产品。Claude 5.1 已经发布,OpenAI 的下一代 Astra 被指将在本周揭晓,谷歌则准备以 Gemini 3.8 Flash 应战。

文章援引 The Information 的说法称,OpenAI 下一代 Astra 采用了一种名为「循环深度」的推理方法,可在减少思考 token 的同时提升性能。对 Anthropic 而言,这一轮更新后,Claude 的主攻方向被概括为编程和科研。

谷歌预热 Gemini 新模型,3.8 Flash 据称将于明日亮相 8

同时,Gemini 3.8 Flash 也被指将在编程方面迎来更大跃升。文末还提到,OpenAI、Anthropic、谷歌以及 SpaceXAI 已同时加快推进各自模型,另据文中说法,马斯克预告 Grok 4.7 将在 10 天后发布。

参考资料包括谷歌在 X 平台发布的内容,以及 DeepMind 官方博客《introducing agentic video in gemini》。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。