在 Claude 5.1 发布、OpenAI Astra 临近亮相之际,谷歌也传出新进展。最新爆料称,Gemini 3.8 Flash 将在明日登场。

比起 3.8 Flash 的发布时间,外界此前更关心 Gemini 3.5 Pro 何时推出。不过,报道给出的信息是,谷歌已放弃这一版本,下一代大版本将转向 Gemini 4.0。
Gemini 3.5 Pro 被取消,4.0 仍在推进
文中提到,自今年 5 月 I/O 大会预告以来,至今已过去近 4 个月,Gemini 3.5 Pro 的进化程度甚至不及 Flash 版本,谷歌因此选择放弃这一产品线。
报道援引《华尔街日报》的独家爆料称,Gemini 4.0 在预训练阶段评估表现优秀,后训练工作仍在顺利进行。与此同时,Gemini 3.8 Flash 的代号为「Skimaki」,其编程能力被列为这次更新的重点之一。

据称,在谷歌内部编码工具 Jetski 的对比测试中,3.8 Flash 的表现超过了 Opus 模型。这款模型已研发数月,启动时间还早于谷歌领导层发生重大调整之前。
原文还提到,Hassabis 让位、首席科学家 Jeff Dean 离职,一度让外界对 Gemini 的后续路线感到不安;但从目前情况看,相关项目仍在内部持续推进。
谷歌计划先推出 Gemini 3.8 Flash,一个直接原因是这款模型参数更小、所需计算资源更少,更容易尽快落地。报道称,从今年初开始,谷歌投入了更多人力与算力,专门提升 Gemini 的代码生成能力,尤其加大了对强化学习的投入,希望让模型通过反复试错获得新能力。

同时,谷歌 DeepMind 与其他实验室在并行推进多个项目,以降低单一路线失利带来的影响。眼下的局面是,Gemini 3.5 Pro 不及预期,而 Gemini 4.0 还未正式推出。
谷歌先给 Gemini 加上视频理解能力
在新模型正式亮相前,谷歌先对 Gemini 做了一次预热,新增能力为智能体视频理解(Agentic Video Understanding)。
谷歌在官方博客中表示,Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite 已支持这项能力,入口位于 Google AI Studio 和 Gemini Enterprise Agent Platform。

按照谷歌披露的数据,在标准视频分析基准中启用这一功能后,token 消耗最多可下降 88%,分析成本最多可下降 66%,准确率最多可提升 7%。该功能不额外收费,仍按标准 API 的 token 定价执行。
文章将这一变化概括为,Gemini 学会了自己「拖进度条」。以往的处理方式属于静态处理,模型被动接收固定帧率的视频流,帧率由 API 参数预设,模型本身不能决定采样方式。现在则改为由模型自行判断看哪一段、以多快速度看,以及优先分析画面、音频还是转录文本。
报道还将其与此前的 agentic vision 做了对比。后者把代码执行与 Gemini 原生图像理解结合起来,模型可以围绕单张图片自行编写代码,完成放大、裁剪和比对。此次谷歌把类似思路扩展到了视频场景,只是把工具换成了原生视频工具。

官方博客列出四类应用场景
根据官方博客,这项能力覆盖几类此前难度较高的视频任务。
- 亚秒级片段检索:过去模型处理视频时,可能一秒只截取一张图,短于 1 秒的瞬间容易被遗漏。现在可以定位到不足 1 秒的片段。
- 长视频检索复杂问题:面对数小时素材时,无需把几百万 token 全部消耗一遍再回答问题。
- 异常检测:模型可以先锁定某个时间窗口,再对该片段提高帧率重新采样,以识别快速运动或细微画面缺陷。文中提到,这对产线质检和安防监控尤其重要,因为异常往往只出现在少数几秒内。
- 计数任务:例如统计某个动作重复多少次,或画面中有多少个不同物体。此前模型在这类问题上经常出错,原因之一就是关键帧没有被采到。
视频成本下降后,Agent 的能力边界被重新讨论
文章认为,视频一直是多模态任务里成本最高的一类输入。文字成本较低,图片居中,而视频体量大、时长长,一分钟素材就可能消耗大量 token。
这也是为什么过去两年谈论 Agent 时,焦点更多落在阅读、写作和工具调用上。一个主要依赖文字理解世界的 Agent,本质上看到的是经过人转述后的信息。摄像头拍下的画面、会议录像、生产线上的视频,只要没有被转成文字,它就难以直接处理。

报道据此判断,随着视频理解成本大幅下降,如果 Agent 能自行浏览数小时监控、几十小时课程,或处理上百条视频素材,又不至于迅速耗尽预算,其接触外部世界的方式也会发生变化。文中将谷歌描述为率先在这一方向上破局的一方。
AI 模型发布节奏继续加快
从文中列举的节奏看,近期多家 AI 公司正密集更新产品。Claude 5.1 已经发布,OpenAI 的下一代 Astra 被指将在本周揭晓,谷歌则准备以 Gemini 3.8 Flash 应战。
文章援引 The Information 的说法称,OpenAI 下一代 Astra 采用了一种名为「循环深度」的推理方法,可在减少思考 token 的同时提升性能。对 Anthropic 而言,这一轮更新后,Claude 的主攻方向被概括为编程和科研。

同时,Gemini 3.8 Flash 也被指将在编程方面迎来更大跃升。文末还提到,OpenAI、Anthropic、谷歌以及 SpaceXAI 已同时加快推进各自模型,另据文中说法,马斯克预告 Grok 4.7 将在 10 天后发布。
参考资料包括谷歌在 X 平台发布的内容,以及 DeepMind 官方博客《introducing agentic video in gemini》。

