谷歌为 Gemini API 上线视频 Agent,分析成本最高降 66%

谷歌为 Gemini API 上线视频 Agent,分析成本最高降 66%

N
News Editor
2026-09-02 04:03:36
谷歌在 Gemini API 中推出 Agentic Video Understanding,让模型自行决定查看哪些视频片段以及如何检查内容。与默认按 1 FPS 固定抽帧并一次性放入上下文的普通模式相比,新模式可沿时间轴定位片段,并按问题选择画面、音频或转录文本。Google 自测称,Gemini 3.7 Flash 开启后,Token 消耗最高下降 88%,分析成本最高下降 66%,准确率相对提升最高约 7%。

谷歌已在 Gemini API 中上线 Agentic Video Understanding,允许模型自己决定查看哪段视频、以及采用什么方式检查内容。

普通模式下,系统默认按 1 FPS 固定抽帧,再一次性放进上下文。新模式则会沿时间轴自行寻找相关片段,并根据问题选择画面、音频或转录文本。遇到快速动作时,还可以提高帧率重新检查。

Google 自测数据显示,Gemini 3.7 Flash 开启这一功能后,Token 消耗最高下降 88%,分析成本最高下降 66%,准确率相对提升最高约 7%。

按官方介绍,这项能力既可以定位不到 1 秒的瞬间,也可以在几小时的视频中找到某个细节。技术上,它相当于把开发者过去需要自行搭建的「先定位、再精看」流程整合进 Gemini 内部。

目前,Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 均已支持该功能。上传视频和 YouTube 视频都可使用,且不会额外收取功能费用。后续这一能力还将接入 Gemini App 和 YouTube 的 Ask YouTube。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
7900

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。