谷歌已在 Gemini API 中上线 Agentic Video Understanding,允许模型自己决定查看哪段视频、以及采用什么方式检查内容。
普通模式下,系统默认按 1 FPS 固定抽帧,再一次性放进上下文。新模式则会沿时间轴自行寻找相关片段,并根据问题选择画面、音频或转录文本。遇到快速动作时,还可以提高帧率重新检查。
Google 自测数据显示,Gemini 3.7 Flash 开启这一功能后,Token 消耗最高下降 88%,分析成本最高下降 66%,准确率相对提升最高约 7%。
按官方介绍,这项能力既可以定位不到 1 秒的瞬间,也可以在几小时的视频中找到某个细节。技术上,它相当于把开发者过去需要自行搭建的「先定位、再精看」流程整合进 Gemini 内部。
目前,Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 均已支持该功能。上传视频和 YouTube 视频都可使用,且不会额外收取功能费用。后续这一能力还将接入 Gemini App 和 YouTube 的 Ask YouTube。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

