Google 于 15 日推出 Gemini 3.1 Flash TTS,并同步接入 Gemini API、Google AI Studio、Vertex AI 与 Google Vids。新模型支持 70 多种语言,还新增“音频标签(Audio Tags)”功能,允许开发者直接用自��语言指令控制 AI 配音的节奏、语气和口音。
排行榜成绩指向高质量与低成本
按照 Google 引用的第三方数据,Gemini 3.1 Flash TTS 在 Artificial Analysis TTS 排行榜中拿到 Elo 1,211。该榜单基于数千笔盲测人类偏好数据,Google 将这一成绩解读为模型同时具备较高的语音生成质量与成本优势。除了多语言覆盖,这一版本也原生支持多说话者对话场景。
音频标签把语音控制拆得更细
这次更新的核心在于音频标签。Google 将这套能力分成几个层次:先由开发者设定场景背景和对话指令,让不同角色在多轮对话里维持统一语境;再通过 Audio Profiles 定义角色声线,配合 Director’s Notes 调整节奏、语气和口音;如果需要在句中临时切换表达方式,还可以使用 Inline Tags 完成更细粒度的控制。
Google 提到,在参数确认后,相关设置还能直接导出为 Gemini API 代码,方便在不同项目和平台之间复用同一套声音风格。StyleUAI、HeyGen、Invideo AI、Sierra 等参与早期测试的企业给出了正面反馈,认为这套机制可以把普通文本转成更有情绪层次的语音表达。
所有生成音频默认加入 SynthID 水印
Gemini 3.1 Flash TTS 生成的全部音频都内置 SynthID 水印。这类标记会嵌入音频波形中,通常难以被察觉,但系统可以可靠检测。Google 将其用于识别 AI 生成内容,并作为内容溯源机制的一部分,以降低错误信息传播风险。
在产品开放范围上,开发者目前可通过 Gemini API 和 Google AI Studio 体验,企业用户可经由 Vertex AI 调用,Google Workspace 和个人账号用户则可在 Google Vids 中直接使用。Google 同时表示,Google Vids 还新增了 16 种支持语言。

