Google发布Gemini 3.1 Flash TTS:支持70多种语言,新增音频标签

Google发布Gemini 3.1 Flash TTS:支持70多种语言,新增音频标签

N
News Editor 01
2026-07-22 22:55:14
Google推出Gemini 3.1 Flash TTS,支持70多种语言,并加入音频标签功能,开发者可用自然语言控制语速、语气和口音。该模型已在Gemini API、Google AI Studio、Vertex AI和Google Vids上线。
GoogleGeminiTTSAI语音音频标签

Google 于 15 日推出 Gemini 3.1 Flash TTS,并同步接入 Gemini API、Google AI Studio、Vertex AI 与 Google Vids。新模型支持 70 多种语言,还新增“音频标签(Audio Tags)”功能,允许开发者直接用自��语言指令控制 AI 配音的节奏、语气和口音。

排行榜成绩指向高质量与低成本

按照 Google 引用的第三方数据,Gemini 3.1 Flash TTS 在 Artificial Analysis TTS 排行榜中拿到 Elo 1,211。该榜单基于数千笔盲测人类偏好数据,Google 将这一成绩解读为模型同时具备较高的语音生成质量与成本优势。除了多语言覆盖,这一版本也原生支持多说话者对话场景。

音频标签把语音控制拆得更细

这次更新的核心在于音频标签。Google 将这套能力分成几个层次:先由开发者设定场景背景和对话指令,让不同角色在多轮对话里维持统一语境;再通过 Audio Profiles 定义角色声线,配合 Director’s Notes 调整节奏、语气和口音;如果需要在句中临时切换表达方式,还可以使用 Inline Tags 完成更细粒度的控制。

Google 提到,在参数确认后,相关设置还能直接导出为 Gemini API 代码,方便在不同项目和平台之间复用同一套声音风格。StyleUAI、HeyGen、Invideo AI、Sierra 等参与早期测试的企业给出了正面反馈,认为这套机制可以把普通文本转成更有情绪层次的语音表达。

所有生成音频默认加入 SynthID 水印

Gemini 3.1 Flash TTS 生成的全部音频都内置 SynthID 水印。这类标记会嵌入音频波形中,通常难以被察觉,但系统可以可靠检测。Google 将其用于识别 AI 生成内容,并作为内容溯源机制的一部分,以降低错误信息传播风险。

在产品开放范围上,开发者目前可通过 Gemini API 和 Google AI Studio 体验,企业用户可经由 Vertex AI 调用,Google Workspace 和个人账号用户则可在 Google Vids 中直接使用。Google 同时表示,Google Vids 还新增了 16 种支持语言

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。