ElevenLabs 发布新一代语音模型 Eleven v4 和实时版 Eleven v4 Turbo。前者主打更自然的情绪表达和更细的声音控制,后者面向实时语音 Agent。
TTS 盲测榜排名升至第一
Artificial Analysis 最新 TTS 盲测榜显示,Eleven v4 目前以 1315 Elo 排名第一。作为对比,Cartesia Sonic 3.6 的得分为 1275,Gemini 3.8 Flash TTS 为 1267,Qwen-Audio-3.0-TTS-Plus 为 1258。
上一代 Eleven v3 目前得分为 1169,排在第 17 位。
v4 延续语音控制能力并提升精度
v3 已支持笑声、耳语等音频标签,v4 主要是在这套控制能力上提升准确性。用户可以直接指定语气、节奏、情绪和音效,也可以用自然语言描述一句话该如何表达。
模型的语言覆盖也从 70 多种扩展到 90 多种。Instant Voice Clone 约需 10 秒音频,并增强了长文本和多人对话场景中的声音一致性。
Turbo 侧重实时对话速度
Eleven v4 Turbo 主要针对实时对话的速度问题。官方文档显示,v3 Conversational 的中位推理延迟约为 280ms,v4 Turbo 已降至约 100ms。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

