马斯克领导的 xAI 在生成式 AI 语音赛道发起强攻。2026 年 4 月 30 日,xAI 官方宣布推出 自订语音(Custom Voices) 与全新 语音库(Voice Library) 功能,允许个人与企业以极低门槛将自己的声音融入 AI 应用。用户只需在 xAI 控制台录音几秒到一分钟,系统便能在 不到 2 分钟 内完成专属语音模型构建,随后立即用于 Grok 的文字转语音(TTS)服务与 Voice Agent API。
五大核心场景:从客服到无障碍辅助
xAI 官方列举了该技术的五项关键应用:品牌客服代理可用统一声音提升企业形象;内容创作者能用自己声音大规模旁白影片或生成有声书;跨国企业 CEO 能以 同一声音切换 28 种语言 发表演讲;游戏与元宇宙中�� NPC 角色可快速配音;为渐冻症等罕见病患者永久保留其原始声音特征。
防滥用机制:禁止上传录音,双重验证
为避免语音克隆被用于深度伪造(Deepfake)诈骗,xAI 设置了严格安全屏障:系统 绝对无法使用现有录音档案进行声音复制。用户必须即时录音,并朗读一段随机生成的验证短句(Passphrase)。AI 通过语音转文字确认内容,再比对语音嵌入向量以确保朗读者与原始录音者为同一人。这套 双因子验证 从根本上阻断黑客利用他人音档“偷声音”的可能。
语音库上线,自订语音免费调用
同步推出的语音库(Voice Library)让开发团队统一管理所有自订与内建语音。目前语音库已内建超过 80 种高品质语音,支援 28 种语言,用户可自由预览。xAI 强调,使用自订语音功能 完全不收取额外费用,且完整支援原有 TTS 系统的高级功能(如语音标签、即时串流等)。用户只需在 API 中指定专属 voice_id 即可调用,大幅降低企业导入专属语音 AI 的成本门槛。

