xAI 已正式向外部开发者开放独立的 Grok 语音转文字(STT) 与 文字转语音(TTS) API。该公司表示,这套语音基础设施并非实验性产品,而是已经运行在 Grok Voice、特斯拉车辆语音��互以及 Starlink 客服系统 中的同一技术栈。
STT按小时计费,支持批处理与实时串流
根据官方说明,Grok STT API 提供两种接入方式:一是通过 REST API 进行批处理,二是通过 WebSocket API 进行低延迟实时串流。价格方面,批处理为 每小时 0.10 美元,串流为 每小时 0.20 美元。xAI 称,其定价相比 ElevenLabs 和 Deepgram 等主流竞品更低。
功能上,Grok STT 支持 25 种以上语言,并提供词级时间戳、说话者区分、多声道音频处理,以及智能反向文本规范化能力。这类能力更适合会议转录、法律记录、医疗记录和客服通话日志等对准确度要求较高的场景。信息很直接,定位也很明确。
实体识别测试中,错误率低于多家竞品
在电话通话场景的实体识别基准测试中,Grok STT 针对姓名、账号、日期等关键实体的错误率为 5.0%。作为对比,ElevenLabs 为 12.0%,Deepgram 为 13.5%,AssemblyAI 为 21.3%。这一组数据也是 xAI 此次对外发布中最受关注的部分。
TTS提供5种音色,支持语音标签细调
Grok TTS API 则提供 5 种语音风格,包括 Ara、Eve、Leo、Rex 和 Sal,覆盖女声、男声与中性风格。系统可自动检测输入语言,原生支持 20 种以上语言,并可通过 BCP-47 语言代码控制发音。
输出格式方面,Grok TTS 支持 MP3、WAV、PCM(Linear16)、G.711 μ-law 以及 G.711 A-law。其中后两种编码常见于电话系统,显示出这套 API 也在兼顾电信场景接入。价格为 每百万字符 4.20 美元。
这套 TTS API 还加入了“语音标签”功能,开发者可以在文本中嵌入控制指令,用来调节停顿、笑声、耳语、语调强调、语速和音高,让合成语音的表达更细。
底层能力已用于特斯拉与Starlink业务
xAI 强调,这次开放的 STT 和 TTS 独立端点,来自已经在内部产品中部署的同一套基础设施,而不是单独新建的接口。按官方说法,这套底层能力曾在 2025 ���底 以 Grok Voice Agent API 形式亮相,主打实时语音对话代理。
当时,Grok Voice Agent API 在 Big Bench Audio 基准测试中排名第一,首次音频响应时间低于 1 秒,约为最近竞争对手的 5 倍速度。如今 xAI 将整合式语音管道拆分成独立组件开放,开发者可以按自身需求调用 STT 或 TTS,或自行组合成完整语音应用。

