微软推出 3 款音频模型,分别是 MAI-Transcribe-2-Streaming、MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,覆盖实时语音转文字和文字生成语音两段流程,主要面向低延迟语音 Agent。
实时转写与语音生成同时上线
其中,MAI-Transcribe-2-Streaming 用于实时语音转文字,可以在人还没说完时持续输出文字,支持 60 种语言,并支持自动语言检测。MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 则负责把文字生成语音。
转写准确率与返回速度数据
据 Artificial Analysis 的流式语音转写榜单,MAI-Transcribe-2-Streaming 在最终转写准确率和首个部分转写准确率两项中均排名第一,词错误率为 2.5%。作为对比,Grok Voice Transcribe 2.0 的词错误率为 2.7%,最终文本返回时间为检测到说话结束后约 0.49 秒;MAI-Transcribe-2-Streaming 的最终文本则在检测到说话结束后约 0.13 秒返回。
Flash 版主打低延迟
MAI-Voice-2.1 支持 23 种语言,并允许同一个声线切换不同语言。Flash 版主要压低延迟,模型推理约 45ms,价格为每百万字符 15 美元;标准版推理约 550ms,价格为每百万字符 22 美元。
两款语音生成模型都支持通过一小段参考音频匹配声线。
面向语音 Agent 的等待问题
这套模型组合针对的是语音 Agent 使用中最影响体验的等待环节。系统可以在用户说话时提前开始转写和推理,再由 Flash 版本快速生成语音回复,不需要等完整一句话结束后再启动处理流程。

