微软发布 3 款音频模型,语音 Agent 生成延迟最低 45ms

微软发布 3 款音频模型,语音 Agent 生成延迟最低 45ms

N
News Editor
2026-10-03 02:32:34
微软一次推出 MAI-Transcribe-2-Streaming、MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 三款音频模型,补齐语音 Agent 的实时转写与语音生成链路。其流式转写支持 60 种语言和自动语言检测,词错误率为 2.5%;Flash 版语音生成推理约 45ms,价格为每百万字符 15 美元,标准版约 550ms、价格 22 美元。

微软推出 3 款音频模型,分别是 MAI-Transcribe-2-Streaming、MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,覆盖实时语音转文字和文字生成语音两段流程,主要面向低延迟语音 Agent。

实时转写与语音生成同时上线

其中,MAI-Transcribe-2-Streaming 用于实时语音转文字,可以在人还没说完时持续输出文字,支持 60 种语言,并支持自动语言检测。MAI-Voice-2.1 和 MAI-Voice-2.1-Flash 则负责把文字生成语音。

转写准确率与返回速度数据

据 Artificial Analysis 的流式语音转写榜单,MAI-Transcribe-2-Streaming 在最终转写准确率和首个部分转写准确率两项中均排名第一,词错误率为 2.5%。作为对比,Grok Voice Transcribe 2.0 的词错误率为 2.7%,最终文本返回时间为检测到说话结束后约 0.49 秒;MAI-Transcribe-2-Streaming 的最终文本则在检测到说话结束后约 0.13 秒返回。

Flash 版主打低延迟

MAI-Voice-2.1 支持 23 种语言,并允许同一个声线切换不同语言。Flash 版主要压低延迟,模型推理约 45ms,价格为每百万字符 15 美元;标准版推理约 550ms,价格为每百万字符 22 美元。

两款语音生成模型都支持通过一小段参考音频匹配声线。

面向语音 Agent 的等待问题

这套模型组合针对的是语音 Agent 使用中最影响体验的等待环节。系统可以在用户说话时提前开始转写和推理,再由 Flash 版本快速生成语音回复,不需要等完整一句话结束后再启动处理流程。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。