Meta Superintelligence Labs 发布 Muse Voice Transcribe,把实时语音转文字、区分说话人以及判断“用户是否已经说完”这三件事放进同一个模型里。它最长能处理超过 1 小时的音频,并同时分辨出 20 多个说话人。
英文实时转写测试:WER 3.1%,低于两款竞品
在 Artificial Analysis 的英文实时转写测试里,Muse Voice Transcribe 的词错误率(WER,越低越好)为 3.1%。作为对比,GPT Live Transcribe 是 3.9%,Gemini 3.5 Transcribe Live 是 4.0%。
延迟控制:每 80ms 决定一次“继续听还是开始输出”
说话结束后约 0.16 秒,模型就能给出最终文本。它没有给所有词固定同一个等待时长,而是每次读取 80ms 音频,再自己判断该继续听,还是开始输出。简单词可以更快写出,难词则多听一些上下文再确认。Meta 用强化学习同时优化准确率和延迟。
多语言、集成与定价
该模型使用 70 多种语言训练,其中 25 种已经做过重点验证,还可以直接识别同一句话里中英文混说。
目前 Muse Voice Transcribe 已经接入 Meta AI for Mac 和 Muse Code,也开放了 Meta Model API。价格为每 1000 分钟 3 美元,换算下来约每小时 0.18 美元。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

