Techub News 消息,Meta Superintelligence Labs 本周发布了实时音频感知模型 Muse Voice Transcribe。
该模型将流式自动语音识别、超过 20 人的说话人分离和端点检测三项任务整合到一个自回归模型中,无需后处理。Muse Voice Transcribe 已作为托管 API 上线 Meta Model API,价格为每 1000 音频分钟 3 美元,也已经为 Meta AI for Mac 和 Muse Code 的听写功能提供支持。
训练方面,该模型基于 70 多种语言进行训练,其中 25 种在发布时经过广泛验证和推荐。模型原生支持超过一小时的音频输入和 20 多名说话人,同样不需要后处理步骤。
Meta 报告称,截至 2026 年 9 月 1 日,Muse Voice Transcribe 在 Artificial Analysis 的流式语音转文本和公开的说话人分离基准测试中均排名第一。消息援引自 MarkTechPost。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

