阿里通义实验室公布,流式语音识别大模型 Fun-ASR-Realtime 已将首字延迟降至百毫秒级,实现接近“话音刚落即出字”的效果。官方同时表示,这一版本的识别准确率已经逼近离线模型水准。
上下文感知成为这次升级核心
这次迭代的重点不是单纯压缩响应时间,而是强化模型的上下文感知能力。新模型可以结合历史对话和实时热词做动态纠错,例如依据后文语义,将“叶鹿”自动修正为“夜鹭”。这类能力直接对应流式语音识别里最常见的问题:前文信息不完整,容易出现误判。
在实时场景中,系统往往要边听边出字。速度快是一回事,能不能在连续语境里维持稳定识别,才更关键。阿里给出的升级方向,正是围绕这个难点展开。
100小时荒岛直播验证户外复杂场景
Fun-ASR-Realtime 还在一场持续100 小时的荒岛直播中接受了真实环境测试。根据披露的数据,该模型在户外暴雨、多人频繁切换发言的情况下,完成了全程实时字幕支持,累计识别6 万余条内容、共132 万字。
这组数据对应的是单声道、高环境噪音、多人交错发言的应用条件。对实时字幕系统来说,这类场景比实验室环境更难,识别结果是否稳定,往往决定了实际可用性。
支持30种语言和16种方言
方言识别是这次升级中的另一项重点。Fun-ASR-Realtime 目前支持30 种语言和16 种方言,在方言测试中的平均字元准确率达到88.62%。其中,上海话识别准确率为92.41%,温州话达到82.74%。
温州话长期被视为识别难度较高的方言类型。官方将其成绩单单独列出,也说明模型在低资源方言上的泛化表现有所提升。
离线版Fun-ASR-Flash同步上线成绩
除了流式版本,离线版模型 Fun-ASR-Flash 也拿到了新的成绩。阿里称,该模型在全球 AI 评测平台 Artificial Analysis 的字错率排行榜上排名第一。
目前,Fun-ASR-Realtime 与 Fun-ASR-Flash 的 API 服务都已上线阿里云百炼,底层开源工具包和模型则可在魔搭社区与 GitHub 获取。

