阿里巴巴于 9 月 19 日发布新一代实时同步口译模型 Qwen3.8-LiveTranslate。根据 Qwen 团队在官方账号公布的说明,这一版本采用 Interleave 架构,在 60 种语言上把平均延迟从 2.8 秒降到 2.3 秒,同时在忠实度、流畅度和简洁度上都有改善。
平均延迟从 2.8 秒降到 2.3 秒
同步口译面对的核心取舍,是等待时间与准确度之间的平衡。模型听得越久,掌握的语义通常越完整,翻译也会更准确,但用户等待的时间也会更长。
官方采用的衡量指标是平均延迟 LAAL,也就是译文相对原文平均落后多少时间。这一版把该数值从 2.8 秒压到 2.3 秒,缩短约 0.5 秒。按照官方说法,在口译场景里,这半秒会影响对话节奏是否被打断。
三项新功能都指向多人对话场景
官方列出的三项新能力,方向较为一致。
- 第一,即时区分说话人。模型可以在多人同时发言的场合分辨是谁在说话,并通过更稳定的声音复制,让不同说话者的译文保留各自音色。
- 第二,原文与译文同步显示,两种语言会同时出现在画面上。
- 第三,长上下文消歧。模型会利用此前的对话内容判断人名和专业术语,让同一个词在整场对话中的翻译保持一致。
这三项功能对应的,都是单向逐句翻译难以处理的情况:会议中有多名发言者、听众需要对照原文,以及同一专有名词在一场对话里反复出现。
通过 QwenCloud 提供,未见开源权重
Qwen3.8-LiveTranslate 目前通过 QwenCloud 提供,官方公告中给出的是博客和云服务链接。ABMedia 查询 Hugging Face 后表示,尚未看到这一模型的权重上架,这与 Qwen 系列部分版本采用开源方式的做法不同。
同属 Qwen 3.8 系列的文本模型则可以在本地运行。报道提到,Vitalik 此前实测其在笔记本电脑上的推理速度约为每秒 33 个 token。
本文最早刊载于链新闻 ABMedia。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

