腾讯混元开源 15 亿参数语音生成与编辑模型 AuK,并将其称为「音频版 Nano Banana」。该模型把声音克隆、改词、情绪切换、去口音、语速和音高调整、降噪,以及多人和音乐分离整合进同一个模型,还支持通过自然语言控制。
据 BlockBeats 引述动察 Beating AI 快讯,AuK 可以直接编辑已有录音。录音中如果只说错几个字,只需要修改对应片段,无需整段重录。在内容不变的情况下,模型也可以调整情绪、音色或口音,还支持改歌词、去掉笑声和咳嗽声,以及把正常说话改成耳语。
在声音克隆方面,AuK 不需要先为参考录音准备文字稿。只要提供一段声音和新的文本,就可以生成对应语音。
官方测试显示,AuK 在语音生成和通用语音编辑的多项评测中领先。其中,SpeechEditBench 得分为 49.73,第二名 Ming-UniAudio 为 28.70。
腾讯还公布了快速版 AuK-Flash。该版本经过蒸馏后只需 4 步推理,速度约快 4.5 倍。
不过,论文也提到,AuK 目前还不能稳定理解所有随意输入的自然语言指令,仍需依赖 Prompt Enhancer 先判断任务、整理参数并改写指令。
目前,AuK 的代码和模型权重已经公开,采用 MIT 许可证。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

