豆包推出 Seed Audio 1.0,一次生成最长 2 分钟完整音轨

豆包推出 Seed Audio 1.0,一次生成最长 2 分钟完整音轨

N
News Editor
2026-07-22 07:07:25
字节跳动旗下豆包团队本周发布音频生成模型 Seed Audio 1.0,并在火山方舟体验中心开放创作者测试,企业端 API 也同步邀测。该模型将人声、配乐、音效和环境声纳入同一声学表征,可一次生成最长接近 2 分钟的完整音轨,支持 20 多种语言,并支持零样本多模态参考、100 毫秒级时间轴控制,已整合进豆包 App,国际开发者可通过 BytePlus 接入。
字节跳动豆包Seed Audio 1.0AI音频生成火山方舟BytePlusTTS

字节跳动旗下豆包团队本周正式发布音频生成模型 Seed Audio 1.0,并在火山方舟体验中心开放创作者测试,企业端 API 也同步邀测。这款模型把人声、配乐、音效和环境声视为同一个声音场景中的元素,一次生成最长接近 2 分钟的完整音轨,支持 20 多种语言。

豆包同时称,个人用户可以直接在火山方舟体验中心使用,国际开发者则可通过 BytePlus 接入,模型也已经整合进豆包 App。

不是传统 TTS,而是整段声音场景一起生成

报道提到,过去制作一段配音时,人声、配乐和音效通常需要分别录制,再分别对齐时间轴,最后在剪辑软件中手动拼接。Seed Audio 1.0 的目标,是通过一次推理直接生成完整声音场景,减少中间拼接流程。

与传统 TTS,也就是文字转语音不同,Seed Audio 1.0 并不只是把文本“念出来”。它把人声、背景音乐、音效和环境声都纳入同一个声音场景,再映射进统一的声学表征中处理。换句话说,模型不是把“谁在说话”和“背景在放什么”拆开分别生成,而是将整个场景作为一个整体生成出来。

支持零样本参考,可安排多角色对白和音效

根据介绍,Seed Audio 1.0 支持零样本(zero-shot)多模态参考。用户无需重新训练模型,只要提供一段文本或一段音频作为示例,模型就可以模仿对应声音的音色与风格。

一条提示词可以同时安排多角色对白、背景音乐和拟音特效。即便生成时长拉长到接近 2 分钟,音频中的多个角色音色也不会在中途发生明显偏移。

在控制能力上,该模型的时间轴精度达到 100 毫秒,对白何时开始、音效何时进入,都可以较为精确地对齐。语言方面,模型支持超过 20 种语言,中文、英语和日语都包含在内。报道还提到,音色和风格可以分开调整,不需要为了更换说话方式而重新更换声音。

面向配音、配乐、拟音与混音等创作流程

这套能力对应的应用场景包括影像级音频创作中的配音、配乐、拟音和混音,也延伸到有声书、广播剧、Podcast、短视频、游戏和互动媒体。按报道描述,这相当于把过去需要后期团队分工完成的多项音频工序,集中到一个模型中处理。

把多条生成链路改成同一表征空间

报道指出,过去语音生成通常会把任务拆成多条线分别处理,例如语音合成一条、配乐一条、音效一条,各自训练、各自输出,再由用户手动把结果对齐到同一时间轴上。

Seed Audio 1.0 的做法则相反:先把所有声音元素放进同一个表征空间,再一次完成生成。这样带来的结果是,不同角色的音色,以及场景中的音乐和音效,从生成阶段开始就是同步的,不需要后续再做额外校准。

对比 ElevenLabs:三步生成与一步生成

文章以 ElevenLabs 的 Studio 作为对照。按照文中说法,ElevenLabs 的路径是把语音、音乐和音效拆分为 3 个独立 API 分别生成,用户需要自行在时间轴上拼接和对齐;豆包则试图用一次推理替代这些环节。

价格方面,文中提到 ElevenLabs Pro 月费为 99 美元,而豆包采用火山引擎的 token 计费方式,也就是按用量收费。在中文场景下,报道认为其成本明显更低。

文章最后提到,配音、配乐和音效过去对应的是 3 个工种、3 套软件和 3 次导出流程。Seed Audio 1.0 想验证的是,这些工序是否可以被压缩进同一次推理中完成。至于它能否真正替代影像配音、有声书和 Podcast 等场景中的专业分工,仍要看创作者实际使用后的反馈。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
800

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。