4月16日(UTC+8),阶跃星辰正式发布StepAudio 2.5 TTS。与传统依赖预设情绪标签的文本转语音系统不同,新版本的核心突破在于:用户可直接通过自然语言描述发音风格、情绪层次与表达细节,从而实现更高精度的语音合成控制。比如,系统不再只是接受“悲伤”这样的单一标签,而是可以理解并执行“克制的悲伤、不要哭腔、带一点轻微颤抖”这类更细腻的要求。
从“选标签”走向“提要求”
这一变化意味着TTS控制范式正在发生明显转向。过去,用户通常只能从有限的情绪标签中做选择,例如开心、悲伤、愤怒等,表达空间较为粗放。StepAudio 2.5则将控制方式升级为自然语言驱动,允许创作者像与真人配音导演沟通一样,直接描述语速、停顿、重音、气声甚至角色潜台词。
根据披露信息,StepAudio 2.5的控制能力主要分为三层。首先是全局语境控制,用于设定整段语音或多轮对话的整体氛围和人物情绪,确保角色表达在长文本场景下保持一致。其次是文内语境控制,可在句子层面细调语调、节奏、停顿、重读和呼吸感,使语音更接近真实表演。第三是零样本语音克隆,即无需额外训练,只需参考一段声音样本即可复刻目标音色,并且情绪与风格仍可独立调整。
目前,上述三项能力已在阶跃星辰开放平台及Step Plan上全面开放。这意味着无论是内容创作者、智能语音产品开发者,还是面向客服、教育、娱乐等场景的企业用户,都能更低门槛地调用更灵活的语音生成能力。
谷歌同日发布,行业方向进一步明确
值得关注的是,就在同一天,谷歌也发布了Gemini 3.1 Flash TTS。公开信息显示,该产品同样采用自然语言替代传统SSML标签,以实现更精细的语音调制,并在第三方评测中取得领先表现。两家机构几乎同步推出类似思路的产品,传递出一个较为清晰的行业信号:TTS赛道正在从“结构化标签控制”快速迈向“自然语言指令控制”。
这一趋势背后,是生成式AI在理解复杂人类意图方面的持续进步。对于音频内容制作而言,以往为了微调一句台词的情绪,往往需要多轮录制与反复修改,而现在,一句描述性的指令就可能完成过去多次沟通才能实现的效果。对配音导演、播客制作者、有声书平台以及虚拟人应用而言,这种效率提升具备直接商业价值。
对AI音频与相关市场的潜在影响
尽管这则消息并非直接的加密资产发行、融资或链上协议更新,但它对加密行业关注的AI赛道仍有重要参考意义。近年来,AI与Web3的结合持续升温,尤其是在数字身份、虚拟人、链上内容分发、AI Agent及创作者经济等领域,语音生成技术正成为关键基础设施之一。更高精度的TTS能力,有望提升去中心化内容平台、元宇宙交互产品以及链上数字角色的用户体验。
从市场层面看,这类技术进展通常会强化投资者对“AI+Crypto”叙事的关注度。虽然新闻中未涉及具体代币、融资规模或商业化收入数据,但StepAudio 2.5与Gemini 3.1 Flash TTS在同日聚焦自然语言控声,说明头部技术路径正在收敛。对于布局AI基础设施、去中心化算力、数字内容生成和虚拟人生态的项目而言,这种技术成熟度提升可能被市场视为中长期利好。
同时,也需要看到,语音克隆与高拟真情绪合成的普及,可能带来版权、身份验证、内容真实性与监管合规等问题。原始素材提到,全球加密政策讨论未来可能会将此类工具纳入更广泛的监管框架。若高质量语音生成能力进一步与链上身份系统、数字资产确权或内容分发协议结合,那么围绕授权、溯源和滥用防范的制度建设将变得更为重要。
结语
总体来看,StepAudio 2.5 TTS的发布,不只是一次产品升级,更代表了语音生成技术交互方式的明显演进:用户不再被动适应机器的标签体系,而是可以直接用自然语言表达创作意图。加之谷歌同日推出相似方向的产品,TTS行业的新阶段已逐渐清晰。未来,随着这类能力在开放平台上的进一步普及,AI音频工具或将在内容生产、虚拟角色、智能助手乃至Web3数字生态中扮演更核心的角色。

