Gradium 上线 Voice Design,可用文本描述生成合成语音
巴黎语音 AI 公司 Gradium 推出 Voice Design,用户输入一段文本描述后,可在几秒内生成全新的合成语音,无需参考音频。该功能已上线其 API 和 Studio,免费层在内的所有套餐均可使用,支持英语、法语、西班牙语、葡萄牙语和德语。Gradium 披露的盲测结果显示,其在口音提示对比测试中的胜率为 72.6%,领先于 ElevenLabs、Inworld 等竞争对手。

巴黎语音 AI 公司 Gradium 推出 Voice Design,用户输入一段文本描述后,可在几秒内生成全新的合成语音,无需参考音频。该功能已上线其 API 和 Studio,免费层在内的所有套餐均可使用,支持英语、法语、西班牙语、葡萄牙语和德语。Gradium 披露的盲测结果显示,其在口音提示对比测试中的胜率为 72.6%,领先于 ElevenLabs、Inworld 等竞争对手。

AI 语音生成初创公司 Fish Audio 宣布完成 5200 万美元种子轮融资,Coreline Ventures 和 Capital Today 领投,359 Capital、Parable、Play Time 等参投。公司由前英伟达研究员 Shijia Liao 创立,过去一年推出 5 款模型,包括 4 款语音生成模型和 1 款语音转文本模型。

中国“数字永生”服务已出现分层收费,最低在淘宝 10 元人民币起,完整定制数字人约 5 万元人民币起,部分平台还推出首年 1,980 元、次年 2,980 元的订阅制。剑桥大学研究团队警告,这类“数字来生产业”可能借悲伤收费、在对话中植入广告。台湾地区立法委员翁晓玲已于 7 月 7 日提出修法主张,立法机构法制部门也建议为利用技术合成不实影像辱骂死者的行为设定罚则,最高可加重至 2 年以下有期徒刑。

AI 语音初创公司 Fish Audio 周二宣布完成 5000 万美元种子轮融资,由 Coreline Ventures 和 Capital Today 领投,359 Capital 等机构参投。该项目由英伟达前研究员 Shijia Liao 发起,Fish Speech 开源代码库目前在 GitHub 获得超 3.1 万颗 Star。过去一年,Fish Audio 推出 5 款模型,其中最新的 S2.1 Pro 仅通过付费 API 提供服务。公司称,自去年推出以来,其开源及托管版本模型已吸引超过 800 万用户,ARR 达到 2100 万美元。

YouTube已将“肖像检测”工具开放给所有18岁以上创作者及部分普通成年人申请使用,用于识别平台上的AI深伪人脸内容,并由当事人发起下架请求。

xAI已正式开放Grok语音转文字与文字转语音API,相关技术已用于Grok Voice、特斯拉车载语音和Starlink客服系统。STT支持25种以上语言,TTS定价为每百万字符4.2美元。
