Google 推出 Gemini 3.5 Transcribe,支持 85 种以上语言与三人说话人识别
Google 为 Gemini Audio 推出新转录模型 Gemini 3.5 Transcribe,支持自动识别 85 种以上语言、最多区分 3 位说话人,并可删除「嗯、啊」等口头禅。官方称其相较前代 Chirp 3 将最终转录延迟缩短 70%,但在第三方榜单 Artificial Analysis 的 AA-WER 排名中,其字错率和价格都未居首位。该功能已在 macOS 版 Gemini app 以英文上线,开发者也可通过 Gemini API 公开预览测试。








