由前OpenAI CTO Mira Murati 领导的 Thinking Machines Lab 近日发布了名为“交互式模型”(Interactive Models)的研究预览,标志着语音AI交互领域迎来重大技术突破。与传统的轮询式语音助手不同,这一新模型能够同时接收用户输入并生成响应,从而实现类似电话通话般的流畅对话体验。
技术突破:实时全双工
传统语音助手通常采用走一步等一步的“半双工”模式,用户说完一段话后需等待模型处理并回应,无法在讲话时被实时打断或插入新信息。而 Thinking Machines Lab 推出的全双工技术则打破了这一限制。模型能够在用户还未说完一句话时,便自动理解上下文并开始准备回应,使得整个交互过程更加自然、高效,接近于人类之间的电话交谈。
性能指标:0.40 秒响应延迟
据报道,发布的 TML-Interaction-Small 模型在测试中实现了约 0.40 秒 的响应时间。这意味着从用户停止说话到 AI 开始回应的延迟极短,几乎感觉不到停顿。这种低延迟对于需要即时反馈的应用场景尤为关键,例如实时翻译、语音游戏或紧急任务助手等。
路线图与应用前景
目前该技术仍处于研究预览阶段,尚未对公众开放。Thinking Machines Lab 计划在未来几个月内启动有限的研究预览,并预计在今年晚些时候进行更广泛的推出。公司表示,目标是将交互式能力直接集成到模型底层,有望彻底改变语音助手和对话式 AI 产品的使用方式。不过,实际应用中的用户体验和性能稳定性仍有待产品正式发布后的检验。
Mira Murati 作为前 OpenAI 首席技术官,其领导的新实验室此番展示的成果,引发了行业极大关注。业内人士认为,如果全双工语音模型能够顺利商,将大幅提升智能客服、车载语音系统、个人虚拟助理等领域的交互体验,甚至可能催生全新的对话式 AI 应用场景。当然,从预览到成熟产品通常需要经历持续优化与迭代,我们也期待看到更多细节与技术评测结果。

