OpenAI 近日公开了新一代语音技术 GPT-Live 的架构细节,重点放在一个过去语音助手较难实现的能力:边听边说。
根据 OpenAI 官方说明,GPT-Live 采用“全双工”(full-duplex)架构,能在用户还在说话时插入“嗯哼”“好”这类即时回应,也可以在自然停顿时接话;即便对话过程中被打断,也不会整段失效,交互方式更接近真人对话。
实时对话走快路径,复杂任务交给后台模型
为了在 ChatGPT 的规模上实现实时语音,OpenAI 表示其从客户端到模型重写了整个语音技术栈。GPT-Live 的设计是让语音走一条专属“快路径”来即时回应,而需要联网搜索、深度推理或代理操作的复杂任务,则交给后台一个更强的前沿模型异步处理。
OpenAI 提到,在发布时承担这类后台任务的是 4 月推出的 GPT-5.5。处理这类任务时,主模型仍可继续与用户对话,不需要停下来等待结果。OpenAI 也表示,其大幅缩短了语音会话的启动延迟。
盲测中偏好度高于原先进阶语音模式
在 5 到 10 分钟对话的人类盲测中,OpenAI 称 GPT-Live-1 相较原本的进阶语音模式(Advanced Voice Mode)获得约 75.7% 的偏好率,较轻量的 GPT-Live-1 mini 也获得约 69.2%。
GPT-Live 已于 7 月上线,这次公开的内容主要是其背后架构如何运作。OpenAI 也借此说明,语音交互正从“一问一答”转向更自然的来回对话。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

