OpenAI公开 GPT-Live 语音架构:支持边听边说,复杂任务交给后台模型

OpenAI公开 GPT-Live 语音架构:支持边听边说,复杂任务交给后台模型

N
News Editor
2026-08-04 06:41:33
OpenAI 近日公开新一代语音技术 GPT-Live 的架构细节,核心是全双工语音能力,可在用户说话过程中给出实时回应,并在自然停顿时接话。官方称,其将实时对话放在专属“快路径”处理,把联网搜索、深度推理和代理操作等复杂任务交给后台更强模型异步完成。OpenAI 还披露,在 5 到 10 分钟的人类盲测中,GPT-Live-1 对原先进阶语音模式的偏好率约为 75.7%,GPT-Live-1 mini 为 69.2%。

OpenAI 近日公开了新一代语音技术 GPT-Live 的架构细节,重点放在一个过去语音助手较难实现的能力:边听边说。

根据 OpenAI 官方说明,GPT-Live 采用“全双工”(full-duplex)架构,能在用户还在说话时插入“嗯哼”“好”这类即时回应,也可以在自然停顿时接话;即便对话过程中被打断,也不会整段失效,交互方式更接近真人对话。

实时对话走快路径,复杂任务交给后台模型

为了在 ChatGPT 的规模上实现实时语音,OpenAI 表示其从客户端到模型重写了整个语音技术栈。GPT-Live 的设计是让语音走一条专属“快路径”来即时回应,而需要联网搜索、深度推理或代理操作的复杂任务,则交给后台一个更强的前沿模型异步处理。

OpenAI 提到,在发布时承担这类后台任务的是 4 月推出的 GPT-5.5。处理这类任务时,主模型仍可继续与用户对话,不需要停下来等待结果。OpenAI 也表示,其大幅缩短了语音会话的启动延迟。

盲测中偏好度高于原先进阶语音模式

在 5 到 10 分钟对话的人类盲测中,OpenAI 称 GPT-Live-1 相较原本的进阶语音模式(Advanced Voice Mode)获得约 75.7% 的偏好率,较轻量的 GPT-Live-1 mini 也获得约 69.2%。

GPT-Live 已于 7 月上线,这次公开的内容主要是其背后架构如何运作。OpenAI 也借此说明,语音交互正从“一问一答”转向更自然的来回对话。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
9600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。