OpenAI 于 7 月 23 日宣布,ChatGPT 的语音功能 ChatGPT Voice 已正式接入桌面版 App。用户可以只通过语音操控电脑,同时指挥在 ChatGPT Work 或 Codex 中运行的多个 AI 代理。该功能由 OpenAI 的实时语音模型 GPT-Live 驱动,并于当日起在 macOS 和 Windows 面向全球推出。
GPT-Live 支持一边对话一边协调任务
ChatGPT Voice 的核心是 GPT-Live 这套实时语音模型。按照 OpenAI 的说法,这套模型让 ChatGPT 可以一边听、一边说,并在 App 内协调正在进行的工作。对用户来说,这意味着不必在打字和操作之间来回切换,直接用口语就能推进任务。
GPT-Live 此前已经在一次多任务演示中亮相,当时展示了同时处理订机票、查天气和同步行程等操作。这次则是将这套能力整合进桌面版,作为操控电脑和代理的统一入口。
可语音指挥 ChatGPT Work 和 Codex 中的多个代理
根据 OpenAI 的说明,用户可以通过语音直接操控电脑,并指挥多个同时运行的 AI 代理。这些代理可以运行在 ChatGPT Work(办公协作)或 Codex(程序开发)环境中,由用户通过口头指令进行分派和调度。
在这一模式下,用户可以并行安排多条工作线,而不需要逐一手动点击完成各项操作。
覆盖 Plus 至 Enterprise 方案
ChatGPT Voice 桌面版于公告当天起在 macOS 和 Windows 面向全球推出,适用方案包括 Plus、Pro、Business、Edu 和 Enterprise。
OpenAI 还在公告中附上一段约 69 秒的操作演示视频。

