返回全双工

全双工

字节跳动
2026-08-05 04:53:00

字节跳动发布SeedRealtime 原生音视频全双工大模型落地豆包

字节跳动正式推出原生音视频全双工大模型SeedRealtime,采用统一架构原生融合音频、视频与文本,支持在连续多模态信息流上实时交互。端到端人工评测显示,相比级联模型,其对话节奏问题减少一半,抢断、迟缓回应、误触发等卡壳现象显著减少,单次对话顺畅完成概率明显提升。该模型已在豆包App全量上线。据财联社报道,PANews 8月5日消息。

1140
字节跳动发布SeedRealtime 原生音视频全双工大模型落地豆包
OpenAI
2026-08-04 06:41:33

OpenAI公开 GPT-Live 语音架构:支持边听边说,复杂任务交给后台模型

OpenAI 近日公开新一代语音技术 GPT-Live 的架构细节,核心是全双工语音能力,可在用户说话过程中给出实时回应,并在自然停顿时接话。官方称,其将实时对话放在专属“快路径”处理,把联网搜索、深度推理和代理操作等复杂任务交给后台更强模型异步完成。OpenAI 还披露,在 5 到 10 分钟的人类盲测中,GPT-Live-1 对原先进阶语音模式的偏好率约为 75.7%,GPT-Live-1 mini 为 69.2%。

960
OpenAI公开 GPT-Live 语音架构:支持边听边说,复杂任务交给后台模型
OpenAI
2026-07-16 07:29:42

OpenAI 展示 GPT-Live 多任务语音能力,可同步查航班与行程

OpenAI 于 7 月 15 日发布 GPT-Live 多任务演示视频,展示模型在连续对话中同步处理查航班、获取当地天气和拟定行程。该产品已于 7 月 8 日上线,并取代 ChatGPT 原有的 Advanced Voice Mode。OpenAI称,其核心在于全双工语音架构,支持边听边说;目前仍不支持屏幕共享和相机功能,这部分仍需切回旧版 Voice Mode。

1060
OpenAI 展示 GPT-Live 多任务语音能力,可同步查航班与行程