字节跳动
2026-08-05 04:53:00字节跳动发布SeedRealtime 原生音视频全双工大模型落地豆包
字节跳动正式推出原生音视频全双工大模型SeedRealtime,采用统一架构原生融合音频、视频与文本,支持在连续多模态信息流上实时交互。端到端人工评测显示,相比级联模型,其对话节奏问题减少一半,抢断、迟缓回应、误触发等卡壳现象显著减少,单次对话顺畅完成概率明显提升。该模型已在豆包App全量上线。据财联社报道,PANews 8月5日消息。
1140

字节跳动正式推出原生音视频全双工大模型SeedRealtime,采用统一架构原生融合音频、视频与文本,支持在连续多模态信息流上实时交互。端到端人工评测显示,相比级联模型,其对话节奏问题减少一半,抢断、迟缓回应、误触发等卡壳现象显著减少,单次对话顺畅完成概率明显提升。该模型已在豆包App全量上线。据财联社报道,PANews 8月5日消息。

OpenAI 近日公开新一代语音技术 GPT-Live 的架构细节,核心是全双工语音能力,可在用户说话过程中给出实时回应,并在自然停顿时接话。官方称,其将实时对话放在专属“快路径”处理,把联网搜索、深度推理和代理操作等复杂任务交给后台更强模型异步完成。OpenAI 还披露,在 5 到 10 分钟的人类盲测中,GPT-Live-1 对原先进阶语音模式的偏好率约为 75.7%,GPT-Live-1 mini 为 69.2%。

OpenAI 于 7 月 15 日发布 GPT-Live 多任务演示视频,展示模型在连续对话中同步处理查航班、获取当地天气和拟定行程。该产品已于 7 月 8 日上线,并取代 ChatGPT 原有的 Advanced Voice Mode。OpenAI称,其核心在于全双工语音架构,支持边听边说;目前仍不支持屏幕共享和相机功能,这部分仍需切回旧版 Voice Mode。

前OpenAI CTO Mira Murati 领衔的 Thinking Machines Lab 发布“交互式模型”研究预览,实现实时全双工语音交互,响应时间仅约 0.40 秒,旨在打造更自然的类电话对话体验。
