字节跳动正式推出音视频全双工大模型SeedRealtime。该模型采用统一架构,将音频、视频与文本原生融合,可在连续多模态信息流上实现实时交互,带来“边看、边听、边说”的对话体验。
PChome 8月5日消息,字节跳动正式推出音视频全双工大模型SeedRealtime。该模型采用统一架构,将音频、视频与文本原生融合,可在连续多模态信息流上实现实时交互,带来“边看、边听、边说”的对话体验。

据介绍,传统音视频对话系统多采用级联方案,不同模态模块分开处理,容易在交互节奏上出现偏差。端到端人工评测结果显示,与级联模型相比,SeedRealtime将音视频对话中的节奏问题减少了一半。模型对说话时机的把握更自然,话未说完被抢断、话音落下后回应迟缓,以及被背景杂音或闲聊误触发等卡壳现象明显减少,单次对话能够完整、顺畅交流的概率也有明显提升。

全双工能力使模型可以同时处理输入与输出,不必严格等待单向轮次结束,更接近真人交流中的插话、应答与即时反馈节奏。目前,SeedRealtime已在豆包App全量上线,用户可直接体验其实时音视频对话能力。