字节发布音视频全双工大模型,原生融合音频、视频与文本

PChome | 编辑: 邸天宇 2026-08-05 14:15:11

字节跳动正式推出音视频全双工大模型SeedRealtime。该模型采用统一架构,将音频、视频与文本原生融合,可在连续多模态信息流上实现实时交互,带来“边看、边听、边说”的对话体验。

PChome 8月5日消息,字节跳动正式推出音视频全双工大模型SeedRealtime。该模型采用统一架构,将音频、视频与文本原生融合,可在连续多模态信息流上实现实时交互,带来“边看、边听、边说”的对话体验。

据介绍,传统音视频对话系统多采用级联方案,不同模态模块分开处理,容易在交互节奏上出现偏差。端到端人工评测结果显示,与级联模型相比,SeedRealtime将音视频对话中的节奏问题减少了一半。模型对说话时机的把握更自然,话未说完被抢断、话音落下后回应迟缓,以及被背景杂音或闲聊误触发等卡壳现象明显减少,单次对话能够完整、顺畅交流的概率也有明显提升。

全双工能力使模型可以同时处理输入与输出,不必严格等待单向轮次结束,更接近真人交流中的插话、应答与即时反馈节奏。目前,SeedRealtime已在豆包App全量上线,用户可直接体验其实时音视频对话能力。

说明:所有图文均来自网络,版权归原作者所有,如果侵犯您的权益,请联系我们删除。

每日精选

首页 手机 数码相机 笔记本 游戏 DIY硬件 硬件外设 办公中心 数字家电 平板电脑