字节跳动宣布豆包视频通话功能完成一次关键升级——正式接入原生音视频全双工大模型SeedRealtime。这意味着,豆包App的用户从此拥有了一位“既能看、又能听、还能说"的AI对话对象。
PChome 8月6日消息,字节跳动宣布豆包视频通话功能完成一次关键升级——正式接入原生音视频全双工大模型SeedRealtime。这意味着,豆包App的用户从此拥有了一位“既能看、又能听、还能说"的AI对话对象。

不同于传统AI将语音识别、图像理解、语义分析、语音合成串联处理的级联架构,SeedRealtime采用统一的端到端模型,把音频、视频、文本放在同一套时序框架内联合推理。它能在对话过程中同步判断:此刻该聆听、该回应,还是该保持沉默;画面里的“这个"指代哪件物体;多人场景下谁才是真正的对话主体。

这种架构带来的直接改观是交互节奏的大幅自然化。据字节方面披露,相比传统级联方案,SeedRealtime将对话节奏类问题减少约50%,抢话、迟答等卡顿显著下降;在机场等高噪环境的测试中,对目标语音的识别准确率达到92%,不会被行李箱滚轮声或广播通知误触发。
从行业坐标看,一个月前OpenAI推出纯语音版的GPT-Live,把AI从“打字"推进到“通话";而SeedRealtime进一步补上了“视觉"这一维,成为业界首个实现音视频全双工规模化落地的大模型方案,目前已全量推送到豆包App——这款日活超过2亿的应用,本身就是检验新技术工程能力的绝佳场域。
用户只需将豆包App更新至最新版,在对话框内点击“打电话"并切换到视频模式,即可开启这场"面对面"的AI对话。无论是外文菜单的实时翻译、咖啡机的分步教学,还是博物馆里的主动提醒,过去需要多次截图、打字描述才能勉强完成的任务,现在镜头一对、开口一问就能解决。