阶跃发布语音大模型StepAudio 3,拿下多个全球第一

PChome | 编辑: 邸天宇 2026-09-15 16:33:19

阶跃星辰发布StepAudio 3系列,一次性推出Realtime、ASR、TTS、Gen、Music五款模型,把语音从“听清、念出”扩到实时对话、专业转写、音频制作和音乐生成全链路。

PChome 9月15日消息,阶跃星辰发布StepAudio 3系列,一次性推出Realtime、ASR、TTS、Gen、Music五款模型,把语音从“听清、念出”扩到实时对话、专业转写、音频制作和音乐生成全链路。多款模型在Artificial Analysis相关榜单登顶,是其本次最硬的成绩单。

实时交互是重点。StepAudio 3 Realtime走原生全双工,不只在用户插话时停一下再答,而是同步处理语义、语气、情绪、副语言和环境声;借助“边说边想”与异步工具调用,推理、语音输出和长任务互不阻塞。其在Conversational Dynamics综合得分98.9%,Speech Reasoning语音推理准确率99.7%,均列全球第一。

识别侧,StepAudio 3 ASR把声学模型与大模型上下文打通,覆盖中英文、方言、中英混说、长音频,以及医疗、法律、金融、汽车、编程等垂直场景;对低声、快语速、连读、背景音乐也有针对性优化。非流式准确性榜单WER仅1.7%,并列第一。

生成侧同样不再单点化:TTS补笑声、迟疑、改口等自然停顿,适配低延迟对话;Gen用统一音频表示做人人声、音效、环境声和配乐编排;Music支持自然语言定曲风、节奏、乐器结构,也能基于ABC记谱法多轮改稿。

对行业而言,StepAudio 3的信号不是“又多一个语音模型”,而是把识别、对话、配音、音效、作曲放进一套工作流。实时语音助手、播客短剧批量生产、会议和专业转写,都可能因此重新比拼交付成本与拟人度。

说明:所有图文均来自网络,版权归原作者所有,如果侵犯您的权益,请联系我们删除。

每日精选

首页 手机 数码相机 笔记本 游戏 DIY硬件 硬件外设 办公中心 数字家电 平板电脑