阿里发布Qwen-Audio-3.1系列,一次性推出五款语音模型,并同步下调全线调用价格。官方信息显示,ASR降幅达95%,TTS约降70%,Realtime约降85%,API已上架千问AI平台,ASR-Next接口后续开放。
PChome 9月23日消息,阿里发布Qwen-Audio-3.1系列,一次性推出五款语音模型,并同步下调全线调用价格。官方信息显示,ASR降幅达95%,TTS约降70%,Realtime约降85%,API已上架千问AI平台,ASR-Next接口后续开放。

新品覆盖“识别—理解—合成—创作—实时交互”。ASR主打多语种与方言,单模型支持30种语言、16种中文方言,流式首字约160毫秒,可自动去语气词、做分角色转写;内部方言集平均字错率10.38%,方言转普通话平均语义句准率82.10%。 ASR-Next把对象从“说话内容”扩到整段音频,可识别情绪、环境声、机械声并做事件定位与问答。

合成侧,TTS支持同音色跨普通话、粤语、英语、日语等迁移,按指令调情绪与语速;TTS-Next不再只出人声,而是按文本和时间戳统一生成对白、音效、环境声,支持多人音色复刻与48kHz输出,面向播客、有声书、影视和游戏。Realtime升级全双工,允许用户插话打断,结合情绪理解调用Agent工具,并已接入Qoder、千问办公及AI眼镜等硬件。
从降价幅度看,阿里明显在把语音能力从“demo级”往规模化商用推。对会议转写、客服、内容生产和智能硬件厂商来说,API成本下行会直接改变选型逻辑。