小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。该模型针对语音识别中的“鸡尾酒会”难题研发,采用端到端大语言模型架构,可在多人同时发声的复杂声学环境下,完成定向语音的提取与转写。
PChome 9月11日消息,小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。该模型针对语音识别中的“鸡尾酒会”难题研发,采用端到端大语言模型架构,可在多人同时发声的复杂声学环境下,完成定向语音的提取与转写。

据小米技术团队公布的信息,这款模型仅需目标说话人的一段参考音频作为声纹匹配依据,即可从混杂的多人语音流中精准锁定目标声源,最终仅输出目标用户的语音转写内容。在多个主流多说话人语音测试集上,该模型的各项指标均达到当前最优水平,表现大幅领先现有同类方案。

除多说话人场景的核心能力外,模型的单人语音识别性能与通用标准语音识别模型持平,可无缝适配单人发声的常规使用场景,无需根据环境切换识别模式。针对非目标说话人的干扰语音,模型具备主动拒识能力,若目标说话人不在场,模型将直接输出空文本,有效降低语音交互的误触发概率。此外,该模型还支持思维链推理模式,能够为识别结果提供可解释的推理过程。
目前,Xiaomi-CocktailASR-1的模型权重与推理代码已正式开放开源,开发者可直接获取并体验这套面向复杂声学场景的语音识别方案。