小米发布工业级目标说话人语音识别大模型:采用端到端LLM架构

PChome | 编辑: 邸天宇 2026-09-11 15:40:48

小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。该模型针对语音识别中的“鸡尾酒会”难题研发,采用端到端大语言模型架构,可在多人同时发声的复杂声学环境下,完成定向语音的提取与转写。

PChome 9月11日消息,小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。该模型针对语音识别中的“鸡尾酒会”难题研发,采用端到端大语言模型架构,可在多人同时发声的复杂声学环境下,完成定向语音的提取与转写。

据小米技术团队公布的信息,这款模型仅需目标说话人的一段参考音频作为声纹匹配依据,即可从混杂的多人语音流中精准锁定目标声源,最终仅输出目标用户的语音转写内容。在多个主流多说话人语音测试集上,该模型的各项指标均达到当前最优水平,表现大幅领先现有同类方案。

除多说话人场景的核心能力外,模型的单人语音识别性能与通用标准语音识别模型持平,可无缝适配单人发声的常规使用场景,无需根据环境切换识别模式。针对非目标说话人的干扰语音,模型具备主动拒识能力,若目标说话人不在场,模型将直接输出空文本,有效降低语音交互的误触发概率。此外,该模型还支持思维链推理模式,能够为识别结果提供可解释的推理过程。

目前,Xiaomi-CocktailASR-1的模型权重与推理代码已正式开放开源,开发者可直接获取并体验这套面向复杂声学场景的语音识别方案。

说明:所有图文均来自网络,版权归原作者所有,如果侵犯您的权益,请联系我们删除。

每日精选

首页 手机 数码相机 笔记本 游戏 DIY硬件 硬件外设 办公中心 数字家电 平板电脑