小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoice多语言语音克隆TTS模型,该模型以其极简架构和超强性能,首次实现了对超过600种语言的语音克隆支持。
PChome 5月7日消息,小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoice多语言语音克隆TTS模型,该模型以其极简架构和超强性能,首次实现了对超过600种语言的语音克隆支持,打破了多语言语音合成的语种局限。

据悉,OmniVoice采用创新的双向Transformer架构,仅用一个网络直接实现文本到语音的转换,是目前最简单的非自回归TTS模型之一。尽管架构极简,但其性能却超越预期。在中英文测试中,OmniVoice的语音合成质量优于当前主流模型,训练和推理速度也极具优势,一天可完成10万小时训练,推理速度可达40倍实时。

该模型最大的亮点在于其强大的多语言能力。基于50个开源语音数据集构建的训练集涵盖646种语种,总时长58万小时。通过低资源语种动态上采样训练策略,OmniVoice即使在训练数据不足10小时的小语种上也能实现高质量合成。在24种语言的测试中,其语音相似度和可懂度均超越多款商用系统;在102种语言的测试中,其语音可懂度甚至逼近真实语音。

OmniVoice的另一大特色是跨语言克隆能力,用户只需提供一种语言的参考音频,即可生成其他语言的语音,真正实现了“说一种语言,通万国语言”。此外,模型还支持自定义音色设计、带噪参考音频适配、丰富语气表达和发音精准纠正等多维度可控功能,极大提升了实用性和灵活性。