小米开源OmniVoice多语言语音克隆TTS:支持跨语言克隆

PChome | 编辑: 邸天宇 2026-05-07 18:26:07

小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoice多语言语音克隆TTS模型,该模型以其极简架构和超强性能,首次实现了对超过600种语言的语音克隆支持。

PChome 5月7日消息,小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoice多语言语音克隆TTS模型,该模型以其极简架构和超强性能,首次实现了对超过600种语言的语音克隆支持,打破了多语言语音合成的语种局限。

据悉,OmniVoice采用创新的双向Transformer架构,仅用一个网络直接实现文本到语音的转换,是目前最简单的非自回归TTS模型之一。尽管架构极简,但其性能却超越预期。在中英文测试中,OmniVoice的语音合成质量优于当前主流模型,训练和推理速度也极具优势,一天可完成10万小时训练,推理速度可达40倍实时。

该模型最大的亮点在于其强大的多语言能力。基于50个开源语音数据集构建的训练集涵盖646种语种,总时长58万小时。通过低资源语种动态上采样训练策略,OmniVoice即使在训练数据不足10小时的小语种上也能实现高质量合成。在24种语言的测试中,其语音相似度和可懂度均超越多款商用系统;在102种语言的测试中,其语音可懂度甚至逼近真实语音。

OmniVoice的另一大特色是跨语言克隆能力,用户只需提供一种语言的参考音频,即可生成其他语言的语音,真正实现了“说一种语言,通万国语言”。此外,模型还支持自定义音色设计、带噪参考音频适配、丰富语气表达和发音精准纠正等多维度可控功能,极大提升了实用性和灵活性。

说明:所有图文均来自网络,版权归原作者所有,如果侵犯您的权益,请联系我们删除。

每日精选

首页 手机 数码相机 笔记本 游戏 DIY硬件 硬件外设 办公中心 数字家电 平板电脑