PChome 5月7日消息,小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoice多语言语音克隆TTS模型,该模型以其极简架构和超强性能,首次实现了对超过600种语言的语音克隆支持,打破了多语言语音合成的语种局限。
![]()
据悉,OmniVoice采用创新的双向Transformer架构,仅用一个网络直接实现文本到语音的转换,是目前最简单的非自回归TTS模型之一。尽管架构极简,但其性能却超越预期。在中英文测试中,OmniVoice的语音合成质量优于当前主流模型,训练和推理速度也极具优势,一天可完成10万小时训练,推理速度可达40倍实时。
![]()
该模型最大的亮点在于其强大的多语言能力。基于50个开源语音数据集构建的训练集涵盖646种语种,总时长58万小时。通过低资源语种动态上采样训练策略,OmniVoice即使在训练数据不足10小时的小语种上也能实现高质量合成。在24种语言的测试中,其语音相似度和可懂度均超越多款商用系统;在102种语言的测试中,其语音可懂度甚至逼近真实语音。
![]()
OmniVoice的另一大特色是跨语言克隆能力,用户只需提供一种语言的参考音频,即可生成其他语言的语音,真正实现了“说一种语言,通万国语言”。此外,模型还支持自定义音色设计、带噪参考音频适配、丰富语气表达和发音精准纠正等多维度可控功能,极大提升了实用性和灵活性。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.