小米开源OmniVoice多语言语音克隆TTS:支持跨语言克隆
创始人
2026-05-08 13:17:52
0

PChome 5月7日消息,小米技术官微官宣,小米AI实验室新一代Kaldi团队开源了OmniVoice多语言语音克隆TTS模型,该模型以其极简架构和超强性能,首次实现了对超过600种语言的语音克隆支持,打破了多语言语音合成的语种局限。

据悉,OmniVoice采用创新的双向Transformer架构,仅用一个网络直接实现文本到语音的转换,是目前最简单的非自回归TTS模型之一。尽管架构极简,但其性能却超越预期。在中英文测试中,OmniVoice的语音合成质量优于当前主流模型,训练和推理速度也极具优势,一天可完成10万小时训练,推理速度可达40倍实时。

该模型最大的亮点在于其强大的多语言能力。基于50个开源语音数据集构建的训练集涵盖646种语种,总时长58万小时。通过低资源语种动态上采样训练策略,OmniVoice即使在训练数据不足10小时的小语种上也能实现高质量合成。在24种语言的测试中,其语音相似度和可懂度均超越多款商用系统;在102种语言的测试中,其语音可懂度甚至逼近真实语音。

OmniVoice的另一大特色是跨语言克隆能力,用户只需提供一种语言的参考音频,即可生成其他语言的语音,真正实现了“说一种语言,通万国语言”。此外,模型还支持自定义音色设计、带噪参考音频适配、丰富语气表达和发音精准纠正等多维度可控功能,极大提升了实用性和灵活性。

相关内容

AI浪潮下的另一种答案:T...
在这一轮AI 热潮中,市场的注意力大多集中在云端训练、推理集群和 ...
2026-06-22 14:39:48
AI进医院的AB面
早晨7点,山东第一医科大学第一附属医院(山东省千佛山医院)放射科,...
2026-06-22 14:39:18
AI手机助手如何引领智能设...
文 | 郭全中 张磊 韦薇 AI手机助手的快速发展不仅正在重塑现有...
2026-06-22 14:39:05
【一周连连看】推动大模型从...
Hi,假期快乐。 本周,你将看到: 1、AI暑期营火了 2、硅谷,...
2026-06-21 20:19:17
CBVI:2026 中国品...
CBVI:2026 中国品牌AI可见度指数 China Brand...
2026-06-21 19:12:58
AI 知识付费“出海”:一...
文 | wiwi AI 浪潮里,最先赚到钱的人,未必是最懂 AI...
2026-06-21 14:04:50

热门资讯

2024云栖大会|阿里云升级无... 北京商报讯(记者魏蔚)9月20日,阿里云无影AI云电脑在2024云栖大会上展出,该版本基于最新的终端...
MWC2025荣耀多款AI技术... 人民财讯3月6日电,2025世界移动通信大会(MWC 2025)上,荣耀MagicBook Pro ...
原创 2... #春日生活好物种草季#近年来,笔记本电脑市场迎来技术爆发期,尤其在手机厂商跨界入局后,轻薄本在性能、...
摩尔线程发布AI算力笔记本MT... 钛媒体App 12月20日消息,摩尔线程创始人、董事长兼CEO张建中在摩尔线程首届MUSA开发者大会...
摩尔线程AI生图摩笔马良全新升... 快科技8月7日消息,作为国产GPU的杰出代表,摩尔线程在当下火爆的AIGC浪潮中也推出了自己的软硬一...
微软 Azure AI 语音服... IT之家 8 月 23 日消息,微软Azure AI 语音服务允许开发者构建多语言生成式 AI 语音...
谷歌打磨 Gemini AI ... IT之家 8 月 31 日消息,谷歌于 8 月 27 日发布博文,宣布旗下 Gemini AI 支持...
青云QingCloud Kub... 日前,青云科技宣布开源 Thanos 的企业级发行版 Whizard,为企业带来真正高可用、可扩展、...
Macos系统上一款强大的卸载... App Cleaner mac中文版是Mac os系统上一款强大 的mac卸载工具,以帮助您完全卸载...
AMD锐龙AI 9 HX 37... 2024年6月3日,AMD正式发布全新的锐龙AI 300系列处理器。该系列处理器一经发布就引发大家的...