![]()
大家好,我是橘子。今天我体验到一个全新的声音模型,跟以前所有的声音模型都不一样。
「等了这么久,终于来了。」
这是我测试的时候,内心的真实想法。
以前的声音模型一般叫 TTS(文本转语音),它们只能根据你给的文本来合成语音,它更像是一个朗读机器,而非智能声音模型。
但这个新模型,可以根据你的想象,生成一切你所需要的声音,包括人声、音乐、音效、环境音,以及这些声音里所富含的那些不可言说的微妙细节。
它的名字名字叫:豆包音频生成模型 Seed Audio 1.0。
在我看来,这就是声音模型的 Seedance 时刻。
就像香蕉是人类第一次将智能赋予图像,Seed Audio 是人类第一次将智能赋予声音。
接下来,就让我们一起听听它到底有何特别。
首先是这篇文章的开场白,这个音色是参考我的某次播客录制生成的。
大家可以记一下我的音色,因为这个模型很强的一点就是它的声音参考功能,除了做文章配音,还能用我的音色去演绎各类场景。
比如这个冥想的引导,你可以听到我的声音从头到尾越来越慢,越来越轻。还配上了轻柔的音乐。
再比如这个脱口秀,完全就是我说话的样子,真实得无法想象,模型还配上了现场的笑声作为环境音。
这是声音模型第一次可以把同一个音色泛化到各种不同的场景,它的想象空间非常大。
这个声音参考,不仅是能支持音色的参考,还支持环境氛围音、音乐作为参考,毕竟很多声音是很抽象的,很难用语言描述,声音参考的意义就像视频模型里的图像参考。听说这个模型甚至也支持图像参考,只是目前还没上线。
我测试了这个模型在不同场景下的表现。
我特别喜欢这个鬼故事场景。你可以听一下,是不是那个感觉。
模型还具备一定的唱歌能力,我让它清唱一下,让朋友们去听,大家都觉得非常真实,甚至那种跑调都很真实。
模型不仅支持单人说话,还支持多人复杂场景的表演,比如短剧配音或者广播剧场景,可以听一下这个场景的表演,画面感是不是一下就出来了。
除了多人场景演绎,模型也支持复杂的环境音生成,这是一个人从甲板上走到船舱里,点了一杯威士忌的场景。
听到这里,现在你应该明白为什么我说这是声音模型的 Seedance 时刻了,有了这样的模型,你真的可以自由创作一切声音内容。(当然是在不侵权的前提之下)
这个模型单次可以生成长达 2 分钟的音频,还能以此为参考继续延长,保持音色和风格的一致性,最长能延续到几十分钟。
有了这个模型,我们终于可以创造属于自己的 AI 声音伙伴了。比如一个跟你聊天、给你讲故事、给你唱歌、逗你开心的 Cola,可以挑一个你最喜欢的音色作为参考。
不过 Seed Audio 作为一个版本号 1.0 的新模型,还有很多不完美的地方。现在同一个参考声音在不同场景下的泛化性还有提升空间,比如我讲冥想那段可以更慢一点,比如在唱歌的时候跑调有点严重,比如有时候人声说话依然带有电音感。
期待在未来的升级中这些问题都能被解决。
我们去年做 ListenHub 的时候,最想要的就是这样一个模型,可以把用声音智能创造有趣且有用的内容。
等了这么久,终于来了。
接下来我们会把 Seed Audio 接入 ListenHub ,到时候大家在制作音频内容的时候,一定会有全新的体验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.