合成语音越来越常见于我们的生活中,从Siri和Alexa等数字助理到自动电话推销和答录机。随着生成式AI的发展,一种新型合成语音诞生了:语音克隆,它仅凭几秒钟的录音就能模仿出一个人声音。
研究发现语音克隆比真人更强
在《美国声学学会杂志》上,伦敦大学学院和罗汉普顿大学的两名研究人员评估了人声和语音克隆的可懂度。他们发现,在嘈杂环境里,语音克隆比人类更容易被理解。
语音克隆跟传统合成语音在需要的采样量上不一样。像Siri这样的合成语音需要配音演员在录音棚里花好几个小时。相比之下,语音克隆仅需10秒的语音即可生成,这大大增加了潜在语音的数量以及潜在应用的数量。
两位研究人员Patti Adank和Han Wang专门研究人类对不清晰语音的感知,并且对机器复制的语音这个想法特别感兴趣。
听众反应出人意料
他们想知道的一个关键问题是,普通人到底容不容易听懂语音克隆。他们原本以为,语音克隆就是把人声模仿得很差,人们听着会很费劲。结果发现根本不是那么回事。
"我一开始觉得,语音克隆嘛,大家不熟悉,肯定不好懂,"阿丹克说道。"结果我发现它们竟然好懂了20%左右,这太让我吃惊了。我们论文里一小段提了那个实验,后面大部分都是我和同事拼命想搞清楚,到底是什么让语音克隆更容易听懂。"
这俩人一开始给志愿者听真人声音和克隆的声音,让他们评评哪个更容易听懂。
他们发现克隆的声音一直被认为更好懂,于是又拿老年志愿者做了一遍实验,想看看听力不好的人会不会有不同结果。又换了美国志愿者(原来那波是英国人)来试,看口音有没有影响。还加了个模仿人工耳蜗的滤镜。每次都是克隆的声音更胜一筹。
探寻克隆为何更胜一筹
在分析了超过100项声学测量后,阿丹克相信,解开这个谜团的唯一方法是与专攻文本转语音系统的合作者一起,改造现有的开源克隆系统。
“我打算试着研究一下合成器怎么工作的,以及它们怎么用数字信号处理生成那些声音,来重现那个效果,先摸清点门道,”阿丹克说。
html
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.