今天我们来聊一聊 ai 人工智能语音,说到机器人朗读呢我们可能会有一些刻板印象。就是每个字我都听得懂但是一段话让他来念总感觉怪怪的。
这个是现在网页端非常常见的机器人朗读的效果,坦率讲这个效果已经比前几年好太多了。但是我们依然觉得这不是人话,听时间长了肯定头疼。当然对于大多数的文字网页来说,语音朗读只是一个非常边缘的附带功能。重视程度不高,确实没必要在他身上投入太多。
但是这里我们要知道的是,同样是合成语音技术和技术之间差异很大。语音合成技术的上限也很高,那接下来呢咱们就来听听当时在北京冬奥会期间虚拟主持人东东的合成语音。
如果不事先点名这是合成出来的,相信大部分朋友一定会把这样的声音当做是真人。语音合成技术是怎么做到以假乱真的,今天我们就来聊聊这个话题。
所谓的语音合成,其实呢就是让机器把文本变成语音。只要给机器本字典,所有的语音合成技术都能够做到见字发声。把任何文字朗读出来,但是呢要让合成语音变得更加有表现力更有韵律,让合成语音具备真人说话的音质,这就是难点所在了。
要像真人那就得来源于真人,因此第一步就是要挑选一位合适的合成语音素材志愿者。为了让合成语音拥有更好的普适性,这位志愿者的普通话得标准口齿得清晰根据不同的应用场景对志愿者的音色需求也不一样。
比如说如果作为客服使用的话,那志愿者的音色就得相对亲切一些,然后就要在专门的录音棚里面对声音进行采集工作。采集的过程不是让志愿者随意说话随便录,而是要尽可能的采集到最多的声音元素。拿汉语普通话来说我们有波泼摸佛这样的20多个声母和啊喔鹅这样的20多个韵母,因此在采集的时候每一个因素甚至是因素组合都要尽可能的采集到位。这个采集量可想而知不小,因此呢还可能需要分多次录制。
我们每个人的声音状态在一天之内都会有不同,那为了确保最终的效果的一致性还要有录音指导现场帮志愿者调整。在全部采集完成之后还要进行一遍筛选,把不合格的录音去掉,那留下更高质量的声音素材。这个过程看上去非常的枯燥和麻烦但是它的质量很大程度上决定了合成语音的最终效果,下一步呢就是训练人工智能算法了。这又是一个相对漫长枯燥的过程,而且不同于下围棋这种规则明晰的项目,合成语音是否更像真人那还得真人说了算。
……后续内容请收听本期语音
富能量 要分享
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.