在TTS或声音克隆的技术选型中,一个绕不开的问题始终存在:哪个模型听感自然、吐字清晰、能真正克隆参考说话人,同时还能在纯CPU环境下保持可用速度?本文完整呈现了四款模型在纯CPU机器上的客观评测过程,包括数据集与指标设计、运行中遇到的问题、数据含义解读,以及如何用Neo克隆项目并扩展。 **为什么需要这场评测** 厂商演示和单说话人样本太容易被美化。一份可信的对比需要覆盖多说话人、性别平衡和口音多样性,需要确保评测文本从未出现在参考音频中,还需要用指标将克隆保真度、自然度、可懂度和延迟分开衡量。更需要诚实地区分真正的零样本克隆模型和固定音色TTS。 本次评测由Neo(可在VS Code或Cursor中运行的自主AI工程代理)端到端完成。从高层目标出发,Neo自主规划了测试框架,完成模型集成、数据管线搭建、批量测试运行、真实数据质量缺陷修复、报告重新生成及仓库推送。 **被测模型** 这一区分至关重要:本次评测中只有Audio8和XTTS是真正的零样本克隆模型。Pocket TTS和Kokoro作为CPU质量和速度基线仍有价值,但它们的说话人相似度分数不能作为克隆保真度的证据。 **指标说明** 全部评分均为自动化完成,本轮没有设置人工听感评定。 **说话人相似度**:使用WavLM-Large x-vector嵌入,计算余弦相似度,两个音频流均统一为16kHz采样。分数越高表示与参考说话人越接近。实际运行中,四款模型的这项指标都饱和在接近1.0的位置,因此它更适合作为基准校验而非排名依据。 **自然度(UTMOSv2)**:预测MOS分,1至5分,分数越高代表听感越自然。正是在这项指标上,固定音色的Kokoro领先于真正的克隆模型。 **可懂度(WER / CER)**:通过faster-whisper small(CTranslate2的CPU int8版本)转写,然后进行文本标准化,再用jiwer计算词错误率和字符错误率,数值越低越好。评测过程中,模型生成的真实WAV文件被逐一抽查,以确保假设与实际情况一致,因此最终的WER/CER数据具有完整的可追溯性。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.