跳到正文
原文
arXiv eess.AS RSS·· 3 小时前

StateVC:基于共享状态局部变换的免训练语音转换

Shared-State Local Translations for Training-Free Voice Conversion

摘要

StateVC 提出一种免训练单样本语音转换方法,通过对源与参考语句的 WavLM 帧级表征拟合配对高斯混合模型,得到共享状态并在各状态内估计源到参考的均值偏移,由源帧后验概率组合局部更新。在 LibriSpeech 单样本协议下,其词错误率和字错误率分别为 8.01% 和 3.22%,说话人相似度达 0.9512,并在所评估系统中取得最高平均感知说话人相似度,在免训练系统中取得最高平均自然度。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv eess.AS RSS · arxiv.org