arXiv eess.AS RSS·· 1 天前
VOSSA:面向流式语音架构的声纹优化框架
VOSSA: Voiceprint Optimization for Streaming Speech Architectures
摘要
VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。
应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv eess.AS RSS · arxiv.org