跳到正文
原文
arXiv eess.AS RSS·· 1 天前

VOSSA:面向流式语音架构的声纹优化框架

VOSSA: Voiceprint Optimization for Streaming Speech Architectures

摘要

VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv eess.AS RSS · arxiv.org