跳到正文
原文
arXiv eess.AS RSS·· 1 天前

MGSA:面向零样本多说话人图像到语音合成的单调性引导语义对齐框架

Monotonicity-Guided Semantic Alignment for Zero-shot Multispeaker Image-to-Speech Synthesis

摘要

研究者提出单调性引导语义对齐(MGSA)框架,用于零样本多说话人图像到语音(Img2Sp)合成,通过语义语音单元提供跨说话人共享内容目标,并借助参考语音进行说话人条件化。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv eess.AS RSS · arxiv.org