arXiv cs.SD RSS·· 3 小时前
DEFINE:基于示例引导的口音控制零样本 TTS 框架
DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS
摘要
DEFINE 是一个端到端零样本 TTS 框架,通过将说话人身份与目标口音分别条件于不同音频示例来实现二者解耦,推理时用单一引导权重连续控制口音强度而无需重训练。
应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv cs.SD RSS · arxiv.org