跳到正文
原文
arXiv cs.SD RSS·· 3 小时前

Watch Your Speech:引入文本条件控制的视频到语音合成框架

Watch Your Speech: Text-aware Video-to-Speech Synthesis with Textual Conditioning

摘要

研究者提出视频到语音合成框架 Watch Your Speech(WYS),通过引入文本条件作为显式语言线索缓解视觉歧义。该框架采用基于注意力的嵌入融合模块将文本上下文与视频序列结合,并配合条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音视频同步指标 LSE-C/D 上取得新的最优结果,同时保持有竞争力的文本准确率(WER)。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv cs.SD RSS · arxiv.org