跳到正文
原文
arXiv cs.SD RSS·· 3 小时前

Soundwich:分层可控音频的视频生成框架

Soundwich: Video Generation with Layered and Controllable Audio

摘要

Soundwich 是一个免训练框架,可将冻结的联合音视频流匹配模型改造为生成与同一视频同步的多条独立可编辑音频轨。它通过共享场景表示在各音轨间传递全局音视频上下文,并将每条音频轨与其对应视觉源进行跨模态交互,从而在保持音源分离的同时提升一致性。生成的音轨可独立调整时序、静音、替换或重新混音,实验与人工评估显示其在时间控制、音源分离和自然度方面均有改善。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv cs.SD RSS · arxiv.org