跳到正文
原文
arXiv cs.SD RSS·· 3 小时前

结构化噪声掩码建模用于视频、音频及更多模态

Structured-Noise Masked Modeling for Video, Audio and Beyond

摘要

研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv cs.SD RSS · arxiv.org