发布于 2026-10-02 12:00
MAV-C:沉浸式虚拟环境中音视频复杂度的联合客观估计框架
研究者提出无参考框架 MAV-C,用于音视频复杂度的联合客观估计,通过参数化融合将熵基音频特征(时域、频谱、空间)与视觉特征(Sobel 梯度幅值、色彩独特性、光流)结合,输出连续联合复杂度分数 CAV(t)∈[0,1]。
研究者提出无参考框架 MAV-C,用于音视频复杂度的联合客观估计,通过参数化融合将熵基音频特征(时域、频谱、空间)与视觉特征(Sobel 梯度幅值、色彩独特性、光流)结合,输出连续联合复杂度分数 CAV(t)∈[0,1]。
针对早期20世纪管弦乐历史录音缺乏退化前真值、修复任务难以监督的问题,研究者构建了端到端管弦乐历史音乐修复基准,通过更忠实地模拟历史录音退化链,将管弦乐修复转化为可监督问题。在合成退化对上训练的潜流匹配模型在侵入式、非侵入式与主观评测中均优于现有修复基线。研究还整理并发布了一个9.3小时、免许可、非配对的古典音乐测试集,以及代码和音频演示。
MuseCritic 是一种半标量奖励模型,先生成覆盖五个美学维度的自然语言评论,再以此为中间表示预测连续奖励分数。
研究提出以音高移调为归纳偏置、通过多视角稀疏自编码器(SAE)对齐来诱导有序轨道,从而发现音乐基础模型内部的结构化概念。该方法生成移调输入对并对齐其SAE表示,在两个先进音乐基础模型上恢复了对应和弦、调性与旋律模式的轨道结构,且仅需少量锚点示例即可解释整个概念族。
研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。