发布于 2026-10-02 12:00
MAV-C:沉浸式虚拟环境中音视频复杂度的联合客观估计框架
研究者提出无参考框架 MAV-C,用于音视频复杂度的联合客观估计,通过参数化融合将熵基音频特征(时域、频谱、空间)与视觉特征(Sobel 梯度幅值、色彩独特性、光流)结合,输出连续联合复杂度分数 CAV(t)∈[0,1]。
研究者提出无参考框架 MAV-C,用于音视频复杂度的联合客观估计,通过参数化融合将熵基音频特征(时域、频谱、空间)与视觉特征(Sobel 梯度幅值、色彩独特性、光流)结合,输出连续联合复杂度分数 CAV(t)∈[0,1]。
RMS-AQA 是一个面向真实家居环境的空间音频问答基准,采用两阶段问答格式,先定位可听声事件再进行时空推理。数据集结合真实一阶 Ambisonics(FOA)录音与基于实测房间脉冲响应(RIR)生成的高保真合成数据,并提供将 FOA 数据注入冻结音频语言骨干的轻量空间插件。实验显示主要挑战来自同时声源、远距离以及 RIR 合成与真实录音之间的仿真到真实域差。
高通在 Snapdragon Summit 2026 发布 Snapdragon Sound Elite Gen 2,这是其首个面向个人 AI 时代的旗舰音频平台,面向 TWS 耳机、头戴耳机、音频眼镜等形态。