MAV-C:沉浸式虚拟环境中音视频复杂度的联合客观估计框架
研究者提出无参考框架 MAV-C,用于音视频复杂度的联合客观估计,通过参数化融合将熵基音频特征(时域、频谱、空间)与视觉特征(Sobel 梯度幅值、色彩独特性、光流)结合,输出连续联合复杂度分数 CAV(t)∈[0,1]。
研究者提出无参考框架 MAV-C,用于音视频复杂度的联合客观估计,通过参数化融合将熵基音频特征(时域、频谱、空间)与视觉特征(Sobel 梯度幅值、色彩独特性、光流)结合,输出连续联合复杂度分数 CAV(t)∈[0,1]。
RMS-AQA 是一个面向真实家居环境的空间音频问答基准,采用两阶段问答格式,先定位可听声事件再进行时空推理。数据集结合真实一阶 Ambisonics(FOA)录音与基于实测房间脉冲响应(RIR)生成的高保真合成数据,并提供将 FOA 数据注入冻结音频语言骨干的轻量空间插件。实验显示主要挑战来自同时声源、远距离以及 RIR 合成与真实录音之间的仿真到真实域差。
PLACE 通过条件嵌入的位置潜在适配方法,扩展预训练任意到音频模型 AudioX,实现由文本、视频及可选音频提示组合生成双耳音频。该方法用 Perception Encoder Core 特征增强视频条件,对齐文本与视频表示以提取空间线索,并对生成潜在施加条件相关低秩变换,以解码音频的双耳声级差与时间差为目标监督适配器。
研究提出并定义新任务 Bin2Ambi,即从双耳音频转换到 Ambisonics 声场。系统利用智能耳机运动传感器同步采集的头部追踪数据,缓解双耳音频前后定位模糊与混淆锥侧向误差带来的方向不确定性。客观指标与主观听音测试显示,转换后的 Ambisonics 声场平均方向误差最高约 11.8°,感知空间质量接近 DirAC 基准模型。
Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。
2026年9月29日,中国科学院老科协声学所分会在声学所举办"智能化趋势下的新电声技术"学术沙龙,声学所副所长杨军作主旨报告。报告介绍声学技术与人工智能、数字信号处理融合趋势,围绕有源噪声控制、个人音频系统与局部声场重建,结合车载降噪、分区聆听、参量阵定向发声等实例阐述,并现场演示聚音屏定向声和免佩戴耳机虚拟环绕声效果。与会人员就双耳听觉、定向声束、声纹识别、助听设备适配等议题研讨。