可解释的目标感知合成器调制恢复方法
研究提出一种可解释的目标感知调制与波形恢复流程,先识别被调制目标,再恢复各目标对应的 LFO 波形并估计振荡器波形以匹配源音色。训练采用含噪声振荡器和更多调制选项的可微合成器,并探索感知损失与对抗训练。客观与主观评测显示,正确预测调制目标是关键,其 Gammatone 损失与 CQT 判别器在感知质量上显著优于传统 MSS 损失。
研究提出一种可解释的目标感知调制与波形恢复流程,先识别被调制目标,再恢复各目标对应的 LFO 波形并估计振荡器波形以匹配源音色。训练采用含噪声振荡器和更多调制选项的可微合成器,并探索感知损失与对抗训练。客观与主观评测显示,正确预测调制目标是关键,其 Gammatone 损失与 CQT 判别器在感知质量上显著优于传统 MSS 损失。
论文将软约束空间选择性主动降噪(SSANC)从全频段标量权衡参数推广为频域加权期望语音保留误差,同时保持低延迟时域主动控制。研究基于实测声学脉冲响应,在多说话人场景下比较了基于 SII、MIRS、LTASS 和信号相关 oracle 的频域加权与标量加权。
PLACE 通过条件嵌入的位置潜在适配方法,扩展预训练任意到音频模型 AudioX,实现由文本、视频及可选音频提示组合生成双耳音频。该方法用 Perception Encoder Core 特征增强视频条件,对齐文本与视频表示以提取空间线索,并对生成潜在施加条件相关低秩变换,以解码音频的双耳声级差与时间差为目标监督适配器。
研究提出并定义新任务 Bin2Ambi,即从双耳音频转换到 Ambisonics 声场。系统利用智能耳机运动传感器同步采集的头部追踪数据,缓解双耳音频前后定位模糊与混淆锥侧向误差带来的方向不确定性。客观指标与主观听音测试显示,转换后的 Ambisonics 声场平均方向误差最高约 11.8°,感知空间质量接近 DirAC 基准模型。
Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。
小提琴家 Nigel Kennedy 的制作经理兼音响工程师 Andreas Adelhofer 在近期约 40 场英国巡演中选用 DPA 麦克风,以保证从最弱段落到最强峰值、从钢琴到低音提琴的拾音保持中性干净。他表示 N-Series 数字无线系统将同样的清晰度带入无线传输,调谐范围 470–870 MHz,可充电电池每次充电约 13 小时。
2026年9月29日,中国科学院老科协声学所分会在声学所举办"智能化趋势下的新电声技术"学术沙龙,声学所副所长杨军作主旨报告。报告介绍声学技术与人工智能、数字信号处理融合趋势,围绕有源噪声控制、个人音频系统与局部声场重建,结合车载降噪、分区聆听、参量阵定向发声等实例阐述,并现场演示聚音屏定向声和免佩戴耳机虚拟环绕声效果。与会人员就双耳听觉、定向声束、声纹识别、助听设备适配等议题研讨。
AssemblyAI 更新了 2026 年 Python 音频处理库清单,指出 Python 3.13 已移除 audioop 模块,导致 pydub 多数操作报错。