跳到正文
今天10月2日周五
  1. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    可解释的目标感知合成器调制恢复方法

    研究提出一种可解释的目标感知调制与波形恢复流程,先识别被调制目标,再恢复各目标对应的 LFO 波形并估计振荡器波形以匹配源音色。训练采用含噪声振荡器和更多调制选项的可微合成器,并探索感知损失与对抗训练。客观与主观评测显示,正确预测调制目标是关键,其 Gammatone 损失与 CQT 判别器在感知质量上显著优于传统 MSS 损失。

  2. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    PLACE:基于条件嵌入的位置潜在适配用于双耳音频生成

    PLACE 通过条件嵌入的位置潜在适配方法,扩展预训练任意到音频模型 AudioX,实现由文本、视频及可选音频提示组合生成双耳音频。该方法用 Perception Encoder Core 特征增强视频条件,对齐文本与视频表示以提取空间线索,并对生成潜在施加条件相关低秩变换,以解码音频的双耳声级差与时间差为目标监督适配器。

10月1日周四
  1. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    Bin2Ambi:利用头部追踪双耳音频学习 Ambisonics 声场重建

    研究提出并定义新任务 Bin2Ambi,即从双耳音频转换到 Ambisonics 声场。系统利用智能耳机运动传感器同步采集的头部追踪数据,缓解双耳音频前后定位模糊与混淆锥侧向误差带来的方向不确定性。客观指标与主观听音测试显示,转换后的 Ambisonics 声场平均方向误差最高约 11.8°,感知空间质量接近 DirAC 基准模型。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    Audible World Models:为 3D 世界生成空间感知音效

    Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。

9月30日周三
  1. DPA Microphones
    发布于 2026-09-30 08:00

    Andreas Adelhofer 谈巡演中使用 DPA 麦克风与 N-Series

    小提琴家 Nigel Kennedy 的制作经理兼音响工程师 Andreas Adelhofer 在近期约 40 场英国巡演中选用 DPA 麦克风,以保证从最弱段落到最强峰值、从钢琴到低音提琴的拾音保持中性干净。他表示 N-Series 数字无线系统将同样的清晰度带入无线传输,调谐范围 470–870 MHz,可充电电池每次充电约 13 小时。

  2. IOA 综合新闻
    发布于 2026-09-30 08:00

    中国科学院老科协声学所分会举办2026年度"智能化趋势下的新电声技术"学术沙龙

    2026年9月29日,中国科学院老科协声学所分会在声学所举办"智能化趋势下的新电声技术"学术沙龙,声学所副所长杨军作主旨报告。报告介绍声学技术与人工智能、数字信号处理融合趋势,围绕有源噪声控制、个人音频系统与局部声场重建,结合车载降噪、分区聆听、参量阵定向发声等实例阐述,并现场演示聚音屏定向声和免佩戴耳机虚拟环绕声效果。与会人员就双耳听觉、定向声束、声纹识别、助听设备适配等议题研讨。