跳到正文
10月1日周四
  1. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于谐波-打击分离神经音频编解码器的带宽扩展

    研究将音频带宽扩展重构为音频 token 预测问题,在谐波-打击分解引导的分离式神经音频编解码器产生的离散表示上训练 transformer 语言模型。该编解码器设计显式考虑下游 token 预测任务,实现编解码结构与 transformer 建模的更有效耦合。客观指标与主观评价均显示可高质量重建原始信号。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向鲁棒音频深度伪造检测的神经音频编解码器 FP-NAC

    研究提出取证保持神经音频编解码器 FP-NAC,通过检测器引导目标微调预训练编解码器,同时保留其原生硬量化路径与比特率。在 ASVspoof 2019 LA 上,FP-NAC 在 0.5 kbps 下相较原始 DAC 将 EER 最多降低 49.8 个百分点,并保持相近的重建质量。该工作还发现低速率下 DAC 与 EnCodec 主要削弱真实语音检测,而 X-Codec 表现出更强的伪造侧局限。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    预测 MOS 能否可靠复现语音增强中的人类系统级偏好?

    研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于事件级变换提示的游戏音效补全

    研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。

  5. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    跨会议持久说话人归属如何评估:SI-cpWER 基准与 ThyVoice 参考系统

    研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。

  6. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    Audible World Models:为 3D 世界生成空间感知音效

    Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。

  7. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    神经音频编解码器通过Token补全实现多速率带宽扩展

    研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。

  8. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    多预测器测试时优化可提高预测 MOS 分数却未改善语音增强感知质量

    一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。

  9. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于连续滤波器组与傅里叶神经算子的异构多类群生物声学分类

    研究提出采样频率无关(SFI)前端,直接在录音原生采样率下处理,并搭配带渐进时间尺度融合的傅里叶神经算子(FNO)骨干,避免固定采样率重采样与高频信息损失。在含84个类别、60种采样率的多类群语料上,SFI-FNO配置优于固定采样率和语料最大采样率基线,取得0.906准确率、0.921平衡准确率和0.899的Macro-F1。训练时轻度采样率增强进一步提升对未见采样率变化的鲁棒性。

  10. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    熟悉度是障碍还是助推?AI 语音克隆对普通话情感韵律识别的影响研究

    一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。

  11. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于相对音程网络的基频轨迹平滑方法 RIN

    研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。

  12. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于两阶段多分辨率集成模型的鲁棒唤醒词检测

    研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。

  13. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

  14. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向恐音症的触发声抑制研究:双路径网络选择性消除触发声

    一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。

  15. Hearing Health Foundation Blog
    发布于 2026-10-01 08:00

    听力健康基金会 2026 年度影响力报告:HRP 与 ERG 项目多项听觉与平衡研究进展

    听力健康基金会发布 2026 年度影响力报告,汇总听力恢复项目(HRP)与新兴研究资助(ERG)支持的多项听觉与平衡研究成果。ERG 科学家发现衰老大脑会放大退化听神经输入且与更差脑结构相关,锌信号抑制或可同时恢复听阈并抑制耳鸣相关神经亢进,耳蜗植入者佩戴时间下降者一年后表现明显更差。HRP 团队还报告了生成功能性人类听觉神经元的突破性方案。

  16. Phys.org 水声检索
    发布于 2026-10-01 02:40

    海鞘如何感知水下噪声:研究揭示基质振动而非声压主导行为反应

    德国波鸿鲁尔大学团队发现,海鞘 Halocynthia papillosa 在 50 至 800 赫兹的低频刺激下主要因基质振动增强而收缩,即使水下声压级超过 130 分贝,只要基质振动低于反应阈值便无类似反应。研究在《Marine Biology》发表,指出仅靠声压不足以解释底栖生物的行为反应,后续需结合生理与神经生物学研究确认感知机制。

  17. Earth Species Project
    发布于 2026-10-01 02:09

    模型合并让 NatureLM-audio 在未见物种上 F1 提升超 200%

    Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。

9月30日周三
  1. Hearing Health and Technology Matters
    发布于 2026-09-30 23:24

    为什么耳鸣在夜间感觉更严重?以及应对方法

    临床心理学家 Jennifer Gans 指出,耳鸣并非在夜间真正加重,而是夜间外部声音减少、注意力转向内部、疲劳降低调节能力,加上大脑将睡前流程与耳鸣关联形成预期性耳鸣,使声音更易被察觉。她建议打乱睡前流程、识别预期性念头、用“我安全”“这是大脑产生的良性声音”等语言安抚神经系统,并借助轻柔背景声引导注意力,目标不是消除声音而是让神经系统平静。

  2. Ocean News 声学检索 RSS
    发布于 2026-09-30 22:52

    AZFP-nano 漂流浮标在俄勒冈觅食鲸鱼周边测绘浮游动物

    俄勒冈州立大学团队在俄勒冈近海觅食鲸鱼周边四次布放并回收 AZFP-nano 水面漂流浮标,用于研究捕食者—猎物动态,期间遇到座头鲸、蓝鲸和长须鲸集群。该浮标核心是一台紧凑轻量的单频 200 kHz 科学回声测深仪,为 AZFP 的小型化版本,采用标准 D 型电池供电。团队同时布放一台搭载水听器的漂流浮标记录鲸鱼发声行为,原型在野外工作良好。

  3. ASE 美国超声心动图学会
    发布于 2026-09-30 22:08

    十月 JASE 上线:儿童癌症幸存者静息自然剪切波速度与心肺适能受损相关

    十月 JASE 在线发表原创研究,发现儿童癌症幸存者静息状态下的自然剪切波速度与心肺适能受损相关。Jens-Uwe Voigt 指出,自然剪切波成像或有助于在静息条件下检出与心肺适能下降相关的心脏功能细微改变。本期还收录二尖瓣反流右室应变、二尖瓣环分离、中度主动脉瓣狭窄干预、心包积液定量及胎儿房间隔瘤与心律失常等主题。

  4. SoundGuys
    发布于 2026-09-30 16:13

    AirPods 5 可维修性评分升至 2/10,打破苹果耳机十年零分纪录

    iFixit 给 AirPods 5 打出 2/10 的可维修性评分,打破苹果耳机连续十年 0/10 的纪录。沿驱动单元接缝施加受控加热即可分离外壳,耳机电池采用模块化触点设计,无需焊接即可更换,但左右耳电池极性相反、触点错位,无法互换。充电盒仍用胶粘与塑料焊接封死,拆解即损毁,且官方不提供备件与维修手册。

  5. Acoustical Surfaces
    发布于 2026-09-30 15:56

    Acoustical Surfaces 谈博物馆与美术馆声学优化

    Acoustical Surfaces 发文讨论博物馆与美术馆的声学优化,指出大型展厅、挑高天花板、抛光混凝土、石材、玻璃和硬木等表面会高效反射声音,使交谈、脚步和展项音频相互叠加。文章建议通过调整展项朝向、扬声器指向、在反射面增加吸声、分隔动静展区及必要时做隔声来改善语音清晰度,并强调声学规划应尽早介入。

  6. Hearing Health and Technology Matters
    发布于 2026-09-30 10:54

    美国听力学医师学会与 WSA 发起 Listen Up 听力筛查活动,倡导 50 岁起常规查听力

    美国听力学医师学会(ADA)与助听器厂商 WSA 联合发起全国性公众意识活动 Listen Up,鼓励成人在 50 岁开始将听力筛查纳入常规健康管理。该活动在肯塔基州试点后正扩展至德克萨斯、佛罗里达、科罗拉多和伊利诺伊州,并推动将听力筛查引入初级保健等成人常规体检场景。