跳到正文
10月1日周四
  1. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    预测 MOS 能否可靠复现语音增强中的人类系统级偏好?

    研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于事件级变换提示的游戏音效补全

    研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    跨会议持久说话人归属如何评估:SI-cpWER 基准与 ThyVoice 参考系统

    研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    Audible World Models:为 3D 世界生成空间感知音效

    Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。

  5. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    神经音频编解码器通过Token补全实现多速率带宽扩展

    研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。

  6. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    多预测器测试时优化可提高预测 MOS 分数却未改善语音增强感知质量

    一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。

  7. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于连续滤波器组与傅里叶神经算子的异构多类群生物声学分类

    研究提出采样频率无关(SFI)前端,直接在录音原生采样率下处理,并搭配带渐进时间尺度融合的傅里叶神经算子(FNO)骨干,避免固定采样率重采样与高频信息损失。在含84个类别、60种采样率的多类群语料上,SFI-FNO配置优于固定采样率和语料最大采样率基线,取得0.906准确率、0.921平衡准确率和0.899的Macro-F1。训练时轻度采样率增强进一步提升对未见采样率变化的鲁棒性。

  8. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    熟悉度是障碍还是助推?AI 语音克隆对普通话情感韵律识别的影响研究

    一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。

  9. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于相对音程网络的基频轨迹平滑方法 RIN

    研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。

  10. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于两阶段多分辨率集成模型的鲁棒唤醒词检测

    研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。

  11. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

  12. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向恐音症的触发声抑制研究:双路径网络选择性消除触发声

    一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。

  13. SDMS 超声诊断医学超声师
    发布于 2026-10-01 08:00

    SDMS 庆祝 2026 年医学超声宣传月,主题“Inside Images”

    美国诊断医学超声学会(SDMS)于今年 10 月参与庆祝医学超声宣传月(MUAM),2026 年主题为“Inside Images”,旨在表彰超声医师对患者诊疗的贡献。SDMS 联合 AIUM、ARDMS、ASE、CCI 和 SVU 共同推广该活动,并鼓励医疗机构、影像中心和教育机构开展表彰活动,使用 #MUAM2026 标签。SDMS 还提供 MUAM 资源和 2026 年主题周边。

  14. Hearing Health Foundation Blog
    发布于 2026-10-01 08:00

    听力健康基金会 2026 年度影响力报告:HRP 与 ERG 项目多项听觉与平衡研究进展

    听力健康基金会发布 2026 年度影响力报告,汇总听力恢复项目(HRP)与新兴研究资助(ERG)支持的多项听觉与平衡研究成果。ERG 科学家发现衰老大脑会放大退化听神经输入且与更差脑结构相关,锌信号抑制或可同时恢复听阈并抑制耳鸣相关神经亢进,耳蜗植入者佩戴时间下降者一年后表现明显更差。HRP 团队还报告了生成功能性人类听觉神经元的突破性方案。

  15. Earth Species Project
    发布于 2026-10-01 02:09

    模型合并让 NatureLM-audio 在未见物种上 F1 提升超 200%

    Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。

9月30日周三
  1. ASE 美国超声心动图学会
    发布于 2026-09-30 22:08

    十月 JASE 上线:儿童癌症幸存者静息自然剪切波速度与心肺适能受损相关

    十月 JASE 在线发表原创研究,发现儿童癌症幸存者静息状态下的自然剪切波速度与心肺适能受损相关。Jens-Uwe Voigt 指出,自然剪切波成像或有助于在静息条件下检出与心肺适能下降相关的心脏功能细微改变。本期还收录二尖瓣反流右室应变、二尖瓣环分离、中度主动脉瓣狭窄干预、心包积液定量及胎儿房间隔瘤与心律失常等主题。

  2. Sonotec 新闻
    发布于 2026-09-30 16:06

    Sonotec 国际销售经理访华,与 JECO 深化超声检测合作

    Sonotec 国际销售经理 Kevin Chang 访华期间到访北京长期合作伙伴 JiashengTest Engineering Co., Ltd.(JECO),与总经理 Shuai 先生及销售助理 Lucy 就双方持续合作及面向中国市场的超声检测方案交换意见。JECO 已将 Sonotec 的 SONOAIR 系统和空气耦合超声检测(ACUT)换能器成功交付中国客户。

  3. Acoustical Surfaces
    发布于 2026-09-30 15:56

    Acoustical Surfaces 谈博物馆与美术馆声学优化

    Acoustical Surfaces 发文讨论博物馆与美术馆的声学优化,指出大型展厅、挑高天花板、抛光混凝土、石材、玻璃和硬木等表面会高效反射声音,使交谈、脚步和展项音频相互叠加。文章建议通过调整展项朝向、扬声器指向、在反射面增加吸声、分隔动静展区及必要时做隔声来改善语音清晰度,并强调声学规划应尽早介入。

  4. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈环境 AI 记录工具如何适配兽医与法律场景

    AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。

  5. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 发布语音智能体上线运行手册:流量爬坡、回滚与值班

    AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。

  6. IOA 科研进展
    发布于 2026-09-30 08:00

    中科院声学所提出基于蜂窝结构低频局域共振的高分辨率成像检测新方法

    中国科学院声学研究所噪声与音频声学实验室原野、刘斌等人提出一种基于蒙皮局域共振模式的高分辨率成像检测新方法,用于蜂窝结构蒙皮-蜂窝芯脱粘缺陷检测。研究发现蜂窝结构在低频范围内存在由蒙皮局域共振引起的特殊振动模态,完好区域蜂窝孔洞处与芯壁连接处信号幅度差可达约20 dB且呈周期性变化,脱粘时该周期性差异消失。

  7. DPA Microphones
    发布于 2026-09-30 08:00

    Andreas Adelhofer 谈巡演中使用 DPA 麦克风与 N-Series

    小提琴家 Nigel Kennedy 的制作经理兼音响工程师 Andreas Adelhofer 在近期约 40 场英国巡演中选用 DPA 麦克风,以保证从最弱段落到最强峰值、从钢琴到低音提琴的拾音保持中性干净。他表示 N-Series 数字无线系统将同样的清晰度带入无线传输,调谐范围 470–870 MHz,可充电电池每次充电约 13 小时。

  8. AssemblyAI Blog
    发布于 2026-09-30 08:00

    如何评估听写 API:五项标准与测试方法

    AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。