跳到正文
10月1日周四
  1. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    跨会议持久说话人归属如何评估:SI-cpWER 基准与 ThyVoice 参考系统

    研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    Audible World Models:为 3D 世界生成空间感知音效

    Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    神经音频编解码器通过Token补全实现多速率带宽扩展

    研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。

  4. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    多预测器测试时优化可提高预测 MOS 分数却未改善语音增强感知质量

    一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。

  5. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于连续滤波器组与傅里叶神经算子的异构多类群生物声学分类

    研究提出采样频率无关(SFI)前端,直接在录音原生采样率下处理,并搭配带渐进时间尺度融合的傅里叶神经算子(FNO)骨干,避免固定采样率重采样与高频信息损失。在含84个类别、60种采样率的多类群语料上,SFI-FNO配置优于固定采样率和语料最大采样率基线,取得0.906准确率、0.921平衡准确率和0.899的Macro-F1。训练时轻度采样率增强进一步提升对未见采样率变化的鲁棒性。

  6. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    熟悉度是障碍还是助推?AI 语音克隆对普通话情感韵律识别的影响研究

    一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。

  7. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于相对音程网络的基频轨迹平滑方法 RIN

    研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。

  8. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于两阶段多分辨率集成模型的鲁棒唤醒词检测

    研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。

  9. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

  10. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向恐音症的触发声抑制研究:双路径网络选择性消除触发声

    一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。

  11. Hearing Health Foundation Blog
    发布于 2026-10-01 08:00

    听力健康基金会 2026 年度影响力报告:HRP 与 ERG 项目多项听觉与平衡研究进展

    听力健康基金会发布 2026 年度影响力报告,汇总听力恢复项目(HRP)与新兴研究资助(ERG)支持的多项听觉与平衡研究成果。ERG 科学家发现衰老大脑会放大退化听神经输入且与更差脑结构相关,锌信号抑制或可同时恢复听阈并抑制耳鸣相关神经亢进,耳蜗植入者佩戴时间下降者一年后表现明显更差。HRP 团队还报告了生成功能性人类听觉神经元的突破性方案。

  12. Earth Species Project
    发布于 2026-10-01 02:09

    模型合并让 NatureLM-audio 在未见物种上 F1 提升超 200%

    Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。

9月30日周三
  1. ASE 美国超声心动图学会
    发布于 2026-09-30 22:08

    十月 JASE 上线:儿童癌症幸存者静息自然剪切波速度与心肺适能受损相关

    十月 JASE 在线发表原创研究,发现儿童癌症幸存者静息状态下的自然剪切波速度与心肺适能受损相关。Jens-Uwe Voigt 指出,自然剪切波成像或有助于在静息条件下检出与心肺适能下降相关的心脏功能细微改变。本期还收录二尖瓣反流右室应变、二尖瓣环分离、中度主动脉瓣狭窄干预、心包积液定量及胎儿房间隔瘤与心律失常等主题。

  2. Acoustical Surfaces
    发布于 2026-09-30 15:56

    Acoustical Surfaces 谈博物馆与美术馆声学优化

    Acoustical Surfaces 发文讨论博物馆与美术馆的声学优化,指出大型展厅、挑高天花板、抛光混凝土、石材、玻璃和硬木等表面会高效反射声音,使交谈、脚步和展项音频相互叠加。文章建议通过调整展项朝向、扬声器指向、在反射面增加吸声、分隔动静展区及必要时做隔声来改善语音清晰度,并强调声学规划应尽早介入。

  3. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈环境 AI 记录工具如何适配兽医与法律场景

    AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。

  4. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 发布语音智能体上线运行手册:流量爬坡、回滚与值班

    AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。

  5. IOA 科研进展
    发布于 2026-09-30 08:00

    中科院声学所提出基于蜂窝结构低频局域共振的高分辨率成像检测新方法

    中国科学院声学研究所噪声与音频声学实验室原野、刘斌等人提出一种基于蒙皮局域共振模式的高分辨率成像检测新方法,用于蜂窝结构蒙皮-蜂窝芯脱粘缺陷检测。研究发现蜂窝结构在低频范围内存在由蒙皮局域共振引起的特殊振动模态,完好区域蜂窝孔洞处与芯壁连接处信号幅度差可达约20 dB且呈周期性变化,脱粘时该周期性差异消失。

  6. DPA Microphones
    发布于 2026-09-30 08:00

    Andreas Adelhofer 谈巡演中使用 DPA 麦克风与 N-Series

    小提琴家 Nigel Kennedy 的制作经理兼音响工程师 Andreas Adelhofer 在近期约 40 场英国巡演中选用 DPA 麦克风,以保证从最弱段落到最强峰值、从钢琴到低音提琴的拾音保持中性干净。他表示 N-Series 数字无线系统将同样的清晰度带入无线传输,调谐范围 470–870 MHz,可充电电池每次充电约 13 小时。

  7. AssemblyAI Blog
    发布于 2026-09-30 08:00

    如何评估听写 API:五项标准与测试方法

    AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。

  8. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈语音 AI 可观测性:智能体上线后需要埋点哪些信号

    AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。

  9. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 如何在上线前对语音智能体做负载测试

    AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。

  10. Hearing Health Foundation Blog
    发布于 2026-09-30 08:00

    新发现的耳聋基因 TECTB 使耳朵对噪声更敏感

    研究发现 TECTB 基因特定变异可直接导致听力损失,携带两份变异的小鼠出现盖膜结构严重破坏和深度耳聋,相关成果发表于 Advanced Science。携带一份变异的人类有明显听力损失,而单拷贝小鼠基线听力正常,但暴露于中等强度噪声后出现永久性严重听力损失,揭示该变异使耳蜗对噪声创伤更敏感。研究建议将 TECTB 纳入遗传性听力损失诊断 panel。

9月29日周二
  1. Sandy Brown 新闻
    发布于 2026-09-29 21:37

    Sandy Brown 为 One Leadenhall 提供声学设计咨询

    Sandy Brown 受委托为 One Leadenhall 提供从概念设计到竣工的声学设计咨询,涵盖建筑围护结构隔声、内部空间隔声、混响控制及建筑设备噪声与振动管理。围护结构内部噪声标准参照 BREEAM、WELL 和 BCO 指南,并针对轻质幕墙侧向传声、楼层间空气声与撞击声制定了楼板和隔墙详细规格。塔楼高处应急发电机带来隔振、内部传声和环境噪声外泄挑战,为此开发了专用隔离箱中箱设计。

  2. Sandy Brown 新闻
    发布于 2026-09-29 21:21

    格拉斯哥 Citizens Theatre 完成大规模翻新后重新开放

    格拉斯哥 Citizens Theatre(The Citz)在经历大规模翻新与扩建后,于 2025 年 9 月重新开放。维多利亚时代原观众厅完成翻新,包括重新找坡的舞台、加高的吊杆塔、新座椅、新控制室和新通风系统;新建环绕式扩建部分设有黑盒工作室剧场、排练室、门厅与酒吧/活动空间、两间学习/活动空间及一个建造工坊。