跳到正文
10月1日周四
  1. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    VOSSA:面向流式语音架构的声纹优化框架

    VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    从语音到可编辑概念:用概念瓶颈模型探究语音情感识别

    一项研究将概念瓶颈模型引入语音情感识别,考察预测如何依赖转录文本、声学描述和说话人属性。实验用三个 LLM 在 CREMA-D、IEMOCAP 和 MELD 上测试,零样本下模型强烈偏向转录文本,使 CREMA-D 的 Macro-F1 从 27.8 降至 5.8;微调后该偏差消除,转录文本将 Macro-F1 从 41.8 提升至 45.1。

  3. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    基于 ASR 对齐与停顿建模的运动神经元病患者言语流畅性指数自动估计

    一项研究提出结合 WhisperX 语音识别与 Silero 语音活动检测并优化时间戳的系统,用于自动估计运动神经元病患者的言语流畅性指数(VFI)。该系统基于运动神经元病数据集,在 P-words 上取得 R² 0.9、NRMSE 0.05,在 S-words 上取得 R² 0.8、NRMSE 0.08,优于传统声学特征和自监督嵌入方案,临床启发特征表现最佳。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    PACT-SLM:语音语言模型在部分语音下何时有足够证据行动?

    研究提出 PACT-SLM 评测契约,为流式语音智能体分配首个有效动作时间,并分别测量动作身份与时机。其诊断集含 4 个留出语义家族的 80 组配对对比和 1600 条前缀预测,覆盖干净与 15 dB 噪声渲染。重拟合的 WavLM Base Plus 探针动作后语义标签准确率为 26.03%,在动作前前缀上暴露动作的比例为 18.99%。

  5. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    WASIL:面向 LLM 的野外阿拉伯语口语交互数据集

    研究者发布 WASIL 阿拉伯语口语交互数据集,包含音频、ASR 假设、助手回复及显式喜欢/不喜欢反馈,共 8,529 轮,其中 14.2% 为不喜欢。另含 2,000 轮测试集,覆盖现代标准阿拉伯语及四种主要方言。数据集通过多 ASR 一致性引导后编辑提供低成本金标准转写,并标注可回答性以区分固有不可回答与 ASR 导致的退化。

  6. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    预测 MOS 能否可靠复现语音增强中的人类系统级偏好?

    研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。

  7. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    跨会议持久说话人归属如何评估:SI-cpWER 基准与 ThyVoice 参考系统

    研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。

  8. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    多预测器测试时优化可提高预测 MOS 分数却未改善语音增强感知质量

    一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。

  9. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    熟悉度是障碍还是助推?AI 语音克隆对普通话情感韵律识别的影响研究

    一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。

  10. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于相对音程网络的基频轨迹平滑方法 RIN

    研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。

  11. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于两阶段多分辨率集成模型的鲁棒唤醒词检测

    研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。

  12. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向恐音症的触发声抑制研究:双路径网络选择性消除触发声

    一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。

  13. Hearing Health Foundation Blog
    发布于 2026-10-01 08:00

    听力健康基金会 2026 年度影响力报告:HRP 与 ERG 项目多项听觉与平衡研究进展

    听力健康基金会发布 2026 年度影响力报告,汇总听力恢复项目(HRP)与新兴研究资助(ERG)支持的多项听觉与平衡研究成果。ERG 科学家发现衰老大脑会放大退化听神经输入且与更差脑结构相关,锌信号抑制或可同时恢复听阈并抑制耳鸣相关神经亢进,耳蜗植入者佩戴时间下降者一年后表现明显更差。HRP 团队还报告了生成功能性人类听觉神经元的突破性方案。

  14. Hearing Review
    发布于 2026-10-01 03:00

    William Shatner 与 Audien Hearing 合作推出“Boldly Hear What's Next”助听器推广活动

    Audien Hearing 宣布与演员 William Shatner 合作,推出名为“Boldly Hear What's Next”的推广活动,鼓励听损成年人采取行动改善听力。95 岁的 Shatner 本人使用 Audien 的 Atom X 非处方助听器,该产品配备可调节音量与聆听模式的触屏充电盒,并附赠一次免费的一对一听力专家 Sound Check 服务。

9月30日周三
  1. Hearing Health and Technology Matters
    发布于 2026-09-30 23:24

    为什么耳鸣在夜间感觉更严重?以及应对方法

    临床心理学家 Jennifer Gans 指出,耳鸣并非在夜间真正加重,而是夜间外部声音减少、注意力转向内部、疲劳降低调节能力,加上大脑将睡前流程与耳鸣关联形成预期性耳鸣,使声音更易被察觉。她建议打乱睡前流程、识别预期性念头、用“我安全”“这是大脑产生的良性声音”等语言安抚神经系统,并借助轻柔背景声引导注意力,目标不是消除声音而是让神经系统平静。

  2. Hearing Health and Technology Matters
    发布于 2026-09-30 10:54

    美国听力学医师学会与 WSA 发起 Listen Up 听力筛查活动,倡导 50 岁起常规查听力

    美国听力学医师学会(ADA)与助听器厂商 WSA 联合发起全国性公众意识活动 Listen Up,鼓励成人在 50 岁开始将听力筛查纳入常规健康管理。该活动在肯塔基州试点后正扩展至德克萨斯、佛罗里达、科罗拉多和伊利诺伊州,并推动将听力筛查引入初级保健等成人常规体检场景。

  3. Hearing Health and Technology Matters
    发布于 2026-09-30 10:43

    读爱尔兰唇语——重度听障者的旅行建议

    一名重度听障者携助听器与人工耳蜗赴爱尔兰旅行,借助蓝牙、智能手机、唇读和 Live Captions 实时字幕应对当地口音,发现适应数日后读爱尔兰唇语与读加拿大唇语难度相当。其指出城堡、遗迹和博物馆的旅游视频普遍缺少字幕,语音导览又受背景噪声干扰,多数景点靠信息牌弥补。

  4. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈语音 AI 可观测性:智能体上线后需要埋点哪些信号

    AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。

  5. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 如何在上线前对语音智能体做负载测试

    AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。

  6. Hearing Health Foundation Blog
    发布于 2026-09-30 08:00

    新发现的耳聋基因 TECTB 使耳朵对噪声更敏感

    研究发现 TECTB 基因特定变异可直接导致听力损失,携带两份变异的小鼠出现盖膜结构严重破坏和深度耳聋,相关成果发表于 Advanced Science。携带一份变异的人类有明显听力损失,而单拷贝小鼠基线听力正常,但暴露于中等强度噪声后出现永久性严重听力损失,揭示该变异使耳蜗对噪声创伤更敏感。研究建议将 TECTB 纳入遗传性听力损失诊断 panel。

  7. Hearing Health and Technology Matters
    发布于 2026-09-30 04:30

    CHOICE 随机临床试验:助听器干预与老年 MCI 患者认知改善相关

    9 月 28 日发表于 JAMA Neurology 的 CHOICE 随机临床试验显示,703 名 60 岁以上同时患有听力损失与轻度认知障碍(MCI)的上海老年人中,佩戴 Widex Evoke 双侧助听器组两年内进展为痴呆级损害的比例为 3.09%,低于听力教育组的 4.74%,但差异未达统计学显著。

  8. Hearing Review
    发布于 2026-09-30 00:39

    Med-El 推出全植入式人工耳蜗 TICI Unico

    Med-El 推出 TICI Unico,公司称其为完全隐形的人工耳蜗,麦克风等部件全部植入皮下,日常使用无需外部硬件。该产品源于 Med-El 此前 TICI 平台可行性研究结果及在欧洲开展的早期手术,面向看重隐蔽性与便利性的患者。Med-El 联合创始人兼 CEO Ingeborg Hochmair 表示,这是人工耳蜗的一个新类别,首次实现人工耳蜗的隐形听力。

9月29日周二
  1. Hearing Health and Technology Matters
    发布于 2026-09-29 23:20

    Cilcare 在东京设立日本子公司 Cilcare K.K.,布局亚太扩张

    听觉科学生物技术公司 Cilcare 在东京设立子公司 Cilcare K.K.,作为其在日本及亚太地区拓展合作的本地基地。该子公司将对接日本机构与 Cilcare 在欧美的研发网络,此前公司已与日本药企盐野义就 CIL001 和 CIL003 的联合开发与商业化建立战略合作。Aurore Marie 被任命为日本及亚洲区总经理,常驻东京负责相关业务。

  2. Hearing Tracker
    发布于 2026-09-29 22:40

    MED-EL 推出 TICI UNICO 全植入式人工耳蜗

    奥地利听力植入厂商 MED-EL 发布 TICI UNICO,称其为首款商用全植入式人工耳蜗,麦克风、电子器件与可充电电池均置于皮下,无耳后或耳上外部处理器。植入电池满电可用约 40 小时,日常充电约 1 小时,需用外部 GoPod 贴于头部,充电时仍可听到声音;电池不可单独更换,若需更换须再次手术。