VOSSA:面向流式语音架构的声纹优化框架
VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。
VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。
一项研究将概念瓶颈模型引入语音情感识别,考察预测如何依赖转录文本、声学描述和说话人属性。实验用三个 LLM 在 CREMA-D、IEMOCAP 和 MELD 上测试,零样本下模型强烈偏向转录文本,使 CREMA-D 的 Macro-F1 从 27.8 降至 5.8;微调后该偏差消除,转录文本将 Macro-F1 从 41.8 提升至 45.1。
研究者提出单调性引导语义对齐(MGSA)框架,用于零样本多说话人图像到语音(Img2Sp)合成,通过语义语音单元提供跨说话人共享内容目标,并借助参考语音进行说话人条件化。
研究提出自适应 Beta 约束决策导向(ABCDD)语音增强框架,通过帧相关增益下限扩展传统 DD 方法,beta 参数控制噪声抑制与语音保留的权衡。团队进一步用轻量多层感知机(MLP)从含噪语音特征预测帧级 beta 值。
一项研究提出结合 WhisperX 语音识别与 Silero 语音活动检测并优化时间戳的系统,用于自动估计运动神经元病患者的言语流畅性指数(VFI)。该系统基于运动神经元病数据集,在 P-words 上取得 R² 0.9、NRMSE 0.05,在 S-words 上取得 R² 0.8、NRMSE 0.08,优于传统声学特征和自监督嵌入方案,临床启发特征表现最佳。
研究提出 PACT-SLM 评测契约,为流式语音智能体分配首个有效动作时间,并分别测量动作身份与时机。其诊断集含 4 个留出语义家族的 80 组配对对比和 1600 条前缀预测,覆盖干净与 15 dB 噪声渲染。重拟合的 WavLM Base Plus 探针动作后语义标签准确率为 26.03%,在动作前前缀上暴露动作的比例为 18.99%。
研究者发布 WASIL 阿拉伯语口语交互数据集,包含音频、ASR 假设、助手回复及显式喜欢/不喜欢反馈,共 8,529 轮,其中 14.2% 为不喜欢。另含 2,000 轮测试集,覆盖现代标准阿拉伯语及四种主要方言。数据集通过多 ASR 一致性引导后编辑提供低成本金标准转写,并标注可回答性以区分固有不可回答与 ASR 导致的退化。
Tacit-TTS 是一种从 IndexTTS2 蒸馏的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。
研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。
FFASR 是一个包含 15,637 条话语的留出语料库与公开排行榜,覆盖九种条件,分别改变单一声学因素:近场消声语音、实测与模拟办公室-实验室配对、高/中/低信噪比静态远场混合,以及匹配信噪比下的移动说话人变体。
研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。
一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。
研究者提出双状态稀疏循环单元 DuSpaR,用于资源受限边缘设备上的语音处理模型,通过双状态循环在有状态反馈回路中调制输入向量,并用 ReLU 激活稀疏化矩阵向量乘法中的输入操作数,动态跳过零项以减少乘累加运算和权重内存读取。
SCBX Innovation Lab 团队提出 SpeechConversationBench(SCB),用 103 个分片 GSM8K 问题评测语音到语音模型的语音数学推理。
一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。
研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。
研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。
研究者提出 Talk2Agent,用于评估语音接口向基于 LLM 的计算机使用智能体传达口语指令的效果,任务源自 WildClawBench 和 OSWorld。
研究提出 Speaker Handles,用软 token 表示把声学说话人身份暴露给冻结的文本 LLM,实现跨会话的说话人相关推理。其轻量投影器参数不足主干 0.1%,在 VoxCeleb1 上达 97.40-98.36% 准确率,在 SpeakerBind 上为 70.40%,接近 71.88% 的 topline。
一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。
Crab(Contrastive Representation and Multimodal Aligned Bottleneck)是一种双模态跨模态 Transformer 架构,融合 WavLM 语音表征与 RoBERTa 文本表征,并提出多层对比监督(MLCS)策略,在网络多层注入多正样本对比学习信号,推理时不增加参数。
听力健康基金会发布 2026 年度影响力报告,汇总听力恢复项目(HRP)与新兴研究资助(ERG)支持的多项听觉与平衡研究成果。ERG 科学家发现衰老大脑会放大退化听神经输入且与更差脑结构相关,锌信号抑制或可同时恢复听阈并抑制耳鸣相关神经亢进,耳蜗植入者佩戴时间下降者一年后表现明显更差。HRP 团队还报告了生成功能性人类听觉神经元的突破性方案。
Audien Hearing 宣布与演员 William Shatner 合作,推出名为“Boldly Hear What's Next”的推广活动,鼓励听损成年人采取行动改善听力。95 岁的 Shatner 本人使用 Audien 的 Atom X 非处方助听器,该产品配备可调节音量与聆听模式的触屏充电盒,并附赠一次免费的一对一听力专家 Sound Check 服务。
临床心理学家 Jennifer Gans 指出,耳鸣并非在夜间真正加重,而是夜间外部声音减少、注意力转向内部、疲劳降低调节能力,加上大脑将睡前流程与耳鸣关联形成预期性耳鸣,使声音更易被察觉。她建议打乱睡前流程、识别预期性念头、用“我安全”“这是大脑产生的良性声音”等语言安抚神经系统,并借助轻柔背景声引导注意力,目标不是消除声音而是让神经系统平静。
美国听力学医师学会(ADA)与助听器厂商 WSA 联合发起全国性公众意识活动 Listen Up,鼓励成人在 50 岁开始将听力筛查纳入常规健康管理。该活动在肯塔基州试点后正扩展至德克萨斯、佛罗里达、科罗拉多和伊利诺伊州,并推动将听力筛查引入初级保健等成人常规体检场景。
一名重度听障者携助听器与人工耳蜗赴爱尔兰旅行,借助蓝牙、智能手机、唇读和 Live Captions 实时字幕应对当地口音,发现适应数日后读爱尔兰唇语与读加拿大唇语难度相当。其指出城堡、遗迹和博物馆的旅游视频普遍缺少字幕,语音导览又受背景噪声干扰,多数景点靠信息牌弥补。
AssemblyAI 发文梳理教育平台评估语音转文字 API 的要点:评估集应以学生音频为主,覆盖口音、儿童语音、远场教室拾音和语码转换,而非干净的教师讲课录音。长音频需区分归档回填与持续采集两类负载,关注季节性、吞吐上限和并发限制。
AssemblyAI 指出,关键术语提示并非词典而是概率偏置,会在全篇范围内影响模型输出。其文档示例中,音频实际说 "Kelly Byrne Donahue",加入相似关键术语 "Kelly Byrne-Donoghue" 后三次运行均被改写;而音频说 "Vertex"、关键术语为 "Vortex" 时三次均未翻转。
AssemblyAI 发布教程,介绍如何用约 100 行 Python 代码搭建语音翻译应用,串联语音转文字、翻译和文本转语音三步,将英语录音翻译成西班牙语、土耳其语和日语并克隆原声朗读。
AssemblyAI 发现部分客户用传统 WER 基准测试其新模型 Universal-3 Pro 时,结果反而差于旧模型,原因是插入错误偏多。回听音频后确认,这些插入大多是人工标注漏掉的真实语音,在噪声、口音、重叠说话等困难音频上模型常优于人工标注。
AssemblyAI 发布技术指南,说明临床听写应如何在 Sync API 与 Dictation API 之间选型:前者返回逐字转写,后者同时返回逐字文本和经 llm.instruction 清理的可控版本。
AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。
AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。
AssemblyAI 与 LiveKit 在纽约联合举办聚会,分享构建真实场景语音智能体的 7 条经验。Boardy 与 Flagler Health 的工程团队展示了两种截然不同的语音智能体架构:前者开放式对话,后者按流程图处理医疗预约。
研究发现 TECTB 基因特定变异可直接导致听力损失,携带两份变异的小鼠出现盖膜结构严重破坏和深度耳聋,相关成果发表于 Advanced Science。携带一份变异的人类有明显听力损失,而单拷贝小鼠基线听力正常,但暴露于中等强度噪声后出现永久性严重听力损失,揭示该变异使耳蜗对噪声创伤更敏感。研究建议将 TECTB 纳入遗传性听力损失诊断 panel。
Legato 准备以 Legato Frames 进入听力眼镜市场,这款眼镜在镜腿内集成听力辅助,面向轻度至中度听力损失人群,结合其 SpeechSense AI 处理、开放式声学设计与处方镜片。
9 月 28 日发表于 JAMA Neurology 的 CHOICE 随机临床试验显示,703 名 60 岁以上同时患有听力损失与轻度认知障碍(MCI)的上海老年人中,佩戴 Widex Evoke 双侧助听器组两年内进展为痴呆级损害的比例为 3.09%,低于听力教育组的 4.74%,但差异未达统计学显著。
Med-El 推出 TICI Unico,公司称其为完全隐形的人工耳蜗,麦克风等部件全部植入皮下,日常使用无需外部硬件。该产品源于 Med-El 此前 TICI 平台可行性研究结果及在欧洲开展的早期手术,面向看重隐蔽性与便利性的患者。Med-El 联合创始人兼 CEO Ingeborg Hochmair 表示,这是人工耳蜗的一个新类别,首次实现人工耳蜗的隐形听力。
听觉科学生物技术公司 Cilcare 在东京设立子公司 Cilcare K.K.,作为其在日本及亚太地区拓展合作的本地基地。该子公司将对接日本机构与 Cilcare 在欧美的研发网络,此前公司已与日本药企盐野义就 CIL001 和 CIL003 的联合开发与商业化建立战略合作。Aurore Marie 被任命为日本及亚洲区总经理,常驻东京负责相关业务。
奥地利听力植入厂商 MED-EL 发布 TICI UNICO,称其为首款商用全植入式人工耳蜗,麦克风、电子器件与可充电电池均置于皮下,无耳后或耳上外部处理器。植入电池满电可用约 40 小时,日常充电约 1 小时,需用外部 GoPod 贴于头部,充电时仍可听到声音;电池不可单独更换,若需更换须再次手术。