预测 MOS 能否可靠复现语音增强中的人类系统级偏好?
研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。
研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。
研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。
FFASR 是一个包含 15,637 条话语的留出语料库与公开排行榜,覆盖九种条件,分别改变单一声学因素:近场消声语音、实测与模拟办公室-实验室配对、高/中/低信噪比静态远场混合,以及匹配信噪比下的移动说话人变体。
研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。
研究发现,大型音频语言模型(LALM)中音频 token 将获得的注意力,可在语言模型运行前由其编码器输出线性预测,在 13 个 LALM 中的 11 个上全层注意力排序相关系数 ρ≥0.69。
Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。
研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。
研究者提出 SE-ADD 自进化音频深伪检测框架,通过低秩适配(LoRA)利用音频语言模型自身的判定结果与自生成取证线索构建错误驱动监督,迭代更新模型。在 Qwen2-Audio 上等错误率(EER)从 36.72% 降至 7.52%,在 MOSS-Audio 上从 19.93% 降至 3.97%。
一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。
研究者提出双状态稀疏循环单元 DuSpaR,用于资源受限边缘设备上的语音处理模型,通过双状态循环在有状态反馈回路中调制输入向量,并用 ReLU 激活稀疏化矩阵向量乘法中的输入操作数,动态跳过零项以减少乘累加运算和权重内存读取。
研究提出采样频率无关(SFI)前端,直接在录音原生采样率下处理,并搭配带渐进时间尺度融合的傅里叶神经算子(FNO)骨干,避免固定采样率重采样与高频信息损失。在含84个类别、60种采样率的多类群语料上,SFI-FNO配置优于固定采样率和语料最大采样率基线,取得0.906准确率、0.921平衡准确率和0.899的Macro-F1。训练时轻度采样率增强进一步提升对未见采样率变化的鲁棒性。
SCBX Innovation Lab 团队提出 SpeechConversationBench(SCB),用 103 个分片 GSM8K 问题评测语音到语音模型的语音数学推理。
SURE-EVAL 是一个面向音频与语音系统的系统化统一智能体评测框架,通过工具智能体工作流将模型发布转化为隔离、可验证的可调用工具,并将所有计分操作交由版本化确定性程序执行。
一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。
研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。
研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。
研究者提出 Talk2Agent,用于评估语音接口向基于 LLM 的计算机使用智能体传达口语指令的效果,任务源自 WildClawBench 和 OSWorld。
研究提出 Speaker Handles,用软 token 表示把声学说话人身份暴露给冻结的文本 LLM,实现跨会话的说话人相关推理。其轻量投影器参数不足主干 0.1%,在 VoxCeleb1 上达 97.40-98.36% 准确率,在 SpeakerBind 上为 70.40%,接近 71.88% 的 topline。
研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。
一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。
Crab(Contrastive Representation and Multimodal Aligned Bottleneck)是一种双模态跨模态 Transformer 架构,融合 WavLM 语音表征与 RoBERTa 文本表征,并提出多层对比监督(MLCS)策略,在网络多层注入多正样本对比学习信号,推理时不增加参数。
美国诊断医学超声学会(SDMS)于今年 10 月参与庆祝医学超声宣传月(MUAM),2026 年主题为“Inside Images”,旨在表彰超声医师对患者诊疗的贡献。SDMS 联合 AIUM、ARDMS、ASE、CCI 和 SVU 共同推广该活动,并鼓励医疗机构、影像中心和教育机构开展表彰活动,使用 #MUAM2026 标签。SDMS 还提供 MUAM 资源和 2026 年主题周边。
ETS-Lindgren 将于 10 月 17 日至 20 日在新奥尔良 Ernest N. Morial 会议中心举办的 2026 Healthcare Design Conference + Expo(展位 #2627)展示 MRI 射频屏蔽产品与服务,包括 EVO 系列 MRI 射频屏蔽门及 ClearShield S-Glass、氧气监测系统(OMS)等配件。
听力健康基金会发布 2026 年度影响力报告,汇总听力恢复项目(HRP)与新兴研究资助(ERG)支持的多项听觉与平衡研究成果。ERG 科学家发现衰老大脑会放大退化听神经输入且与更差脑结构相关,锌信号抑制或可同时恢复听阈并抑制耳鸣相关神经亢进,耳蜗植入者佩戴时间下降者一年后表现明显更差。HRP 团队还报告了生成功能性人类听觉神经元的突破性方案。
Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。
十月 JASE 在线发表原创研究,发现儿童癌症幸存者静息状态下的自然剪切波速度与心肺适能受损相关。Jens-Uwe Voigt 指出,自然剪切波成像或有助于在静息条件下检出与心肺适能下降相关的心脏功能细微改变。本期还收录二尖瓣反流右室应变、二尖瓣环分离、中度主动脉瓣狭窄干预、心包积液定量及胎儿房间隔瘤与心律失常等主题。
Siemens Simcenter 发布 2026 年 9 月物理测试月度更新,汇总自动化 blocked force 测试、环境测试、旋转机械开发等资源,并重点介绍 Simcenter Testlab 2606 的自动化部件表征、虚拟 NVH 开发、结构动力学、振动鉴定、免许可采集和 AI 就绪测试数据等能力。
Sonotec 国际销售经理 Kevin Chang 访华期间到访北京长期合作伙伴 JiashengTest Engineering Co., Ltd.(JECO),与总经理 Shuai 先生及销售助理 Lucy 就双方持续合作及面向中国市场的超声检测方案交换意见。JECO 已将 Sonotec 的 SONOAIR 系统和空气耦合超声检测(ACUT)换能器成功交付中国客户。
Acoustical Surfaces 发文讨论博物馆与美术馆的声学优化,指出大型展厅、挑高天花板、抛光混凝土、石材、玻璃和硬木等表面会高效反射声音,使交谈、脚步和展项音频相互叠加。文章建议通过调整展项朝向、扬声器指向、在反射面增加吸声、分隔动静展区及必要时做隔声来改善语音清晰度,并强调声学规划应尽早介入。
AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。
AssemblyAI 发文梳理教育平台评估语音转文字 API 的要点:评估集应以学生音频为主,覆盖口音、儿童语音、远场教室拾音和语码转换,而非干净的教师讲课录音。长音频需区分归档回填与持续采集两类负载,关注季节性、吞吐上限和并发限制。
AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。
中国科学院声学研究所噪声与音频声学实验室原野、刘斌等人提出一种基于蒙皮局域共振模式的高分辨率成像检测新方法,用于蜂窝结构蒙皮-蜂窝芯脱粘缺陷检测。研究发现蜂窝结构在低频范围内存在由蒙皮局域共振引起的特殊振动模态,完好区域蜂窝孔洞处与芯壁连接处信号幅度差可达约20 dB且呈周期性变化,脱粘时该周期性差异消失。
小提琴家 Nigel Kennedy 的制作经理兼音响工程师 Andreas Adelhofer 在近期约 40 场英国巡演中选用 DPA 麦克风,以保证从最弱段落到最强峰值、从钢琴到低音提琴的拾音保持中性干净。他表示 N-Series 数字无线系统将同样的清晰度带入无线传输,调谐范围 470–870 MHz,可充电电池每次充电约 13 小时。
AssemblyAI 指出,关键术语提示并非词典而是概率偏置,会在全篇范围内影响模型输出。其文档示例中,音频实际说 "Kelly Byrne Donahue",加入相似关键术语 "Kelly Byrne-Donoghue" 后三次运行均被改写;而音频说 "Vertex"、关键术语为 "Vortex" 时三次均未翻转。
AssemblyAI 发布教程,介绍如何用约 100 行 Python 代码搭建语音翻译应用,串联语音转文字、翻译和文本转语音三步,将英语录音翻译成西班牙语、土耳其语和日语并克隆原声朗读。
AssemblyAI 发现部分客户用传统 WER 基准测试其新模型 Universal-3 Pro 时,结果反而差于旧模型,原因是插入错误偏多。回听音频后确认,这些插入大多是人工标注漏掉的真实语音,在噪声、口音、重叠说话等困难音频上模型常优于人工标注。
AssemblyAI 发布面向 2026 模型格局的提示工程速成课程,其 YouTube 版自 2023 年以来播放量已超 20 万次。课程涵盖提示的五要素、八条仍有效的技巧与输出控制方法,并指出结构化输出已获 API 支持,提示工程在音频场景下规则会反转。
AssemblyAI 发布技术指南,说明临床听写应如何在 Sync API 与 Dictation API 之间选型:前者返回逐字转写,后者同时返回逐字文本和经 llm.instruction 清理的可控版本。
AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。