基于谐波-打击分离神经音频编解码器的带宽扩展
研究将音频带宽扩展重构为音频 token 预测问题,在谐波-打击分解引导的分离式神经音频编解码器产生的离散表示上训练 transformer 语言模型。该编解码器设计显式考虑下游 token 预测任务,实现编解码结构与 transformer 建模的更有效耦合。客观指标与主观评价均显示可高质量重建原始信号。
研究将音频带宽扩展重构为音频 token 预测问题,在谐波-打击分解引导的分离式神经音频编解码器产生的离散表示上训练 transformer 语言模型。该编解码器设计显式考虑下游 token 预测任务,实现编解码结构与 transformer 建模的更有效耦合。客观指标与主观评价均显示可高质量重建原始信号。
研究提出取证保持神经音频编解码器 FP-NAC,通过检测器引导目标微调预训练编解码器,同时保留其原生硬量化路径与比特率。在 ASVspoof 2019 LA 上,FP-NAC 在 0.5 kbps 下相较原始 DAC 将 EER 最多降低 49.8 个百分点,并保持相近的重建质量。该工作还发现低速率下 DAC 与 EnCodec 主要削弱真实语音检测,而 X-Codec 表现出更强的伪造侧局限。
研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。
研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。
FFASR 是一个包含 15,637 条话语的留出语料库与公开排行榜,覆盖九种条件,分别改变单一声学因素:近场消声语音、实测与模拟办公室-实验室配对、高/中/低信噪比静态远场混合,以及匹配信噪比下的移动说话人变体。
研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。
研究发现,大型音频语言模型(LALM)中音频 token 将获得的注意力,可在语言模型运行前由其编码器输出线性预测,在 13 个 LALM 中的 11 个上全层注意力排序相关系数 ρ≥0.69。
Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。
研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。
研究者提出 SE-ADD 自进化音频深伪检测框架,通过低秩适配(LoRA)利用音频语言模型自身的判定结果与自生成取证线索构建错误驱动监督,迭代更新模型。在 Qwen2-Audio 上等错误率(EER)从 36.72% 降至 7.52%,在 MOSS-Audio 上从 19.93% 降至 3.97%。
一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。
研究者提出双状态稀疏循环单元 DuSpaR,用于资源受限边缘设备上的语音处理模型,通过双状态循环在有状态反馈回路中调制输入向量,并用 ReLU 激活稀疏化矩阵向量乘法中的输入操作数,动态跳过零项以减少乘累加运算和权重内存读取。
研究提出采样频率无关(SFI)前端,直接在录音原生采样率下处理,并搭配带渐进时间尺度融合的傅里叶神经算子(FNO)骨干,避免固定采样率重采样与高频信息损失。在含84个类别、60种采样率的多类群语料上,SFI-FNO配置优于固定采样率和语料最大采样率基线,取得0.906准确率、0.921平衡准确率和0.899的Macro-F1。训练时轻度采样率增强进一步提升对未见采样率变化的鲁棒性。
SCBX Innovation Lab 团队提出 SpeechConversationBench(SCB),用 103 个分片 GSM8K 问题评测语音到语音模型的语音数学推理。
SURE-EVAL 是一个面向音频与语音系统的系统化统一智能体评测框架,通过工具智能体工作流将模型发布转化为隔离、可验证的可调用工具,并将所有计分操作交由版本化确定性程序执行。
一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。
研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。
研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。
研究者提出 Talk2Agent,用于评估语音接口向基于 LLM 的计算机使用智能体传达口语指令的效果,任务源自 WildClawBench 和 OSWorld。
研究提出 Speaker Handles,用软 token 表示把声学说话人身份暴露给冻结的文本 LLM,实现跨会话的说话人相关推理。其轻量投影器参数不足主干 0.1%,在 VoxCeleb1 上达 97.40-98.36% 准确率,在 SpeakerBind 上为 70.40%,接近 71.88% 的 topline。
研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。
一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。
Crab(Contrastive Representation and Multimodal Aligned Bottleneck)是一种双模态跨模态 Transformer 架构,融合 WavLM 语音表征与 RoBERTa 文本表征,并提出多层对比监督(MLCS)策略,在网络多层注入多正样本对比学习信号,推理时不增加参数。
听力健康基金会发布 2026 年度影响力报告,汇总听力恢复项目(HRP)与新兴研究资助(ERG)支持的多项听觉与平衡研究成果。ERG 科学家发现衰老大脑会放大退化听神经输入且与更差脑结构相关,锌信号抑制或可同时恢复听阈并抑制耳鸣相关神经亢进,耳蜗植入者佩戴时间下降者一年后表现明显更差。HRP 团队还报告了生成功能性人类听觉神经元的突破性方案。
成均馆大学 Nae-Eung Lee 团队研发出可拉伸压电纳米复合材料,并据此制成模拟海豚听觉的"人工超声感觉突触",相关成果发表于 Advanced Materials。
德国波鸿鲁尔大学团队发现,海鞘 Halocynthia papillosa 在 50 至 800 赫兹的低频刺激下主要因基质振动增强而收缩,即使水下声压级超过 130 分贝,只要基质振动低于反应阈值便无类似反应。研究在《Marine Biology》发表,指出仅靠声压不足以解释底栖生物的行为反应,后续需结合生理与神经生物学研究确认感知机制。
Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。
Black Lava Studios 在萨克拉门托一处改造的住宅车库内建成沉浸式音频工作室,由 Advanced Systems Group 设计并供应 9.1.6 监听环境。
临床心理学家 Jennifer Gans 指出,耳鸣并非在夜间真正加重,而是夜间外部声音减少、注意力转向内部、疲劳降低调节能力,加上大脑将睡前流程与耳鸣关联形成预期性耳鸣,使声音更易被察觉。她建议打乱睡前流程、识别预期性念头、用“我安全”“这是大脑产生的良性声音”等语言安抚神经系统,并借助轻柔背景声引导注意力,目标不是消除声音而是让神经系统平静。
Bodo Felusch 在 ProSoundWeb 撰文分析线阵列波导机械精度与电子同步的关系:20 kHz 下可接受相位差为四分之一波长(90 度),对应机械公差窗口 4.3 mm,等效电子时间差约 12.5 μs;而 10 米距离上 1°C 温差造成的传播延迟差约 51 μs,是电子误差预算的四倍。
俄勒冈州立大学团队在俄勒冈近海觅食鲸鱼周边四次布放并回收 AZFP-nano 水面漂流浮标,用于研究捕食者—猎物动态,期间遇到座头鲸、蓝鲸和长须鲸集群。该浮标核心是一台紧凑轻量的单频 200 kHz 科学回声测深仪,为 AZFP 的小型化版本,采用标准 D 型电池供电。团队同时布放一台搭载水听器的漂流浮标记录鲸鱼发声行为,原型在野外工作良好。
十月 JASE 在线发表原创研究,发现儿童癌症幸存者静息状态下的自然剪切波速度与心肺适能受损相关。Jens-Uwe Voigt 指出,自然剪切波成像或有助于在静息条件下检出与心肺适能下降相关的心脏功能细微改变。本期还收录二尖瓣反流右室应变、二尖瓣环分离、中度主动脉瓣狭窄干预、心包积液定量及胎儿房间隔瘤与心律失常等主题。
《Journal of Ultrasound in Medicine》EarlyView 刊文指出,既往透视检查可能高估儿童肛门直肠畸形中独立超声造影的准确性。该研究提示,在评估超声造影单独诊断表现时需考虑此前透视检查带来的偏倚。
Decware 创始人 Steve Deckert 本月一个周二下午将静电面板与一对被他称为“610s”的音箱同时接入同一音源、各由独立功放驱动,称效果胜过现场音乐。他未提供测量数据、两对音箱间距或盲听对比,也未说明当天是否有其他人听到相同结果。
独立测试显示,SMSL PL200 MKII、FiiO DM13、Fosi Merak、SMSL PL20 和 Shanling EC Play 等现代 CD 机未能对带预加重标志的早期 CD 施加去加重,导致高频被保留最多约 10 dB。
iFixit 给 AirPods 5 打出 2/10 的可维修性评分,打破苹果耳机连续十年 0/10 的纪录。沿驱动单元接缝施加受控加热即可分离外壳,耳机电池采用模块化触点设计,无需焊接即可更换,但左右耳电池极性相反、触点错位,无法互换。充电盒仍用胶粘与塑料焊接封死,拆解即损毁,且官方不提供备件与维修手册。
Pro Tools 的颜色编码功能可通过 Window > Color Palette 打开,支持对轨道、片段、片段列表、编组和标记分别着色,并可选择 Default 恢复默认或 None 关闭着色。
Acoustical Surfaces 发文讨论博物馆与美术馆的声学优化,指出大型展厅、挑高天花板、抛光混凝土、石材、玻璃和硬木等表面会高效反射声音,使交谈、脚步和展项音频相互叠加。文章建议通过调整展项朝向、扬声器指向、在反射面增加吸声、分隔动静展区及必要时做隔声来改善语音清晰度,并强调声学规划应尽早介入。
美国听力学医师学会(ADA)与助听器厂商 WSA 联合发起全国性公众意识活动 Listen Up,鼓励成人在 50 岁开始将听力筛查纳入常规健康管理。该活动在肯塔基州试点后正扩展至德克萨斯、佛罗里达、科罗拉多和伊利诺伊州,并推动将听力筛查引入初级保健等成人常规体检场景。
制作人 Noah Strik 在尼泊尔为期四周的录音行程最终发展为一部 70 分钟纪录片《Project Nepal》,Audient EVO 8 音频接口是其便携录制设备的一部分。