无需微调:从预训练 ASR 提取紧凑编码器实现唤醒词检测
一项研究探索不经过梯度微调、直接复用预训练 ASR 主干进行唤醒词检测,并尝试用 SliceGPT 的 PCA 结构化剪枝提取紧凑编码器。在 Parakeet-TDT-0.6B-v3 和 Moonshine-base 上的实验显示,编码器通道维度缩减 50% 后唤醒词检测性能仍相对稳定。结果表明可从预训练 ASR 模型直接导出任务相关的紧凑编码器,无需微调。
一项研究探索不经过梯度微调、直接复用预训练 ASR 主干进行唤醒词检测,并尝试用 SliceGPT 的 PCA 结构化剪枝提取紧凑编码器。在 Parakeet-TDT-0.6B-v3 和 Moonshine-base 上的实验显示,编码器通道维度缩减 50% 后唤醒词检测性能仍相对稳定。结果表明可从预训练 ASR 模型直接导出任务相关的紧凑编码器,无需微调。
一项基于 Grid5000 共享计算平台活动日志的研究估算,深度学习音频项目开发阶段的能耗是单独训练最佳模型所需能耗的 3 至 256 倍。该研究以 LORIA 实验室 Multispeech 团队的四个音频项目为案例,评估了其整体能耗并与训练已报告模型的能耗进行对比。作者据此呼吁对深度学习音频项目全生命周期的能耗进行更系统的报告。
研究者提出无参考框架 MAV-C,用于音视频复杂度的联合客观估计,通过参数化融合将熵基音频特征(时域、频谱、空间)与视觉特征(Sobel 梯度幅值、色彩独特性、光流)结合,输出连续联合复杂度分数 CAV(t)∈[0,1]。
一项针对语音反欺骗的研究对比了七种辅助目标与交叉熵在五个语料库、113 次运行中的表现,并直接测量了 24 次 AASIST3 运行的嵌入空间。结果显示,经空间扩散归一化后,没有任何辅助目标能在不同架构、语料库和随机种子下持续优于交叉熵;所有训练空间均被单一决策轴主导,且四次运行崩溃为近似恒定输出。
一项研究用182段合成日语护理交接语音,将1.47B音频模型通过全量微调和rank-16 LoRA适配为六字段结构化笔记生成。在39段合成测试集上,未适配模型事实召回得分0.0500,全量微调0.8664,LoRA 0.8461,LoRA可训练参数12.4M约占主干0.85%。
研究者提出 LateIntent-Bench,一个针对延迟意图揭示的配对基准,用共享歧义前缀加受控停顿延迟良性或有害分支的可区分时刻,并定义 Premature Response Rate(PRR)衡量响应起始是否早于意图揭示。
针对早期20世纪管弦乐历史录音缺乏退化前真值、修复任务难以监督的问题,研究者构建了端到端管弦乐历史音乐修复基准,通过更忠实地模拟历史录音退化链,将管弦乐修复转化为可监督问题。在合成退化对上训练的潜流匹配模型在侵入式、非侵入式与主观评测中均优于现有修复基线。研究还整理并发布了一个9.3小时、免许可、非配对的古典音乐测试集,以及代码和音频演示。
研究提出一种可解释的目标感知调制与波形恢复流程,先识别被调制目标,再恢复各目标对应的 LFO 波形并估计振荡器波形以匹配源音色。训练采用含噪声振荡器和更多调制选项的可微合成器,并探索感知损失与对抗训练。客观与主观评测显示,正确预测调制目标是关键,其 Gammatone 损失与 CQT 判别器在感知质量上显著优于传统 MSS 损失。
研究者提出 FedCFM,一种基于条件流匹配(CFM)的联邦持续域泛化框架,用于在分布式客户端间不共享原始语音数据的情况下协作检测虚假语音。各客户端训练 CFM 生成器建模特定欺骗类型的嵌入分布,通过跨客户端生成器交换合成未见欺骗类型嵌入,并借助生成回放与知识蒸馏持续更新分类器。在相同训练数据集下,FedCFM 的 EER 低于所评估的集中式和联邦域泛化基线。
MuseCritic 是一种半标量奖励模型,先生成覆盖五个美学维度的自然语言评论,再以此为中间表示预测连续奖励分数。
ProxyMOS 将多个公开 MOS 预测器通过多教师蒸馏与自适应路由整合为单一模型,无需新的人工标注。系统对八个预测器进行基准测试,选取信息量最高的五个进行子集搜索,最佳四模型集成标注 80.7 万条无标签语音,训练 wav2vec 2.0 学生模型。
AudioJev 将波形、问题与候选选项直接映射为候选分布,用单一共享全参数模型完成推理,无需校准头或顺序集成。其随机错位 SKL 训练为每个问题配对重排视图并监督两个答案,在三个训练种子上于完整 MMAU/MMAR 达到 68.88%/55.33% 平均准确率,随机顺序 SKL 较单视图消融分别降低 43.8%/60.5%。
研究提出元数据监督预训练(MSP),利用说话人身份、情感等语音属性,为无编码器语音大模型(Speech-LLM)构建说话人区分与副语言能力,并引入说话人感知话语组合(SAUC)与随机跨度掩蔽。在多说话人对话的联合 ASR 与说话人日志任务上,相同训练数据下该无编码器模型优于随机初始化的编码器基线;在有限元数据标注下,与使用大规模语料预训练语音编码器的模型相比具有竞争力,并在若干设置中胜出。
研究者提出 AURAL,在潜在空间对多条推理路径建模并联合预测未来状态分块,以减少顺序前向计算和推理延迟,并构建了含 68.3 万条双语语音话语(约 1000 小时)的 AuralReason-683K 数据集。
StateVC 提出一种免训练单样本语音转换方法,通过对源与参考语句的 WavLM 帧级表征拟合配对高斯混合模型,得到共享状态并在各状态内估计源到参考的均值偏移,由源帧后验概率组合局部更新。在 LibriSpeech 单样本协议下,其词错误率和字错误率分别为 8.01% 和 3.22%,说话人相似度达 0.9512,并在所评估系统中取得最高平均感知说话人相似度,在免训练系统中取得最高平均自然度。
研究提出快速保护方法 STM,在心理声学掩蔽约束下于频域生成感知受限扰动,对抗训练中严格强制可感知性边界,无需迭代质量平衡。在多个先进 VC 与 TTS 模型上,STM 保护性能相当或更优,感知质量明显更好,较现有白盒基线最高提速 45.3 倍。
研究者提出一种以自运动(egomotion)作为监督信号的双耳声源定位学习方法,通过多视图几何传统方法估计相机运动,训练音频模型预测与视觉相机运动估计一致的声源方向。该方法将这种弱但充足的监督与传统双耳线索结合,并构建了带自运动的真实世界音视频数据集进行评估,结果显示模型能从真实数据中成功学习并在声源定位任务上表现良好。
AVSD-Scenes 是一个面向城市环境的配对音视频场景描述数据集,包含 12,291 条描述,基于 TAU Urban Audio-Visual Scenes 数据集构建。
研究者提出 RIME(Rule-based Instructions for Music Editing)框架,可从任意基线音乐数据集生成贴近真实后期制作流程的成对编辑指令数据,并借助结合分轨、混音与常见录音棚效果器的 POEMS 工具包,生成 15000 对编辑指令与真值音频。用该数据评估现有多模态 LLM 智能体时暴露出持续存在的局限,而基于合成数据的监督微调可提升后期制作智能体的表现。
研究对 DAC、EnCodec、FocalCodec、LanguageCodec、SemantiCodec、UniCodec、WavTokenizer 七款开源神经音频编解码器。
CARD 是一种无编码器音频描述模型,推理时移除音频编码器,由 13.2M 投影器向冻结 LLM 馈入合并 LoRA 适配器,训练用教师模型随后丢弃。它将预训练音频教师 CLAP-HTSAT 的表征跨组件路由:感知阶段送入投影器,语义阶段送入 LLM。
Chordonomicon 数据集发布,包含超过 666,000 首歌曲级符号化和弦进行,标注了段落结构(主歌、副歌、桥段等)、流派和发行日期。该数据集通过抓取用户生成和弦进行及相关元数据构建,并提供可复现的下一和弦预测基准套件,在严格精确匹配评估下测试了 RNN、GRU、LSTM 三种序列模型。实验表明,段落结构标注能持续提升预测性能。
FlowW2N 采用条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,并以域不变特征为条件,实现耳语到正常语音的转换。该方法利用在合成与真实耳语间具有强不变性的高层 ASR 嵌入,无需真实配对数据即可泛化到真实耳语。在 CHAINS 和 wTIMIT 数据集上取得 SOTA 可懂度,词错误率相对先前工作降低 26-46%,推理仅需 10 步。
TTSYoruba 是一款面向约鲁巴语的规则式拼接双音子语音合成器,已部署于 YorubaName.com 约鲁巴人名开放词典。系统以带声调标记的约鲁巴语文本为输入,基于 651 个双音子单元(覆盖每个辅音-元音组合的五种声调变体)和手工声调规则生成语音,并处理口腔 /n/、鼻化元音与成音节鼻音的三向消歧。
研究者提出视频到语音合成框架 Watch Your Speech(WYS),通过引入文本条件作为显式语言线索缓解视觉歧义。该框架采用基于注意力的嵌入融合模块将文本上下文与视频序列结合,并配合条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音视频同步指标 LSE-C/D 上取得新的最优结果,同时保持有竞争力的文本准确率(WER)。
研究将话语级语码转换语言识别(CS-LID)建模为多标签语言集合预测,提出直接输出话语所含语言的集合生成器,并与原子对和基于分数的分类基线对比。Oracle Top-k 是最强基线,但阈值法因无法用单一阈值区分语码转换与单语语音而失效。
研究将结构化音系表征模型 PhonoQ-2.0 适配到儿童语音,使用 CHILDES-Aligned 数据并比较 Adult、Adult+Child、Child-only 三种对齐监督条件与两种初始化策略。
研究提出基于 AMI 语料库的多方会话反馈预测基准,包含 171 场会议、190 位说话人、18,697 个反馈事件和 682 个掩蔽听者视图。现有二元会话模型零样本应用于会议音频时仅达随机水平(AUROC 0.499),线性探针达 0.704,重训练后升至 0.751。听者条件化对训练中见过的听者有效,但对未见听者无效,且该差距在容量缩减、听者对抗训练等条件下依然存在。
Q-SPT 是一种低帧率双流语音标记器,为语义和声学表示分别配备上下文感知的可学习查询压缩器,查询以固定速率独立关注两路流作为键值源。该方法还引入自回归文本损失显式监督语义压缩器以保留语言信息。实验显示,在相同帧率下 Q-SPT 的重建效果优于所评估的编解码器,在下游 SLM 中取得最佳语音识别准确率和文本转语音感知质量,可懂度具竞争力。
针对 Audio LLM 在英汉混说语音转写中出现的语言遗漏、翻译替代转写和幻觉三类失败模式,研究者采用直接偏好优化(DPO)对齐模型,构造保留混说内容为正例、模仿失败模式为负例的偏好对。在 10 万对(570 小时)数据上训练三个 Audio LLM 后,模型更倾向于保留语言构成而非翻译,分布内 MER 最多降低 89.6%,分布外降低 20.0%。
一项研究在仅200个训练样本、冻结wav2vec 2.0嵌入经主成分分析降至四维的条件下,比较了量子支持向量机(QSVM)、经典SVM和多层感知机(MLP)的跨语料音频深伪检测表现。
一项新研究提出面向多智能体听觉场景分析(ASA)的优化机制,改用一组覆盖多个位置的质量估计替代逐窗单点质量估计,使搜索空间更清晰、优化更简单。该ASA优化时间显著缩短、定位更准确,在真实声学场景中纠正更高定位误差时更稳定,且复杂度低于此前方案。代价是质量估计智能体的响应时间增加,但完整ASA仍可实时运行。
研究提出以音高移调为归纳偏置、通过多视角稀疏自编码器(SAE)对齐来诱导有序轨道,从而发现音乐基础模型内部的结构化概念。该方法生成移调输入对并对齐其SAE表示,在两个先进音乐基础模型上恢复了对应和弦、调性与旋律模式的轨道结构,且仅需少量锚点示例即可解释整个概念族。
Soundwich 是一个免训练框架,可将冻结的联合音视频流匹配模型改造为生成与同一视频同步的多条独立可编辑音频轨。它通过共享场景表示在各音轨间传递全局音视频上下文,并将每条音频轨与其对应视觉源进行跨模态交互,从而在保持音源分离的同时提升一致性。生成的音轨可独立调整时序、静音、替换或重新混音,实验与人工评估显示其在时间控制、音源分离和自然度方面均有改善。
循环音频频谱图 Transformer(LAST)先处理全部 token,再复用同一组模块仅对类别 token 在固定音频特征上做多轮精修。在 AudioSet 上,十轮 LAST 取得 0.345 平均精度,相对十二层顺序 Transformer 提升 2.1%,参数量减少 49.4%,乘加运算减少 42%,实测吞吐量提高 9.8%。
研究者提出 RVCBench,用于评估语音克隆在真实部署偏移下的鲁棒性,覆盖 18 项鲁棒性评测、204 位说话人和 14,370 条语句级评测项。该基准通过受控文本-音频配对、多语言与长音频场景、表现力提示、后处理条件及被动或主动音频扰动实例化部署偏移。
AnchorPrompt 是一种保持模型冻结的适配方法,在解码器输入端、音频与问题嵌入之间插入单块提示向量,并通过在多种音频与文本扰动上的自蒸馏训练这些向量。该方法以干净录音的预测作为可回答输入的目标,在音频证据不足时指定拒答目标,推理时无需预先检测扰动,可零样本迁移到未见失真。
RMS-AQA 是一个面向真实家居环境的空间音频问答基准,采用两阶段问答格式,先定位可听声事件再进行时空推理。数据集结合真实一阶 Ambisonics(FOA)录音与基于实测房间脉冲响应(RIR)生成的高保真合成数据,并提供将 FOA 数据注入冻结音频语言骨干的轻量空间插件。实验显示主要挑战来自同时声源、远距离以及 RIR 合成与真实录音之间的仿真到真实域差。
论文将软约束空间选择性主动降噪(SSANC)从全频段标量权衡参数推广为频域加权期望语音保留误差,同时保持低延迟时域主动控制。研究基于实测声学脉冲响应,在多说话人场景下比较了基于 SII、MIRS、LTASS 和信号相关 oracle 的频域加权与标量加权。
PLACE 通过条件嵌入的位置潜在适配方法,扩展预训练任意到音频模型 AudioX,实现由文本、视频及可选音频提示组合生成双耳音频。该方法用 Perception Encoder Core 特征增强视频条件,对齐文本与视频表示以提取空间线索,并对生成潜在施加条件相关低秩变换,以解码音频的双耳声级差与时间差为目标监督适配器。