无需微调:从预训练 ASR 提取紧凑编码器实现唤醒词检测
一项研究探索不经过梯度微调、直接复用预训练 ASR 主干进行唤醒词检测,并尝试用 SliceGPT 的 PCA 结构化剪枝提取紧凑编码器。在 Parakeet-TDT-0.6B-v3 和 Moonshine-base 上的实验显示,编码器通道维度缩减 50% 后唤醒词检测性能仍相对稳定。结果表明可从预训练 ASR 模型直接导出任务相关的紧凑编码器,无需微调。
一项研究探索不经过梯度微调、直接复用预训练 ASR 主干进行唤醒词检测,并尝试用 SliceGPT 的 PCA 结构化剪枝提取紧凑编码器。在 Parakeet-TDT-0.6B-v3 和 Moonshine-base 上的实验显示,编码器通道维度缩减 50% 后唤醒词检测性能仍相对稳定。结果表明可从预训练 ASR 模型直接导出任务相关的紧凑编码器,无需微调。
一项针对语音反欺骗的研究对比了七种辅助目标与交叉熵在五个语料库、113 次运行中的表现,并直接测量了 24 次 AASIST3 运行的嵌入空间。结果显示,经空间扩散归一化后,没有任何辅助目标能在不同架构、语料库和随机种子下持续优于交叉熵;所有训练空间均被单一决策轴主导,且四次运行崩溃为近似恒定输出。
一项研究用182段合成日语护理交接语音,将1.47B音频模型通过全量微调和rank-16 LoRA适配为六字段结构化笔记生成。在39段合成测试集上,未适配模型事实召回得分0.0500,全量微调0.8664,LoRA 0.8461,LoRA可训练参数12.4M约占主干0.85%。
研究者提出 LateIntent-Bench,一个针对延迟意图揭示的配对基准,用共享歧义前缀加受控停顿延迟良性或有害分支的可区分时刻,并定义 Premature Response Rate(PRR)衡量响应起始是否早于意图揭示。
研究者提出 FedCFM,一种基于条件流匹配(CFM)的联邦持续域泛化框架,用于在分布式客户端间不共享原始语音数据的情况下协作检测虚假语音。各客户端训练 CFM 生成器建模特定欺骗类型的嵌入分布,通过跨客户端生成器交换合成未见欺骗类型嵌入,并借助生成回放与知识蒸馏持续更新分类器。在相同训练数据集下,FedCFM 的 EER 低于所评估的集中式和联邦域泛化基线。
ProxyMOS 将多个公开 MOS 预测器通过多教师蒸馏与自适应路由整合为单一模型,无需新的人工标注。系统对八个预测器进行基准测试,选取信息量最高的五个进行子集搜索,最佳四模型集成标注 80.7 万条无标签语音,训练 wav2vec 2.0 学生模型。
研究提出元数据监督预训练(MSP),利用说话人身份、情感等语音属性,为无编码器语音大模型(Speech-LLM)构建说话人区分与副语言能力,并引入说话人感知话语组合(SAUC)与随机跨度掩蔽。在多说话人对话的联合 ASR 与说话人日志任务上,相同训练数据下该无编码器模型优于随机初始化的编码器基线;在有限元数据标注下,与使用大规模语料预训练语音编码器的模型相比具有竞争力,并在若干设置中胜出。
研究者提出 AURAL,在潜在空间对多条推理路径建模并联合预测未来状态分块,以减少顺序前向计算和推理延迟,并构建了含 68.3 万条双语语音话语(约 1000 小时)的 AuralReason-683K 数据集。
StateVC 提出一种免训练单样本语音转换方法,通过对源与参考语句的 WavLM 帧级表征拟合配对高斯混合模型,得到共享状态并在各状态内估计源到参考的均值偏移,由源帧后验概率组合局部更新。在 LibriSpeech 单样本协议下,其词错误率和字错误率分别为 8.01% 和 3.22%,说话人相似度达 0.9512,并在所评估系统中取得最高平均感知说话人相似度,在免训练系统中取得最高平均自然度。
研究提出快速保护方法 STM,在心理声学掩蔽约束下于频域生成感知受限扰动,对抗训练中严格强制可感知性边界,无需迭代质量平衡。在多个先进 VC 与 TTS 模型上,STM 保护性能相当或更优,感知质量明显更好,较现有白盒基线最高提速 45.3 倍。
研究者提出一种以自运动(egomotion)作为监督信号的双耳声源定位学习方法,通过多视图几何传统方法估计相机运动,训练音频模型预测与视觉相机运动估计一致的声源方向。该方法将这种弱但充足的监督与传统双耳线索结合,并构建了带自运动的真实世界音视频数据集进行评估,结果显示模型能从真实数据中成功学习并在声源定位任务上表现良好。
研究对 DAC、EnCodec、FocalCodec、LanguageCodec、SemantiCodec、UniCodec、WavTokenizer 七款开源神经音频编解码器。
Chordonomicon 数据集发布,包含超过 666,000 首歌曲级符号化和弦进行,标注了段落结构(主歌、副歌、桥段等)、流派和发行日期。该数据集通过抓取用户生成和弦进行及相关元数据构建,并提供可复现的下一和弦预测基准套件,在严格精确匹配评估下测试了 RNN、GRU、LSTM 三种序列模型。实验表明,段落结构标注能持续提升预测性能。
FlowW2N 采用条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,并以域不变特征为条件,实现耳语到正常语音的转换。该方法利用在合成与真实耳语间具有强不变性的高层 ASR 嵌入,无需真实配对数据即可泛化到真实耳语。在 CHAINS 和 wTIMIT 数据集上取得 SOTA 可懂度,词错误率相对先前工作降低 26-46%,推理仅需 10 步。
TTSYoruba 是一款面向约鲁巴语的规则式拼接双音子语音合成器,已部署于 YorubaName.com 约鲁巴人名开放词典。系统以带声调标记的约鲁巴语文本为输入,基于 651 个双音子单元(覆盖每个辅音-元音组合的五种声调变体)和手工声调规则生成语音,并处理口腔 /n/、鼻化元音与成音节鼻音的三向消歧。
研究者提出视频到语音合成框架 Watch Your Speech(WYS),通过引入文本条件作为显式语言线索缓解视觉歧义。该框架采用基于注意力的嵌入融合模块将文本上下文与视频序列结合,并配合条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音视频同步指标 LSE-C/D 上取得新的最优结果,同时保持有竞争力的文本准确率(WER)。
研究将话语级语码转换语言识别(CS-LID)建模为多标签语言集合预测,提出直接输出话语所含语言的集合生成器,并与原子对和基于分数的分类基线对比。Oracle Top-k 是最强基线,但阈值法因无法用单一阈值区分语码转换与单语语音而失效。
研究将结构化音系表征模型 PhonoQ-2.0 适配到儿童语音,使用 CHILDES-Aligned 数据并比较 Adult、Adult+Child、Child-only 三种对齐监督条件与两种初始化策略。
研究提出基于 AMI 语料库的多方会话反馈预测基准,包含 171 场会议、190 位说话人、18,697 个反馈事件和 682 个掩蔽听者视图。现有二元会话模型零样本应用于会议音频时仅达随机水平(AUROC 0.499),线性探针达 0.704,重训练后升至 0.751。听者条件化对训练中见过的听者有效,但对未见听者无效,且该差距在容量缩减、听者对抗训练等条件下依然存在。
Q-SPT 是一种低帧率双流语音标记器,为语义和声学表示分别配备上下文感知的可学习查询压缩器,查询以固定速率独立关注两路流作为键值源。该方法还引入自回归文本损失显式监督语义压缩器以保留语言信息。实验显示,在相同帧率下 Q-SPT 的重建效果优于所评估的编解码器,在下游 SLM 中取得最佳语音识别准确率和文本转语音感知质量,可懂度具竞争力。
针对 Audio LLM 在英汉混说语音转写中出现的语言遗漏、翻译替代转写和幻觉三类失败模式,研究者采用直接偏好优化(DPO)对齐模型,构造保留混说内容为正例、模仿失败模式为负例的偏好对。在 10 万对(570 小时)数据上训练三个 Audio LLM 后,模型更倾向于保留语言构成而非翻译,分布内 MER 最多降低 89.6%,分布外降低 20.0%。
一项新研究提出面向多智能体听觉场景分析(ASA)的优化机制,改用一组覆盖多个位置的质量估计替代逐窗单点质量估计,使搜索空间更清晰、优化更简单。该ASA优化时间显著缩短、定位更准确,在真实声学场景中纠正更高定位误差时更稳定,且复杂度低于此前方案。代价是质量估计智能体的响应时间增加,但完整ASA仍可实时运行。
研究者提出 RVCBench,用于评估语音克隆在真实部署偏移下的鲁棒性,覆盖 18 项鲁棒性评测、204 位说话人和 14,370 条语句级评测项。该基准通过受控文本-音频配对、多语言与长音频场景、表现力提示、后处理条件及被动或主动音频扰动实例化部署偏移。
一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。
研究者提出感知音频数据扰动(PADP),利用人耳对特定细微信号变化不敏感的特性,在保持感知音质与内容的同时大幅改变波形,并通过受控听音测试评估其可听度与参数选择。用PADP对SOTA感知导向客观音频质量模型和基础模型进行压力测试后发现,模型响应与人类听觉感知存在错位,对部分变换的感知意识有限。
ParaCalib 通过语句级语义语境校准副语言行为,将声学线索映射为结构化 SC-Para 表示,在 DAIC-WOZ 和 MODMA 上分别取得 71.9% 和 90.5% 的最高平均 Macro-F1。该框架用音频语言模型生成语境化声音描述,再由基于 LLM 的副语言状态提取器进行映射;受控分析显示,固定声学描述下改变语义语境会改变推断出的抑郁相关副语言证据。
研究者提出联邦深度伪造语音检测方法 FedDSD,各客户端用 FedProx 算法训练本地模型并上传参数至中央服务器,无需共享原始音频。该方法进一步提出逐层中心引导加权聚合策略 L-CGWA,依据客户端与参考中心的距离逐层调整其贡献。实验显示其等错误率与集中式协同训练相当,并显著优于单语料库训练模型,在跨域数据集上表现出稳健泛化能力。
研究者发布 Balalaika-Longform 俄语开源语料库,含 189 小时连续语音单元,单元时长 30 秒至 15 分钟,并配有匹配的短窗口用于同一录音的微调对比。
DEFINE 是一个端到端零样本 TTS 框架,通过将说话人身份与目标口音分别条件于不同音频示例来实现二者解耦,推理时用单一引导权重连续控制口音强度而无需重训练。
研究基于 ADReSSo 数据集和三种大型自监督学习骨干模型,对仅参与者语音、非语音和完整录音施加受控噪声与混响干预,结合逐层线性解码、输入与表征空间干预及几何对齐分析,区分声学可解码性与对 AD 预测的实际影响。
针对口音转换中平行录音稀缺的问题,研究者提出多样本合成监督框架,通过联合评估候选波形的口音实现度与说话人保持度来构建转换目标,并选取候选对应的离散语音编码作为口音条件自回归适配的目标。
Starkey 推出 Omega AI+ 助听器,原文标题显示其采用四路 DNN 与 DNN 双压缩。材料无正文,具体规格与上市信息未披露。
SelfTTS 是一种无需外部预训练说话人或情感编码器的跨说话人风格迁移 TTS 模型,通过梯度反转层(GRL)结合余弦相似度损失显式解耦说话人与情感信息,并引入多正样本对比学习(MPCL)聚类说话人和情感嵌入。该模型还采用基于自增强的自优化策略,利用自身语音转换能力提升合成语音自然度。实验显示其在情感自然度(eMOS)及目标音色与情感稳定性上优于现有基线。
研究者提出无需训练的亲和融合方法 TFAF,将神经说话人日志推断的说话人结构融入基于嵌入的日志系统,无需额外训练、共享嵌入空间或说话人标签对齐。在 AMI 和 CALLHOME 上,DER 较两个组成系统均有一致提升;在 AMI 上融合还改善了说话人归属转写。消融实验显示神经说话人划分贡献了大部分增益,保留连续嵌入亲和比硬划分融合额外获益。
NVV-Locator 通过非自回归槽填充架构联合预测词汇时间戳、非言语发声类别与事件边界,在 NVV-TimeBench 上取得 71.0% Micro F1、70.2% Macro F1、80.4% Macro mIoU 和 59.6 ms Macro mMAE,优于所评估的大型音频模型。
研究针对精神科双人临床对话录音中指定说话人删除的验证问题,构建了确认临床医生语音和患者语音分别被移除的两条对称流水线,先用目标角色音频进行消隐处理,再用音频语言模型和大语言模型扫描残留输出以识别遗漏删除。
研究将ProtoPNet适配到基于频谱图的语音表示,在MLAAD数据集上开展闭集、跨语言和开集条件下的合成语音溯源实验。结果显示,原型推理在归因性能上与基线相当或更优,同时能提供基于样本的解释,表明可解释性与性能可在合成语音溯源中兼得。
MeanVoiceFlow2 通过联合优化基于流的转换模块与高效内容编码器,实现单步零样本语音转换。该模型采用 MeanVoiceFlow 进行转换蒸馏并结合真实数据重建训练,同时引入扩散-GAN 训练、样本混合与教师引导条件增强。实验显示其感知质量优于 MeanVoiceFlow,推理速度约提升 9 倍,说话人相似度相当。
研究者提出 SCIC(范围与码本感知指令条件)方法,用于说话人自适应表现力 TTS,通过时间指令路由器实现帧级标签激活,并对残差码本进行标签特定加权。该方法基于 Qwen3-TTS RVQ 码本分析,发现能量集中于早期残差码本、音高在更深前缀中累积,从而改善说话人相对音高与能量控制,并结合多奖励 GDPO 后训练优化控制精度与语音质量。
针对条件流匹配(CFM)TTS 推理中频谱演化不协调的问题,研究者提出一种免训练的频带选择性增强策略,利用离散小波变换在 ODE 积分过程中动态调制梅尔频谱子带,抑制低频过快增长并提升滞后的高频细节。该方法在 Matcha-TTS、F5-TTS、IndicF5 等架构上验证,将函数评估次数(NFE)从 32 降至 26,FAD 最多改善 61%,且不损失主观意见分、说话人相似度与语音可懂度。