跳到正文
今天10月2日周五
  1. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    无需微调:从预训练 ASR 提取紧凑编码器实现唤醒词检测

    一项研究探索不经过梯度微调、直接复用预训练 ASR 主干进行唤醒词检测,并尝试用 SliceGPT 的 PCA 结构化剪枝提取紧凑编码器。在 Parakeet-TDT-0.6B-v3 和 Moonshine-base 上的实验显示,编码器通道维度缩减 50% 后唤醒词检测性能仍相对稳定。结果表明可从预训练 ASR 模型直接导出任务相关的紧凑编码器,无需微调。

  2. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    语音反欺骗辅助目标失效:崩溃而非不变性

    一项针对语音反欺骗的研究对比了七种辅助目标与交叉熵在五个语料库、113 次运行中的表现,并直接测量了 24 次 AASIST3 运行的嵌入空间。结果显示,经空间扩散归一化后,没有任何辅助目标能在不同架构、语料库和随机种子下持续优于交叉熵;所有训练空间均被单一决策轴主导,且四次运行崩溃为近似恒定输出。

  3. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    FedCFM:基于条件流匹配的联邦持续域泛化虚假语音检测框架

    研究者提出 FedCFM,一种基于条件流匹配(CFM)的联邦持续域泛化框架,用于在分布式客户端间不共享原始语音数据的情况下协作检测虚假语音。各客户端训练 CFM 生成器建模特定欺骗类型的嵌入分布,通过跨客户端生成器交换合成未见欺骗类型嵌入,并借助生成回放与知识蒸馏持续更新分类器。在相同训练数据集下,FedCFM 的 EER 低于所评估的集中式和联邦域泛化基线。

  4. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    面向无编码器语音大模型:用元数据监督预训练教 LLM 听出谁说了什么

    研究提出元数据监督预训练(MSP),利用说话人身份、情感等语音属性,为无编码器语音大模型(Speech-LLM)构建说话人区分与副语言能力,并引入说话人感知话语组合(SAUC)与随机跨度掩蔽。在多说话人对话的联合 ASR 与说话人日志任务上,相同训练数据下该无编码器模型优于随机初始化的编码器基线;在有限元数据标注下,与使用大规模语料预训练语音编码器的模型相比具有竞争力,并在若干设置中胜出。

  5. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    StateVC:基于共享状态局部变换的免训练语音转换

    StateVC 提出一种免训练单样本语音转换方法,通过对源与参考语句的 WavLM 帧级表征拟合配对高斯混合模型,得到共享状态并在各状态内估计源到参考的均值偏移,由源帧后验概率组合局部更新。在 LibriSpeech 单样本协议下,其词错误率和字错误率分别为 8.01% 和 3.22%,说话人相似度达 0.9512,并在所评估系统中取得最高平均感知说话人相似度,在免训练系统中取得最高平均自然度。

  6. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    利用野外自运动监督的双耳声源定位方法

    研究者提出一种以自运动(egomotion)作为监督信号的双耳声源定位学习方法,通过多视图几何传统方法估计相机运动,训练音频模型预测与视觉相机运动估计一致的声源方向。该方法将这种弱但充足的监督与传统双耳线索结合,并构建了带自运动的真实世界音视频数据集进行评估,结果显示模型能从真实数据中成功学习并在声源定位任务上表现良好。

  7. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Chordonomicon:66.6 万首歌曲和弦进行数据集发布

    Chordonomicon 数据集发布,包含超过 666,000 首歌曲级符号化和弦进行,标注了段落结构(主歌、副歌、桥段等)、流派和发行日期。该数据集通过抓取用户生成和弦进行及相关元数据构建,并提供可复现的下一和弦预测基准套件,在严格精确匹配评估下测试了 RNN、GRU、LSTM 三种序列模型。实验表明,段落结构标注能持续提升预测性能。

  8. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    FlowW2N:基于流匹配的耳语转正常语音转换

    FlowW2N 采用条件流匹配方法,仅用合成时间对齐的耳语-正常语音对训练,并以域不变特征为条件,实现耳语到正常语音的转换。该方法利用在合成与真实耳语间具有强不变性的高层 ASR 嵌入,无需真实配对数据即可泛化到真实耳语。在 CHAINS 和 wTIMIT 数据集上取得 SOTA 可懂度,词错误率相对先前工作降低 26-46%,推理仅需 10 步。

  9. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Watch Your Speech:引入文本条件控制的视频到语音合成框架

    研究者提出视频到语音合成框架 Watch Your Speech(WYS),通过引入文本条件作为显式语言线索缓解视觉歧义。该框架采用基于注意力的嵌入融合模块将文本上下文与视频序列结合,并配合条件流匹配目标生成高保真语音。在 LRS2 和 LRS3 数据集上,WYS 在音视频同步指标 LSE-C/D 上取得新的最优结果,同时保持有竞争力的文本准确率(WER)。

  10. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    多方可话反馈预测:诊断、基准与性能上限

    研究提出基于 AMI 语料库的多方会话反馈预测基准,包含 171 场会议、190 位说话人、18,697 个反馈事件和 682 个掩蔽听者视图。现有二元会话模型零样本应用于会议音频时仅达随机水平(AUROC 0.499),线性探针达 0.704,重训练后升至 0.751。听者条件化对训练中见过的听者有效,但对未见听者无效,且该差距在容量缩减、听者对抗训练等条件下依然存在。

  11. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Q-SPT:面向低帧率语音标记化的可学习查询压缩方法

    Q-SPT 是一种低帧率双流语音标记器,为语义和声学表示分别配备上下文感知的可学习查询压缩器,查询以固定速率独立关注两路流作为键值源。该方法还引入自回归文本损失显式监督语义压缩器以保留语言信息。实验显示,在相同帧率下 Q-SPT 的重建效果优于所评估的编解码器,在下游 SLM 中取得最佳语音识别准确率和文本转语音感知质量,可懂度具竞争力。

  12. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    用直接偏好优化改进 Audio LLM 的英汉混说语音识别

    针对 Audio LLM 在英汉混说语音转写中出现的语言遗漏、翻译替代转写和幻觉三类失败模式,研究者采用直接偏好优化(DPO)对齐模型,构造保留混说内容为正例、模仿失败模式为负例的偏好对。在 10 万对(570 小时)数据上训练三个 Audio LLM 后,模型更倾向于保留语言构成而非翻译,分布内 MER 最多降低 89.6%,分布外降低 20.0%。

  13. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    基于发音运动学的源-滤波器 TTS:通过声道运动实现物理可解释控制

    一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。

  14. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    PADP:面向音频质量模型感知意识探测的感知音频数据扰动方法

    研究者提出感知音频数据扰动(PADP),利用人耳对特定细微信号变化不敏感的特性,在保持感知音质与内容的同时大幅改变波形,并通过受控听音测试评估其可听度与参数选择。用PADP对SOTA感知导向客观音频质量模型和基础模型进行压力测试后发现,模型响应与人类听觉感知存在错位,对部分变换的感知意识有限。

  15. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    ParaCalib:面向抑郁检测的语义校准副语言建模框架

    ParaCalib 通过语句级语义语境校准副语言行为,将声学线索映射为结构化 SC-Para 表示,在 DAIC-WOZ 和 MODMA 上分别取得 71.9% 和 90.5% 的最高平均 Macro-F1。该框架用音频语言模型生成语境化声音描述,再由基于 LLM 的副语言状态提取器进行映射;受控分析显示,固定声学描述下改变语义语境会改变推断出的抑郁相关副语言证据。

  16. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    基于逐层中心引导加权聚合的联邦深度伪造语音检测方法

    研究者提出联邦深度伪造语音检测方法 FedDSD,各客户端用 FedProx 算法训练本地模型并上传参数至中央服务器,无需共享原始音频。该方法进一步提出逐层中心引导加权聚合策略 L-CGWA,依据客户端与参考中心的距离逐层调整其贡献。实验显示其等错误率与集中式协同训练相当,并显著优于单语料库训练模型,在跨域数据集上表现出稳健泛化能力。

  17. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    超越可解码性:声学因素是否驱动基于语音的阿尔茨海默病评估预测?

    研究基于 ADReSSo 数据集和三种大型自监督学习骨干模型,对仅参与者语音、非语音和完整录音施加受控噪声与混响干预,结合逐层线性解码、输入与表征空间干预及几何对齐分析,区分声学可解码性与对 AD 预测的实际影响。

10月1日周四
  1. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SelfTTS:通过显式嵌入解耦与自增强自优化实现跨说话人风格迁移

    SelfTTS 是一种无需外部预训练说话人或情感编码器的跨说话人风格迁移 TTS 模型,通过梯度反转层(GRL)结合余弦相似度损失显式解耦说话人与情感信息,并引入多正样本对比学习(MPCL)聚类说话人和情感嵌入。该模型还采用基于自增强的自优化策略,利用自身语音转换能力提升合成语音自然度。实验显示其在情感自然度(eMOS)及目标音色与情感稳定性上优于现有基线。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    无需训练的神经与嵌入说话人日志亲和融合方法

    研究者提出无需训练的亲和融合方法 TFAF,将神经说话人日志推断的说话人结构融入基于嵌入的日志系统,无需额外训练、共享嵌入空间或说话人标签对齐。在 AMI 和 CALLHOME 上,DER 较两个组成系统均有一致提升;在 AMI 上融合还改善了说话人归属转写。消融实验显示神经说话人划分贡献了大部分增益,保留连续嵌入亲和比硬划分融合额外获益。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于音频语言模型的精神科临床语音录音角色引导说话人删除验证

    研究针对精神科双人临床对话录音中指定说话人删除的验证问题,构建了确认临床医生语音和患者语音分别被移除的两条对称流水线,先用目标角色音频进行消隐处理,再用音频语言模型和大语言模型扫描残留输出以识别遗漏删除。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    MeanVoiceFlow2:联合优化平均流与内容编码器实现快速单步零样本语音转换

    MeanVoiceFlow2 通过联合优化基于流的转换模块与高效内容编码器,实现单步零样本语音转换。该模型采用 MeanVoiceFlow 进行转换蒸馏并结合真实数据重建训练,同时引入扩散-GAN 训练、样本混合与教师引导条件增强。实验显示其感知质量优于 MeanVoiceFlow,推理速度约提升 9 倍,说话人相似度相当。

  5. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SCIC:面向说话人自适应表现力 TTS 的范围与码本感知指令条件方法

    研究者提出 SCIC(范围与码本感知指令条件)方法,用于说话人自适应表现力 TTS,通过时间指令路由器实现帧级标签激活,并对残差码本进行标签特定加权。该方法基于 Qwen3-TTS RVQ 码本分析,发现能量集中于早期残差码本、音高在更深前缀中累积,从而改善说话人相对音高与能量控制,并结合多奖励 GDPO 后训练优化控制精度与语音质量。

  6. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向 TTS 条件流匹配的频谱演化协调方法

    针对条件流匹配(CFM)TTS 推理中频谱演化不协调的问题,研究者提出一种免训练的频带选择性增强策略,利用离散小波变换在 ODE 积分过程中动态调制梅尔频谱子带,抑制低频过快增长并提升滞后的高频细节。该方法在 Matcha-TTS、F5-TTS、IndicF5 等架构上验证,将函数评估次数(NFE)从 32 降至 26,FAD 最多改善 61%,且不损失主观意见分、说话人相似度与语音可懂度。

  7. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    VOSSA:面向流式语音架构的声纹优化框架

    VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。

  8. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    从语音到可编辑概念:用概念瓶颈模型探究语音情感识别

    一项研究将概念瓶颈模型引入语音情感识别,考察预测如何依赖转录文本、声学描述和说话人属性。实验用三个 LLM 在 CREMA-D、IEMOCAP 和 MELD 上测试,零样本下模型强烈偏向转录文本,使 CREMA-D 的 Macro-F1 从 27.8 降至 5.8;微调后该偏差消除,转录文本将 Macro-F1 从 41.8 提升至 45.1。