跳到正文
今天10月2日周五
  1. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    基于发音运动学的源-滤波器 TTS:通过声道运动实现物理可解释控制

    一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。

  2. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    PADP:面向音频质量模型感知意识探测的感知音频数据扰动方法

    研究者提出感知音频数据扰动(PADP),利用人耳对特定细微信号变化不敏感的特性,在保持感知音质与内容的同时大幅改变波形,并通过受控听音测试评估其可听度与参数选择。用PADP对SOTA感知导向客观音频质量模型和基础模型进行压力测试后发现,模型响应与人类听觉感知存在错位,对部分变换的感知意识有限。

  3. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    ParaCalib:面向抑郁检测的语义校准副语言建模框架

    ParaCalib 通过语句级语义语境校准副语言行为,将声学线索映射为结构化 SC-Para 表示,在 DAIC-WOZ 和 MODMA 上分别取得 71.9% 和 90.5% 的最高平均 Macro-F1。该框架用音频语言模型生成语境化声音描述,再由基于 LLM 的副语言状态提取器进行映射;受控分析显示,固定声学描述下改变语义语境会改变推断出的抑郁相关副语言证据。

  4. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    基于逐层中心引导加权聚合的联邦深度伪造语音检测方法

    研究者提出联邦深度伪造语音检测方法 FedDSD,各客户端用 FedProx 算法训练本地模型并上传参数至中央服务器,无需共享原始音频。该方法进一步提出逐层中心引导加权聚合策略 L-CGWA,依据客户端与参考中心的距离逐层调整其贡献。实验显示其等错误率与集中式协同训练相当,并显著优于单语料库训练模型,在跨域数据集上表现出稳健泛化能力。

  5. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Dyna2Music:面向舞蹈到音乐生成的结构化运动条件与音乐动态监督

    研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。

  6. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    结构化噪声掩码建模用于视频、音频及更多模态

    研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。

  7. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    超越可解码性:声学因素是否驱动基于语音的阿尔茨海默病评估预测?

    研究基于 ADReSSo 数据集和三种大型自监督学习骨干模型,对仅参与者语音、非语音和完整录音施加受控噪声与混响干预,结合逐层线性解码、输入与表征空间干预及几何对齐分析,区分声学可解码性与对 AD 预测的实际影响。

10月1日周四
  1. Earth Species Project
    发布于 2026-10-01 23:31

    新研究:机器学习揭示大象合唱声编码行为信息

    一项发表于 Scientific Reports 的研究用机器学习分析大象重叠合唱声,无需分离每头个体的叫声即可预测其行为情境。研究分析1986至2022年间成年雌象的903次隆隆声,发现约60%的隆隆声发生在两只及以上个体的合唱中,并在问候、联络和节奏性隆隆声三类情境中观察到发声趋同现象。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SelfTTS:通过显式嵌入解耦与自增强自优化实现跨说话人风格迁移

    SelfTTS 是一种无需外部预训练说话人或情感编码器的跨说话人风格迁移 TTS 模型,通过梯度反转层(GRL)结合余弦相似度损失显式解耦说话人与情感信息,并引入多正样本对比学习(MPCL)聚类说话人和情感嵌入。该模型还采用基于自增强的自优化策略,利用自身语音转换能力提升合成语音自然度。实验显示其在情感自然度(eMOS)及目标音色与情感稳定性上优于现有基线。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    无需训练的神经与嵌入说话人日志亲和融合方法

    研究者提出无需训练的亲和融合方法 TFAF,将神经说话人日志推断的说话人结构融入基于嵌入的日志系统,无需额外训练、共享嵌入空间或说话人标签对齐。在 AMI 和 CALLHOME 上,DER 较两个组成系统均有一致提升;在 AMI 上融合还改善了说话人归属转写。消融实验显示神经说话人划分贡献了大部分增益,保留连续嵌入亲和比硬划分融合额外获益。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于音频语言模型的精神科临床语音录音角色引导说话人删除验证

    研究针对精神科双人临床对话录音中指定说话人删除的验证问题,构建了确认临床医生语音和患者语音分别被移除的两条对称流水线,先用目标角色音频进行消隐处理,再用音频语言模型和大语言模型扫描残留输出以识别遗漏删除。

  5. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    PG-SELD:物理引导的声事件定位与检测

    研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。

  6. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    MeanVoiceFlow2:联合优化平均流与内容编码器实现快速单步零样本语音转换

    MeanVoiceFlow2 通过联合优化基于流的转换模块与高效内容编码器,实现单步零样本语音转换。该模型采用 MeanVoiceFlow 进行转换蒸馏并结合真实数据重建训练,同时引入扩散-GAN 训练、样本混合与教师引导条件增强。实验显示其感知质量优于 MeanVoiceFlow,推理速度约提升 9 倍,说话人相似度相当。

  7. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SCIC:面向说话人自适应表现力 TTS 的范围与码本感知指令条件方法

    研究者提出 SCIC(范围与码本感知指令条件)方法,用于说话人自适应表现力 TTS,通过时间指令路由器实现帧级标签激活,并对残差码本进行标签特定加权。该方法基于 Qwen3-TTS RVQ 码本分析,发现能量集中于早期残差码本、音高在更深前缀中累积,从而改善说话人相对音高与能量控制,并结合多奖励 GDPO 后训练优化控制精度与语音质量。

  8. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向 TTS 条件流匹配的频谱演化协调方法

    针对条件流匹配(CFM)TTS 推理中频谱演化不协调的问题,研究者提出一种免训练的频带选择性增强策略,利用离散小波变换在 ODE 积分过程中动态调制梅尔频谱子带,抑制低频过快增长并提升滞后的高频细节。该方法在 Matcha-TTS、F5-TTS、IndicF5 等架构上验证,将函数评估次数(NFE)从 32 降至 26,FAD 最多改善 61%,且不损失主观意见分、说话人相似度与语音可懂度。

  9. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    VOSSA:面向流式语音架构的声纹优化框架

    VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。

  10. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    从语音到可编辑概念:用概念瓶颈模型探究语音情感识别

    一项研究将概念瓶颈模型引入语音情感识别,考察预测如何依赖转录文本、声学描述和说话人属性。实验用三个 LLM 在 CREMA-D、IEMOCAP 和 MELD 上测试,零样本下模型强烈偏向转录文本,使 CREMA-D 的 Macro-F1 从 27.8 降至 5.8;微调后该偏差消除,转录文本将 Macro-F1 从 41.8 提升至 45.1。

  11. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    RAST:面向低分辨率音频活动识别的分辨率感知特权结构迁移

    RAST 是一种分辨率感知迁移框架,训练时利用高分辨率音频作为教师表示,推理时仅依赖低分辨率音频,通过保留 token 级信息和邻域结构再进行局部 HR-LR 对齐。在 SAMoSA 和 AudioIMU 数据集上,RAST 持续优于仅用低分辨率训练和直接教师迁移基线,将低分辨率识别性能最多提升约 7.8%。

  12. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    Bin2Ambi:利用头部追踪双耳音频学习 Ambisonics 声场重建

    研究提出并定义新任务 Bin2Ambi,即从双耳音频转换到 Ambisonics 声场。系统利用智能耳机运动传感器同步采集的头部追踪数据,缓解双耳音频前后定位模糊与混淆锥侧向误差带来的方向不确定性。客观指标与主观听音测试显示,转换后的 Ambisonics 声场平均方向误差最高约 11.8°,感知空间质量接近 DirAC 基准模型。

  13. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    基于 ASR 对齐与停顿建模的运动神经元病患者言语流畅性指数自动估计

    一项研究提出结合 WhisperX 语音识别与 Silero 语音活动检测并优化时间戳的系统,用于自动估计运动神经元病患者的言语流畅性指数(VFI)。该系统基于运动神经元病数据集,在 P-words 上取得 R² 0.9、NRMSE 0.05,在 S-words 上取得 R² 0.8、NRMSE 0.08,优于传统声学特征和自监督嵌入方案,临床启发特征表现最佳。

  14. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    PACT-SLM:语音语言模型在部分语音下何时有足够证据行动?

    研究提出 PACT-SLM 评测契约,为流式语音智能体分配首个有效动作时间,并分别测量动作身份与时机。其诊断集含 4 个留出语义家族的 80 组配对对比和 1600 条前缀预测,覆盖干净与 15 dB 噪声渲染。重拟合的 WavLM Base Plus 探针动作后语义标签准确率为 26.03%,在动作前前缀上暴露动作的比例为 18.99%。

  15. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向蝙蝠声学监测的硬件感知 Bat Activity Detector(BAD)在 EFM32PG26 上实现全层卸载

    研究团队提出硬件感知的 Bat Activity Detector(BAD),用于在 192–384 kHz 可变采样率下区分蝙蝠叫声与生物及环境干扰。该模型针对 Silicon Labs EFM32PG26(MVP)以 8 位整数精度实现全部 14 层硬件卸载,占用 17.2 KB Flash 与 73.1 KB RAM。

  16. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    WASIL:面向 LLM 的野外阿拉伯语口语交互数据集

    研究者发布 WASIL 阿拉伯语口语交互数据集,包含音频、ASR 假设、助手回复及显式喜欢/不喜欢反馈,共 8,529 轮,其中 14.2% 为不喜欢。另含 2,000 轮测试集,覆盖现代标准阿拉伯语及四种主要方言。数据集通过多 ASR 一致性引导后编辑提供低成本金标准转写,并标注可回答性以区分固有不可回答与 ASR 导致的退化。

  17. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于谐波-打击分离神经音频编解码器的带宽扩展

    研究将音频带宽扩展重构为音频 token 预测问题,在谐波-打击分解引导的分离式神经音频编解码器产生的离散表示上训练 transformer 语言模型。该编解码器设计显式考虑下游 token 预测任务,实现编解码结构与 transformer 建模的更有效耦合。客观指标与主观评价均显示可高质量重建原始信号。

  18. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向鲁棒音频深度伪造检测的神经音频编解码器 FP-NAC

    研究提出取证保持神经音频编解码器 FP-NAC,通过检测器引导目标微调预训练编解码器,同时保留其原生硬量化路径与比特率。在 ASVspoof 2019 LA 上,FP-NAC 在 0.5 kbps 下相较原始 DAC 将 EER 最多降低 49.8 个百分点,并保持相近的重建质量。该工作还发现低速率下 DAC 与 EnCodec 主要削弱真实语音检测,而 X-Codec 表现出更强的伪造侧局限。

  19. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    预测 MOS 能否可靠复现语音增强中的人类系统级偏好?

    研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。

  20. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于事件级变换提示的游戏音效补全

    研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。