跳到正文
10月1日周四
  1. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    无需训练的神经与嵌入说话人日志亲和融合方法

    研究者提出无需训练的亲和融合方法 TFAF,将神经说话人日志推断的说话人结构融入基于嵌入的日志系统,无需额外训练、共享嵌入空间或说话人标签对齐。在 AMI 和 CALLHOME 上,DER 较两个组成系统均有一致提升;在 AMI 上融合还改善了说话人归属转写。消融实验显示神经说话人划分贡献了大部分增益,保留连续嵌入亲和比硬划分融合额外获益。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于音频语言模型的精神科临床语音录音角色引导说话人删除验证

    研究针对精神科双人临床对话录音中指定说话人删除的验证问题,构建了确认临床医生语音和患者语音分别被移除的两条对称流水线,先用目标角色音频进行消隐处理,再用音频语言模型和大语言模型扫描残留输出以识别遗漏删除。

  3. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    PG-SELD:物理引导的声事件定位与检测

    研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    MeanVoiceFlow2:联合优化平均流与内容编码器实现快速单步零样本语音转换

    MeanVoiceFlow2 通过联合优化基于流的转换模块与高效内容编码器,实现单步零样本语音转换。该模型采用 MeanVoiceFlow 进行转换蒸馏并结合真实数据重建训练,同时引入扩散-GAN 训练、样本混合与教师引导条件增强。实验显示其感知质量优于 MeanVoiceFlow,推理速度约提升 9 倍,说话人相似度相当。

  5. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SCIC:面向说话人自适应表现力 TTS 的范围与码本感知指令条件方法

    研究者提出 SCIC(范围与码本感知指令条件)方法,用于说话人自适应表现力 TTS,通过时间指令路由器实现帧级标签激活,并对残差码本进行标签特定加权。该方法基于 Qwen3-TTS RVQ 码本分析,发现能量集中于早期残差码本、音高在更深前缀中累积,从而改善说话人相对音高与能量控制,并结合多奖励 GDPO 后训练优化控制精度与语音质量。

  6. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向 TTS 条件流匹配的频谱演化协调方法

    针对条件流匹配(CFM)TTS 推理中频谱演化不协调的问题,研究者提出一种免训练的频带选择性增强策略,利用离散小波变换在 ODE 积分过程中动态调制梅尔频谱子带,抑制低频过快增长并提升滞后的高频细节。该方法在 Matcha-TTS、F5-TTS、IndicF5 等架构上验证,将函数评估次数(NFE)从 32 降至 26,FAD 最多改善 61%,且不损失主观意见分、说话人相似度与语音可懂度。

  7. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    VOSSA:面向流式语音架构的声纹优化框架

    VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。

  8. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    从语音到可编辑概念:用概念瓶颈模型探究语音情感识别

    一项研究将概念瓶颈模型引入语音情感识别,考察预测如何依赖转录文本、声学描述和说话人属性。实验用三个 LLM 在 CREMA-D、IEMOCAP 和 MELD 上测试,零样本下模型强烈偏向转录文本,使 CREMA-D 的 Macro-F1 从 27.8 降至 5.8;微调后该偏差消除,转录文本将 Macro-F1 从 41.8 提升至 45.1。

  9. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    RAST:面向低分辨率音频活动识别的分辨率感知特权结构迁移

    RAST 是一种分辨率感知迁移框架,训练时利用高分辨率音频作为教师表示,推理时仅依赖低分辨率音频,通过保留 token 级信息和邻域结构再进行局部 HR-LR 对齐。在 SAMoSA 和 AudioIMU 数据集上,RAST 持续优于仅用低分辨率训练和直接教师迁移基线,将低分辨率识别性能最多提升约 7.8%。

  10. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    Bin2Ambi:利用头部追踪双耳音频学习 Ambisonics 声场重建

    研究提出并定义新任务 Bin2Ambi,即从双耳音频转换到 Ambisonics 声场。系统利用智能耳机运动传感器同步采集的头部追踪数据,缓解双耳音频前后定位模糊与混淆锥侧向误差带来的方向不确定性。客观指标与主观听音测试显示,转换后的 Ambisonics 声场平均方向误差最高约 11.8°,感知空间质量接近 DirAC 基准模型。

  11. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    基于 ASR 对齐与停顿建模的运动神经元病患者言语流畅性指数自动估计

    一项研究提出结合 WhisperX 语音识别与 Silero 语音活动检测并优化时间戳的系统,用于自动估计运动神经元病患者的言语流畅性指数(VFI)。该系统基于运动神经元病数据集,在 P-words 上取得 R² 0.9、NRMSE 0.05,在 S-words 上取得 R² 0.8、NRMSE 0.08,优于传统声学特征和自监督嵌入方案,临床启发特征表现最佳。

  12. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    PACT-SLM:语音语言模型在部分语音下何时有足够证据行动?

    研究提出 PACT-SLM 评测契约,为流式语音智能体分配首个有效动作时间,并分别测量动作身份与时机。其诊断集含 4 个留出语义家族的 80 组配对对比和 1600 条前缀预测,覆盖干净与 15 dB 噪声渲染。重拟合的 WavLM Base Plus 探针动作后语义标签准确率为 26.03%,在动作前前缀上暴露动作的比例为 18.99%。

  13. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向蝙蝠声学监测的硬件感知 Bat Activity Detector(BAD)在 EFM32PG26 上实现全层卸载

    研究团队提出硬件感知的 Bat Activity Detector(BAD),用于在 192–384 kHz 可变采样率下区分蝙蝠叫声与生物及环境干扰。该模型针对 Silicon Labs EFM32PG26(MVP)以 8 位整数精度实现全部 14 层硬件卸载,占用 17.2 KB Flash 与 73.1 KB RAM。

  14. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    WASIL:面向 LLM 的野外阿拉伯语口语交互数据集

    研究者发布 WASIL 阿拉伯语口语交互数据集,包含音频、ASR 假设、助手回复及显式喜欢/不喜欢反馈,共 8,529 轮,其中 14.2% 为不喜欢。另含 2,000 轮测试集,覆盖现代标准阿拉伯语及四种主要方言。数据集通过多 ASR 一致性引导后编辑提供低成本金标准转写,并标注可回答性以区分固有不可回答与 ASR 导致的退化。

  15. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于谐波-打击分离神经音频编解码器的带宽扩展

    研究将音频带宽扩展重构为音频 token 预测问题,在谐波-打击分解引导的分离式神经音频编解码器产生的离散表示上训练 transformer 语言模型。该编解码器设计显式考虑下游 token 预测任务,实现编解码结构与 transformer 建模的更有效耦合。客观指标与主观评价均显示可高质量重建原始信号。

  16. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向鲁棒音频深度伪造检测的神经音频编解码器 FP-NAC

    研究提出取证保持神经音频编解码器 FP-NAC,通过检测器引导目标微调预训练编解码器,同时保留其原生硬量化路径与比特率。在 ASVspoof 2019 LA 上,FP-NAC 在 0.5 kbps 下相较原始 DAC 将 EER 最多降低 49.8 个百分点,并保持相近的重建质量。该工作还发现低速率下 DAC 与 EnCodec 主要削弱真实语音检测,而 X-Codec 表现出更强的伪造侧局限。

  17. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    预测 MOS 能否可靠复现语音增强中的人类系统级偏好?

    研究提出系统级偏好准确率(SPA),直接检验预测 MOS 与人工评分是否给出相同的语音增强系统偏好。实验显示,单一预测模型的 SPA 从 9.4% 到 76.8% 不等,最佳模型在约 23% 的系统对比中仍与人类判断不一致。集成仅带来有限提升,域自适应在闭集条件下大幅改善 SPA,但在目标系统与说话人均未知的开集条件下增益有限。

  18. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于事件级变换提示的游戏音效补全

    研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。

  19. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    跨会议持久说话人归属如何评估:SI-cpWER 基准与 ThyVoice 参考系统

    研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。

  20. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    Audible World Models:为 3D 世界生成空间感知音效

    Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。

  21. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    神经音频编解码器通过Token补全实现多速率带宽扩展

    研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。

  22. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    多预测器测试时优化可提高预测 MOS 分数却未改善语音增强感知质量

    一项针对语音增强的测试时优化分析显示,直接修改增强信号以抬高多个 MOS 预测器平均分后,在 URGENT 2026 挑战赛的七个系统上,所有优化后的预测分数均上升,而基于参考的指标几乎不变。未参与优化的预测器分数不上升,MUSHRA 听音测试也未显示感知质量改善。研究提示用于优化的预测器不应再用于评估,挑战赛应保持排序所用预测器不公开。

  23. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于连续滤波器组与傅里叶神经算子的异构多类群生物声学分类

    研究提出采样频率无关(SFI)前端,直接在录音原生采样率下处理,并搭配带渐进时间尺度融合的傅里叶神经算子(FNO)骨干,避免固定采样率重采样与高频信息损失。在含84个类别、60种采样率的多类群语料上,SFI-FNO配置优于固定采样率和语料最大采样率基线,取得0.906准确率、0.921平衡准确率和0.899的Macro-F1。训练时轻度采样率增强进一步提升对未见采样率变化的鲁棒性。

  24. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    熟悉度是障碍还是助推?AI 语音克隆对普通话情感韵律识别的影响研究

    一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。

  25. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于相对音程网络的基频轨迹平滑方法 RIN

    研究人员提出相对音程网络(RIN),一种将逐帧基频估计与数据驱动的多跳音高差相结合的音高轨迹平滑框架。该方法利用可变Q变换互相关提取任意帧偏移下的稳健相对音高音程,并将平滑问题建模为L1范数优化,证明其等价于最小费用循环问题,可通过线性规划高效求解。在语音、歌唱与器乐数据集上的评估显示,RIN显著改善弱估计器,在相近计算成本下达到或超过Viterbi解码,并在某些声学退化条件下具有更优鲁棒性。

  26. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于两阶段多分辨率集成模型的鲁棒唤醒词检测

    研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。