Dyna2Music:面向舞蹈到音乐生成的结构化运动条件与音乐动态监督
研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。
研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。
研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。
DEFINE 是一个端到端零样本 TTS 框架,通过将说话人身份与目标口音分别条件于不同音频示例来实现二者解耦,推理时用单一引导权重连续控制口音强度而无需重训练。
研究基于 ADReSSo 数据集和三种大型自监督学习骨干模型,对仅参与者语音、非语音和完整录音施加受控噪声与混响干预,结合逐层线性解码、输入与表征空间干预及几何对齐分析,区分声学可解码性与对 AD 预测的实际影响。
针对口音转换中平行录音稀缺的问题,研究者提出多样本合成监督框架,通过联合评估候选波形的口音实现度与说话人保持度来构建转换目标,并选取候选对应的离散语音编码作为口音条件自回归适配的目标。
一项发表于 Scientific Reports 的研究用机器学习分析大象重叠合唱声,无需分离每头个体的叫声即可预测其行为情境。研究分析1986至2022年间成年雌象的903次隆隆声,发现约60%的隆隆声发生在两只及以上个体的合唱中,并在问候、联络和节奏性隆隆声三类情境中观察到发声趋同现象。
Starkey 推出 Omega AI+ 助听器,原文标题显示其采用四路 DNN 与 DNN 双压缩。材料无正文,具体规格与上市信息未披露。
Sinee 推出低频塑形插件 Kikzilla 2,提供混响、噪声、采样或外部输入四种声源,支持可变形包络与三模式滤波,首发价 €79(原价 €99)。Antares 发布 AutoTune Advanced,搭载更新版 Auto-Mode 音高算法与 DVA 引擎,可自动检测并保留歌手颤音,售价 £398 或每月 £15.50。
Signal Tools Co. 发布 Pro Knob 系列单旋钮混音插件,首发 17 款,含免费的 Trimmer 与 Unlock,Delay、Plate、Shimmer 各带 Aux 发送版本。
Production Expert 指出,录音棚助理正以 AI 软件形式回归,可承担多机位素材同步等任务,但不应在无人监督下直接信任。文章强调,响度、相位、同步等可测量指标仍可客观质检,而生成式补音、修复等缺乏明确标准,必须由人实时完整监听判断。文中引用乳腺 X 光 AI 辅助研究,说明经验丰富的放射科医生也会因自动化偏差重复 AI 的错误。
SelfTTS 是一种无需外部预训练说话人或情感编码器的跨说话人风格迁移 TTS 模型,通过梯度反转层(GRL)结合余弦相似度损失显式解耦说话人与情感信息,并引入多正样本对比学习(MPCL)聚类说话人和情感嵌入。该模型还采用基于自增强的自优化策略,利用自身语音转换能力提升合成语音自然度。实验显示其在情感自然度(eMOS)及目标音色与情感稳定性上优于现有基线。
研究者提出无需训练的亲和融合方法 TFAF,将神经说话人日志推断的说话人结构融入基于嵌入的日志系统,无需额外训练、共享嵌入空间或说话人标签对齐。在 AMI 和 CALLHOME 上,DER 较两个组成系统均有一致提升;在 AMI 上融合还改善了说话人归属转写。消融实验显示神经说话人划分贡献了大部分增益,保留连续嵌入亲和比硬划分融合额外获益。
NVV-Locator 通过非自回归槽填充架构联合预测词汇时间戳、非言语发声类别与事件边界,在 NVV-TimeBench 上取得 71.0% Micro F1、70.2% Macro F1、80.4% Macro mIoU 和 59.6 ms Macro mMAE,优于所评估的大型音频模型。
研究针对精神科双人临床对话录音中指定说话人删除的验证问题,构建了确认临床医生语音和患者语音分别被移除的两条对称流水线,先用目标角色音频进行消隐处理,再用音频语言模型和大语言模型扫描残留输出以识别遗漏删除。
研究将ProtoPNet适配到基于频谱图的语音表示,在MLAAD数据集上开展闭集、跨语言和开集条件下的合成语音溯源实验。结果显示,原型推理在归因性能上与基线相当或更优,同时能提供基于样本的解释,表明可解释性与性能可在合成语音溯源中兼得。
研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。
研究对 ACE-Step 1.5 的受控案例显示,仅凭歌词即可在模型内部激活中线性解码出对应艺术家身份,该条件信号在推理时从歌词编码器传播至扩散骨干。案例覆盖 100 位艺术家的 2000 首歌曲,表明歌词构成提示侧防护未覆盖的艺术家级条件通道。
MeanVoiceFlow2 通过联合优化基于流的转换模块与高效内容编码器,实现单步零样本语音转换。该模型采用 MeanVoiceFlow 进行转换蒸馏并结合真实数据重建训练,同时引入扩散-GAN 训练、样本混合与教师引导条件增强。实验显示其感知质量优于 MeanVoiceFlow,推理速度约提升 9 倍,说话人相似度相当。
研究者提出 OP-CAD(On-Policy Clean-Audio Distillation),一种基于课程的特权自蒸馏框架,用于提升音视频理解在环境噪声与竞争语音下的鲁棒性。
研究者提出 SCIC(范围与码本感知指令条件)方法,用于说话人自适应表现力 TTS,通过时间指令路由器实现帧级标签激活,并对残差码本进行标签特定加权。该方法基于 Qwen3-TTS RVQ 码本分析,发现能量集中于早期残差码本、音高在更深前缀中累积,从而改善说话人相对音高与能量控制,并结合多奖励 GDPO 后训练优化控制精度与语音质量。
UniAE-MoE 是一个通过混合专家(MoE)架构建模跨域音频表示的统一音频编码器,融合了 Qwen2-Audio 与 Audio-Flamingo 3 的编码器,并采用带共享专家的 SwiGLU 解耦网络。
针对条件流匹配(CFM)TTS 推理中频谱演化不协调的问题,研究者提出一种免训练的频带选择性增强策略,利用离散小波变换在 ODE 积分过程中动态调制梅尔频谱子带,抑制低频过快增长并提升滞后的高频细节。该方法在 Matcha-TTS、F5-TTS、IndicF5 等架构上验证,将函数评估次数(NFE)从 32 降至 26,FAD 最多改善 61%,且不损失主观意见分、说话人相似度与语音可懂度。
VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。
一项研究将概念瓶颈模型引入语音情感识别,考察预测如何依赖转录文本、声学描述和说话人属性。实验用三个 LLM 在 CREMA-D、IEMOCAP 和 MELD 上测试,零样本下模型强烈偏向转录文本,使 CREMA-D 的 Macro-F1 从 27.8 降至 5.8;微调后该偏差消除,转录文本将 Macro-F1 从 41.8 提升至 45.1。
RAST 是一种分辨率感知迁移框架,训练时利用高分辨率音频作为教师表示,推理时仅依赖低分辨率音频,通过保留 token 级信息和邻域结构再进行局部 HR-LR 对齐。在 SAMoSA 和 AudioIMU 数据集上,RAST 持续优于仅用低分辨率训练和直接教师迁移基线,将低分辨率识别性能最多提升约 7.8%。
研究者提出单调性引导语义对齐(MGSA)框架,用于零样本多说话人图像到语音(Img2Sp)合成,通过语义语音单元提供跨说话人共享内容目标,并借助参考语音进行说话人条件化。
研究提出自适应 Beta 约束决策导向(ABCDD)语音增强框架,通过帧相关增益下限扩展传统 DD 方法,beta 参数控制噪声抑制与语音保留的权衡。团队进一步用轻量多层感知机(MLP)从含噪语音特征预测帧级 beta 值。
研究提出 PACT-SLM 评测契约,为流式语音智能体分配首个有效动作时间,并分别测量动作身份与时机。其诊断集含 4 个留出语义家族的 80 组配对对比和 1600 条前缀预测,覆盖干净与 15 dB 噪声渲染。重拟合的 WavLM Base Plus 探针动作后语义标签准确率为 26.03%,在动作前前缀上暴露动作的比例为 18.99%。
研究者发布 WASIL 阿拉伯语口语交互数据集,包含音频、ASR 假设、助手回复及显式喜欢/不喜欢反馈,共 8,529 轮,其中 14.2% 为不喜欢。另含 2,000 轮测试集,覆盖现代标准阿拉伯语及四种主要方言。数据集通过多 ASR 一致性引导后编辑提供低成本金标准转写,并标注可回答性以区分固有不可回答与 ASR 导致的退化。
Tacit-TTS 是一种从 IndexTTS2 蒸馏的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。
研究将音频带宽扩展重构为音频 token 预测问题,在谐波-打击分解引导的分离式神经音频编解码器产生的离散表示上训练 transformer 语言模型。该编解码器设计显式考虑下游 token 预测任务,实现编解码结构与 transformer 建模的更有效耦合。客观指标与主观评价均显示可高质量重建原始信号。
研究提出取证保持神经音频编解码器 FP-NAC,通过检测器引导目标微调预训练编解码器,同时保留其原生硬量化路径与比特率。在 ASVspoof 2019 LA 上,FP-NAC 在 0.5 kbps 下相较原始 DAC 将 EER 最多降低 49.8 个百分点,并保持相近的重建质量。该工作还发现低速率下 DAC 与 EnCodec 主要削弱真实语音检测,而 X-Codec 表现出更强的伪造侧局限。
研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。
研究提出用 Speaker Identified cpWER(SI-cpWER)在单一全局说话人 ID 分配下评估跨会议持久说话人归属,覆盖五个商用 diarize-then-identify 级联、两个开放学术基线和端到端参考系统 ThyVoice,测试集为 CHiME-8 NOTSOFAR 全部 129 场会议(干净与加噪)及 CHiME-6。
研究发现,大型音频语言模型(LALM)中音频 token 将获得的注意力,可在语言模型运行前由其编码器输出线性预测,在 13 个 LALM 中的 11 个上全层注意力排序相关系数 ρ≥0.69。
Audible World Models 提出一种免训练框架,将声音纳入生成的世界状态。系统从文本提示构建全景 3D 代理,分离语义层,识别发声前景物体与环境背景区域,为每个声音标签合成干音频,再将其锚定到重建几何体,并利用几何声学传播渲染随听者位置变化的空间音频。在 80 个生成场景上的实验显示,其空间一致性优于文本、视频和全景条件基线,同时保持有竞争力的语义对齐。
研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。
研究者提出 SE-ADD 自进化音频深伪检测框架,通过低秩适配(LoRA)利用音频语言模型自身的判定结果与自生成取证线索构建错误驱动监督,迭代更新模型。在 Qwen2-Audio 上等错误率(EER)从 36.72% 降至 7.52%,在 MOSS-Audio 上从 19.93% 降至 3.97%。
研究者提出双状态稀疏循环单元 DuSpaR,用于资源受限边缘设备上的语音处理模型,通过双状态循环在有状态反馈回路中调制输入向量,并用 ReLU 激活稀疏化矩阵向量乘法中的输入操作数,动态跳过零项以减少乘累加运算和权重内存读取。
研究提出采样频率无关(SFI)前端,直接在录音原生采样率下处理,并搭配带渐进时间尺度融合的傅里叶神经算子(FNO)骨干,避免固定采样率重采样与高频信息损失。在含84个类别、60种采样率的多类群语料上,SFI-FNO配置优于固定采样率和语料最大采样率基线,取得0.906准确率、0.921平衡准确率和0.899的Macro-F1。训练时轻度采样率增强进一步提升对未见采样率变化的鲁棒性。