基于发音运动学的源-滤波器 TTS:通过声道运动实现物理可解释控制
一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。
一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。
研究者提出感知音频数据扰动(PADP),利用人耳对特定细微信号变化不敏感的特性,在保持感知音质与内容的同时大幅改变波形,并通过受控听音测试评估其可听度与参数选择。用PADP对SOTA感知导向客观音频质量模型和基础模型进行压力测试后发现,模型响应与人类听觉感知存在错位,对部分变换的感知意识有限。
ParaCalib 通过语句级语义语境校准副语言行为,将声学线索映射为结构化 SC-Para 表示,在 DAIC-WOZ 和 MODMA 上分别取得 71.9% 和 90.5% 的最高平均 Macro-F1。该框架用音频语言模型生成语境化声音描述,再由基于 LLM 的副语言状态提取器进行映射;受控分析显示,固定声学描述下改变语义语境会改变推断出的抑郁相关副语言证据。
研究者提出联邦深度伪造语音检测方法 FedDSD,各客户端用 FedProx 算法训练本地模型并上传参数至中央服务器,无需共享原始音频。该方法进一步提出逐层中心引导加权聚合策略 L-CGWA,依据客户端与参考中心的距离逐层调整其贡献。实验显示其等错误率与集中式协同训练相当,并显著优于单语料库训练模型,在跨域数据集上表现出稳健泛化能力。
研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。
研究者发布 Balalaika-Longform 俄语开源语料库,含 189 小时连续语音单元,单元时长 30 秒至 15 分钟,并配有匹配的短窗口用于同一录音的微调对比。
研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。
DEFINE 是一个端到端零样本 TTS 框架,通过将说话人身份与目标口音分别条件于不同音频示例来实现二者解耦,推理时用单一引导权重连续控制口音强度而无需重训练。
研究基于 ADReSSo 数据集和三种大型自监督学习骨干模型,对仅参与者语音、非语音和完整录音施加受控噪声与混响干预,结合逐层线性解码、输入与表征空间干预及几何对齐分析,区分声学可解码性与对 AD 预测的实际影响。
针对口音转换中平行录音稀缺的问题,研究者提出多样本合成监督框架,通过联合评估候选波形的口音实现度与说话人保持度来构建转换目标,并选取候选对应的离散语音编码作为口音条件自回归适配的目标。
研究在 ThinCert 插入式培养的 hCMEC/D3 人脑微血管内皮单层上,施加 1.2 MHz、80 V pp、60 秒连续波聚焦超声(不加微泡),发现曝光期间 Lucifer Yellow 转运较对照平均增加 0.283 nmol(95% CI 0.185–0.380 nmol),8 次配对实验方向一致。
自然界的许多系统可停留在多个不同稳定状态,最终状态取决于初始条件。但这些状态之间的边界往往比表面看起来复杂得多,隐藏的“漏斗”结构使系统得以在稳定状态之间滑移。
FabFilter Pro-C 3 新增的 Auto Threshold 功能可让压缩量独立于输入电平保持稳定,适合创意塑形,若仅用于电平控制则可关闭。启用后会出现 Lock Auto Threshold 按钮以在预设间保持相同压缩量,阈值旋钮周围的环形侧链电平表便于判断阈值设置,Audition Triggering 可单独监听被压缩的信号成分。
一项发表于 Scientific Reports 的研究用机器学习分析大象重叠合唱声,无需分离每头个体的叫声即可预测其行为情境。研究分析1986至2022年间成年雌象的903次隆隆声,发现约60%的隆隆声发生在两只及以上个体的合唱中,并在问候、联络和节奏性隆隆声三类情境中观察到发声趋同现象。
将泡菜插在金属叉上通电后一端会发出明亮橙光,这一K–12经典科学演示背后的确切物理机制长期未明。有研究者针对这一发光现象展开探究。
YouTube 频道 pierogi engineering 用 1983 年的汞灌入四根透明管制成喇叭线,与普通铜线对比试听,称两者差异极小。万用表显示铜线约 0.07–0.08 欧姆,单根汞管约 0.22–0.23 欧姆,差值约 0.15 欧姆。该对比为单人非盲听、未做电平匹配,制作者本人也承认可能存在预期偏差。
Headphonesty 汇总多项调查,列出发烧友票选的 15 款可驱动几乎任何音箱的功放,McIntosh MC462 以 14.14% 得票居首,Bryston 4B 与 Carver M1.5 分列二、三位。
SelfTTS 是一种无需外部预训练说话人或情感编码器的跨说话人风格迁移 TTS 模型,通过梯度反转层(GRL)结合余弦相似度损失显式解耦说话人与情感信息,并引入多正样本对比学习(MPCL)聚类说话人和情感嵌入。该模型还采用基于自增强的自优化策略,利用自身语音转换能力提升合成语音自然度。实验显示其在情感自然度(eMOS)及目标音色与情感稳定性上优于现有基线。
研究者提出无需训练的亲和融合方法 TFAF,将神经说话人日志推断的说话人结构融入基于嵌入的日志系统,无需额外训练、共享嵌入空间或说话人标签对齐。在 AMI 和 CALLHOME 上,DER 较两个组成系统均有一致提升;在 AMI 上融合还改善了说话人归属转写。消融实验显示神经说话人划分贡献了大部分增益,保留连续嵌入亲和比硬划分融合额外获益。
NVV-Locator 通过非自回归槽填充架构联合预测词汇时间戳、非言语发声类别与事件边界,在 NVV-TimeBench 上取得 71.0% Micro F1、70.2% Macro F1、80.4% Macro mIoU 和 59.6 ms Macro mMAE,优于所评估的大型音频模型。
研究针对精神科双人临床对话录音中指定说话人删除的验证问题,构建了确认临床医生语音和患者语音分别被移除的两条对称流水线,先用目标角色音频进行消隐处理,再用音频语言模型和大语言模型扫描残留输出以识别遗漏删除。
研究将ProtoPNet适配到基于频谱图的语音表示,在MLAAD数据集上开展闭集、跨语言和开集条件下的合成语音溯源实验。结果显示,原型推理在归因性能上与基线相当或更优,同时能提供基于样本的解释,表明可解释性与性能可在合成语音溯源中兼得。
研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。
研究对 ACE-Step 1.5 的受控案例显示,仅凭歌词即可在模型内部激活中线性解码出对应艺术家身份,该条件信号在推理时从歌词编码器传播至扩散骨干。案例覆盖 100 位艺术家的 2000 首歌曲,表明歌词构成提示侧防护未覆盖的艺术家级条件通道。
MeanVoiceFlow2 通过联合优化基于流的转换模块与高效内容编码器,实现单步零样本语音转换。该模型采用 MeanVoiceFlow 进行转换蒸馏并结合真实数据重建训练,同时引入扩散-GAN 训练、样本混合与教师引导条件增强。实验显示其感知质量优于 MeanVoiceFlow,推理速度约提升 9 倍,说话人相似度相当。
研究者提出 OP-CAD(On-Policy Clean-Audio Distillation),一种基于课程的特权自蒸馏框架,用于提升音视频理解在环境噪声与竞争语音下的鲁棒性。
研究者提出 SCIC(范围与码本感知指令条件)方法,用于说话人自适应表现力 TTS,通过时间指令路由器实现帧级标签激活,并对残差码本进行标签特定加权。该方法基于 Qwen3-TTS RVQ 码本分析,发现能量集中于早期残差码本、音高在更深前缀中累积,从而改善说话人相对音高与能量控制,并结合多奖励 GDPO 后训练优化控制精度与语音质量。
UniAE-MoE 是一个通过混合专家(MoE)架构建模跨域音频表示的统一音频编码器,融合了 Qwen2-Audio 与 Audio-Flamingo 3 的编码器,并采用带共享专家的 SwiGLU 解耦网络。
针对条件流匹配(CFM)TTS 推理中频谱演化不协调的问题,研究者提出一种免训练的频带选择性增强策略,利用离散小波变换在 ODE 积分过程中动态调制梅尔频谱子带,抑制低频过快增长并提升滞后的高频细节。该方法在 Matcha-TTS、F5-TTS、IndicF5 等架构上验证,将函数评估次数(NFE)从 32 降至 26,FAD 最多改善 61%,且不损失主观意见分、说话人相似度与语音可懂度。
VOSSA 是一种面向流式语音转换的说话人表征框架,从内容编码器中间层提取说话人信息并用注意力统计池化聚合,与语音转换目标联合训练,无需独立说话人编码器。在六个数据集上,VOSSA 改善了 F0 动态与元音区分性声学线索,同时保持 NISQA-MOS、WER 和说话人相似度相当。感知测试显示自然度、说话人相似度、可懂度和活跃度均有提升。
一项研究将概念瓶颈模型引入语音情感识别,考察预测如何依赖转录文本、声学描述和说话人属性。实验用三个 LLM 在 CREMA-D、IEMOCAP 和 MELD 上测试,零样本下模型强烈偏向转录文本,使 CREMA-D 的 Macro-F1 从 27.8 降至 5.8;微调后该偏差消除,转录文本将 Macro-F1 从 41.8 提升至 45.1。
RAST 是一种分辨率感知迁移框架,训练时利用高分辨率音频作为教师表示,推理时仅依赖低分辨率音频,通过保留 token 级信息和邻域结构再进行局部 HR-LR 对齐。在 SAMoSA 和 AudioIMU 数据集上,RAST 持续优于仅用低分辨率训练和直接教师迁移基线,将低分辨率识别性能最多提升约 7.8%。
研究者提出单调性引导语义对齐(MGSA)框架,用于零样本多说话人图像到语音(Img2Sp)合成,通过语义语音单元提供跨说话人共享内容目标,并借助参考语音进行说话人条件化。
研究提出自适应 Beta 约束决策导向(ABCDD)语音增强框架,通过帧相关增益下限扩展传统 DD 方法,beta 参数控制噪声抑制与语音保留的权衡。团队进一步用轻量多层感知机(MLP)从含噪语音特征预测帧级 beta 值。
研究提出并定义新任务 Bin2Ambi,即从双耳音频转换到 Ambisonics 声场。系统利用智能耳机运动传感器同步采集的头部追踪数据,缓解双耳音频前后定位模糊与混淆锥侧向误差带来的方向不确定性。客观指标与主观听音测试显示,转换后的 Ambisonics 声场平均方向误差最高约 11.8°,感知空间质量接近 DirAC 基准模型。
一项研究提出结合 WhisperX 语音识别与 Silero 语音活动检测并优化时间戳的系统,用于自动估计运动神经元病患者的言语流畅性指数(VFI)。该系统基于运动神经元病数据集,在 P-words 上取得 R² 0.9、NRMSE 0.05,在 S-words 上取得 R² 0.8、NRMSE 0.08,优于传统声学特征和自监督嵌入方案,临床启发特征表现最佳。
研究提出 PACT-SLM 评测契约,为流式语音智能体分配首个有效动作时间,并分别测量动作身份与时机。其诊断集含 4 个留出语义家族的 80 组配对对比和 1600 条前缀预测,覆盖干净与 15 dB 噪声渲染。重拟合的 WavLM Base Plus 探针动作后语义标签准确率为 26.03%,在动作前前缀上暴露动作的比例为 18.99%。
研究团队提出硬件感知的 Bat Activity Detector(BAD),用于在 192–384 kHz 可变采样率下区分蝙蝠叫声与生物及环境干扰。该模型针对 Silicon Labs EFM32PG26(MVP)以 8 位整数精度实现全部 14 层硬件卸载,占用 17.2 KB Flash 与 73.1 KB RAM。
研究者发布 WASIL 阿拉伯语口语交互数据集,包含音频、ASR 假设、助手回复及显式喜欢/不喜欢反馈,共 8,529 轮,其中 14.2% 为不喜欢。另含 2,000 轮测试集,覆盖现代标准阿拉伯语及四种主要方言。数据集通过多 ASR 一致性引导后编辑提供低成本金标准转写,并标注可回答性以区分固有不可回答与 ASR 导致的退化。
Tacit-TTS 是一种从 IndexTTS2 蒸馏的无转写零样本语音克隆系统,用掩码非自回归生成替代自回归文本到语义解码,并引入免训练声学长度估计与 ReFlow 蒸馏加速流匹配渲染器。