发布于 2026-10-02 12:00
深度学习音频开发的环境成本:开发阶段能耗可达模型训练的 256 倍
一项基于 Grid5000 共享计算平台活动日志的研究估算,深度学习音频项目开发阶段的能耗是单独训练最佳模型所需能耗的 3 至 256 倍。该研究以 LORIA 实验室 Multispeech 团队的四个音频项目为案例,评估了其整体能耗并与训练已报告模型的能耗进行对比。作者据此呼吁对深度学习音频项目全生命周期的能耗进行更系统的报告。
一项基于 Grid5000 共享计算平台活动日志的研究估算,深度学习音频项目开发阶段的能耗是单独训练最佳模型所需能耗的 3 至 256 倍。该研究以 LORIA 实验室 Multispeech 团队的四个音频项目为案例,评估了其整体能耗并与训练已报告模型的能耗进行对比。作者据此呼吁对深度学习音频项目全生命周期的能耗进行更系统的报告。
FFASR 是一个包含 15,637 条话语的留出语料库与公开排行榜,覆盖九种条件,分别改变单一声学因素:近场消声语音、实测与模拟办公室-实验室配对、高/中/低信噪比静态远场混合,以及匹配信噪比下的移动说话人变体。
研究人员开发了一种模拟听觉脑干回路、由数千个神经元活动合成 ABR 波的计算机模型,并用脆性 X 综合征小鼠和衰老沙鼠的 recordings 验证。在脆性 X 模型中,模拟的神经兴奋性增高和髓鞘缺陷产生的 ABR 波幅与时间变化与实验记录高度吻合;衰老模型也复现了老年沙鼠的听觉脑干改变。
Arne Hölter、Mathias Lemke、Stefan Weinzierl 与 Lewin Stein 在《理论计算声学杂志》发表论文,推导并分析了用于直接与伴随时域声学仿真的非反射特征边界条件。