跳到正文
今天10月2日周五
  1. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    深度学习音频开发的环境成本:开发阶段能耗可达模型训练的 256 倍

    一项基于 Grid5000 共享计算平台活动日志的研究估算,深度学习音频项目开发阶段的能耗是单独训练最佳模型所需能耗的 3 至 256 倍。该研究以 LORIA 实验室 Multispeech 团队的四个音频项目为案例,评估了其整体能耗并与训练已报告模型的能耗进行对比。作者据此呼吁对深度学习音频项目全生命周期的能耗进行更系统的报告。

  2. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    潜在空间端到端历史音乐修复:面向管弦乐的有监督基准与潜流匹配模型

    针对早期20世纪管弦乐历史录音缺乏退化前真值、修复任务难以监督的问题,研究者构建了端到端管弦乐历史音乐修复基准,通过更忠实地模拟历史录音退化链,将管弦乐修复转化为可监督问题。在合成退化对上训练的潜流匹配模型在侵入式、非侵入式与主观评测中均优于现有修复基线。研究还整理并发布了一个9.3小时、免许可、非配对的古典音乐测试集,以及代码和音频演示。

  3. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    可解释的目标感知合成器调制恢复方法

    研究提出一种可解释的目标感知调制与波形恢复流程,先识别被调制目标,再恢复各目标对应的 LFO 波形并估计振荡器波形以匹配源音色。训练采用含噪声振荡器和更多调制选项的可微合成器,并探索感知损失与对抗训练。客观与主观评测显示,正确预测调制目标是关键,其 Gammatone 损失与 CQT 判别器在感知质量上显著优于传统 MSS 损失。

  4. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    AudioJev:以顺序校准概率实现直接音频决策

    AudioJev 将波形、问题与候选选项直接映射为候选分布,用单一共享全参数模型完成推理,无需校准头或顺序集成。其随机错位 SKL 训练为每个问题配对重排视图并监督两个答案,在三个训练种子上于完整 MMAU/MMAR 达到 68.88%/55.33% 平均准确率,随机顺序 SKL 较单视图消融分别降低 43.8%/60.5%。

  5. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    RIME:面向大规模智能体音乐后期制作的编辑指令框架

    研究者提出 RIME(Rule-based Instructions for Music Editing)框架,可从任意基线音乐数据集生成贴近真实后期制作流程的成对编辑指令数据,并借助结合分轨、混音与常见录音棚效果器的 POEMS 工具包,生成 15000 对编辑指令与真值音频。用该数据评估现有多模态 LLM 智能体时暴露出持续存在的局限,而基于合成数据的监督微调可提升后期制作智能体的表现。

  6. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    从孤立特征到轨道:通过多SAE对齐发现音乐概念

    研究提出以音高移调为归纳偏置、通过多视角稀疏自编码器(SAE)对齐来诱导有序轨道,从而发现音乐基础模型内部的结构化概念。该方法生成移调输入对并对齐其SAE表示,在两个先进音乐基础模型上恢复了对应和弦、调性与旋律模式的轨道结构,且仅需少量锚点示例即可解释整个概念族。

  7. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Soundwich:分层可控音频的视频生成框架

    Soundwich 是一个免训练框架,可将冻结的联合音视频流匹配模型改造为生成与同一视频同步的多条独立可编辑音频轨。它通过共享场景表示在各音轨间传递全局音视频上下文,并将每条音频轨与其对应视觉源进行跨模态交互,从而在保持音源分离的同时提升一致性。生成的音轨可独立调整时序、静音、替换或重新混音,实验与人工评估显示其在时间控制、音源分离和自然度方面均有改善。

  8. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    AnchorPrompt:面向鲁棒音频语言模型的自蒸馏软提示

    AnchorPrompt 是一种保持模型冻结的适配方法,在解码器输入端、音频与问题嵌入之间插入单块提示向量,并通过在多种音频与文本扰动上的自蒸馏训练这些向量。该方法以干净录音的预测作为可回答输入的目标,在音频证据不足时指定拒答目标,推理时无需预先检测扰动,可零样本迁移到未见失真。

  9. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    RMS-AQA:面向真实家居环境的两阶段空间音频问答基准

    RMS-AQA 是一个面向真实家居环境的空间音频问答基准,采用两阶段问答格式,先定位可听声事件再进行时空推理。数据集结合真实一阶 Ambisonics(FOA)录音与基于实测房间脉冲响应(RIR)生成的高保真合成数据,并提供将 FOA 数据注入冻结音频语言骨干的轻量空间插件。实验显示主要挑战来自同时声源、远距离以及 RIR 合成与真实录音之间的仿真到真实域差。

  10. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Dyna2Music:面向舞蹈到音乐生成的结构化运动条件与音乐动态监督

    研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。

  11. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    结构化噪声掩码建模用于视频、音频及更多模态

    研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。

10月1日周四
  1. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    PG-SELD:物理引导的声事件定位与检测

    研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    RAST:面向低分辨率音频活动识别的分辨率感知特权结构迁移

    RAST 是一种分辨率感知迁移框架,训练时利用高分辨率音频作为教师表示,推理时仅依赖低分辨率音频,通过保留 token 级信息和邻域结构再进行局部 HR-LR 对齐。在 SAMoSA 和 AudioIMU 数据集上,RAST 持续优于仅用低分辨率训练和直接教师迁移基线,将低分辨率识别性能最多提升约 7.8%。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于谐波-打击分离神经音频编解码器的带宽扩展

    研究将音频带宽扩展重构为音频 token 预测问题,在谐波-打击分解引导的分离式神经音频编解码器产生的离散表示上训练 transformer 语言模型。该编解码器设计显式考虑下游 token 预测任务,实现编解码结构与 transformer 建模的更有效耦合。客观指标与主观评价均显示可高质量重建原始信号。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向鲁棒音频深度伪造检测的神经音频编解码器 FP-NAC

    研究提出取证保持神经音频编解码器 FP-NAC,通过检测器引导目标微调预训练编解码器,同时保留其原生硬量化路径与比特率。在 ASVspoof 2019 LA 上,FP-NAC 在 0.5 kbps 下相较原始 DAC 将 EER 最多降低 49.8 个百分点,并保持相近的重建质量。该工作还发现低速率下 DAC 与 EnCodec 主要削弱真实语音检测,而 X-Codec 表现出更强的伪造侧局限。

  5. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于事件级变换提示的游戏音效补全

    研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。

  6. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    神经音频编解码器通过Token补全实现多速率带宽扩展

    研究将带宽扩展重构为音频Token预测问题,在解耦神经音频编解码器生成的离散表示上训练基于Transformer的语言模型,解耦过程由输入信号的谐波-打击分离引导,以突出对带宽扩展关键的频谱结构。方法提出一种显式考虑下游Token预测任务的编解码器设计,使编解码器结构与Transformer建模更有效耦合。客观指标与主观评价均显示该方法能高质量重建原始信号。

  7. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

9月30日周三
  1. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈环境 AI 记录工具如何适配兽医与法律场景

    AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。

  2. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 发布语音智能体上线运行手册:流量爬坡、回滚与值班

    AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。

  3. AssemblyAI Blog
    发布于 2026-09-30 08:00

    如何评估听写 API:五项标准与测试方法

    AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。

9月29日周二