跳到正文
今天10月2日周五
  1. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    RIME:面向大规模智能体音乐后期制作的编辑指令框架

    研究者提出 RIME(Rule-based Instructions for Music Editing)框架,可从任意基线音乐数据集生成贴近真实后期制作流程的成对编辑指令数据,并借助结合分轨、混音与常见录音棚效果器的 POEMS 工具包,生成 15000 对编辑指令与真值音频。用该数据评估现有多模态 LLM 智能体时暴露出持续存在的局限,而基于合成数据的监督微调可提升后期制作智能体的表现。

  2. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    多智能体听觉场景分析:多波束成形语音质量反馈提升定位速度与鲁棒性

    一项新研究提出面向多智能体听觉场景分析(ASA)的优化机制,改用一组覆盖多个位置的质量估计替代逐窗单点质量估计,使搜索空间更清晰、优化更简单。该ASA优化时间显著缩短、定位更准确,在真实声学场景中纠正更高定位误差时更稳定,且复杂度低于此前方案。代价是质量估计智能体的响应时间增加,但完整ASA仍可实时运行。

  3. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Soundwich:分层可控音频的视频生成框架

    Soundwich 是一个免训练框架,可将冻结的联合音视频流匹配模型改造为生成与同一视频同步的多条独立可编辑音频轨。它通过共享场景表示在各音轨间传递全局音视频上下文,并将每条音频轨与其对应视觉源进行跨模态交互,从而在保持音源分离的同时提升一致性。生成的音轨可独立调整时序、静音、替换或重新混音,实验与人工评估显示其在时间控制、音源分离和自然度方面均有改善。

  4. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    AnchorPrompt:面向鲁棒音频语言模型的自蒸馏软提示

    AnchorPrompt 是一种保持模型冻结的适配方法,在解码器输入端、音频与问题嵌入之间插入单块提示向量,并通过在多种音频与文本扰动上的自蒸馏训练这些向量。该方法以干净录音的预测作为可回答输入的目标,在音频证据不足时指定拒答目标,推理时无需预先检测扰动,可零样本迁移到未见失真。

  5. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    结构化噪声掩码建模用于视频、音频及更多模态

    研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。

10月1日周四
  1. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    PG-SELD:物理引导的声事件定位与检测

    研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于事件级变换提示的游戏音效补全

    研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

9月30日周三
  1. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈环境 AI 记录工具如何适配兽医与法律场景

    AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。

  2. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 发布语音智能体上线运行手册:流量爬坡、回滚与值班

    AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。

  3. AssemblyAI Blog
    发布于 2026-09-30 08:00

    如何评估听写 API:五项标准与测试方法

    AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。

9月29日周二
  1. Acoustic Ecology: World Forum for Acoustic Ecology
    发布于 2026-09-29 18:34

    CENSE 发布第 10 期声音作品合辑 MARE SUEBICUM

    CENSE 发布第 10 期声音作品合辑 MARE SUEBICUM,呼应即将在格但斯克举办的活动主题与地理语境,汇集 CENSE 社群及合作者的音频作品。波罗的海在罗马帝国时期被称为 Mare Suebicum,如今被视为全球受威胁最严重的海域之一,浅而近乎封闭的盆地使污染滞留数十年。

9月28日周一
  1. Salford Acoustics 研究
    发布于 2026-09-28 15:46

    Salford Acoustics 举办 Forum Acusticum 论文分享午餐研讨会

    Salford Acoustics 将于本周举办午餐研讨会,分享其在 Graz 举行的 Forum Acusticum 上发表的 14 篇论文和海报中的部分新研究。内容涵盖爆炸深度硬化高幅冲击噪声测量、基于 ConvTasNet 的一阶 Ambisonics 声源分离,以及含衍射的表面几何声学算法;校园参会者还可观看空气源热泵噪声现场研究海报。