跳到正文
今天10月2日周五
  1. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    RIME:面向大规模智能体音乐后期制作的编辑指令框架

    研究者提出 RIME(Rule-based Instructions for Music Editing)框架,可从任意基线音乐数据集生成贴近真实后期制作流程的成对编辑指令数据,并借助结合分轨、混音与常见录音棚效果器的 POEMS 工具包,生成 15000 对编辑指令与真值音频。用该数据评估现有多模态 LLM 智能体时暴露出持续存在的局限,而基于合成数据的监督微调可提升后期制作智能体的表现。

  2. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Soundwich:分层可控音频的视频生成框架

    Soundwich 是一个免训练框架,可将冻结的联合音视频流匹配模型改造为生成与同一视频同步的多条独立可编辑音频轨。它通过共享场景表示在各音轨间传递全局音视频上下文,并将每条音频轨与其对应视觉源进行跨模态交互,从而在保持音源分离的同时提升一致性。生成的音轨可独立调整时序、静音、替换或重新混音,实验与人工评估显示其在时间控制、音源分离和自然度方面均有改善。

  3. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    AnchorPrompt:面向鲁棒音频语言模型的自蒸馏软提示

    AnchorPrompt 是一种保持模型冻结的适配方法,在解码器输入端、音频与问题嵌入之间插入单块提示向量,并通过在多种音频与文本扰动上的自蒸馏训练这些向量。该方法以干净录音的预测作为可回答输入的目标,在音频证据不足时指定拒答目标,推理时无需预先检测扰动,可零样本迁移到未见失真。

  4. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    结构化噪声掩码建模用于视频、音频及更多模态

    研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。

10月1日周四
  1. Production Expert
    发布于 2026-10-01 16:00

    录音棚助理以 AI 软件形式回归,Production Expert 提醒仍需人工质检

    Production Expert 指出,录音棚助理正以 AI 软件形式回归,可承担多机位素材同步等任务,但不应在无人监督下直接信任。文章强调,响度、相位、同步等可测量指标仍可客观质检,而生成式补音、修复等缺乏明确标准,必须由人实时完整监听判断。文中引用乳腺 X 光 AI 辅助研究,说明经验丰富的放射科医生也会因自动化偏差重复 AI 的错误。

  2. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    PG-SELD:物理引导的声事件定位与检测

    研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于事件级变换提示的游戏音效补全

    研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

9月30日周三
  1. ProSoundWeb
    发布于 2026-09-30 22:34

    Sonuscore 为 THE PULSE 制作引擎新增 Synth Wave 与 Epic Atmospheres 扩展包

    Sonuscore 为 THE PULSE 制作引擎新增 Synth Wave 与 Epic Atmospheres 两个扩展包,使该引擎的扩展包总数达到四个。Synth Wave 包含 20 个预设,主打脉冲贝斯、琶音、主音与怀旧和弦;Epic Atmospheres 同样包含 20 个预设,围绕温暖模拟合成器、深沉持续音与宏大混响构建,灵感来自《银翼杀手》系列配乐。

  2. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈环境 AI 记录工具如何适配兽医与法律场景

    AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。

  3. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 发布语音智能体上线运行手册:流量爬坡、回滚与值班

    AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。

  4. AssemblyAI Blog
    发布于 2026-09-30 08:00

    如何评估听写 API:五项标准与测试方法

    AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。

9月29日周二
9月28日周一
9月27日周日
  1. Production Expert
    发布于 2026-09-27 16:00

    生成式 AI 与音频创作:我们该谈谈房间里的大象了

    Production Expert 刊文讨论生成式 AI 对专业音频创作的影响,作者认为其输出"天生平庸",因模型基于概率猜测最可能的答案,无法产生意外与偶然发现。文章以 gated reverb 的意外诞生为例,并称用 Suno 输入"创作前所未闻的音乐"等提示,得到的是三首平庸流行歌。