AVSD-Scenes:面向城市声景的音视频场景描述数据集
AVSD-Scenes 是一个面向城市环境的配对音视频场景描述数据集,包含 12,291 条描述,基于 TAU Urban Audio-Visual Scenes 数据集构建。
AVSD-Scenes 是一个面向城市环境的配对音视频场景描述数据集,包含 12,291 条描述,基于 TAU Urban Audio-Visual Scenes 数据集构建。
研究者提出 RIME(Rule-based Instructions for Music Editing)框架,可从任意基线音乐数据集生成贴近真实后期制作流程的成对编辑指令数据,并借助结合分轨、混音与常见录音棚效果器的 POEMS 工具包,生成 15000 对编辑指令与真值音频。用该数据评估现有多模态 LLM 智能体时暴露出持续存在的局限,而基于合成数据的监督微调可提升后期制作智能体的表现。
一项研究在仅200个训练样本、冻结wav2vec 2.0嵌入经主成分分析降至四维的条件下,比较了量子支持向量机(QSVM)、经典SVM和多层感知机(MLP)的跨语料音频深伪检测表现。
一项新研究提出面向多智能体听觉场景分析(ASA)的优化机制,改用一组覆盖多个位置的质量估计替代逐窗单点质量估计,使搜索空间更清晰、优化更简单。该ASA优化时间显著缩短、定位更准确,在真实声学场景中纠正更高定位误差时更稳定,且复杂度低于此前方案。代价是质量估计智能体的响应时间增加,但完整ASA仍可实时运行。
Soundwich 是一个免训练框架,可将冻结的联合音视频流匹配模型改造为生成与同一视频同步的多条独立可编辑音频轨。它通过共享场景表示在各音轨间传递全局音视频上下文,并将每条音频轨与其对应视觉源进行跨模态交互,从而在保持音源分离的同时提升一致性。生成的音轨可独立调整时序、静音、替换或重新混音,实验与人工评估显示其在时间控制、音源分离和自然度方面均有改善。
循环音频频谱图 Transformer(LAST)先处理全部 token,再复用同一组模块仅对类别 token 在固定音频特征上做多轮精修。在 AudioSet 上,十轮 LAST 取得 0.345 平均精度,相对十二层顺序 Transformer 提升 2.1%,参数量减少 49.4%,乘加运算减少 42%,实测吞吐量提高 9.8%。
AnchorPrompt 是一种保持模型冻结的适配方法,在解码器输入端、音频与问题嵌入之间插入单块提示向量,并通过在多种音频与文本扰动上的自蒸馏训练这些向量。该方法以干净录音的预测作为可回答输入的目标,在音频证据不足时指定拒答目标,推理时无需预先检测扰动,可零样本迁移到未见失真。
研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。
Production Expert 指出,录音棚助理正以 AI 软件形式回归,可承担多机位素材同步等任务,但不应在无人监督下直接信任。文章强调,响度、相位、同步等可测量指标仍可客观质检,而生成式补音、修复等缺乏明确标准,必须由人实时完整监听判断。文中引用乳腺 X 光 AI 辅助研究,说明经验丰富的放射科医生也会因自动化偏差重复 AI 的错误。
研究者提出 PG-SELD 训练框架,将自由场物理模型作为房间无关参考,通过物理引导知识蒸馏,把混响信号提取的中间表征与匹配声场景下自由场教师模型的表征对齐,以保留事件与定位信息并降低对房间特性的敏感度。在 STARSS23 基准上,PG-SELD 持续提升多种基线 SELD 架构的泛化性能。
研究对 ACE-Step 1.5 的受控案例显示,仅凭歌词即可在模型内部激活中线性解码出对应艺术家身份,该条件信号在推理时从歌词编码器传播至扩散骨干。案例覆盖 100 位艺术家的 2000 首歌曲,表明歌词构成提示侧防护未覆盖的艺术家级条件通道。
UniAE-MoE 是一个通过混合专家(MoE)架构建模跨域音频表示的统一音频编码器,融合了 Qwen2-Audio 与 Audio-Flamingo 3 的编码器,并采用带共享专家的 SwiGLU 解耦网络。
研究提出以基础皮肤音频、已补全目标素材和文本设计描述为条件的音效补全任务,并构建了跨《英雄联盟》皮肤对齐对应事件的流水线。方法基于 Stable Audio 3 预训练音频先验微调隐空间修复模型,用带符号软保留掩码为每个缺失事件编码可调变换提示。在留出皮肤上的实验显示,其重建效果优于所评估的通用音频编辑器,三级提示可保留连续引导的大部分收益。
研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。
Sonuscore 为 THE PULSE 制作引擎新增 Synth Wave 与 Epic Atmospheres 两个扩展包,使该引擎的扩展包总数达到四个。Synth Wave 包含 20 个预设,主打脉冲贝斯、琶音、主音与怀旧和弦;Epic Atmospheres 同样包含 20 个预设,围绕温暖模拟合成器、深沉持续音与宏大混响构建,灵感来自《银翼杀手》系列配乐。
Sonuscore 为 The Pulse 推出 Synth Wave 和 Epic Atmospheres 两款扩展包,各含 20 个预设,售价均为 29 欧元。
GamesSoundCon 2026 将于 10 月 20-21 日在加州 Burbank 的 Marriott Burbank Convention Center 举行,线上与线下报名已开放。
Pro Tools 的颜色编码功能可通过 Window > Color Palette 打开,支持对轨道、片段、片段列表、编组和标记分别着色,并可选择 Default 恢复默认或 None 关闭着色。
AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。
AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。
AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。
AssemblyAI 发布 Universal-3.5 Pro 与 OpenAI Whisper 及 GPT-4o-Transcribe 的对比,称其幻觉比 Whisper 少约 30%,代码切换平均 WER 为 7.69,而 GPT-4o-Transcribe 为 44.58。
Spitfire Audio 与 BT 合作推出软件乐器 Phoenix,这是双方继 Phobos(2017)和 Polaris(2022)之后的第三次合作。Phoenix 内置六个合成引擎,涵盖频谱波表、FM 与深度采样,并配有八个音序器、四个随机发生器和基于 StutterEdit 的概率琶音器。
CENSE 发布第 10 期声音作品合辑 MARE SUEBICUM,呼应即将在格但斯克举办的活动主题与地理语境,汇集 CENSE 社群及合作者的音频作品。波罗的海在罗马帝国时期被称为 Mare Suebicum,如今被视为全球受威胁最严重的海域之一,浅而近乎封闭的盆地使污染滞留数十年。
歌手、词曲作者兼录音室乐手 Hazel Mills 做客与 Audient 合作的播客 My Forever Studio,在节目中构想了一间偏远而宜人的录音室,并发明了一件新乐器。她讲述了与 Kylie Minogue 巡演的经历、如何平衡录音室工作与个人音乐项目,以及一度痴迷预置钢琴的往事,并透露了新“反乌托邦舞曲”专辑的线索。
AudioCodes 指出,语音 AI 应用将语音链路变为 AI 交付链的一部分,网络或媒体故障不再只是通话质量问题,还会影响 AI 应用听取来电者与交互速度。
Kraxton Labs 推出独立应用 AAF Sync,仅凭新旧画面剪辑的 AAF 元数据在 Pro Tools 中自动完成重套剪,无需参考视频、EDL 或音频分析。
Salford Acoustics 将于本周举办午餐研讨会,分享其在 Graz 举行的 Forum Acusticum 上发表的 14 篇论文和海报中的部分新研究。内容涵盖爆炸深度硬化高幅冲击噪声测量、基于 ConvTasNet 的一阶 Ambisonics 声源分离,以及含衍射的表面几何声学算法;校园参会者还可观看空气源热泵噪声现场研究海报。
Production Expert 刊文讨论生成式 AI 对专业音频创作的影响,作者认为其输出"天生平庸",因模型基于概率猜测最可能的答案,无法产生意外与偶然发现。文章以 gated reverb 的意外诞生为例,并称用 Suno 输入"创作前所未闻的音乐"等提示,得到的是三首平庸流行歌。