跳到正文
今天10月2日周五
  1. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    基于发音运动学的源-滤波器 TTS:通过声道运动实现物理可解释控制

    一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。

  2. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    PADP:面向音频质量模型感知意识探测的感知音频数据扰动方法

    研究者提出感知音频数据扰动(PADP),利用人耳对特定细微信号变化不敏感的特性,在保持感知音质与内容的同时大幅改变波形,并通过受控听音测试评估其可听度与参数选择。用PADP对SOTA感知导向客观音频质量模型和基础模型进行压力测试后发现,模型响应与人类听觉感知存在错位,对部分变换的感知意识有限。

  3. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    ParaCalib:面向抑郁检测的语义校准副语言建模框架

    ParaCalib 通过语句级语义语境校准副语言行为,将声学线索映射为结构化 SC-Para 表示,在 DAIC-WOZ 和 MODMA 上分别取得 71.9% 和 90.5% 的最高平均 Macro-F1。该框架用音频语言模型生成语境化声音描述,再由基于 LLM 的副语言状态提取器进行映射;受控分析显示,固定声学描述下改变语义语境会改变推断出的抑郁相关副语言证据。

  4. arXiv eess.AS RSS
    发布于 2026-10-02 12:00

    基于逐层中心引导加权聚合的联邦深度伪造语音检测方法

    研究者提出联邦深度伪造语音检测方法 FedDSD,各客户端用 FedProx 算法训练本地模型并上传参数至中央服务器,无需共享原始音频。该方法进一步提出逐层中心引导加权聚合策略 L-CGWA,依据客户端与参考中心的距离逐层调整其贡献。实验显示其等错误率与集中式协同训练相当,并显著优于单语料库训练模型,在跨域数据集上表现出稳健泛化能力。

  5. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    Dyna2Music:面向舞蹈到音乐生成的结构化运动条件与音乐动态监督

    研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。

  6. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    结构化噪声掩码建模用于视频、音频及更多模态

    研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。

  7. arXiv cs.SD RSS
    发布于 2026-10-02 12:00

    超越可解码性:声学因素是否驱动基于语音的阿尔茨海默病评估预测?

    研究基于 ADReSSo 数据集和三种大型自监督学习骨干模型,对仅参与者语音、非语音和完整录音施加受控噪声与混响干预,结合逐层线性解码、输入与表征空间干预及几何对齐分析,区分声学可解码性与对 AD 预测的实际影响。

  8. Mix Online
    发布于 2026-10-02 03:45

    Mix Sound for Film & TV 2026 现场报道(下):Google Eclipsa 沉浸式音频系统亮相

    Mix Sound for Film & TV 2026 于 9 月 26 日在索尼影视制片厂举办,超 500 名音频从业者到场。Google 联合三星首次以赞助商身份展示 Eclipsa 沉浸式音频系统,提供面向家庭直播的全带宽沉浸式音频工具与交付规范,现场以三星显示器和 7.1.4 消费级回放系统演示。

  9. Mix Online
    发布于 2026-10-02 03:37

    Austrian Audio 发布 OC616 多指向电容麦克风

    Austrian Audio 推出多指向大振膜电容麦克风 OC616,采用其新 CKR12 音头,最大声压级 157 dB,动态范围 134 dB。该麦克风提供全指向、宽心形、心形、超心形和八字形五种指向,三段可切换高通滤波和 -10 dB / -20 dB 两档衰减,适用于人声、原声乐器、高电平声源及 Mid/Side 等立体声录音。

  10. Mix Online
    发布于 2026-10-02 03:30

    Focusrite Control 2 软件功能解析:为 ISA C8X 提供混音与路由控制

    Focusrite Control 2 是 ISA C8X 的桌面软件控制中心,可将前面板的大部分功能延伸到电脑上。其 Mixer 标签页可把接口的模拟与数字输入同 DAW 播放通道组合,建立多路独立的监听与耳机混音,并远程调整增益、输入选择、幻象电源、阻抗、Auto Gain、Air、Drive、Console 模式、插入与高通滤波。

  11. Production Expert
    发布于 2026-10-02 01:00

    FabFilter Pro-C 3 的 Auto Threshold 功能解析

    FabFilter Pro-C 3 新增的 Auto Threshold 功能可让压缩量独立于输入电平保持稳定,适合创意塑形,若仅用于电平控制则可关闭。启用后会出现 Lock Auto Threshold 按钮以在预设间保持相同压缩量,阈值旋钮周围的环形侧链电平表便于判断阈值设置,Audition Triggering 可单独监听被压缩的信号成分。

10月1日周四
  1. Earth Species Project
    发布于 2026-10-01 23:31

    新研究:机器学习揭示大象合唱声编码行为信息

    一项发表于 Scientific Reports 的研究用机器学习分析大象重叠合唱声,无需分离每头个体的叫声即可预测其行为情境。研究分析1986至2022年间成年雌象的903次隆隆声,发现约60%的隆隆声发生在两只及以上个体的合唱中,并在问候、联络和节奏性隆隆声三类情境中观察到发声趋同现象。

  2. MusicTech
    发布于 2026-10-01 22:40

    本周新音乐插件盘点:Sinee Kikzilla 2、Antares AutoTune Advanced、Zplane Timbre 等

    Sinee 推出低频塑形插件 Kikzilla 2,提供混响、噪声、采样或外部输入四种声源,支持可变形包络与三模式滤波,首发价 €79(原价 €99)。Antares 发布 AutoTune Advanced,搭载更新版 Auto-Mode 音高算法与 DVA 引擎,可自动检测并保留歌手颤音,售价 £398 或每月 £15.50。

  3. UK Acoustics Network
    发布于 2026-10-01 19:42

    结构健康监测技术加速应用研讨会将于 2026 年 10 月在考文垂举行

    BINDT 结构健康监测小组将于 2026 年 10 月 20 日在英国考文垂制造技术中心举办"加速采用结构健康监测技术"研讨会,现已开放注册并征集不超过 200 字的演讲摘要。会议聚焦航空航天、油气、土木工程和风机领域的 SHM 成功案例,探讨如何利用 NDT 与状态监测现有标准规范,并梳理认证、监管与保险等采用障碍。

  4. Headphonesty
    发布于 2026-10-01 18:10

    Dual CS 629Q 全自动直驱黑胶唱机原型亮相 High End Vienna 2026

    Dual 在 High End Vienna 2026 展出 CS 629Q 全自动直驱唱机原型,产品页标注 Preview 2027,未公布量产规格。其草稿手册给出 DIN 计权下抖晃率低于 ±0.06%,支持 33、45、78 rpm,预计售价约 1800 欧元,2027 年第一季度开启预售。该机沿用 CS 529 的机械自动机构与唱臂,将直驱电机重新布置以适配自动机构。

  5. Production Expert
    发布于 2026-10-01 18:05

    tokyomeltdown 发布 EQ Mirror 测量插件,实时显示 EQ 实际频响曲线

    tokyomeltdown 发布其首款插件 EQ Mirror,通过在 EQ 前后各插入一个实例,实时显示均衡器实际施加的频响曲线,无需侧链路由。该插件从轨道音频而非测试音测量,支持多数线性相位 EQ,可显示左右或中侧差异并以单一数值报告失真,不改变音频且不报告延迟。支持 AU、VST3、AAX,适用于 macOS 12 及以上,售价 18 美元,提供 14 天全功能试用。

  6. ASE 美国超声心动图学会
    发布于 2026-10-01 18:00

    ASE 与 AIUM 等联合开展 2026 年医学超声宣传月

    ASE 与 AIUM、ARDMS、CCI、SDMS、SVU 联合开展 2026 年医学超声宣传月(MUAM),聚焦心血管超声从业者。10 月期间 ASE Learning Hub 教育产品可使用优惠码 MUAM10 在会员折扣基础上再省 10%,合计近 30% 折扣;新会员按 12 个月价格获 15 个月权益,会员有效期至 2027 年 12 月 31 日。

  7. Headphonesty
    发布于 2026-10-01 17:51

    YouTuber 用导电性比铜差 57 倍的汞制作 Hi-Fi 线材,听音对比几乎听不出差异

    YouTube 频道 pierogi engineering 用 1983 年的汞灌入四根透明管制成喇叭线,与普通铜线对比试听,称两者差异极小。万用表显示铜线约 0.07–0.08 欧姆,单根汞管约 0.22–0.23 欧姆,差值约 0.15 欧姆。该对比为单人非盲听、未做电平匹配,制作者本人也承认可能存在预期偏差。

  8. Production Expert
    发布于 2026-10-01 16:00

    录音棚助理以 AI 软件形式回归,Production Expert 提醒仍需人工质检

    Production Expert 指出,录音棚助理正以 AI 软件形式回归,可承担多机位素材同步等任务,但不应在无人监督下直接信任。文章强调,响度、相位、同步等可测量指标仍可客观质检,而生成式补音、修复等缺乏明确标准,必须由人实时完整监听判断。文中引用乳腺 X 光 AI 辅助研究,说明经验丰富的放射科医生也会因自动化偏差重复 AI 的错误。

  9. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SelfTTS:通过显式嵌入解耦与自增强自优化实现跨说话人风格迁移

    SelfTTS 是一种无需外部预训练说话人或情感编码器的跨说话人风格迁移 TTS 模型,通过梯度反转层(GRL)结合余弦相似度损失显式解耦说话人与情感信息,并引入多正样本对比学习(MPCL)聚类说话人和情感嵌入。该模型还采用基于自增强的自优化策略,利用自身语音转换能力提升合成语音自然度。实验显示其在情感自然度(eMOS)及目标音色与情感稳定性上优于现有基线。