基于发音运动学的源-滤波器 TTS:通过声道运动实现物理可解释控制
一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。
一项新研究提出基于发音运动学的可控源-滤波器 TTS 架构,由声学到发音反演(AAI)模型生成运动学伪轨迹来调节滤波器响应,预测的基频与能量轮廓参数化声门源,源与滤波器独立预测,源经最优传输条件流匹配(OT-CFM)模块细化后重组为频谱图。
研究者提出感知音频数据扰动(PADP),利用人耳对特定细微信号变化不敏感的特性,在保持感知音质与内容的同时大幅改变波形,并通过受控听音测试评估其可听度与参数选择。用PADP对SOTA感知导向客观音频质量模型和基础模型进行压力测试后发现,模型响应与人类听觉感知存在错位,对部分变换的感知意识有限。
ParaCalib 通过语句级语义语境校准副语言行为,将声学线索映射为结构化 SC-Para 表示,在 DAIC-WOZ 和 MODMA 上分别取得 71.9% 和 90.5% 的最高平均 Macro-F1。该框架用音频语言模型生成语境化声音描述,再由基于 LLM 的副语言状态提取器进行映射;受控分析显示,固定声学描述下改变语义语境会改变推断出的抑郁相关副语言证据。
研究者提出联邦深度伪造语音检测方法 FedDSD,各客户端用 FedProx 算法训练本地模型并上传参数至中央服务器,无需共享原始音频。该方法进一步提出逐层中心引导加权聚合策略 L-CGWA,依据客户端与参考中心的距离逐层调整其贡献。实验显示其等错误率与集中式协同训练相当,并显著优于单语料库训练模型,在跨域数据集上表现出稳健泛化能力。
研究者提出 Dyna2Music,一种潜在流匹配框架,将结构化运动条件与音乐潜在动态的显式监督相结合,用于舞蹈到音乐生成。该方法在 AIST++ 上分析空间划分与频率分离对节拍对齐和运动参考密度的影响,将关节速度分解为快慢分量并分层融合部位运动能量与预训练关节特征。其引入的潜在动态一致性(LDC)辅助目标无需额外可训练参数或推理计算,在 AIST++ 和 TikTok 上改善了节奏对齐与音频质量。
研究者发布 Balalaika-Longform 俄语开源语料库,含 189 小时连续语音单元,单元时长 30 秒至 15 分钟,并配有匹配的短窗口用于同一录音的微调对比。
研究者提出一种基于结构化噪声的掩码方法,通过将白噪声滤波为不同有色噪声分布来生成结构化掩码,以匹配视频和音频数据的时空与频谱特性,无需手工启发式规则或访问数据。该方法在不增加额外计算成本的前提下增强了掩码视频和音频建模框架。实验表明,结构化噪声掩码持续优于随机掩码。
DEFINE 是一个端到端零样本 TTS 框架,通过将说话人身份与目标口音分别条件于不同音频示例来实现二者解耦,推理时用单一引导权重连续控制口音强度而无需重训练。
研究基于 ADReSSo 数据集和三种大型自监督学习骨干模型,对仅参与者语音、非语音和完整录音施加受控噪声与混响干预,结合逐层线性解码、输入与表征空间干预及几何对齐分析,区分声学可解码性与对 AD 预测的实际影响。
针对口音转换中平行录音稀缺的问题,研究者提出多样本合成监督框架,通过联合评估候选波形的口音实现度与说话人保持度来构建转换目标,并选取候选对应的离散语音编码作为口音条件自回归适配的目标。
研究在 ThinCert 插入式培养的 hCMEC/D3 人脑微血管内皮单层上,施加 1.2 MHz、80 V pp、60 秒连续波聚焦超声(不加微泡),发现曝光期间 Lucifer Yellow 转运较对照平均增加 0.283 nmol(95% CI 0.185–0.380 nmol),8 次配对实验方向一致。
Signal To Noise 播客第 334 期邀请纳什维尔录音与现场扩声工程师 Russ Long 做客,他合作过的艺人包括 Sixpence None the Richer、Dolly Parton、Wilco、Amy Grant、Miley Cyrus 等,并参与格莱美与 CMA 颁奖礼转播及影视项目。
Mix Sound for Film & TV 2026 于 9 月 26 日在索尼影视制片厂举办,超 500 名音频从业者到场。Google 联合三星首次以赞助商身份展示 Eclipsa 沉浸式音频系统,提供面向家庭直播的全带宽沉浸式音频工具与交付规范,现场以三星显示器和 7.1.4 消费级回放系统演示。
Novation 与 Image-Line 合作推出专为 FL Studio 设计的 FLpad 和 FLpad Mini 两款 8×8 网格控制器,分别定价 219.99 美元和 139.99 美元。
Austrian Audio 推出多指向大振膜电容麦克风 OC616,采用其新 CKR12 音头,最大声压级 157 dB,动态范围 134 dB。该麦克风提供全指向、宽心形、心形、超心形和八字形五种指向,三段可切换高通滤波和 -10 dB / -20 dB 两档衰减,适用于人声、原声乐器、高电平声源及 Mid/Side 等立体声录音。
Focusrite 推出 ISA 系列首款音频接口 ISA C8X,为 26 进 28 出、2U 的 USB-C 设备,售价 2299.99 美元。
Focusrite Control 2 是 ISA C8X 的桌面软件控制中心,可将前面板的大部分功能延伸到电脑上。其 Mixer 标签页可把接口的模拟与数字输入同 DAW 播放通道组合,建立多路独立的监听与耳机混音,并远程调整增益、输入选择、幻象电源、阻抗、Auto Gain、Air、Drive、Console 模式、插入与高通滤波。
自然界的许多系统可停留在多个不同稳定状态,最终状态取决于初始条件。但这些状态之间的边界往往比表面看起来复杂得多,隐藏的“漏斗”结构使系统得以在稳定状态之间滑移。
Universal Audio 发布 Volt Gen 2 与 Volt Max 共六款 USB 总线供电音频接口,取代原 Volt 系列,全部采用 32-bit、192kHz A/D 与 D/A 转换。
UGREEN 发布开放式耳夹耳机 ClipBuds Pro 2,售价 99.99 美元,已在官网和 Amazon 开售。该耳机采用 11mm 双磁钛复合振膜单元,支持 Hi-Res Wireless 认证与 LDAC 高码率传输,单次续航 10 小时、配合充电盒可达 46 小时,并具备 IP56 防护与蓝牙 6.1。
FabFilter Pro-C 3 新增的 Auto Threshold 功能可让压缩量独立于输入电平保持稳定,适合创意塑形,若仅用于电平控制则可关闭。启用后会出现 Lock Auto Threshold 按钮以在预设间保持相同压缩量,阈值旋钮周围的环形侧链电平表便于判断阈值设置,Audition Triggering 可单独监听被压缩的信号成分。
一项发表于 Scientific Reports 的研究用机器学习分析大象重叠合唱声,无需分离每头个体的叫声即可预测其行为情境。研究分析1986至2022年间成年雌象的903次隆隆声,发现约60%的隆隆声发生在两只及以上个体的合唱中,并在问候、联络和节奏性隆隆声三类情境中观察到发声趋同现象。
Stereophile 发布 2026 秋季版推荐器材榜单,涵盖软件、信号处理器与 FM 调谐器三类,由 John Atkinson 于 10 月 1 日发布。
Stereophile 发布 2026 秋季版推荐器材榜单中的室内声学处理类别,由 John Atkinson 于 10 月 1 日发布。该榜单为发烧友提供室内声学处理产品的推荐参考。
Starkey 推出 Omega AI+ 助听器,原文标题显示其采用四路 DNN 与 DNN 双压缩。材料无正文,具体规格与上市信息未披露。
Sinee 推出低频塑形插件 Kikzilla 2,提供混响、噪声、采样或外部输入四种声源,支持可变形包络与三模式滤波,首发价 €79(原价 €99)。Antares 发布 AutoTune Advanced,搭载更新版 Auto-Mode 音高算法与 DVA 引擎,可自动检测并保留歌手颤音,售价 £398 或每月 £15.50。
美国佛罗里达州西棕榈滩 Raymond F. Kravis 表演艺术中心的 Dreyfoos 音乐厅成为首个同时配备 Meyer Sound TIGRA 线阵列与 1800-LFC 低频控制单元的场馆,取代服务该 2195 座大厅 18 年的 MICA 阵列。
Signal Tools Co. 发布 Pro Knob 系列单旋钮混音插件,首发 17 款,含免费的 Trimmer 与 Unlock,Delay、Plate、Shimmer 各带 Aux 发送版本。
将泡菜插在金属叉上通电后一端会发出明亮橙光,这一K–12经典科学演示背后的确切物理机制长期未明。有研究者针对这一发光现象展开探究。
BINDT 结构健康监测小组将于 2026 年 10 月 20 日在英国考文垂制造技术中心举办"加速采用结构健康监测技术"研讨会,现已开放注册并征集不超过 200 字的演讲摘要。会议聚焦航空航天、油气、土木工程和风机领域的 SHM 成功案例,探讨如何利用 NDT 与状态监测现有标准规范,并梳理认证、监管与保险等采用障碍。
Austrian Audio 发布 OC616 多指向大振膜电容麦克风,在维也纳手工制造,采用源自 CK12 的 CKR12 双振膜音头,提供全指向、宽心形、心形、超心形和 8 字形五种指向,以及三档高通滤波和 -10dB、-20dB 两档衰减。
Dual 在 High End Vienna 2026 展出 CS 629Q 全自动直驱唱机原型,产品页标注 Preview 2027,未公布量产规格。其草稿手册给出 DIN 计权下抖晃率低于 ±0.06%,支持 33、45、78 rpm,预计售价约 1800 欧元,2027 年第一季度开启预售。该机沿用 CS 529 的机械自动机构与唱臂,将直驱电机重新布置以适配自动机构。
tokyomeltdown 发布其首款插件 EQ Mirror,通过在 EQ 前后各插入一个实例,实时显示均衡器实际施加的频响曲线,无需侧链路由。该插件从轨道音频而非测试音测量,支持多数线性相位 EQ,可显示左右或中侧差异并以单一数值报告失真,不改变音频且不报告延迟。支持 AU、VST3、AAX,适用于 macOS 12 及以上,售价 18 美元,提供 14 天全功能试用。
ASE 与 AIUM、ARDMS、CCI、SDMS、SVU 联合开展 2026 年医学超声宣传月(MUAM),聚焦心血管超声从业者。10 月期间 ASE Learning Hub 教育产品可使用优惠码 MUAM10 在会员折扣基础上再省 10%,合计近 30% 折扣;新会员按 12 个月价格获 15 个月权益,会员有效期至 2027 年 12 月 31 日。
Clarius 在 IEEE IUS 2026(展位 35,10 月 4 日至 8 日)展示面向超声研究者的方案,研究扫描仪直接输出 RF 和 IQ 原始回波数据。
YouTube 频道 pierogi engineering 用 1983 年的汞灌入四根透明管制成喇叭线,与普通铜线对比试听,称两者差异极小。万用表显示铜线约 0.07–0.08 欧姆,单根汞管约 0.22–0.23 欧姆,差值约 0.15 欧姆。该对比为单人非盲听、未做电平匹配,制作者本人也承认可能存在预期偏差。
Headphonesty 汇总多项调查,列出发烧友票选的 15 款可驱动几乎任何音箱的功放,McIntosh MC462 以 14.14% 得票居首,Bryston 4B 与 Carver M1.5 分列二、三位。
Production Expert 指出,录音棚助理正以 AI 软件形式回归,可承担多机位素材同步等任务,但不应在无人监督下直接信任。文章强调,响度、相位、同步等可测量指标仍可客观质检,而生成式补音、修复等缺乏明确标准,必须由人实时完整监听判断。文中引用乳腺 X 光 AI 辅助研究,说明经验丰富的放射科医生也会因自动化偏差重复 AI 的错误。
三星推出首款夹耳式耳机 Galaxy Buds On,采用不入耳设计,搭载高通 Snapdragon S7 Gen 1 音频平台与 D 类放大器,单次续航最长 9.5 小时,并配备 Audio Leakage Reduction 防漏音系统、TwinBoost 扬声器、三麦克风与骨振动拾音,支持自动音量调节和 Gemini Live。
SelfTTS 是一种无需外部预训练说话人或情感编码器的跨说话人风格迁移 TTS 模型,通过梯度反转层(GRL)结合余弦相似度损失显式解耦说话人与情感信息,并引入多正样本对比学习(MPCL)聚类说话人和情感嵌入。该模型还采用基于自增强的自优化策略,利用自身语音转换能力提升合成语音自然度。实验显示其在情感自然度(eMOS)及目标音色与情感稳定性上优于现有基线。