跳到正文
10月1日周四
  1. arXiv eess.AS RSS
    发布于 2026-10-01 12:00

    熟悉度是障碍还是助推?AI 语音克隆对普通话情感韵律识别的影响研究

    一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    基于两阶段多分辨率集成模型的鲁棒唤醒词检测

    研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。

  3. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

  4. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向恐音症的触发声抑制研究:双路径网络选择性消除触发声

    一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。

  5. Earth Species Project
    发布于 2026-10-01 02:09

    模型合并让 NatureLM-audio 在未见物种上 F1 提升超 200%

    Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。

9月30日周三
  1. ProSoundWeb
    发布于 2026-09-30 22:34

    Sonuscore 为 THE PULSE 制作引擎新增 Synth Wave 与 Epic Atmospheres 扩展包

    Sonuscore 为 THE PULSE 制作引擎新增 Synth Wave 与 Epic Atmospheres 两个扩展包,使该引擎的扩展包总数达到四个。Synth Wave 包含 20 个预设,主打脉冲贝斯、琶音、主音与怀旧和弦;Epic Atmospheres 同样包含 20 个预设,围绕温暖模拟合成器、深沉持续音与宏大混响构建,灵感来自《银翼杀手》系列配乐。

  2. Production Expert
    发布于 2026-09-30 16:15

    Spitfire Audio 与 BT 发布混合合成器 Phoenix,面向电影化声音设计

    Spitfire Audio 与 BT 联合发布深度混合合成器 Phoenix,每声部配备六种合成引擎和两条独立立体声合成链,可对左右声道分别塑形。它结合 BT 私人收藏的复古合成器、采样器、磁带与黑胶录音,以及 Spitfire 音库中的管弦乐素材,内置 37 款效果器、六算子 FM 引擎(34 种算法)和 16 声部 MPE 支持。

  3. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈环境 AI 记录工具如何适配兽医与法律场景

    AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。

  4. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 发布语音智能体上线运行手册:流量爬坡、回滚与值班

    AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。

  5. AssemblyAI Blog
    发布于 2026-09-30 08:00

    如何评估听写 API:五项标准与测试方法

    AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。

  6. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈语音 AI 可观测性:智能体上线后需要埋点哪些信号

    AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。

  7. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 如何在上线前对语音智能体做负载测试

    AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。

9月29日周二
9月28日周一
  1. ElevenLabs Blog
    发布于 2026-09-28 20:00

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 文本转语音模型

    ElevenLabs 推出文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,前者被 Artificial Analysis 排名第一,并在盲测对比中获约 75% 听众偏好。Eleven v4 Turbo 面向智能体等低延迟场景,首次语音中位延迟约 150ms,推理中位延迟约 100ms。两款模型支持 90 多种语言,并改进多说话人对话、IPA 音素与音频标签控制。

  2. Production Expert
    发布于 2026-09-28 18:35

    Naturl Audio 发布 AL-1 限制器 1.1 版,新增算法与真峰值限制

    Naturl Audio 发布 AL-1 母带限制器 1.1 版,用新算法替换原算法,并新增独立的真峰值限制级,置于主限制处理之后,用于捕捉真峰值过冲。公司称新算法在谐波失真、互调失真和混叠方面测量更干净,同时保留原有声音特性;界面提高对比度,原先位于菜单中的控制项移至主界面。