SCB:评估语音到语音模型多轮推理的 SpeechConversationBench
SCBX Innovation Lab 团队提出 SpeechConversationBench(SCB),用 103 个分片 GSM8K 问题评测语音到语音模型的语音数学推理。
SCBX Innovation Lab 团队提出 SpeechConversationBench(SCB),用 103 个分片 GSM8K 问题评测语音到语音模型的语音数学推理。
SURE-EVAL 是一个面向音频与语音系统的系统化统一智能体评测框架,通过工具智能体工作流将模型发布转化为隔离、可验证的可调用工具,并将所有计分操作交由版本化确定性程序执行。
一项被 Interspeech 2026 接收的研究以普通话成年人为被试,考察语音来源(真人 vs AI)与说话人熟悉度对情感识别准确率和认知负荷的影响。结果显示真人语音的识别准确率显著更高、处理速度更快,而心率变异性在各条件间无显著差异。研究认为合成语音的解码受自上而下的社会认知调控,反映当前 AI 语音合成技术的局限。
研究提出一种两阶段多分辨率唤醒词检测方案,设备端用轻量模型实时处理音频流,服务器端用异构架构集成模型做验证,音频特征而非原始音频上传云端以保护隐私。研究比较了13种音频分类器的性能与推理时间,并针对特征提取考察多种参数配置。该集成方案在每种噪声条件下均优于其更强的单一分类器。
研究者提出 Talk2Agent,用于评估语音接口向基于 LLM 的计算机使用智能体传达口语指令的效果,任务源自 WildClawBench 和 OSWorld。
研究提出 Speaker Handles,用软 token 表示把声学说话人身份暴露给冻结的文本 LLM,实现跨会话的说话人相关推理。其轻量投影器参数不足主干 0.1%,在 VoxCeleb1 上达 97.40-98.36% 准确率,在 SpeakerBind 上为 70.40%,接近 71.88% 的 topline。
研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。
一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。
Crab(Contrastive Representation and Multimodal Aligned Bottleneck)是一种双模态跨模态 Transformer 架构,融合 WavLM 语音表征与 RoBERTa 文本表征,并提出多层对比监督(MLCS)策略,在网络多层注入多正样本对比学习信号,推理时不增加参数。
Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。
sensiBel 推出 NOVA32 开发平台,采用 32 颗 SBM100B 光学 MEMS 麦克风组成螺旋阵列,通过 XMOS XCORE.AI 处理器同步为单路 32 通道 24-bit、48kHz USB 音频输出。
Sonuscore 为 THE PULSE 制作引擎新增 Synth Wave 与 Epic Atmospheres 两个扩展包,使该引擎的扩展包总数达到四个。Synth Wave 包含 20 个预设,主打脉冲贝斯、琶音、主音与怀旧和弦;Epic Atmospheres 同样包含 20 个预设,围绕温暖模拟合成器、深沉持续音与宏大混响构建,灵感来自《银翼杀手》系列配乐。
Sonuscore 为 The Pulse 推出 Synth Wave 和 Epic Atmospheres 两款扩展包,各含 20 个预设,售价均为 29 欧元。
GamesSoundCon 2026 将于 10 月 20-21 日在加州 Burbank 的 Marriott Burbank Convention Center 举行,线上与线下报名已开放。
Spitfire Audio 与 BT 联合发布深度混合合成器 Phoenix,每声部配备六种合成引擎和两条独立立体声合成链,可对左右声道分别塑形。它结合 BT 私人收藏的复古合成器、采样器、磁带与黑胶录音,以及 Spitfire 音库中的管弦乐素材,内置 37 款效果器、六算子 FM 引擎(34 种算法)和 16 声部 MPE 支持。
MusicTech 按 DJ 混音制作流程推荐了四款软件:DJ.Studio 被列为整体最佳,可从 rekordbox、Serato 导入播放列表并自动生成过渡;Density 记录演奏数据而非音频,事后用原始音频文件重建混音;Ableton Live 适合精修与母带处理;Audacity 则是免费剪辑选择。
AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。
AssemblyAI 发文梳理教育平台评估语音转文字 API 的要点:评估集应以学生音频为主,覆盖口音、儿童语音、远场教室拾音和语码转换,而非干净的教师讲课录音。长音频需区分归档回填与持续采集两类负载,关注季节性、吞吐上限和并发限制。
AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。
AssemblyAI 指出,关键术语提示并非词典而是概率偏置,会在全篇范围内影响模型输出。其文档示例中,音频实际说 "Kelly Byrne Donahue",加入相似关键术语 "Kelly Byrne-Donoghue" 后三次运行均被改写;而音频说 "Vertex"、关键术语为 "Vortex" 时三次均未翻转。
AssemblyAI 发布教程,介绍如何用约 100 行 Python 代码搭建语音翻译应用,串联语音转文字、翻译和文本转语音三步,将英语录音翻译成西班牙语、土耳其语和日语并克隆原声朗读。
AssemblyAI 发现部分客户用传统 WER 基准测试其新模型 Universal-3 Pro 时,结果反而差于旧模型,原因是插入错误偏多。回听音频后确认,这些插入大多是人工标注漏掉的真实语音,在噪声、口音、重叠说话等困难音频上模型常优于人工标注。
AssemblyAI 发布面向 2026 模型格局的提示工程速成课程,其 YouTube 版自 2023 年以来播放量已超 20 万次。课程涵盖提示的五要素、八条仍有效的技巧与输出控制方法,并指出结构化输出已获 API 支持,提示工程在音频场景下规则会反转。
AssemblyAI 发布技术指南,说明临床听写应如何在 Sync API 与 Dictation API 之间选型:前者返回逐字转写,后者同时返回逐字文本和经 llm.instruction 清理的可控版本。
AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。
AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。
AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。
AssemblyAI 发布 Universal-3.5 Pro 与 OpenAI Whisper 及 GPT-4o-Transcribe 的对比,称其幻觉比 Whisper 少约 30%,代码切换平均 WER 为 7.69,而 GPT-4o-Transcribe 为 44.58。
AssemblyAI 更新了 2026 年 Python 音频处理库清单,指出 Python 3.13 已移除 audioop 模块,导致 pydub 多数操作报错。
AssemblyAI 与 LiveKit 在纽约联合举办聚会,分享构建真实场景语音智能体的 7 条经验。Boardy 与 Flagler Health 的工程团队展示了两种截然不同的语音智能体架构:前者开放式对话,后者按流程图处理医疗预约。
Legato 准备以 Legato Frames 进入听力眼镜市场,这款眼镜在镜腿内集成听力辅助,面向轻度至中度听力损失人群,结合其 SpeechSense AI 处理、开放式声学设计与处方镜片。
Synchro Arts 发布 VocAlign 7,新增多轨工作区,可将任意轨道设为参考轨并同时对齐多条人声,且不限制轨道与参考轨数量。Pro 版独占 SmartPitch 智能音准修正、SynchroLink 2.0 与 Creative Formant Control,标准版和 Pro 版均新增 Visual Energy Analysis 实时能量显示。
Spitfire Audio 发布与 BT 合作的混合合成器 Phoenix,这是双方继 2017 年 Phobos 和 2022 年 Polaris 后的第三次合作。
Spitfire Audio 与 BT 合作推出软件乐器 Phoenix,这是双方继 Phobos(2017)和 Polaris(2022)之后的第三次合作。Phoenix 内置六个合成引擎,涵盖频谱波表、FM 与深度采样,并配有八个音序器、四个随机发生器和基于 StutterEdit 的概率琶音器。
Segment CPH 推出首款插件 Palora,一款采用全功能减法合成架构的模拟合成器,支持 Windows 和 macOS(含 M 系列处理器),插件格式为 VST3 和 AU,并提供独立软件版本。
Tupos Audio 推出 FM 合成器插件 Tupos MPE FM,采用复音 FM 合成架构,可将触压、滑动和力度等调制源直接分配至每个旋钮,无需独立调制矩阵。
AssemblyAI 发布 Universal-3.6 Pro Realtime,为 Universal-3.5 Pro 的直接升级版,基于数万小时真实语音代理与电话对话训练,单一模型支持 32 种语言并自动检测语种,延迟与 3.5 Pro 相同,现已以 universal-3-6-pro 提供,价格 $0.45/hr。
AudioCodes 指出,语音 AI 应用将语音链路变为 AI 交付链的一部分,网络或媒体故障不再只是通话质量问题,还会影响 AI 应用听取来电者与交互速度。
ElevenLabs 推出文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,前者被 Artificial Analysis 排名第一,并在盲测对比中获约 75% 听众偏好。Eleven v4 Turbo 面向智能体等低延迟场景,首次语音中位延迟约 150ms,推理中位延迟约 100ms。两款模型支持 90 多种语言,并改进多说话人对话、IPA 音素与音频标签控制。
Naturl Audio 发布 AL-1 母带限制器 1.1 版,用新算法替换原算法,并新增独立的真峰值限制级,置于主限制处理之后,用于捕捉真峰值过冲。公司称新算法在谐波失真、互调失真和混叠方面测量更干净,同时保留原有声音特性;界面提高对比度,原先位于菜单中的控制项移至主界面。