Talk2Agent:面向文本智能体的语音接口基准测试
研究者提出 Talk2Agent,用于评估语音接口向基于 LLM 的计算机使用智能体传达口语指令的效果,任务源自 WildClawBench 和 OSWorld。
研究者提出 Talk2Agent,用于评估语音接口向基于 LLM 的计算机使用智能体传达口语指令的效果,任务源自 WildClawBench 和 OSWorld。
研究提出 Speaker Handles,用软 token 表示把声学说话人身份暴露给冻结的文本 LLM,实现跨会话的说话人相关推理。其轻量投影器参数不足主干 0.1%,在 VoxCeleb1 上达 97.40-98.36% 准确率,在 SpeakerBind 上为 70.40%,接近 71.88% 的 topline。
研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。
一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。
Crab(Contrastive Representation and Multimodal Aligned Bottleneck)是一种双模态跨模态 Transformer 架构,融合 WavLM 语音表征与 RoBERTa 文本表征,并提出多层对比监督(MLCS)策略,在网络多层注入多正样本对比学习信号,推理时不增加参数。
Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。
AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。
AssemblyAI 发文梳理教育平台评估语音转文字 API 的要点:评估集应以学生音频为主,覆盖口音、儿童语音、远场教室拾音和语码转换,而非干净的教师讲课录音。长音频需区分归档回填与持续采集两类负载,关注季节性、吞吐上限和并发限制。
AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。
AssemblyAI 指出,关键术语提示并非词典而是概率偏置,会在全篇范围内影响模型输出。其文档示例中,音频实际说 "Kelly Byrne Donahue",加入相似关键术语 "Kelly Byrne-Donoghue" 后三次运行均被改写;而音频说 "Vertex"、关键术语为 "Vortex" 时三次均未翻转。
AssemblyAI 发布教程,介绍如何用约 100 行 Python 代码搭建语音翻译应用,串联语音转文字、翻译和文本转语音三步,将英语录音翻译成西班牙语、土耳其语和日语并克隆原声朗读。
AssemblyAI 发现部分客户用传统 WER 基准测试其新模型 Universal-3 Pro 时,结果反而差于旧模型,原因是插入错误偏多。回听音频后确认,这些插入大多是人工标注漏掉的真实语音,在噪声、口音、重叠说话等困难音频上模型常优于人工标注。
AssemblyAI 发布面向 2026 模型格局的提示工程速成课程,其 YouTube 版自 2023 年以来播放量已超 20 万次。课程涵盖提示的五要素、八条仍有效的技巧与输出控制方法,并指出结构化输出已获 API 支持,提示工程在音频场景下规则会反转。
AssemblyAI 发布技术指南,说明临床听写应如何在 Sync API 与 Dictation API 之间选型:前者返回逐字转写,后者同时返回逐字文本和经 llm.instruction 清理的可控版本。
AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。
AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。
AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。
AssemblyAI 发布 Universal-3.5 Pro 与 OpenAI Whisper 及 GPT-4o-Transcribe 的对比,称其幻觉比 Whisper 少约 30%,代码切换平均 WER 为 7.69,而 GPT-4o-Transcribe 为 44.58。
AssemblyAI 更新了 2026 年 Python 音频处理库清单,指出 Python 3.13 已移除 audioop 模块,导致 pydub 多数操作报错。
AssemblyAI 与 LiveKit 在纽约联合举办聚会,分享构建真实场景语音智能体的 7 条经验。Boardy 与 Flagler Health 的工程团队展示了两种截然不同的语音智能体架构:前者开放式对话,后者按流程图处理医疗预约。
AssemblyAI 发布 Universal-3.6 Pro Realtime,为 Universal-3.5 Pro 的直接升级版,基于数万小时真实语音代理与电话对话训练,单一模型支持 32 种语言并自动检测语种,延迟与 3.5 Pro 相同,现已以 universal-3-6-pro 提供,价格 $0.45/hr。
AudioCodes 指出,语音 AI 应用将语音链路变为 AI 交付链的一部分,网络或媒体故障不再只是通话质量问题,还会影响 AI 应用听取来电者与交互速度。
ElevenLabs 推出文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,前者被 Artificial Analysis 排名第一,并在盲测对比中获约 75% 听众偏好。Eleven v4 Turbo 面向智能体等低延迟场景,首次语音中位延迟约 150ms,推理中位延迟约 100ms。两款模型支持 90 多种语言,并改进多说话人对话、IPA 音素与音频标签控制。
美国中西部一家大型心脏病诊所的影像诊断经理 Michael Denning 分享了采用 Us2.ai 的实践体验:扫描时无需测量,图像传至 PACS 后由 AI 自动完成全部测量,平均每次检查节省约 6.5 分钟,测量准确率约 85% 至 90%。部署上线即时完成,主要挑战在于超声技师对工作流程改变和 AI 取代岗位的顾虑。