发布于 2026-10-01 12:00
FFASR:基于高保真模拟 RIR 的远场自动语音识别基准
FFASR 是一个包含 15,637 条话语的留出语料库与公开排行榜,覆盖九种条件,分别改变单一声学因素:近场消声语音、实测与模拟办公室-实验室配对、高/中/低信噪比静态远场混合,以及匹配信噪比下的移动说话人变体。
FFASR 是一个包含 15,637 条话语的留出语料库与公开排行榜,覆盖九种条件,分别改变单一声学因素:近场消声语音、实测与模拟办公室-实验室配对、高/中/低信噪比静态远场混合,以及匹配信噪比下的移动说话人变体。
AssemblyAI 发现部分客户用传统 WER 基准测试其新模型 Universal-3 Pro 时,结果反而差于旧模型,原因是插入错误偏多。回听音频后确认,这些插入大多是人工标注漏掉的真实语音,在噪声、口音、重叠说话等困难音频上模型常优于人工标注。
AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。
AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。
RNID 与 BT 合作两年,对助听电话、DECT 电话、文本电话、警报系统和答录机等设备进行 Digital Voice 兼容性测试,发现五类问题并已给出解决方案。问题涉及答录机与 1571 语音信箱冲突、分机电话需额外配置 BT Hub、旧式电话因适配器不兼容不响铃、文本电话出现个别错误字符,以及传真机兼容性无法保证。测试表明绝大多数常用助听电话和警报设备无需特殊支持即可兼容。