AssemblyAI 谈语音 AI 可观测性:智能体上线后需要埋点哪些信号
AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。
AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。
AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。
AssemblyAI 发布 Universal-3.5 Pro 与 OpenAI Whisper 及 GPT-4o-Transcribe 的对比,称其幻觉比 Whisper 少约 30%,代码切换平均 WER 为 7.69,而 GPT-4o-Transcribe 为 44.58。
2026年9月29日,中国科学院老科协声学所分会在声学所举办"智能化趋势下的新电声技术"学术沙龙,声学所副所长杨军作主旨报告。报告介绍声学技术与人工智能、数字信号处理融合趋势,围绕有源噪声控制、个人音频系统与局部声场重建,结合车载降噪、分区聆听、参量阵定向发声等实例阐述,并现场演示聚音屏定向声和免佩戴耳机虚拟环绕声效果。与会人员就双耳听觉、定向声束、声纹识别、助听设备适配等议题研讨。
AssemblyAI 更新了 2026 年 Python 音频处理库清单,指出 Python 3.13 已移除 audioop 模块,导致 pydub 多数操作报错。
AssemblyAI 与 LiveKit 在纽约联合举办聚会,分享构建真实场景语音智能体的 7 条经验。Boardy 与 Flagler Health 的工程团队展示了两种截然不同的语音智能体架构:前者开放式对话,后者按流程图处理医疗预约。
研究发现 TECTB 基因特定变异可直接导致听力损失,携带两份变异的小鼠出现盖膜结构严重破坏和深度耳聋,相关成果发表于 Advanced Science。携带一份变异的人类有明显听力损失,而单拷贝小鼠基线听力正常,但暴露于中等强度噪声后出现永久性严重听力损失,揭示该变异使耳蜗对噪声创伤更敏感。研究建议将 TECTB 纳入遗传性听力损失诊断 panel。
Acoem 发布文章讨论博物馆和历史建筑在施工、翻新期间的振动监测问题,指出重型机械、开挖等产生的振动可能导致建筑开裂或陶瓷、玻璃等脆弱藏品受损。文章提到常用起点是依据 DIN 4150-3 等标准评估和限制振动,但对藏品数以千计的复杂博物馆,仅符合通用标准可能不够,需与声学和振动专家合作制定项目专属阈值与控制措施。
Sandy Brown 为伦敦 1 Paddington Square 八至十六层办公空间提供声学设计,涵盖建筑声学与机电噪声振动控制,项目需满足 WELL 和 BREEAM 要求。设计通过浮筑楼板与弹性吊顶实现礼堂与上下层间的高隔声,并控制背景噪声与串音,配合隔声掩蔽保障私密性,在音频空间内获得优良语言清晰度。
Sandy Brown 受委托为 One Leadenhall 提供从概念设计到竣工的声学设计咨询,涵盖建筑围护结构隔声、内部空间隔声、混响控制及建筑设备噪声与振动管理。围护结构内部噪声标准参照 BREEAM、WELL 和 BCO 指南,并针对轻质幕墙侧向传声、楼层间空气声与撞击声制定了楼板和隔墙详细规格。塔楼高处应急发电机带来隔振、内部传声和环境噪声外泄挑战,为此开发了专用隔离箱中箱设计。
格拉斯哥 Citizens Theatre(The Citz)在经历大规模翻新与扩建后,于 2025 年 9 月重新开放。维多利亚时代原观众厅完成翻新,包括重新找坡的舞台、加高的吊杆塔、新座椅、新控制室和新通风系统;新建环绕式扩建部分设有黑盒工作室剧场、排练室、门厅与酒吧/活动空间、两间学习/活动空间及一个建造工坊。
Sandy Brown 受 Native Land 委托,为位于两条铁路拱门内、正处繁忙铁路下方的 Bankside Yards 营销中心提供全程声学咨询,涵盖现场噪声与振动测量、Stage 3 和 4 声学设计、施工支持、现场检查及竣工后声学测试。
CENSE 发布第 10 期声音作品合辑 MARE SUEBICUM,呼应即将在格但斯克举办的活动主题与地理语境,汇集 CENSE 社群及合作者的音频作品。波罗的海在罗马帝国时期被称为 Mare Suebicum,如今被视为全球受威胁最严重的海域之一,浅而近乎封闭的盆地使污染滞留数十年。
英国政府发布针对国家重大基础设施项目(NSIP)累积效应评估的建议,梳理了依据《2008年规划法》开展此类评估的流程。该建议面向NSIP语境下的累积效应评估工作。
世界声学生态论坛(WFAE)发售 R. Murray Schafer 八十寿辰纪念文集《Ways of Listening, Figures of Thought》,平装 72 页,需支付 15 美元名义费用以覆盖海外运费与包装。
一项研究系统评估了氧化铝及冷冻保护剂乙二醇(EG)和丙二醇(PG)浓度对 10%(w/v)PVA 组织模拟体模声学与黏弹特性的影响。氧化铝浓度从 0% 增至 10%(w/v)时衰减从 0.12 升至 0.54 dB/cm/MHz(r=0.98),纵波声速(1576–1583 m/s)与黏度(1.58–2.15 Pa·s)无显著变化,但剪切模量随浓度升高而增大。
声学所在建深远海实验船近日完成艏部总段吊装,顺利实现全船贯通,建造由总段搭载转入全船设备与系统安装调试阶段。声学所派驻现场人员与船厂、设计院协同攻克建造难点,保障总段搭载连续实施。后续多工种交叉作业将全面展开,声学所将加强现场质量、进度和安全管控,确保下水节点完整性目标,为系泊试验、航行试验和交船筑牢基础。
AssemblyAI 发布 Universal-3.6 Pro Realtime,为 Universal-3.5 Pro 的直接升级版,基于数万小时真实语音代理与电话对话训练,单一模型支持 32 种语言并自动检测语种,延迟与 3.5 Pro 相同,现已以 universal-3-6-pro 提供,价格 $0.45/hr。
研究人员开发了一种模拟听觉脑干回路、由数千个神经元活动合成 ABR 波的计算机模型,并用脆性 X 综合征小鼠和衰老沙鼠的 recordings 验证。在脆性 X 模型中,模拟的神经兴奋性增高和髓鞘缺陷产生的 ABR 波幅与时间变化与实验记录高度吻合;衰老模型也复现了老年沙鼠的听觉脑干改变。
AudioCodes 指出,语音 AI 应用将语音链路变为 AI 交付链的一部分,网络或媒体故障不再只是通话质量问题,还会影响 AI 应用听取来电者与交互速度。
Verasonics 宣布成为 2026 IEEE 国际超声研讨会(IUS)白金赞助商,该会议于 10 月 4 日至 8 日在北卡罗来纳州罗利举行,公司将在 20、21 号展位演示 Vantage NXT 研究超声系统。
Focused Ultrasound Foundation 播客 Curing with Sound 第61期邀请弗吉尼亚大学介入放射科医生 Daniel Sheeran,讨论利用聚焦超声产生微气泡、以机械方式破坏目标组织而不需切口或加热的组织碎化术。
物理治疗师 Christopher "CJ" Miller 在骨科、初级保健和急诊护理场景中使用 Clarius 手持超声设备,将床旁超声(POCUS)与临床检查结合,帮助患者理解肩部部分撕裂等影像发现并指导康复。Clarius 将于 10 月 6 日举办一小时的 MSK POCUS 网络研讨会,面向一线从业者讲解其在物理治疗中的临床应用、适用场景及实施风险。
清诚声发射(广州)面向国庆期间连续运行的储罐、压力容器,推出基于国产声发射(AE)在线监测的24小时值守方案,以弥补人工巡检夜间盲区。方案涵盖SAEU3H检测仪(最高10M采样率、16位精度、60通道以内全波形连续采集)、RAEM1-6监测系统(多机箱级联可扩展至128通道)、RAEM1-C无线同步时钟系统(无线同步时钟精度优于±10μs)及AI智能分析工作站。
英国政府发布海上油气勘探生产、海上天然气卸载与储存及海上二氧化碳封存活动的环境法规与指南。内容涉及上述海上活动的环境监管要求。
RNID 与 BT 合作两年,对助听电话、DECT 电话、文本电话、警报系统和答录机等设备进行 Digital Voice 兼容性测试,发现五类问题并已给出解决方案。问题涉及答录机与 1571 语音信箱冲突、分机电话需额外配置 BT Hub、旧式电话因适配器不兼容不响铃、文本电话出现个别错误字符,以及传真机兼容性无法保证。测试表明绝大多数常用助听电话和警报设备无需特殊支持即可兼容。
ElevenLabs 推出文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,前者被 Artificial Analysis 排名第一,并在盲测对比中获约 75% 听众偏好。Eleven v4 Turbo 面向智能体等低延迟场景,首次语音中位延迟约 150ms,推理中位延迟约 100ms。两款模型支持 90 多种语言,并改进多说话人对话、IPA 音素与音频标签控制。
Salford Acoustics 将于本周举办午餐研讨会,分享其在 Graz 举行的 Forum Acusticum 上发表的 14 篇论文和海报中的部分新研究。内容涵盖爆炸深度硬化高幅冲击噪声测量、基于 ConvTasNet 的一阶 Ambisonics 声源分离,以及含衍射的表面几何声学算法;校园参会者还可观看空气源热泵噪声现场研究海报。
蓝鲸飞跃针对发动机叶片积碳、氧化层和微米级冷却孔堵塞物,推出多频复合超声波清洗方案,支持28kHz-40kHz低频预剥离与高频精洗分段切换。方案配套非标定制清洗篮、多槽全自动清洗线及循环过滤装置,将频率、温度、时间纳入程序化控制以稳定复现清洗效果。
助听器虽能帮助恢复清晰度与交流,但并非人耳替代品,仍存在耳垢检查、夜间充电、蓝牙断连和手机应用设置被关闭等日常困扰。文章援引《美国听力学学会杂志》称,人们从怀疑听力损失到接受干预平均等待7至10年;CDC发病率和死亡率周报显示,45至84岁男性使用助听器的比例约为女性的两倍。
Nortek 在 Oceans 2026(Monterey)发布 Marin 浮标与 ADCP 系统,提供实时运动校正海流剖面以及波浪参数、温度、盐度等数据。内置 Marin ADCP 的海流剖面量程可达 20 m,浮标上的 OceanIQ 智能 QA/QC 边缘处理完成运动校正并自动质控,仅通过卫星传输合格数据。
陕西师范大学等团队设计了一种基于低强度聚焦超声的双曲声聚焦换能器,用于刺激耳穴改善睡眠障碍。研究先用 COMSOL Multiphysics 6.2 仿真确定声刺激强度、发射频率和尺寸等辐射参数,再通过水听器实验测量外部声场验证参数有效性。
布里斯托大学 Marc Holderied 教授将于 10 月 22 日在 Sustainable Sound Futures CDT 线上大师课介绍其团队发现的天然声学超材料,并展示面向仿生超材料吸声体的后续工作。
RNID 与 In2scienceUK 合作资助了四个听力学研究实习岗位,分别位于伦敦大学学院和纽卡斯尔大学。Daniel Cairns 在纽卡斯尔大学 Michael Mather 博士实验室参与中耳炎和内耳类器官发育两篇论文的数据分析与稿件审阅工作。他将于今年秋季在牛津大学攻读博士学位,并表示希望未来能回到听力学研究领域。
Arne Hölter、Mathias Lemke、Stefan Weinzierl 与 Lewin Stein 在《理论计算声学杂志》发表论文,推导并分析了用于直接与伴随时域声学仿真的非反射特征边界条件。
美国中西部一家大型心脏病诊所的影像诊断经理 Michael Denning 分享了采用 Us2.ai 的实践体验:扫描时无需测量,图像传至 PACS 后由 AI 自动完成全部测量,平均每次检查节省约 6.5 分钟,测量准确率约 85% 至 90%。部署上线即时完成,主要挑战在于超声技师对工作流程改变和 AI 取代岗位的顾虑。
ISCA 正招募一名具备扎实软件工程能力的中高级研究员,牵头维护和开发支撑 Interspeech 论文出版的工具套件。该工具套件由 ISCA library、Interspeech tools 和 Validation UI 三部分组成,自 2023 年起用于处理 CMT 元数据与投稿 PDF 的核对、摘要集生成及 ISCA Archive 归档准备。
NHS England 新生儿听力筛查项目(NHSP)对现行定向随访路径开展评估,并据此提出路径变更建议,现就建议征求利益相关方意见。咨询重点包括建议依据、潜在收益与风险、服务交付影响及健康公平性等,截止日期为 2026 年 12 月 18 日。反馈将纳入最终决策,咨询结果摘要与后续步骤将适时公布。
EMSO ERIC 将其十周年科学日的意向登记与摘要征集截止日期延长至 9 月 27 日 23:59 CEST。活动于 2026 年 12 月 15–16 日在罗马 Barceló Roma Hotel 举行,首日为科学日,次日为信息会与官方庆典。摘要须用英文撰写、400–500 词,围绕海洋动力学、生物多样性与地球物理三大主题,录用摘要将收入会议论文集。