跳到正文
10月1日周四
  1. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    SEAR:面向音频语言模型的伪造证据锚定音频推理基准

    研究者提出 SEAR,一个包含四项任务的 AQA 基准,通过声学证据识别与量化、深度伪造检测和取证理由生成来评估基于 ALM 的音频深度伪造检测。同时提出 BAEA,为冻结的 ALM 配备受控声学工具,采用固定或自适应证据获取策略。六种 ALM 的实验显示,合理解释与可验证声学证据推理之间存在明显差距,BAEA-Fixed 在两个评估分区上均改善了最终判定和取证理由。

  2. arXiv cs.SD RSS
    发布于 2026-10-01 12:00

    面向恐音症的触发声抑制研究:双路径网络选择性消除触发声

    一项研究提出面向恐音症的神经触发声抑制方法,可选择性消除触发声而非屏蔽全部声音。研究构建覆盖10类最常见触发声的数据集,采用在6 ms音频块上运行的流式双路径网络,探索单热与多热条件模型,从声场景中抑制1-3个触发声。30名临床恐音症困扰程度升高的成年人参与听音研究,报告抑制后音频的困扰与唤醒显著降低、效价改善。

  3. Earth Species Project
    发布于 2026-10-01 02:09

    模型合并让 NatureLM-audio 在未见物种上 F1 提升超 200%

    Emanuele Rossi 等研究者用模型合并将 NatureLM-audio 与其原始语言模型结合,在训练中未见过分类科的物种上取得 F1 相对提升超 200%,创下该评测的新最优。合并后模型在保持动物声音识别能力的同时,更能遵循多样化指令。相关成果在 NeurIPS 2025 非人类动物交流 AI 研讨会上展示,其经验已用于即将发布的 NatureLM-audio 2.0。

9月30日周三
  1. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈环境 AI 记录工具如何适配兽医与法律场景

    AssemblyAI 发文分析环境 AI 记录工具在兽医与法律场景的适配差异,指出兽医问诊是兽医、宠物主与护士的三方对话,且伴随犬吠等非语音噪声,对说话人分离和短时轮换提出更高要求。其 Universal-3.5 Pro 以联合方式生成转写与说话人变更,并针对 cpWER 优化,可配合上下文提示引入药物与品种词汇。

  2. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 发布语音智能体上线运行手册:流量爬坡、回滚与值班

    AssemblyAI 发布语音智能体上线运行手册,提出按对话数而非时钟时间设置影子、金丝雀、早期、多数和全量五阶段流量爬坡,并保留对照组。手册要求回滚阈值绑定控制组数据,以遏制率下降、转人工激增和重复话语率等指标触发回滚,并指出语音智能体故障是部分且对话式的,延迟和成本随对话长度变化。

  3. AssemblyAI Blog
    发布于 2026-09-30 08:00

    如何评估听写 API:五项标准与测试方法

    AssemblyAI 发布听写 API 评估指南,提出清理质量、延迟、术语准确率、集成成本和合规数据流五项标准。其 Dictation API 默认开启清理,每次响应同时返回原文 text 和清理后 llm_response,llm_instruction 支持每请求最多 2048 字符的英文指令。指南建议用二十条真实杂乱语音对比各厂商输出,并测量 p50 与 p95 延迟。

  4. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 谈语音 AI 可观测性:智能体上线后需要埋点哪些信号

    AssemblyAI 提出语音 AI 可观测性应覆盖传输、流水线和对话结果三层,并按延迟、准确率、对话与成本四类信号逐轮埋点。延迟需按语音转文本、LLM 首 token、文本转语音首字节等逐跳统计 P50/P95/P99,准确率可用词级置信度、实体捕获率和来电者重复率作代理指标。

  5. AssemblyAI Blog
    发布于 2026-09-30 08:00

    AssemblyAI 如何在上线前对语音智能体做负载测试

    AssemblyAI 发布指南,说明语音智能体上线前需对语音转文本、LLM、文本转语音、工具调用和电话链路做负载测试,并区分并发、吞吐与时长三类失败。测试语料应取最差的 50 通电话,覆盖 8 kHz mulaw 电话压缩、含账号等实体内容、真实口音与背景噪声,评分时优先看实体准确率而非词错误率。

9月29日周二
9月28日周一
  1. ElevenLabs Blog
    发布于 2026-09-28 20:00

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 文本转语音模型

    ElevenLabs 推出文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,前者被 Artificial Analysis 排名第一,并在盲测对比中获约 75% 听众偏好。Eleven v4 Turbo 面向智能体等低延迟场景,首次语音中位延迟约 150ms,推理中位延迟约 100ms。两款模型支持 90 多种语言,并改进多说话人对话、IPA 音素与音频标签控制。

9月25日周五
  1. Us2.ai 新闻
    发布于 2026-09-25 08:00

    Us2.ai 真实世界 AI 超声心动图部署经验:专访 Michael Denning

    美国中西部一家大型心脏病诊所的影像诊断经理 Michael Denning 分享了采用 Us2.ai 的实践体验:扫描时无需测量,图像传至 PACS 后由 AI 自动完成全部测量,平均每次检查节省约 6.5 分钟,测量准确率约 85% 至 90%。部署上线即时完成,主要挑战在于超声技师对工作流程改变和 AI 取代岗位的顾虑。