跳到正文
原文
arXiv eess.AS RSS·· 3 小时前

面向无编码器语音大模型:用元数据监督预训练教 LLM 听出谁说了什么

Teaching LLMs to Hear Who Spoke What: Metadata-Supervised Pretraining for Encoder-Free Speech-LLMs

摘要

研究提出元数据监督预训练(MSP),利用说话人身份、情感等语音属性,为无编码器语音大模型(Speech-LLM)构建说话人区分与副语言能力,并引入说话人感知话语组合(SAUC)与随机跨度掩蔽。在多说话人对话的联合 ASR 与说话人日志任务上,相同训练数据下该无编码器模型优于随机初始化的编码器基线;在有限元数据标注下,与使用大规模语料预训练语音编码器的模型相比具有竞争力,并在若干设置中胜出。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv eess.AS RSS · arxiv.org