跳到正文
原文
arXiv cs.SD RSS·· 3 小时前

用直接偏好优化改进 Audio LLM 的英汉混说语音识别

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

摘要

针对 Audio LLM 在英汉混说语音转写中出现的语言遗漏、翻译替代转写和幻觉三类失败模式,研究者采用直接偏好优化(DPO)对齐模型,构造保留混说内容为正例、模仿失败模式为负例的偏好对。在 10 万对(570 小时)数据上训练三个 Audio LLM 后,模型更倾向于保留语言构成而非翻译,分布内 MER 最多降低 89.6%,分布外降低 20.0%。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv cs.SD RSS · arxiv.org