arXiv cs.SD RSS·· 3 小时前
用直接偏好优化改进 Audio LLM 的英汉混说语音识别
Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs
摘要
针对 Audio LLM 在英汉混说语音转写中出现的语言遗漏、翻译替代转写和幻觉三类失败模式,研究者采用直接偏好优化(DPO)对齐模型,构造保留混说内容为正例、模仿失败模式为负例的偏好对。在 10 万对(570 小时)数据上训练三个 Audio LLM 后,模型更倾向于保留语言构成而非翻译,分布内 MER 最多降低 89.6%,分布外降低 20.0%。
应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv cs.SD RSS · arxiv.org