跳到正文
原文
arXiv cs.SD RSS·· 3 小时前

CARD:面向无编码器音频描述任务的跨组件音频表征蒸馏

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

摘要

CARD 是一种无编码器音频描述模型,推理时移除音频编码器,由 13.2M 投影器向冻结 LLM 馈入合并 LoRA 适配器,训练用教师模型随后丢弃。它将预训练音频教师 CLAP-HTSAT 的表征跨组件路由:感知阶段送入投影器,语义阶段送入 LLM。

应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。

来源:arXiv cs.SD RSS · arxiv.org