arXiv cs.SD RSS·· 3 小时前
Q-SPT:面向低帧率语音标记化的可学习查询压缩方法
Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization
摘要
Q-SPT 是一种低帧率双流语音标记器,为语义和声学表示分别配备上下文感知的可学习查询压缩器,查询以固定速率独立关注两路流作为键值源。该方法还引入自回归文本损失显式监督语义压缩器以保留语言信息。实验显示,在相同帧率下 Q-SPT 的重建效果优于所评估的编解码器,在下游 SLM 中取得最佳语音识别准确率和文本转语音感知质量,可懂度具竞争力。
应来源方要求,这里只提供摘要与原文入口。完整内容请阅读原文。
来源:arXiv cs.SD RSS · arxiv.org