arXiv · Audio and Speech· Jeeyoung Yun, Seohwan Yun, Sungwoong Kim·· 3 小时前AI 评分26
Q-SPT:基于可学习查询的低帧率语音 Tokenizer 压缩方法
Q-SPT: Learnable Query-Based Compression for Low-Frame-Rate Speech Tokenization
AI 导读
Q-SPT 提出一种低帧率双流语音 Tokenizer,分别对语义和声学表示进行上下文感知的可学习查询压缩,并通过自回归文本损失监督语义压缩器保留语言信息。实验表明,在相同帧率下 Q-SPT 的重建质量最优,下游 SLM 的语音识别准确率和 TTS 感知质量最佳,且可懂度具有竞争力。
来源:arXiv · Audio and Speech · arxiv.org