Skip to content
Hot eventLive

Q-SPT:基于可学习查询的低帧率语音 Tokenizer 压缩方法

1 reports1 sources3 hr ago updated

Get the story

AI overview

Q-SPT 提出一种低帧率双流语音 Tokenizer,分别对语义和声学表示进行上下文感知的可学习查询压缩,并通过自回归文本损失监督语义压缩器以保留语言信息。实验显示,在相同帧率下 Q-SPT 的重建质量最优,下游 SLM 的语音识别准确率和 TTS 感知质量最佳,且可懂度具有竞争力。

Generated from reports · updated 2 hr ago

Timeline

Follow the coverage from different angles.

Oct 2, 2026
  1. arXiv · Audio and Speech
    Q-SPT:基于可学习查询的低帧率语音 Tokenizer 压缩方法

    Q-SPT 提出一种低帧率双流语音 Tokenizer,分别对语义和声学表示进行上下文感知的可学习查询压缩,并通过自回归文本损失监督语义压缩器保留语言信息。实验表明,在相同帧率下 Q-SPT 的重建质量最优,下游 SLM 的语音识别准确率和 TTS 感知质量最佳,且可懂度具有竞争力。

Heat trend

There is not enough continuous observation data to draw a trend yet.