跳到正文
原文
arXiv · Audio and Speech· Mohan Shi, Ruchao Fan, Sunit Sivasankaran, Keqi Deng, Jinyu Li·· 3 小时前AI 评分38

教大语言模型识别说话人:Metadata-Supervised Pretraining 用于无编码器语音-LLM

Teaching LLMs to Hear Who Spoke What: Metadata-Supervised Pretraining for Encoder-Free Speech-LLMs

AI 导读

论文提出 metadata-supervised pretraining(MSP),利用说话人身份和情感等语音属性训练无编码器 Speech-LLM,并引入 speaker-aware utterance composition(SAUC)和随机跨度掩码正则化。

来源:arXiv · Audio and Speech · arxiv.org