arXiv · Audio and Speech· Mohan Shi, Ruchao Fan, Sunit Sivasankaran, Keqi Deng, Jinyu Li·· 3 小时前AI 评分38
教大语言模型识别说话人:Metadata-Supervised Pretraining 用于无编码器语音-LLM
Teaching LLMs to Hear Who Spoke What: Metadata-Supervised Pretraining for Encoder-Free Speech-LLMs
AI 导读
论文提出 metadata-supervised pretraining(MSP),利用说话人身份和情感等语音属性训练无编码器 Speech-LLM,并引入 speaker-aware utterance composition(SAUC)和随机跨度掩码正则化。
来源:arXiv · Audio and Speech · arxiv.org