跳到正文
原文
arXiv · Audio and Speech· Ryo Magoshi, Shinsuke Sakai, Tatsuya Kawahara·· 3 小时前AI 评分24

面向基于 LLM 的语音识别的音素引导初始化方法

Phoneme-Guided Initialization for LLM-based Speech Recognition

AI 导读

论文提出音素引导初始化方法,在端到端框架内先分别预训练音频编码器完成语音到音素(S2P)转换、LLM 完成音素到字素(P2G)转换,再连接并端到端微调。在日语 CSJ、中文 AISHELL-1 及 Common Voice 25.0 的 Tatar 和 Urdu 低资源语言上,该方法匹配或优于级联 S2P-P2G 基线和无 P2G 初始化的端到端模型。论文已被 IEEE SLT 2026 接收。

来源:arXiv · Audio and Speech · arxiv.org