arXiv · Audio and Speech· Lukuan Dong, Ziwei Li, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou·· 3 小时前AI 评分17
多语言语音识别中基于 LLM 的音素到字素映射研究
Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition
AI 导读
研究在十语言 CV-Lang10 基准上探索多语言 LLM 音素到字素(P2G)映射,以应对语言感知生成与跨语言数据失衡。论文评估 DANP 与简化 SKM(S-SKM)等考虑 S2P 不确定性的鲁棒训练策略,S-SKM 以蒙特卡洛近似避免 P2G 训练中基于 CTC 的 S2P 概率加权。结合鲁棒训练与低资源过采样,平均 WER 从 10.56% 降至 7.66%。
来源:arXiv · Audio and Speech · arxiv.org