Skip to content
arXiv · Audio and Speech· Lukuan Dong, Ziwei Li, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou·· 4 hr agoAI score17

多语言语音识别中基于 LLM 的音素到字素映射研究

Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition

AI brief

研究在十语言 CV-Lang10 基准上探索多语言 LLM 音素到字素(P2G)映射,以应对语言感知生成与跨语言数据失衡。论文评估 DANP 与简化 SKM(S-SKM)等考虑 S2P 不确定性的鲁棒训练策略,S-SKM 以蒙特卡洛近似避免 P2G 训练中基于 CTC 的 S2P 概率加权。结合鲁棒训练与低资源过采样,平均 WER 从 10.56% 降至 7.66%。

Source: arXiv · Audio and Speech · arxiv.org