跳到正文
原文
arXiv · Audio and Speech· Gene-Ping Yang, Haibin Wu, Peng Su, Ruizhe Huang, Suwon Shon, Bach Do, Minxue Niu, Zhaoheng Ni, Shang-Wen Li, Florian Metze, Yossi Adi, Ming Sun, Yuzong Liu·· 4 小时前AI 评分24

Beyond Words:ASR 中非语言发声的有效建模

Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR

AI 导读

研究提出三种数据中心策略提升 ASR 对非语言发声(NVs,如笑声、呼吸、咳嗽、哭声)的识别:两阶段课程学习(先映射到通用 token 再在目标类别上微调)、从高资源事件(笑声、呼吸)向稀有事件(哭泣)的 token 间迁移,以及带类别平衡的语音转换增强。

来源:arXiv · Audio and Speech · arxiv.org