跳到正文
热点事件持续更新

ASR非语言发声建模研究提出三种策略

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月8日,arXiv平台Audio and Speech栏目发布一手研究论文《Beyond Words:ASR中非语言发声的有效建模》。研究针对自动语音识别(ASR)中非语言发声(NVs,如笑声、呼吸、咳嗽、哭声)的建模问题,提出三种数据中心策略:一是两阶段课程学习,先将模型映射到通用token,再在目标类别上微调;二是token间迁移,从高资源事件(笑声、呼吸)向稀有事件(哭泣)迁移;三是带类别平衡的语音转换增强。论文目前仅公开上述方法框架,未披露实验数据或进一步验证结果。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv · Audio and Speech
    Beyond Words:ASR 中非语言发声的有效建模

    研究提出三种数据中心策略提升 ASR 对非语言发声(NVs,如笑声、呼吸、咳嗽、哭声)的识别:两阶段课程学习(先映射到通用 token 再在目标类别上微调)、从高资源事件(笑声、呼吸)向稀有事件(哭泣)的 token 间迁移,以及带类别平衡的语音转换增强。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。