热点事件持续更新
ASR非语言发声建模研究提出三种策略
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月8日,arXiv平台Audio and Speech栏目发布一手研究论文《Beyond Words:ASR中非语言发声的有效建模》。研究针对自动语音识别(ASR)中非语言发声(NVs,如笑声、呼吸、咳嗽、哭声)的建模问题,提出三种数据中心策略:一是两阶段课程学习,先将模型映射到通用token,再在目标类别上微调;二是token间迁移,从高资源事件(笑声、呼吸)向稀有事件(哭泣)迁移;三是带类别平衡的语音转换增强。论文目前仅公开上述方法框架,未披露实验数据或进一步验证结果。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
arXiv新论文提出三种策略提升ASR对笑声、呼吸、咳嗽等非语言发声的识别。报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv · Audio and SpeechBeyond Words:ASR 中非语言发声的有效建模
研究提出三种数据中心策略提升 ASR 对非语言发声(NVs,如笑声、呼吸、咳嗽、哭声)的识别:两阶段课程学习(先映射到通用 token 再在目标类别上微调)、从高资源事件(笑声、呼吸)向稀有事件(哭泣)的 token 间迁移,以及带类别平衡的语音转换增强。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。