跳到正文
原文
arXiv · Audio and Speech· Nikita Torgashov, Okan K\"op\"ukl\"u·· 21 小时前AI 评分35

FASTDIAR:面向流式说话人日志的帧级说话人编码器

FASTDIAR: Frame-level speaker encoder for Streaming Diarization

AI 导读

FASTDIAR 把一个 state-of-the-art 说话人识别架构改造成因果帧级编码器,从两秒有界历史音频窗口中每 80 ms 输出一个嵌入,并配合以流自相似性为门控的在线聚类。

来源:arXiv · Audio and Speech · arxiv.org