arXiv · Audio and Speech· Nikita Torgashov, Okan K\"op\"ukl\"u·· 21 小时前AI 评分35
FASTDIAR:面向流式说话人日志的帧级说话人编码器
FASTDIAR: Frame-level speaker encoder for Streaming Diarization
AI 导读
FASTDIAR 把一个 state-of-the-art 说话人识别架构改造成因果帧级编码器,从两秒有界历史音频窗口中每 80 ms 输出一个嵌入,并配合以流自相似性为门控的在线聚类。
来源:arXiv · Audio and Speech · arxiv.org