arXiv · Audio and Speech· Shaole Li, Siqing Qin, Youzhi Tu, Kong Aik Lee·· 3 小时前AI 评分28
DuRe-ST:用于语音深度伪造检测的双关系谱时建模
DuRe-ST: Dual-Relation Spectro-Temporal Modeling for Speech Deepfake Detection
AI 导读
研究者提出语音深度伪造检测模型 DuRe-ST,联合利用协方差诱导关系与图注意力关系,捕捉互补的二阶共变与自适应谱时依赖。在 ASVspoof 基准上相对 XLSR-AASIST 平均 EER 降低 25.9%,四个跨数据集基准降低 28.4%,仅增加 4-8k 可训练后端参数;在四个基准上相对 EER 优于最强公开对比模型 2.2-13.2%,且规模更小。
来源:arXiv · Audio and Speech · arxiv.org