arXiv · Computation and Language· Puneet Mathur, Dinesh Manocha·· 3 小时前AI 评分39
FD-VAD:流式全双工语音的语义端点检测
FD-VAD: Semantic Endpoint Detection for Streaming Full-Duplex Speech
AI 导读
FD-VAD 是一种无需 ASR 的流式语义端点检测模型,将有界因果音频窗口直接映射为 Continue/Stop 决策,在 TurnBench dev 集上以零样本方式达到 EOT 召回率 0.853(FP<=0.10)。模型融合冻结语音编码器、轻量模态适配器与参数高效适配的语言模型,采用末段训练目标与置信度门控端点提交机制,在领域内和对话评测中均优于强基线。
来源:arXiv · Computation and Language · arxiv.org