arXiv · Audio and Speech· Haolong Zheng, Maike Z\"ufle, Dominik Mach\'a\v{c}ek, Peter Pol\'ak, Xulin Fan, Xavier Sumba, Siyin Wang, Ond\v{r}ej Klejch, Mark Hasegawa-Johnson·· 4 hr agoAI score37
SteerablePlex:全双工语音模型能被引导吗?
SteerablePlex: Can We Steer Full-Duplex Models?
AI brief
研究提出 SimIF-Bench,用于评测对话模型是否能在规定场景内按顺序完成多个目标,结果显示当前开源全双工模型难以遵循此类约束。团队进一步提出基于 GDPO 的训练方法,让全双工模型在保持轮次切换能力的同时遵循文本指令,生成 SteerablePlex。连接异步后端语言模型后,其多阶段约束遵循能力优于现有开源模型和 GPT-Realtime。
Source: arXiv · Audio and Speech · arxiv.org