arXiv · Audio and Speech· Haolong Zheng, Maike Z\"ufle, Dominik Mach\'a\v{c}ek, Peter Pol\'ak, Xulin Fan, Xavier Sumba, Siyin Wang, Ond\v{r}ej Klejch, Mark Hasegawa-Johnson·· 3 小时前AI 评分37
SteerablePlex:全双工语音模型能被引导吗?
SteerablePlex: Can We Steer Full-Duplex Models?
AI 导读
研究提出 SimIF-Bench,用于评测对话模型是否能在规定场景内按顺序完成多个目标,结果显示当前开源全双工模型难以遵循此类约束。团队进一步提出基于 GDPO 的训练方法,让全双工模型在保持轮次切换能力的同时遵循文本指令,生成 SteerablePlex。连接异步后端语言模型后,其多阶段约束遵循能力优于现有开源模型和 GPT-Realtime。
来源:arXiv · Audio and Speech · arxiv.org