跳到正文
原文
arXiv · Computation and Language· Vaishnav Negi, Lev Sorokin, Soroosh Tayebi Arasteh, Andrea Stocco·· 7 小时前AI 评分35

车载对话助手多轮对话自动评估框架

Automated Evaluation of Multi-Turn Dialogues in In-Car Conversational Assistants

AI 导读

提出一种针对车载对话助手(ICA)的自动化多轮对话测试框架,通过闭环模拟、策略引导用户模拟器与对抗策略管理器,结合两级LLM裁判评估轮次失败与对话质量。在工业ICA上验证,自动化裁判与人类标注高度一致,策略引导每轮对话发现的独特失败类型提升2.96倍,失败对话数翻倍以上。

来源:arXiv · Computation and Language · arxiv.org