arXiv · Artificial Intelligence· Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi·· 2 小时前精选AI 评分67
VAmoS Part Deux:更难、更真实的语音智能体模拟基准
VAmoS Part Deux: Harder, More Realistic Voice-Agent Simulation
AI 导读
论文提出 VAmoS Energy 基准,在100个公用事业账单与支付协助通话中测试语音智能体处理多请求、背景语音和用户耐性的能力。智能体拥有16个工具并由 Stripe 账单孪生与 Apache Fineract 引擎支撑,通话需通过验证才能访问账户;LLM-as-a-verifier 与代码验证器一致率为99.1%。
推荐理由
背景电视噪声使完成率从38.7%骤降至8.6%,揭示语音智能体在真实噪声环境中仍存在显著脆弱性。
来源:arXiv · Artificial Intelligence · arxiv.org