Skip to content
arXiv · Artificial Intelligence· Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi·· 8 hr agoSelectedAI score67

VAmoS Part Deux:更难、更真实的语音智能体模拟基准

VAmoS Part Deux: Harder, More Realistic Voice-Agent Simulation

AI brief

论文提出 VAmoS Energy 基准,在100个公用事业账单与支付协助通话中测试语音智能体处理多请求、背景语音和用户耐性的能力。智能体拥有16个工具并由 Stripe 账单孪生与 Apache Fineract 引擎支撑,通话需通过验证才能访问账户;LLM-as-a-verifier 与代码验证器一致率为99.1%。

Why it matters

背景电视噪声使完成率从38.7%骤降至8.6%,揭示语音智能体在真实噪声环境中仍存在显著脆弱性。

Source: arXiv · Artificial Intelligence · arxiv.org