arXiv · Artificial Intelligence· Andre Fu, Malik Drabla, Leon Liu, Meji Abidoye, Marek Suppa, Lata Mishra, Adnan El Assadi, Yiyuan Li·· 3 hr agoSelectedAI score62
Incident-Arena:让智能体达到可靠性最后九分钟
Incident-Arena: Getting agents to the last nine of reliability
AI brief
论文提出 Incident-Arena,一个包含 20 个真实生产场景任务的人类构建基准,覆盖配置层、镜像层和负载注入的 Kubernetes 故障响应。智能体平均消耗 2.81M tokens 和 41 轮,前沿模型在 3 类应用上得分低于 64.3%,失败集中在诊断定位、修复不完整和不安全回归。
Why it matters
基准揭示前沿模型在生产故障响应中仍有显著短板,为评估智能体长期推理能力提供了更贴近真实的测试环境。
Source: arXiv · Artificial Intelligence · arxiv.org