arXiv · Artificial Intelligence· Michael Hardy, Ruhana Azam, Anka Reuel, Mykel Kochenderfer, Sanmi Koyejo·· 3 hr agoSelectedAI score72
Agent 评测可靠性:更多任务未必能修复排行榜
Agent Evaluation Reliability: More Tasks Won't (Always) Fix An Agent Leaderboard
AI brief
论文提出贝叶斯方差分解框架,分析 22 个智能体排行榜,发现评测可靠性依赖测量目标:固定模型-支架系统可靠性 0.935-0.994,底层模型仅 0.148-0.841;支架选择会改变结论;无限增加同类任务最多提升 0.097;池化多样 benchmark 可将跨任务可靠性从 0.44 提升至 0.75,成本最高降 83%。
Why it matters
研究指出智能体评测的可靠性取决于目标,固定模型-支架系统排名稳定,但底层模型排名可靠性低,且增加任务数未必能解决问题。
Source: arXiv · Artificial Intelligence · arxiv.org