跳到正文
原文
AI Snake Oil· Sayash Kapoor·· 2026-02-24精选AI 评分78

新论文:迈向AI智能体可靠性科学

New Paper: Towards a science of AI agent reliability

AI 导读

Stephan Rabanser、Sayash Kapoor与Arvind Narayanan发布论文《Towards a Science of AI Agent Reliability》,将可靠性分解为12个维度,并在GAIA与TauBench两个互补基准上评测了14个模型,发现近18个月能力快速提升但可靠性改善有限。

推荐理由

论文将可靠性分解为12个维度并评测14个模型,揭示能力提升与可靠性进步不匹配,对部署者和研究者提出具体改进方向。

来源:AI Snake Oil · normaltech.ai