跳到正文
原文
arXiv · Databases· Gabriel Tomitsuka, Arman Raayatsanati, Emma Xing, Duke Gand, Joseph J Ma·· 5 小时前AI 评分59

Argo-Bench:面向企业级工作流的数据代理评估基准

Argo-Bench: Evaluating Data Agents on Enterprise-Scale Workflows

AI 导读

arXiv 论文 Argo-Bench 提出包含 210 个数据科学与分析任务的评估框架,基于纽约外卖平台 8100 万笔订单、235 张表、75 亿行的 ERP 仓库模拟真实企业场景。代理需在看不到真实状态的情况下重建事实并执行封禁欺诈账户、分配骑手激励预算等操作,14 个前沿与开源模型仅 34.8% 任务得分≥95,均分 59.5。代码、数据与网站链接见原文。

来源:arXiv · Databases · arxiv.org