跳到正文
原文
arXiv · Artificial Intelligence· Yixuan Li, Yiyun Zhou, Yao Long Teng, Fuchao Yang, Yanchen Deng, Zhiyi Lyu, Xuyu Dong, Feng Chen, Bo An·· 2 小时前精选AI 评分79

Finding the Right Fit: Model-Harness Interactions across Agent Tasks

Finding the Right Fit: Model-Harness Interactions across Agent Tasks

AI 导读

论文评估了 66 种配置:4 个可配置 harness(OpenHands、DeepSeek Harness、PI、openJiuwen)与 5 个模型在 TUA-Bench、ALE-CLI、Terminal-Bench 4 上的表现,另含 Codex-GPT 与 Claude Code-Claude 原生配对。

推荐理由

同一模型在不同 harness 下排名可逆转,读者可据此判断选型不能只看模型本身。

来源:arXiv · Artificial Intelligence · arxiv.org