arXiv · Artificial Intelligence· Yixuan Li, Yiyun Zhou, Yao Long Teng, Fuchao Yang, Yanchen Deng, Zhiyi Lyu, Xuyu Dong, Feng Chen, Bo An·· 2 小时前精选AI 评分79
Finding the Right Fit: Model-Harness Interactions across Agent Tasks
Finding the Right Fit: Model-Harness Interactions across Agent Tasks
AI 导读
论文评估了 66 种配置:4 个可配置 harness(OpenHands、DeepSeek Harness、PI、openJiuwen)与 5 个模型在 TUA-Bench、ALE-CLI、Terminal-Bench 4 上的表现,另含 Codex-GPT 与 Claude Code-Claude 原生配对。
推荐理由
同一模型在不同 harness 下排名可逆转,读者可据此判断选型不能只看模型本身。
来源:arXiv · Artificial Intelligence · arxiv.org