arXiv · Multiagent Systems· Minki Kang, Ryo Hachiuma, Shaokun Zhang, Subhashree Radhakrishnan, Yonggan Fu, Jindong Jiang, Mingjie Liu, Ehsan Hosseini-Asl, Yi Dong, Yu-Chiang Frank Wang, Byung-Kwan Lee·· 8 hr agoSelectedAI score62
Mid-Harness:在模型与执行环境之间扩展动作以提升终端智能体可靠性
Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents
AI brief
该研究提出 Mid-Harness 方法,在模型生成动作后、执行前引入采样与验证环节,保持生成器和执行环境不变。实验显示,GPT-5.6 Sol 作为验证器时,Pass@1 从 50.00% 提升至 68.03%;TMAX-9B 自验证时成对验证效果最佳。将强验证器响应蒸馏到 TMAX-9B 后进一步提升 Pass@1,且动作与轨迹联合缩放能以更低 token 成本达到更高成功率。
Why it matters
论文提出在模型与执行环境之间引入验证环节,用更少的轨迹采样实现更高成功率,为终端智能体的测试时计算分配提供了新方向。
Source: arXiv · Multiagent Systems · arxiv.org