arXiv · Computation and Language· Cheng Chang, Yining Mao, Peng Qi·· 5 小时前AI 评分38
PADMÉ:用于 LM Agent 评估器元评估的偏好对齐数据合成方法
PADM\'E: Preference Alignment Data Synthesis for Meta-Evaluation of LM Agent Evaluators
AI 导读
PADMÉ 是一种基于偏好判断的元评估数据合成方法,仅使用小语言模型,无需人工参与评估,在低计算预算下运行。研究者在四个 Agent 领域和三个评估标准上合成了 1,000 个样本,150 个样本的人工验证显示其与人类判断的一致性从 73% 提升至 85%。用该数据集元评估 25 个常用模型,揭示了评估性能与评分粒度、宽容度和模型规模等因素之间的相关性。
来源:arXiv · Computation and Language · arxiv.org