跳到正文
热点事件持续更新

PADMÉ:偏好对齐数据合成用于LM智能体评估器的元评估

1 篇报道1 个报道来源6 小时前更新

先了解这件事

AI 综述

2026-09-30,arXiv 发表 Computation and Language 论文 PADMÉ,提出一种基于偏好判断的元评估数据合成方法,仅依赖小语言模型、无需人工参与,在低计算预算下运行。研究者在四个 Agent 领域和三个评估标准上合成 1,000 个样本,150 个人工验证样本显示与人类判断的一致性由 73% 提升至 85%。利用该数据集对 25 个常用模型进行元评估,揭示评估性能与评分粒度、宽容度及模型规模等因素之间的相关性。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

9月30日
  1. arXiv · Computation and Language
    PADMÉ:用于 LM Agent 评估器元评估的偏好对齐数据合成方法

    PADMÉ 是一种基于偏好判断的元评估数据合成方法,仅使用小语言模型,无需人工参与评估,在低计算预算下运行。研究者在四个 Agent 领域和三个评估标准上合成了 1,000 个样本,150 个样本的人工验证显示其与人类判断的一致性从 73% 提升至 85%。用该数据集元评估 25 个常用模型,揭示了评估性能与评分粒度、宽容度和模型规模等因素之间的相关性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。