跳到正文
原文
Google Research·· 2026-04-01精选AI 评分62

构建更好的 AI 基准:多少标注者才够用?

Building better AI benchmarks: How many raters are enough?

AI 导读

Google Research 提出森林与树的(N,K)权衡框架,研究在固定预算下标注条目数与每条目标注者数量的最优配比。实验基于毒性、DICES、D3code、Jobs 等真实主观数据集,发现每条目 3–5 个标注者常不足、多数票用广度策略、意见分布用深度策略,并开源了模拟器。

推荐理由

给出了(N,K)权衡的模拟框架和开源工具,读者可据此在有限预算下设计更可复现的评估方案。

来源:Google Research · research.google