Skip to content
Google Research·· Apr 1SelectedAI score62

构建更好的 AI 基准:多少标注者才够用?

Building better AI benchmarks: How many raters are enough?

AI brief

Google Research 提出森林与树的(N,K)权衡框架,研究在固定预算下标注条目数与每条目标注者数量的最优配比。实验基于毒性、DICES、D3code、Jobs 等真实主观数据集,发现每条目 3–5 个标注者常不足、多数票用广度策略、意见分布用深度策略,并开源了模拟器。

Why it matters

给出了(N,K)权衡的模拟框架和开源工具,读者可据此在有限预算下设计更可复现的评估方案。

Source: Google Research · research.google