跳到正文
原文
arXiv · Artificial Intelligence· Harry Lyu, Neil Thompson·· 16 小时前AI 评分41

排序正确,尺度错误:审计 LLM 评委的职业 AI 测量

Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement

AI 导读

研究推出 O*NET-BENCH,基于 45,796 条工人评分构建,在 4,501 条测试评分上评估 33 个评委配置(覆盖六个模型族)。25 个配置的 tie-aware pair accuracy 至少 0.60,但评委估计 3.0%-97.9% 的回复可接受,远偏离职业匹配工人的 61.1%。校准后分数最多解释 8.5% 的个体评分方差,排序一致不足以支撑职业测量。

来源:arXiv · Artificial Intelligence · arxiv.org