arXiv · Computation and Language· Ian Arawjo·· 7 小时前AI 评分58
evalstats:如何对 LLM 评判做统计推断并信任结果
How to Run Statistics over LLM Judges and Trust the Results: Calibrated Inference for Small-Sample AI Evaluation with evalstats
AI 导读
论文提出 evalstats 开源 Python 包,用于在小样本 AI 评测中对 LLM 评判分数做校准推断。研究发现直接对原始评判分数统计会导致假阳性膨胀,尤其在人类与 LLM 评判接近完全一致时风险最高;作者通过预测驱动推断(PPI)实现 9 种假设检验,并引入 bootstrap-adaptive power tuning 以稳定小规模标注校准集。
来源:arXiv · Computation and Language · arxiv.org