跳到正文
原文
arXiv · Statistics Machine Learning· Tianxi Li, Jie Ding·· 3 小时前AI 评分28

AI 评委的可信模型比较:顺序、批次与聚合效应下的估计与设计

Trustworthy Method Comparison with AI Judges: Estimation and Design under Order, Batch, and Aggregation Effects

AI 导读

论文提出用一阶 Markov GLMM 近似 LLM 评估机制,并在三个主流商业 LLM 的样本外预测上得到支持。研究显示随机化-平均选择在 mild separation 条件下具有一致性,Williams square 设计可在项目质量接近时提升效率;分组比较中朴素平均会因响应模型非线性导致结论不一致。方法还应用于 AI 评委比较两种图模型估计方法。

来源:arXiv · Statistics Machine Learning · arxiv.org