arXiv · Machine Learning Theory· Ali Aouad, Aymane El Gadarri, Vivek F. Farias·· 3 小时前AI 评分37
重新审视奖励优化的缩放定律
Revisiting scaling laws for reward optimization
AI 导读
论文提出奖励优化性能的缩放定律 $\Theta(\sqrt{\min\{\log(M),K\}})$,其中 $M$ 为训练数据中的比较次数,$K$ 为 KL 散度预算,拟合优度 $R^2$ 达 97%–99%。
来源:arXiv · Machine Learning Theory · arxiv.org