跳到正文
原文
arXiv · Machine Learning Theory· Ali Aouad, Aymane El Gadarri, Vivek F. Farias·· 3 小时前AI 评分37

重新审视奖励优化的缩放定律

Revisiting scaling laws for reward optimization

AI 导读

论文提出奖励优化性能的缩放定律 $\Theta(\sqrt{\min\{\log(M),K\}})$,其中 $M$ 为训练数据中的比较次数,$K$ 为 KL 散度预算,拟合优度 $R^2$ 达 97%–99%。

来源:arXiv · Machine Learning Theory · arxiv.org