Skip to content
arXiv · Machine Learning Theory· Yifan Zhang·· 4 hr agoAI score38

KL 正则化策略优化研究:提出 KLPO 框架

On KL-Regularized Policy Optimization

AI brief

研究提出 KL 正则化策略优化(KLPO)框架,将 KL 正则项锚定在采样器上,正则化改进步具有闭式 Gibbs 解,并通过最小二乘拟合对数比最优性条件,无需重要性权重。

Source: arXiv · Machine Learning Theory · arxiv.org