arXiv · Machine Learning Theory· Yifan Zhang·· 4 hr agoAI score38
KL 正则化策略优化研究:提出 KLPO 框架
On KL-Regularized Policy Optimization
AI brief
研究提出 KL 正则化策略优化(KLPO)框架,将 KL 正则项锚定在采样器上,正则化改进步具有闭式 Gibbs 解,并通过最小二乘拟合对数比最优性条件,无需重要性权重。
Source: arXiv · Machine Learning Theory · arxiv.org