arXiv · Machine Learning Theory· Yifan Zhang·· 3 小时前AI 评分38
KL 正则化策略优化研究:提出 KLPO 框架
On KL-Regularized Policy Optimization
AI 导读
研究提出 KL 正则化策略优化(KLPO)框架,将 KL 正则项锚定在采样器上,正则化改进步具有闭式 Gibbs 解,并通过最小二乘拟合对数比最优性条件,无需重要性权重。
来源:arXiv · Machine Learning Theory · arxiv.org