Skip to content
arXiv · Machine Learning Theory· Shripad V. Deshmukh, Yaswanth Chittepu, Dhawal Gupta, Philip Thomas, Scott Niekum·· 4 hr agoAI score39

Convex-Concave Reinforcement Learning:把策略优化重构为 DC 约束 DC 规划

Convex-Concave Reinforcement Learning

AI brief

论文提出 Convex-Concave RL(CCRL),在 log-density-ratio 坐标下把逐迭代目标表示为 difference-of-convex-constrained difference-of-convex 规划,并用 sequential convex programming 求解、给出收敛保证。

Source: arXiv · Machine Learning Theory · arxiv.org