arXiv · Machine Learning Theory· Shripad V. Deshmukh, Yaswanth Chittepu, Dhawal Gupta, Philip Thomas, Scott Niekum·· 4 小时前AI 评分39
Convex-Concave Reinforcement Learning:把策略优化重构为 DC 约束 DC 规划
Convex-Concave Reinforcement Learning
AI 导读
论文提出 Convex-Concave RL(CCRL),在 log-density-ratio 坐标下把逐迭代目标表示为 difference-of-convex-constrained difference-of-convex 规划,并用 sequential convex programming 求解、给出收敛保证。
来源:arXiv · Machine Learning Theory · arxiv.org