arXiv · Statistics Machine Learning· Wenbin Zhou, Michael Lingzhi Li, Shixiang Zhu·· 4 hr agoAI score25
Safe Meta-Policy Design with Risk Control
Safe Meta-Policy Design with Risk Control
AI brief
论文提出一种安全元策略设计方法,在模型随新数据重训前规划策略更新,平衡改进收益与性能回退风险。该离线元策略在预期劣于被替换策略的更新次数预算约束下最大化期望累计价值,通过历史学习轨迹估计切换的价值与风险,用有向无环图表示更新计划并以动态规划选取。领先阶分析指出策略改进的信噪比决定更新频率、等待时间与风险分配,合成数据与临床试验数据实验验证了性能—风险权衡。
Source: arXiv · Statistics Machine Learning · arxiv.org