Safe Meta-Policy Design with Risk Control
Get the story
2026年10月8日,arXiv(Statistics Machine Learning,一手来源)发表论文《Safe Meta-Policy Design with Risk Control》,提出一种安全元策略设计方法:在模型随新数据重训之前先规划策略更新,以平衡改进收益与性能回退风险。该方法为离线元策略,在预期劣于被替换策略的更新次数预算约束下最大化期望累计价值;具体通过历史学习轨迹估计每次切换的价值与风险,用有向无环图表示更新计划,并以动态规划选取更新方案。论文的领先阶分析指出,策略改进的信噪比决定更新频率、等待时间与风险分配;合成数据与临床试验数据实验验证了性能—风险权衡。
Generated from reports · updated 3 hr ago
Timeline
Follow the coverage from different angles.
- arXiv · Statistics Machine LearningSafe Meta-Policy Design with Risk Control
论文提出一种安全元策略设计方法,在模型随新数据重训前规划策略更新,平衡改进收益与性能回退风险。该离线元策略在预期劣于被替换策略的更新次数预算约束下最大化期望累计价值,通过历史学习轨迹估计切换的价值与风险,用有向无环图表示更新计划并以动态规划选取。领先阶分析指出策略改进的信噪比决定更新频率、等待时间与风险分配,合成数据与临床试验数据实验验证了性能—风险权衡。
Heat trend
Current heat 9·Comparable peak 10(Oct 8)·Comparable change over 24 hours –
The trend compares only the same participants observed continuously; its range may be smaller than the current heat count. Move or click on the chart to inspect hourly heat; use the left and right arrow keys to switch.