arXiv · Statistics Machine Learning· Nam Nguyen, Tuan Quang Dam·· 3 小时前AI 评分12
$\beta$-EB-TCI 惩罚挑战者的尖锐非渐近分析:伯努利多臂老虎机固定置信最佳臂识别
Sharp Non-Asymptotic Analysis of the Penalized Challenger in $\beta$-EB-TCI for Bernoulli Bandits
AI 导读
summary_zh: 该研究针对伯努利多臂老虎机的固定置信最佳臂识别问题,分析了 $\beta$-EB-TCI 算法的尖锐非渐近行为。在经验最优臂成为真实最优臂且采样比例稳定在 $\beta$ 附近时,停止时间为 $T_{\beta}^{\star}(\mu)\log(1/\delta)$,且每个挑战者均被线性采样。
来源:arXiv · Statistics Machine Learning · arxiv.org