跳到正文
原文
Lilian Weng·· 2018-01-23AI 评分22

多臂老虎机问题及其解法

The Multi-Armed Bandit Problem and Its Solutions

AI 导读

多臂老虎机问题是探索与利用权衡的经典模型,目标是最大化累积奖励并最小化遗憾。文章介绍了 ε-Greedy 算法和 Upper Confidence Bounds(UCB)等策略,通过实验估计动作价值并平衡随机探索与利用已知最优动作。算法实现位于 lilianweng/multi-armed-bandit。

来源:Lilian Weng · lilianweng.github.io