跳到正文
原文
arXiv · Statistics Machine Learning· Ian Osband·· 16 小时前AI 评分37

Planning to Learn:把策略梯度按剩余学习量截断的 horizon loss

Planning to Learn

AI 导读

论文提出 horizon loss,把精确策略梯度按剩余学习量截断,介于交叉熵与零时域极限之间。分类器期望奖励即期望准确率,精确策略梯度虽无探索、信用分配与动作采样噪声,却因短视而输给交叉熵。MNIST 与 ImageNet 上 ResNet-50、ResNet-101、ViT-S/16 在固定学习率下 top-1 准确率提升,标签噪声越大增益越明显。

来源:arXiv · Statistics Machine Learning · arxiv.org