跳到正文
原文
Andrej Karpathy · Notes·· 2016-05-31AI 评分37

Deep Reinforcement Learning: Pong from Pixels

Deep Reinforcement Learning: Pong from Pixels

AI 导读

Andrej Karpathy 博客讲解策略梯度(Policy Gradients)算法,用 2 层神经网络从 Pong 游戏原始像素直接学习控制挡板。代码仅 130 行 Python,依赖仅 numpy,实现端到端强化学习。文中指出近期 RL 进展主要来自算力、数据和基础设施,而非算法突破。

来源:Andrej Karpathy · Notes · karpathy.github.io