跳到正文
原文
Lilian Weng·· 2021-09-24AI 评分33

如何在多 GPU 上训练超大模型?并行策略与内存优化方法

How to Train Really Large Models on Many GPUs?

AI 导读

summary_zh: 大模型训练面临 GPU 内存与计算时间瓶颈,需依赖并行策略扩展至多 GPU。数据并行通过梯度同步更新权重,模型并行将参数切分到不同设备,流水线并行则用微批次减少空闲等待。

来源:Lilian Weng · lilianweng.github.io