跳到正文
原文
Lilian Weng·· 2023-01-11AI 评分36

大型 Transformer 模型推理优化

Large Transformer Model Inference Optimization

AI 导读

summary_zh: 大型 Transformer 模型推理面临高内存占用与自回归解码难以并行两大瓶颈,KV 缓存随序列长度二次增长。文章重点介绍网络压缩(剪枝、量化、蒸馏)与架构改进两类优化手段,并以 DistilBERT 为例说明蒸馏可减少 40% 参数同时保持 97% 性能、运行速度提升 71%。

来源:Lilian Weng · lilianweng.github.io