Lilian Weng·· 2023-01-11AI 评分36
大型 Transformer 模型推理优化
Large Transformer Model Inference Optimization
AI 导读
summary_zh: 大型 Transformer 模型推理面临高内存占用与自回归解码难以并行两大瓶颈,KV 缓存随序列长度二次增长。文章重点介绍网络压缩(剪枝、量化、蒸馏)与架构改进两类优化手段,并以 DistilBERT 为例说明蒸馏可减少 40% 参数同时保持 97% 性能、运行速度提升 71%。
来源:Lilian Weng · lilianweng.github.io