跳到正文
原文
DeepSpeed·· 2023-09-12AI 评分39

DeepSpeed ZeRO-Inference:通过权重量化与 KV cache 卸载实现 20 倍推理加速

Zero Inference

AI 导读

DeepSpeed 发布 ZeRO-Inference,通过权重量化与 KV cache 卸载实现 20 倍推理加速。该技术针对大语言模型推理优化,支持量化与卸载策略以降低显存占用。未在原文中给出具体模型版本、benchmark 分数、API 或开源信息。

来源:DeepSpeed · deepspeed.ai