DeepSpeed·· 2023-09-12AI 评分39
DeepSpeed ZeRO-Inference:通过权重量化与 KV cache 卸载实现 20 倍推理加速
Zero Inference
AI 导读
DeepSpeed 发布 ZeRO-Inference,通过权重量化与 KV cache 卸载实现 20 倍推理加速。该技术针对大语言模型推理优化,支持量化与卸载策略以降低显存占用。未在原文中给出具体模型版本、benchmark 分数、API 或开源信息。
来源:DeepSpeed · deepspeed.ai