跳到正文
原文
Hugging Face Blog·· 2026-08-10精选AI 评分62

高效知识蒸馏:离线 Top-K Logits 与融合分块 KL 损失

Making Knowledge Distillation Cheap Enough to Run at Scale

AI 导读

Multiverse Computing 提出高效知识蒸馏方法,通过缓存教师模型 top-100 logits 与融合分块 KL 损失,避免构建全词汇表×序列矩阵,在单 H200 上把峰值显存从约 250GB 降至约 58GB,并在 32K 上下文下把蒸馏从四卡节点缩至单卡。代码已开源:github.com/CompactifAI/Full-Chunked-KL-Loss

推荐理由

通过缓存 top-K logits 与融合分块 KL 损失两条改动,把蒸馏显存占用压到单卡可跑,为长上下文蒸馏提供了可复现的低成本路径。

来源:Hugging Face Blog · huggingface.co