跳到正文
原文
AIHub· Iheb Bouriel·· 5 天前AI 评分59

混合LLM压缩中的交互效应:压缩技巧并非简单叠加

When compression techniques don’t just add up: Interaction effects in hybrid LLM compression

AI 导读

研究在RTX 3080 Ti上测试Falcon3-1B、LLaMA-3.2-1B和Qwen2.5-1.5B的组合剪枝与量化,发现混合压缩在TruthfulQA上超出预期约7-14点,但在GSM8K和MMLU上反而下降16-20点,部分设置下GSM8K准确率降至零;效应在中等剪枝(20-30%)最明显,50%剪枝时减弱,量化单独使用即可实现约2-3倍内存缩减。

来源:AIHub · aihub.org