跳到正文
原文
arXiv · Machine Learning Theory· Heng Liang, Xinwen Zhang, Hongchang Gao·· 3 小时前AI 评分27

BiToK-SD:用双层 Top-K token 选择改进大语言模型自蒸馏

Learning What to Distill: Bilevel Top-K Token Selection for Self-Distillation in Large Language Models

AI 导读

研究者提出 BiToK-SD(Bilevel Top-K Token Selection for Self-Distillation),一种基于双层优化的 token 选择方法,用于在 on-policy 自蒸馏中学习应在哪些位置施加蒸馏。

来源:arXiv · Machine Learning Theory · arxiv.org