arXiv · Machine Learning Theory· Heng Liang, Xinwen Zhang, Hongchang Gao·· 4 hr agoAI score27
BiToK-SD:用双层 Top-K token 选择改进大语言模型自蒸馏
Learning What to Distill: Bilevel Top-K Token Selection for Self-Distillation in Large Language Models
AI brief
研究者提出 BiToK-SD(Bilevel Top-K Token Selection for Self-Distillation),一种基于双层优化的 token 选择方法,用于在 on-policy 自蒸馏中学习应在哪些位置施加蒸馏。
Source: arXiv · Machine Learning Theory · arxiv.org