跳到正文
原文
arXiv · Machine Learning Theory· Zhengyu Fang, Seoyeon Hong, Jie Yang, Muyang Li, Koyoshi Shindo, Brandon Joseph Lwowski, Jing Li·· 16 小时前AI 评分33

Latent-MOPD:潜空间多教师在策略蒸馏

Latent-MOPD: Latent Multi-Teacher On-Policy Distillation

AI 导读

Latent-MOPD 提出首个面向 LLM 的表示级多教师在策略蒸馏方法,通过教师的预测与隐藏状态整合多个专家模型,无需额外教师训练。在数学、代码与逻辑共九个基准上,Latent-MOPD 优于仅 token、仅表示与均匀平均基线,且与教师同参数量时在多数基准上超过各基准最佳教师。跨家族教师设置下同样优于两种单通道基线。

来源:arXiv · Machine Learning Theory · arxiv.org