arXiv · Computation and Language· Baohang Li, Xiaocheng Feng, Yichong Huang, Chengpeng Fu, Wenshuai Huo, Zekun Zhou, Zekun Yuan, Tingjia Zhang, Bing Qin·· 16 小时前AI 评分28
Adaptive Mutual Distillation:用于大语言模型均衡多任务后训练
Adaptive Mutual Distillation for Balanced Multi-Task Post-Training of Large Language Models
AI 导读
提出 Adaptive Mutual Distillation(AMD)框架,联合训练两个采用不同任务均衡策略的大语言模型,并用任务级验证分数按任务和迁移方向选择蒸馏权重。在六个基准和三个 LLM 骨干上,两个 AMD 模型的平均分数均超过同采样策略的 SFT 基线及现有任务均衡方法;合并两模型后较 multi-task SFT 平均提升 2.91 分。
来源:arXiv · Computation and Language · arxiv.org