arXiv · Machine Learning Theory· Nilushika Udayangania, Kishor Nandakishora, Marimuthu Palaniswami·· 4 hr agoAI score21
Learning to Remember:为紧凑型循环神经网络蒸馏记忆保持能力
Learning to Remember: Distilling Memory Retention for Compact Recurrent Neural Networks
AI brief
一篇 arXiv 预印本提出 Memory-Discrepancy Knowledge Distillation(MemKD)框架,用专门损失函数捕捉教师与学生模型在时间序列子序列间的记忆保持差异。实验显示 MemKD 显著优于现有 KD 方法,并可在多种压缩级别下匹配教师模型性能,大幅减少参数量与内存占用且不明显损失精度。
Source: arXiv · Machine Learning Theory · arxiv.org