arXiv · Computation and Language· Jingxuan Wu, Yuzhe Yang, Yiqiao Huang, Chengzhi Liu, Qingni Wang, Chengxuan Qian, Shutong Wu, Jiawei Zhang, Xin Eric Wang·· 7 小时前AI 评分40
MemFold:通过在线策略优化学习紧凑软记忆以实现长上下文个性化
MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization
AI 导读
MemFold 将查询条件化的文本记忆压缩为 K 个连续向量作为记忆接口,通过组相对奖励和置信门控的在线策略蒸馏进行训练。教师模型从不采样,推理时完全移除。在 Qwen 三个骨干网络上,MemFold 在 PersonaMem-32K 和 PersonaMem-128K 上达到最高准确率,且迁移到 PrefEval 和 LongMemEval 无需目标域训练。
来源:arXiv · Computation and Language · arxiv.org