跳到正文
原文
arXiv · Computation and Language· Jingxuan Wu, Yuzhe Yang, Yiqiao Huang, Chengzhi Liu, Qingni Wang, Chengxuan Qian, Shutong Wu, Jiawei Zhang, Xin Eric Wang·· 7 小时前AI 评分40

MemFold:通过在线策略优化学习紧凑软记忆以实现长上下文个性化

MemFold: Learning Compact Soft Memory for Long-Context Personalization via On-Policy Optimization

AI 导读

MemFold 将查询条件化的文本记忆压缩为 K 个连续向量作为记忆接口,通过组相对奖励和置信门控的在线策略蒸馏进行训练。教师模型从不采样,推理时完全移除。在 Qwen 三个骨干网络上,MemFold 在 PersonaMem-32K 和 PersonaMem-128K 上达到最高准确率,且迁移到 PrefEval 和 LongMemEval 无需目标域训练。

来源:arXiv · Computation and Language · arxiv.org