AIHub· Lucy Smith·· 20 天前AI 评分35
大规模推荐系统早期检索的改进:Haruka Kiyohara 访谈
Improving the process for large-scale recommender systems: an interview with Haruka Kiyohara
AI 导读
Haruka Kiyohara 等研究者提出 Credit-assigned Policy Gradient(CA-PG)方法,用于优化大规模推荐系统中两阶段排序的早期检索策略。传统早期检索策略训练依赖监督学习,存在位置偏差导致奖励回归对齐失效的问题,且端到端训练面临探索困难与奖励信号稀疏的挑战。CA-PG 通过仅对产生高奖励的候选 item 分配梯度信用,降低方差并提升早期策略训练效率。
来源:AIHub · aihub.org