arXiv · Statistics Machine Learning· Zihan Shen, Qi Liu, Zixuan Yang, Yiqun Chen, Chenglong Zhao, Xiaozhao Wang, Lei He·· 3 小时前AI 评分35
MatrixReward:基于评分矩阵构建开放式生成奖励机制
MatrixReward: Reward from Rubric Matrix for Open-Ended Generation
AI 导读
MatrixReward 通过逐条 rubric 的 pairwise 比较构建 rollout-by-rubric win-rate 矩阵,利用列间区分度和相关性计算数据依赖的 rubric 权重,并结合先验权重经列归一化后定义正负理想轮廓,以相对接近度作为质量奖励。
来源:arXiv · Statistics Machine Learning · arxiv.org