跳到正文
原文
arXiv · Computation and Language· Yida Cai, Xin Dai, Bingxiang He, Huiyuan Xie, Yuxiao Ye, Zhenghao Liu, Yang Bai, Zhiyuan Liu·· 3 小时前AI 评分34

LexReward:面向法律语言模型的分层奖励框架

LexReward: A Taxonomy-Driven Reward Framework for Legal Language Models

AI 导读

LexReward 提出基于 Style、Element、Chain 三维的法律响应质量评估框架,为每个维度制定评分标准并生成配对偏好数据,用于 DPO 训练与奖励模型学习。实验表明该奖励信号能有效区分不同质量的法律回答,且 DPO 训练在三个维度上均提升性能;学习到的 LexRM 奖励模型可在强化学习中按维度优化策略,无需参考答案。

来源:arXiv · Computation and Language · arxiv.org