arXiv · Computation and Language· Mingqing Yuan (Soochow University), Xiaobo Liang (Soochow University), Junwei Yang (University of Cambridge), Ziwei Chen (Chalmers University of Technology), Zeren Zhang (Peking University), Hejin Wang (Tsinghua University), Yubin Wang (The Hong Kong University of Science,Technology), Juntao Li (Soochow University)·· 4 hr agoAI score39
LatentGRM:在潜在空间中进行评判,通过语义保持压缩实现高效生成式奖励建模
Judging in Latent Space: Efficient Generative Reward Modeling via Semantics-Preserving Compression
AI brief
LatentGRM 是一种基于语义分块、压缩与重建的潜在评估框架,可在不生成文本评估的情况下完成自主成对判断。在匹配训练数据与骨干模型条件下,其 4B 与 8B 规模相对显式 SFT 评判器取得有竞争力的偏好准确率;在四个基准域上,LatentGRM-8B 将评估轨迹压缩 8.9–9.2 倍,vote@5 下总评判推理时间降低 6.1–7.0 倍。
Source: arXiv · Computation and Language · arxiv.org