arXiv · Machine Learning Theory· Liv G. d'Aliberti, Marwa Abdulhai, Sofiia Druchyna, Peter Henderson, Manoel Horta Ribeiro·· 4 hr agoAI score49
RLVR 中解法模式坍缩的测量与缓解
Measuring and Mitigating Solution Mode Collapse in RLVR
AI brief
论文提出 ModeBench,一个同时返回正确性与所发现解法模式的基准,用于测量 RLVR 后训练中的解法多样性。结果显示 RLVR 后训练会把概率集中到更少的正确模式上,即使准确率保持或提升,前沿模型也已高度集中;为此提出 Re:Max,在回放缓冲区中为每个已发现模式存储一个已验证样本并均匀训练,在三个模型规模、两种 RL 目标与更难任务构造上同时提升策略成功率与成功方式数量。
Source: arXiv · Machine Learning Theory · arxiv.org