跳到正文
热点事件持续更新

RLVR导致解法模式坍缩,提出ModeBench与Re:Max

1 篇报道1 个报道来源2 小时前 更新

先了解这件事

AI 综述

2026年10月9日,arXiv Machine Learning Theory(一手)发表论文,研究RLVR后训练中的解法模式坍缩问题。论文提出ModeBench基准,可同时返回正确性与所发现的解法模式,用于测量RLVR后训练中的解法多样性。结果显示,RLVR后训练会把概率集中到更少的正确模式上,即使准确率保持或提升,前沿模型也已高度集中。为此论文提出Re:Max方法,在回放缓冲区中为每个已发现模式存储一个已验证样本并均匀训练,在三个模型规模、两种RL目标与更难任务构造上同时提升策略成功率与成功方式数量。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv · Machine Learning Theory
    RLVR 中解法模式坍缩的测量与缓解

    论文提出 ModeBench,一个同时返回正确性与所发现解法模式的基准,用于测量 RLVR 后训练中的解法多样性。结果显示 RLVR 后训练会把概率集中到更少的正确模式上,即使准确率保持或提升,前沿模型也已高度集中;为此提出 Re:Max,在回放缓冲区中为每个已发现模式存储一个已验证样本并均匀训练,在三个模型规模、两种 RL 目标与更难任务构造上同时提升策略成功率与成功方式数量。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。