热点事件持续更新
RLVR导致解法模式坍缩,提出ModeBench与Re:Max
1 篇报道1 个报道来源2 小时前 更新
先了解这件事
AI 综述
2026年10月9日,arXiv Machine Learning Theory(一手)发表论文,研究RLVR后训练中的解法模式坍缩问题。论文提出ModeBench基准,可同时返回正确性与所发现的解法模式,用于测量RLVR后训练中的解法多样性。结果显示,RLVR后训练会把概率集中到更少的正确模式上,即使准确率保持或提升,前沿模型也已高度集中。为此论文提出Re:Max方法,在回放缓冲区中为每个已发现模式存储一个已验证样本并均匀训练,在三个模型规模、两种RL目标与更难任务构造上同时提升策略成功率与成功方式数量。
AI 根据报道生成 · 2 小时前更新
最新进展10月9日 12:00
论文提出ModeBench测量RLVR解法多样性,并提出Re:Max缓解模式坍缩,同步提升成功率与成功方式数量。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv · Machine Learning TheoryRLVR 中解法模式坍缩的测量与缓解
论文提出 ModeBench,一个同时返回正确性与所发现解法模式的基准,用于测量 RLVR 后训练中的解法多样性。结果显示 RLVR 后训练会把概率集中到更少的正确模式上,即使准确率保持或提升,前沿模型也已高度集中;为此提出 Re:Max,在回放缓冲区中为每个已发现模式存储一个已验证样本并均匀训练,在三个模型规模、两种 RL 目标与更难任务构造上同时提升策略成功率与成功方式数量。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。