跳到正文
热点事件持续更新

测试时数学推理中的预算边界效应研究

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

研究通过19,200条公开轨迹的配对离线回放,测量AIME、BrUMO和HMMT问题在4k、8k、32k token cap下的边界选择。结果显示严格停止会因前缀未完成而损失准确率;advisory策略在低成本下准确率高于严格停止,但在高成本下低于严格32k。候选覆盖增加不保证准确率提升,相同cap下多数准确率差异缩小至1.3个百分点以内。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月1日
  1. arXiv · Artificial Intelligence
    测试时数学推理中的预算边界效应

    研究通过19,200条公开轨迹的配对离线回放,测量AIME、BrUMO和HMMT问题在4k、8k、32k token cap下的边界选择。发现严格停止会因前缀未完成而损失准确率,而advisory策略在低成本下准确率高于严格停止,但在高成本下低于严格32k。候选覆盖增加不保证准确率提升,相同cap下多数准确率差异缩小至1.3个百分点以内。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。