跳到正文
原文
arXiv · Artificial Intelligence· Guilin Zhang, Ziqi Tan, Wulan Guo, Kai Zhao, Hongyun Yang, Mei Luo, Qi Ning, Feng Yang·· 3 小时前AI 评分39

测试时数学推理中的预算边界效应

Budget Boundary Effects in Test-Time Mathematical Reasoning

AI 导读

研究通过19,200条公开轨迹的配对离线回放,测量AIME、BrUMO和HMMT问题在4k、8k、32k token cap下的边界选择。发现严格停止会因前缀未完成而损失准确率,而advisory策略在低成本下准确率高于严格停止,但在高成本下低于严格32k。候选覆盖增加不保证准确率提升,相同cap下多数准确率差异缩小至1.3个百分点以内。

来源:arXiv · Artificial Intelligence · arxiv.org