Amazon Science·· 2026-05-26精选AI 评分62
多样化推理轨迹教会大语言模型做出更好决策
Diverse reasoning traces teach LLMs to make better decisions
AI 导读
亚马逊研究团队在ICLR发表论文,提出集合监督微调(SSFT)与全局分叉策略优化(GFPO),通过为不同推理模式分配全局分叉token来训练模型掌握多样化推理策略,并在推理时选择最优模式。AIME 2025、AIME 2024与LiveCodeBench-v5上Pass@1分别提升6.84、5.37与4.94个百分点,同时改善pass@k多样性且不损害单次准确率。
推荐理由
提出集合监督微调与全局分叉策略优化,在标准推理与编程基准上单次准确率提升5%至7%。
来源:Amazon Science · amazon.science