跳到正文
原文
arXiv · Artificial Intelligence· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Daren Zha, Jun Xiao·· 16 小时前AI 评分29

FSPO:面向预算化 LLM RL 后训练的策略一致风险与 Pareto 可行控制

FSPO: Policy-Consistent Risk and Pareto-Feasible Control for Budgeted LLM RL Post-Training

AI 导读

FSPO 是一种面向预算化 LLM RL 后训练的反馈状态控制器,联合学习策略一致风险-to-go 模型与长视界效用模型。在匹配 GRPO 资源包络下,FSPO 取得 66.11% 留出集和 59.43% OOD 准确率,优于最强自适应基线 PB2 的 64.47% 和 57.03%。

来源:arXiv · Artificial Intelligence · arxiv.org