arXiv · Machine Learning Theory· Sofia Torres, Gabriel Almeida, Carter Adams, Camila Rocha·· 4 hr agoAI score35
外部指导何时有助于 LLM 推理?指导增强 GRPO 的偏差-方差理论
When Does External Guidance Help LLM Reasoning? A Bias-Variance Theory of Guidance-Augmented GRPO
AI brief
论文提出指导增强 GRPO(GA-GRPO)统一理论框架,把外部指导建模为随机指导算子 G,并将 LUFFY、ExPO、PAPO、TAPO 纳入为特例。
Source: arXiv · Machine Learning Theory · arxiv.org