Skip to content
arXiv · Machine Learning Theory· Sofia Torres, Gabriel Almeida, Carter Adams, Camila Rocha·· 4 hr agoAI score35

外部指导何时有助于 LLM 推理?指导增强 GRPO 的偏差-方差理论

When Does External Guidance Help LLM Reasoning? A Bias-Variance Theory of Guidance-Augmented GRPO

AI brief

论文提出指导增强 GRPO(GA-GRPO)统一理论框架,把外部指导建模为随机指导算子 G,并将 LUFFY、ExPO、PAPO、TAPO 纳入为特例。

Source: arXiv · Machine Learning Theory · arxiv.org