跳到正文
原文
arXiv · Machine Learning Theory· Matthieu Zimmer, Xiaotong Ji, Tu Nguyen, Haitham Bou-Ammar·· 5 小时前AI 评分50

蒸馏 LLM 推理能力的最弱环节方法:基于最坏情况约束强化学习的推理蒸馏

The Weakest Link: Distilling LLM Reasoning with Worst-Case Constrained Reinforcement Learning

AI 导读

论文提出将 LLM 推理蒸馏建模为约束强化学习问题,以轨迹前缀上教师似然的最坏情况为硬约束,避免纯 RL 的奖励欺骗与 KL 蒸馏的逻辑稀释。该方法在数学推理和代码生成任务上扩展了准确率-保真度帕累托前沿,以与纯 RL 相当的最终答案正确率大幅降低教师约束违反,实现最高的严谨推理成功率。

来源:arXiv · Machine Learning Theory · arxiv.org