跳到正文
原文
arXiv · Machine Learning Theory· Chiwun Yang, Xiaoyu Li·· 3 小时前AI 评分28

预训练与中间训练如何让奖励信号变得可学习?

What Pretraining and Midtraining Make Learnable from Rewards?

AI 导读

summary_zh: 该研究分析预训练和中间训练如何为奖励适应提供信息与计算机制。在序列状态计算与上下文记忆任务中,模型可能对训练奖励一致但需要不同的验证答案,而与任务无关的源观测能解决这一歧义。

来源:arXiv · Machine Learning Theory · arxiv.org