arXiv · Machine Learning Theory· Chiwun Yang, Xiaoyu Li·· 3 小时前AI 评分28
预训练与中间训练如何让奖励信号变得可学习?
What Pretraining and Midtraining Make Learnable from Rewards?
AI 导读
summary_zh: 该研究分析预训练和中间训练如何为奖励适应提供信息与计算机制。在序列状态计算与上下文记忆任务中,模型可能对训练奖励一致但需要不同的验证答案,而与任务无关的源观测能解决这一歧义。
来源:arXiv · Machine Learning Theory · arxiv.org