跳到正文
原文
arXiv · Artificial Intelligence· Pengxin Guo, Shuang Zeng, Zonggen Li, Weiying Zheng, Mengting Liu, Liangqiong Qu·· 3 小时前AI 评分30

Fed-GRPO:以奖励信号驱动的联邦组相对策略优化框架

Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization

AI 导读

Fed-GRPO 是一种联邦 GRPO 训练框架,在不共享原始数据的前提下实现协作推理训练,利用 GRPO 训练中自然产生的奖励统计作为零成本信号来指导聚合、本地训练与通信。

来源:arXiv · Artificial Intelligence · arxiv.org