arXiv · Artificial Intelligence· Pengxin Guo, Shuang Zeng, Zonggen Li, Weiying Zheng, Mengting Liu, Liangqiong Qu·· 3 小时前AI 评分30
Fed-GRPO:以奖励信号驱动的联邦组相对策略优化框架
Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization
AI 导读
Fed-GRPO 是一种联邦 GRPO 训练框架,在不共享原始数据的前提下实现协作推理训练,利用 GRPO 训练中自然产生的奖励统计作为零成本信号来指导聚合、本地训练与通信。
来源:arXiv · Artificial Intelligence · arxiv.org