Preprint Open access
Fed-GRPO: Reward-Signal-Driven Federated Group Relative Policy Optimization
Large Language Models (LLMs) have shown strong reasoning capabilities when fine-tuned with reinforcement learning (RL), particularly through Group Relative Policy Optimization (GRPO). However, existing GRPO methods assume centralized access to training data, which may not hold in practice due to privacy or regulatory c …