نسخة أولية وصول مفتوح
Save Your Saturated Data: Learning Beyond Reward Saturation in Group-Based RL
Group-relative reinforcement learning (RL) relies on reward variation among sampled responses to estimate informative relative advantages. As language models become increasingly capable, existing training data can become reward-saturated: all sampled responses to the same problem might receive equally high rewards, whe …