الباحثون

Yike Wang

المنشورات 1

نسخة أولية وصول مفتوح

Save Your Saturated Data: Learning Beyond Reward Saturation in Group-Based RL

Ziyuan Yang, Yike Wang, Shangbin Feng وآخرون · 2026

Group-relative reinforcement learning (RL) relies on reward variation among sampled responses to estimate informative relative advantages. As language models become increasingly capable, existing training data can become reward-saturated: all sampled responses to the same problem might receive equally high rewards, whe …

المؤلفون المشاركون