الباحثون

Yazhe Niu

المنشورات 1

نسخة أولية وصول مفتوح

RollVerify: Bridging Efficiency and Accuracy in Long-Tail Rollout Reinforcement Learning

Yongqiang Yao, Jinru Tan, Kaihuan Liang وآخرون · 2026

Reinforcement learning is crucial for improving large language models' reasoning and generalization. It relies on massive rollouts whose lengths become increasingly long-tailed as context windows grow. In on-policy training, these long-tail rollouts can result in GPU bubbles, reducing system utilization and limiting RL …

المؤلفون المشاركون