الباحثون

Cheng Chen

المنشورات 4

نسخة أولية وصول مفتوح

COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning

Zicheng Hu, Zhijian Zhou, Xuan Zhang وآخرون · 2026

Asynchronous RL accelerates large language model post-training by decoupling rollout generation from optimization, but trains on stale trajectories. Existing methods primarily correct token-level policy mismatch through importance-ratio control in the actor objective. We show that this \emph{policy-side correction} alo …

المؤلفون المشاركون