الباحثون

Yan Feng

المنشورات 1

نسخة أولية وصول مفتوح

COPC: Coupled Off-Policy Correction for Asynchronous LLM Reinforcement Learning

Zicheng Hu, Zhijian Zhou, Xuan Zhang وآخرون · 2026

Asynchronous RL accelerates large language model post-training by decoupling rollout generation from optimization, but trains on stale trajectories. Existing methods primarily correct token-level policy mismatch through importance-ratio control in the actor objective. We show that this \emph{policy-side correction} alo …

المؤلفون المشاركون