Authors

Tong Wei

Publications 4

Preprint Open access

Outcome-Guided On-Policy Self-Distillation

On-policy self-distillation (OPSD) provides denser token-level supervision and better computational efficiency than Reinforcement Learning with Verifiable Rewards (RLVR). However, this denser supervision may introduce substantial noise and training instability. Existing improvements often rely on high-variance per-toke …

Preprint Open access

Learning Process Rewards via Reasoning State Propagation

Kai Gan, Zi-Hao Zhou, Bo Ye et al. · 2026

Process reward models (PRMs) have demonstrated notable effectiveness in test-time scaling and reinforcement learning by providing fine-grained signals for evaluating intermediate reasoning states, but their training relies heavily on costly process annotations. A natural way to alleviate this dependence is to complemen …

Co-authors