Yu, Y., Lu, Z., Liu, Y., Pan, Y., Wang, A., Chen, Q., Yang, H., Zhang, W., Chen, Q., & Shen, Y. (2026). RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning. https://omanscience.com/en/articles/retireopd-self-retiring-on-policy-distillation-for-agentic-reinforcement-learning