Zhang, Z., Tan, X., Li, L., Zhang, X., Li, Y., & Ren, K. (2026). Train Ahead, Distill Back: Bootstrapping On-Policy Self-Distillation for Large Language Models. https://omanscience.com/ar/articles/train-ahead-distill-back-bootstrapping-on-policy-self-distillation-for-large-language-models