الملخص
On-policy distillation (OPD) trains a student model on self-generated trajectories, but transmitting dense teacher distributions across long reasoning traces creates prohibitive communication and memory bottlenecks. Practical systems therefore rely on sparse teacher interfaces, typically transmitting either the sampled-token score or a small Top-$k$ distribution. However, this sparse setting faces a fundamental dilemma: sampled-token estimators are unbiased but suffer from severe gradient variance, whereas directly optimizing Top-$k$ objectives introduces systematic bias. To improve this trade-off, we propose ResOPD (On-Policy Distillation with Tail Residualization), which provides unbiased full-vocabulary reverse KL gradient estimation under on-policy sampling, with substantial variance reduction under the same sparse payload in the evaluated settings. ResOPD aggregates the unobserved vocabulary into an observable coarse tail event, computes its exact aggregate gradient, and samples only the fine-grained within-tail residual, which requires no additional teacher queries or forward passes. Extensive experiments demonstrate that ResOPD substantially reduces gradient variance, stabilizes online training dynamics, and improves downstream performance across the evaluated settings. These results establish ResOPD as an efficient, plug-and-play variance reduction primitive for sparse on-policy distillation.
الكلمات المفتاحية
الموضوع
بيانات النشر
- المجلة
- غير متاح
- وصول مفتوح
- وصول مفتوح أخضر
اقتبس هذه المقالة
APA 7
Yang, P., Xing, L., Dai, X., Liu, Z., Chen, K., & Zang, Y. (2026). ResOPD: Tail Residualization for Sparse On-Policy Distillation. https://omanscience.com/ar/articles/resopd-tail-residualization-for-sparse-on-policy-distillation
MLA 9
Yang, Penghui, et al. "ResOPD: Tail Residualization for Sparse On-Policy Distillation." https://omanscience.com/ar/articles/resopd-tail-residualization-for-sparse-on-policy-distillation.
شيكاغو (المؤلف–التاريخ)
Yang, Penghui, Long Xing, Xuanlang Dai, Ziyu Liu, Kai Chen, and Yuhang Zang. 2026. "ResOPD: Tail Residualization for Sparse On-Policy Distillation." https://omanscience.com/ar/articles/resopd-tail-residualization-for-sparse-on-policy-distillation.
هارفارد
Yang, P., Xing, L., Dai, X., Liu, Z., Chen, K. and Zang, Y. (2026) 'ResOPD: Tail Residualization for Sparse On-Policy Distillation', Available at: https://omanscience.com/ar/articles/resopd-tail-residualization-for-sparse-on-policy-distillation.
فانكوفر
Yang P, Xing L, Dai X, Liu Z, Chen K, Zang Y. ResOPD: Tail Residualization for Sparse On-Policy Distillation. https://omanscience.com/ar/articles/resopd-tail-residualization-for-sparse-on-policy-distillation
IEEE
P. Yang, L. Xing, X. Dai, Z. Liu, K. Chen, and Y. Zang, "ResOPD: Tail Residualization for Sparse On-Policy Distillation," https://omanscience.com/ar/articles/resopd-tail-residualization-for-sparse-on-policy-distillation.