Preprint Open access
Investigating Model Compression for Neural Machine Translation in the Biomedical Domain
Large-scale pretrained transformer models have achieved state-of-the-art performance across diverse machine translation tasks, including multilingual settings. Knowledge distillation has emerged as a sustainable approach for model compression, transferring knowledge from large teacher models to smaller, more efficient …