Ferrara, A., Rumi, A., & Bonchi, F. (2026). BA-DPO: Bias-Adjusted Direct Preference Optimization for Language Model Alignment. https://omanscience.com/en/articles/ba-dpo-bias-adjusted-direct-preference-optimization-for-language-model-alignment