نسخة أولية وصول مفتوح
Masking Frequent Tokens Sharpens Direct Preference Optimization
Direct Preference Optimization (DPO) aligns language models by optimizing over sequence-level sums of token-wise implicit reward differences. However, we identify a pervasive pathology in this formulation: a disproportionately small subset of high-frequency token types dominates cumulative sequence scores while appeari …