Abstract
Direct Preference Optimization (DPO) aligns language models by optimizing over sequence-level sums of token-wise implicit reward differences. However, we identify a pervasive pathology in this formulation: a disproportionately small subset of high-frequency token types dominates cumulative sequence scores while appearing symmetrically across both preferred and dispreferred responses. Specifically, under canonical Qwen tokenization on Anthropic HH-RLHF, merely 69 token types account for $55.1\%$ of all response tokens and $85.9\%$ of within-pair shared token mass, exhibiting substantially lower preference-side specificity than the remaining vocabulary. This symmetric ubiquity induces gradient entanglement and dilutes the discriminative preference signal propagated through the objective. To resolve this issue, we introduce \emph{Anisotropic DPO} (\textsf{ADPO}) and its canonical realization, \emph{Frequency-Hard DPO}. Using a fixed, label-agnostic vocabulary mask, our method zeroes the implicit reward contribution of high-frequency response tokens while assigning unit weight to informative positions, thereby suppressing gradient interference without modifying preference pairs, discarding context, or introducing learned parameters. Here, \emph{anisotropy} designates non-uniform token-level objective weighting rather than representational geometry. Extensive empirical evaluations on AlpacaEval, MT-Bench, and Arena-Hard demonstrate that Frequency-Hard DPO consistently outperforms standard DPO across Qwen-2.5-7B-Instruct and Llama-3-8B-Instruct, establishing that selectively masking shared high-frequency tokens offers an effective, zero-overhead mechanism for robust preference alignment.
Keywords
Subject
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Saini, H., Jha, S., Tang, Y., & Liu, D. (2026). Masking Frequent Tokens Sharpens Direct Preference Optimization. https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization
MLA 9
Saini, Harshvardhan, et al. "Masking Frequent Tokens Sharpens Direct Preference Optimization." https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.
Chicago (author–date)
Saini, Harshvardhan, Samyak Jha, Yiming Tang, and Dianbo Liu. 2026. "Masking Frequent Tokens Sharpens Direct Preference Optimization." https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.
Harvard
Saini, H., Jha, S., Tang, Y. and Liu, D. (2026) 'Masking Frequent Tokens Sharpens Direct Preference Optimization', Available at: https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.
Vancouver
Saini H, Jha S, Tang Y, Liu D. Masking Frequent Tokens Sharpens Direct Preference Optimization. https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization
IEEE
H. Saini, S. Jha, Y. Tang, and D. Liu, "Masking Frequent Tokens Sharpens Direct Preference Optimization," https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.