Abstract

Direct Preference Optimization (DPO) aligns language models by optimizing over sequence-level sums of token-wise implicit reward differences. However, we identify a pervasive pathology in this formulation: a disproportionately small subset of high-frequency token types dominates cumulative sequence scores while appearing symmetrically across both preferred and dispreferred responses. Specifically, under canonical Qwen tokenization on Anthropic HH-RLHF, merely 69 token types account for $55.1\%$ of all response tokens and $85.9\%$ of within-pair shared token mass, exhibiting substantially lower preference-side specificity than the remaining vocabulary. This symmetric ubiquity induces gradient entanglement and dilutes the discriminative preference signal propagated through the objective. To resolve this issue, we introduce \emph{Anisotropic DPO} (\textsf{ADPO}) and its canonical realization, \emph{Frequency-Hard DPO}. Using a fixed, label-agnostic vocabulary mask, our method zeroes the implicit reward contribution of high-frequency response tokens while assigning unit weight to informative positions, thereby suppressing gradient interference without modifying preference pairs, discarding context, or introducing learned parameters. Here, \emph{anisotropy} designates non-uniform token-level objective weighting rather than representational geometry. Extensive empirical evaluations on AlpacaEval, MT-Bench, and Arena-Hard demonstrate that Frequency-Hard DPO consistently outperforms standard DPO across Qwen-2.5-7B-Instruct and Llama-3-8B-Instruct, establishing that selectively masking shared high-frequency tokens offers an effective, zero-overhead mechanism for robust preference alignment.

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Saini, H., Jha, S., Tang, Y., & Liu, D. (2026). Masking Frequent Tokens Sharpens Direct Preference Optimization. https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization

MLA 9

Saini, Harshvardhan, et al. "Masking Frequent Tokens Sharpens Direct Preference Optimization." https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.

Chicago (author–date)

Saini, Harshvardhan, Samyak Jha, Yiming Tang, and Dianbo Liu. 2026. "Masking Frequent Tokens Sharpens Direct Preference Optimization." https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.

Harvard

Saini, H., Jha, S., Tang, Y. and Liu, D. (2026) 'Masking Frequent Tokens Sharpens Direct Preference Optimization', Available at: https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.

Vancouver

Saini H, Jha S, Tang Y, Liu D. Masking Frequent Tokens Sharpens Direct Preference Optimization. https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization

IEEE

H. Saini, S. Jha, Y. Tang, and D. Liu, "Masking Frequent Tokens Sharpens Direct Preference Optimization," https://omanscience.com/en/articles/masking-frequent-tokens-sharpens-direct-preference-optimization.