Abstract

Masked discrete diffusion models offer a promising alternative to autoregressive generation, but iterative sampling can be costly, and intractable sequence likelihoods complicate reward fine-tuning. We introduce IDRF, a framework for reward fine-tuning of few-step masked discrete diffusion generators. Starting from a standard reverse-KL-regularized objective, IDRF replaces the intractable sequence-level KL penalty with inverse-distillation regularization. With an optimal auxiliary denoiser, we prove that the population inverse-distillation loss upper-bounds the sequence-level KL divergence to the reference distribution. IDRF optimizes a trajectory-based surrogate of this loss without reference-model rollouts, so the student keeps its own few-step sampler. We view few-step generation as a finite-horizon Markov decision process and optimize reward with a clipped policy-gradient objective over the student's trajectories. Across DNA, image, and text generation, IDRF achieves high reward with up to $32\times$ fewer denoising steps than the reference while mitigating reward hacking and preserving sample quality.

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Gromadskii, V., Li, D., Gourevitch, S., Janati, Y., Moulines, E., Panov, M., & Korotin, A. (2026). IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models. https://omanscience.com/en/articles/idrf-inverse-distilled-reward-fine-tuning-of-masked-discrete-diffusion-models

MLA 9

Gromadskii, Vladislav, et al. "IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models." https://omanscience.com/en/articles/idrf-inverse-distilled-reward-fine-tuning-of-masked-discrete-diffusion-models.

Chicago (author–date)

Gromadskii, Vladislav, David Li, Samson Gourevitch, Yazid Janati, Eric Moulines, Maxim Panov, and Alexander Korotin. 2026. "IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models." https://omanscience.com/en/articles/idrf-inverse-distilled-reward-fine-tuning-of-masked-discrete-diffusion-models.

Harvard

Gromadskii, V., Li, D., Gourevitch, S., Janati, Y., Moulines, E., Panov, M. and Korotin, A. (2026) 'IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models', Available at: https://omanscience.com/en/articles/idrf-inverse-distilled-reward-fine-tuning-of-masked-discrete-diffusion-models.

Vancouver

Gromadskii V, Li D, Gourevitch S, Janati Y, Moulines E, Panov M, et al. IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models. https://omanscience.com/en/articles/idrf-inverse-distilled-reward-fine-tuning-of-masked-discrete-diffusion-models

IEEE

V. Gromadskii, D. Li, S. Gourevitch, Y. Janati, E. Moulines, M. Panov, and A. Korotin, "IDRF: Inverse-Distilled Reward Fine-tuning of Masked Discrete Diffusion Models," https://omanscience.com/en/articles/idrf-inverse-distilled-reward-fine-tuning-of-masked-discrete-diffusion-models.