Abstract

Recent years have witnessed major progress in joint audio-video generation. Existing models still suffer from limited per-modality fidelity, insufficient text-modality alignment and weak cross-modal synchronization. While reinforcement-learning post-training offers a promising remedy, directly adapting it to joint audio-video generation is challenging. Heterogeneous multimodal rewards entangle learning signals and complicate credit assignment. Joint optimization of two modality towers is computationally expensive given their divergent dynamics. Moreover, synchronization evaluation difficulty depends on paired samples, preventing fair reward comparisons. We propose AV-GRPO, a modality-anchored online diffusion RL framework, and 5DAV, a decoupled, difficulty-controllable training dataset. AV-GRPO includes three key modules: (1) modality-anchored rollouts to disentangle learning signals and stabilize difficulty; (2) trajectory-locked frozen-tower optimization to reduce cost and reassign credit; (3) adaptive objectives and perturbation strengths tailored to modality-specific dynamics. This converts coupled multimodal preference learning into unimodal subproblems for precise reward attribution and better synchronization. Our 5DAV dataset decouples samples across five dimensions for systematic training. Experiments on JavisBench and VABench demonstrate AV-GRPO outperforms LTX-2.3 in generation quality, semantic alignment and cross-modal synchronization under LoRA and full fine-tuning. Ablations confirm our designs. Code and data: https://github.com/zhiyuxu03/AV-GRPO

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Xu, Z., Yan, W., Shi, Y., Li, S., Liu, Y., Lam, K. M., & Cao, Y. (2026). AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation. https://omanscience.com/en/articles/av-grpo-modality-anchored-decoupling-diffusion-reinforcement-learning-for-joint-audio-video-generation

MLA 9

Xu, Zhiyu, et al. "AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation." https://omanscience.com/en/articles/av-grpo-modality-anchored-decoupling-diffusion-reinforcement-learning-for-joint-audio-video-generation.

Chicago (author–date)

Xu, Zhiyu, Weilong Yan, Yufei Shi, Shiyang Li, Yihao Liu, Kin-Man Lam, and Yuewen Cao. 2026. "AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation." https://omanscience.com/en/articles/av-grpo-modality-anchored-decoupling-diffusion-reinforcement-learning-for-joint-audio-video-generation.

Harvard

Xu, Z., Yan, W., Shi, Y., Li, S., Liu, Y., Lam, K. M. and Cao, Y. (2026) 'AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation', Available at: https://omanscience.com/en/articles/av-grpo-modality-anchored-decoupling-diffusion-reinforcement-learning-for-joint-audio-video-generation.

Vancouver

Xu Z, Yan W, Shi Y, Li S, Liu Y, Lam KM, et al. AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation. https://omanscience.com/en/articles/av-grpo-modality-anchored-decoupling-diffusion-reinforcement-learning-for-joint-audio-video-generation

IEEE

Z. Xu, W. Yan, Y. Shi, S. Li, Y. Liu, K. M. Lam, and Y. Cao, "AV-GRPO: Modality-Anchored Decoupling Diffusion Reinforcement Learning for Joint Audio-Video Generation," https://omanscience.com/en/articles/av-grpo-modality-anchored-decoupling-diffusion-reinforcement-learning-for-joint-audio-video-generation.