الباحثون

Jameson Dong

المنشورات 1

نسخة أولية وصول مفتوح

CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models

Zhaolong Su, Yujin Han, Feng Wang وآخرون · 2026

Latent reward models (LRMs) enable efficient alignment of video diffusion models by scoring intermediate states directly in latent space. However, we find that optimizing against a fixed latent reward rapidly leads to latent reward hacking: the predicted reward stays high while perceptual and motion quality deteriorate …

المؤلفون المشاركون