الباحثون

Lingzhen Li

المنشورات 1

نسخة أولية وصول مفتوح

Unified Trajectory Matching Policy Optimization: Diverse T2I Generation and VLA Generalization

Zhiyuan Ma, Jiaming Li, Lingzhen Li وآخرون · 2026

Reward-maximizing reinforcement learning (RL) is widely used to post-train stochastic diffusion and flow policies for text-to-image (T2I) generation. However, reward-maximizing RL causes policy mode collapse even under reference KL or entropy regularization, reducing the policy to a single high-reward mode. In T2I, thi …

المؤلفون المشاركون