Preprint Open access
Flow-Matched Motion Priors: Online Optimal-Transport Rewards for Imitation Learning
Learning a motion prior requires a reward that guides a policy from its current behavior toward demonstrated motion. Adversarial Motion Priors (AMP) provide such a reward with a discriminator. However, adversarial objectives can become uninformative when policy and expert supports are far apart. A naive use of optimal …