Preprint Open access
Variance-Averse $n$-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments
Generative actors are transforming offline reinforcement learning (RL) by enabling expressive policy classes that model complex action distributions. However, this expressiveness also exposes a key challenge in heterogeneous datasets: generative policies can reproduce unreliable action modes whose return distributions …