Kang, G., & Kwon, M. (2026). Variance-Averse $n$-Step Offline Reinforcement Learning for Sparse Long-Horizon Environments. https://omanscience.com/en/articles/variance-averse-n-step-offline-reinforcement-learning-for-sparse-long-horizon-environments