Chen, Y., Zhang, Y., Witbrock, M., & Hu, S. (2026). Loop-Free Inverse Reinforcement Learning via Sequential Value Recovery with Q-Score Matching. https://omanscience.com/en/articles/loop-free-inverse-reinforcement-learning-via-sequential-value-recovery-with-q-score-matching