Hu, S., Wang, P., Hu, J., Zhou, Q., Hu, A., Shen, L., Zhang, Y., & Tao, D. (2026). Q-learning Penalized Transformer for Safe Offline Reinforcement Learning. https://omanscience.com/ar/articles/q-learning-penalized-transformer-for-safe-offline-reinforcement-learning