Abstract
Exploratory reinforcement learning (RL) on an operating bus fleet is impractical,while policies trained only from historical data cannot acquire new experience. Hybrid Offline-and-Online (H2O) RL combines fixed target replay with simulator interaction, but the inexpensive online simulator can differ from the target in transition and event-duration dynamics. We study this cross-fidelity problem for multi-line bus holding and address a failure mode in which lower generalized passenger time coexists with incomplete passenger journeys.
Keywords
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Zhang, Y., Zhang, Q., & Zheng, L. (2026). Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding. https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding
MLA 9
Zhang, Yifan, et al. "Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding." https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.
Chicago (author–date)
Zhang, Yifan, Qifan Zhang, and Liang Zheng. 2026. "Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding." https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.
Harvard
Zhang, Y., Zhang, Q. and Zheng, L. (2026) 'Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding', Available at: https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.
Vancouver
Zhang Y, Zhang Q, Zheng L. Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding. https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding
IEEE
Y. Zhang, Q. Zhang, and L. Zheng, "Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding," https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.