Abstract

Exploratory reinforcement learning (RL) on an operating bus fleet is impractical,while policies trained only from historical data cannot acquire new experience. Hybrid Offline-and-Online (H2O) RL combines fixed target replay with simulator interaction, but the inexpensive online simulator can differ from the target in transition and event-duration dynamics. We study this cross-fidelity problem for multi-line bus holding and address a failure mode in which lower generalized passenger time coexists with incomplete passenger journeys.

Keywords

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Zhang, Y., Zhang, Q., & Zheng, L. (2026). Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding. https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding

MLA 9

Zhang, Yifan, et al. "Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding." https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.

Chicago (author–date)

Zhang, Yifan, Qifan Zhang, and Liang Zheng. 2026. "Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding." https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.

Harvard

Zhang, Y., Zhang, Q. and Zheng, L. (2026) 'Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding', Available at: https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.

Vancouver

Zhang Y, Zhang Q, Zheng L. Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding. https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding

IEEE

Y. Zhang, Q. Zhang, and L. Zheng, "Completion-Aware Cross-Fidelity Offline-to-Online Reinforcement Learning for Multi-Line Bus Holding," https://omanscience.com/en/articles/completion-aware-cross-fidelity-offline-to-online-reinforcement-learning-for-multi-line-bus-holding.