Abstract
We study multi-armed bandits (MAB) with multiple optimal arms, motivated by the fact that many practical decision making problems admit multiple correct answers. For $K$-armed bandits with $A$ optimal arms, we first provide a sharper analysis of previous sub-sampling algorithms (De Heide et al., 2021; Zhu and Nowak, 2020), establishing a $\tilde{O}\Big(\frac{K-A}{\sqrt{KA}}\sqrt{T} \Big)$ minimax regret, where $T$ is the total number of interactions and $\tilde O(\cdot)$ drops all constant and logarithmic factors, improving the previous $\tilde{O}(\sqrt{KT/A})$ regret. We then provide a matching lower bound up to logarithmic factors, indicating that our established rate is nearly minimax-optimal. We further show that the knowledge of $A$ up to $\tilde{O}(1)$ factors is necessary to achieve near-optimal regret, as near-optimal algorithms for one number of optimal arms must incur substantially larger regret than optimal regret for a smaller number. Overall, our results provide a comprehensive minimax characterization of $K$-armed bandits with $A$ over the entire range of $1 \leq A \leq K-1$.
Keywords
Subject
Publication details
- Journal
- Not available
- Open access
- Green open access
Cite this article
APA 7
Ji, K., Di, Q., Zhao, Q., Zhao, H., & Gu, Q. (2026). Bandits with Multiple Optimal Arms: Minimax Regret and Non-Adaptivity. https://omanscience.com/en/articles/bandits-with-multiple-optimal-arms-minimax-regret-and-non-adaptivity
MLA 9
Ji, Kaixuan, et al. "Bandits with Multiple Optimal Arms: Minimax Regret and Non-Adaptivity." https://omanscience.com/en/articles/bandits-with-multiple-optimal-arms-minimax-regret-and-non-adaptivity.
Chicago (author–date)
Ji, Kaixuan, Qiwei Di, Qingyue Zhao, Heyang Zhao, and Quanquan Gu. 2026. "Bandits with Multiple Optimal Arms: Minimax Regret and Non-Adaptivity." https://omanscience.com/en/articles/bandits-with-multiple-optimal-arms-minimax-regret-and-non-adaptivity.
Harvard
Ji, K., Di, Q., Zhao, Q., Zhao, H. and Gu, Q. (2026) 'Bandits with Multiple Optimal Arms: Minimax Regret and Non-Adaptivity', Available at: https://omanscience.com/en/articles/bandits-with-multiple-optimal-arms-minimax-regret-and-non-adaptivity.
Vancouver
Ji K, Di Q, Zhao Q, Zhao H, Gu Q. Bandits with Multiple Optimal Arms: Minimax Regret and Non-Adaptivity. https://omanscience.com/en/articles/bandits-with-multiple-optimal-arms-minimax-regret-and-non-adaptivity
IEEE
K. Ji, Q. Di, Q. Zhao, H. Zhao, and Q. Gu, "Bandits with Multiple Optimal Arms: Minimax Regret and Non-Adaptivity," https://omanscience.com/en/articles/bandits-with-multiple-optimal-arms-minimax-regret-and-non-adaptivity.