Team, X. L. C., Qiao, Z., Hua, Z., Ou, Z., Yue, Z., Jiang, Z., Huang, Z., Chen, Z., Zheng, Z., Xu, Z., Ma, Z., Hu, Y., Dong, Y., Zhang, Y., Wang, Y., Liu, Y., Yang, Y., Cai, Y., Zhao, Y., Yan, Y., Zhang, Y., Song, Y., Wei, X., Zhang, X., Zhang, X., Liu, X., Ji, X., Deng, X., Guo, X., Ma, W., Xiong, W., Wang, W., Zhuang, W., Liu, S., Ren, S., Gu, S., Chen, S., Cao, S., Yu, S., Li, S., Zhou, S., Zhang, S., Li, R., Wang, Q., Fang, Q., Chen, Q., Wang, M., Wang, L., Yao, L., Zhang, L., Cheng, L., Zhao, L., Li, L., Dong, J., Xiang, J., Wei, J., Duo, J., Liu, H., Fan, H., Guan, H., Xu, H., Tian, H., Li, H., Zhang, H., Wang, G., Luo, F., Wei, F., Zhang, D., Zhu, D., Lou, C., He, C., He, C., Liu, C., Ye, B., Shen, B., Xu, B., Yang, B., Xia, B., Xiao, B., Xu, B., Mao, Z., Zhang, Z., Xu, Z., Lin, Z., Tang, Z., Huang, Z., Weng, Y., Xiang, Y., Li, Y., Yang, Y., Wang, Y., Liu, Y., Tian, Y., Dong, Y., Cheng, Y., He, Y., Liang, Y., Wang, Y., Wang, Y., Gong, Y., Zhang, Y., Xin, Y., Zhang, X., Zhao, X., Yang, W., Huang, W., Li, W., Huang, T., Yu, T., Lu, T., Yang, T., Du, S., Tian, S., Du, S., Wang, S., Fang, S., Zhang, Q., Yang, Q., Yu, Q., Tu, Q., Xie, P., Wang, P., Li, P., Guo, M., Shao, M., Gao, L., Wang, L., Shi, L., Chen, K., Liu, K., Wang, K., Yang, K., Xue, J., Zhang, J., Liu, J., An, H., Peng, H., Lü, H., Wang, G., Yang, F., Cao, F., Liu, F., Cui, F., Wang, C., Chen, C., Bai, C., Zhu, C., Wang, C., & Zeng, B. (2026). MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement. https://omanscience.com/ar/articles/mimo-v2-6-scaling-reinforcement-learning-towards-self-improvement