الملخص

Open-source reasoning models provide unequal access to reasoning capability across languages. When a model can solve a problem but cannot deliver a complete solution in the user's language, language becomes an access barrier rather than merely a source of performance variation. We audit Qwen3 checkpoints on competition-mathematics tasks in eleven languages. Across the ten non-English languages, only 15.4-17.9% of problems receive a correct, terminating solution with visible reasoning in the requested language in any of 16 samples, compared with 92.9% in English. To identify the source of this disparity, we evaluate thirteen endpoints from one model family, spanning released checkpoints, multilingual supervised fine-tuning (SFT) at two scales, controlled SFT ablations, and three reinforcement-learning (RL) reward formulations. We jointly track correctness, language adherence, termination, and delivery efficiency. The dominant bottleneck shifts across post-training stages. Released models often reason in English. Multilingual SFT restores target-language reasoning, but accuracy declines across multilingual, English-only, and single-language SFT runs, showing that this cost is not specific to multilingual mixing; non-English reasoning traces additionally become prone to non-terminating loops. RL restores termination in both arms at no cost in accuracy, but only the arm whose reward includes a language term delivers: rewarding correctness alone returns the model to English. Together, these stages establish a constructive post-training path from English-pivoted capability to multilingual reasoning that is reliably delivered.

الكلمات المفتاحية

الموضوع

بيانات النشر

المجلة
غير متاح
وصول مفتوح
وصول مفتوح أخضر

اقتبس هذه المقالة

APA 7

Li, H., Li, X., Wu, C., Danoy, G., & Bouvry, P. (2026). What Does Post-Training Change in Multilingual Reasoning? https://omanscience.com/ar/articles/what-does-post-training-change-in-multilingual-reasoning

MLA 9

Li, Hongyang, et al. "What Does Post-Training Change in Multilingual Reasoning?" https://omanscience.com/ar/articles/what-does-post-training-change-in-multilingual-reasoning.

شيكاغو (المؤلف–التاريخ)

Li, Hongyang, Xiao Li, Caesar Wu, Grégoire Danoy, and Pascal Bouvry. 2026. "What Does Post-Training Change in Multilingual Reasoning?" https://omanscience.com/ar/articles/what-does-post-training-change-in-multilingual-reasoning.

هارفارد

Li, H., Li, X., Wu, C., Danoy, G. and Bouvry, P. (2026) 'What Does Post-Training Change in Multilingual Reasoning?', Available at: https://omanscience.com/ar/articles/what-does-post-training-change-in-multilingual-reasoning.

فانكوفر

Li H, Li X, Wu C, Danoy G, Bouvry P. What Does Post-Training Change in Multilingual Reasoning? https://omanscience.com/ar/articles/what-does-post-training-change-in-multilingual-reasoning

IEEE

H. Li, X. Li, C. Wu, G. Danoy, and P. Bouvry, "What Does Post-Training Change in Multilingual Reasoning?," https://omanscience.com/ar/articles/what-does-post-training-change-in-multilingual-reasoning.