الملخص

تمت ترجمة أجزاء من هذه الصفحة آلياً وقد تحتوي على أخطاء.

يمكن لنموذج اللغة (LM) أن يجيب عادة على نفس السؤال بأكثر من طريقة واحدة، ولكن تعلم التعزيز مع المكافآت التي يمكن التحقق منها (RLVR) لا يهم أي إجابة صحيحة تنتجها النموذج. سيحصل الحل على نفس الجائزة سواء كان ألف نسخة من إجابة مألوفة أو واحدة لم تنتجها النموذج من قبل. ومع ذلك، هناك قيمة محتملة في جعل النموذج يحافظ على العديد من الحلول الصحيحة أثناء تدريبها. على سبيل المثال، قد توفر أنماط متعددة للمستخدمين خيارًا وتوفير استراتيجيات حل المشاكل التي تحسن الأداء العام للنموذج. هنا، نقوم بإدخال ModeBench، وهو مقياس للمهام متعددة الحلول التي يعيد فيها المحقق على حد سواء الصدقة والطريقة المكتشفة. ثم نستخدم ModeBench لقياس كيف تتغير تنوع الحلول في مرحلة ما بعد التدريب RLVR. ونحن نرى أن RLVR بعد التدريب يركز الاحتمال على أقل أساليب صحيحة حتى مع الحفاظ على دقة أو تحسين، وعلاوة على ذلك، أن النماذج الحدودية هي بالفعل مركزة للغاية. ثم نقوم بتقديم حلنا، Re:Max، الذي يحفظ نموذجًا واحدًا معتمدًا لكل وضع اكتشف في حافظة إعادة التشغيل والقطارات على تلك الأوضاع المخزنة بشكل متساو. لذا فإن الحل الذي تم العثور عليه مرة واحدة يتم ممارسته في نفس المرات التي يتم العثور عليها مراراً وتكراراً عبر ثلاثة مقاييس نموذجية، وأهداف RL اثنين، وبناء المهام الأصعب، يُحسن التكرار على حد سواء مدى نجاح السياسة وكيف يمكن أن تنجح بطرق مختلفة.

الكلمات المفتاحية

الموضوع

بيانات النشر

المجلة
غير متاح
وصول مفتوح
وصول مفتوح أخضر

اقتبس هذه المقالة

APA 7

d'Aliberti, L. G., Abdulhai, M., Druchyna, S., Henderson, P., & Ribeiro, M. H. (2026). وضع حل القياس والتخفيف الانهيار في RLVR. https://omanscience.com/ar/articles/measuring-and-mitigating-solution-mode-collapse-in-rlvr

MLA 9

d'Aliberti, Liv G., et al. "وضع حل القياس والتخفيف الانهيار في RLVR." https://omanscience.com/ar/articles/measuring-and-mitigating-solution-mode-collapse-in-rlvr.

شيكاغو (المؤلف–التاريخ)

d'Aliberti, Liv G., Marwa Abdulhai, Sofiia Druchyna, Peter Henderson, and Manoel Horta Ribeiro. 2026. "وضع حل القياس والتخفيف الانهيار في RLVR." https://omanscience.com/ar/articles/measuring-and-mitigating-solution-mode-collapse-in-rlvr.

هارفارد

d'Aliberti, L. G., Abdulhai, M., Druchyna, S., Henderson, P. and Ribeiro, M. H. (2026) 'وضع حل القياس والتخفيف الانهيار في RLVR', Available at: https://omanscience.com/ar/articles/measuring-and-mitigating-solution-mode-collapse-in-rlvr.

فانكوفر

d'Aliberti LG, Abdulhai M, Druchyna S, Henderson P, Ribeiro MH. وضع حل القياس والتخفيف الانهيار في RLVR. https://omanscience.com/ar/articles/measuring-and-mitigating-solution-mode-collapse-in-rlvr

IEEE

L. G. d'Aliberti, M. Abdulhai, S. Druchyna, P. Henderson, and M. H. Ribeiro, "وضع حل القياس والتخفيف الانهيار في RLVR," https://omanscience.com/ar/articles/measuring-and-mitigating-solution-mode-collapse-in-rlvr.