00:00
01:00
02:00
03:00
04:00
05:00
06:00
07:00
08:00
09:00
10:00
11:00
12:00
13:00
14:00
15:00
16:00
17:00
18:00
19:00
20:00
21:00
22:00
23:00
00:00
01:00
02:00
03:00
04:00
05:00
06:00
07:00
08:00
09:00
10:00
11:00
12:00
13:00
14:00
15:00
16:00
17:00
18:00
19:00
20:00
21:00
22:00
23:00
ع الموجة مع ايلي
02:30 GMT
150 د
مدار الليل والنهار
05:00 GMT
183 د
المقهى الثقافي
08:29 GMT
17 د
08:45 GMT
15 د
مدار الليل والنهار
13:00 GMT
183 د
مدار الليل والنهار
19:00 GMT
120 د
مدار الليل والنهار
21:00 GMT
30 د
مدار الليل والنهار
02:30 GMT
150 د
مدار الليل والنهار
05:00 GMT
183 د
مدار الليل والنهار
13:00 GMT
183 د
مدار الليل والنهار
19:00 GMT
120 د
أمساليوم
بث مباشر
 - سبوتنيك عربي, 1920
مجتمع
تابع آخر الأخبار عن القضايا الاجتماعية والفعاليات الثقافية في دول الوطن العربي والعالم. تعرف على آخر أخبار المجتمع، قصص إنسانية، وتقارير مصورة عن حياة المجتمع.

هل يساعد التعلم المعزز بالذكاء الاصطناعي على تحسين حل المسائل الرياضية؟

© Photo / CCامتحان الرياضيات
امتحان الرياضيات - سبوتنيك عربي, 1920, 04.08.2026
تابعنا عبر
درس الباحثون التغيرات التي تطرأ على نماذج الذكاء الاصطناعي عند تدريبها باستخدام التعلم المعزز بدلاً من الضبط الدقيق التقليدي الخاضع للإشراف، وتشير تجاربهم إلى أن التعلم المعزز لا يقتصر على تحسين الإجابات النهائية فحسب، بل يعيد تنظيم كيفية تمثيل المعلومات الرياضية عبر الشبكة، ما يجعل الإشارات المرتبطة بالحلول الصحيحة والخاطئة أكثر وضوحًا.
في الضبط الدقيق الخاضع للإشراف، يتعلم النموذج من أمثلة الأسئلة المقترنة بحلول مكتوبة بعناية، ويُشجع على محاكاة أنماط الاستدلال والإجابات الموجودة في تلك الأمثلة.
أما التعلم المعزز، فيعمل بطريقة مختلفة، حيث يُولّد النموذج حلولًا ويتلقى مكافآت عندما تُحقق إجاباته هدفًا قابلاً للقياس، مثل إنتاج النتيجة الصحيحة، ومن خلال التغذية الراجعة المتكررة، يتعلم النموذج استراتيجيات الاستدلال الأكثر احتمالًا للنجاح.
وغالبًا ما تُظهر نماذج الاستدلال المُدرَّبة بتقنية التعلم المعزز أداءً أفضل في الاختبارات الرياضية المعيارية، إلا أن ارتفاع الدرجات وحده لا يُفسِّر التغييرات الداخلية التي طرأت عليها. ولذلك، قارنت الدراسة الجديدة بين نماذج التعلم المعزز والنماذج المُعدَّلة وفقًا للتعليمات، باستخدام عدة طرق مُصمَّمة للكشف عن مكان وكيفية ظهور معلومات صحة الإجابة داخل طبقاتها.

هل يُمكن للحالة الداخلية للنموذج الكشف عن صحة إجابته؟

قام الباحثون بتوليد 1000 مسألة رياضية اصطناعية تغطي الاحتمالات والكسور والنمو المتسلسل وحسابات التكلفة، وقد سمحت لهم هذه المسائل الاصطناعية بالتحكم في الإجابات الصحيحة، وتجنب تأثير المواد المعيارية المحفوظة، وتوفير أمثلة كافية للاختبار الإحصائي.
استخرجوا الحالة الداخلية للنموذج لكل حل مُكتمل مباشرةً قبل أن يُنتج الإجابة النهائية، ثم درَّبوا مُصنِّفًا بسيطًا، يُعرف باسم "المسبار الخطي"، للتنبؤ بصحة تلك الإجابة. لا يحلّ التحليل الخطي المسائل الرياضية بحد ذاتها، بل يسأل عما إذا كانت الحلول الصحيحة والخاطئة تقع ضمن مناطق متميزة في التمثيل الداخلي للنموذج، فعندما يفصل مصنف بسيط بينها بدقة، تُوصف المعلومات بأنها أكثر قابلية للفصل الخطي، ما يعني أن النموذج قد نظّم نوعي النتائج في أنماط رياضية أوضح.

أنتجت النماذج المدربة على التعلم المعزز والنماذج التي تركز على الاستدلال إشارات أقوى، حيث بلغت دقة تحليلاتها الطبقية ما يقارب 83-98%، مقارنةً بنحو 75-90% للنماذج المُعدّلة وفقًا للتعليمات، بفارق متوسط ​​يبلغ حوالي ثماني نقاط مئوية، كما ظهرت المعلومات المتعلقة بصحة الحل في وقت أبكر، وظلت واضحة بشكل خاص عبر العديد من الطبقات الوسطى والعميقة.

لا يعني هذا أن النماذج تعرف بوعي ما إذا كانت صحيحة أم لا، بل تحتوي حالاتها الخفية على معلومات إحصائية تُساعد المصنف الخارجي على التمييز بين الاستدلال الناجح والاستدلال غير الناجح.
ألماس - سبوتنيك عربي, 1920, 23.07.2026
مجتمع
باحثون يطورون ذكاء اصطناعيا توليديا قادر على تصميم بلورات جديدة باستخدام التعلم المعزز

التعلم المعزز يُغير أهمية الطبقات

استخدم الفريق لاحقًا "الحجب المتوسط"، وهي طريقة تُعطل مؤقتًا إحدى الطبقات باستبدال نشاطها بقيمة مرجعية متوسطة، إذا أدى هذا التدخل إلى انخفاض حاد في الدقة، فمن المرجح أن تكون الطبقة المتأثرة مهمة للحساب.

قارنت هذه التجربة النموذجين المُدرَّبين بالتعلم المعزز والمُدرَّبين وفقًا للتعليمات على مجموعة صغيرة من مسائل (GSM8K). وزّع النموذج "المُدرَّب وفقًا للتعليمات" الأهمية بشكل متساوٍ نسبيًا عبر طبقاته، مع تركيز طفيف على المعالجة الأولية، بينما أصبح النموذج "المُدرَّب بالتعلم المعزز" أكثر اعتمادًا تدريجيًا على الطبقات الأعمق، وخاصة المجموعات في الأجزاء الوسطى واللاحقة من الشبكة.

يفسر الباحثون هذا النمط على أنه بنية استدلال هرمية أكثر، حيث قد تعالج الطبقات الأولية العمليات الحسابية الأساسية والعلاقات التأسيسية، بينما تُدمج الطبقات الأعمق هذه العناصر بشكل متزايد في استدلال من الدرجة العليا. في المقابل، قد يُوزّع التدريب الخاضع للإشراف على أمثلة الحلول الكاملة العملية بشكل أكثر توازنًا ويُدخل تكرارًا عبر الشبكة.
استجاب كلا النموذجين بشكل مماثل عندما تم تعطيل الطبقات المبكرة، لكن سلوكهما اختلف بشكل حاد بعد الطبقة 15 تقريبًا، ما يشير إلى أن طريقة التدريب كان لها أكبر تأثير على المراحل اللاحقة من المعالجة الرياضية بدلاً من الأسس الحسابية الأساسية.

هل يستخدم نموذج الاستدلال الأفضل عددًا أكبر من الرموز عند الحاجة فقط؟

بحث الباحثون أيضًا فيما إذا كانت النماذج المدربة بالتعلم المعزز تُعدّل طول استدلالها وفقًا لصعوبة المسألة. اختبروا أربعة نماذج على 50 سؤالًا من أسئلة (GSM8K-Platinum)، وولّدوا 50 إجابة مستقلة لكل سؤال، وقاسوا مقدار التغير في طول المخرجات بين المحاولات المتكررة.
لم تكشف النتائج عن نمط شامل واحد للتعلم المعزز، يشير هذا إلى أن تخصيص الرموز لا يعتمد فقط على استخدام التعلم المعزز، بل يعتمد أيضًا على مسار التدريب الكامل، وتصميم المكافآت، ونوع النموذج.
لذا، فإن طول الاستدلال ليس بالضرورة أفضل، فالنموذج الفعال، في الوضع الأمثل، ينبغي أن يخصص قدرًا أكبر من الحسابات للمسائل الصعبة حقًا، بينما يحل المسائل الأسهل بإيجاز. تشير الدراسة إلى أن أساليب التعلم المعزز الحالية قادرة على تعزيز التمثيلات الداخلية دون أن تُنتج بالضرورة تحكمًا دقيقًا في طول الاستدلال.
كمبيوتر خارق - سبوتنيك عربي, 1920, 31.07.2026
مجتمع
جامعة موسكو الحكومية تسرع تدريب الذكاء الاصطناعي لشبكات حوسبة أكثر ذكاء

ما يمكن أن تُحسّنه النتائج

يقدم البحث تفسيرًا آليًا مبكرًا لسبب تفوق النماذج المدربة بالتعلم المعزز على الأنظمة المُعدّلة تقليديًا في الرياضيات، حيث تبدو تمثيلاتها الخفية أكثر وضوحًا، وتصبح المعلومات المتعلقة بصحة الإجابة متاحة في وقت أبكر، وتضطلع الطبقات الأعمق بأدوار أكثر أهمية تدريجيًا.

قد تساعد هذه القياسات المطورين في نهاية المطاف على تقييم جودة الاستدلال أثناء التدريب، وتحديد الطبقات المرتبطة بالفشل، وتصميم مكافآت تُشجع النماذج على استخدام الجهد الحسابي بكفاءة أكبر. مع ذلك، فقد فحصت الدراسة عددًا محدودًا من عائلات النماذج، واعتمدت بشكل أساسي على قوالب حسابية اصطناعية لتحليلها الاستقصائي، واستخدمت 20 مسألة فقط في تجربة حجب أو ازالة الطبقات.

لذلك يوصي المؤلفون بتوسيع نطاق هذه الطريقة لتشمل نماذج أكبر، وخطوات استدلال وسيطة، ومجالات أخرى، بما في ذلك الاستدلال العلمي وتوليد التعليمات البرمجية، وحتى اكتمال هذا العمل، ينبغي اعتبار النتائج بمثابة دليل على النماذج المختبرة بدلاً من تفسير شامل لكل نظام استدلال.
المصدر: | مستودع الأبحاث العلمية |
شريط الأخبار
0
للمشاركة في المناقشة
قم بتسجيل الدخول أو تسجيل
loader
المحادثات
Заголовок открываемого материала