00:00
01:00
02:00
03:00
04:00
05:00
06:00
07:00
08:00
09:00
10:00
11:00
12:00
13:00
14:00
15:00
16:00
17:00
18:00
19:00
20:00
21:00
22:00
23:00
00:00
01:00
02:00
03:00
04:00
05:00
06:00
07:00
08:00
09:00
10:00
11:00
12:00
13:00
14:00
15:00
16:00
17:00
18:00
19:00
20:00
21:00
22:00
23:00
ع الموجة مع ايلي
02:29 GMT
151 د
مدار الليل والنهار
05:00 GMT
183 د
بين بيروت والقاهرة
10:00 GMT
123 د
مدار الليل والنهار
13:00 GMT
183 د
مدار الليل والنهار
19:00 GMT
120 د
مدار الليل والنهار
21:00 GMT
30 د
مدار الليل والنهار
02:30 GMT
150 د
مدار الليل والنهار
05:00 GMT
183 د
موزاييك
09:34 GMT
17 د
مدار الليل والنهار
13:00 GMT
183 د
صدى الحياة
اليمن.. حيث الشباب هم الوقود والموت مهنة من لا مهنة له
16:03 GMT
29 د
عرب بوينت بودكاست
16:48 GMT
11 د
مدار الليل والنهار
19:00 GMT
120 د
مدار الليل والنهار
البرنامج الصباحي - إعادة
21:00 GMT
30 د
أمساليوم
بث مباشر
 - سبوتنيك عربي, 1920
مجتمع
تابع آخر الأخبار عن القضايا الاجتماعية والفعاليات الثقافية في دول الوطن العربي والعالم. تعرف على آخر أخبار المجتمع، قصص إنسانية، وتقارير مصورة عن حياة المجتمع.

باحثون روس يطورون طريقة لاكتشاف الأخطاء في نصوص تدريب الذكاء الاصطناعي

© Photo / unsplash/Creatopyالذكاء الاصطناعي...حهاز كمبيوتر
الذكاء الاصطناعي...حهاز كمبيوتر - سبوتنيك عربي, 1920, 11.08.2026
تابعنا عبر
طور علماء في جامعة موسكو الحكومية طريقةً للكشف التلقائي عن الأخطاء والتناقضات المحتملة في مجموعات النصوص المشروحة، وهي مجموعات من الجمل المصنفة بعناية والمستخدمة لتدريب وتقييم أنظمة معالجة اللغة، ومن خلال تحديد الجمل التي يمكن تفسيرها بأكثر من طريقة، يساعد النظام الخبراء على تحديد الشروح المشكوك فيها بسرعة أكبر بكثير من فحص آلاف الجمل يدويًا.
في اختبار شمل 8199 جملة، حددت الطريقة 1148 حالة ذات تحليلات متعددة محتملة، ومن اللافت للنظر أن 1078 حالة منها كانت مرتبطة بشرح الفواصل، ما يكشف كيف يمكن حتى لقرارات الترقيم الصغيرة أن تُحدث تناقضات كبيرة في مجموعات البيانات اللغوية.

لماذا يحتاج الذكاء الاصطناعي إلى نصوص مشروحة؟

قبل أن يتمكن الحاسوب من تعلم تحليل اللغة، غالبًا ما يُعد الباحثون مجموعات بيانات خاصة تم فيها تحديد بنية كل جملة مسبقًا بواسطة خبراء بشريين. تُوفّر مجموعات البيانات هذه، المعروفة باسم "المجموعات اللغوية المُعَلَّمة"، أمثلةً تُوضّح كيفية ترابط الكلمات وأجزاء الجمل، ويمكن استخدامها عند تطوير أنظمة التحليل اللغوي الآلي.
تُعدّ جودة هذه التعابير بالغة الأهمية، فإذا احتوت مجموعة البيانات على تصنيفات هيكلية غير متسقة أو غير صحيحة، فقد يتعلّم النموذج المُدرَّب عليها هذه الأخطاء إلى جانب الأنماط الصحيحة، وتكمن الصعوبة في الحجم، إذ قد تحتوي المجموعات اللغوية الكبيرة على آلاف أو ملايين العناصر المُعَلَّمة، مما يجعل التحقق اليدوي الكامل عمليةً بطيئةً وشاقة.

دع المجموعة اللغوية تدقق نفسها

اقترح باحثو جامعة موسكو حلاً أنيقاً، حيث يقومون بإنشاء نموذج تلقائياً من المجموعة اللغوية المُعَلَّمة نفسها، ويطلبون منه إعادة إنتاج الأنماط الهيكلية الموجودة في البيانات.
إذا اكتشف النظام أن الجملة نفسها يُمكن تحليلها هيكلياً بعدة طرق مختلفة، فهذا يُصبح مؤشراً تحذيرياً، ولا يعني هذا الاختلاف بالضرورة أن التعابير خاطئة، فاللغة الطبيعية قد تكون غامضةً بالفعل، ولكنه يُرشد الخبراء بدقة إلى المواضع التي ينبغي عليهم التدقيق فيها أكثر.
بهذا المعنى، يعمل النظام كمرشح لمراقبة الجودة، فبدلاً من محاولة استبدال اللغويين، يُضيّق نطاق آلاف المشكلات المحتملة إلى مجموعة أصغر بكثير تتطلب مراجعة بشرية.
مخطوطات أثرية - سبوتنيك عربي, 1920, 07.07.2026
مجتمع
لإنقاذ المخطوطات التاريخية.. علماء روس يطورون ذكاء اصطناعيا يتيح قراء النصوص العربية

اكتشاف أكثر من ألف حالة مشبوهة

اختبر الباحثون الطريقة على مدونة لغوية روسية تحتوي على جمل مُعَلَّمة نحويًا. ضمن مجموعة فرعية من 8199 جملة، وجد النظام 1148 حالة يُمكن فيها إجراء أكثر من تحليل واحد.
ووفقًا لإيغور غولوفين، الأستاذ المشارك في كلية الرياضيات الحاسوبية وعلم التحكم الآلي بجامعة ولاية ميشيغان، فإن معظم هذه الاختلافات تتعلق بعلامات الترقيم، 1078 جملة من الجمل المُعلَّمة كانت مرتبطة بتعليم الفواصل.
تُعدّ هذه النتيجة مفيدةً لأنّ علامات الترقيم ليست مجرّد عنصرٍ شكليّ في معالجة اللغة، فالفاصلة قد تؤثّر على كيفية ترابط أجزاء الجملة، ممّا يؤثّر بدوره على كيفية تفسير الحاسوب لبنيتها النحوية.

يبقى القرار النهائي للبشر

يؤكّد الباحثون أنّ هذه الأداة ليست مُصمّمةً لاستبدال خبراء اللغة، بل هي بمثابة نظام فحص آليّ، يُحدّد المواضع التي يُحتمل فيها وجود تناقضات أو غموض، ممّا يُتيح للخبراء تركيز جهودهم على تلك الجمل بدلًا من مراجعة النصّ بأكمله من البداية إلى النهاية.
يُعدّ هذا الجمع بين الأتمتة ورأي الخبراء ذا قيمةٍ بالغةٍ عند بناء مجموعات بيانات لغوية عالية الجودة، لأنّ الحاسوب يُمكنه إجراء البحث المُكرّر بينما يُقرّر الإنسان ما إذا كانت الحالة المُحدّدة تُمثّل خطأً حقيقيًّا أم غموضًا لغويًّا مشروعًا.
الاكتئاب - سبوتنيك عربي, 1920, 10.08.2026
مجتمع
علماء روس يطورون ذكاء اصطناعيا يكشف الاكتئاب بدقة تتجاوز 96%

أهمية بيانات النصوص النظيفة للذكاء الاصطناعي

تعتمد أنظمة معالجة اللغة اعتمادًا كبيرًا على البيانات المستخدمة في تطويرها، فعندما تُصنَّف هذه الأمثلة بعناية وانتظام، تُصبح النماذج أكثر قدرة على فهم بنية اللغة. لذا، تُعالج طريقة جامعة موسكو مرحلةً مهمةً تحدث قبل تدريب العديد من أنظمة الذكاء الاصطناعي، وهي تحسين جودة البيانات اللغوية التي قد تعتمد عليها النماذج اللاحقة، وفقا لـبوابة روسيا العلمية.
عُرضت النتائج في المؤتمر العلمي "قراءات لومونوسوف"، ويشير الباحثون إلى أن أدوات مماثلة قد تكون مفيدة في إعداد بيانات لغوية مُصنَّفة لأنظمة الذكاء الاصطناعي، حيث تؤثر جودة التصنيف بشكل مباشر على دقة النماذج الناتجة.
شريط الأخبار
0
للمشاركة في المناقشة
قم بتسجيل الدخول أو تسجيل
loader
المحادثات
Заголовок открываемого материала