https://sarabic.ae/20260811/باحثون-روس-يطورون-طريقة-لاكتشاف-الأخطاء-في-نصوص-تدريب-الذكاء-الاصطناعي-1115950690.html
باحثون روس يطورون طريقة لاكتشاف الأخطاء في نصوص تدريب الذكاء الاصطناعي
باحثون روس يطورون طريقة لاكتشاف الأخطاء في نصوص تدريب الذكاء الاصطناعي
سبوتنيك عربي
طور علماء في جامعة موسكو الحكومية طريقةً للكشف التلقائي عن الأخطاء والتناقضات المحتملة في مجموعات النصوص المشروحة، وهي مجموعات من الجمل المصنفة بعناية... 11.08.2026, سبوتنيك عربي
2026-08-11T19:24+0000
2026-08-11T19:24+0000
2026-08-11T19:24+0000
مجتمع
علوم
العالم
أخبار الأبحاث العلمية
جامعات روسية
ذكاء اصطناعي
https://cdn.img.sarabic.ae/img/07e9/08/1a/1104169300_0:67:640:427_1920x0_80_0_0_5d01665ccdac8252f4488c59632c33ac.jpg
في اختبار شمل 8199 جملة، حددت الطريقة 1148 حالة ذات تحليلات متعددة محتملة، ومن اللافت للنظر أن 1078 حالة منها كانت مرتبطة بشرح الفواصل، ما يكشف كيف يمكن حتى لقرارات الترقيم الصغيرة أن تُحدث تناقضات كبيرة في مجموعات البيانات اللغوية.لماذا يحتاج الذكاء الاصطناعي إلى نصوص مشروحة؟قبل أن يتمكن الحاسوب من تعلم تحليل اللغة، غالبًا ما يُعد الباحثون مجموعات بيانات خاصة تم فيها تحديد بنية كل جملة مسبقًا بواسطة خبراء بشريين. تُوفّر مجموعات البيانات هذه، المعروفة باسم "المجموعات اللغوية المُعَلَّمة"، أمثلةً تُوضّح كيفية ترابط الكلمات وأجزاء الجمل، ويمكن استخدامها عند تطوير أنظمة التحليل اللغوي الآلي.دع المجموعة اللغوية تدقق نفسهااقترح باحثو جامعة موسكو حلاً أنيقاً، حيث يقومون بإنشاء نموذج تلقائياً من المجموعة اللغوية المُعَلَّمة نفسها، ويطلبون منه إعادة إنتاج الأنماط الهيكلية الموجودة في البيانات.إذا اكتشف النظام أن الجملة نفسها يُمكن تحليلها هيكلياً بعدة طرق مختلفة، فهذا يُصبح مؤشراً تحذيرياً، ولا يعني هذا الاختلاف بالضرورة أن التعابير خاطئة، فاللغة الطبيعية قد تكون غامضةً بالفعل، ولكنه يُرشد الخبراء بدقة إلى المواضع التي ينبغي عليهم التدقيق فيها أكثر.اكتشاف أكثر من ألف حالة مشبوهةاختبر الباحثون الطريقة على مدونة لغوية روسية تحتوي على جمل مُعَلَّمة نحويًا. ضمن مجموعة فرعية من 8199 جملة، وجد النظام 1148 حالة يُمكن فيها إجراء أكثر من تحليل واحد.ووفقًا لإيغور غولوفين، الأستاذ المشارك في كلية الرياضيات الحاسوبية وعلم التحكم الآلي بجامعة ولاية ميشيغان، فإن معظم هذه الاختلافات تتعلق بعلامات الترقيم، 1078 جملة من الجمل المُعلَّمة كانت مرتبطة بتعليم الفواصل.يبقى القرار النهائي للبشريؤكّد الباحثون أنّ هذه الأداة ليست مُصمّمةً لاستبدال خبراء اللغة، بل هي بمثابة نظام فحص آليّ، يُحدّد المواضع التي يُحتمل فيها وجود تناقضات أو غموض، ممّا يُتيح للخبراء تركيز جهودهم على تلك الجمل بدلًا من مراجعة النصّ بأكمله من البداية إلى النهاية.أهمية بيانات النصوص النظيفة للذكاء الاصطناعيتعتمد أنظمة معالجة اللغة اعتمادًا كبيرًا على البيانات المستخدمة في تطويرها، فعندما تُصنَّف هذه الأمثلة بعناية وانتظام، تُصبح النماذج أكثر قدرة على فهم بنية اللغة. لذا، تُعالج طريقة جامعة موسكو مرحلةً مهمةً تحدث قبل تدريب العديد من أنظمة الذكاء الاصطناعي، وهي تحسين جودة البيانات اللغوية التي قد تعتمد عليها النماذج اللاحقة، وفقا لـبوابة روسيا العلمية.عُرضت النتائج في المؤتمر العلمي "قراءات لومونوسوف"، ويشير الباحثون إلى أن أدوات مماثلة قد تكون مفيدة في إعداد بيانات لغوية مُصنَّفة لأنظمة الذكاء الاصطناعي، حيث تؤثر جودة التصنيف بشكل مباشر على دقة النماذج الناتجة.
https://sarabic.ae/20260707/لإنقاذ-المخطوطات-التاريخية-علماء-روس-يطورون-ذكاء-اصطناعيا-يتيح-قراء-النصوص-العربية--1115024164.html
https://sarabic.ae/20260810/علماء-روس-يطورون-ذكاء-اصطناعيا-يكشف-الاكتئاب-بدقة-تتجاوز-96-1115924255.html
سبوتنيك عربي
feedback.arabic@sputniknews.com
+74956456601
MIA „Rossiya Segodnya“
2026
سبوتنيك عربي
feedback.arabic@sputniknews.com
+74956456601
MIA „Rossiya Segodnya“
الأخبار
ar_EG
سبوتنيك عربي
feedback.arabic@sputniknews.com
+74956456601
MIA „Rossiya Segodnya“
https://cdn.img.sarabic.ae/img/07e9/08/1a/1104169300_0:0:570:427_1920x0_80_0_0_fb3a0fad8c4345d64a68d6be3b4de7b6.jpgسبوتنيك عربي
feedback.arabic@sputniknews.com
+74956456601
MIA „Rossiya Segodnya“
علوم, العالم, أخبار الأبحاث العلمية, جامعات روسية, ذكاء اصطناعي
علوم, العالم, أخبار الأبحاث العلمية, جامعات روسية, ذكاء اصطناعي
باحثون روس يطورون طريقة لاكتشاف الأخطاء في نصوص تدريب الذكاء الاصطناعي
طور علماء في جامعة موسكو الحكومية طريقةً للكشف التلقائي عن الأخطاء والتناقضات المحتملة في مجموعات النصوص المشروحة، وهي مجموعات من الجمل المصنفة بعناية والمستخدمة لتدريب وتقييم أنظمة معالجة اللغة، ومن خلال تحديد الجمل التي يمكن تفسيرها بأكثر من طريقة، يساعد النظام الخبراء على تحديد الشروح المشكوك فيها بسرعة أكبر بكثير من فحص آلاف الجمل يدويًا.
في اختبار شمل 8199 جملة، حددت الطريقة 1148 حالة ذات تحليلات متعددة محتملة، ومن اللافت للنظر أن 1078 حالة منها كانت مرتبطة بشرح الفواصل، ما يكشف كيف يمكن حتى لقرارات الترقيم الصغيرة أن تُحدث تناقضات كبيرة في مجموعات البيانات اللغوية.
لماذا يحتاج الذكاء الاصطناعي إلى نصوص مشروحة؟
قبل أن يتمكن الحاسوب من تعلم تحليل اللغة، غالبًا ما يُعد الباحثون مجموعات بيانات خاصة تم فيها تحديد بنية كل جملة مسبقًا بواسطة خبراء بشريين. تُوفّر مجموعات البيانات هذه، المعروفة باسم "المجموعات اللغوية المُعَلَّمة"، أمثلةً تُوضّح كيفية ترابط الكلمات وأجزاء الجمل، ويمكن استخدامها عند تطوير أنظمة التحليل اللغوي الآلي.
تُعدّ جودة هذه التعابير بالغة الأهمية، فإذا احتوت مجموعة البيانات على تصنيفات هيكلية غير متسقة أو غير صحيحة، فقد يتعلّم النموذج المُدرَّب عليها هذه الأخطاء إلى جانب الأنماط الصحيحة، وتكمن الصعوبة في الحجم، إذ قد تحتوي المجموعات اللغوية الكبيرة على آلاف أو ملايين العناصر المُعَلَّمة، مما يجعل التحقق اليدوي الكامل عمليةً بطيئةً وشاقة.
دع المجموعة اللغوية تدقق نفسها
اقترح باحثو جامعة موسكو حلاً أنيقاً، حيث يقومون بإنشاء نموذج تلقائياً من المجموعة اللغوية المُعَلَّمة نفسها، ويطلبون منه إعادة إنتاج الأنماط الهيكلية الموجودة في البيانات.
إذا اكتشف النظام أن الجملة نفسها يُمكن تحليلها هيكلياً بعدة طرق مختلفة، فهذا يُصبح مؤشراً تحذيرياً، ولا يعني هذا الاختلاف بالضرورة أن التعابير خاطئة، فاللغة الطبيعية قد تكون غامضةً بالفعل، ولكنه يُرشد الخبراء بدقة إلى المواضع التي ينبغي عليهم التدقيق فيها أكثر.
بهذا المعنى، يعمل النظام كمرشح لمراقبة الجودة، فبدلاً من محاولة استبدال اللغويين، يُضيّق نطاق آلاف المشكلات المحتملة إلى مجموعة أصغر بكثير تتطلب مراجعة بشرية.
اكتشاف أكثر من ألف حالة مشبوهة
اختبر الباحثون الطريقة على مدونة لغوية روسية تحتوي على جمل مُعَلَّمة نحويًا. ضمن مجموعة فرعية من 8199 جملة، وجد النظام 1148 حالة يُمكن فيها إجراء أكثر من تحليل واحد.
ووفقًا لإيغور غولوفين، الأستاذ المشارك في كلية الرياضيات الحاسوبية وعلم التحكم الآلي بجامعة ولاية ميشيغان، فإن معظم هذه الاختلافات تتعلق بعلامات الترقيم، 1078 جملة من الجمل المُعلَّمة كانت مرتبطة بتعليم الفواصل.
تُعدّ هذه النتيجة مفيدةً لأنّ علامات الترقيم ليست مجرّد عنصرٍ شكليّ في معالجة اللغة، فالفاصلة قد تؤثّر على كيفية ترابط أجزاء الجملة، ممّا يؤثّر بدوره على كيفية تفسير الحاسوب لبنيتها النحوية.
يبقى القرار النهائي للبشر
يؤكّد الباحثون أنّ هذه الأداة ليست مُصمّمةً لاستبدال خبراء اللغة، بل هي بمثابة نظام فحص آليّ، يُحدّد المواضع التي يُحتمل فيها وجود تناقضات أو غموض، ممّا يُتيح للخبراء تركيز جهودهم على تلك الجمل بدلًا من مراجعة النصّ بأكمله من البداية إلى النهاية.
يُعدّ هذا الجمع بين الأتمتة ورأي الخبراء ذا قيمةٍ بالغةٍ عند بناء مجموعات بيانات لغوية عالية الجودة، لأنّ الحاسوب يُمكنه إجراء البحث المُكرّر بينما يُقرّر الإنسان ما إذا كانت الحالة المُحدّدة تُمثّل خطأً حقيقيًّا أم غموضًا لغويًّا مشروعًا.
أهمية بيانات النصوص النظيفة للذكاء الاصطناعي
تعتمد أنظمة معالجة اللغة اعتمادًا كبيرًا على البيانات المستخدمة في تطويرها، فعندما تُصنَّف هذه الأمثلة بعناية وانتظام، تُصبح النماذج أكثر قدرة على فهم بنية اللغة. لذا، تُعالج طريقة جامعة موسكو مرحلةً مهمةً تحدث قبل تدريب العديد من أنظمة الذكاء الاصطناعي، وهي تحسين جودة البيانات اللغوية التي قد تعتمد عليها النماذج اللاحقة، وفقا لـ
بوابة روسيا العلمية.
عُرضت النتائج في المؤتمر العلمي "قراءات لومونوسوف"، ويشير الباحثون إلى أن أدوات مماثلة قد تكون مفيدة في إعداد بيانات لغوية مُصنَّفة لأنظمة الذكاء الاصطناعي، حيث تؤثر جودة التصنيف بشكل مباشر على دقة النماذج الناتجة.