هل يمكننا كشف نقاط ضعف أنظمة الذكاء الاصطناعي قبل وقوع أخطاء خطيرة؟

© Photo / unsplash/Zachary Keimig
تابعنا عبر
طوّر باحثون في جامعة سانت بطرسبرغ الكهروتقنية "LETI" طريقة آلية للبحث عن ثغرات خفية في الشبكات العصبية المخصصة للرؤية الحاسوبية، وذلك قبل نشر هذه الأنظمة في تطبيقات تعتمد عليها السلامة بشكل حيوي.
وفي اختبارات شملت 1000 صورة، نجحت طريقة هجوم تقليدية في خداع الشبكة العصبية في 13% من الحالات، بينما نجحت إعدادات اختارها النظام الجديد تلقائياً في تحقيق ذلك بنسبة 58%، مع كون التشويهات في الصور أقل وضوحاً بنسبة 15% تقريباً.
ولا يتمثل الهدف في مهاجمة أنظمة الذكاء الاصطناعي فعلياً، بل في تزويد المطورين بأداة أقوى للتدقيق الأمني، تتيح لهم اكتشاف نقاط الضعف وإصلاحها في التقنيات المستخدمة في المركبات والطيران وغيرها من الأنظمة الآلية.
لماذا يمكن لتغيير طفيف في الصورة أن يخدع الذكاء الاصطناعي؟
تُستخدم أنظمة الرؤية الحاسوبية بشكل متزايد للتعرف على الأشياء وتصنيفها في السيارات والطائرات ووسائل النقل البحري وغيرها من الأنظمة الآلية أو شبه الآلية،ويمكن للقرارات التي تتخذها هذه الأنظمة أن تؤثر على كيفية استجابة المركبة لمحيطها، مما يجعل الموثوقية أمراً بالغ الأهمية.
وتتمثل إحدى المشكلات الأمنية الرئيسية فيما يُعرف بـ "المثال الخصمي" (adversarial example): وهي صورة تم تعديلها عمداً بطريقة قد تكون غير مرئية تقريباً للعين البشرية، لكنها قادرة على دفع الشبكة العصبية لتصنيف الجسم الموجود في الصورة بشكل خاطئ.
قد يرى الإنسان بوضوح أحد المشاة أو لافتة مرورية، بينما يرى نظام الذكاء الاصطناعي شيئاً مختلفاً تماماً، وفي البيئات التي تعتمد عليها السلامة، يُعد هذا الاختلاف أمراً جوهرياً؛ إذ يمكن لخطأ بسيط في التعرف على الأشياء أن يتحول إلى مشكلة تشغيلية أكبر بكثير.
مشكلة اختبار أنظمة الذكاء الاصطناعي يدوياً
يختبر المطورون بالفعل الشبكات العصبية ضد الهجمات الخصمية، ولكن وفقاً لباحثي جامعة "LETI"، غالباً ما تتطلب هذه العملية من المتخصصين اختيار أساليب الهجوم يدوياً، وضبط معاييرها، وتحديد الإعدادات الأكثر ملاءمة لنموذج معين.
وهذا الأمر يطرح صعوبتين:
أولاً، هناك احتمالات وتوليفات عديدة لأدوات الهجوم والإعدادات، مما يجعل استكشافها بشكل منهجي أمراً صعباً.
وثانياً، قد تعتمد النتائج بشكل كبير على خبرة وخيارات الخبير الفردي الذي يجري الاختبار.
لذا، طرح الباحثون سؤالاً عملياً: هل يمكن أتمتة عملية البحث عن الثغرات بحد ذاتها؟
وتمثلت إجابتهم في إنشاء إطار عمل مشترك يضم أدوات متنوعة لاختبار نماذج الرؤية الحاسوبية، ثم ترك خوارزمية تحسين تحدد أي مزيج من هذه الأدوات يكشف نقاط ضعف نموذج معين بأكبر قدر من الفعالية.
خوارزمية تبني استراتيجية الهجوم الخاصة بها
قسّم الفريق عملية اختبار الثغرات إلى ست وحدات قابلة للتبادل، وتشمل هذه الوحدات مكونات مثل دوال التهيئة (initializers)، ودوال الخسارة (loss functions)، وجداول التحكم (schedulers)، وتدرجات النموذج (model gradients). وببساطة، تتحكم كل وحدة في جزء مختلف من عملية إنشاء الصورة الخصمية (adversarial image) وتحسينها.
وبدلاً من الاعتماد على طريقة هجوم واحدة ثابتة، يمكن للنظام الجمع بين أدوات مختلفة من هذه الوحدات وتعديل معاملاتها (parameters) تلقائياً.
ثم تعامل الباحثون مع مسألة البحث عن أفضل إعدادات للنظام باعتبارها مشكلة "تحسين الصندوق الأسود" (black-box optimization)، مستخدمين تقنية التحسين (Bayesian optimization) إلى جانب خوارزمية تطورية طُوِّرت خصيصاً لهذا الغرض.
تعمل الخوارزميات التطورية من خلال توليد حلول محتملة بشكل متكرر، وتقييم أدائها، واستخدام الحلول الأكثر نجاحاً لإنتاج تركيبات محسّنة، وهذا يتيح للنظام استكشاف إعدادات الهجوم تلقائياً، بدلاً من إجبار الباحث على اختبارها بشكل فردي.
وأوضحت آلا بوريسوفنا ليفينا، رئيسة مختبر المبادئ الأساسية لبناء الأنظمة الذكية والأستاذة المشاركة في قسم أمن المعلومات بجامعة سانت بطرسبرغ الكهروتقنية "LETI"، أن الباحثين أنشأوا قاعدة بيانات موحدة لأدوات البحث عن الثغرات الموجودة حالياً، وطوّروا خوارزمية تحسين تطورية قادرة على دمج هذه الأدوات واختيار المعاملات المناسبة لشبكة عصبية معينة.
58% مقابل 13% مع تغييرات أقل وضوحاً للعين البشرية
لتقييم هذا النهج، قام الباحثون بتدريب شبكة عصبية تلافيفية (convolutional neural network) خاصة بهم للتعرف على الصور وتصنيفها، ثم أخضعوها لطرق مختلفة من اختبارات الهجوم الخصمي.
وقد قيّموا الهجمات باستخدام معيارين رئيسيين: معدل خداع الشبكة العصبية ومدى وضوح التغييرات التي طرأت على الصورة بالنسبة للمراقب البشري.
كان الفارق كبيراً، فقد تسببت خوارزمية تقليدية في جعل الشبكة العصبية ترتكب أخطاءً في 13% فقط من أصل 1,000 صورة خضعت للاختبار، فيالمقابل، نجحت الإعدادات التي اختارها النظام الجديد في تحقيق ذلك في 58% من الحالات. وفي الوقت نفسه، كانت التغييرات التي أُدخلت على الصور أقل بنسبة 15% تقريباً مقارنةً بالطريقة التقليدية.
وفقاً لـ "رومان راديونوف"، الباحث المساعد في المختبر وطالب الدراسات العليا في قسم أمن المعلومات بجامعة "LETI"، قد لا تبدو الصور المُعدَّلة للعين البشرية سوى "ضجيج" (تشويش) طفيف يظهر في صورة حُفظت عدة مرات، بدلاً من أن تبدو كتلاعب واضح ومقصود.
وتكتسب هذه التركيبة أهمية بالغة في مجال اختبارات الأمان؛ إذ تزداد خطورة الثغرة الأمنية عندما يسهل خداع نظام الذكاء الاصطناعي بتعديلٍ يظل من الصعب على البشر ملاحظته.
اكتشاف نقاط الضعف قبل طرح النظام
ينظر الباحثون إلى هذه التقنية في المقام الأول بوصفها أداةً لتدقيق أمان أنظمة الذكاء الاصطناعي، فقبل طرح نموذج للرؤية الحاسوبية، يمكن للمطورين استخدام هذا الإطار للكشف عن أنماط الفشل التي يصعب رصدها، ودراسة أنواع التلاعب التي تؤدي إلى حدوث أخطاء، ومن ثم تعزيز النموذج وحمايته ضدها.
وتكتسب هذه الخطوة أهمية خاصة بالنسبة للأنظمة التي تؤثر فيها الرؤية الحاسوبية على إجراءات مادية ملموسة، بما في ذلك المركبات ذاتية القيادة، ولا يعني هذا العمل أن الخوارزمية تضمن اكتشاف كل نقطة ضعف محتملة؛ بل تُظهر الاختبارات المُجراة أن الدمج والتحسين الآلي لأساليب الهجوم يمكن أن يكشفا عن ثغرات قد تغفل عنها الأساليب الفردية التقليدية.
التحدي القادم: اختبار الذكاء الاصطناعي من الخارج
يركز العمل الحالي على نماذج "الصندوق الأبيض" (white-box models)، مما يعني أن الباحثين يمتلكون صلاحية الوصول الكامل إلى البنية الداخلية ومعاملات الشبكة العصبية، ويخطط الفريق الآن للتعامل مع سيناريو أكثر تعقيداً، وهو نماذج "الصندوق الأسود" (black-box models).
في أنظمة الصندوق الأسود، لا يرى المُختبِر سوى المدخلات والمخرجات الخاصة بالنموذج، دون إمكانية الوصول إلى بنيته الداخلية؛ وهو وضع يحاكي إلى حد كبير الظروف الواقعية عند اختبار العديد من خدمات الذكاء الاصطناعي التجارية أو تلك التي توفرها جهات خارجية، ويهدف الباحثون إلى جعل خوارزميتهم قادرة على اكتشاف ثغرات فعالة ويصعب رصدها بشكل آلي، حتى في ظل هذه القيود.
كما يخططون لتوسيع نطاق هذا النهج القائم على الوحدات ليشمل -إلى جانب الصور- نماذج اللغة الكبيرة؛ إذ يمكن نظرياً تطبيق الفكرة الأساسية، المتمثلة في تقسيم اختبار الأمان إلى مكونات وإيجاد تركيبة فعالة لها آلياً،على أنظمة الذكاء الاصطناعي القائمة على النصوص أيضاً.
المصدر : | بوابة روسيا العلمية |



