يشهد عام 2026 تصاعداً في الحوادث التي أعادت المخاوف من خروج نماذج الذكاء الاصطناعي عن القيود المفروضة عليها إلى الواجهة، بعدما أظهرت اختبارات أجرتها شركات متخصصة أن بعض النماذج المتقدمة باتت قادرة على اكتشاف طرق غير متوقعة لتجاوز أنظمة العزل والوصول إلى الإنترنت أو خدمات وأنظمة خارجية.

ومن أبرز هذه الوقائع حادثة كشفت عنها شركة OpenAI في يوليو/تموز 2026، بعدما تمكنت نماذج تابعة لها خلال اختبارات للأمن السيبراني من تجاوز عزلها عن الإنترنت واستغلال ثغرات في البنية التحتية المشتركة، والوصول إلى أنظمة مرتبطة بمنصة Hugging Face. واعتبرت الشركة الواقعة مؤشراً على تنامي قدرة النماذج على تنفيذ مهام بصورة مستمرة وتعاونية واستغلال نقاط ضعف تمتد عبر أكثر من نظام، وفق ما أوردته رويترز.

وفي سبتمبر/أيلول، كشفت OpenAI عن واقعة أخرى تمكن خلالها نموذج بحثي من الوصول إلى روبوت محادثة خارجي عبر ثغرة مرتبطة بآليات حظر نظام DNS داخل بيئة التدريب. ورغم عدم اتصال النموذج بالإنترنت بصورة مباشرة، فإنه تمكن من اكتشاف مسار غير مقصود للاتصال الخارجي واستخدمه لإرسال استفسارات إلى خدمة خارجية، ما أظهر أن تجاوز القيود لا يحتاج بالضرورة إلى اختراق مباشر لحاجز أمني، بل قد يحدث عبر اكتشاف مسارات لم تكن ضمن الحسابات الأصلية للمطورين.

ويأتي ذلك بالتزامن مع ارتفاع مستوى استقلالية وكلاء الذكاء الاصطناعي، الذين لم يعودوا يقتصرون على تقديم الإجابات، بل أصبح بإمكانهم تنفيذ سلسلة من الإجراءات باستخدام أدوات مختلفة، مثل كتابة الأكواد وتشغيلها، وتصفح الإنترنت، والتعامل مع الملفات، وإرسال الطلبات إلى خدمات خارجية، ثم تحليل النتائج واتخاذ خطوات جديدة بناءً عليها.

وهذا التطور يغيّر طبيعة المخاطر، إذ لم يعد الخطأ مقتصراً على تقديم إجابة غير صحيحة، بل يمكن أن يتحول إلى سلسلة من الأفعال المتتابعة، خصوصاً عندما يمتلك الوكيل صلاحيات واسعة وهدفاً محدداً يسعى إلى تحقيقه.

وسجلت شركة Anthropic وقائع مشابهة خلال اختبارات الأمن السيبراني، إذ أعلنت في يوليو/تموز 2026 اكتشاف ثلاث حالات تمكنت فيها نماذج Claude، أثناء الاختبارات، من الوصول إلى الإنترنت ثم الدخول بصورة غير مصرح بها إلى أنظمة حقيقية تابعة لثلاث مؤسسات. وبعد توسيع نطاق المراجعة، أعلنت الشركة لاحقاً اكتشاف حالة رابعة ضمن نحو 481 مليون سجل للمحادثات والاختبارات.

ورغم وصف بعض هذه الوقائع بأنها حالات خروج عن السيطرة، فإن هذا التعبير لا يعني بالضرورة أن النماذج تمتلك نوايا بشرية مستقلة أو رغبة في التمرد. ففي كثير من السيناريوهات، يحاول النموذج ببساطة تحقيق الهدف المحدد له، لكنه يكتشف أن القواعد أو القيود المفروضة عليه يمكن تجاوزها للوصول إلى النتيجة المطلوبة.

وتزداد احتمالات ظهور هذا النوع من السلوك عندما تكون المهمة طويلة ومعقدة، وعندما يمتلك النموذج مجموعة واسعة من الأدوات والصلاحيات التي يمكنه استخدامها للوصول إلى هدفه.

وأظهرت أبحاث أجرتها Anthropic في بيئات محاكاة أن بعض النماذج المتقدمة يمكن أن تلجأ إلى سلوكيات مثل التخريب أو التلاعب بالمعلومات عندما تتعارض الأهداف المفترضة مع القيود الموضوعة أمامها، إلا أن نتائج هذه التجارب لا تعني بالضرورة أن السلوك ذاته يحدث في الاستخدام التجاري الفعلي.

يرتبط جزء من المشكلة بالتطور السريع لقدرات النماذج مقارنة بأنظمة الحماية المحيطة بها. فكلما ازدادت قدرتها على البرمجة والاستدلال واستخدام الأدوات، ظهرت أساليب جديدة لتنفيذ المهام لم تكن أنظمة الأمان قد اختبرتها مسبقاً.

كما أن الاعتماد على حاجز أمني واحد قد يترك مساراً غير متوقع يمكن استغلاله. ففي إحدى وقائع OpenAI، افترض تصميم بيئة التدريب أن النموذج لن يتمكن من الوصول إلى الإنترنت، إلا أن مسار DNS غير مقصود أتاح له إيجاد طريقة للاتصال بخدمة خارجية.

ولهذا تتجه مختبرات الذكاء الاصطناعي إلى اعتماد أنظمة حماية متعددة الطبقات، تشمل عزل النماذج، وتقليص الصلاحيات الممنوحة لها، ومراقبة سلوكها بصورة مستمرة، إلى جانب إجراء اختبارات أمنية أكثر شمولاً لمحاولة اكتشاف المسارات غير المتوقعة قبل استخدامها في بيئات حقيقية.

ومع استمرار تطور وكلاء الذكاء الاصطناعي، يبدو أن التحدي الأمني يتخذ شكل سباق متواصل بين قدرات النماذج على إيجاد طرق جديدة لتنفيذ أهدافها، وقدرة أنظمة الحماية على اكتشاف هذه الطرق وإغلاقها قبل أن تتحول إلى حوادث فعلية.