الأحدث الأكثر رواجاً استكشف الخطوط الزمنية التصنيفات
←كل الشروحات

شرح تقني

كيف تستغل الهجمات متعددة الجولات وكلاء الذكاء الاصطناعي؟

تخفي الهجمات متعددة الجولات هدفا محظورا واحدا داخل طلبات قد تبدو مقبولة منفردة. وتتطلب حماية الوكلاء الذين يستخدمون الأدوات تتبع النية والحالة والصلاحيات وآثار الأفعال عبر سير العمل كله، من دون تعطيل الأعمال المشروعة متعددة الخطوات.

تستغل الهجمات متعددة الجولات وكيل الذكاء الاصطناعي بتوزيع هدف محظور على سلسلة من الطلبات التي قد تبدو مقبولة إذا فُحص كل واحد منها منفردا. يحتفظ الوكيل بسياق المحادثة ونتائج الأدوات والملفات والقرارات السابقة، ويستغل المهاجم هذا الاستمرار حتى تهيئ كل خطوة ما بعدها من دون إعلان الخطة كاملة في رسالة واحدة.

نمط الهجوم في 30 ثانية

  • إخفاء الغاية النهائية. تبدأ المحادثة بدور مقنع أو سؤال بحثي أو مهمة إعداد تبدو عادية.
  • تكوين حالة قابلة للاستخدام. تجمع كل جولة معلومة أو تنشئ ملفا أو تغير إعدادا أو تثبت مقدمة.
  • التكيف بعد الرفض. إذا رفض الوكيل، يعاد تأطير الخطوة التالية أو تضييقها أو تمريرها عبر أداة أخرى.
  • استغلال صلاحيات الأدوات. يرتفع الأثر عندما يستطيع الوكيل التصفح أو تنفيذ الشفرة أو تعديل الملفات أو إرسال الرسائل أو تشغيل خدمة خارجية.
  • إتمام الهدف بالتراكم. تتجمع أفعال مسموحة ظاهريا لتنتج نتيجة كان ينبغي منعها.

لماذا يفشل فحص كل رسالة منفردة؟

يسأل المرشح أحادي الجولة: «هل هذا الطلب ضار؟». أما الحماية التي تفهم الحالة فعليها أن تسأل أيضا: «ماذا فعلت المحادثة حتى الآن، وأي نتيجة ستقربها الخطوة التالية؟». السؤالان مختلفان.

قد يكون جمع معلومة عامة وتحويل بيانات وحفظ ملف أعمالا مشروعة كل على حدة. لكن جمعها قد يخدم غاية محظورة بحسب الهدف والبيانات وما ستفعله الأداة التالية. تكمن الخطورة في سير العمل، لا في جملة واحدة بالضرورة.

تزداد المشكلة مع وكيل الذكاء الاصطناعي. قد يبقى خطأ روبوت المحادثة نصا على الشاشة، بينما يستطيع الوكيل حفظ الحالة والتأثير في نظام خارجي، فيستخدم فشل الجولة العاشرة صلاحيات وملفات جُمعت خلال الجولات السابقة.

كيف يتطور التلاعب؟

  1. تأسيس سياق سليم ظاهريا. يعرض المستخدم وظيفة أو تعليما أو تصحيحا تقنيا أو إجراء إداريا مقنعا.
  2. طلب عنصر منفرد. يقدم الوكيل معلومة أو إجراء له استخدامات مشروعة كثيرة.
  3. حفظ النتيجة. تدخل المخرجات إلى الذاكرة أو ملف أو قاعدة بيانات أو جلسة متصفح أو أداة أخرى.
  4. إضافة عنصر جديد. يعتمد الطلب التالي على الحالة السابقة من دون كشف الغاية الكاملة.
  5. اختبار الحدود. يكشف الرفض الكلمة أو الأداة أو الإجراء الذي فعّل الحماية.
  6. تغيير الطريق. تتبدل الصياغة أو اللغة أو التنسيق أو الأداة مع بقاء الغاية نفسها.
  7. تنفيذ الخطوة المؤثرة. تجعل الحركة الأخيرة الأجزاء السابقة قابلة للاستخدام.

لا يتطلب ذلك أن «ينسى» النموذج قواعده. قد يصنف كل خطوة محلية تصنيفا خاطئا لأن منطق السلامة لا يمثل الغاية المتراكمة.

التلاعب المتتابع ليس حقن التعليمات

الخطر مصدر التعليمات نوع الفشل
التلاعب متعدد الجولات مستخدم أو وكيل آخر عبر محادثة تتراكم أفعال معقولة منفردة لتصنع خطة محظورة
حقن التعليمات محتوى غير موثوق يقرؤه الوكيل مثل صفحة أو مستند أو رسالة يُعامل نص خارجي كأنه أمر مصرح به
إساءة استخدام الصلاحيات طلب يبدو مشروعا لكنه يستخدم وصولا زائدا يسمح النظام بفعل يتجاوز حاجة المستخدم أو المهمة
تلويث الذاكرة حالة خاطئة أو ضارة تُحفظ للمستقبل تثق القرارات التالية في معلومة لم تتحقق منها

قد تتجمع هذه المخاطر. توجه المحادثة الوكيل إلى مستند يحوي تعليما مزروعا، فيستدعي أداة ذات صلاحية ويخزن نتيجة مضللة في الذاكرة. لذلك تتبع الحماية البيانات والتعليمات والصلاحيات والنية معا.

لماذا تزيد الأدوات أثر الفشل؟

تحول الأدوات اللغة إلى نتائج. قد يعرض التصفح الوكيل إلى تعليمات غير موثوقة، وينفذ الكود تحويلا أو فعلا على البيانات، ويكشف الوصول إلى الملفات معلومات دائمة أو يغيرها، وتؤثر الرسائل والمدفوعات في أشخاص أو أصول.

السؤال الصحيح ليس هل الأداة قوية عموما، بل هل تحتاج المهمة الحالية إلى القدرة المطلوبة، على الهدف المحدد، في هذه اللحظة. تحد الصلاحية الدنيا من الضرر: القراءة لا تعني الكتابة، وإعداد المسودة لا يعني الإرسال، والوصول إلى ملف أو مستلم لا يعني الوصول إلى الجميع.

تستطيع بيئة عزل وكيل الذكاء الاصطناعي تقييد الملفات والشبكات والعمليات وبيانات الدخول، لكن العزل لا يقرر وحده هل الفعل المسموح مناسب. يجمع النظام الآمن الاحتواء مع فحص السياسة وتفويض المستخدم.

ما الذي ينبغي للحماية الاحتفاظ به؟

  • الهدف المعلن: ما قال المستخدم إنه يريد إنجازه.
  • سير العمل المستنتج: النتيجة الأوسع التي توحي بها السلسلة، مع التعبير عن عدم اليقين لا إصدار اتهام دائم.
  • الكيانات الحساسة: الأشخاص والحسابات والأنظمة والاعتمادات والمواقع والبيانات المحمية.
  • الأفعال المكتملة: الملفات المكتوبة والخدمات المستدعاة والمعلومات المسترجعة والصلاحيات المستخدمة.
  • الرفض واختبار الحدود: محاولات الوصول إلى النتيجة المحظورة نفسها بصيغ مختلفة.
  • الأثر المتبقي: ما ستجعله الأداة التالية ممكنا عند جمعه بالحالة الموجودة.

تخلق الذاكرة مخاطر للخصوصية والإنذارات الكاذبة أيضا. ينبغي الاحتفاظ بأقل حالة لازمة للسلامة وحمايتها وتحديد مدة لها والسماح للمستخدم السليم بتصحيح فهم خاطئ.

كيف تُحمى العملية كاملة؟

الضابط الفائدة ما لا يحله وحده
تتبع النية عبر المحادثة يربط الأفعال بين الجولات وإعادة الصياغة قد يكون استنتاج النية غير مؤكد أو منحازا
فحص كل أداة قبل التنفيذ يفحص الأداة والهدف والمعاملات والأثر قد يصبح الفعل المسموح ضارا عند جمعه بغيره
بيانات دخول بأقل صلاحية تحد الأنظمة والبيانات الممكن الوصول إليها لا تمنع الإساءة داخل النطاق المسموح
تأكيد المستخدم يفرض موافقة صريحة على التغييرات عالية الأثر قد يوافق المستخدم على شرح مضلل أو غامض
حدود المعدل والتسلسل تقلل التراكم السريع واختبار الحدود المتكرر تبقى الهجمات البطيئة والأعمال الطويلة المشروعة صعبة
سجل تدقيق واسترجاع يدعمان التحقيق والإصلاح لا يمكن عكس بعض الأفعال الخارجية

ينبغي أن يعمل ضابط الأمان في عدة طبقات: جواب النموذج والخطة واختيار الأداة وحدود الصلاحية ومراقبة ما بعد التنفيذ.

لماذا يحتاج التأكيد إلى سياق؟

لا يكفي سؤال «هل تسمح بهذا الإجراء؟» إذا لم ير المستخدم ما تراكم. يوضح التأكيد الجيد الهدف والبيانات المتأثرة والنتيجة الخارجية وهل يمكن عكسها وعلاقتها بالخطوات السابقة. ويظهر قرب الفعل المؤثر، لا في البداية كموافقة عامة على سير غير معروف.

كما يحافظ الوكيل على الفرق بين الإعداد والتنفيذ. يستطيع صياغة رسالة من دون إرسالها، أو عرض أمر مقترح من دون تشغيله، أو تجهيز معاملة من دون تقديمها. تمنح هذه النقاط الإنسان فرصة حقيقية لفحص التركيب النهائي.

كيف تُختبر السلامة متعددة الجولات؟

تحتاج التقييمات إلى محادثات متكيفة، لا قوائم ثابتة من الأسئلة فقط. يستطيع الاختبار تغيير الشخصية واللغة والترتيب والأدوات المتاحة والاستجابة للرفض. ويجب أن يشمل أعمالا سليمة تشبه الأعمال الضارة، لأن منع كل شيء يصنع وكيلا غير مفيد يبدو آمنا على الورق.

تشمل المقاييس المفيدة اكتمال المهمة المحظورة، وتوقيت الرفض، والتقدم الجزئي الضار، وإتمام الأعمال السليمة، والمقاطعة غير اللازمة، وتصعيد الصلاحيات، وقدرة النظام على التعافي من سياق مضلل. وتظل المراجعة البشرية مهمة لأن المقيم الآلي قد يسيء فهم حالة الأداة أو يعد سلسلة ناقصة نجاحا.

ماذا أضاف بحث STING؟

غطت نيو تقنية إطار STING الذي طوره باحثو EPFL لتقسيم أهداف معيارية ضارة إلى مراحل محادثة متكيفة. عبر 176 حالة مشتقة من 44 سيناريو، رفعت الطريقة المتعددة الجولات إتمام المهام المحظورة مقارنة بالطلب المباشر: طلبات تبدو بريئة قد تقود وكيلا إلى تنفيذ هدف ضار.

تكشف النتيجة ثغرة في تقييم الرسالة الواحدة، لكنها لا تحدد معدل الهجمات الواقعية ولا تثبت فشل كل وكيل منشور بالطريقة نفسها. استخدمت الدراسة أدوات محكومة ومقيمين آليين، بينما قد تضيف المنتجات صلاحيات ومراقبة وضوابط مرتبطة بالتطبيق.

نتيجة المعيار تحذير وليست إحصاء للاختراقات

تعتمد الزيادة النسبية على خط الأساس والسيناريو والنموذج واللغة والأدوات وتعريف الاكتمال. يستطيع المعيار كشف فشل قابل للتكرار من دون توقع شيوعه في الاستخدام. نحتاج إلى تكرار مستقل وتحقق بشري وصلاحيات تشبه الإنتاج وتحليل واضح للأخطاء قبل تحويل رقم واحد إلى حكم عام على سلامة الوكلاء.

الصورة التي تستحق التذكر

يخفي الهجوم متعدد الجولات وحدة التحليل الخطرة. تبدو الرسالة سليمة، بينما يصبح سير العمل ضارا. لذلك تتطلب حماية الوكيل تتبع الهدف المتغير والحالة المتراكمة وأثر الأدوات وحدود الصلاحية عبر التفاعل كله، مع الحفاظ على قدرة المستخدمين على إنجاز أعمال مشروعة متعددة الخطوات.

ظهر أول مرة في

طلبات تبدو بريئة قد تقود وكيل الذكاء الاصطناعي إلى تنفيذ هدف ضار

يتوفر إصدار جديد من نيو تقنية.