Agentic Red Teaming: فحص السلاسل الوكيلية
كيف يُجرى فحص هجومي موجّه للوكلاء يستهدف السلسلة الكاملة لا الردود النصية المفردة.
مقدمة
الفحص الهجومي التقليدي للنماذج يركّز على المخرجات النصية: هل يمكن دفع النموذج لقول شيء غير لائق؟ هذا السؤال غير كافٍ للوكلاء، لأن الضرر لا يقع في الجملة بل في الفعل. السؤال الصحيح: هل يمكن دفع الوكيل لتنفيذ سلسلة أفعال تنتهي بضرر حقيقي؟
المفهوم الأساسي
الفحص الوكيلي يستهدف السلسلة كاملة: المدخل غير الموثوق، ثم بناء السياق، ثم قرار اختيار الأداة، ثم تنفيذ الفعل، ثم أثره في النظام الهدف. أهم المسارات التي تستحق التغطية:
- إدخال تعليمات عبر محتوى يقرأه الوكيل من مصدر خارجي.
- استغلال توصيف أداة لتوجيه الوكيل نحو استدعاء غير مقصود.
- تجاوز حدود النطاق بالانتقال من قراءة إلى كتابة عبر خطوات متتابعة.
- إساءة استخدام سلسلة وكلاء لتمرير فعل محظور عبر وكيل يثق بآخر.
- استنزاف الموارد بحلقات تكرار غير محدودة.
معيار النجاح ليس عدد الحالات المجرَّبة، بل تغطية كل أداة عالية الأثر بمسار واحد على الأقل، وتوثيق نقطة الانكسار بدقة تسمح ببناء ضابط مقابل.
مثال عملي
فريق أمني وضع مستنداً في مجلد مشترك يقرأه وكيل تلخيص داخلي، وأدرج داخله نصاً يوجّه الوكيل لإرسال ملخص إلى عنوان خارجي. نجح المسار في المحاولة الأولى لأن الوكيل يملك أداة إرسال بريد بلا قائمة وجهات مسموحة. النتيجة قادت مباشرة إلى ضابط جديد: حصر وجهات الإرسال في نطاقات داخلية معتمدة.
أخطاء شائعة
- الاكتفاء بتجريب مطالبات نصية دون متابعة الأفعال المنفذة.
- إجراء الفحص مرة واحدة قبل الإطلاق ثم إهماله بعد إضافة أدوات.
- تنفيذ الفحص في بيئة لا تشبه الإنتاج فتغيب مسارات حقيقية.
- توثيق النتيجة كنجاح أو فشل دون تحديد نقطة الانكسار والضابط المقترح.
الإسناد إلى المعايير
ابنِ سيناريوهات الفحص على قوائم المخاطر المنشورة بدل الارتجال: مخاطر OWASP لتطبيقات النماذج اللغوية والأنظمة الوكيلية تغطي حقن التعليمات، وإساءة استخدام الأدوات، والاستقلالية المفرطة، وتسرّب السياق. النتائج تُغذّي وظيفة القياس في NIST AI RMF كدليل موثّق.
الخطر والضابط والدليل
| الخطر | الضابط | الدليل |
|---|---|---|
| حقن تعليمات عبر مدخل خارجي | سيناريوهات فحص موجّهة للوكيل | ورقة سيناريوهات الفحص (Red Team Scenario Sheet) |
| إساءة استخدام أداة مسموحة | فحص تصعيد الصلاحيات | تقرير نتائج الفحص (Adversarial Findings Report) |
| تكرار الثغرة بعد المعالجة | إعادة فحص بعد الإصلاح | سجل معالجة الثغرات (Remediation Tracking Log) |
ماذا تطبق عملياً؟
- ابنِ مكتبة سيناريوهات هجوم موجّهة للوكلاء لا للنماذج فقط.
- اختبر حقن التعليمات عبر المدخلات الخارجية الحقيقية.
- افحص إساءة استخدام الأدوات وتصعيد الصلاحيات.
- وثّق كل سيناريو بنتيجته والضابط الذي أوقفه أو فشل.
أدلة ومخرجات
- ورقة سيناريوهات الفحص الهجومي (Red Team Scenario Sheet)
- تقرير نتائج الفحص (Adversarial Findings Report)
- سجل معالجة الثغرات (Remediation Tracking Log)
خلاصة عملية
اجعل الفحص موجّهاً بالأثر: غطّ كل أداة عالية الأثر، تتبّع السلسلة حتى النظام الهدف، وأعد التشغيل عند كل تغيير في الأدوات أو الصلاحيات أو مصادر المحتوى.