في 23 يوليو، قدم معهد أمن الذكاء الاصطناعي النتائج الأولية لفريقه الذي يركز على تدابير الرقابة. هنا، "الرقابة" تعني نموذجًا يقوم بفحص أفعال أو عمليات أي وكيل، بهدف تحديد أي سلوكيات خطيرة، سواء قبل أو بعد تنفيذها، وفقًا للنظام المعتمد.
أظهرت التجارب التي أجريت مع Google DeepMind و Anthropic نقاط ضعف، وساهمت في تطوير تصحيحات مستمرة. كما أن المؤسسة تجري بحثًا تلقائيًا لاكتشاف الهجمات. ويشيرون إلى صعوبة: يمكن لمهاجم محاكاة أن يحصل على معلومات أو خيارات تجريب لا يمتلكها وكيل نشط. لذا، فإن إيجاد حل أو طريقة للالتفاف لا يقيس بشكل مباشر احتمالية نجاحه في بيئة حقيقية.
لماذا هذا يتعلق ببحثنا؟
تجمع المراقبة أداة وإجراء. فيما يتعلق بـ "Fondation UvH"، يجب تحديد من يتلقى تنبيهًا، ومن يمكنه تعليق إجراء، وكيف يتم مناقشة الأخطاء التي يرتكبها النظام. اختيار الإجراءات التي يتم مراقبتها مهم بنفس القدر مثل أداء النموذج المسؤول عن فحصها.
هذه الأعمال تُظهر كيف يمكن إثبات فعالية الحماية بدلاً من افتراضها. كما أنها تذكر بأن تفويض المراقبة إلى ذكاء اصطناعي آخر يمثل جزءًا من المشكلة: يجب تقييم موثوقية المتحكم نفسه.
