23 июля, Институт безопасности ИИ представляет первые результаты работы своей команды, занимающейся мерами контроля. Здесь «контролер» – это модель, которая анализирует действия или рассуждения агента, чтобы выявить потенциально опасное поведение, как до, так и после его выполнения, в зависимости от системы.
Исследования, проведенные с Google DeepMind и Anthropic, выявили уязвимости и способствовали разработке новых корректировок. Институт также ведет автоматизированный поиск уязвимостей. Подчеркивается сложность: смоделированный атакующий может получать информацию или варианты для тестирования, которые агент, развернутый в реальной среде, не получит. Поэтому поиск обходных путей не позволяет напрямую оценить его вероятность в реальной ситуации.
Почему это касается наших исследований?
Надзор сочетает в себе инструмент и процедуру. Для Fondation UvH необходимо проанализировать, кто получает оповещение, кто может приостановить действие, и как ошибки контроллера обсуждаются. Выбор объектов, подлежащих контролю, так же важен, как и производительность модели, отвечающей за их анализ.
Эти исследования показывают, как необходимо проверять эффективность защиты, а не просто предполагать её. Они также напоминают, что передача контроля другой ИИ переносит часть проблемы: необходимо оценивать надежность самого контролирующего ИИ.
