El 23 de julio, el AI Security Institute presentó el primer trabajo de su equipo especializado en medidas de control. En este caso, un monitor es un modelo que examina las acciones o el razonamiento de un agente para detectar conductas peligrosas, antes o después de su ejecución según el diseño.
Las pruebas realizadas con Google DeepMind y Anthropic revelaron debilidades y permitieron introducir correcciones sucesivas. El instituto también experimenta con la búsqueda automatizada de ataques. Señala una dificultad: un atacante simulado puede recibir información u oportunidades de prueba inaccesibles para un agente desplegado. Detectar una vía de evasión, por tanto, no mide directamente su probabilidad en un uso real.
¿Por qué afecta a nuestra investigación?
La supervisión combina una herramienta y un procedimiento. Para Fondation UvH, es necesario examinar quién recibe una alerta, quién puede suspender una acción y cómo se impugnan los errores del monitor. Elegir qué acciones se supervisan importa tanto como el rendimiento del modelo que las examina.
Este trabajo muestra cómo probar una protección en lugar de presuponer que funciona. También recuerda que delegar la supervisión en otra IA desplaza parte del problema: la fiabilidad del monitor también debe evaluarse.
