Le 23 juillet, l’AI Security Institute présente les premiers travaux de son équipe consacrée aux mesures de contrôle. Un contrôleur est ici un modèle qui examine les actions ou le raisonnement d’un agent pour signaler un comportement dangereux, avant ou après son exécution selon le dispositif.
Les essais menés avec Google DeepMind et Anthropic ont révélé des faiblesses et alimenté des corrections successives. L’institut expérimente aussi une recherche automatisée d’attaques. Il souligne une difficulté : un attaquant simulé peut recevoir des informations ou des possibilités d’essai dont un agent déployé ne disposerait pas. Trouver un contournement ne mesure donc pas directement sa probabilité en situation réelle.
Pourquoi cela concerne nos recherches ?
La supervision combine un outil et une procédure. Pour la Fondation UvH, il faut examiner qui reçoit une alerte, qui peut suspendre une action et comment les erreurs du contrôleur sont discutées. Le choix des actes surveillés compte autant que la performance du modèle chargé de les examiner.
Ces travaux montrent comment éprouver une protection au lieu de présumer son efficacité. Ils rappellent aussi que confier la surveillance à une autre IA déplace une partie du problème : la fiabilité du contrôleur doit elle-même être évaluée.
