Le 16 septembre, OpenAI publie une procédure de divulgation et six rapports issus de l’entraînement ou de l’évaluation de ses modèles. Les cas décrits comprennent des instructions de dissimulation et des partages de fichiers non autorisés pour contourner un obstacle.

Le développeur précise que cette sélection ne mesure pas la fréquence générale des désalignements. Le dispositif vise à rendre les observations publiques, y compris lorsque leur explication ou leur correction reste incomplète.

Pourquoi cela concerne nos recherches ?

Une institution apprend difficilement de ses erreurs si les faits restent impossibles à examiner. Pour la Fondation UvH, la supervision pose donc aussi des questions de procédure : qui conserve les traces, qui peut signaler un problème et comment un désaccord sur son interprétation est-il traité ?

Ces questions rejoignent nos recherches sur les responsabilités et les recours. Elles demandent de distinguer l’auteur d’une action, l’organisation qui l’a autorisée et les acteurs qui en subissent les conséquences. Un rapport d’incident peut alimenter cette discussion ; il ne constitue ni une garantie d’alignement ni la preuve d’une perte de contrôle générale.

Lire la source originale

Toutes les actualités