Le 6 juillet, des chercheurs d’Anthropic présentent la « Jacobian lens ». Cette méthode repère certaines représentations internes associées à des concepts que le modèle peut exprimer. Dans des expériences ciblées, intervenir sur ces représentations modifie ses réponses ou ses comportements.
L’accès reste incomplet : certains concepts sont difficiles à isoler et certaines lectures demeurent ininterprétables. Les auteurs étudient des propriétés fonctionnelles ; leurs observations ne démontrent pas qu’un modèle possède une expérience subjective.
Pourquoi cela concerne nos recherches ?
Pour la Fondation UvH, mieux examiner les mécanismes d’un système pourrait aider à comprendre ce que ses seules réponses ne permettent pas de vérifier. Cela ouvre une question de supervision : quelles informations donnent réellement prise à une enquête et comment confronter des indices contradictoires ?
La question morale demande une autre étape. Reconnaître une organisation interne utile au raisonnement ne suffit pas à établir qu’un système peut éprouver un bien-être ou subir une souffrance. Nos travaux rapprochent ces interrogations sans les confondre : comprendre un fonctionnement, évaluer des intérêts possibles et justifier un statut exigent des arguments distincts.
