Anthropic propose de lire le préentraînement comme l’apprentissage de nombreuses personas, puis le postentraînement comme l’affinement d’un personnage d’assistant. Ce cadre cherche à expliquer des comportements qui semblent humains et certains changements de comportement inattendus.

Les auteurs distinguent explicitement la persona simulée du système qui la produit. Leur proposition est une théorie du comportement : elle n’établit ni une identité personnelle ni une expérience subjective.

Pourquoi cela concerne nos recherches ?

Attribuer des intentions à un assistant peut aider à décrire ses réponses, mais ne suffit pas à fonder un statut moral ou juridique. Le modèle invite à examiner séparément comportement, mécanisme d’entraînement et conditions de reconnaissance.

Lire la source originale

Toutes les actualités