El 6 de julio, investigadores de Anthropic presentaron la «lente jacobiana». El método identifica ciertas representaciones internas asociadas a conceptos que un modelo puede expresar. En experimentos dirigidos, intervenir sobre esas representaciones cambia sus respuestas o su conducta.
El acceso sigue siendo parcial: algunos conceptos son difíciles de aislar y ciertas lecturas continúan sin poder interpretarse. Los autores estudian propiedades funcionales; sus observaciones no muestran que un modelo tenga experiencia subjetiva.
¿Por qué afecta a nuestra investigación?
Para Fondation UvH, examinar con más detalle los mecanismos de un sistema podría ayudar a comprender aquello que sus respuestas por sí solas no permiten verificar. Esto plantea una pregunta de supervisión: ¿qué información permite realmente investigar y cómo se pueden comparar pruebas contradictorias?
La cuestión moral exige un paso adicional. Identificar una organización interna útil para razonar no demuestra que un sistema pueda experimentar bienestar o sufrimiento. Nuestro trabajo reúne estas preguntas sin confundirlas: comprender un mecanismo, evaluar posibles intereses y justificar un estatus requieren argumentos distintos.
