Los investigadores de Anthropic hicieron un descubrimiento inesperado al examinar el interior de su modelo de lenguaje Claude. Encontraron una estructura interna que no fue planificada por los ingenieros durante su diseño. Este mecanismo, denominado «J-space», funciona como un espacio de trabajo común al que acceden varios componentes del modelo durante la ejecución de tareas.

En esencia, J-space es una «pizarra» virtual donde Claude reúne información clave necesaria para responder a una consulta, resolver un problema o ejecutar una instrucción. Esta capa interna de datos es accesible para diferentes partes de la red neuronal, lo que permite coordinar su trabajo. El descubrimiento se realizó mediante una herramienta de visualización especial llamada «J-lens», que permitió observar el movimiento de los flujos de información dentro del modelo en tiempo real.

Lo más notable es que J-space surgió espontáneamente durante el proceso de aprendizaje. No fue algo incorporado por los desarrolladores. El concepto se asemeja sorprendentemente a lo que en neurociencia se conoce como «espacio de trabajo global»: una teoría que describe cómo el cerebro humano integra datos de diferentes áreas para el procesamiento consciente de la información. Los experimentos demostraron que Claude no solo puede leer el contenido de J-space, sino también modificarlo bajo demanda, lo que afecta directamente sus respuestas y comportamiento.

¿Por qué esto cambia las reglas del juego para la seguridad de la IA?

Este descubrimiento tiene una importancia colosal para la seguridad y la interpretabilidad de la inteligencia artificial. La posibilidad de monitorear J-space nos brinda una «ventana» al proceso de toma de decisiones del modelo. Ahora podemos potencialmente rastrear motivos ocultos o identificar momentos en que el sistema comienza a funcionar de manera inestable. Por ejemplo, abre nuevos horizontes para la detección de ataques de tipo prompt-injection, donde instrucciones maliciosas intentan tomar el control de la respuesta del modelo.

Anthropic ya ha publicado el código fuente de la implementación de J-lens y ha entregado una versión demo a la plataforma Neuronpedia para su verificación independiente por parte de la comunidad científica. La empresa continúa una serie de trabajos sobre el estudio de los procesos internos de los modelos, iniciada ya en 2025.

Opinión del experto: El descubrimiento de J-space es, quizás, uno de los pasos más significativos en el campo de la interpretabilidad de la IA en los últimos tiempos. Pasamos de una «caja negra» a comprender cómo los grandes modelos de lenguaje estructuran y procesan el conocimiento. Para la industria cripto, donde la IA se utiliza cada vez más para analizar mercados y gestionar activos, la transparencia de dichos sistemas es un factor de confianza críticamente importante. La posibilidad de «mirar dentro de los pensamientos» del algoritmo podría convertirse en un estándar de seguridad de nueva generación.