Los investigadores de Anthropic lograron un avance en la comprensión del funcionamiento interno de sus modelos Claude. Descubrieron una estructura que los ingenieros no incorporaron en la arquitectura durante la fase de diseño. Se trata del llamado «J-space»: un espacio de trabajo interno que el modelo creó por sí mismo durante el proceso de aprendizaje.

El J-space funciona como un tablón de anuncios global para los datos. Cuando Claude procesa una consulta, resuelve un problema o ejecuta una instrucción, la información críticamente importante se concentra en este espacio. Diversos componentes del modelo recurren al J-space para intercambiar datos. Esto recuerda al concepto de «espacio de trabajo global» en la neurociencia cognitiva, donde el cerebro integra información de distintas áreas para tomar decisiones.

Para detectar esta estructura, el equipo de Anthropic desarrolló una herramienta llamada J-lens. Con ella, los investigadores observaron cómo se mueve la información dentro del modelo durante la ejecución de una tarea. La conclusión clave: el J-space no fue programado, sino que surgió espontáneamente como una propiedad emergente del aprendizaje.

Por qué es importante para la seguridad e interpretabilidad de la IA

El descubrimiento del J-space tiene una enorme relevancia para la seguridad de la inteligencia artificial. Si los científicos pueden rastrear la actividad en este espacio, tendrán la capacidad de identificar motivos ocultos en el comportamiento de los modelos. Esto abre el camino hacia una detección más eficaz de ataques, como la inyección de instrucciones (prompt-injection), donde instrucciones maliciosas intentan tomar el control de la respuesta del modelo.

Los investigadores también demostraron que pueden modificar manualmente el contenido del J-space, lo que afecta directamente las respuestas y el comportamiento de Claude. Esto proporciona un nivel de control y comprensión sin precedentes.

Anthropic publicó el código fuente de la implementación de J-lens y subió una versión demo en Neuronpedia, invitando a la comunidad científica a verificar los resultados en la práctica. Esto es una continuación de la serie de trabajos de la empresa: en octubre de 2025 publicaron un informe sobre la conciencia introspectiva emergente, y en abril lanzaron iniciativas para estudiar el bienestar de los modelos.

Opinión del experto: El descubrimiento del J-space no es solo una curiosidad académica. Es un paso hacia una «IA transparente», donde podamos mirar dentro de la «caja negra» de la red neuronal y entender por qué toma ciertas decisiones. Para la industria cripto, donde la IA se utiliza cada vez más para analizar mercados y gestionar activos, este es un camino directo hacia una mayor confianza y seguridad. La posibilidad de monitorear los procesos internos del modelo es un nuevo estándar de seguridad al que debemos aspirar.