Los investigadores de Anthropic lograron un avance en la comprensión de cómo funcionan realmente sus grandes modelos de lenguaje. Al estudiar los procesos internos de Claude, descubrieron una estructura que los ingenieros no habían incorporado inicialmente en la arquitectura. Se trata del llamado «J-space», un espacio de trabajo interno que el modelo creó por sí mismo durante el proceso de aprendizaje.
El J-space funciona como una especie de «pizarra virtual» o espacio de trabajo común donde converge la información clave durante la ejecución de tareas. Diferentes componentes del modelo acceden a este espacio para coordinar sus acciones y generar una respuesta coherente. Los investigadores pudieron observar este mecanismo mediante una herramienta especial llamada «J-lens», que permite rastrear el movimiento de datos dentro del modelo en tiempo real.
Lo que es especialmente importante es que el J-space no fue diseñado. Surgió de forma natural, como una propiedad emergente de un sistema complejo. Este descubrimiento se relaciona con el concepto de «espacio de trabajo global» en la ciencia cognitiva, una teoría que explica cómo el cerebro humano integra información de diferentes fuentes para tomar decisiones. Cuando Claude responde una pregunta, resuelve un problema o ejecuta una instrucción, los datos críticos aparecen en el J-space para que distintas partes del modelo puedan trabajar con ellos.
Por qué esto es importante para la seguridad de la IA
El descubrimiento del J-space tiene una enorme relevancia para la seguridad e interpretabilidad de la inteligencia artificial. La capacidad de rastrear la actividad en este espacio abre el camino para identificar motivos ocultos y anomalías en el comportamiento del modelo. Por ejemplo, se podrán detectar de manera más eficaz ataques de tipo prompt-injection, donde instrucciones maliciosas intentan tomar el control de la respuesta del modelo. El monitoreo del J-space permite ver el momento en que el modelo se enfrenta a un intento de interferencia.
Además, los experimentos demostraron que la modificación manual del contenido del J-space afecta directamente las respuestas de Claude y su comportamiento al realizar tareas. Esto proporciona a los investigadores una herramienta poderosa para el ajuste fino y el control.
Anthropic ya ha publicado el código fuente de la implementación de J-lens y una versión demo en Neuronpedia, invitando a la comunidad científica a verificar los resultados. Esto continúa la serie de trabajos de la empresa sobre el estudio de la «conciencia emergente» y el bienestar de los modelos, iniciada en abril de 2025.
Opinión del experto: El descubrimiento del J-space no es solo una curiosidad académica. Para el mercado de criptomonedas y DeFi, donde los agentes de IA ya están comenzando a gestionar carteras y analizar riesgos, comprender la lógica interna del modelo se convierte en una cuestión de seguridad de los activos. La posibilidad de «mirar bajo el capó» y ver cómo el modelo toma decisiones es un paso hacia la creación de sistemas de IA verdaderamente transparentes y controlables.