El equipo de investigación de Anthropic ha logrado un avance en la comprensión de la arquitectura interna de los grandes modelos de lenguaje. Durante el análisis de los modelos de la familia Claude, se descubrió una estructura que los desarrolladores no habían incorporado inicialmente en el diseño. Este mecanismo interno, denominado «J-space», funciona como un espacio de trabajo común: varios componentes del modelo recurren a él para intercambiar y procesar información clave.
Los resultados de la investigación, publicados el 6 de julio, representan un paso significativo en la interpretación de lo que realmente ocurre dentro de la «caja negra» de los sistemas de IA modernos.
¿Qué es J-space y cómo funciona?
J-space es un espacio virtual interno donde Claude recopila y transmite datos importantes a través de todo el modelo. La forma más sencilla de imaginarlo es como una «pizarra virtual» dentro de la inteligencia artificial. Cuando Claude responde una pregunta, resuelve un problema o ejecuta una instrucción, la información clave aparece en J-space para que diferentes partes del modelo puedan trabajar con ella.
Esta estructura se pudo descubrir gracias a una herramienta especial llamada J-lens. Los investigadores observaron cómo se movía la información dentro del modelo durante la ejecución de una tarea. El punto clave: J-space surgió espontáneamente durante el proceso de aprendizaje; no fue incorporado directamente por los diseñadores.
Este concepto se relaciona con la teoría del «espacio de trabajo global» en neurociencias. En los humanos, este sistema proporciona acceso a información importante para varios procesos de pensamiento simultáneamente. Por ejemplo, cuando una persona escucha una pregunta, recuerda un dato relevante y decide cómo responder, el cerebro reúne todos los datos necesarios en un solo lugar.
Claude funciona de manera similar. Anthropic demostró que el modelo no solo puede describir el contenido de J-space cuando se le solicita, sino también modificarlo si se le pide. Además, cuando los investigadores alteraban manualmente J-space, cambiaban tanto las respuestas de Claude como su comportamiento al realizar tareas.
Por qué esto es importante para la seguridad e interpretabilidad de la IA
Este descubrimiento tiene una gran importancia para la seguridad de la inteligencia artificial. Si los científicos pueden rastrear la actividad de J-space, tendrán la oportunidad de identificar motivos ocultos en el comportamiento de los modelos de IA. Gracias a esto, se podrá detectar de manera más efectiva cuándo un sistema comienza a funcionar de forma poco fiable.
Esto incluye la detección de ataques. El monitoreo de J-space permite ver el momento en que el modelo se enfrenta a intentos de prompt-injection (inyección de instrucciones maliciosas en la solicitud para tomar el control de la respuesta del modelo). Además, incluso el acceso parcial a esta capa de procesamiento «consciente» abre perspectivas importantes para la investigación.
Por ahora, las capacidades son limitadas. La mayor parte del procesamiento de información en Claude sigue ocurriendo fuera de J-space. No obstante, Anthropic ha publicado el código fuente de la implementación de J-lens y ha subido una versión demo a Neuronpedia, invitando a la comunidad investigadora a verificar los resultados en la práctica.
La investigación se basa en una serie de trabajos anteriores. En octubre de 2025, Anthropic publicó un informe sobre la conciencia introspectiva emergente. Anteriormente, en abril de 2025, la empresa lanzó iniciativas para estudiar el bienestar de los modelos, avanzando paso a paso en la comprensión de lo que ocurre dentro de sus sistemas.
También hay una aclaración importante. Anthropic enfatiza que no afirma que Claude posea conciencia o experiencia subjetiva. En el trabajo se utiliza el término información «conscientemente accesible», tomado de la ciencia cognitiva; esto no implica la existencia de una conciencia real.
Comentario del analista: El descubrimiento de J-space no es solo una curiosidad académica. Para el mercado de la IA y las tecnologías relacionadas, es una señal: la «caja negra» de las redes neuronales se está volviendo gradualmente más transparente. La posibilidad de monitorear procesos internos afecta directamente la seguridad de los contratos inteligentes y los protocolos DeFi que utilizan agentes de IA. Cuanto más entendamos la lógica interna del modelo, de manera más confiable podremos integrarlo en sistemas financieros críticos.