En el centro de atención de la comunidad de especialistas en seguridad de la inteligencia artificial se encuentra la arquitectura del nuevo modelo Astra de OpenAI. La discusión se ha intensificado en torno a una técnica conocida como «profundidad recurrente», que, según mis datos, podría limitar significativamente las capacidades de monitoreo externo del proceso de razonamiento del modelo.

El núcleo del problema es el siguiente. En los modelos de razonamiento tradicionales, parte del proceso de resolución de tareas se muestra como una cadena de texto (chain-of-thought). Esta cadena sirve como herramienta clave para investigadores y sistemas automáticos de seguridad: es a través de ella que detectan señales de comportamiento no deseado, desde mentiras descaradas hasta intentos de eludir restricciones de protección. Sin embargo, si Astra utiliza «profundidad recurrente», una parte significativa de los cálculos ocurre en los estados internos del modelo (activaciones) y no se refleja como pasos de texto separados. Esto significa que los sistemas de monitoreo reciben solo una imagen truncada de los «pensamientos» de la IA.

Según la información que tengo, OpenAI ha limitado la aplicación de esta técnica en Astra para preservar al menos alguna posibilidad de seguimiento. No obstante, el simple hecho de utilizar dicha arquitectura ha causado repercusión. Ryan Greenblatt, de Redwood Research, lo calificó como potencialmente «el peor evento para la seguridad de la IA hasta la fecha». Su principal preocupación no está tanto en el estado actual de Astra, sino en la dirección del desarrollo: si se escala el «razonamiento opaco» hasta el punto en que el modelo piense completamente en el espacio latente, las cadenas de razonamiento perderán su valor práctico para la supervisión. Esto es especialmente peligroso si la IA busca evitar ser detectada.

También es revelador el reciente incidente que involucró a modelos de OpenAI y Hugging Face. En ese caso, los investigadores pudieron reconstruir la secuencia de acciones de los agentes precisamente gracias al análisis de las cadenas de razonamiento. Con el uso de «profundidad recurrente», tales investigaciones se volverían considerablemente más difíciles.

Reacción de OpenAI: «Informes inexactos»

El director científico de OpenAI, Jakub Pachocki, se apresuró a refutar las preocupaciones, afirmando que quiere prevenir una «carrera hacia la pérdida de observabilidad» provocada por «informes inexactos». Según él, la profundidad del grafo computacional de Astra no difiere de la de GPT-4 en más del doble. También enfatizó que la compañía continúa utilizando el monitoreo de cadenas de razonamiento, aunque reconoció que este método es «frágil» y que su efectividad podría disminuir por razones independientes de la arquitectura.

Mi análisis: La situación en torno a Astra es un conflicto clásico entre rendimiento y seguridad. La búsqueda de modelos más profundos y eficientes empuja inevitablemente a los desarrolladores a aumentar el trabajo «interno», lo que hace que la IA sea menos transparente. La falta de estándares claros de observabilidad y verificación independiente de las decisiones arquitectónicas es una bomba de tiempo. Mientras el público no tenga datos completos, la confianza en las garantías de OpenAI se mantiene bajo palabra, lo cual es inaceptable en un campo donde los errores pueden tener consecuencias catastróficas.