En el centro de atención de la comunidad de investigadores de IA se encuentra el nuevo modelo Astra de OpenAI. El debate no se debe a su rendimiento, sino a una posible reducción de la transparencia de los procesos internos, lo que pone en duda la eficacia de los mecanismos de supervisión existentes.

El núcleo del problema: la «profundidad recurrente»

Según la información que he obtenido, Astra emplea una técnica conocida como «profundidad recurrente». A diferencia de los modelos de razonamiento estándar, donde los pasos lógicos se muestran como una cadena de texto disponible para el análisis, la profundidad recurrente implica un procesamiento repetido de las representaciones internas del modelo antes de generar el siguiente paso textual. Esto significa que una parte significativa de los cálculos ocurre en los estados ocultos de la red neuronal y no se refleja de forma explícita, lo que potencialmente reduce la cantidad de información disponible para los sistemas de monitoreo.

El riesgo clave aquí radica en que los investigadores y los sistemas de seguridad automatizados, que dependen de las cadenas de razonamiento para detectar señales de comportamiento no deseado —como mentiras o intentos de eludir restricciones— podrían perder esta capacidad crucial. Si el modelo es capaz de «pensar» en el espacio latente sin revelar sus intenciones en el texto, la supervisión del mismo se vuelve extremadamente difícil.

Evaluación de los expertos y postura de OpenAI

Esta noticia ha generado una gran preocupación entre los principales especialistas. Ryan Greenblatt, científico jefe de Redwood Research, calificó esta decisión arquitectónica como potencialmente el «peor evento para la seguridad de la IA». Su principal temor se relaciona con que la ampliación del «razonamiento opaco» podría llevar a la creación de modelos que piensen completamente en el espacio latente, privando a las cadenas de razonamiento de su valor práctico para el monitoreo.

En respuesta a las críticas, el científico jefe de OpenAI, Jakub Pachocki, se apresuró a asegurar al público que la profundidad del grafo computacional de Astra difiere de la de GPT-4 en no más de un factor de dos. Destacó que la empresa busca mantener la capacidad de monitorear las cadenas de razonamiento, aunque reconoció que esta capacidad es «frágil» y podría deteriorarse por razones independientes de la arquitectura.

A pesar de estas garantías, la situación sigue siendo preocupante. Recordemos que en agosto OpenAI ya ralentizó temporalmente la ampliación de nuevos modelos debido a ciberriesgos, y a la propia Astra se le asignó un nivel crítico de capacidades cibernéticas. Esto indica que la empresa es consciente de la gravedad de las posibles amenazas.

Mi análisis: La postura de OpenAI, que lo reduce todo al «factor de dos» respecto a GPT-4, parece algo evasiva. Incluso un pequeño aumento en la «profundidad» de los cálculos en el espacio latente podría complicar exponencialmente la tarea de interpretación para los sistemas externos. La cuestión clave no es cuánto difiere la arquitectura de la anterior, sino qué porcentaje de razonamientos críticamente importantes permanece fuera del alcance visual para el monitoreo. El público necesita una evaluación más detallada e independiente de este aspecto para que podamos valorar adecuadamente los riesgos reales.