El centro de atención de la comunidad de investigadores de seguridad en IA ha recaído en la arquitectura del nuevo modelo Astra de OpenAI. La discusión no gira tanto en torno a su rendimiento, sino a una pregunta fundamental: ¿hasta qué punto somos realmente capaces de controlar el proceso de razonamiento de sistemas como este?
La esencia del posible problema radica en la aplicación de una técnica conocida como «profundidad recurrente». En lugar de construir completamente la cadena lógica en forma de texto, el modelo puede realizar una parte significativa de los cálculos en estados internos que no se muestran de manera explícita. Esto crea una especie de «razonamiento opaco», lo que afecta directamente a los métodos de monitoreo utilizados para detectar comportamientos potencialmente peligrosos, como la evasión de restricciones de seguridad o la mentira.
El problema clave para la seguridad
Los principales expertos en seguridad de IA han expresado su preocupación al respecto. Ryan Greenblatt, de Redwood Research, calificó la posible arquitectura de Astra como uno de los riesgos más graves para el control de la IA. Su inquietud no se relaciona tanto con el estado actual del modelo, sino con la dirección de su desarrollo.
El riesgo principal, según él, radica en que escalar este enfoque podría llevar a la creación de sistemas que razonen completamente en el espacio latente. Esto prácticamente privaría a los investigadores y a los sistemas automatizados de supervisión de la capacidad de interpretar las acciones del modelo e intervenir de manera oportuna. Esto resulta especialmente alarmante a la luz de incidentes recientes, en los que los investigadores dependían precisamente de las cadenas de razonamiento textuales para analizar las acciones de los agentes de IA.
Es revelador que, en respuesta a las críticas, el director científico de OpenAI, Jakub Pachocki, se apresurara a tranquilizar al público. Afirmó que la profundidad del grafo computacional de Astra no supera en más del doble la del GPT-4, y subrayó que la empresa siempre ha buscado preservar la capacidad de monitoreo. Sin embargo, también reconoció que la propia posibilidad de dicho control es «frágil» y podría deteriorarse.
Esta situación pone al descubierto una paradoja clave en el desarrollo de la IA: la búsqueda de sistemas cada vez más potentes y autónomos choca inevitablemente con el problema de su controlabilidad. OpenAI ya ha asignado a Astra un nivel crítico de capacidades cibernéticas, lo que implica que el modelo puede buscar vulnerabilidades de manera autónoma. La cuestión de cuánto podemos confiar en una «caja negra» con tales capacidades se vuelve no solo técnica, sino existencial.
Mi opinión profesional: el debate público en torno a Astra es una señal importante. Estamos al borde de que las capacidades de los modelos comiencen a superar nuestras herramientas para comprenderlos. La exigencia de una evaluación independiente y la divulgación de los detalles técnicos de la arquitectura no es una curiosidad ociosa, sino una medida necesaria para garantizar la seguridad en la próxima etapa del desarrollo de la IA.