El análisis de los últimos datos sobre el modelo Astra de OpenAI, que se está preparando, ha revelado una tendencia potencialmente alarmante en el ámbito de la seguridad de la inteligencia artificial. En el centro del debate se encuentra una técnica conocida como «profundidad recurrente», que, según mis datos, podría limitar significativamente las capacidades de monitoreo externo del proceso de razonamiento de la red neuronal.

La esencia del problema radica en que Astra, a diferencia de muchos de sus predecesores, muestra a los investigadores solo una pequeña parte de sus razonamientos intermedios. Esto se logra porque una parte considerable de los cálculos no ocurre en la cadena de texto, sino en los estados internos del modelo. Para la comunidad, esto es críticamente importante, ya que son precisamente las cadenas de razonamiento textuales las que sirven como herramienta principal para detectar signos de comportamiento no deseado, desde mentiras descaradas hasta intentos de eludir los protocolos de protección.

Riesgos para la seguridad y la supervisión

El investigador principal de Redwood Research, Ryan Greenblatt, calificó en su análisis esta solución arquitectónica como un riesgo grave. Su principal preocupación no está tanto relacionada con el estado actual de Astra, sino con la trayectoria potencial de su desarrollo. Si OpenAI escala el «razonamiento opaco», podríamos llegar a modelos que piensen completamente en el espacio latente, lo que haría que las cadenas de razonamiento fueran inútiles para la supervisión. Esto es especialmente peligroso si la IA intenta deliberadamente evitar ser detectada.

Un ejemplo ilustrativo es el reciente incidente que involucró a agentes de OpenAI y Hugging Face. La investigación de esos eventos se basó en gran medida en la reconstrucción de la secuencia de acciones a través de las cadenas de razonamiento. Con la nueva arquitectura, reconstruir las relaciones de causa y efecto sería prácticamente imposible.

Posición oficial de OpenAI

En respuesta a la ola de críticas, el científico jefe de OpenAI, Jakub Pachocki, se apresuró a asegurar al público que la profundidad del grafo computacional de Astra se encuentra dentro de un rango de dos veces la de GPT-4. Destacó que la compañía continúa trabajando para mantener el monitoreo de las cadenas de razonamiento, aunque reconoció que este mecanismo sigue siendo «frágil». Es notable que OpenAI ya haya pausado temporalmente el entrenamiento de nuevos sistemas debido al aumento de los ciberriesgos, y que Astra haya alcanzado un nivel crítico de capacidades cibernéticas, demostrando la capacidad de encontrar vulnerabilidades desconocidas sin control humano.

Mi opinión: la divulgación pública de información por parte de OpenAI es insuficiente. La situación requiere una experiencia técnica independiente para evaluar el grado real de reducción de la observabilidad. Sin esto, corremos el riesgo de avanzar hacia la creación de sistemas cuyo comportamiento se vuelva impredecible e incontrolable, lo que contradice los principios básicos del desarrollo seguro de la IA.