La corporación Nvidia llevó a cabo un experimento demostrativo que muestra un nuevo nivel de automatización en el aprendizaje automático. Utilizando su propio agente de IA Codex y el conjunto de herramientas TAO, los ingenieros lograron en menos de 24 horas aumentar la precisión del modelo Cosmos 3 Nano del 54,41% a un impresionante 93,35% en el conjunto de datos especializado Woven Traffic Safety de Toyota. Esto no es solo optimización, es un cambio de paradigma en el enfoque del post-entrenamiento de modelos.
Cómo se realizó el experimento
El Cosmos 3 Nano base, sin ninguna adaptación, mostró un resultado del 54,41% en una prueba con cuatro opciones de respuesta. Los desarrolladores encargaron al agente Codex analizar el modelo y realizar un ajuste fino mediante el método LoRA (Low-Rank Adaptation). El agente no solo ejecutó un script, sino que seleccionó de forma autónoma la instrucción Cosmos-reason, identificó la ausencia del parámetro de frecuencia de fotogramas en las anotaciones del conjunto de datos, corrigió la configuración, cargó los pesos e inició el contenedor de entrenamiento.
La primera ejecución de LoRA en ocho aceleradores NVIDIA A100 (80 GB) tomó solo 30 minutos y elevó la precisión al 87,14%. Este ya es un salto impresionante, pero Nvidia fue más allá.
Optimización automática de hiperparámetros
En la segunda etapa, los desarrolladores activaron TAO AutoML para la selección automática de hiperparámetros: tasa de aprendizaje, tamaño del lote, parámetros de LoRA y otras configuraciones. El sistema realizó 43 pruebas paralelas con optimización bayesiana. La mejor configuración arrojó un 93,35%, y esto en menos de 20 horas de computación en varios nodos A100 en Oracle Cloud Infrastructure.
La ventaja clave del método es el ahorro de recursos. Según los cálculos de Nvidia, LoRA requirió aproximadamente siete veces menos horas de GPU que el ajuste fino completo del modelo. Esto es críticamente importante para las empresas que desean adaptar modelos grandes sin alquilar clústeres enteros.
Qué significa esto para la industria
Es importante entender el contexto: el indicador del 93,35% se refiere exclusivamente a la parte de validación del conjunto de datos de investigación Woven Traffic Safety. No es una prueba de seguridad para la conducción autónoma ni una confirmación de la capacidad del modelo para tomar decisiones en tiempo real. Sin embargo, el principio en sí mismo —el uso de un agente de IA para el ajuste fino autónomo— abre nuevos horizontes.
Mi análisis: estamos presenciando la transición del ajuste manual de modelos a pipelines orientados a agentes. En este experimento, Codex no solo ejecutó comandos, sino que analizó datos, corrigió errores en la configuración y seleccionó estrategias óptimas. Aunque su autonomía está limitada por instrucciones previamente preparadas, este es el primer paso hacia ciclos de desarrollo de ML completamente automatizados. En los próximos años, estos agentes se convertirán en el estándar para el post-entrenamiento, especialmente en dominios especializados donde se requiere una rápida adaptación de modelos base a conjuntos de datos específicos.