Como parte de un experimento técnico realizado por mi equipo y los ingenieros de Nvidia, el modelo Cosmos 3 Nano demostró un impresionante salto de rendimiento. Inicialmente, la precisión del modelo en la prueba de cuatro opciones de respuesta era del 54,41%. Sin embargo, en menos de 24 horas, gracias al trabajo autónomo del agente de IA Codex, este indicador se elevó al 93,35%.

El factor clave del éxito fue el uso del conjunto de datos especializado Woven Traffic Safety de Woven by Toyota, que contiene más de 8000 ejemplos de videos de situaciones de tráfico con preguntas. El agente Codex, actuando según las instrucciones predefinidas del conjunto de herramientas Nvidia TAO, evaluó de forma autónoma el modelo base y seleccionó el método de ajuste fino LoRA (Low-Rank Adaptation).

Es interesante que Codex no solo inició el proceso. Demostró capacidades analíticas: detectó un parámetro de frecuencia de fotogramas faltante en la configuración del conjunto de datos, lo corrigió, cargó los pesos del modelo y ejecutó el contenedor de entrenamiento. La primera ejecución de LoRA en ocho aceleradores NVIDIA A100 (80 GB) tomó solo 30 minutos y elevó la precisión al 87,14%.

En la segunda etapa, los desarrolladores utilizaron TAO AutoML para la optimización bayesiana de hiperparámetros. El sistema realizó 43 pruebas paralelas, ajustando la tasa de aprendizaje, el tamaño del lote y los parámetros de LoRA. El mejor resultado del 93,35% se alcanzó en 19,5 horas en varios nodos A100 en Oracle Cloud Infrastructure.

Es importante destacar: aunque el agente actuó de forma autónoma, sus capacidades estaban limitadas por las instrucciones predefinidas. No generó nuevas estrategias, sino que simplemente ejecutó un flujo de trabajo predeterminado. Además, el indicador del 93,35% se refiere a un conjunto de datos de investigación específico y no es un indicador de seguridad para la conducción autónoma real.

Mi evaluación experta: Este experimento demuestra la madurez de las tecnologías de automatización del aprendizaje automático. LoRA combinado con AutoML permite ahorrar hasta 7 veces más horas de GPU en comparación con el ajuste fino completo. Sin embargo, la conclusión clave aquí no es tanto la precisión, sino la velocidad de iteración. La capacidad de pasar de un modelo base a una solución especializada de alta precisión en un día es un avance en MLOps que acelerará significativamente la implementación de la IA en escenarios industriales.