El mercado de agentes de IA tiene un nuevo favorito. Los resultados del benchmark independiente AutomationBench-AA de Artificial Analysis mostraron que el modelo Grok 4.5 de SpaceXAI no solo alcanzó, sino que superó con confianza a pesos pesados como Claude Fable 5 y Claude Opus 4.8. Elon Musk, al comentar el lanzamiento, enfatizó la velocidad y la eficiencia económica, y las cifras confirman plenamente sus palabras.

El indicador clave es la puntuación final. Grok 4.5 obtuvo un 51,4%, dejando atrás a Fable 5 con un 48,6% y a Opus 4.8 con un 48,5%. Sin embargo, es mucho más interesante observar el costo. Completar una tarea cuesta solo $0,34. En comparación, para Fable 5 es $1,35, y para Opus 4.8, $1,46. El competidor más cercano en precio es Gemini 3.5 Flash ($0,49), pero es inferior en calidad.

La eficiencia como principal baza

El secreto de este precio tan bajo radica en la arquitectura V9 con 1,5 billones de parámetros. Para completar una tarea, Grok 4.5 utiliza alrededor de 8000 tokens de salida, lo que representa solo el 25% de los recursos que consume Opus 4.8. El consumo total de 0,44 millones de tokens por tarea es uno de los indicadores más bajos del mercado. Es precisamente esta eficiencia y el bajo precio del token lo que forma una ventaja decisiva.

Además de las estadísticas generales, los detalles son importantes. Grok 4.5 completó correctamente el 79,9% de las acciones individuales, y logró finalizar por completo, de principio a fin, el 21,9% de las tareas. En la categoría financiera, la más difícil de la prueba, el modelo mostró un 71% de soluciones exitosas. Esto es significativamente superior al de Fable 5 (64%) y Opus 4.8 (62%).

Sin embargo, hay un matiz. Grok 4.5 infringe las reglas con más frecuencia que sus competidores: un promedio de 0,63 infracciones por tarea frente a 0,55 de Opus 4.8 y 0,46 de Gemini 3.5 Flash. Para las empresas que implementan agentes en sistemas financieros reales, esto es un punto crítico: una sola acción incorrecta puede provocar pérdidas graves.

Opinión del analista: Grok 4.5 establece un nuevo estándar para el mercado de agentes de IA, desplazando el enfoque del rendimiento "puro" hacia la eficiencia económica. Sin embargo, la mayor propensión a errores es una "bomba de tiempo". Por ahora, el modelo gana gracias a su bajo precio, pero para el sector empresarial, la fiabilidad sigue siendo una prioridad. La próxima versión deberá resolver el problema del cumplimiento de las reglas para consolidar el éxito.