El mercado de agentes de IA tiene un nuevo líder. El modelo Grok 4.5 de SpaceXAI no solo ha superado a los buques insignia de Anthropic — Claude Fable 5 y Claude Opus 4.8 — en el benchmark independiente AutomationBench-AA, sino que lo ha hecho con una ventaja colosal en eficiencia económica. Esto no es solo una victoria en una prueba, es un cambio de paradigma.

Grok 4.5, construido sobre la arquitectura V9 con 1,5 billones de parámetros, demostró un resultado del 51,4% en el benchmark AutomationBench-AA de Artificial Analysis. En comparación, Claude Fable 5 obtuvo un 48,6% y Claude Opus 4.8 un 48,5%. Sin embargo, el indicador clave no es solo la precisión, sino también el costo.

Grok 4.5 completa una tarea por $0,34, mientras que Fable 5 cuesta $1,35 y Opus 4.8 $1,46. El competidor más cercano en precio, Gemini 3.5 Flash, cuesta $0,49 por tarea. Este costo tan bajo se logra gracias a una eficiencia radical: Grok 4.5 utiliza alrededor de 8000 tokens de salida por tarea, lo que representa solo el 25% de los recursos consumidos por Opus 4.8. El consumo total de tokens — 0,44 millones por tarea — es uno de los más bajos del mercado.

Sector financiero: donde Grok 4.5 realmente brilló

El resultado más revelador del modelo se encuentra en la categoría financiera, la más difícil de la prueba. Grok 4.5 obtuvo un 71%, dejando atrás a Fable 5 (64%) y Opus 4.8 (62%). Para las empresas que automatizan procesos financieros, esta brecha es crítica. Un error en un agente financiero puede traducirse en pérdidas directas, y aquí Grok demuestra una clara superioridad.

Sin embargo, hay un matiz: Grok 4.5 infringe las reglas un promedio de 0,63 veces por tarea, una cifra superior a la de Opus 4.8 (0,55) y Gemini 3.5 Flash (0,46). Este es el precio de una optimización agresiva de velocidad y costo. Para las empresas que implementan agentes en entornos de producción, este factor requiere especial atención y capas adicionales de validación.

La prueba incluye 657 tareas en 40 aplicaciones simuladas, incluyendo Gmail, Slack, Salesforce y HubSpot. La puntuación final refleja la proporción de tareas completadas por el agente sin violar las reglas establecidas. Artificial Analysis mantiene la lista de tareas en secreto, lo que garantiza la objetividad de los resultados y evita el "entrenamiento específico" de los modelos.

Mi opinión profesional: Grok 4.5 establece un nuevo estándar para el mercado de agentes de IA. La combinación de alta precisión y un costo radicalmente bajo es exactamente lo que se necesita para la adopción masiva de agentes en procesos empresariales. La victoria en el sector financiero es una señal para todo el FinTech. Si Anthropic y Google no responden con una reducción de precios adecuada, la cuota de Grok en el mercado corporativo crecerá exponencialmente.