SpaceXAI ha lanzado oficialmente Grok 4.5, un nuevo modelo insignia orientado a la programación, el trabajo con agentes y la resolución de tareas intelectuales complejas. En el comunicado de prensa, el modelo es calificado como «el sistema más potente» en la cartera de la empresa. Sin embargo, el énfasis clave no está en la superioridad absoluta en los benchmarks, sino en el equilibrio entre precio, velocidad y eficiencia.
Grok 4.5 ya está disponible a través de la API y también está integrado en las plataformas Grok Build y Cursor en todos los planes tarifarios. Los usuarios de la Unión Europea aún quedan fuera; se espera su lanzamiento en la región a mediados de julio.
El precio como principal baza
SpaceXAI ofrece Grok 4.5 a un precio de $2 por 1 millón de tokens de entrada y $6 por 1 millón de tokens de salida. Esto es significativamente más barato que sus competidores directos. A modo de comparación: Claude Opus 4.8 de Anthropic cuesta $5 y $25 respectivamente, Claude Fable 5 cuesta $10 y $50, y GPT-5.6 Sol de OpenAI cuesta $5 y $30. Incluso dentro de su propia línea, OpenAI ofrece el modelo Luna a $1 por tokens de entrada, pero a $6 por tokens de salida, lo que es comparable a Grok 4.5.
Elon Musk describió la novedad como «un modelo de clase Opus, pero más rápido, más barato y más eficiente en tokens». Según sus palabras, las pruebas internas de SpaceXAI muestran que Grok 4.5 «es aproximadamente comparable a Opus 4.7, pero mucho más rápido».
Resultados de benchmarks: ambiguos, pero prometedores
Los datos publicados por SpaceXAI muestran un panorama mixto. En la prueba DeepSWE 1.0, Grok 4.5 obtuvo un 62%, por detrás de Fable (66,1%) y GPT-5.5 (64,31%), pero superando a Claude Opus 4.8 (55,75%) y Opus 4.7 (40,12%). El benchmark más reciente DeepSWE 1.1 mostró un resultado del 53%, inferior al de Opus 4.8 (59%), GPT-5.5 (67%) y Fable (70%).
En SWE Bench Pro, el modelo alcanzó un 64,7%, superando a GPT-5.5 (58,6%) y casi al nivel de Opus 4.7 (64,3%), pero por debajo de Opus 4.8 (69,2%) y Fable (80,4%). En Terminal Bench 2.1, Grok 4.5 demostró un 83,3%, casi idéntico a GPT-5.5 (83,4%) y ligeramente por detrás de Fable (84,3%). Sin embargo, en SWE Marathon, el modelo ocupó el primer lugar con un 29%, superando a Opus 4.8 (26%) y Fable (24%). También se afirma su liderazgo en Harvey's Legal Agent Benchmark.
Economía de tokens: donde SpaceXAI realmente gana
El argumento más sólido a favor de Grok 4.5 no son las puntuaciones brutas, sino la eficiencia en el uso de tokens. En las tareas de SWE Bench Pro, el modelo consumió un promedio de 15,954 tokens de salida por tarea. En Claude Opus 4.8, esta cifra fue de 67,020 tokens, 4.2 veces más. Con un precio por token más bajo, esto implica una reducción drástica del costo final para escenarios con un gran número de iteraciones: corrección de errores, generación de parches, revisión de código y ciclos de agentes.
SpaceXAI también afirma una velocidad de generación de aproximadamente 80 tokens por segundo y una ventana de contexto de 500,000 tokens. El modelo se posiciona como un compromiso entre calidad, velocidad y costo, exactamente lo que se necesita para implementaciones industriales a gran escala.
Vínculo con Cursor y contexto estratégico
Es notable que Grok 4.5 se entrenó en estrecha colaboración con el servicio de IA Cursor, que SpaceX acordó recientemente adquirir por $60 mil millones. En el entrenamiento se utilizaron datos de sesiones de desarrolladores de Cursor, incluyendo trazas de depuración y correcciones de código reales, no solo repositorios estáticos. Esto explica la fuerte orientación del modelo hacia tareas prácticas de programación.
Para entrenar Grok 4.5, la empresa utilizó decenas de miles de GPU Nvidia GB300. El modelo se convierte en uno de los primeros grandes después de la fusión de la dirección de IA de Elon Musk con SpaceX.
Mi opinión experta: SpaceXAI no apuesta a ser la mejor en todas las pruebas, sino a ser la más económicamente eficiente en escenarios de uso real. En una era donde los costos de inferencia se convierten en un factor crítico para la escalabilidad de la IA, este enfoque podría resultar más ventajoso que la búsqueda de récords abstractos en benchmarks. Si Grok 4.5 realmente ofrece una calidad comparable con un costo de tokens 4 veces menor, esto podría reconfigurar seriamente el mercado de modelos de IA para el sector empresarial.