SpaceXAI ha presentado oficialmente Grok 4.5, un nuevo modelo lingüístico orientado a la programación, tareas de agente y trabajo intelectual. La compañía lo posiciona como su sistema más potente hasta la fecha. El modelo ya está disponible a través de la API, en Grok Build y en el entorno de desarrollo Cursor en todos los planes de suscripción. Los usuarios de la Unión Europea aún no pueden acceder a él; su lanzamiento allí está previsto para mediados de julio.
La ventaja clave de Grok 4.5, según los desarrolladores, es la combinación de rendimiento con una agresiva política de precios. El costo del modelo es de $2 por cada millón de tokens de entrada y $6 por cada millón de tokens de salida. A modo de comparación: Claude Opus 4.8 de Anthropic cuesta $5 y $25 respectivamente, Claude Fable 5 cuesta $10 y $50, y el buque insignia de OpenAI, GPT-5.6 Sol, cuesta $5 y $30. Dentro de la misma línea, GPT-5.6 Luna ofrece un precio aún más bajo: $1 por entrada y $6 por salida, pero se encuentra en modo de vista previa limitada. Esto convierte a Grok 4.5 en una de las soluciones más accesibles en su clase.
Elon Musk describió la novedad como un modelo "de clase Opus, pero significativamente más rápido, más barato y más eficiente en tokens". Según él, las pruebas internas de SpaceXAI muestran que Grok 4.5 es "aproximadamente comparable a Opus 4.7, pero mucho más rápido".
Resultados de benchmarks: desigual, pero competitivo
Los datos de benchmarks publicados por SpaceXAI pintan un panorama mixto. En DeepSWE 1.0, el modelo obtuvo un 62%, por detrás de Fable (66,1%) y GPT-5.5 (64,31%), pero superando a Claude Opus 4.8 (55,75%) y Opus 4.7 (40,12%). En el más complejo DeepSWE 1.1, el resultado fue inferior: 53% frente al 59% de Opus 4.8 y el 70% de Fable. En SWE Bench Pro, Grok 4.5 mostró un 64,7%, superando a GPT-5.5 (58,6%) y estando al nivel de Opus 4.7 (64,3%), pero por debajo de Opus 4.8 (69,2%) y Fable (80,4%).
Sin embargo, en algunas pruebas el modelo se mostró más fuerte. En Terminal Bench 2.1 obtuvo un 83,3%, casi igualando a GPT-5.5 (83,4%) y quedando solo ligeramente por detrás de Fable (84,3%). En SWE Marathon, Grok 4.5 ocupó el primer lugar con un 29%, superando a Opus 4.8 (26%) y Fable (24%). La compañía también afirmó su liderazgo en el Harvey's Legal Agent Benchmark, una prueba para tareas de agente legal.
La economía, el principal as bajo la manga
El argumento más sólido a favor de Grok 4.5 no reside en el ámbito del rendimiento máximo, sino en la economía. SpaceXAI presenta datos que indican que en las tareas de SWE Bench Pro, el modelo utiliza un promedio de 15,954 tokens de salida por tarea, mientras que Claude Opus 4.8 utiliza 67,020 tokens, es decir, 4.2 veces más. Con un precio por token significativamente más bajo, esto convierte a Grok 4.5 en una opción extremadamente ventajosa para escenarios con un gran número de iteraciones: corrección de errores, generación de parches, revisión de código y ciclos de agente.
Adicionalmente, se declara una velocidad de generación de aproximadamente 80 tokens por segundo y una ventana de contexto de 500,000 tokens. SpaceXAI posiciona el modelo como el compromiso óptimo entre calidad, velocidad y costo.
Vínculo con Cursor y contexto estratégico
Es importante señalar que Grok 4.5 se entrenó conjuntamente con el servicio de IA Cursor, que SpaceX acordó recientemente adquirir por $60 mil millones. La operación se realizará con acciones de clase A y se espera que se cierre en el tercer trimestre de 2026. Para el entrenamiento del modelo se utilizaron datos de sesiones reales de desarrolladores de Cursor, incluyendo trazas de depuración y correcciones de código, lo que le otorga una ventaja única en la comprensión de tareas prácticas de programación. Para el entrenamiento se emplearon decenas de miles de GPU Nvidia GB300.
Este lanzamiento es una de las primeras grandes iniciativas tras la fusión de la división de IA de Elon Musk con SpaceX. Grok 4.5 no pretende ser el líder indiscutible en todas las pruebas, sino que ofrece un enfoque pragmático: una calidad suficientemente alta a un precio que podría revolucionar la economía de las aplicaciones empresariales. En un mundo donde los costos de inferencia se están convirtiendo en la principal barrera para la escalabilidad de la IA, este enfoque no solo parece razonable, sino potencialmente dominante.