Exactamente dentro de diez días, el 12 de septiembre, xAI presentará el tan esperado modelo Grok 4.7. Elon Musk hace declaraciones audaces sobre su superioridad sobre todos los sistemas de IA existentes, respaldando sus ambiciones no solo con cambios arquitectónicos, sino también con acceso exclusivo a datos de la industria espacial.

Este anuncio resulta especialmente intrigante en medio de la rápida aceleración del ciclo de lanzamientos. Solo en agosto vimos Grok 4.6 (el día 12), y en julio el debut público de Grok 4.5. Ahora, apenas un mes después, nos espera la siguiente iteración. Mientras tanto, OpenAI no duerme, anunciando su propio modelo Astra, lo que solo intensifica la carrera competitiva.

Los datos de SpaceX como principal baza

La diferencia clave de Grok 4.7 frente a sus predecesores no radica solo en la escala. Musk confirmó que el entrenamiento base está completo y que ahora se encuentra en la fase final de ajuste con datos internos de SpaceX. Es un movimiento estratégico que podría otorgar al modelo una ventaja única en la resolución de tareas de ingeniería y científicas, inaccesible para los competidores.

La arquitectura también ha sufrido cambios significativos. Grok 4.7 operará con 2,1 billones de parámetros, un 40% más que Grok 4.6 (1,5 billones). Sin embargo, según Musk, la nueva versión funcionará algo más lento, pero consumirá tokens de cómputo de manera mucho más eficiente: un compromiso que indica un enfoque en la profundidad del análisis, no en la velocidad de respuesta.

«Grok 4.7 superará a todos los modelos actuales. Dicho esto, Anthropic es una gran empresa; probablemente pronto mostrarán soluciones más avanzadas. Gracias a los datos únicos de entrenamiento de SpaceX, me sorprendería que cualquier otro modelo resultara mejor que Grok 4.7 para tareas de ingeniería en el mundo real», declaró Musk.

Referencias y realidades de los benchmarks

Para entender cuán ambicioso es el objetivo, vale la pena observar los resultados de su predecesor. Grok 4.6 obtuvo 61 puntos en el índice AA Intelligence, igualando a GPT-5.6 Sol Max, pero quedando un punto por detrás del líder: Claude Fable 5 Max (62 puntos). En la prueba GDPVal-AA v2, el modelo alcanzó 1753 puntos, aunque en Terminal-Bench v3.0 los resultados fueron más modestos: solo un 26% frente al 34,6% del competidor de OpenAI.

Es interesante que Grok 4.5 mostrara anteriormente una dinámica similar: liderando en AutomationBench-AA con un 51,4% a un costo de $0,34 por tarea, pero infringiendo con más frecuencia las restricciones de seguridad (0,63 fallos frente a 0,55 de Claude Opus 4.8). Esta tendencia demuestra que xAI apuesta por el poder "bruto", a veces en detrimento de la seguridad.

Ahora que la fecha del lanzamiento final está confirmada, la gran pregunta es si xAI podrá respaldar sus grandes promesas con pruebas independientes, o si volveremos a ver una brecha entre el marketing y los resultados reales.

Mi opinión: apostar por los datos únicos de SpaceX es realmente un movimiento fuerte, difícil de copiar para los competidores. Sin embargo, el factor decisivo no será la cantidad de parámetros, sino la capacidad del modelo para aplicar eficazmente ese conocimiento en escenarios reales. El mercado ya está cansado de récords "de papel": se necesitan pruebas en condiciones reales.