Carrera de velocidades: Google y OpenAI presentan soluciones de IA de nueva generación

El 13 de agosto se produjo un doble golpe al mercado de la inteligencia artificial: Google anunció el modelo Gemini 3.7 Flash, y OpenAI presentó el revolucionario modo Ultrafast para GPT-5.6 Sol. Ambos desarrollos apuntan a un segmento crítico: la ejecución de tareas de alta velocidad relacionadas con la programación y los agentes de IA autónomos.
Gemini 3.7 Flash: apuesta por la eficiencia y el ahorro
El nuevo modelo de Google se posiciona como un caballo de batalla para el sector corporativo y los desarrolladores. Las mejoras clave se centran en la planificación de múltiples etapas, el seguimiento preciso de instrucciones y la generación de código. Sin embargo, el aspecto más intrigante ha sido la reducción radical del precio: el costo de uso ha caído a la mitad en comparación con la tarifa de la versión anterior.
La línea Flash tradicionalmente cubre escenarios donde la latencia es crítica: codificación, pipelines de agentes y tareas con múltiples llamadas secuenciales al modelo. Recuerdo que en julio salió Gemini 3.6 Flash con un precio de $1,5 por millón de tokens de entrada y $7,5 por millón de tokens de salida. En ese momento, la compañía también informó de una reducción del 17% en el consumo de tokens de salida en comparación con 3.5 Flash.
Es revelador que el modelo insignia Gemini 3.5 Pro todavía esté en fase de pruebas cerradas con socios, y los plazos para su lanzamiento público sigan siendo inciertos. Esto crea un desequilibrio curioso: Google claramente apuesta por el segmento masivo, no por los modelos premium.
OpenAI Ultrafast: 750 tokens por segundo basados en Cerebras
OpenAI respondió con su propia baza: el modo Ultrafast para GPT-5.6 Sol. Las cifras declaradas son impresionantes: hasta 14 veces más rápido que la versión estándar y generación de hasta 750 tokens de salida por segundo. La base tecnológica es la infraestructura de Cerebras, especializada en obleas de silicio gigantes.
Al inicio, solo un grupo limitado de clientes tendrá acceso a Ultrafast a través de la API. Es un paso deliberado: OpenAI irá aumentando gradualmente la capacidad de cómputo, conectando a nuevos usuarios de forma progresiva. Es notable que la cifra de 750 tokens por segundo ya aparecía en el anuncio de GPT-5.6 de junio, aunque entonces la compañía advirtió sobre un acceso desigual a la versión acelerada.
El contexto de la carrera se intensifica con el lanzamiento en agosto de Grok 4.6 de SpaceXAI, centrado en escenarios de agentes a largo plazo y aplicaciones interactivas.
Mi análisis: Estamos presenciando un cambio tectónico en la competencia: de la calidad de las respuestas a la velocidad para obtenerlas. El abaratamiento de los modelos Flash de Google y el agresivo modo ultrarrápido de OpenAI son una consecuencia directa de la presión de los modelos abiertos. Sin embargo, 750 tokens por segundo no es solo marketing: estas cifras abren el camino a agentes en tiempo real que puedan interactuar con el usuario sin demoras perceptibles. La cuestión es si Cerebras podrá escalar lo suficientemente rápido para democratizar esta tecnología, o si la ultra velocidad seguirá siendo un privilegio de unos pocos clientes corporativos seleccionados.