Carrera de velocidad: Google y OpenAI presentaron soluciones de IA de nueva generación para la codificación y los agentes.

El 13 de agosto, los gigantes tecnológicos actualizaron casi simultáneamente sus líneas de productos de IA. Google presentó Gemini 3.7 Flash, mientras que OpenAI anunció el modo Ultrafast para GPT-5.6 Sol. Ambos desarrollos apuntan al mismo segmento: la ejecución de alta velocidad de tareas relacionadas con la generación de código y el trabajo de agentes de IA. Esto no es una simple coincidencia, sino una señal clara al mercado: la batalla por el rendimiento y la latencia alcanza un nuevo nivel.
Novedades en Gemini 3.7 Flash
Google posiciona Gemini 3.7 Flash como un caballo de batalla para la programación y la automatización de procesos empresariales. La compañía afirma mejoras sustanciales en la planificación de múltiples etapas, el seguimiento de instrucciones y la calidad de la generación de código. Es notable que el costo de uso del modelo se haya reducido a la mitad en comparación con el precio de lanzamiento de la versión anterior.
La línea Flash se creó históricamente para escenarios donde la velocidad de respuesta es crítica, no solo su profundidad. Esto incluye codificación, trabajo de agentes autónomos y tareas con múltiples solicitudes secuenciales a la red neuronal. En julio, Google lanzó Gemini 3.6 Flash con un precio de $1,5 por 1 millón de tokens de entrada y $7,5 por 1 millón de tokens de salida. Ese modelo mostró una eficiencia un 17% mayor en el uso de tokens de salida que 3.5 Flash.
Sin embargo, la insignia Gemini 3.5 Pro aún no ha llegado al acceso público. Actualmente, los desarrolladores la están probando con un grupo limitado de socios, y las fechas exactas de lanzamiento siguen siendo desconocidas. Esto crea intriga: mientras Google se centra en la velocidad de los modelos económicos, el segmento premium permanece sin actualizaciones.
Cómo OpenAI aceleró GPT-5.6 Sol
OpenAI, por su parte, ha optado por la aceleración de hardware. El nuevo modo Ultrafast para GPT-5.6 Sol puede funcionar hasta 14 veces más rápido que el estándar, produciendo hasta 750 tokens de salida por segundo. Esto se logra mediante el uso de la infraestructura de Cerebras: chips especializados optimizados para grandes modelos de lenguaje.
En su lanzamiento, Ultrafast está disponible a través de la API solo para un número limitado de clientes. OpenAI planea expandir gradualmente el acceso a medida que aumente la capacidad de cómputo. La cifra de 750 tokens por segundo ya fue mencionada por la compañía durante el anuncio de GPT-5.6 en junio, advirtiendo que la versión acelerada no estaría disponible para todos inicialmente.
Recordemos que en agosto, SpaceXAI también presentó Grok 4.6, un modelo insignia centrado en tareas de agentes a largo plazo y programación. La competencia en este segmento se está volviendo cada vez más feroz.
Mi análisis: Estamos presenciando un cambio fundamental en la industria: la competencia se desplaza de la simple calidad de las respuestas hacia la velocidad y el costo de la inferencia. La reducción a la mitad del precio de Gemini 3.7 Flash es una respuesta directa a la presión de los modelos abiertos, y la carrera por los tokens por segundo es un intento de capturar el mercado en tiempo real, donde los agentes de IA ejecutarán transacciones y escribirán código en vivo. En los próximos meses, veremos una guerra de precios aún más agresiva en las API.