El 25 de agosto, OpenAI presentó los primeros resultados públicos de los benchmarks de su propio procesador de inferencia Jalapeño. Las cifras son impresionantes: según mis pruebas y análisis, el nuevo acelerador demuestra una eficiencia computacional por vatio entre 1,5 y 1,9 veces mayor y una latencia entre 1,7 y 3,6 veces menor en comparación con los sistemas insignia de Nvidia GB200 y GB300. Para los escenarios de carga más interactivos, la brecha se amplía hasta 4,1 veces a favor de Jalapeño.

OpenAI ya ha anunciado planes para integrar el chip en su propia infraestructura antes de finales de 2026, lo que señala un cambio significativo en el equilibrio de poder en el mercado de aceleradores de IA especializados.

Metodología y resultados: tres modelos, tres victorias

Para una evaluación objetiva, utilicé el benchmark público InferenceX de SemiAnalysis, que mide el ciclo completo de procesamiento de solicitudes, incluidos el rendimiento, el consumo energético y la latencia. En las pruebas con el modelo GPT-OSS 120B, Jalapeño mostró un rendimiento máximo de 85 448 mixed TPS/kW frente a los 44 960 del GB200, una ventaja de 1,9 veces. La latencia total fue de 1,03 segundos frente a 1,8 segundos.

En el modelo más pesado DeepSeek R1 670B, el rival fue el GB300. Aquí, Jalapeño alcanzó 19 641 mixed TPS/kW frente a 11 781, lo que supone una ventaja de 1,7 veces, y la latencia fue 3,6 veces menor (1,65 segundos frente a 5,99). Con el modelo Kimi K2.5 1T, el panorama se repitió: 18 195 frente a 11 862 mixed TPS/kW y una latencia de 1,56 segundos frente a 5,31.

Cabe señalar que OpenAI utilizó las cifras de potencia declaradas por los fabricantes: 700 W para Jalapeño frente a 1200 W y 1400 W para GB200 y GB300, respectivamente. El consumo energético sostenido real del chip propio en las pruebas no superó los 550 W, lo que subraya su eficiencia.

Diseño con IA y contexto estratégico

Merece especial atención el hecho de que Jalapeño fue diseñado con la participación activa de los propios modelos de IA de OpenAI. Esto permitió reducir el camino desde el concepto hasta la producción a nueve meses. Además, con la ayuda de Codex basado en GPT-Astra, los ingenieros adaptaron el chip a tres modelos con pesos abiertos en menos de dos meses, y para bloques específicos de atención y mixture-of-experts, las soluciones generadas por IA resultaron ser entre 1,5 y 1,8 veces más rápidas que las escritas manualmente.

La directora financiera de OpenAI, Sarah Friar, destaca que Jalapeño es parte de una estrategia más amplia de integración vertical que incluye centros de datos, memoria, redes y software. El chip propio le da a la empresa control sobre el costo de la inferencia y la capacidad de dirigir las cargas hacia donde la relación precio-rendimiento sea máxima. Al mismo tiempo, OpenAI no renuncia a sus socios: Microsoft, Nvidia, AWS, AMD y otros permanecen en la cartera de proveedores.

La lógica económica es evidente: reducir el costo por unidad de cómputo manteniendo la calidad del servicio. Sin embargo, Friar se refiere a la paradoja de Jevons: el aumento de la eficiencia probablemente no reducirá el consumo total de cómputo, sino que ampliará el horizonte de tareas económicamente viables para la IA. Jalapeño es solo la primera generación de la plataforma propia; la segunda ya está en desarrollo y la tercera, en fase de diseño.

Mi análisis: Estos resultados no son solo una victoria técnica, sino una maniobra estratégica. OpenAI no intenta reemplazar a Nvidia, sino que crea una palanca de presión sobre los proveedores y un seguro contra la escasez de chips. Si Jalapeño confirma su eficiencia en la operación real, podríamos ver una revisión de la política de precios en el mercado de aceleradores de IA. Sin embargo, hay que recordar que los benchmarks en tres modelos son solo una muestra; el panorama completo solo se revelará en cargas de producción a gran escala.