Grok 4.5 aplasta a la competencia en pruebas de agentes de IA en navegadores: el nuevo líder de autonomía
Los desarrolladores están creando activamente asistentes de IA capaces de interactuar de forma autónoma con sitios web: abrir páginas, hacer clic en botones, rellenar formularios y recopilar información. Estos agentes pueden, por orden del usuario, reservar un billete o analizar datos de un sitio web, todo sin intervención humana.
Una reciente prueba comparativa realizada por el creador del servicio Browser Use, Gregor Zunic, mostró que la herramienta basada en el modelo Grok de xAI maneja esta tarea significativamente mejor que sus competidores. Esto no es solo una victoria en un benchmark, sino una señal de un cambio de paradigma en el segmento de los agentes de navegación autónomos.
Quién obtuvo el mejor resultado
Los analistas evaluaron cinco herramientas según un único criterio: la frecuencia de finalización exitosa de tareas en el sitio web sin errores. Cuanto mayor sea la puntuación, más fiable es el agente.
El líder con una gran ventaja fue Grok: su agente completó correctamente el 76,42% de las tareas. En segundo lugar, el asistente de OpenAI con un resultado de 72,70%. Le siguen dos agentes de Anthropic con puntuaciones de 70,75% y 67,92%. Cierra la clasificación GPT a través del plugin OpenClaw, con solo un 60,38% de ejecuciones exitosas.
Cada asistente funciona con su propio modelo de IA base. Grok utiliza el modelo Grok 4.5, las herramientas de OpenAI usan GPT 5.5, y las soluciones de Anthropic emplean Opus 4.8. Es el modelo, como el "cerebro" del sistema, el que toma las decisiones, mientras que el agente solo añade la capacidad de controlar el navegador.
Qué tener en cuenta
Las pruebas demuestran claramente que, en igualdad de condiciones, la elección del modelo de IA juega un papel decisivo. Grok 4.5 supera objetivamente a sus oponentes en tareas de navegación web autónoma. Sin embargo, también es importante la forma de conexión al navegador: en el mismo asistente de Anthropic, el resultado varió casi tres puntos porcentuales según el método de integración con el sitio web.
Mi opinión experta: El dominio de Grok 4.5 en este benchmark no es casualidad. Indica un trabajo enfocado de xAI en mejorar la capacidad del modelo para realizar acciones secuenciales en un entorno digital real. Para la industria de las criptomonedas, esto es especialmente importante: los agentes autónomos pueden simplificar drásticamente la interacción con protocolos DeFi, DEX y mercados NFT, realizando operaciones rutinarias por el usuario. Si esta tendencia continúa, nos espera un auge de la automatización con IA en Web3.