Z.ai ha presentado GLM-5.3: un avance en la programación agéntica y la ciberseguridad

La startup china Z.ai presentó oficialmente el modelo de lenguaje GLM-5.3, apostando por una mejora significativa en programación, escenarios de agentes y búsqueda de vulnerabilidades. Esta actualización no es solo una iteración, sino un paso estratégico que redefine el posicionamiento de la empresa en la carrera del desarrollo de IA.
Mejoras clave y benchmarks
Contrariamente a las expectativas del mercado, el aumento de rendimiento se logró exclusivamente mediante el post-entrenamiento, sin cambiar la arquitectura base. Este enfoque permite a Z.ai escalar rápidamente las mejoras, manteniendo los costos computacionales en el mismo nivel. En la prueba interna Code Bench, que evalúa habilidades de codificación, GLM-5.3 mostró una mejora del 50% en comparación con su predecesora GLM-5.2.
Los resultados en benchmarks especializados son especialmente impresionantes:
- Terminal Bench 3.0 — 28,3 puntos frente a 4,6 de GLM-5.2 (crecimiento de 6 veces);
- DeepSWE v1.1 — 66,9 frente a 46,2;
- Agents' Last Exam — 28,5 frente a 23,8;
- CyberGym — 84,5% frente a 77,2%;
- ExploitBench — 54,4% frente a 24,4% (más del doble).
Avance en la búsqueda de vulnerabilidades
Merece especial atención ExploitGym, donde el modelo demostró una eficacia sobresaliente: con un presupuesto de dos horas resolvió 105 tareas frente a 29 de GLM-5.2, y con un límite de seis horas — 130 tareas en lugar de 39. Estas cifras indican un salto cualitativo en el análisis autónomo de seguridad.
En pruebas reales sobre bases de código junto con equipos de seguridad chinos, el sistema identificó 2436 vulnerabilidades en 269 proyectos, de las cuales 1097 son de criticidad media y alta. Solo se revelaron públicamente 53 hallazgos; los otros 2383 permanecen bajo embargo. La «edad» promedio de las vulnerabilidades detectadas es de 26,6 años, y la más antigua data de 1981. Para mayor transparencia, Z.ai lanzó el registro público Z.ai Security Disclosure Ledger, que rastrea el estado y la criticidad de los hallazgos.
Integración de producto y contexto
GLM-5.3 ya está implementada para los suscriptores de GLM Coding Plan, donde se convierte en el motor principal para la programación con agentes y tareas de larga duración. Las solicitudes a modelos antiguos se enrutan automáticamente a la nueva versión, lo que simplifica la migración de los usuarios. Los pesos abiertos aparecerán en dos semanas, tras la evaluación de seguridad y el endurecimiento.
Recuerdo que en julio Anthropic acusó a Z.ai de destilación no autorizada de GLM-5.2 utilizando respuestas de Claude y GPT. Este contexto añade intriga: el éxito de GLM-5.3 podría ser tanto el resultado de investigaciones propias como de métodos controvertidos, lo que plantea la cuestión de los límites de la innovación en la industria.
Mi opinión: Z.ai demuestra que el post-entrenamiento es una palanca subestimada para mejorar rápidamente los modelos, especialmente en dominios de nicho como la ciberseguridad. Sin embargo, un enfoque tan agresivo en ExploitBench podría señalar un cambio del mercado hacia herramientas de IA ofensivas, lo que inevitablemente provocará nuevos debates éticos y regulatorios.