Crypto news

14.08.2026
07:25

Z.ai lanza GLM-5.3: un avance en la codificación agéntica y la búsqueda de vulnerabilidades

ИИ-агенты AI agents

La startup china Z.ai presentó oficialmente el modelo de lenguaje GLM-5.3, apostando por tres áreas clave: programación, escenarios de agentes autónomos y ciberseguridad. Esto no es solo una actualización incremental: los desarrolladores afirman un salto radical en el rendimiento en varios benchmarks especializados.

Post-entrenamiento sin cambio de arquitectura

Es notable que el aumento de potencia computacional se logró exclusivamente mediante post-entrenamiento, sin modificar el modelo base en comparación con GLM-5.2. Esto indica un alto potencial en la optimización de algoritmos de aprendizaje, algo poco común en la industria. Los pesos abiertos estarán disponibles en dos semanas, tras completar la evaluación de seguridad y un endurecimiento adicional.

En la prueba interna Code Bench, que evalúa la calidad de la codificación, el nuevo modelo mejoró el resultado de su predecesor en un 50%. Sin embargo, los datos sobre escenarios de agentes y ciberseguridad son mucho más impresionantes:

  • Terminal Bench 3.0 — 28,3 puntos frente a 4,6 de GLM-5.2 (crecimiento de más de 6 veces);
  • DeepSWE v1.1 — 66,9 frente a 46,2;
  • Agents' Last Exam — 28,5 frente a 23,8;
  • CyberGym — 84,5% frente a 77,2%;
  • ExploitBench — 54,4% frente a 24,4%.

Caza de vulnerabilidades: 2436 hallazgos

ExploitGym merece especial atención. Con un presupuesto de dos horas, el modelo resolvió 105 tareas frente a 29 de GLM-5.2, y con seis horas, 130 frente a 39. Esto demuestra no solo una mejora, sino una transición cualitativa hacia el trabajo autónomo real.

Durante las pruebas en bases de código reales, en colaboración con equipos de seguridad chinos, el sistema identificó 2436 vulnerabilidades en 269 proyectos, incluyendo 1097 problemas de criticidad media y alta. Solo se revelaron públicamente 53 hallazgos; los otros 2383 permanecen bajo embargo. La «edad» promedio de las vulnerabilidades detectadas es de 26,6 años, y la más antigua data de 1981.

Para garantizar la transparencia del proceso, Z.ai lanzó Security Disclosure Ledger, un registro público que rastrea el estado de divulgación y la criticidad de cada hallazgo. Este es un paso poco común en la industria que aumenta la confianza en el modelo.

Lanzamiento del producto y contexto del mercado

GLM-5.3 ya está implementada para los suscriptores de GLM Coding Plan como motor principal para programación de agentes y tareas de larga duración. Las solicitudes a modelos antiguos se enrutan automáticamente al nuevo, lo que facilita la migración de los usuarios.

Recordemos que en julio, Anthropic acusó a Z.ai de destilación no autorizada de GLM-5.2 utilizando respuestas de Claude y GPT. Este lanzamiento probablemente intensificará la tensión competitiva en el segmento de agentes de IA para desarrolladores.

Mi análisis: El crecimiento en escenarios de agentes y ciberseguridad es un movimiento estratégico de Z.ai para diferenciarse de OpenAI y Anthropic, que se centran en modelos generales. Sin embargo, la mejora del 50% en Code Bench, lograda sin cambiar la arquitectura, plantea preguntas sobre la reproducibilidad de tales resultados en condiciones reales. La industria necesita benchmarks independientes, no solo métricas internas.