
GLM-5.3 ya está disponible de forma parcial con una estrategia poco habitual: Z.ai ha mantenido el mismo modelo base de 743.000 millones de parámetros utilizado por GLM-5.2 y ha concentrado las mejoras en el postentrenamiento. El resultado, según las evaluaciones comunicadas por la compañía, se nota especialmente en tareas de programación largas y en varios escenarios de ciberseguridad.
El modelo puede utilizarse actualmente mediante la API de Z.ai, el GLM Coding Plan y ZCode. Los pesos todavía no se han publicado. Z.ai prevé liberarlos aproximadamente dos semanas después del lanzamiento, una vez terminadas sus evaluaciones de seguridad y el proceso de endurecimiento.
GLM-5.3 reutiliza la base de GLM-5.2, pero obtiene mejores resultados al ampliar los entornos de entrenamiento, los tipos de tareas y la duración del postentrenamiento.
Más rendimiento en tareas de programación extensas
La mejora más llamativa aparece en Terminal-Bench 3.0, donde GLM-5.3 pasa del 4,6% de GLM-5.2 al 28,3%. En DeepSWE v1.1, el resultado sube de 46,2% a 66,9%, mientras que Agents’ Last Exam en su modalidad CLI avanza de 23,8% a 28,5%. En GDPval-AA v2, una prueba que cubre 44 ocupaciones, el modelo alcanza una puntuación de 1.769.
Estas cifras apuntan a usos como refactorizaciones a escala de repositorio, agentes de línea de comandos con tareas de larga duración, análisis de fallos en integración continua y revisión de código. Para startups y organizaciones de ingeniería medianas, el acceso mediante API o el plan de programación permite probar estas funciones sin esperar a la publicación de los pesos.
Resultados internos y comparación con otros modelos
En Z.ai Code Bench, una evaluación interna, Z.ai comunica una mejora del 50% frente a GLM-5.2 y una puntuación del 31,4% con unos 50.000 tokens de salida por tarea. La compañía compara ese resultado con el 29,5% de Claude Opus 4.8 usando 120.000 tokens, mientras que Claude Fable 5 alcanza el 39,5% con el máximo esfuerzo. En varias pruebas públicas de programación más exigentes, GLM-5.3 queda por detrás de GPT-5.6 Sol y Fable 5.
Todos estos resultados son comunicados por Z.ai. Las comparaciones dependen del banco de pruebas, la longitud de contexto y los ajustes de muestreo empleados, por lo que no permiten establecer un ganador general entre modelos.
Un salto mayor en pruebas de ciberseguridad
Z.ai afirma que el comportamiento en seguridad superó sus previsiones iniciales. Tras incorporar datos de descubrimiento de vulnerabilidades, GLM-5.3 mejoró no solo en la identificación de fallos aislados, sino también en la planificación de cadenas completas de explotación.
En CyberGym, que evalúa el descubrimiento y la validación a partir de código fuente disponible, el modelo sube del 77,2% al 84,5%. Esa cifra queda ligeramente por encima de Mythos 5, con un 83,8%, y GPT-5.6 Sol, con un 83,6%. En ExploitBench, que exige localizar la causa raíz y producir un exploit funcional, el resultado pasa del 24,4% al 54,4%, aunque Mythos 5 conserva una ventaja notable con el 78%.
ExploitGym muestra una evolución similar: GLM-5.3 completa 105 tareas en dos horas y 130 en seis, frente a las 29 y 39 de GLM-5.2. Mythos 5 alcanza 181 y 247 tareas en esos mismos intervalos. El patrón comunicado por Z.ai es que las mejoras aumentan cuanto más avanzada es la fase de explotación evaluada, pero la distancia con otros modelos sigue siendo desigual según la prueba.
Acceso actual y aspectos pendientes
El modelo puede resultar especialmente relevante para herramientas de desarrollo, infraestructura en la nube, seguridad de aplicaciones, ingeniería en fintech y comercio electrónico, además de proveedores que trabajan con kernels, motores de navegador o pilas de red. Los equipos de seguridad y los proveedores de servicios gestionados obtienen señales útiles para evaluar automatización, pero también afrontan mayores exigencias de control y políticas de uso.
Las empresas con requisitos estrictos de residencia de datos o revisiones de proveedores pueden preferir esperar a la publicación de los pesos. Ese lanzamiento, previsto para unas dos semanas después, será un momento importante para comprobar el acceso directo al modelo y realizar evaluaciones propias.
Conclusión
GLM-5.3 muestra que el aumento del postentrenamiento puede traducirse en avances relevantes sin modificar el modelo base. Sus progresos son especialmente visibles en programación de larga duración y en determinadas pruebas de ciberseguridad, aunque los resultados publicados siguen siendo mediciones de Z.ai y no una evaluación independiente.
El despliegue actual permite empezar a probarlo mediante sus servicios de acceso, mientras que la publicación de los pesos y las auditorías externas ayudarán a determinar hasta qué punto estas mejoras se mantienen fuera de los entornos y configuraciones elegidos por la compañía.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.


