Skip to content
Exterior de un edificio de laboratorio público

En pocas palabras: CAISI del NIST publicó el 17 de septiembre de 2026 que Z.ai lanzó GLM-5.3 el 14 de agosto y abrió pesos dos semanas después. En las baterías cyber de CAISI, GLM-5.3 supera a los open weight chinos previos pero queda por debajo de sistemas estadounidenses de frontera probados con salvaguardas cyber desactivadas, versiones no descargables libremente. Ejemplos: SEC-Bench Pro 40,4 % (74/183) frente a 90,2 % EE. UU. y 27,3 % open weight chino anterior; ExploitBench 61,1 % (9,8/16 best-of-three) frente a 100 % EE. UU. y 32,2 %; ExploitGym 9,4 % frente a 44,4 %; OSS-Fuzz 7,7 % frente a 23,2 %. No mezcle el 50/410 de Anthropic en ExploitBench con el 61,1 % de CAISI: arneses distintos.

Estado de los hechos: Comprobado el 5 de octubre de 2026 con el comunicado NIST CAISI del 17 de septiembre de 2026. Las puntuaciones cambian si los proveedores parchean modelos o actualizan tareas. Las notas estadounidenses reflejan builds de evaluación sin salvaguardas, no necesariamente lo que recibe cada cliente por API.

Qué mide CAISI

CAISI, dentro del National Institute of Standards and Technology, sigue el rendimiento de modelos de inteligencia artificial en tareas estandarizadas, incluidos escenarios cyber relevantes para seguridad nacional e infraestructuras críticas. Cuando un laboratorio chino publica pesos abiertos, CAISI puede aplicar las mismas pruebas que a los modelos estadounidenses de punta y publicar la brecha en cifras claras.

Esa misión no es un red team interno de un proveedor. La entrada de Anthropic a finales de septiembre de 2026 probó GLM-5.3 con sus propios jailbreaks y reporta, por ejemplo, 50 tareas logradas de 410 en su variante ExploitBench. El release CAISI del 17 de septiembre usa nombres de benchmark gubernamentales y muestra ExploitBench al 61,1 % en best-of-three sobre 16 ítems. Ambos porcentajes hablan de capacidad ofensiva, pero no se intercambian en un mismo titular.

GLM-5.3 en el carril open weight

Z.ai, marca ligada a Zhipu AI, entregó GLM-5.3 el 14 de agosto de 2026 y publicó pesos descargables unas dos semanas después, según CAISI. Open weight implica que quien tenga GPUs puede ejecutar el modelo en local, envolverlo en asistentes de hacking o afinar refusals sin pedir permiso a Pekín ni a San Francisco.

CAISI etiqueta a GLM-5.3 como el open weight más capaz en cyber evaluado hasta la fecha, afirmación sobre la clase descargable, no sobre todo el universo cerrado estadounidense. Los modelos frontier cerrados suelen quedar detrás de API monitorizadas. CAISI también prueba modelos estadounidenses con salvaguardas cyber apagadas para comparar, pero esos builds no circulan como GLM-5.3 en foros.

Cifras que conviene separar

En SEC-Bench Pro (183 tareas de razonamiento de seguridad), GLM-5.3 alcanza 40,4 %, 74 tareas. Los modelos estadounidenses de referencia llegan al 90,2 %, frente a 27,3 % de media en open weights chinos anteriores del set comparativo. El salto muestra progreso rápido en open weight chino pese a un hueco amplio con EE. UU.

ExploitBench figura al 61,1 % en best-of-three sobre 16 retos, contra 100 % de la referencia estadounidense y 32,2 % del open weight chino previo. ExploitGym, más interactivo, marca 9,4 % frente a 44,4 % EE. UU. y 2,6 % open weight chino anterior. Tareas tipo OSS-Fuzz sitúan a GLM-5.3 en 7,7 % frente a 23,2 % EE. UU. y 2,4 % open weight chino anterior.

Agregando suites, CAISI ubica a GLM-5.3 unos cuatro meses detrás de la frontera estadounidense en su índice IRT interno. El retraso es estimación de laboratorio, no regla de calendario, pero orienta a quien diseña políticas sobre la velocidad de las descargas abiertas en habilidades cyber.

Lo que este informe no es

CAISI no acusa a Z.ai de una intrusión concreta, no ordena retirada y no criminaliza descargar pesos. El documento informa controles de exportación, defensa de infraestructuras y conversaciones diplomáticas sobre normas de publicación.

Presentar la evaluación como prueba de que GLM-5.3 ya impulsó una brecha nombrada va más allá del texto. Citar el 50/410 de Anthropic y el 61,1 % CAISI en ExploitBench sin explicar tamaños distintos también confunde. Mantenga cada arnés en su carril.

Lo que está claro

Washington tiene ya un marcador público: GLM-5.3 lidera open weight cyber y sigue meses detrás de modelos frontier estadounidenses probados sin salvaguardas en el índice CAISI. Los proveedores pueden parchear; CAISI puede actualizar. Los pesos abiertos obligan a asumir copias fuera del laboratorio.

Convendrá seguir al Departamento de Comercio, si aliados adoptan los mismos benchmarks y si la próxima versión de Z.ai cierra huecos en SEC-Bench o ExploitGym. Por ahora, la lectura defensiva es tratar GLM-5.3 descargable como asistente de scripting capaz en manos adversas, y leer tablas CAISI aparte del blog red team de Anthropic al comparar porcentajes.

Fuentes: NIST CAISI, 17 de septiembre de 2026.