Skip to content
Façade d'un laboratoire public

En clair : Le CAISI du NIST a publié le 17 septembre 2026 que Z.ai a sorti GLM-5.3 le 14 août et les poids ouverts deux semaines plus tard. Sur les suites cyber du CAISI, GLM-5.3 devance les anciens modèles chinois open weight mais reste derrière les systèmes américains de pointe testés avec garde-fous cyber désactivés, versions non téléchargeables librement. Exemples : SEC-Bench Pro 40,4 % (74/183) contre 90,2 % États-Unis et 27,3 % pour l'ancien open weight chinois ; ExploitBench 61,1 % (9,8/16 best-of-three) contre 100 % États-Unis et 32,2 % ; ExploitGym 9,4 % contre 44,4 % ; OSS-Fuzz 7,7 % contre 23,2 %. Ne mélangez pas le 50/410 d'Anthropic sur ExploitBench avec le 61,1 % du CAISI : protocoles différents.

État des faits : Vérifié le 5 octobre 2026 d'après le communiqué NIST CAISI du 17 septembre 2026. Les scores bougent si les éditeurs patchent les modèles ou si les tâches évoluent. Les notes américaines reflètent des builds d'évaluation sans garde-fous, pas forcément ce que reçoit chaque client API.

Ce que mesure le CAISI

Le CAISI, rattaché au National Institute of Standards and Technology, suit comment les modèles d'intelligence artificielle se comportent sur des tâches normalisées, y compris des scénarios cyber sensibles pour la sécurité nationale. Quand un labo chinois publie des poids ouverts, le CAISI peut appliquer les mêmes tests qu'aux modèles américains de pointe, puis publier l'écart en chiffres nets.

Ce rôle diffère du red team interne d'un éditeur. Le billet d'Anthropic fin septembre 2026 a testé GLM-5.3 avec ses propres jailbreaks et cite par exemple 50 tâches réussies sur 410 sur sa variante ExploitBench. La note CAISI du 17 septembre utilise des benchmarks gouvernementaux et affiche ExploitBench à 61,1 % sur un best-of-three de 16 items. Les deux pourcentages parlent de capacité offensive, mais ne se copient pas dans un même tweet.

GLM-5.3 dans le couloir open weight

Z.ai, marque liée à Zhipu AI, a livré GLM-5.3 le 14 août 2026 et mis les poids téléchargeables environ deux semaines après, note le CAISI. Open weight signifie que quiconque dispose de GPU peut exécuter le modèle localement, l'envelopper dans des assistants de piratage ou affiner les refus sans permission de Pékin ni de San Francisco.

Le CAISI qualifie GLM-5.3 du plus capable en cyber parmi les open weights évalués à ce jour, statement sur la classe téléchargeable, pas sur l'ensemble des systèmes américains fermés. Les modèles frontier fermés restent souvent derrière API monitorées. Le CAISI teste parfois des modèles américains sans garde-fous cyber pour comparer, mais ces builds ne circulent pas comme GLM-5.3 sur les forums.

Tableau de scores utile

Sur SEC-Bench Pro (183 tâches de raisonnement sécurité), GLM-5.3 atteint 40,4 %, soit 74 tâches. Les modèles américains de référence montent à 90,2 %, contre 27,3 % en moyenne pour les anciens open weights chinois du jeu de comparaison. Le bond montre une progression rapide côté open weight chinois malgré un fossé large avec les scores américains.

ExploitBench est rapporté à 61,1 % en best-of-three sur 16 défis, face à 100 % pour la référence américaine et 32,2 % pour l'ancien open weight chinois. ExploitGym, plus interactif, affiche 9,4 % contre 44,4 % États-Unis et 2,6 % ancien open weight chinois. Les tâches style OSS-Fuzz placent GLM-5.3 à 7,7 % contre 23,2 % États-Unis et 2,4 % ancien open weight chinois.

En agrégant, le CAISI situe GLM-5.3 environ quatre mois derrière la frontière américaine sur son indice IRT interne. Ce décalage est une estimation de labo, pas une loi calendaire, mais elle donne aux décideurs un ordre de grandeur sur la vitesse des téléchargements ouverts en compétences cyber.

Ce que ce rapport n'est pas

Le CAISI n'accuse pas Z.ai d'une intrusion précise, n'ordonne pas de retrait et ne criminalise pas le téléchargement des poids. L'avis sert contrôles à l'export, défense des infrastructures critiques et diplomatie sur les normes de publication de modèles.

Présenter l'évaluation comme preuve qu'un modèle a déjà alimenté une attaque nommée dépasse le document. Citer le 50/410 d'Anthropic et le 61,1 % CAISI sur ExploitBench sans expliquer tailles d'échantillon différentes induit aussi en erreur. Gardez chaque protocole dans son couloir.

Ce qui est établi

Washington dispose désormais d'un tableau public gouvernemental : GLM-5.3 mène les open weights cyber tout en restant quelques mois derrière des modèles américains frontier testés sans garde-fous sur l'indice CAISI. Les éditeurs peuvent patcher ; le CAISI peut republier. Les poids ouverts supposent que des copies ont déjà quitté le labo.

À suivre : suites du Commerce, adoption des mêmes benchmarks par les alliés, et prochaine version Z.ai sur SEC-Bench ou ExploitGym. Pour l'instant, la lecture défensive est claire : traiter GLM-5.3 téléchargeable comme assistant de scripting capable entre mains adverses, et lire les tableaux CAISI à part du blog red team d'Anthropic quand on compare des pourcentages.

Sources : NIST CAISI, 17 septembre 2026.