📑 Table des matières

Anthropic accuse GLM-5.3 de capacités de hacking « Mythos-class » — et relance la guerre contre les open weights

LLM & Modèles 🟢 Débutant ⏱️ 15 min de lecture 📅 2026-09-30

Anthropic accuse GLM-5.3 de capacités de hacking « Mythos-class » — et relance la guerre contre les open weights

🔎 Un rapport explosif, publié au pire moment pour être cru

Le 30 septembre 2026, l'équipe Frontier Red Team d'Anthropic publie ses conclusions : GLM-5.3, le modèle open weights du labo chinois Zhipu (Z.ai), construit des exploits informatiques quasi au niveau de Claude Mythos Preview — le modèle frontier qu'Anthropic, justement, ne publie pas. Un modèle téléchargeable par n'importe qui, avec des capacités offensives de premier rang mondial.

Le contexte rend l'annonce encore plus inflammable. Le rapport sort la veille d'un accord annoncé à la Maison-Blanche sur l'encadrement de l'IA, alors qu'Anthropic prépare son introduction en bourse et que les modèles ouverts — 5 à 50 fois moins chers — grignotent mécaniquement les revenus des labs closed-source.

Faut-il croire Anthropic sur parole ? Le rapport est détaillé, chiffré, et le NIST corrobore sa conclusion. Mais l'accusateur est aussi un vendeur qui perd des clients face à ces mêmes modèles ouverts. Les deux réalités coexistent — risque technique documenté, conflit d'intérêts commercial — et c'est précisément ce qui rend ce dossier passionnant.


L'essentiel

  • Le constat central : sur ExploitBench (vulnérabilités du moteur V8 de Chrome), GLM-5.3 construit un exploit complet dans 50 cas sur 410 tentatives, contre 56 pour Claude Mythos Preview.
  • L'exploitation binaire : sur 100 tâches issues d'OSS-Fuzz, GLM-5.3 obtient une prise de contrôle totale du flux d'exécution dans 4 % des cas (Mythos : 6 %). Kimi K3, DeepSeek V4.1 Flash, Claude Opus 4.6 et GLM-5.2 : 0 %.
  • Les garde-fous sautent : 64 % d'engagement sur requête nuisible via role-play, 92 % avec prefill des thinking tokens, quasi 100 % après abliteration (taux de refus résiduel : 6 %).
  • Le coût de l'attaque : environ 20,40 $ de tokens et 8 heures pour une génération autonome d'exploit chaîné avec GLM-5.3-Flash.
  • La riposte de Z.ai : meilleur score revendiqué sur CyberGym (84,5 %, devant Mythos 5 à 83,8 %), mais derrière sur ExploitBench et ExploitGym.
  • Le contexte : rapport publié la veille d'un accord à la Maison-Blanche, IPO d'Anthropic en préparation, open weights qui talonnent les modèles fermés en quelques mois.

Outils recommandés

Pour auditer vous-même les capacités des open weights — ou simplement les exécuter dans un environnement contrôlé — voici la boîte à outils minimale.

Outil Usage principal Prix (octobre 2026) Idéal pour
Ollama Exécuter des open weights (GLM inclus) en local Gratuit Auditer ce qu'un modèle open weight sait réellement faire
LM Studio Inférence locale avec interface graphique Gratuit (usage personnel) Tester des modèles sans ligne de commande
abliteration.ai API hébergée de GLM-5.3 ablitéré Payante à l'usage (voir abliteration.ai) Comprendre le marché secondaire « unrestricted »
Hostinger VPS pour serveur d'inférence isolé À partir d'environ 5 €/mois (vérifiez sur hostinger.com) Héberger vos modèles hors de votre réseau principal
The Open Weights Veille releases et licences open weights Gratuit Suivre la vague GLM et ses garde-fous

Le rapport d'Anthropic, chiffre par chiffre

Réponse directe : GLM-5.3 n'« évoque » pas Mythos en cyber-offensive — il s'en approche à quelques points près sur les mesures publiées, et domine tout ce qui a été mesuré avant lui en open weights.

Le test central porte sur ExploitBench : des vulnérabilités connues du moteur V8, celui de Chrome. Sur 410 tentatives en sandbox, GLM-5.3 construit un exploit complet — de l'identification du bug au code fonctionnel — dans 50 cas. Claude Mythos Preview : 56. Tom's Hardware souligne que le rapport documente aussi la faiblesse générale des safeguards des modèles open weights récents.

Deuxième mesure, plus brutale : l'exploitation binaire sur 100 tâches issues d'OSS-Fuzz, le service de fuzzing open source de Google. GLM-5.3 obtient un « full control-flow hijack » — prise de contrôle complète du flux d'exécution d'un programme — dans 4 % des cas, contre 6 % pour Mythos. Kimi K3, DeepSeek V4.1 Flash, Claude Opus 4.6 et GLM-5.2 : zéro réussite.

Pour mémoire, GLM-5.2 était pourtant présenté à sa sortie comme le modèle open weights le plus puissant du monde. Le saut entre les deux générations n'est pas incrémental : il est catégorique.

Le point le plus inquiétant ne figure dans aucun benchmark. Un chercheur d'Anthropic a fait analyser par GLM-5.3 un navigateur très répandu pendant environ une journée. Le modèle a trouvé plusieurs vulnérabilités zero-day, puis les a chaînées en une simple page web capable de lire des fichiers arbitraires sur la machine d'un visiteur. Les failles ont été signalées à l'éditeur, que le rapport ne nomme pas.

Les conclusions d'Anthropic sont sans détour. GLM-5.3 représente « a meaningful step change in the cyber capabilities available to attackers ». Et il est « likely » — probable — que des acteurs étatiques comme non étatiques utilisent de tels modèles pour causer des dommages réels. Le NIST abonde : pour l'institut américain, GLM-5.3 est « the most cyber-capable open-weight model released to date ».

Reste le chiffre le plus politique du rapport : le coût. Une génération autonome d'exploit chaîné revient à environ 20,40 $ de tokens et huit heures de calcul avec GLM-5.3-Flash. Le barrage économique qui protégeait implicitement les systèmes informatiques — le piratage avancé coûte cher — vient de tomber.


Des garde-fous qui ne survivent pas à trois techniques connues

Réponse directe : non, les refus intégrés de GLM-5.3 ne résistent pas. Trois techniques publiées et documentées depuis des années suffisent à les contourner dans 64 à 100 % des cas testés.

La méthodologie d'Anthropic est honnête sur ses limites : la simulation n'exécute aucun code, elle mesure uniquement si le modèle tente de se connecter à une cible sur requête nuisible explicite. Comportement de base : GLM-5.3 refuse. Les modèles Claude protégés restent à zéro dans toutes les conditions testées.

Premier contournement : habiller exactement la même requête en exercice de red team « autorisé ». Le modèle tente alors la connexion dans 64 % des runs. Deuxième technique, plus fine : pré-remplir les thinking tokens (prefill), ce qui pousse le taux à 92 %. Selon The Decoder, c'est le même prompt — seul l'habillage change.

Troisième technique, et c'est là que le dossier change de nature : l'abliteration, qui retire le comportement de refus directement dans les poids. Résultat : taux d'engagement de 100 % dans la simulation, taux de refus résiduel de 6 % selon le rapport. Anthropic a documenté sa propre opération — environ 2 200 heures GPU, environ 4 400 $ — et estime qu'une équipe expérimentée ferait le travail pour environ 1 200 $.

AI Weekly résume l'enseignement : les refus intégrés de GLM-5.3 « ne survivent pas au contact d'adversaires ». Autrement dit, neutraliser les garde-fous d'un modèle frontier open weight coûte le prix d'un billet d'avion. Ce n'est plus une barrière, c'est un droit d'entrée symbolique.


L'abliteration : la sécurité des poids ouverts se désinstalle en une commande

Réponse directe : tant que les poids sont téléchargeables, le refus est une option amovible — et un marché entier s'est déjà organisé pour la retirer à votre place.

Anthropic le dit explicitement : l'abliteration est triviale sur des poids téléchargeables. L'écosystème open source en fournit la preuve quotidienne : le repo heretic, qui automatise l'opération, frôle les 30 000 stars et tourne en tête du trending GitHub au moment de l'écriture.

Plus révélateur encore : plus besoin de 2 200 heures GPU ni de savoir-faire. abliteration.ai commercialise déjà un « GLM-5.3 Abliterated Large v2 » via une API compatible OpenAI, avec la promesse « Unrestricted, zero data retention », des connecteurs Policy Gateway et des intégrations Claude Code et OpenClaw. Le marché secondaire de la désafety existe, il est hébergé, il est bon marché, et il est accessible sans aucune compétence GPU.

C'est l'argument structurel contre l'open weights « safetied » : publier des poids avec garde-fous revient, à quelques centaines de dollars et quelques jours près, à publier des poids sans. La vraie question n'est donc pas de savoir si les refus seront retirés — ils le seront — mais qui le fera, à quelle vitesse, et avec quelles intentions.

Pour vous faire une opinion par vous-même, nos guides sur les meilleurs LLM à run en local et l'installation d'un LLM local avec Ollama ou LM Studio restent le bon point de départ. Une mise en garde s'impose : un modèle local ablitéré n'a plus aucun garde-fou, ni pour le pire, ni pour le meilleur.

Et si vous branchez des modèles ouverts sur des outils — fichiers, réseau, shell — relisez notre dossier sur les meilleurs LLM pour les agents IA. Un agent ablitéré avec accès shell n'est pas un chatbot : c'est un opérateur autonome sans inhibiteurs.


Z.ai contre-attaque : trois benchmarks, trois histoires différentes

Réponse directe : Z.ai refuse le récit d'Anthropic et brandit son propre tableau, où GLM-5.3 est numéro un mondial de cybersécurité. Les deux récits ne se contredisent pas frontalement : ils ne mesurent tout simplement pas la même chose.

Dans sa réponse officielle, Z.ai publie des chiffres choisis avec soin. Sur CyberGym, GLM-5.3 atteint 84,5 % — meilleur score du tableau, devant « Mythos 5 » (83,8 %) et GPT-5.6 Sol (83,6 %). Le labo revendique noir sur blanc le dépassement des systèmes américains leaders en cybersécurité. Le SCMP traduit l'ambition géopolitique : la Chine cherche un avantage de niveau Mythos en cyber-défense.

Mais sur les deux autres benchmarks du même tableau, l'histoire change de signe :

Benchmark GLM-5.3 Mythos 5 Fable 5 GPT-5.6 Sol Claude Opus 4.8 GLM-5.2
CyberGym 84,5 % 83,8 % — 83,6 % — —
ExploitBench 54,4 % — 78,0 % 76,5 % 40,0 % 24,4 %
ExploitGym (2 h/6 h) 105/130 — 181/247 216/293 — —

Sur ExploitBench comme sur ExploitGym, GLM-5.3 domine la génération précédente et Claude Opus 4.8, mais reste derrière Fable 5, GPT-5.6 Sol — et Mythos 5, selon le décryptage d'AI News. Trois benchmarks, trois images différentes, et un chiffre-titre qui masque tout le reste.

Ajoutez un différend de protocole qui nourrit la dispute. Anthropic mesure des réussites de bout en bout : 50 exploits complets sur 410 tentatives, soit environ 12 % par tentative. Z.ai publie un score agrégé de 54,4 % sur le même benchmark. Les deux chiffres ne sont pas comparables — critères de succès, nombre d'essais autorisés, tout diffère. Chaque camp choisit la métrique qui arrange son récit.

Côté code, la progression est en revanche incontestable, et documentée par Z.ai elle-même. À effort Max, GLM-5.3 atteint 34,5 % avec environ 75 000 tokens de sortie par tâche, contre 23,4 % à 96K pour GLM-5.2. À effort High, 31,4 % avec ~50K tokens, devant Claude Opus 4.8 (29,5 % avec 120K). Le modèle qui inquiète la sécurité informatique américaine est aussi, factuellement, l'un des meilleurs modèles de code du moment — sorti en open weights avec une licence anti-hyperscalers, rappelons-le.


IPO, Maison-Blanche, parts de marché : le rapport tombe au pire moment pour être neutre

Réponse directe : le rapport arrive au moment exact où Anthropic a des raisons commerciales de freiner les open weights. Cela n'invalide pas ses chiffres — cela change seulement qui a intérêt à y croire, et à quelles conclusions politiques ils servent.

Le calendrier, d'abord. L'accord annoncé à la Maison-Blanche sur l'encadrement de l'IA tombe le lendemain du rapport. Un labo closed-source qui documente les dangers des modèles ouverts, la veille d'un cycle réglementaire, n'est pas un observateur neutre. Et Anthropic prépare son entrée en bourse : ses futurs actionnaires n'ont aucun intérêt à voir la prime de valeur des modèles fermés s'éroder.

La dynamique de marché, ensuite. Les open weights coûtent 5 à 50 fois moins cher que les modèles frontier hébergés, et leur retard de capacité se compte désormais en mois. Les modèles ouverts tournent déjà 56 % des tokens de Vercel : la migration est silencieuse, massive, et elle mange directement le revenu des labs propriétaires. Pendant ce temps, OpenAI officialise Path to Astra — la pression concurrentielle sur les prix n'a jamais été aussi forte.

Le pattern, enfin. Ce n'est pas la première salve d'Anthropic contre l'écosystème chinois. Le labo avait déjà refusé l'accès de la Chine à son modèle Mythos, puis accusé Alibaba de la plus grande attaque de distillation jamais documentée — 28,8 millions d'échanges, 25 000 comptes frauduleux. À chaque fois, le fond technique était documenté. À chaque fois, le récit arrangeait aussi la stratégie commerciale du labo.

Alors, manipulation ? Non — et c'est là toute la difficulté. Le rapport publie sa méthodologie, ses chiffres, ses limites. Le NIST confirme la qualification du modèle. Z.ai elle-même communique des benchmarks cyber dans son tableau de lancement. Le risque décrit est réel. Mais la conclusion politique implicite — « il faut freiner les open weights » — ne découle pas mécaniquement des données. Un vendeur de modèle fermé 30 fois plus cher que son concurrent ouvert a un intérêt structurel à cette conclusion. Lecteurs, régulateurs et DSI doivent séparer les deux plans : la mesure technique, et l'intérêt de celui qui la publie.


Côté défenseurs : que faire concrètement, sans céder à la panique

Réponse directe : traitez tout modèle open weight comme du code non fiable, et tout agent qui y a accès comme une surface d'attaque à part entière.

Cinq mesures, dans l'ordre de priorité :

  1. Inventoriez vos usages de modèles ouverts. Vous ne pouvez pas sécuriser ce que vous ne listez pas — y compris les dérivés ablitérés qui entrent par la fenêtre des marketplaces communautaires.
  2. Isolez le réseau. Un serveur d'inférence locale n'a pas besoin d'un accès sortant illimité. Segmentez, loggez, alertez.
  3. Limitez les outils des agents. Sandboxes, jetons à durée de vie courte, permissions minimales. Le rapport décrit un modèle capable de chaîner des failles : ne lui donnez pas le contexte pour le faire chez vous.
  4. Surveillez les dérivés. Un modèle « safetied » publié aujourd'hui sera ablitéré demain pour 1 200 $. Évaluez le risque sur les poids, pas sur la fiche produit.
  5. Retournez la capacité. Les mêmes compétences servent le fuzzing, la reproduction d'exploits et le tri de vulnérabilités. Selon TrendingTopics, la vraie question posée par Anthropic est de savoir si les défenseurs instrumenteront la génération d'exploits pilotée par agents à temps.

Un dernier point, celui qui devrait obséder tout le secteur. Si la prochaine release de Z.ai garde la même posture, écrivent les analystes d'AI Weekly, « the open-weight cyber baseline resets again ». Chaque génération open weight relève la base du possible, côté attaque comme côté défense. Se préparer pour GLM-5.3, c'est déjà se préparer pour GLM-6.


❌ Erreurs courantes

Erreur 1 : prendre le chiffre-titre de Z.ai pour un verdict global

Le 84,5 % de CyberGym est réel, mais CyberGym ne mesure pas la même chose qu'ExploitBench ou ExploitGym, où GLM-5.3 est dominé par Fable 5 et GPT-5.6 Sol. La solution : lire les trois benchmarks et leurs protocoles, et refuser tout récit construit sur un seul chiffre — y compris celui d'Anthropic.

Erreur 2 : croire que les garde-fous « intégrés » d'un open weight constituent une sécurité

64 %, 92 %, puis quasi 100 % d'engagement : trois techniques standards suffisent. La solution : évaluer un modèle open weight sur ses poids, en supposant qu'une version ablitérée circulera — parce qu'elle circule déjà, hébergée et bon marché.

Erreur 3 : confondre capacité démontrée en sandbox et attaque réelle

La simulation d'Anthropic n'exécute aucun code, et la découverte de zero-days a été pilotée par un chercheur. Les titres du type « l'IA pirate Chrome toute seule » surestiment l'autonomie actuelle. Cela n'invalide pas le signal : la capacité existe, l'autonomie est une question de temps et d'outillage agentique.

Erreur 4 : réagir par principe plutôt que par risque

Diaboliser tous les open weights — ou les défendre sans nuance — sont la même erreur symétrique. Les faits : 5 à 50 fois moins chers, un retard en mois, des capacités duales réelles. La solution : une adoption fondée sur le risque, modèle par modèle, usage par usage.


❓ Questions fréquentes

GLM-5.3 peut-il vraiment pirater des systèmes tout seul ?

Pas démontré à ce stade. Le rapport montre qu'il construit des exploits en environnement contrôlé et qu'il a trouvé des zero-days chaînés sous la direction d'un chercheur. Aucune attaque réelle attribuée à GLM-5.3 n'est documentée publiquement à ce jour. La capacité est là ; l'autonomie opérationnelle reste à prouver.

Qu'est-ce que l'abliteration, exactement ?

Une technique qui retire le comportement de refus d'un modèle en modifiant directement ses poids, sans réentraînement complet. Anthropic l'a réalisée en environ 2 200 heures GPU (environ 4 400 $) et estime qu'une équipe expérimentée peut la faire pour environ 1 200 $. Sur des poids téléchargeables, l'opération est reproductible par n'importe qui.

Anthropic a-t-il un conflit d'intérêts ?

Oui, et il faut le nommer : labo closed-source, IPO en préparation, parts de marché grignotées par des open weights 5 à 50 fois moins chers. Mais un conflit d'intérêts ne falsifie pas des données — le NIST corrobore la qualification du modèle. Jugez la méthode d'un côté, l'intérêt de l'autre.

Ce rapport sonne-t-il la fin des open weights ?

Rien ne l'indique. La dynamique économique — coût, latence, souveraineté — pousse vers les poids ouverts plus vite que la régulation ne peut réagir. Le vrai débat porte sur les licences et les contrôles post-publication : retirer des poids déjà publiés est quasi impossible, comme le prouve le marché de l'abliteration hébergée.

GLM-5.3 reste-t-il un bon choix pour coder ?

Oui, c'est même le paradoxe du modèle. Z.ai revendique 34,5 % à effort Max (environ 75 000 tokens par tâche) contre 23,4 % pour GLM-5.2, et 31,4 % à effort High, devant Claude Opus 4.8 (29,5 %). Excellent assistant de code, candidat sérieux en cyber-défense — et arme offensive potentielle. À manier en conséquence.


✅ Conclusion

Un modèle open weight à quelques points du meilleur système fermé du monde en génération d'exploits, des garde-fous retirables pour 1 200 $ et un marché secondaire déjà opérationnel : même en tenant compte des intérêts commerciaux d'Anthropic, ce rapport décrit un vrai changement d'échelle. Pour choisir votre prochain modèle en connaissance de cause, direction notre comparatif mensuel des meilleurs LLM.