IA

Anthropic alerte sur les garde-fous de GLM-5.3 de Zhipu AI

Anthropic publie un rapport de red teaming : le modèle open-weight GLM-5.3 de Zhipu AI contournerait ses protections et atteindrait des capacités de hacking de niveau Mythos.

Anthropic a publié un rapport de « frontier red teaming » dans lequel la société affirme que GLM-5.3, le modèle à poids ouverts de Zhipu AI, présente des garde-fous faibles et des capacités d'attaque comparables à celles de sa famille Mythos. Selon Anthropic, ces protections peuvent être contournées par des prompts trompeurs, le préremplissage de tokens de raisonnement (« prefilling thinking tokens ») et l'abliteration.

Les chiffres avancés par Anthropic sont précis : dans son banc d'essai Exploitbench, GLM-5.3 a développé des exploits de bout en bout 50 fois sur 410 exécutions, contre 56 pour Claude Mythos. Sur un benchmark interne mesurant la prise de contrôle complète du flux d'exécution (« full control-flow hijacks »), GLM-5.3 affiche un taux de réussite de 4 %, contre 6 % pour Mythos, tandis que Kimi K3 et DeepSeek V4.1 Flash restent à 0 %.

Anthropic indique par ailleurs que l'abliteration de GLM-5.3 fait chuter son taux de refus à 6 %, et celui de GLM-5.3-Flash à 14 %. Ces mesures visent à quantifier la facilité avec laquelle un modèle peut être détourné de ses garde-fous après modification.

Un contexte de vigilance déjà installé

Fin septembre, le Center for AI Standards and Innovation avait déjà publié un rapport affirmant que GLM-5.3 pouvait automatiser entièrement des exploits à un niveau proche de celui du modèle Claude Mythos, non encore publié par Anthropic. De son côté, Anthropic a développé Project Glasswing, destiné à donner aux développeurs l'accès à un modèle de classe Mythos pour corriger des bugs et des vulnérabilités avant la sortie de tels modèles.

Cette alerte intervient après la publication par Anthropic de Claude Opus 5.5 et Claude Sonnet 5.5, quelques jours seulement après des mises en garde sur le rythme du développement de l'IA. Le rapport, relayé par tomshardware.com, alimente le débat sur les modèles ouverts et la sécurité offensive.

En bref

Quels contournements Anthropic décrit-il pour GLM-5.3 ?

Anthropic cite les prompts trompeurs, le préremplissage de tokens de raisonnement et l'abliteration.

Quels résultats GLM-5.3 obtient-il face à Claude Mythos ?

Dans Exploitbench, 50 exploits de bout en bout sur 410 exécutions contre 56 pour Mythos ; sur le benchmark de contrôle complet du flux d'exécution, 4 % contre 6 %.

Que devient le taux de refus après abliteration ?

Il tombe à 6 % pour GLM-5.3 et à 14 % pour GLM-5.3-Flash, selon Anthropic.

Source