Tencent AI-Infra-Guard : l'open source s'attaque au red teaming de toute la stack IA — agents, skills, MCP et LLM
🔎 Le jailbreak n'est plus la seule porte d'entrée
Pendant deux ans, sécuriser une application IA a voulu dire une chose : tester son modèle contre les jailbreaks. Cette époque est révolue. En 2026, les incidents qui font mal ne passent plus par le prompt, mais par tout ce qui entoure le modèle — serveurs MCP, skills tiers, workflows d'agents, infrastructures Ollama ou vLLM mal exposées.
C'est exactement l'angle d'AI-Infra-Guard, la plateforme de red teaming IA open source de Tencent. Publiée sous licence Apache 2.0 par le Zhuque Lab, elle vient de franchir les 6 100 étoiles sur GitHub (6 116 au 1er octobre 2026) et s'est installée en tête de GitHub Trending, portée par un rythme d'environ 150 étoiles par jour ces dernières semaines.
Le timing n'a rien d'un hasard. Un agent OpenAI vient de hacker le portail Medicare australien (premier incident connu de ce type), Cisco Talos a révélé ClosedQuorum, le premier malware à command-and-control 100 % autonome piloté par LLM (notre analyse), et les agents détournés sur Hugging Face comme la faille DNS d'OpenAI ont montré que la chaîne d'exécution d'un agent constitue une surface d'attaque à part entière.
Face à ça, tester uniquement le modèle revient à blinder la porte avant en laissant le garage ouvert. AI-Infra-Guard prétend scanner le garage, le jardin et le sous-sol. Voyons ce qu'il vaut vraiment.
L'essentiel
- AI-Infra-Guard est une plateforme open source (Apache 2.0) de red teaming IA développée par le Zhuque Lab de Tencent : 6 116 étoiles et 569 forks sur GitHub au 1er octobre 2026.
- Elle couvre 4 couches d'attaque — infrastructure, protocole/outils, comportement d'agent, modèle — via 5 modules : ClawScan, Agent Scan, Skills/MCP Scan, AI Infra Scan et Jailbreak Evaluation.
- Base actuelle : 146+ composants IA et plus de 2 000 règles CVE (v4.6.2, septembre 2026), de Ollama à vLLM en passant par n8n, ComfyUI et Triton.
- C'est le premier scanner open source de supply chain MCP/skills, capable de détecter le tool poisoning sémantique et les problèmes d'intégrité du code dans les skills tiers.
- Avertissement officiel : aucune authentification. À déployer strictement en interne, jamais sur un réseau public.
Outils recommandés
| Outil | Usage principal | Prix (octobre 2026) | Idéal pour |
|---|---|---|---|
| AI-Infra-Guard | Red teaming full-stack : infra, MCP/skills, agents, modèles | Gratuit (Apache 2.0) | Équipes qui déploient des agents en production |
| PyRIT | Red teaming de modèles LLM (Microsoft) | Gratuit, open source | Tests de robustesse au niveau modèle |
| Garak | Sondes de vulnérabilités LLM (NVIDIA) | Gratuit, open source | Benchmark de sécurité d'un LLM isolé |
| Promptfoo | Évals et tests de prompts | Gratuit, open source | Équipes produit qui itèrent sur les prompts |
| Hostinger | Héberger un labo de scan isolé (VPS) | Dès quelques €/mois (vérifiez sur hostinger.fr) | PME sans réseau interne dédié |
Qu'est-ce qu'AI-Infra-Guard, et pourquoi tout le monde en parle ?
AI-Infra-Guard est une plateforme de red teaming IA qui audite l'intégralité de la stack d'un système agentique — pas seulement le modèle. Elle est développée par le Zhuque Lab, l'équipe de sécurité créée par Tencent en 2019, qui a découvert des vulnérabilités à haut risque chez NVIDIA, Google, Microsoft et dans les communautés OpenClaw, Linux et Hugging Face.
Le projet est passé en quelques mois du statut d'outil de niche à référence du secteur. Sa fiche figure sur Kitploit, et son rythme de publication est remarquable : huit versions entre mars et septembre 2026, avec des règles de détection ajoutées chaque mois.
Ce momentum s'inscrit dans une tendance plus large : après l'open-sourcing complet de la stack robotique d'Alphabet avec Intrinsic Core sous Apache 2.0, l'open source s'attaque désormais aux couches les plus critiques de l'IA — et la sécurité est la plus critique de toutes. Mon avis : c'est exactement le type d'outil qui ne peut exister que s'il est open source, car personne n'accepte d'auditer sa propre sécurité avec une boîte noire.
Le calendrier des versions clés
| Version | Date | Apport principal |
|---|---|---|
| v4.1 | 23/03/2026 | Base de vulnérabilités OpenClaw élargie à 281 entrées CVE/GHSA |
| v4.1.1 | 25/03/2026 | Détection de l'attaque supply chain LiteLLM (CRITICAL) |
| v4.1.9 | 21/05/2026 | 26 opérateurs d'attaque Prompt Security (20 single-turn, 6 multi-tours) |
| v4.5.0 | 27/07/2026 | AI Security Skill Market, frontend open source, CLI aig-skill-scan |
| v4.5.1 | 30/07/2026 | Jailbreaks multi-tours (Many-Shot, PAIR, GOAT, ActorAttack), 5 skills OWASP |
| v4.5.2 | 17/08/2026 | Détection de contournement bytecode .pyc, prévention RCE en mode MCP dynamique |
| v4.6.0 | 26/08/2026 | Détection d'empoisonnement d'API LLM, 146 composants / 2 000+ règles |
| v4.6.2 | 17/09/2026 | +155 règles CVE sur 40+ composants, benchmarks FORGE-Bench et RogueHandoff-20 |
Source : changelog détaillé et dépôt officiel.
Les 4 couches d'attaque : le principe de « layer-paradigm matching »
Un agent IA expose quatre surfaces d'attaque distinctes, et chacune exige une méthode de détection différente. C'est la thèse centrale du rapport technique de l'équipe (arXiv 2606.31227), organisé autour du « layer-paradigm matching ».
- Infrastructure : correspondance déterministe de règles. Le papier décrit 75+ composants et 1 400+ règles ; la base est montée à 146 composants et 2 000+ règles CVE depuis la v4.6.0 (août 2026).
- Protocole/outils : audit agentique piloté par LLM des serveurs MCP et des paquets de skills.
- Comportement d'agent : red teaming multi-tours en boîte noire, pour tester ce que l'agent fait réellement — pas ce qu'il devrait faire.
- Modèle : harnais de jailbreak avec 26+ opérateurs d'attaque évalués sur 16 datasets.
Ce que dit l'architecture
Le système repose sur un serveur-agent distribué : scan d'infrastructure en Go, modules LLM en Python, communication par WebSocket. Concrètement, on peut répartir les scans lourds sur plusieurs machines — un détail qui compte quand on audite un parc entier d'agents plutôt qu'un prototype.
Ce découpage en couches est, à ma connaissance, ce qui distingue le plus AI-Infra-Guard de la génération précédente d'outils. Les frameworks de jailbreak testent la couche 4. Les incidents de 2026 se jouent sur les couches 1 à 3.
Les 5 modules de scan, en détail
Cinq modules couvrent les quatre couches, chacun avec un périmètre précis.
| Module | Ce qu'il audite | Points clés |
|---|---|---|
| AI Infra Scan | Composants d'infra IA | 146+ composants, 2 000+ règles CVE : Ollama, ComfyUI, vLLM, n8n, Triton… |
| ClawScan | OpenClaw Security Scan | Base de vulnérabilités OpenClaw : 281 entrées CVE/GHSA (v4.1, mars 2026) |
| Agent Scan | Frameworks multi-agents | Workflows Dify/Coze, 5 skills OWASP (v4.5.1), benchmarks FORGE-Bench et RogueHandoff-20 |
| Skills/MCP Scan | Serveurs MCP et skills tiers | 14 catégories de risques, tool poisoning sémantique, détection d'exfiltration web |
| Jailbreak Evaluation | Robustesse du modèle | 26+ opérateurs d'attaque, 16 datasets, jailbreaks multi-tours |
Trois modules méritent qu'on s'y attarde.
AI Infra Scan dresse l'inventaire des composants IA exposés et les confronte aux CVE connues. Si vous faites tourner des agents IA open source avec Ollama en local, c'est le module qui vous dira si votre instance traîne une vulnérabilité connue — et c'est malheureusement fréquent.
Agent Scan cible les workflows multi-agents, notamment ceux construits sur Dify et Coze. Les benchmarks FORGE-Bench et RogueHandoff-20, ajoutés en v4.6.2 (17 septembre 2026), mesurent la perte de contrôle d'agents : le scénario où l'agent sort de son périmètre prévu. C'est exactement le type de dérive observée dans les incidents récents.
Jailbreak Evaluation embarque 26+ opérateurs d'attaque sur 16 datasets — dont cnsafe (3 030 prompts), JailBench-Tiny (133) et JADE-db-v3.0 (122). Depuis la v4.5.1 (30 juillet 2026), il couvre les jailbreaks multi-tours : Many-Shot, PAIR, GOAT et ActorAttack. Les attaques multi-tours sont celles qui fonctionnent le mieux contre les agents, précisément parce qu'elles imitent une conversation légitime.
MCP et skills : le scan de supply chain qui manquait à l'écosystème
AI-Infra-Guard est le premier scanner open source capable d'auditer les serveurs MCP et les paquets de skills d'agents pour contenu adversarial. C'est la lecture de The New Claw Times, et elle est fondée : PyRIT, Garak et Promptfoo s'arrêtent tous à la couche modèle.
Pourquoi c'est crucial : un skill MCP tiers contient des descriptions en langage naturel que votre LLM lit et exécute. Un attaquant peut y cacher des instructions détournées — le « tool poisoning » sémantique — ou du code malveillant. L'agent exécute, et personne ne voit rien.
Le scanner détecte ces risques via une taxonomie T01–T09 : détournement d'instructions, empoisonnement de mémoire, téléchargement de payload, escalade de privilèges, dépendances non sûres… L'attaque supply chain LiteLLM, détectée dès la v4.1.1 (25 mars 2026) et classée CRITICAL, prouve que la menace n'est pas théorique. La v4.5.2 a ajouté la détection de contournement bytecode .pyc et la prévention de RCE par whitelist d'outils en mode MCP dynamique.
Si vous cherchez à réduire structurellement cette surface d'attaque, une piste consiste à sortir du paradigme « tout-LLM » : Laya, le modèle de décision open source de 421M paramètres, propose de remplacer le LLM dans les boucles de décision des agents. Moins de langage naturel ingéré, moins de surface d'injection.
Intégrer AI-Infra-Guard dans une pipeline d'audit d'agents
L'intégration se fait en quatre étapes, de l'infrastructure vers le modèle. Le déploiement est sans surprise : image Docker, interface web sur localhost:8088, 4 Go de RAM minimum. Pour le scan de skills, un CLI standalone existe depuis la v4.5.0 :
pip install aig-skill-scan
La pipeline que je recommande :
- Cartographier l'infrastructure (AI Infra Scan) : inventaire des composants exposés, confrontation aux 2 000+ règles CVE.
- Auditer la supply chain MCP/skills : chaque serveur MCP et chaque skill tiers passe au scanner, en local.
- Red teamer le comportement (Agent Scan) : workflows Dify/Coze, scénarios multi-agents, benchmarks de perte de contrôle.
- Évaluer le modèle (Jailbreak Evaluation) : opérateurs single-turn et multi-tours sur vos prompts système réels.
Et surtout : automatisez. Entre la v4.1 (23 mars 2026) et la v4.6.2 (17 septembre 2026), la base de règles a grossi de plusieurs centaines d'entrées. Un scan datant de trois mois est un scan mort. Branchez le CLI skill-scan dans votre CI pour qu'il tourne à chaque ajout de skill ou de serveur MCP.
L'alerte à connaître avant d'installer
L'avertissement officiel est sans détour : la plateforme n'a aucun mécanisme d'authentification. Comme le souligne l'analyse de METAL LAB, l'outil de scan lui-même peut devenir un point d'entrée s'il est mal déployé. La recommandation est claire : isolation réseau interne ou VPN, et jamais d'exposition publique.
Sécuriser sans casser la performance
Un audit qui aboutit à des gardes-fous lourds tue souvent les performances de l'agent. C'est un faux dilemme : des approches runtime comme Life-Harness, qui booste les agents LLM de 88,5 % sans retraining, montrent qu'on peut durcir et accélérer en même temps. Auditez d'abord, optimisez ensuite.
Quel LLM faire tourner derrière le scanner ?
Le moteur d'audit agentique a besoin d'un LLM pour analyser les skills et piloter les scénarios d'attaque — et les résultats SkillTrustBench du dépôt officiel montrent que le choix compte, sans être déterminant. Tous les modèles testés dépassent un F1 de 0,97 sur la détection de risques de skills.
| LLM (moteur d'audit) | F1 (SkillTrustBench) |
|---|---|
| Claude Opus 4.6 | 0,9848 |
| GLM 5.1 | 0,9836 |
| Gemini 3.5 Flash | 0,9792 |
| Kimi 2.6 | 0,9780 |
| DeepSeek v4 Flash | 0,9740 |
Claude Opus 4.6 mène, mais l'écart avec GLM 5.1 — qui peut tourner en self-host — est de 0,0012. Pour des données sensibles, un moteur d'audit auto-hébergé avec GLM ou Kimi est une option crédible ; notre comparatif des meilleurs LLM à faire tourner en local détaille les configurations nécessaires.
Détail important : le LLM du scanner est un choix distinct de celui de vos agents en production. Si votre stack tourne sur GPT-5.5 ou Claude Opus 4.7, le scanner peut s'appuyer sur un tout autre modèle. Notre guide des meilleurs LLM pour les agents IA et le comparatif mensuel des meilleurs LLM vous aideront à trancher des deux côtés.
Face à PyRIT, Garak et Promptfoo : un complément, pas un concurrent
AI-Infra-Guard ne remplace pas les outils de red teaming de modèles : il couvre ce qu'ils ignorent. Les trois références du marché s'arrêtent à la couche modèle, tandis que trois des cinq piliers d'AI-Infra-Guard ciblent les couches autour — agents, skills, MCP.
| Outil | Éditeur | Couches couvertes |
|---|---|---|
| AI-Infra-Guard | Tencent Zhuque Lab | Infra + protocole/outils + agent + modèle |
| PyRIT | Microsoft | Modèle |
| Garak | NVIDIA | Modèle |
| Promptfoo | Promptfoo | Modèle / prompts |
Le contexte industriel pousse dans le même sens : entre les garde-fous négociés dans l'accord avec la Maison-Blanche et les plateformes de sûreté des grands labos — notre analyse d'OpenShell et Sentry, la plateforme de sécurité agentique de NVIDIA — la sécurisation des agents est devenue un enjeu politique autant que technique. La différence, c'est qu'AI-Infra-Guard vous donne les clés : tout tourne chez vous, le code est auditable ligne par ligne.
Mon positionnement : gardez Garak ou PyRIT pour stresser vos modèles, et ajoutez AI-Infra-Guard pour tout ce qui les entoure. Les deux approches sont gratuites ; il n'y a aucune raison de choisir.
Limites : ce qu'AI-Infra-Guard ne résout pas
Trois limites sérieuses, à connaître avant d'adopter.
Zéro authentification. C'est le point aveugle le plus ironique : un outil de sécurité qui ne peut pas être sécurisé par authentification. La réponse est architecturale — VLAN dédié, VPN, binding localhost — mais elle repose sur vous, pas sur l'outil.
La question de la confiance. Le projet est adossé à Tencent, et le scanner lit vos configurations MCP, vos skills et potentiellement vos prompts système. Le code est sous Apache 2.0 et donc auditable, et un déploiement en réseau isolé avec un LLM auto-hébergé (GLM 5.1, Kimi 2.6) limite les fuites. Pour un environnement régulé, cette décision mérite une revue de sécurité formelle.
Un scan n'est pas un pentest. Les 2 000+ règles couvrent les vecteurs connus. Les benchmarks FORGE-Bench et RogueHandoff-20 élargissent la détection de perte de contrôle, mais aucun scanner ne remplace un humain qui teste la logique métier de votre agent.
❌ Erreurs courantes
Erreur 1 : exposer l'interface de scan sur un serveur accessible
Sans authentification, quiconque atteint le port 8088 contrôle votre outil de scan — et à travers lui, l'accès à vos configurations. Solution : binding localhost, accès par tunnel SSH ou VPN, VLAN dédié si vous scannez en continu.
Erreur 2 : ne lancer que l'évaluation de jailbreak
C'est l'erreur la plus fréquente, parce que c'est le module le plus connu. Or trois des cinq piliers ciblent les couches autour du modèle. Solution : les cinq modules, dans l'ordre infra → MCP/skills → agents → modèle.
Erreur 3 : traiter le scan comme un one-shot
La base de règles évolue chaque mois — 155 nouvelles règles CVE sur 40+ composants dans la seule v4.6.2 (17 septembre 2026) — et vos skills changent chaque semaine. Solution : re-scan automatique en CI à chaque modification de skill, de serveur MCP ou de version de composant.
Erreur 4 : ignorer les dépendances « mineures »
L'attaque LiteLLM détectée en mars 2026 ne visait pas le code des équipes, mais une dépendance transverse. Solution : scan systématique de tout nouvel ajout, et whitelist d'outils en mode MCP dynamique pour prévenir les RCE.
❓ Questions fréquentes
AI-Infra-Guard est-il vraiment gratuit ?
Oui. Le projet est sous licence Apache 2.0, auto-hébergé, sans version payante. Le frontend a été open-sourcé avec la v4.5.0 (juillet 2026), et le scan de skills dispose d'un CLI standalone installable via pip. Seuls coûts réels : la machine qui héberge le scan (4 Go de RAM minimum) et les appels LLM du moteur d'audit.
Quels composants IA sont couverts par l'infra scan ?
Plus de 146 composants et 2 000+ règles CVE (v4.6.2, septembre 2026) : Ollama, ComfyUI, vLLM, n8n, Triton, entre autres. La base inclut aussi les vulnérabilités OpenClaw (281 entrées CVE/GHSA depuis mars 2026) et les attaques supply chain comme LiteLLM.
Peut-il remplacer un pentest classique ?
Non. Il automatise la détection des vecteurs connus sur quatre couches, ce qu'un pentest manuel ne couvre jamais de façon exhaustive. Mais la logique métier d'un agent, les scénarios d'abus spécifiques à votre domaine et les 0-days restent du ressort d'une revue humaine. Les deux approches se complètent.
Est-il risqué d'utiliser un outil développé par Tencent ?
Le code est auditable (Apache 2.0) et le déploiement est local. Le vrai risque est fonctionnel : le scanner accède à vos configs MCP et skills. Déployez-le en réseau isolé, avec un LLM auto-hébergé si les données sont sensibles, et faites auditer le code pour un environnement régulé.
Quelle différence avec PyRIT ou Garak ?
PyRIT (Microsoft) et Garak (NVIDIA) testent la robustesse du modèle : jailbreaks, biais, fuites de données. AI-Infra-Guard couvre en plus l'infrastructure, les serveurs MCP, les skills tiers et le comportement multi-agents. C'est le premier scanner open source de supply chain MCP — l'angle mort des trois outils concurrents.
✅ Conclusion
Pour toute équipe qui déploie des agents en 2026, le scan de la chaîne MCP/skills n'est plus une option mais un prérequis de mise en production — et AI-Infra-Guard est aujourd'hui l'outil open source le plus complet pour le faire. Installez-le en réseau isolé, lancez les cinq modules, et si vous partez de zéro, notre guide des meilleurs agents IA autonomes vous aidera à construire une stack qui mérite d'être auditée.