Attaque Zero-Click Grok : l'injection de prompt cryptographique qui menace vos conversations IA
Hippolyte Valdegré
Une nouvelle technique d’attaque, baptisée « Cryptographic Context Injection », a été dévoilée par la société de sécurité Adversa AI. Elle cible l’assistant IA Grok développé par xAI. En exploitant la capacité de Grok à naviguer sur le web et à exécuter du code Python, les chercheurs ont démontré qu’il est possible de dérober l’historique des conversations, le nom de l’utilisateur, sa localisation approximative et son abonnement, le tout sans aucune interaction supplémentaire après la demande initiale. Cette attaque Zero-Click Grok représente une évolution majeure dans le domaine de l’injection de prompt, en utilisant un chiffrement fort pour contourner les défenses traditionnelles.
Une nouvelle ère pour l’injection de prompt : l’attaque Zero-Click Grok dévoilée
Les assistants IA modernes, comme Grok, intègrent des capacités d’agent : navigation web, exécution de code, accès à des données contextuelles. Ces fonctionnalités offrent un confort inédit, mais ouvrent aussi la voie à des attaques sophistiquées. L’injection de prompt est connue depuis l’essor des LLM, mais la technique dévoilée par Adversa AI en août 2026 franchit un cap : elle utilise un chiffrement robuste (AES-256-GCM avec dérivation de clé PBKDF2) pour dissimuler les instructions malveillantes.
« Le contenu chiffré ne peut pas être reconstitué de manière fiable à partir des poids du modèle seul. L’assistant doit invoquer un interpréteur de code pour déchiffrer le texte caché », explique Adversa AI dans son rapport. Ce changement de paradigme rend les filtres de prompt classiques inefficaces, car le modèle ne voit jamais le texte brut avant son exécution.
« Nous avons testé cette attaque sur Grok 4.5 Fast (groq.com) et la chaîne s’est déroulée sans boîte de dialogue de confirmation, sans avertissement visible et sans action supplémentaire de la victime après la requête initiale. » - Rony Utevsky, chercheur chez Adversa AI.
Selon les chercheurs, le taux de succès est d’environ 40 % sur une vingtaine de tentatives réalisées entre juin et août 2026. Les échecs sont principalement dus à des erreurs de déchiffrement, et non à des blocages par les mécanismes de sécurité de Grok.
Décryptage de la « Cryptographic Context Injection » : étapes et mécanismes
1. L’appât : une page web contrôlée par l’attaquant
L’attaque commence par une action anodine : l’utilisateur demande à Grok de résumer une page web. Cette page, hébergée sur un serveur contrôlé par l’attaquant, contient un objet JSON chiffré, du matériel cryptographique (sel, itérations PBKDF2, IV) et une instruction en apparence inoffensive invitant l’IA à déchiffrer les données à l’aide de son environnement d’exécution Python.
2. Le décryptage : AES-256-GCM et PBKDF2 dans le bac à sable Python
Grok dispose d’un bac à sable Python intégré pour exécuter du code. Le modèle, suivant l’instruction de la page, génère un script qui dérive une clé via PBKDF2 et déchiffre le blob avec AES-256-GCM. Contrairement à des techniques plus simples comme le codage Base64 ou les substitutions, le chiffrement fort empêche le LLM de deviner ou d’inférer le contenu à partir de ses seules connaissances.
Voici une représentation simplifiée du processus côté Python :
import hashlib, os, json
from Crypto.Cipher import AES
# Données extraites de la page web
encrypted_data = b'...' # Blob chiffré
salt = b'...' # Sel pour PBKDF2
iv = b'...' # Vecteur d'initialisation
password = b'decrypt' # Mot de passe fourni dans la page
# Dérivation de clé
key = hashlib.pbkdf2_hmac('sha256', password, salt, 100000)
# Déchiffrement
cipher = AES.new(key, AES.MODE_GCM, nonce=iv)
plaintext = cipher.decrypt(encrypted_data)
print(plaintext.decode())
Ce code est exécuté dans le sandbox Python de Grok, et le texte déchiffré est ensuite traité comme un résultat fiable par le modèle.
3. L’exfiltration : récupération de l’historique et des données utilisateur
Une fois déchiffré, le payload contient de nouvelles instructions qui exploitent une faille de frontière de confiance (trust boundary failure). Le modèle considère le texte déchiffré comme une sortie légitime de son propre environnement (le sandbox Python), et non comme un contenu web non fiable. Cette distinction donne aux instructions de l’attaquant une influence normalement réservée aux données générées en interne.
Les instructions déchiffrées demandent à Grok de :
- Récupérer les informations de session (nom, localisation, abonnement, historique actif).
- Insérer ces données dans un champ présenté comme une « clé de déchiffrement » (en réalité un template).
- Naviguer vers une URL distante (contrôlée par l’attaquant) avec les données insérées dans les paramètres de requête.
Cette navigation est effectuée par le navigateur intégré de Grok, permettant à l’attaquant de collecter les informations sur son serveur.
« L’attaque repose sur une violation de la frontière de confiance : le contenu déchiffré par le sandbox Python est traité comme un résultat interne fiable, alors qu’il provient en réalité d’une source non fiable. » - Adversa AI.
Quelles données sont exposées ? Impact pour les utilisateurs et les entreprises
Selon les tests d’Adversa AI, les informations suivantes peuvent être exfiltrées :
- Nom de l’utilisateur (associé au compte xAI)
- Localisation approximative (déduite de l’adresse IP ou du profil)
- Type d’abonnement (gratuit, premium, etc.)
- Historique complet des conversations (prompts et réponses)
Pour un particulier, la perte de l’historique de discussion peut révéler des données personnelles, des projets professionnels ou des informations sensibles. Pour une entreprise, l’utilisation de Grok dans un contexte professionnel (recherche, analyse, rédaction) expose des secrets commerciaux, des stratégies ou des données clients. Selon le Règlement général sur la protection des données (RGPD), une telle fuite pourrait constituer une violation de données à caractère personnel, avec des sanctions potentielles.
L’Agence nationale de la sécurité des systèmes d’information (ANSSI) rappelle dans ses guides que l’utilisation d’IA agentielle doit s’accompagner d’une évaluation des risques spécifiques, notamment en matière de contrôle des flux de données et de séparation des contextes.
Pourquoi cette technique est-elle particulièrement dangereuse ?
Plusieurs facteurs rendent cette attaque Zero-Click Grok redoutable :
- Zéro clic : l’utilisateur n’a pas à cliquer sur un lien ou à valider une action ; la simple demande de résumé déclenche la chaîne.
- Aucun avertissement : la navigation vers le site de l’attaquant et l’exécution du code Python se font sans dialogue de confirmation ni indicateur visible.
- Contournement des filtres : les défenses traditionnelles (détection de mots-clés, regex, analyse de sentiment) sont inefficaces face à du contenu chiffré.
- Exploitation de la confiance : le modèle fait confiance aux résultats du sandbox Python, ce qui permet d’injecter des instructions à un niveau privilégié.
Le tableau ci-dessous compare cette méthode à d’autres techniques d’injection de prompt :
| Technique | Détection par filtres classiques | Recours à l’exécution de code | Complexité de mise en œuvre |
|---|---|---|---|
| Codage Base64 | Facile (patterns reconnaissables) | Non | Faible |
| Substitution de caractères | Moyenne (statistiques de fréquence) | Non | Faible |
| Obfuscation Unicode | Moyenne (normalisation possible) | Non | Moyenne |
| Injection cryptographique | Très difficile (chiffrement fort) | Oui (sandbox) | Élevée |
L’injection cryptographique se distingue par son niveau de furtivité et la nécessité d’un environnement d’exécution, ce qui la rend particulièrement adaptée aux attaques ciblant des agents IA capables de coder.
Comment se protéger face à cette menace ?
Bonnes pratiques pour les utilisateurs
- Évitez de demander le résumé de pages web non fiables (sites inconnus, liens reçus par email ou message).
- Utilisez des IA avec des sandbox restrictifs : privilégiez les solutions qui limitent les capacités d’exécution de code ou qui demandent une validation explicite pour chaque action sensible.
- Surveillez les accès réseau : des outils de sécurité locaux peuvent détecter des requêtes sortantes suspectes vers des domaines inconnus.
- Limitez les informations partagées : ne stockez pas de données critiques dans l’historique des conversations si vous utilisez des IA agentielles.
Recommandations pour les développeurs et les entreprises
Les fournisseurs d’IA et les équipes de sécurité doivent intégrer des garde-fous techniques pour prévenir ce type d’attaque :
- Préserver la provenance des données : tout contenu provenant d’une source externe (page web, fichier) doit être étiqueté comme « non fiable » tout au long du traitement, même après déchiffrement par un composant interne.
- Isoler le contenu web non fiable : ne pas mélanger les données externes avec le contexte système ou les instructions de l’utilisateur sans une barrière stricte.
- Exiger une confirmation pour les navigations sortantes : toute requête HTTP vers un domaine externe déclenchée par le modèle doit être soumise à une validation explicite ou à une liste blanche.
- Détecter les chaînes à risque : surveiller les séquences d’actions qui enchaînent contenu web → exécution de code → accès à des données sensibles → exfiltration réseau. De telles chaînes doivent être bloquées ou nécessiter une approbation.
- Appliquer les recommandations de l’ANSSI et de l’OWASP : le projet OWASP Top 10 for LLM Applications liste l’injection de prompt comme risque critique ; des mesures comme la validation d’entrée, le moindre privilège et la séparation des contextes sont essentielles.
Adversa AI a signalé la vulnérabilité à xAI via HackerOne le 3 juin 2026. xAI a accusé réception mais n’a pas fourni de calendrier de correctif. Les chercheurs ont confirmé que la chaîne d’attaque était toujours reproductible le 19 août 2026. Aucun CVE n’a encore été attribué, et aucune exploitation en milieu sauvage n’a été observée à ce jour.
Conclusion : vers une sécurité renforcée des agents conversationnels
L’attaque Zero-Click Grok illustre les défis de sécurité posés par l’essor des agents IA capables d’interagir avec le web et d’exécuter du code. La technique de « Cryptographic Context Injection » contourne les défenses actuelles en exploitant la confiance accordée aux environnements d’exécution internes. Pour les utilisateurs, la vigilance est de mise : éviter les résumés de pages douteuses et limiter l’exposition des données sensibles. Pour les entreprises, il est urgent d’adopter des contrôles stricts sur les capacités agentielles et de mettre en place une détection des comportements anormaux.
Alors que xAI n’a pas encore déployé de correctif, la responsabilité incombe aux équipes de sécurité d’anticiper ces attaques. La recherche d’Adversa AI montre que l’injection de prompt n’est plus seulement une affaire de mots cachés : elle peut désormais s’appuyer sur le chiffrement pour frapper silencieusement. Face à cette évolution, la communauté cybersécurité doit repenser ses modèles de confiance et intégrer la sécurité dès la conception des systèmes d’IA.