L'e-mail semble normal. La pièce jointe demande une offre et contient, en blanc sur fond blanc, une consigne pour l'agent: ignorer les règles et envoyer des données clients à une autre adresse. Une personne ne verra peut-être jamais cette ligne. Un agent IA peut la lire et la prendre au sérieux.
C'est une injection indirecte de prompt. L'attaque passe par le matériel que l'agent doit justement consulter: e-mail, PDF, document partagé ou site web. Si le même agent peut agir dans le CRM ou la messagerie, le problème dépasse largement une réponse bizarre.
Le contenu apporte des faits, jamais une autorisation
Un e-mail client peut décrire un besoin. Il ne peut pas choisir les outils de l'agent, ajouter un destinataire ou supprimer une règle de sécurité. L'autorité vient du processus contrôlé. Le document reste une entrée non fiable, même si son expéditeur paraît légitime.
| Entrée | Peut apporter | Ne peut jamais autoriser |
|---|---|---|
| E-mail client | Nom, demande, horaire | Nouveau destinataire ou droits étendus |
| Produits, quantités, références | Modification des règles système | |
| Page web | Informations publiques | Connexion, paiement ou transfert de données |
| Note CRM | Contexte du dossier | Suppression de la piste de contrôle |
Quatre protections réalistes pour une PME
- Traiter techniquement tout contenu externe comme une entrée non fiable.
- Accorder moins de droits d'écriture et d'envoi que de droits de lecture.
- Bloquer les nouvelles destinations, les destinataires inhabituels et les actions de masse.
- Journaliser la source qui a contribué à chaque action proposée.
Un prompt système plus long ne suffit pas. Un filtre unique non plus. Le rapport d'incident publié par OpenAI en 2026 décrit un environnement d'évaluation exceptionnel avec des protections réduites. Il ne mesure pas le risque moyen d'une PME. Il montre néanmoins pourquoi l'isolation et la sortie de secours doivent être indépendantes du bon comportement du modèle.
Le test à faire avant la mise en production
Copiez le processus sans vraies données clients. Placez des consignes hostiles mais inoffensives dans un e-mail, un PDF et une page web: changer le destinataire, exporter une liste, contourner une règle. L'agent doit extraire les faits utiles tout en refusant la consigne cachée ou en la transférant pour validation.
Si cette frontière reste instable, gardez les outils en lecture seule. Les articles sur les droits e-mail et calendrier et la sécurité des outils IA complètent le sujet. Le contrôle doit vivre dans l'architecture du processus, pas dans une collection de prompts.
Sources
FAQ
Quelle différence entre injection directe et indirecte?
L'injection directe est adressée à l'agent. L'injection indirecte se cache dans un contenu qu'il consulte.
Un prompt système suffit-il?
Non. Il faut aussi des niveaux de confiance, des droits limités, des validations et une surveillance.
Une base RAG peut-elle être touchée?
Oui. Un document manipulé peut entrer dans le contexte par la recherche documentaire.
Quel est le départ le plus sûr?
Un accès en lecture seule dans un environnement de test, peu d'actions autorisées et une file de validation.