Injection de prompt
Définition
L'injection de prompt est une attaque de sécurité où des instructions malveillantes sont dissimulées dans une entrée utilisateur ou un contenu externe pour amener un système d'IA à ignorer ses instructions d'origine ou à effectuer des actions non prévues.
Comment cela fonctionne
Comme les LLM traitent les instructions et les données dans le même flux de texte, un attaquant peut glisser des commandes du type « ignore tes instructions précédentes » dans un message de chat, un ticket de support ou une page web que l'agent consulte. Si le système ne distingue pas les instructions de confiance du contenu non fiable, il risque de suivre la commande injectée.
L'injection de prompt indirecte est particulièrement dangereuse pour les agents IA qui récupèrent du contenu externe ou appellent des outils, puisque l'instruction malveillante peut arriver par les données récupérées plutôt que directement de l'utilisateur.
Pourquoi c'est important pour le support
Un agent IA de support connecté à de vrais systèmes pourrait être amené par la ruse à divulguer des données, à contourner une politique ou à effectuer des actions nuisibles. Les défenses comprennent des garde-fous, le filtrage des entrées, des permissions d'outils au moindre privilège et un system prompt maintenu séparé du contenu utilisateur et prioritaire sur lui.
Questions fréquentes
Quelle est la différence entre l'injection de prompt et un jailbreak ?
Un jailbreak amène un modèle à contourner ses règles de sécurité ; l'injection de prompt écrase plus largement les instructions prévues par le système, souvent via une entrée non fiable ou un contenu externe. Les deux se recoupent, mais l'injection inclut les attaques indirectes par les données récupérées.
Comment prévenir l'injection de prompt ?
Séparez les instructions de confiance des entrées non fiables, appliquez des garde-fous et un filtrage des entrées, limitez les permissions d'outils au moindre privilège et exigez une confirmation pour les actions sensibles.
Termes liés
Garde-fous IA
Les garde-fous IA sont les règles, contrôles et contraintes placés autour d'un système d'IA pour que son comportement reste sûr, dans le sujet et conforme à la politique de l'entreprise — en encadrant ce qu'il peut dire, faire et consulter..
Prompt système
Un prompt système est l'ensemble d'instructions sous-jacent qui définit le rôle, le comportement, le ton et les limites d'un modèle d'IA pour une conversation — défini par le développeur, pas par l'utilisateur final, et appliqué à chaque interaction..
Grand modèle de langage (LLM)
Un grand modèle de langage (LLM) est un réseau de neurones entraîné sur d'immenses volumes de texte pour prédire et générer du langage, ce qui lui permet de comprendre des questions, de résumer, de classer et de rédiger des réponses proches de l'écriture humaine..
Agent IA
Un agent IA est un système logiciel qui s'appuie sur un modèle de langage pour comprendre une demande, décider quoi faire et agir — appeler des outils, récupérer des données, accomplir des tâches — au lieu de se contenter de renvoyer une réponse scriptée unique..
Utilisation d'outils
L'utilisation d'outils est la capacité d'un modèle d'IA à appeler des fonctions, des API ou des systèmes externes — comme rechercher une commande ou émettre un remboursement — au lieu de se contenter de générer du texte, ce qui lui permet d'agir sur des données réelles plutôt que de simplement les décrire..
Passez à l'action
Macha est une couche d'agents IA qui se pose sur le help desk que vous utilisez déjà, Zendesk, Freshdesk, Front, Intercom ou Gorgias.
Démarrer l'essai