Garde-fous IA
Définition
Les garde-fous IA sont les règles, contrôles et contraintes placés autour d'un système d'IA pour que son comportement reste sûr, dans le sujet et conforme à la politique de l'entreprise — en encadrant ce qu'il peut dire, faire et consulter.
Comment cela fonctionne
Les garde-fous peuvent agir à plusieurs niveaux : des instructions dans le prompt système qui posent les limites, des filtres d'entrée qui bloquent les injections de prompt ou les demandes hors sujet, des contrôles de sortie qui interceptent les réponses dangereuses ou non conformes, et des restrictions de permissions sur les outils et les données auxquels un agent peut toucher.
Dans le support, les garde-fous courants consistent à interdire à l'agent de faire des promesses hors politique, à exiger une transmission à un humain sur les sujets sensibles comme les résiliations ou les questions juridiques, et à restreindre les actions que l'agent peut effectuer de façon autonome par rapport à celles qui nécessitent une approbation.
Pourquoi c'est important pour le support
Les garde-fous sont ce qui rend l'automatisation digne de confiance à grande échelle. Ils empêchent un agent IA d'inventer des politiques, de divulguer des données ou d'effectuer des actions irréversibles — ils transforment un modèle imprévisible en un système maîtrisé que vous pouvez placer devant vos clients.
- Empêchent les réponses hors politique et les actions non autorisées
- Imposent l'escalade sur les cas sensibles ou à faible confiance
- Limitent l'accès aux outils et aux données à ce qui est approprié
Questions fréquentes
Quel est un exemple de garde-fou IA dans le support ?
Une règle imposant que l'agent transmette à un humain toute résiliation ou tout remboursement au-delà d'un montant défini, au lieu d'agir de façon autonome.
Les garde-fous empêchent-ils les hallucinations ?
Ils y contribuent en restreignant le périmètre et en exigeant un ancrage, mais ils fonctionnent en complément de techniques comme le RAG. Les garde-fous limitent ce que l'IA a le droit de dire et de faire ; l'ancrage améliore l'exactitude de ce qu'elle dit.
Termes liés
Hallucination de l'IA
Une hallucination de l'IA se produit lorsqu'un modèle de langage génère une réponse fluide et assurée mais factuellement fausse ou inventée — en fabriquant des détails, des politiques ou des sources qui n'existent pas..
Injection de prompt
L'injection de prompt est une attaque de sécurité où des instructions malveillantes sont dissimulées dans une entrée utilisateur ou un contenu externe pour amener un système d'IA à ignorer ses instructions d'origine ou à effectuer des actions non prévues..
Prompt système
Un prompt système est l'ensemble d'instructions sous-jacent qui définit le rôle, le comportement, le ton et les limites d'un modèle d'IA pour une conversation — défini par le développeur, pas par l'utilisateur final, et appliqué à chaque interaction..
Transfert à un humain
Le transfert à un humain est le principe, chez Macha, de garder une personne dans la boucle sur tout ce qui est visible par le client — très concrètement au moyen de garde-fous de confirmation qui suspendent un agent avant toute action d'écriture en chat interactif, et de schémas d'escalade qui orientent les cas difficiles vers votre équipe..
Grounding
Le grounding (ancrage) est la pratique consistant à rattacher les réponses d'un modèle d'IA à des sources vérifiées — votre documentation, des données en direct, votre base de connaissances — pour que les réponses reflètent des faits réels plutôt que les suppositions du modèle..
Passez à l'action
Macha est une couche d'agents IA qui se pose sur le help desk que vous utilisez déjà, Zendesk, Freshdesk, Front, Intercom ou Gorgias.
Démarrer l'essai