Fenêtre de contexte
Définition
La fenêtre de contexte est la quantité maximale de texte — mesurée en tokens — qu'un modèle de langage peut prendre en compte en une seule fois, en incluant à la fois l'entrée que vous lui fournissez et la sortie qu'il génère.
Comment cela fonctionne
Tout ce que le modèle « voit » pour une requête — le prompt système, l'historique de la conversation, les documents récupérés et la réponse en cours de rédaction — doit tenir dans la fenêtre de contexte, comptée en tokens. Au-delà, le contenu le plus ancien est tronqué ou supprimé : le modèle oublie donc, en pratique, les premières parties.
La taille de la fenêtre varie selon les modèles, de quelques milliers de tokens à bien plus d'un million. Une fenêtre plus large permet au modèle de raisonner sur plus d'historique ou de documents à la fois, mais traiter davantage de tokens coûte aussi plus cher et peut ralentir les réponses.
Pourquoi c'est important pour le support
La fenêtre de contexte fixe la limite pratique de ce qu'un agent peut garder à l'esprit en une fois : un long fil de ticket, une base de connaissances, l'historique d'un client. C'est une raison centrale de l'existence du RAG : plutôt que d'entasser toute une base de connaissances dans la fenêtre, on ne récupère que les passages pertinents pour les y faire tenir — ce qui garde les réponses ancrées dans les sources et les coûts maîtrisés.
Questions fréquentes
Que se passe-t-il lorsque la fenêtre de contexte est dépassée ?
Le contenu au-delà de la limite est tronqué ou supprimé : le modèle peut donc perdre les parties antérieures de la conversation ou des documents. Des techniques comme la recherche documentaire et le résumé ne conservent dans la fenêtre que le texte le plus pertinent.
Une fenêtre de contexte plus grande est-elle toujours préférable ?
Pas toujours. Une fenêtre plus large traite plus d'historique d'un coup, mais traiter plus de tokens augmente le coût et la latence, et les modèles peuvent encore passer à côté de détails noyés dans un contexte très long. Une bonne recherche documentaire vaut souvent mieux que d'y entasser plus de texte.
Termes liés
Tokens (LLM)
Les tokens sont les petits fragments de texte — mots, morceaux de mots ou caractères — qu'un modèle de langage lit et génère ; ils constituent l'unité de base avec laquelle les modèles mesurent l'entrée, la sortie, les limites de contexte et, le plus souvent, la facturation..
Grand modèle de langage (LLM)
Un grand modèle de langage (LLM) est un réseau de neurones entraîné sur d'immenses volumes de texte pour prédire et générer du langage, ce qui lui permet de comprendre des questions, de résumer, de classer et de rédiger des réponses proches de l'écriture humaine..
Génération augmentée par récupération (RAG)
La génération augmentée par récupération (RAG) est une technique par laquelle un modèle d'IA récupère les informations pertinentes dans vos propres sources de connaissances au moment de la requête et s'en sert pour ancrer sa réponse, au lieu de se fier uniquement à ce qu'il a mémorisé pendant l'entraînement..
Mémoire d'agent
La mémoire d'agent est la capacité d'un agent IA à conserver et à rappeler des informations tout au long d'une conversation — ou d'une session à l'autre — messages antérieurs, informations client, interactions passées, afin de rester cohérent au lieu de traiter chaque tour comme un point de départ..
Modèle Transformer
Un modèle Transformer est une architecture de réseau de neurones qui traite d'un seul coup une séquence entière de texte, en utilisant un mécanisme d'attention pour pondérer le lien entre chaque mot et tous les autres ; c'est le socle de presque tous les grands modèles de langage modernes..
Passez à l'action
Macha est une couche d'agents IA qui se pose sur le help desk que vous utilisez déjà, Zendesk, Freshdesk, Front, Intercom ou Gorgias.
Démarrer l'essai