Tokens (LLM)
Définition
Les tokens sont les petits fragments de texte — mots, morceaux de mots ou caractères — qu'un modèle de langage lit et génère ; ils constituent l'unité de base avec laquelle les modèles mesurent l'entrée, la sortie, les limites de contexte et, le plus souvent, la facturation.
Comment cela fonctionne
Avant qu'un modèle ne traite un texte, un tokenizer le découpe en tokens. Les mots courants peuvent tenir en un seul token, tandis que les mots longs ou rares se découpent en plusieurs (« tokenization » peut devenir « token » + « ization »). En règle générale pour l'anglais, un token représente environ quatre caractères, soit à peu près ¾ d'un mot — 1 000 tokens font donc environ 750 mots.
Le modèle lit des tokens en entrée et produit des tokens en sortie. Les deux comptent dans la fenêtre de contexte, et la plupart des API de LLM facturent l'usage au token, avec des tarifs distincts en entrée et en sortie.
Pourquoi c'est important pour le support
Les tokens sont l'unité de coût et de capacité de tout système reposant sur un LLM. Les longs fils de tickets, les documents volumineux récupérés et les prompts bavards consomment tous plus de tokens — d'où l'intérêt de prompts concis et d'une recherche ciblée pour contenir à la fois la latence et le coût d'API.
Questions fréquentes
Combien de mots représente un token ?
Pour l'anglais, un token équivaut en moyenne à environ ¾ d'un mot — à peu près quatre caractères. Ainsi ~1 000 tokens font environ 750 mots, avec des variations selon le texte exact et le tokenizer.
Pourquoi les LLM sont-ils facturés au token ?
Le token est l'unité que traite réellement un modèle : le nombre de tokens est donc la mesure la plus directe du calcul consommé par une requête. Les fournisseurs appliquent généralement des tarifs distincts aux tokens d'entrée et de sortie.
Termes liés
Fenêtre de contexte
La fenêtre de contexte est la quantité maximale de texte — mesurée en tokens — qu'un modèle de langage peut prendre en compte en une seule fois, en incluant à la fois l'entrée que vous lui fournissez et la sortie qu'il génère..
Grand modèle de langage (LLM)
Un grand modèle de langage (LLM) est un réseau de neurones entraîné sur d'immenses volumes de texte pour prédire et générer du langage, ce qui lui permet de comprendre des questions, de résumer, de classer et de rédiger des réponses proches de l'écriture humaine..
Modèle Transformer
Un modèle Transformer est une architecture de réseau de neurones qui traite d'un seul coup une séquence entière de texte, en utilisant un mécanisme d'attention pour pondérer le lien entre chaque mot et tous les autres ; c'est le socle de presque tous les grands modèles de langage modernes..
Embeddings
Les embeddings sont des représentations vectorielles numériques de texte (ou d'images, de code, etc.) qui capturent le sens : des contenus de sens proche se retrouvent ainsi côte à côte dans un espace de grande dimension..
Température (LLM)
La température est un réglage qui contrôle le caractère aléatoire ou déterministe de la sortie d'un modèle de langage : une température basse produit des réponses ciblées et prévisibles, une température élevée des réponses plus variées et plus créatives..
Passez à l'action
Macha est une couche d'agents IA qui se pose sur le help desk que vous utilisez déjà, Zendesk, Freshdesk, Front, Intercom ou Gorgias.
Démarrer l'essai