Température (LLM)
Définition
La température est un réglage qui contrôle le caractère aléatoire ou déterministe de la sortie d'un modèle de langage : une température basse produit des réponses ciblées et prévisibles, une température élevée des réponses plus variées et plus créatives.
Comment cela fonctionne
À chaque étape, un modèle produit une distribution de probabilité sur les tokens suivants possibles. La température remodèle cette distribution avant le tirage d'un token. Proche de 0, le modèle choisit presque toujours le token le plus probable, ce qui donne des réponses cohérentes et reproductibles. Des valeurs plus élevées (disons 0,7 à 1,0 et au-delà) aplatissent la distribution, rendant les tokens les moins probables plus accessibles et la sortie plus variée.
Elle se règle souvent de pair avec des paramètres comme le top-p (échantillonnage par noyau), qui restreint ou élargit de la même façon le vivier de tokens candidats.
Pourquoi c'est important pour le support
Pour le support client, une température basse est généralement le bon choix. Vous voulez des réponses exactes, cohérentes et conformes à vos règles — pas de la variation créative — pour qu'un agent réponde toujours de la même façon à la même question et reste ancré dans vos sources. Une température plus élevée convient au brainstorming ou à la rédaction, où la variété est un atout plutôt qu'un risque.
Questions fréquentes
Quelle température utiliser pour un agent de support ?
En général une valeur basse (proche de 0), pour des réponses cohérentes, factuelles et conformes aux règles. Le support privilégie la fiabilité sur la variété créative, et une température basse réduit le risque de réponses hors script ou incohérentes.
La température provoque-t-elle des hallucinations ?
Une température plus élevée peut augmenter les chances d'une réponse inattendue ou non étayée, en rendant les tokens improbables plus probables, mais les hallucinations viennent surtout d'un ancrage absent ou faible. Une température basse combinée à une bonne recherche documentaire réduit le risque sur les deux fronts.
Termes liés
Grand modèle de langage (LLM)
Un grand modèle de langage (LLM) est un réseau de neurones entraîné sur d'immenses volumes de texte pour prédire et générer du langage, ce qui lui permet de comprendre des questions, de résumer, de classer et de rédiger des réponses proches de l'écriture humaine..
Hallucination de l'IA
Une hallucination de l'IA se produit lorsqu'un modèle de langage génère une réponse fluide et assurée mais factuellement fausse ou inventée — en fabriquant des détails, des politiques ou des sources qui n'existent pas..
Tokens (LLM)
Les tokens sont les petits fragments de texte — mots, morceaux de mots ou caractères — qu'un modèle de langage lit et génère ; ils constituent l'unité de base avec laquelle les modèles mesurent l'entrée, la sortie, les limites de contexte et, le plus souvent, la facturation..
Prompt engineering
Le prompt engineering est la pratique consistant à concevoir et affiner les instructions données à un modèle de langage pour obtenir des résultats exacts, pertinents et fiables sur une tâche précise..
Prompt système
Un prompt système est l'ensemble d'instructions sous-jacent qui définit le rôle, le comportement, le ton et les limites d'un modèle d'IA pour une conversation — défini par le développeur, pas par l'utilisateur final, et appliqué à chaque interaction..
Passez à l'action
Macha est une couche d'agents IA qui se pose sur le help desk que vous utilisez déjà, Zendesk, Freshdesk, Front, Intercom ou Gorgias.
Démarrer l'essai