Temperatur (LLM)
Definition
Die Temperatur ist eine Einstellung, die steuert, wie zufällig oder deterministisch die Ausgabe eines Sprachmodells ausfällt: Eine niedrige Temperatur liefert fokussierte, vorhersagbare Antworten, eine hohe eher abwechslungsreiche und kreative.
So funktioniert es
Bei jedem Schritt erzeugt ein Modell eine Wahrscheinlichkeitsverteilung über die möglichen nächsten Tokens. Die Temperatur formt diese Verteilung um, bevor ein Token gezogen wird. Nahe 0 wählt das Modell fast immer das wahrscheinlichste Token, was gleichbleibende, wiederholbare Antworten ergibt. Höhere Werte (etwa 0,7–1,0 und darüber) flachen die Verteilung ab, machen unwahrscheinlichere Tokens wahrscheinlicher und die Ausgabe vielfältiger.
Sie wird oft gemeinsam mit Einstellungen wie Top-p (Nucleus Sampling) justiert, die den Pool der infrage kommenden Tokens ähnlich verengen oder erweitern.
Warum das für den Support wichtig ist
Im Kundensupport ist eine niedrige Temperatur meist die richtige Wahl. Sie wollen korrekte, gleichbleibende, richtlinientreue Antworten – keine kreative Variation –, damit ein Agent auf dieselbe Frage dieselbe Antwort gibt und in Ihren Quellen verankert bleibt. Höhere Temperaturen passen zum Brainstorming oder zu Entwürfen, wo Vielfalt ein Vorteil und kein Risiko ist.
Häufig gefragt
Welche Temperatur sollte ein Support-Agent verwenden?
Üblicherweise einen niedrigen Wert (nahe 0), damit Antworten konsistent, faktentreu und richtlinienkonform sind. Support stellt Verlässlichkeit über kreative Vielfalt, und eine niedrige Temperatur senkt die Gefahr von Antworten außerhalb des Skripts.
Verursacht die Temperatur Halluzinationen?
Eine höhere Temperatur kann unerwartete oder unbelegte Antworten wahrscheinlicher machen, weil sie unwahrscheinliche Tokens begünstigt. Halluzinationen entstehen aber vor allem durch fehlende oder schwache Verankerung. Niedrige Temperatur plus gute Retrieval-Qualität senkt das Risiko an beiden Fronten.
Verwandte Begriffe
Large Language Model (LLM)
Ein Large Language Model (LLM) ist ein neuronales Netz, das auf riesigen Textmengen trainiert wurde, um Sprache vorherzusagen und zu erzeugen – dadurch kann es Fragen verstehen, zusammenfassen, klassifizieren und menschenähnliche Antworten schreiben..
KI-Halluzination
Eine KI-Halluzination liegt vor, wenn ein Sprachmodell eine Antwort erzeugt, die flüssig und selbstbewusst klingt, sachlich aber falsch oder frei erfunden ist — mit Details, Richtlinien oder Quellen, die es nicht gibt..
Tokens (LLM)
Tokens sind die kleinen Textbausteine – Wörter, Wortteile oder Zeichen –, die ein Sprachmodell liest und erzeugt.
Prompt Engineering
Prompt Engineering ist die Praxis, die Anweisungen an ein Sprachmodell so zu gestalten und zu verfeinern, dass es für eine bestimmte Aufgabe präzise, relevante und verlässliche Ergebnisse liefert..
System-Prompt
Ein System-Prompt ist der zugrunde liegende Satz von Anweisungen, der Rolle, Verhalten, Tonfall und Grenzen eines KI-Modells für eine Konversation festlegt – gesetzt von der Entwicklerseite, nicht von den Nutzern, und gültig für jede Interaktion..
Setzen Sie diese Ideen ein
Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.
Trial starten