Tokens (LLM)
Definition
Tokens sind die kleinen Textbausteine – Wörter, Wortteile oder Zeichen –, die ein Sprachmodell liest und erzeugt. Sie sind die Grundeinheit, in der Modelle Eingabe, Ausgabe, Kontextgrenzen und meist auch die Abrechnung messen.
So funktioniert es
Bevor ein Modell Text verarbeitet, zerlegt ihn ein Tokenizer in Tokens. Häufige Wörter sind oft ein einziges Token, während längere oder seltenere Wörter in mehrere zerfallen („Tokenisierung“ wird vielleicht zu „Token“ + „isierung“). Als grobe Faustregel gilt für Englisch: ein Token entspricht etwa vier Zeichen oder rund ¾ eines Wortes – 1.000 Tokens sind also etwa 750 Wörter. Für Deutsch fällt die Zahl der Tokens pro Wort wegen der langen Komposita eher höher aus.
Das Modell liest Tokens als Eingabe und erzeugt Tokens als Ausgabe. Beide zählen auf das Kontextfenster ein, und die meisten LLM-APIs rechnen pro Token ab, mit getrennten Sätzen für Eingabe und Ausgabe.
Warum das für den Support wichtig ist
Tokens sind die Einheit für Kosten und Kapazität jedes LLM-gestützten Systems. Lange Ticket-Threads, große abgerufene Dokumente und weitschweifige Prompts verbrauchen mehr Tokens – deshalb halten knappe Prompts und gezieltes Retrieval sowohl Latenz als auch API-Kosten niedrig.
Häufig gefragt
Wie vielen Wörtern entspricht ein Token?
Im Englischen entspricht ein Token im Schnitt rund ¾ eines Wortes – etwa vier Zeichen. Rund 1.000 Tokens sind also etwa 750 Wörter, wobei es vom konkreten Text und vom Tokenizer abhängt; im Deutschen liegt der Wert wegen längerer Wörter oft darunter.
Warum werden LLMs pro Token abgerechnet?
Tokens sind die tatsächliche Einheit, die ein Modell verarbeitet, daher ist die Token-Zahl das direkteste Maß für die Rechenleistung einer Anfrage. Anbieter berechnen üblicherweise getrennte Sätze für Eingabe- und Ausgabe-Tokens.
Verwandte Begriffe
Kontextfenster
Das Kontextfenster ist die maximale Textmenge — gemessen in Tokens —, die ein Sprachmodell auf einmal berücksichtigen kann, einschließlich der Eingabe, die Sie ihm geben, und der Ausgabe, die es erzeugt..
Large Language Model (LLM)
Ein Large Language Model (LLM) ist ein neuronales Netz, das auf riesigen Textmengen trainiert wurde, um Sprache vorherzusagen und zu erzeugen – dadurch kann es Fragen verstehen, zusammenfassen, klassifizieren und menschenähnliche Antworten schreiben..
Transformer-Modell
Ein Transformer-Modell ist eine Architektur neuronaler Netze, die eine ganze Textsequenz auf einmal verarbeitet und über einen Attention-Mechanismus gewichtet, wie stark sich die Wörter aufeinander beziehen.
Embeddings
Embeddings sind numerische Vektordarstellungen von Text (oder Bildern, Code usw.), die Bedeutung erfassen — Inhalte mit ähnlicher Bedeutung liegen dadurch in einem hochdimensionalen Raum dicht beieinander..
Temperatur (LLM)
Die Temperatur ist eine Einstellung, die steuert, wie zufällig oder deterministisch die Ausgabe eines Sprachmodells ausfällt: Eine niedrige Temperatur liefert fokussierte, vorhersagbare Antworten, eine hohe eher abwechslungsreiche und kreative..
Setzen Sie diese Ideen ein
Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.
Trial starten