Kontextfenster
Definition
Das Kontextfenster ist die maximale Textmenge — gemessen in Tokens —, die ein Sprachmodell auf einmal berücksichtigen kann, einschließlich der Eingabe, die Sie ihm geben, und der Ausgabe, die es erzeugt.
So funktioniert es
Alles, was das Modell für eine Anfrage „sieht“ — der System-Prompt, der Gesprächsverlauf, alle abgerufenen Dokumente und die Antwort, die gerade entsteht —, muss in das Kontextfenster passen, gezählt in Tokens. Wird es überschritten, werden ältere Inhalte gekürzt oder verworfen, und das Modell vergisst die frühesten Teile faktisch.
Die Fenstergröße variiert je nach Modell, von wenigen Tausend Tokens bis weit über eine Million. Ein größeres Fenster lässt das Modell über mehr Verlauf oder mehr Dokumente auf einmal nachdenken, doch mehr Tokens zu verarbeiten kostet auch mehr und kann Antworten verlangsamen.
Warum es im Support wichtig ist
Das Kontextfenster setzt die praktische Grenze dafür, wie viel von einem langen Ticket-Thread, einer Wissensdatenbank oder einer Kundenhistorie ein Agent gleichzeitig präsent haben kann. Das ist ein Hauptgrund, warum es RAG gibt: Statt eine ganze Wissensdatenbank in das Fenster zu pressen, rufen Sie nur die relevanten Passagen ab und bringen sie unter — so bleiben Antworten fundiert und die Kosten kontrolliert.
Häufig gefragt
Was passiert, wenn das Kontextfenster überschritten wird?
Inhalte jenseits der Grenze werden gekürzt oder verworfen, sodass das Modell frühere Teile der Konversation oder der Dokumente verlieren kann. Verfahren wie Retrieval und Zusammenfassung halten nur den relevantesten Text im Fenster.
Ist ein größeres Kontextfenster immer besser?
Nicht immer. Ein größeres Fenster verarbeitet mehr Verlauf auf einmal, aber mehr Tokens erhöhen Kosten und Latenz, und Modelle können Details übersehen, die in einem sehr langen Kontext vergraben sind. Gutes Retrieval schlägt oft schlicht mehr Text.
Verwandte Begriffe
Tokens (LLM)
Tokens sind die kleinen Textbausteine – Wörter, Wortteile oder Zeichen –, die ein Sprachmodell liest und erzeugt.
Large Language Model (LLM)
Ein Large Language Model (LLM) ist ein neuronales Netz, das auf riesigen Textmengen trainiert wurde, um Sprache vorherzusagen und zu erzeugen – dadurch kann es Fragen verstehen, zusammenfassen, klassifizieren und menschenähnliche Antworten schreiben..
Retrieval-Augmented Generation (RAG)
Retrieval-Augmented Generation (RAG) ist ein Verfahren, bei dem ein KI-Modell zur Laufzeit relevante Informationen aus Ihren eigenen Wissensquellen abruft und seine Antwort darauf stützt, statt sich allein auf das zu verlassen, was es im Training gelernt hat..
Agenten-Gedächtnis
Das Agenten-Gedächtnis ist die Fähigkeit eines KI-Agenten, Informationen über eine Konversation hinweg — oder über Sitzungen hinweg — zu behalten und abzurufen: frühere Nachrichten, Kundendaten und vergangene Interaktionen.
Transformer-Modell
Ein Transformer-Modell ist eine Architektur neuronaler Netze, die eine ganze Textsequenz auf einmal verarbeitet und über einen Attention-Mechanismus gewichtet, wie stark sich die Wörter aufeinander beziehen.
Setzen Sie diese Ideen ein
Macha ist eine KI-Agent-Schicht, die auf dem Help Desk sitzt, den Sie schon nutzen, Zendesk, Freshdesk, Front, Intercom oder Gorgias.
Trial starten